(1)笔者在时间有限的情况下,想要多积累一些自身课题之外的新文献、新知识,所以开了这一篇文章。
(2)想通过将文献喂给大模型,并向大模型提问的方式来快速理解文献的重要信息(如基础idea、contribution、大致方法等)。
(3)文章内容大多由AI产生,经笔者梳理而成。如果有误,敬请批评指正。


一、Hier-SLAM: Scaling-up Semantics in SLAM with a Hierarchically Categorical Gaussian Splatting

在这里插入图片描述

作者:Boying Li, Zhixi Cai, Yuan-Fang Li, Ian Reid, and Hamid Rezatofighi
机构:Monash & MBZUAI
原文链接:https://arxiv.org/abs/2409.12518
代码链接:https://github.com/LeeBY68/Hier-SLAM
发表:ICRA 2025

摘要:
本文提出了 Hier-SLAM,这是一种基于语义的三维高斯溅射 SLAM 方法,具备全新的层级类别表示方式,能够实现精准的全局三维语义建图、良好的扩展性,以及三维世界中显式的语义标签预测。随着环境复杂度的增加,语义 SLAM 系统的参数量急剧上升,使得场景理解变得尤为困难且成本高昂。

为了解决这一问题,本文引入了一种紧凑的层级语义表示,将语义信息有效嵌入到 3D Gaussian Splatting 中,并借助大语言模型(LLM)的能力构建结构化语义编码。此外,本文设计了一种新的语义损失函数,通过层内(inter-level)和跨层(cross-level)联合优化,进一步提升层级语义信息的学习效果。本文还对整个 SLAM 系统进行了全面优化,显著提升了追踪建图性能及运行速度。

Hier-SLAM 在建图和定位精度方面均超越现有的稠密 SLAM 方法,并在运行速度上实现了 2 倍加速。同时,在语义渲染性能上也达到了与现有方法相当的水平,同时在存储开销与训练时间方面大幅下降。令人印象深刻的是,该系统的渲染速度可达每秒 2000 帧(含语义)或 3000 帧(无语义)。尤其重要的是,Hier-SLAM 首次展现了在超过 500 类语义场景中仍能高效运行的能力,充分体现了其强大的扩展性。

1. 什么是语义SLAM系统呢?
语义SLAM(Semantic SLAM)是同时定位与建图(SLAM)技术的升级版,它不仅构建环境的几何地图,还能识别并标注地图中物体的语义信息(如“椅子”“墙壁”“行人”),让机器真正“理解”周围场景。

2. 本文是如何实现层级语义表示与3D高斯泼溅的融合的?
(1)层级树结构构建
(i)语义树定义:将语义类别组织为树状结构 G=(V,E),其中节点 V 表示不同层级的语义类(如“背景→结构→平面→墙”),边 E 表示类别的从属关系。
(ii)LLM辅助生成:

  • 输入一组语义标签(如ScanNet的550类),利用LLM(如GPT-4)自底向上迭代聚类,生成层次结构。
  • 通过循环校验机制(Loop-based Critic)修正LLM输出:对比LLM生成的聚类结果与输入标签,剔除无关类别(Unseen
    Classes)并补全遗漏节点(Omitted Nodes),直至所有标签被正确归类。

(2)紧凑编码设计
每个3D高斯 primitive 的语义嵌入 h 由各层级嵌入h’拼接而成。
在这里插入图片描述

(3)语义优化策略

  • 层级内损失(Inter-level Loss):每层单独计算交叉熵损失,确保层级内分类正确性。
  • 跨层级损失(Cross-level Loss):通过共享线性层 F 将层级编码映射为扁平概率分布,与真实标签计算全局交叉熵损失,保证层级间一致性。

通俗易懂的解释:
这篇文章的“语义压缩”方法,可以类比为整理一个杂乱的文件柜:

步骤1:用AI给文件分类(LLM建树)
把一堆未分类的文件(如550种物体标签)交给AI(如ChatGPT),让它按“大类→子类”自动整理。例如:第一层:“家具” vs “电器” 第二层:“家具”下分“椅子”“桌子”……
AI可能分错,所以加了自动修正程序:检查遗漏的标签(如“漏了台灯”),重新让AI补分,直到所有文件归位。

步骤2:给每个物体贴层级标签(紧凑编码)
以前:每个物体直接标记具体名称(如“办公椅”),需要大量标签。
现在:改为层级路径编码(如“家具/椅子/办公椅”),只需记录每层的选择(如1-2-3),大幅节省空间。

步骤3:双重检查(层级优化)
逐层检查:确保“椅子”确实属于“家具”。
整体检查:最终生成的标签(如“办公椅”)要与真实名称一致。

效果:
原本存1000种物体需要1000个标签,现在只需20个数字编码(类似压缩成文件夹路径)。
机器人看到“办公椅”时,既能知道它是“椅子”,也能明白它属于“家具”,适合高层决策(如“避开所有家具”)。

3.本文的核心贡献是什么?
(1)层次化语义表示提出一种树状层次结构编码语义信息利用大语言模型(LLM)生成语义类别的层次关系(如“背景→结构→平面→墙”),将语义信息压缩为紧凑的符号编码。例如,10层二叉树可覆盖1024个类别,仅需20维编码(每层2维Softmax)。通过几何与语义属性联合优化,构建多级树结构,显著减少存储需求(相比扁平表示降低66%)。

(2)层次化语义损失函数:设计跨层级(Cross-level)和层级内(Inter-level)联合优化损失,结合交叉熵损失,实现从粗到细的语义理解。

(3)高效SLAM系统:在3D高斯泼溅框架中集成层次化语义表示,优化跟踪(Tracking)与建图(Mapping)模块。系统在保持高精度(ScanNet数据集上ATE RMSE为3.2cm)的同时,实现2000 FPS(带语义)/3000 FPS(无语义)的实时渲染速度,存储需求降低至910.5MB(原需2.7GB)。

(4)扩展性验证:在包含550个语义类别的ScanNet数据集中,通过LLM辅助的层次化编码将语义参数压缩7倍,首次实现复杂场景的高效语义理解。

二、DreamSpace: Dreaming Your Room Space with Text-Driven Panoramic Texture Propagation

在这里插入图片描述

作者:Bangbang Yang, Wenqi Dong, Lin Ma, Wenbo Hu, Xiao Liu, Zhaopeng Cui, Yuewen Ma
机构:(1)PICO, ByteDance (2)State Key Lab of CAD&CG, Zhejiang University
文章链接:https://arxiv.org/abs/2310.13119
项目链接:https://ybbbbt.com/publication/dreamspace/
发表:IEEE VR 2024

摘要:
基于扩散模型的方法在二维媒体生成领域已取得显著成功,然而在三维空间应用(如XR/VR)中实现同等水平的场景级网格纹理生成仍面临挑战,主要受限于三维几何结构的复杂性及沉浸式自由视角渲染的技术要求。本文提出了一种创新的室内场景纹理生成框架,通过文本驱动生成具有精细细节与真实空间一致性的纹理。其核心思想是:首先从场景中心视角生成风格化的360°全景纹理,继而通过修复与模仿技术将其扩散至其他区域。为确保纹理与场景的语义对齐,我们开发了一种新颖的双重纹理对齐机制,采用由粗到细的全景纹理生成方法,同时考量场景的几何特征与纹理线索。针对纹理传播过程中的复杂几何干扰,我们设计了分离式处理策略:先在置信区域执行纹理修复,再通过隐式模仿网络合成被遮挡区域与微细结构的纹理。大量实验及真实室内场景的沉浸式VR应用证明,该方法能生成高质量纹理,并为VR头显设备提供引人入胜的体验。

1. 文章简介
本文《DreamSpace: Dreaming Your Room Space with Text-Driven Panoramic Texture Propagation》提出了一种创新的文本驱动室内场景纹理生成框架,旨在解决三维空间应用中场景级网格纹理合成的关键挑战。针对现有扩散模型在2D媒体生成的成功难以迁移到3D场景的问题,作者提出以下技术贡献:

(1)全景纹理生成:采用自上而下的流程,首先生成中心视点的360°风格化全景纹理,通过改进的潜在扩散模型(LDM)实现粗到细的生成策略,结合非对称环形填充和分块扩散技术保障高分辨率与无缝投影。

(2)双重纹理对齐:提出风格优先与对齐优先的双通道纹理生成机制,通过深度边缘感知的泊松混合解决几何-纹理错位问题,在保持风格质量的同时提升几何一致性。

(3)全场景纹理传播:设计分区域处理策略,对可见区域采用置信扩散修复,对遮挡/微小结构区域采用基于坐标的隐式纹理模仿网络(MLP),实现纹理的空间连贯性填充。

实验表明,该方法在真实场景数据集(DreamSpot/Replica)上显著优于StyleMesh、TEXTure等方法(CLIP分数提升14.4%,美学评分提升9.6%),并通过VR应用验证了其在头显设备中的沉浸式体验。局限性包括对PBR材质支持不足及超大场景适配性问题。


通俗易懂版介绍
这篇文章开发了一个叫DreamSpace的"AI装修神器",能用文字描述自动给3D房间模型换上梦幻风格的墙纸、地板和家具贴图。比如输入"星空主题",系统就会把房间变成银河效果,沙发、电视等物品还能保持原有形状但变成星空纹理。

核心技术有三招
(1)全景照片生成:先站在房间中心,用AI生成一张包裹整个房间的360°全景风格图(类似手机全景拍照,但内容是AI画的星空/森林等主题)。
(2)智能对齐:通过"双保险"策略让贴图完美贴合家具边缘,避免出现扭曲或错位。
(3)死角填充:对于柜子缝隙、沙发底部等死角,AI会参考已生成部分智能补全,而不是简单复制。

实际效果:
(1)比传统方法贴图更精准,VR眼镜中观看时不会出现接缝或穿帮。
(2)支持实时渲染,生成的3D房间能直接导入VR设备漫游。
(3)目前局限是不能做金属反光等复杂材质,超大教堂类场景也暂不支持。

2. 介绍一下这篇文章中的framework
DreamSpace 是一个基于扩散模型(Diffusion Model)的 文本驱动室内场景纹理生成框架,旨在为 3D 场景网格(Mesh)生成高质量、语义一致且空间连贯的纹理。其核心流程分为三个阶段:

(1)全景纹理生成(Panoramic Texture Generation)

  • 输入:用户文本描述(如“星空主题”)+ 真实场景的 3D 网格(带初始纹理和几何)。
  • 方法:
    粗到细生成:先用低分辨率全景扩散模型生成基础结构,再通过超分辨率提升细节。
    双重纹理对齐(Dual Texture Alignment):生成“风格优先”和“对齐优先”两种纹理,并用深度边缘感知的泊松混合(Poisson Blending)优化几何贴合。
  • 输出:高分辨率 360° 全景纹理(Equirectangular 投影)。

(2)初始纹理投影(Initial Texture Projection)

  • 将全景纹理通过 UV 映射 投影到 3D 网格的可见部分,形成初步风格化场景。

(3)全场景纹理传播(Holistic Texture Propagation)

  • 置信区域修复(Confidential Inpainting):在少量新视角下,用扩散模型修复未被初始全景覆盖的可见区域。
  • 隐式纹理模仿(Implicit Texture Imitating):对遮挡区域(如家具底部、墙壁缝隙),训练一个 MLP 网络 从已风格化区域学习颜色映射,预测合理纹理。
  • 最终输出:完整 UV 纹理贴图,可直接用于 3D 引擎(如 Unity/Unreal)或 VR 设备。

在这里插入图片描述
给定一个重建的真实场景和用户的文本描述,我们首先在中心视点生成高分辨率且几何对齐的全景纹理。随后,通过整体纹理传播技术将纹理扩展至其余区域——其中,置信纹理修复负责填充大范围的可信区域,而隐式纹理模仿则预测细小区域的色彩。最终生成的场景网格附带有烘焙后的风格化UV纹理,可直接上传至头戴显示设备(HMD),用于沉浸式VR漫游体验。

在这里插入图片描述

3. 文章是如何实现双重纹理对齐的
(1)双通道纹理生成
风格优先纹理(Style-first Panorama):使用全景扩散模型(LDM)生成高视觉质量的纹理,但几何贴合较弱。(“好看但可能歪的图”:AI自由发挥,保证星空效果炫酷,但可能没对准家具边缘。)
对齐优先纹理(Align-first Panorama):基于真实场景纹理,通过Canny边缘控制强制几何对齐,但风格质量较低。(对齐但略丑的图":AI严格按真实家具轮廓生成,风格较单调。)

(2)深度感知混合

  • 从全景深度图提取深度边缘(如家具轮廓),生成混合掩膜。(AI先用深度图找到桌子/沙发的边缘线(像描边工具))
  • 通过泊松图像编辑将对齐优先纹理融合到风格优先纹理中。
    边缘区域:优先使用对齐优先纹理(保证几何贴合)(在边缘线附近,用"对齐图"修正位置(确保纹理不穿帮)。)
    平坦区域:保留风格优先纹理(维持视觉质量)(其他区域保留"好看图"的绚丽效果。)

4.文章是如何“先用低分辨率全景扩散模型生成基础结构,再通过超分辨率提升细节”的?
(1)低分辨率基础结构生成

  • 输入条件:文本提示(如“星空主题”);场景中心视点的低分辨率(如512×1024)全景深度图与边缘图。
  • 模型:基于Latent Diffusion Model (LDM)的全景扩散模型,通过以下改进实现结构一致性:
    水平环形填充(Horizontal Circular Padding):替换UNet的常规卷积,强制左右边界连续。
    多条件控制:联合调节深度、边缘和文本嵌入
  • 输出:低分辨率(如1024×2048)全景纹理,保留场景宏观布局(如墙壁/家具位置),但缺乏细节。

(2)超分辨率细节增强

  • 方法
    分块扩散上采样(Tiled Diffusion):将低分辨率全景图分块输入通用LDM,通过扩散过程逐步提升分辨率(如3倍至3072×6144)。
    极区修复(Polar Inpainting):将全景图上下极区转换为透视投影,修复扭曲的顶/底部分(如天花板/地板)。水平滚动图像,修复左右边界接缝。
  • 输出:高分辨率无缝全景图,细节丰富(如家具木纹、星空的光点),符合等距柱状投影(Equirectangular Projection)要求。

在这里插入图片描述

三、Sample2SQL: A Visual Interface for Querying Risky Enterprises

作者:Hongjia Wu, Shanchen Zou, Jiazhi Xia, Hongxin Zhang, Wei Chen
机构:(1)State Key Lab of CAD&CG, Zhejiang University (2)Central South University
文章链接:https://ieeexplore.ieee.org/document/10541717
发表:PacificVis 2024

在这里插入图片描述
可视化界面包含三个主要视图:全局视图、AHP(层次分析法)视图和查询树视图。全局视图展示了不同粒度级别的信息,包括企业散点图 (A)、样本企业列表 (B) 和选定企业列表 ©。AHP 视图 (D) 分为两个部分,左侧 (D1) 显示 AHP 模型的层次结构,右侧 (D2) 显示每个维度的数据分布。查询树视图 (E) 用于构建 SQL 查询语句,由上部的查询树 (E1) 和下部的 SQL 语句文本框 (E3) 组成。

摘要:
我们提出了一种针对高风险企业的可视化查询系统。用户只需输入少量高风险企业的样本,即可通过交互式分析获得表达查询结果的 SQL 语句,从而方便后续的任务操作和理解风险标准。由于企业的多样性和经济指标的复杂性,对于普通用户来说,理解、评估和查询高风险企业是一项具有挑战性的任务。为了解决这个问题,我们的可视化查询系统通过可视化分析界面集成了多标准决策技术和数据挖掘。该系统利用从少量已知风险公司样本中获得的知识,能够高效地识别高风险企业。我们的系统包括一个用于表达领域知识的层次分析模型、一个查询树构建算法和一个精心设计的可视化界面。两个真实案例证明了我们系统的有效性。

1. 简要介绍一下这篇文章
区域企业法律风险评估需综合分析政治、市场、法律等多维数据,但传统方法面临数据量大、维度高、信息不对称等挑战。现有系统多聚焦于风险模型设计或自然语言转SQL,缺乏结合领域知识与可视化探索的端到端解决方案。
核心贡献
1)交互式规则模型调整

  • 基于层次分析法(AHP)构建可解释的风险评估模型,支持通过可视化界面动态调整维度权重(如“法律诉讼次数”权重提升)。
  • 提出简化的AHP计算流程,仅需专家排序维度重要性即可生成一致性矩阵,降低交互负担。

(2)查询树构建算法

  • 将SQL语句抽象为树结构,叶节点为离散化后的过滤条件(如2 < 企业年龄 < 5),非叶节点为布尔组合(AND/OR)。
  • 定义目标函数(基于Jaccard指数)优化查询条件,贪心算法生成近似最优SQL语句,支持对目标企业集合的语义匹配。

(3)可视化分析流水线

  • 全局视图:UMAP降维散点图展示区域企业分布,太阳图(Sunburst)编码企业多维度数据与AHP权重。
  • AHP视图:条形图对比样本企业与整体数据分布,突出关键风险维度(如“失信记录数”分布偏移)。
  • 查询树视图:树形结构可视化SQL条件组合,支持节点点击预览查询结果。

实验验证

  • 使用中国杭州8,300家企业真实数据,案例显示系统能快速识别高风险企业(如失信企业集群),生成可解释SQL语句(如筛选失信记录 > 5 AND 行业 = “租赁服务”)。
  • 专家评估表明,系统将规则模型调整时间缩短60%,SQL构建效率提升75%。

局限性

  • 仅支持单表查询,缺乏多表连接(JOIN)等复杂操作。
  • 时间序列分析能力不足,未考虑企业动态风险变化。

通俗易懂版本介绍
这是一款名为Sample2SQL的“企业风险扫描神器”,专为投资机构、政府监管部门设计。用户只需输入几家已知的高风险企业(比如因违规被处罚的公司),系统就能自动分析这些企业的共同特征,并生成标准的数据库查询语句(SQL),快速找出其他具有相似风险的企业。

核心功能:

(1)智能风险打分

系统内置一个评分模型(类似考试判卷规则),比如“法律诉讼次数多”的企业扣分多。用户可以通过拖拽调整不同指标的权重(如把“失信记录”的权重调高)。

(2)可视化分析

  • 全局地图:所有企业显示为散点图,高风险企业标红,点击可查看详情(如行业、注册资本)。
  • 对比功能:用条形图对比高风险企业和普通企业的差异(比如高风险企业的“被告案件数”普遍偏高)。
  • SQL生成器:系统自动将分析结果转换成SQL查询语句,像搭积木一样组合条件(例如“找出租赁行业且失信记录>5次的企业”)。

2. 什么是层次分析法?AHP模型是如何得到的?
层次分析法(Analytic Hierarchy Process, AHP)是一种结构化决策方法,用于处理多准则复杂问题,由Thomas Saaty于1970年代提出。其核心步骤包括:
(1)构建层次模型:目标层(如“评估企业风险”)、准则层(如“法律风险”“财务风险”)、方案层(如“涉诉案件数量”、“失信被执行人次数”、“税务违规情况”等)。
(2)构造判断矩阵:通过两两比较准则重要性(如“法律风险 vs 财务风险,哪个更重要?”),用1-9标度量化。
(3)计算权重:特征向量法求权重,一致性检验(CR<0.1)确保逻辑合理。
(4)综合评分:加权计算各方案总分。

在Sample2SQL中,实现了:用户输入样本 → AHP模型动态优化 → 自动生成SQL的无缝流程。
在这篇工作中,作者与领域专家(投资公司的量化分析师和投资经理)进行了长时间(8 个月)的合作,通过反复的讨论来确定模型的结构和参数。
AHP 模型根据用户设定的权重和企业在各个维度上的数据,计算出一个综合的风险评分。这个评分可以用来对企业进行排序或分类,识别出潜在的高风险企业。系统使用“查询树构建算法”来自动生成 SQL 语句。该算法的输入是目标企业集合,目标是找到一组 SQL 过滤条件,能够尽可能精确地匹配这些目标企业。

3. 查询树构建算法是怎么实现的?
查询树构建算法旨在解决以下优化问题:给定企业数据集 D 和目标企业集合 No,寻找最优查询条件 oˆ,使得通过 oˆ 查询到的企业子集 Noˆ 与 No 的相似度尽可能高。算法采用贪心策略,从基本查询条件出发,通过布尔运算逐步构建复杂的查询条件,并使用基于 Jaccard 指数的损失函数 L(oˆ) 评估每个查询条件的优劣。为了防止查询树过于复杂,算法引入正则化项 λHeight,并限制查询树的最大高度 Hmax。算法迭代进行,每次选择损失函数值最小的查询条件加入查询树,直到损失函数收敛或达到最大迭代次数。

通俗易懂的描述
想象一下,你有一堆企业的信息,你想从中找到一些“坏公司”(高风险企业)。你已经有一些“坏公司”的样本(目标集合),你想找到和它们类似的公司。
“查询树构建算法”就像一个聪明的助手,它会帮你自动生成一个 SQL 查询语句,来找到这些“坏公司”。

这个助手是怎么工作的呢?
(1)划分特征: 助手会把每个公司的各种特征(例如,公司年龄、注册资本)划分成几个范围,例如“公司年龄小于 5 年”、“公司年龄在 5 到 10 年之间”等等。
(2)尝试各种组合: 助手会尝试各种特征的组合,例如“公司年龄小于 5 年 并且 涉诉案件数量大于 10 起”。
(3)评估效果: 助手会评估每种组合的效果,看看它能找到多少“坏公司”,以及找到的公司有多大程度上和已知的“坏公司”相似。
(4)构建查询树: 助手会把这些组合按照效果好坏组织成一棵树,效果最好的组合放在树的顶端。
(5)生成 SQL 语句: 最后,助手会把这棵树转换成一个 SQL 查询语句,你就可以用这个语句在数据库里找到和你已知的“坏公司”类似的公司了。
为了防止生成的 SQL 语句太复杂,助手会限制树的高度,并且会尽量选择简单的组合。
总而言之,“查询树构建算法”就像一个自动化的 SQL 查询生成器,它会根据你提供的一些“坏公司”的样本,自动生成一个 SQL 查询语句,帮你找到更多类似的“坏公司”。

四、ReLive: Walking into Virtual Reality Spaces from Video Recordings of One’s Past Can Increase the Experiential Detail and Affect of Autobiographical Memories

在这里插入图片描述

作者:Valdemar Danry, Eli Villa, Samantha Chan, Pattie Maes
机构:MIT Media Lab
文章链接:https://ieeexplore.ieee.org/abstract/document/10919245
发表:TVCG 2025

摘要
随着先进机器学习方法在空间重建方面的快速发展,理解这些技术对自传记忆的心理和情感影响变得愈发重要。在一项被试内研究中,我们发现允许用户在从他们的视频重建的旧空间中漫步,显著增强了他们对过去记忆的旅行感,增加了这些记忆的生动性,并提升了情感强度,相较于仅仅观看同一事件的视频。这些发现强调,无论技术如何进步,虚拟现实的沉浸体验都能深刻影响记忆现象学和情感参与。随着能够实现沉浸式记忆重建的系统变得愈加普及,批判性地审视它们对人类认知和现实感知的影响变得至关重要。

1. 简要介绍一下文章和method
这篇文章探讨了利用虚拟现实(VR)技术重建个人记忆的影响,特别是通过从个人视频中生成沉浸式的3D环境。研究表明,参与者在这种重建的空间中行走时,比起单纯观看视频,他们的记忆重温感、情感强度和记忆的生动性均显著提升。实验结果显示,沉浸式体验能够增强自传记忆的现象学特征,改善记忆的连贯性和细节。文章强调,随着这些技术的普及,深入研究其对人类认知和现实感知的影响至关重要。

这篇文章的方法主要包括以下几个步骤:
(1)视频转化:首先,研究团队使用FFmpeg将参与者提交的个人视频转化为一系列有序的图像序列,设置帧率为10帧每秒,以便进行后续处理。
(2)3D重建:采用Meshroom这一光学测量软件,通过光摄影测量技术(photogrammetry)将图像序列转化为3D可步行的虚拟环境。研究选择Meshroom是因为它在处理短视频时更具有效性。
(3)用户研究设计:进行了一项被试内研究,邀请14名参与者。每位参与者提交至少三个与其个人经历相关的视频。随机选择一个视频进行3D重建。
(4)实验条件:参与者在两个条件下进行实验:一是观看原始2D视频,二是在重建的3D虚拟空间中行走。通过随机顺序控制实验顺序,以减少变量干扰。
(5)数据收集与分析:在每个实验条件后,参与者填写问卷,包括自传记忆重温测试(ART)、情感量表(PANAS)和重建准确性评估。数据通过普通最小二乘法(OLS)线性回归分析进行处理,以评估不同条件对记忆和情感的影响。
(6)定性分析:研究还通过半结构化访谈收集参与者的反馈,以深入了解他们的体验和感受。

2. 简要介绍一下研究结果
这篇文章的研究结果主要包括以下几个方面:

(1)记忆重温感:参与者在虚拟现实(VR)环境中行走时,感受到的“重温”记忆的程度显著高于观看视频的情况。VR条件下的自传记忆重温评分明显更高,表明沉浸式体验增强了记忆的回溯感。
(2)情感强度:在VR环境中,参与者的情感反应显著增强。情感量表(PANAS)的评分显示,参与者在沉浸于重建的空间时,体验到的情感强度要高于视频观看时的情感反应。
(3)记忆的生动性和连贯性:参与者在VR环境中对记忆的细节和连贯性评估也更高。自传记忆重温测试(ART)的结果显示,参与者在VR条件下对空间布局的记忆更为清晰,且记忆内容的连贯性也得到了改善。
(4)重建准确性:研究还发现,虚拟环境的重建准确性与情感反应和记忆质量之间存在显著关联。重建得越准确,参与者的情感反应和记忆的生动性、连贯性就越强。
(5)定性反馈:通过访谈,参与者普遍表示在VR环境中体验到的记忆更为生动,能够更好地回忆起特定的物品和情境。尽管存在一些细节缺失,许多参与者能够凭借想象力填补这些空白。

总体而言,研究结果表明,虚拟现实技术显著提升了个人记忆的回忆体验和情感参与,显示出其在自传记忆重建领域的潜力。

五、Mood-Driven Colorization of Virtual Indoor Scenes

在这里插入图片描述

作者:Boying Li, Zhixi Cai, Yuan-Fang Li, Ian Reid, and Hamid Rezatofighi
机构:(1)George Mason University (2)Tianjin University of Finance & Economics (3)Zhejiang University
原文链接:https://ieeexplore.ieee.org/document/9714118
发表:TVCG 2022

摘要
在虚拟现实(VR)中,设计虚拟场景以引发观众特定情绪是一项具有挑战性的任务。由于情绪的主观性,这一目标充满了不确定性。我们提出了一种新颖的方法,自动调整虚拟室内场景中物体纹理的颜色,以匹配目标情绪。我们使用了一个包含25,000张图像的数据集,这些图像包括建筑/家庭室内场景,用于训练一个分类器,通过深度学习提取特征。这一方法有助于优化过程,使虚拟场景能够自动根据目标情绪进行色彩化。我们在四个不同的室内场景上进行了测试,并通过用户研究展示了该方法的有效性,重点关注用户在使用VR头戴设备时的体验影响。

1.请讲一下这篇文章的pipeline

在这里插入图片描述
输入选择:用户选择一个目标情绪和一个虚拟室内场景(如卧室、餐厅等)。
特征提取:使用预训练的深度学习模型(如VGG-F)从输入图像中提取特征,以识别与目标情绪相关的图像特征。
优化过程:采用随机优化方法,迭代调整场景中物体的纹理颜色,直到达到满意的情绪匹配。计算总成本函数,包括情绪成本和真实感成本,以指导优化过程。
生成输出:最终生成与目标情绪匹配的优化场景,并展示给用户。
用户验证:进行用户研究,评估优化结果是否有效地引发了目标情绪,并收集用户反馈以验证方法的有效性。

2.请问是如何“使用预训练的深度学习模型从输入图像中提取特征,以识别与目标情绪相关的图像特征的”?
特征提取:使用预训练的VGG-F深度学习模型,对输入的室内图像进行处理。该模型通过多个卷积层和池化层提取图像的层次特征。
图像分类:提取的特征被输入到一个分类器中(如支持向量机SVM),用于分类图像的情绪。模型会根据训练时学习到的特征和情绪标签,评估输入图像与不同情绪的匹配程度。
情绪评分:对于每种情绪,模型会计算出一个得分,表示输入图像与该情绪的相关性,得分越高,表示越可能与目标情绪匹配。

3.“采用随机优化方法,迭代调整场景中物体的纹理颜色,直到达到满意的情绪匹配。” 随机优化方法是怎么工作的?
随机优化方法是一种用于解决复杂优化问题的算法,通常用于大规模搜索空间。具体过程如下:
初始状态:随机选择一个初始状态(例如,场景中物体的纹理颜色)。
目标函数:定义一个总成本函数,该函数由多个部分组成,包括情绪成本和真实感成本,用于评估当前状态的质量。
邻域生成:在当前状态的基础上,随机生成一个或多个邻近状态,这些状态是通过小幅修改当前状态(如调整颜色)得到的。
接受标准:比较新状态的成本与当前状态的成本。如果新状态的成本更低,则接受新状态;如果成本更高,则以一定概率接受新状态,以避免陷入局部最优解。
迭代过程:重复上述过程,直到达到预设的停止条件(如成本变化小于一定值或达到最大迭代次数)。

4.“特征提取:使用预训练的深度学习模型(如VGG-F)从输入图像中提取特征,以识别与目标情绪相关的图像特征。”这个阶段的作用是什么?为啥不直接进入到优化过程阶段?
特征提取阶段的作用是为优化过程提供必要的信息基础,具体来说,原因如下:
理解图像内容:特征提取帮助系统理解输入图像的内容,包括颜色、纹理、形状等。这些信息是判断图像传达情绪的关键。
情绪识别:通过提取特征,系统可以识别出图像与不同情绪的关联。例如,鲜艳的颜色可能与“快乐”相关,而阴暗的色调可能与“忧伤”相关。
为优化提供依据:在优化过程中,系统需要知道当前图像的情绪特征才能进行调整。如果没有这些特征信息,系统无法判断如何修改颜色或纹理以匹配目标情绪。
减少试错成本:通过提取特征,系统可以更有效地进行优化,减少随机尝试的次数,从而提高效率。
简单来说,特征提取就像是为优化过程打下基础。只有理解了输入图像中的情绪特征,系统才能进行有效的调整,以达成目标情绪。直接进入优化过程可能导致无效或不准确的结果。

六、AutoSpark: Supporting Automobile Appearance Design Ideation with Kansei Engineering and Generative AI

在这里插入图片描述

作者:L Chen, Q Jing, Y Tsang, Q Wang, R Liu, D Xia, Y Zhou, L Sun
机构:Zhejiang University
原文链接:https://dl.acm.org/doi/10.1145/3654777.3676337
发表:UIST 2024

摘要
快速创造出符合消费者情感需求的新颖产品外观设计是一项重大挑战。文本到图像模型凭借其卓越的图像生成能力,在激发设计师灵感方面展现出巨大潜力。然而,在实际应用中,设计师仍面临情感需求对齐、设计意图表达以及生成结果理解等问题。为解决这些挑战,我们提出了AutoSpark,这是一个结合感性工学(Kansei Engineering)与生成式AI的交互系统,旨在为设计师提供创意支持,帮助其创作符合情感需求的汽车外观设计。

AutoSpark通过生成式AI和语义网络驱动的感性工学引擎,**协助设计师完成情感需求对齐、设计意图表达和提示词优化。**系统还通过细粒度的图像间相似性对比和文本-图像相关性评估,帮助设计师理解和迭代生成结果。其界面中的设计思维导图有助于管理设计流程。用户研究表明,与基线系统相比,AutoSpark能更有效地帮助设计师生成符合情感需求且质量更高的设计,同时提升了人机协作过程中的设计体验。

1.介绍一下这篇文章
本文介绍了一种名为 AutoSpark 的互动系统,旨在支持汽车外观设计中的创意生成,特别是在满足消费者情感需求的早期概念构思阶段。通过结合感性工程和生成 AI,AutoSpark 解决了设计师在情感需求对齐、设计意图表达及生成结果理解等方面的挑战。

该系统采用感性工程引擎和语义网络,帮助设计师发散情感词并将其转化为具体设计特征。AutoSpark 还通过细粒度的图像间相似性比较和文本与图像相关性评估,促进设计师对生成结果的理解和迭代。用户研究表明,相较于基线系统,AutoSpark 更有效地支持设计师生成与情感需求更一致且质量更高的设计,同时提升了设计师在与 AI 协作创作过程中的体验。

通俗易懂版本的介绍:
这篇文章介绍了一款叫 AutoSpark 的新工具,帮助汽车设计师在创作时更好地满足消费者的情感需求。设计汽车的外观不仅要好看,还要让人有感觉,这对设计师来说是一项挑战。

AutoSpark 结合了感性工程和生成人工智能,帮助设计师找到合适的情感词,并把这些词转化为具体的设计元素。它还能让设计师更容易理解和调整生成的设计图。通过一项用户研究,结果显示,使用 AutoSpark 的设计师能更好地创造出符合消费者情感需求的高质量设计,并且在与 AI 合作的过程中体验更好。

2.文章的contribution是什么?
(1)AutoSpark 是一个互动系统,帮助设计师创造满足消费者情感需求的汽车外观设计,通过图像间和文本与图像的比较进行设计迭代,并利用设计思维图管理创作过程。

(2)结合了感性工程引擎和补丁反演算法的计算管道。感性工程引擎支持情感词的发散、设计特征的翻译和提示建议,而补丁反演算法则支持抽象文本提示与生成图像之间关系的解释。

(3)用户研究的发现表明,AutoSpark 如何通过与 AI 的合作帮助设计师生成创意外观设计,并提升他们在共同创作过程中的体验。

3.介绍一下文章的pipeline
(1) 感性工程引擎(KE Engine)
情感词发散:该引擎通过输入的情感词生成相关的多个情感词,帮助设计师探索不同的设计方向。例如,如果输入“优雅”,系统可能会生成“奢华”、“精致”等相关词汇。
设计特征翻译:将情感词转化为具体的设计特征,帮助设计师将抽象的情感需求具体化为可操作的设计元素,如形状、颜色和纹理。
提示建议:生成适合的文本提示,供设计师用于文本到图像模型中,以确保生成的图像符合设计师的意图。
(2)补丁反演算法(Patch-Inversion Algorithm)
该算法用于分析生成图像中各个区域与输入的抽象文本提示之间的相关性。通过计算每个区域的相关性,设计师可以更好地理解哪些部分与情感需求相符,从而进行更精确的调整。
该方法通过比较局部区域与整体图像的关系,帮助设计师评估设计元素在整体构图中的作用,提升设计的一致性和表达效果。
(3)设计思维图(Design-Thinking Map)
该图提供了一种结构化的方式,帮助设计师管理和追踪设计过程。设计师可以在图中记录情感词、设计特征和生成的图像,便于回顾和迭代设计方案。
设计思维图的树状结构清晰展示了设计方向的演变,帮助设计师在整个创作过程中保持清晰的思路。

4.什么是感性工程引擎(KE Engine)?这是如何实现的?
(1)情感词发散:
输入:设计师首先输入一个或多个情感词,例如“优雅”。
处理:引擎利用语义网络,从大量的消费评论和设计案例中提取与该情感词相关的其他情感词,如“奢华”、“精致”等。
输出:生成一组相互关联的情感词,供设计师选择和使用。
(2)设计特征翻译:
特征映射:系统将情感词映射到具体的设计特征,例如形状、颜色和纹理。通过分析历史数据和设计案例,系统能够识别哪些特征与特定情感相关。
示例:例如,“优雅”的情感可能对应于流线型的设计和柔和的色彩。
(3)提示建议:
生成提示:引擎根据选定的情感词和设计特征生成适合的文本提示,用于文本到图像模型。
优化:这些提示经过优化,使其能够更好地指导图像生成过程,以确保生成的图像符合设计师的意图。
(4)反馈循环:
迭代改进:设计师可以根据生成的图像反馈,进一步调整情感词或设计特征,循环进行发散和优化(这里需要用到补丁反演算法),达到更理想的设计效果。

感性工程引擎是如何实现的?
(1)数据收集
用户评论和反馈:从汽车评论网站、社交媒体和消费者反馈中收集大量关于汽车外观的评论和描述。这些数据包含消费者的情感表达和对设计特征的评价。
(2)情感词提取
自然语言处理:利用自然语言处理(NLP)技术,从收集到的文本中提取出情感词。这些词反映了消费者对汽车外观的感受,例如“优雅”、“豪华”、“运动”等。
(3)语义网络构建
构建网络:基于提取的情感词,构建一个语义网络。这个网络展示了不同情感词之间的关系,例如“优雅”可能与“豪华”、“精致”相连。
(4) 特征映射
设计特征关联:确定每个情感词与具体设计特征的关联。这一步通常依赖于设计专家的知识和历史数据分析,识别哪些设计元素(如形状、颜色和材质)能传达特定的情感。
(5)提示生成
生成设计提示:根据情感词和设计特征,自动生成文本提示。这些提示将用于指导设计师在生成图像时更好地表达他们的意图。
(6)反馈与迭代
用户交互:设计师使用引擎生成设计方案后,可以根据反馈调整情感词或设计特征。引擎可以在这一过程中不断学习和优化。

5. 你说“设计师可以根据生成的图像反馈,进一步调整情感词或设计特征,循环进行发散和优化”,这里是需要用到补丁反演算法吗?
是的,补丁反演算法在这个过程中起到了重要的作用。
补丁反演算法的作用
(1)分析生成图像:
该算法可以帮助设计师识别生成图像中各个区域与输入的情感词之间的相关性。这种分析可以揭示哪些设计元素与期望的情感效果相符。
(2)反馈机制:
设计师可以根据补丁反演算法提供的反馈,了解哪些部分表达了所需的情感,哪些部分则未能达到预期效果。这种信息可以指导设计师调整情感词或设计特征。
(3)优化迭代:
当设计师进行调整时,补丁反演算法可以再次评估新的生成图像,形成一个闭环。设计师可以不断优化输入的情感词和设计特征,从而产生更符合需求的设计方案。

6. 补丁反演算法具体是如何实现的?
补丁反演算法的具体实现可以分为以下几个步骤:
(1)图像分割
分割生成图像:将生成的图像划分为多个小区域(补丁),通常以网格形式进行分割,例如 8x8 或 16x16 的小块。
(2)特征提取
提取特征向量:对每个补丁使用视觉模型(如 CLIP)提取特征向量。这些向量能够表示每个补丁的视觉信息,如形状、颜色和纹理。
(3)相关性计算
计算相关性:针对每个补丁,计算其特征向量与输入的情感词的相关性。这通常是通过计算余弦相似度来实现的。
(4)补丁反演
生成反向图像:对于每个补丁,通过遮罩原始图像中的该补丁,创建一个新的“反向图像”。在这个反向图像中,只有该补丁被保留,其他部分被替换为背景或平均色值。
重新计算相关性:再对这个反向图像的补丁特征向量与情感词进行相关性计算,以评估该补丁对情感表达的影响。
通俗解释:现在,我们对每个小方块做一个实验:把它的内容保留,而把其他部分(其他小方块)遮住。这样,我们就得到了一个新的图像,只能看到一个小方块。然后,我们再看看这个只包含一个小方块的图像,它和“优雅”这个词的关系是什么。我们会发现,有些小方块可能和“优雅”特别相关,而有些则不太相关。最后,我们把所有小方块的相关性结果用颜色显示出来。比如,和“优雅”关系特别强的小方块用红色表示,而关系不强的小方块用蓝色表示。这样一来,我们就能一眼看到哪些部分是成功表达了“优雅”的,哪些部分需要改进。
(5)可视化结果
热图生成:根据相关性得分,为每个补丁生成热图,显示每个区域对情感词的影响程度。热图中,颜色越红表示相关性越高,颜色越蓝表示相关性越低。
(7)反馈与调整
设计师分析:设计师根据热图的结果分析哪些部分符合其设计意图,哪些部分需要调整。根据这些反馈,设计师可以优化输入的情感词或设计特征。
在这里插入图片描述

七、LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

在这里插入图片描述
Figure 1.我们提出了LSceneLLM,这是一个用于自适应大3D场景理解的新框架。(a)现有方法在面对大场景时难以定位任务相关的视觉信息。(B)我们致力于通过自适应场景建模精确识别细粒度任务相关的视觉特征。©在各种基准测试中,我们的方法优于现有方法。

作者:Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan
机构:(1)South China University of Technology (2)Tencent Robotics X (3)Northeastern University (4)UMass Amherst (5)MIT-IBM Watson AI Lab (6)Pazhou Laboratory (7)Sichuan University
文章链接:https://arxiv.org/abs/2412.01292
发表:CVPR 2025

摘要
三维视觉-语言模型(3D-VLM)的研究正受到越来越多的关注,这类模型对于开发三维场景中的具身人工智能(如视觉导航、具身问答)至关重要。由于视觉特征的高密度性(尤其在大型3D场景中),精确定位与任务相关的视觉信息极具挑战性。现有研究通常尝试分割所有物体并将其特征作为场景表征,但这些与任务无关的物体特征包含大量冗余信息,且缺失任务关键区域的细节。

为解决这些问题,我们提出LSceneLLM——一种自适应框架,通过利用大语言模型(LLM)对不同任务的视觉偏好自动识别任务相关区域并采用即插即用的场景放大模块捕捉聚焦区域的细粒度细节。具体而言:dense token selector 通过分析LLM的注意力图来识别指令输入对应的视觉关注区域;场景放大模块对聚焦区域进行细粒度细节增强;自适应自注意力模块融合粗粒度全局信息与筛选的细粒度局部特征。

为全面评估3D-VLM的大场景理解能力,我们进一步提出了跨房间理解基准XR-Scene,包含XR-QA(跨房间问答)、XR-EmbodiedPlanning(跨房间具身规划)和XR-SceneCaption(跨房间场景描述)等一系列任务。实验表明,我们的方法在大型场景理解和现有场景理解基准上均超越现有方法。将场景放大模块嵌入现有3D-VLM也能带来显著性能提升。

1. 简要介绍一下这篇文章
本文提出了一种新的3D视觉-语言模型框架——LSceneLLM,旨在提高对大型3D场景的理解能力。通过利用大语言模型(LLM)的视觉偏好,LSceneLLM能够自动识别任务相关区域,并通过插入场景放大模块来捕捉细粒度细节。该框架包括一个粗略场景理解模块和一个场景放大模块,能够从粗粒度到细粒度地理解复杂场景。
主要贡献为:
(1)提出LSceneLLM框架,自动识别并放大任务相关区域的信息。(能自动识别重要信息区域,帮助计算机更准确地理解场景)
(2)引入XR-Scene基准,评估3D-VLM在大型场景理解中的表现。(提出了XR-Scene这个新的测试平台,用来评估计算机在大型场景中的表现)
(3)实验结果表明,LSceneLLM在多个基准测试中超越了现有方法。

2. 请详细讲一下LSceneLLM框架
LSceneLLM由两个主要模块组成:
(1)粗略场景理解模块
该模块负责对3D场景进行初步分析,提取稀疏的视觉特征。
使用场景编码器对降采样的点云进行编码,生成粗粒度的视觉信息。
(2)场景放大模块
该模块用于聚焦于任务相关区域,捕捉更细致的视觉信息。
通过密集标记选择器分析LLM的注意力图,识别与当前任务相关的视觉偏好,提取密集的视觉特征。

自适应自注意力机制结合了粗粒度和细粒度的信息,增强了模型的上下文理解能力。通过选择性地聚焦于重要区域,使得模型在处理复杂场景时更为高效。
LSceneLLM能够根据不同任务自动调整其视觉偏好,从而更好地识别和处理与任务相关的视觉信息。

在这里插入图片描述
(翻译自原文)
如图2所示,给定一个3D场景的密集点云,我们首先通过场景编码器提取密集点云特征。这些特征随后被降采样为稀疏点云特征。通过一个粗略场景理解模块,该模块从SA模块修改而来,为每个采样点随机采样并聚合大量附近特征,将稀疏点云特征转换为稀疏视觉标记(sparse vision group),表示一个粗略的场景描述

为了构建细粒度特征,我们识别出首选区域的中心点,并从其附近的密集点云特征中提取特定数量的点云特征。这些局部区域的点云特征通过SA模块处理,以获得密集视觉标记(dense vision group)。

在接收视觉特征后,我们用所提出的场景放大模块修改LLM,以实现细粒度的场景感知。给定一个具有N层自注意力的LLM,我们将最后 N M A N_{MA} NMA层的自注意力模块替换为场景放大模块,同时保持前 N S A N_{SA} NSA层不变,因为前几层的注意力通常会关注视觉输入的全局信息。为了降低计算复杂度,我们只将稀疏视觉标记和文本标记输入到前 N S A N_{SA} NSA层。对于使用场景放大模块的最后 N M A N_{MA} NMA层,我们还额外引入选定的密集视觉标记,以增强模型对感兴趣区域的理解。具体而言,场景放大模块包含两个子模块:密集视觉标记选择器(Dense Vision Token Selector)和自适应自注意力机制(Adaptive SelfAttention)。密集视觉标记选择器动态识别并选择感兴趣区域的密集视觉标记,这一过程是通过自注意力机制的注意力图引导的,而不是输入所有的密集视觉标记。自适应自注意力机制将选定的密集视觉标记的信息整合到原始的隐状态中,从而丰富模型的上下文理解。

补充:请分别解释下这篇文章中,什么是Sparse Vision Tokens、Dense Vision Tokens、Sample Groups,它们是怎么产生的?
(1)Sparse Vision Tokens
稀疏视觉标记是从3D场景中提取的初步视觉特征,通常代表较大范围内的视觉信息。通过场景编码器对降采样的点云进行处理,生成稀疏的视觉特征。这些标记主要用于初步的场景理解,提供粗粒度的信息。

(2)Dense Vision Tokens
密集视觉标记是从特定区域提取的更详细的视觉特征,能够捕捉到细粒度的信息。在识别出任务相关区域后,通过密集标记选择器从密集点云特征中提取。这些标记是基于LLM的注意力图选择的,专注于与当前任务紧密相关的视觉信息。

(3)Sample Groups
样本组是指从稀疏视觉标记中选取的特定视觉特征集合,用于进一步处理和分析。在处理稀疏视觉标记时,选择一定数量的特征作为样本组,以便对特定区域进行详细分析。这个过程包括从稀疏标记中识别出感兴趣的区域,并从这些区域提取相应的密集视觉标记。

3.请讲讲文章是如何评估所提出的这个方法的
(1)引入XR-Scene基准
文章提出了一个新的评估基准,XR-Scene,专门用于测试大型场景理解能力。该基准包含多种任务,如XR-QA(问答)、XR-EmbodiedPlanning(体感规划)和XR-SceneCaption(场景描述)。
(2)实验设置
使用了多个数据集进行训练和测试,包括ScanNet和HM3D等,涵盖了不同类型的3D任务。将LSceneLLM与现有的3D-VLM方法进行对比,比如LL3DA、Chat-Scene和Leo等,以验证其性能优越性。
(3)性能指标
使用了多种评估指标,如CIDEr、METEOR和ROUGE等,来量化生成文本的质量和模型的回答准确性。
(4)消融实验
进行了消融实验,以分析不同模块和参数设置对模型性能的影响,进一步验证了场景放大模块的有效性。

八、NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis

在这里插入图片描述

作者:Ben Mildenhall, Pratul P. Srinivasan, Matthew Tancik, Jonathan T. Barron, Ravi Ramamoorthi, Ren Ng
机构:(1)UC Berkeley (2)Google Research (3)UC San Diego
文章链接:https://arxiv.org/abs/2003.08934
代码链接:https://github.com/bmild/nerf

摘要
我们提出了一种方法,通过优化底层连续体积场函数,使用稀疏的输入视图,达到合成复杂场景新视图的最先进结果。我们的算法使用一个完全连接的(非卷积)深度网络来表示场景,其输入是一个连续的5D坐标(空间位置和视角方向),输出是该空间位置的体积密度和视角依赖的发射辐射。我们通过沿相机光线查询5D坐标来合成视图,并使用经典的体积渲染技术将输出颜色和密度投影到图像中。由于体积渲染自然可微分,优化我们表示所需的唯一输入是一组具有已知相机姿态的图像。我们描述了如何有效优化神经辐射场,以渲染具有复杂几何形状和外观的照片级真实新视图,并展示了超越先前神经渲染和视图合成工作的结果。视图合成结果最好以视频形式查看,因此我们建议读者观看我们的补充视频,以获得令人信服的比较。

NeRF是Neural Radiance Fields(神经辐射场)的缩写。因为这篇文章比较经典,所以直接看了B站视频解析。B站视频链接:十分钟带你快速入门NeRF原理 。具体笔记如下。

nerf也是一种三维重建的技术,但和以往的三维重建技术有所不同。过往的三维重建技术是直接通过图片重建出一个网格/点云的三维模型,但Nerf通过一种神经隐式的方式去重建这个三维模型。

1. 什么是神经隐式?
我们可以简单地理解为,“隐式”就是将三维模型的信息存在了神经网络中。神经网络的输入是相机位姿,输出是RGB和不透明度值。

我们使用一个NeRF神经网络采取体积雾的渲染方式,通过已知视角的图片进行训练,然后输入其它相机视角的参数,从而预测出未出现视角的图片。此时三维模型的信息就储存在了NeRF神经网络之中!所以这是一种“隐式”的表示方法,而不是像点云、体素、网格这种显式的表示方式。

PS:一个Nerf神经网络模型只能存储一个三维物体或者一个三维场景的信息。即:如果每次需要用Nerf来表示一个新的三维物体,都需要训练一个新的Nerf模型。
在这里插入图片描述

2. Nerf的输入、输出和基本介绍
Nerf的输入信息包括相机的位置(x, y, z)、相机的方向(θ, φ)。输出信息是在该相机位姿下,所拍摄到的成像内容(一张图片)。希望通过这种方式,将一个三维模型的信息储存在一个神经网络中。

在训练过程中,Nerf以一个像素点对应的射线和相机位置,作为训练数据,而不是把一整张图片作为训练数据。也就是说,每一个像素点都是单独抽离出来的。每一个batch里面都有很多个来自不同地方的像素点和相机参数作为训练数据。

在输出方面,Nerf的输出是RGB和不透明度值。神经网络先输出一段采样点上的RGBA的值,然后在射线方向上对这些采样点进行特定的积分,得到最终的输出。(如下图c、d所示)

在这里插入图片描述

3. Nerf中的位置编码
位置编码主要是为了将图像中的高频信息体现出来。Nerf采用的位置编码能够大幅度提高图片的细节质量,而不会受到周边像素平滑过后的影响。下图最右边是不加位置编码的效果,边缘不太清晰。加了位置编码后的图片会看起来更真实。

Nerf中的位置编码是通过concat的方式,将信息融合起来。每个位置编码由sin和cos组合而成。
在这里插入图片描述
3. Nerf中的网络结构
网络结构整体上是一个全连接网络。
在这里插入图片描述
4. Volume Render
NeRF采用的是一种体积雾的渲染方式,在获取一定范围采样点的(r,g,b,a)之后需要再进行特定积分运算,最终得到对应像素最终的(r,g,b,a),在训练时通过光线采样点积分的得到的像素值。
在这里插入图片描述

Nerf的volume rendering是在哪个步骤使用的?
体积渲染发生在训练阶段和渲染阶段,是连接神经网络预测与最终图像合成的桥梁。将神经网络输出的空间颜色和密度信息,通过积分计算转换为2D像素颜色,实现从三维到二维的映射。
假设我们要渲染一个茶杯的图像:
(1)光线投射:从相机位置发射一条光线穿过茶杯区域。
(2)采样:在光线上采样多个点,输入神经网络得到每个点的颜色和密度。
(3)积分:通过体积渲染公式计算所有采样点的贡献,得到该像素的颜色。
(4)合成图像:对所有像素重复上述过程,生成完整的茶杯图像。

5. nerf的训练数据怎么制作呢?
制作NeRF的训练数据需要经过图像采集、相机位姿获取、数据格式转换及配置等步骤,以下是详细说明:
(1)图像采集:拍摄一组多视角的图像。可以通过手机或相机围绕目标物体拍摄视频,然后抽帧提取关键帧,或者手动拍摄不同角度的图像。拍摄时建议保持背景简单、物体居中,并确保光照条件一致,以减少后续处理难度。
(2)获取相机位姿:使用COLMAP软件来计算图像的相机位姿。COLMAP是一款开源的多视图立体几何软件,能够通过特征提取、特征匹配和稀疏重建等步骤,生成图像的相机参数和位姿信息。具体操作包括:新建项目、导入图像、进行特征提取和匹配、执行稀疏重建,最后导出模型数据。
(3)数据格式转换:将COLMAP输出的位姿数据转换为NeRF能够读取的LLFF格式。LLFF格式将图片参数、相机位姿和相机参数存储在一个.npy文件中,方便Python读取。可以通过修改LLFF提供的imgs2poses.py脚本,设置正确的工作目录,运行脚本完成格式转换。
(4)数据集配置:将处理好的数据集配置到NeRF代码目录下。将转换后的数据集复制到NeRF代码的/data/nerf_llff_data/目录下,并确保文件夹命名规范,避免中文路径导致的错误。
(5)配置文件设置:在NeRF代码目录下,复制配置文件模板(如fern.txt),并重命名为与数据集对应的名称(如plant.txt)。修改配置文件中的关键参数,例如数据集路径、图像分辨率、采样数量等。这些参数将直接影响训练效果,需根据数据集特点进行调整。
(6)运行训练代码:使用配置好的文件启动训练。例如,运行命令python run_nerf.py --config configs/your_dataset.txt,即可开始训练。

九、Diffusion Model

看了两个B站视频:两分钟讲清楚什么是diffusion model(扩散模型)【大白话01】一文理清 Diffusion Model 扩散模型 | 原理图解+公式推导

1.Diffusion Model是如何运作的?
假设现在要产生一张猫咪图片,猫咪图片的分辨率是256*256。先从噪声图片中采样出分辨率相同,但符合高斯分布的噪点,进行去噪Denoise,得到了右边清晰一些的猫咪图片。重复该步骤,会得到更清晰一点的猫咪图片。不停地重复,最终得到没有噪点的完美图片。
在这里插入图片描述
为每个步骤编上序号。带有噪点的图片是输入,清晰一点的图片是输出。这些噪点图片统一通过denoise模块进行去噪。

在这里插入图片描述
denoise模块包含了一个预测噪声的功能。输入是带噪点的图片和时间步,noise predicter预测出噪声的分布,从而在原图片上减去噪声,输出是清晰一些的图片。
在这里插入图片描述
训练数据本来就有这个完美的图片,通过随机生成噪点来给图片加噪声。重复这个步骤,不断给图片加噪声,直到得到纯噪声。训练noise predicter的时候,带有噪点的图片和时间步作为输入,噪点的分布作为输出,反复训练得到噪点预测的模型。该模型训练好了之后,就可以用该模型去删除噪点。但是最终是用文字生成图片,所以文字也需要作为每一步训练的输入(如下图所示)。
在这里插入图片描述

2. 介绍一下DDPM的训练过程
DDPM(Denoising Diffusion Probabilistic Models)的训练过程的核心目标是学习一个去噪网络(预测噪声的分布),使其能够预测从噪声样本 x t x_t xt恢复出原始数据 x 0 x_0 x0的过程中需要去除的噪声。具体步骤如下:
在这里插入图片描述
在这里插入图片描述
3.在DDPM中,什么是采样?采样的作用是什么?
在DDPM(Denoising Diffusion Probabilistic Models)中,采样是指从模型中生成新的数据样本的过程。具体来说,采样过程是从纯高斯噪声 x T   N ( 0 , I ) x_{T} ~ N(0,I) xT N(0,I)开始,通过逐步去噪(反向过程),最终生成一个与训练数据分布相似的新样本 x 0 x_0 x0
在这里插入图片描述
采样是DDPM的核心功能之一,其作用主要体现在以下几个方面:
(1)生成新数据
核心目标:DDPM的训练是为了学习数据分布,而采样的作用是从学习到的分布中生成新的、未见过的样本。
应用场景:
图像生成:生成新的图像(如人脸、风景等)。
文本生成:生成新的文本序列(需结合其他模型,如Diffusion-LM)。
音频生成:生成新的音频信号。
(2)验证模型能力
评估生成质量:通过采样生成样本,可以直观地评估模型是否学习到了真实数据的分布。
定量指标:可以使用FID(Fréchet Inception Distance)、IS(Inception Score)等指标量化生成样本的质量。
(3)支持下游任务
数据增强:生成额外的样本用于训练其他模型(如分类器)。
创意应用:在艺术、设计等领域生成新的创意内容。
(4)反向过程的物理意义
从噪声到数据:采样过程模拟了从噪声逐步构建数据的过程,与前向扩散过程(从数据到噪声)相反。
马尔可夫链的逆过程:采样过程是前向扩散过程的逆过程,通过逐步去噪实现。

4.原理公式补充(具体可看B站视频:【大白话01】一文理清 Diffusion Model 扩散模型 | 原理图解+公式推导
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
在这里插入图片描述
5. Diffusion Model的应用
Diffusion model的应用广泛且多样,涵盖了图像、音频、文本生成以及多个跨学科领域,以下是对其具体应用的归纳。
图像生成与编辑:
图像生成:Diffusion model可以生成高质量的图像,如Stable Diffusion、DALL·E 2等模型在图像生成领域取得了显著成果。这些模型能够学习图像的特征和分布规律,生成符合这些规律的新图像。
图像编辑:Diffusion model还可用于图像修复、图像增强、图像超分辨率、图像去噪、去雨、去模糊、风格变化、去雾等任务。通过训练,模型可以学习到图像在不同条件下的变化规律,从而实现对图像的精细编辑。

音频与视频生成:
音频生成:Diffusion model可以生成各种类型的音乐、声音效果,甚至模拟特定人的声音。在音频生成领域,Diffusion model通过逐步去噪的过程,从纯噪声中生成符合特定音频分布的样本。
视频生成:虽然直接的视频生成应用相对较少,但Diffusion model的原理可以扩展到视频生成领域,通过逐帧生成或时空联合建模的方式实现视频内容的生成。

自然语言处理:
文本生成:Diffusion model在文本生成领域也有应用,如Diffusion-LM等模型通过引入隐变量和可控生成方法,实现了高质量、可控的文本生成。这些模型可以学习到语言的特征和分布规律,生成符合语法和语义规则的新文本。

跨学科应用:
药物发现与设计:Diffusion model在药物发现与设计领域也有潜在应用。通过模拟分子间的相互作用和扩散过程,Diffusion model可以帮助研究人员发现新的药物分子或优化现有药物的结构。
数据分析与增强:在数据分析领域,Diffusion model可以用于数据增强和模拟。通过生成符合特定分布的新数据样本,Diffusion model可以扩充数据集规模,提高模型的泛化能力。
强化学习与机器人技术:在强化学习和机器人技术领域,Diffusion model可以用于模拟环境动态和生成训练样本。通过生成多样化的环境状态和动作序列,Diffusion model可以帮助强化学习算法和机器人系统更好地适应复杂多变的环境。

十、DTBIA: An Immersive Visual Analytics System for Brain-Inspired Research (2025, TVCG)

在这里插入图片描述

作者:Jun-Hsiang Yao, Mingzheng Li, Jiayi Liu, Yuxiao Li, Jielin Feng, Jun Han, Qibao Zheng, Jianfeng Feng, Siming Chen
机构:(1)Fudan University(2)The Hong Kong University of Science and Technology and CORE
文章链接:https://arxiv.org/abs/2505.23730

数字双胞胎大脑(DTB)是一种先进的人工智能框架,集成了脉冲神经元,以模拟复杂的认知功能和协作行为。对于领域专家来说,直观展示 DTB 的模拟结果对于理解复杂的认知活动至关重要。然而,由于 DTB 数据固有的特性,包括其高维度、时间动态和空间复杂性,这项任务面临重大挑战。为了解决这些挑战,我们开发了 DTBIA,一个用于脑启发研究的沉浸式可视分析系统。在与领域专家的合作中,我们确定了有效可视化时空和拓扑模式的关键需求,涵盖多个细节层次。DTBIA 采用分层工作流程——从脑区到体素和切片,结合沉浸式导航和 3D 边缘捆绑算法,以增强清晰度并提供对功能(BOLD)和结构(DTI)脑数据的更深入洞察。通过与脑研究专家的两个案例研究验证了 DTBIA 的实用性和有效性。结果强调了该系统在增强对复杂神经行为和交互理解中的作用。

1. 这篇文章的motivation和contribution?
motivation:数字双胞胎大脑(DTB)可以帮助我们模拟人脑的复杂思维和行为,但它的数据很复杂(高纬度、时间动态、空间复杂性),难以理解。为了让专家们更好地看到这些数据,我们开发了一个叫 DTBIA 的新系统,让他们可以更清晰地可视化和分析这些信息。通过和专家的合作,我们找出了他们在可视化时需要什么样的帮助并设计了一个分层的工作流程来更好地展示脑部数据。

contribution:

  • 我们与12位领域专家合作,解决有效的数字双胞胎(DTB)可视化工具的缺口。这一跨学科的努力将脑启发计算与神经科学相结合,促进了更好的见解交流,并加深了可视化在推动脑启发研究中的作用。
  • 我们开发了一个沉浸式可视分析系统,利用沉浸式可视化技术来探索DTB数据,方便分析时空模式和数据行为。
  • 我们通过实际案例研究的验证和分析,以及专家反馈和评估,展示了我们系统在DTB研究中的实际价值。

2. 帮我介绍一下文章的3.2节“3.2 Collaborative Feedback and Design Insights”
在这一节中,文章讨论了与领域专家的密切合作,以识别在数字双胞胎(DTB)研究中可视化工具的具体挑战和需求。研究团队与来自复旦大学脑启发智能研究所的10位专家进行了深入交流,专家们在数学建模和神经科学方面具有丰富的背景。
主要内容:
(1)专家反馈:通过定期会议,研究团队收集了专家在使用现有可视化工具时遇到的问题,例如对比模拟神经信号和真实数据的互动工具缺乏,以及在多模态数据分析中的数据跟踪难题。
(2)识别关键问题:专家指出,当前工具在探索大规模神经数据时效率低下,且2D可视化方法无法充分展示脑区之间复杂的空间关系,导致信息过于繁杂,难以有效分析。
(3)分析任务:团队明确了几项关键分析任务,例如比较模拟与真实神经信号的相似性、功能数据的时空分析,以及结构数据的拓扑分析。
(4)设计需求:基于专家的反馈,研究团队提出了设计需求,确保系统能够有效支持这些分析任务,并提供更好的用户体验。
通过这些合作,研究团队不仅增强了对高维脑数据的理解,还为设计更有效的可视化工具奠定了基础。

3. 请介绍一下这篇文章中的system workflow
文章中的系统工作流程描述了 DTBIA(数字双胞胎大脑沉浸式可视分析系统)如何组织和执行数据分析。该工作流程遵循“先概览,再缩放和筛选,最后详细查看”的原则,适合处理复杂的数据集。
关键组成部分:
(1)分层探索过程:
区域级(Region-Level):用户可以获得脑部整体的宏观视图,比较模拟的神经信号与真实数据。
体素级(Voxel-Level):在这一层,用户可以深入分析特定体素的数据,观察其连接性和功能。
切片级(Slice-Section Level):用户可以查看脑部特定平面的切片,分析BOLD信号和DTI连接的空间分布。

(2)沉浸式交互层级:
DTBIA 提供两种脑模型:真实规模脑模型用于总体观察,大规模脑模型用于细致探索。用户可以在这两种模型之间无缝切换。

(3)数据整合:
系统整合了功能性BOLD数据和基于DTI的结构连接数据,使用户能够同时分析神经活动及其结构网络。

通过这一工作流程,DTBIA 使得用户能够从宏观到微观层次逐步深入分析脑数据,提升了对复杂神经行为和互动的理解。

4.其他
3D-FDEB算法是一种基于力的算法,在DTBIA系统中主要用于处理和展示大脑的结构数据,特别是神经连接。该算法基于重要性(例如,连接强度)选择前10%的连接,提取端点的x、y、z坐标,并对边进行聚类。这个算法可以把看起来相似的连接线聚在一起,减少画面上的杂乱,让用户更容易看清楚重要的信息。

文章通过两个案例研究验证了 DTBIA 的有效性。第一个案例中,脑科学计算专家使用该系统评估模拟结果的有效性;第二个案例中,生物学专家探索默认模式网络(DMN),分析脑区的功能和结构。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐