1
Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong
任务设定
从语言指令合成机器人长时程操作策略
痛点动机
现有方法丢弃任务语义,奖励人工设计导致行为漂移
解决方案
提出 SUN 程序统一定义几何语义,编译为 MPC 代价与 RL 奖励,自动训练分阶段策略
2
Rukhshanda Hussain, Noé Artru, Emeline Got, Luiz Gustavo Hafemann, Alexandre Messier, Brandon Dearlove, Rafael M. O. Cruz, Abdallah Dib, Eric Granger
任务设定
单目相机实现高保真人脸表演实时捕捉
痛点动机
多视角 lightstage 采集耗时耗力,难以快速迭代
解决方案
先离线构建个性化人脸模型,再单目实时估计 4K 纹理与几何
3
Haozheng Yu, Xinyu Yang, Rundong Luo, Jennifer J. Sun, Bharath Hariharan
任务设定
单目视频的动态高斯泼溅场景重建
痛点动机
遮挡和欠约束区域下动态高斯易过拟合训练视角
解决方案
构建语义运动图,用可靠节点的运动引导邻近不可靠区域
4
Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz
任务设定
双臂多视角机器人感知的标定数据集
痛点动机
单视角感知因自遮挡导致物体表面观测不完整
解决方案
双臂各装 RGB-D-IR 相机,自动定位与跨臂确认采集多视角数据
5
Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan
任务设定
用预训练 VLM 实现跨任务、跨本体的具身导航
痛点动机
现有导航系统按任务/本体拆分模块,泛化能力弱
解决方案
用双通道指向统一表达空间意图,配合残差 VQ 动作分词器转成具体轨迹,单模型端到端完成导航
6
Jianjie Fang, Xvyuan Liu, Ziyou Wang, Rongze Tang, Zhaolu Wang, Zhuohang Li, Xin Zhang, Haisheng Su, Chen Gao, Wei Wu, Xinlei Chen, Yong Li
任务设定
训练动作条件下的世界模型视频生成器
痛点动机
均匀 MSE 训练让背景像素主导梯度,动作因果区域反而欠优化
解决方案
对比有无动作条件的预测差异,在线定位因果动作效应区域并据此重加权训练损失
7
Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li
任务设定
将真实室内场景重建为可编辑的 3D 物体资产集合
痛点动机
真实拍摄常有遮挡和几何缺失,难满足现有方法苛刻输入要求
解决方案
先解析场景图并逐实例生成完整资产,再用 VLM 策略 GizmoAct 闭环调整摆放位置
8
Joonghyuk Shin, Yicong Hong, Jaesik Park, Xun Huang
任务设定
测试视频世界模型能否追踪未观测的隐藏状态
痛点动机
视觉逼真度不代表模型真正维护了世界隐状态
解决方案
设计动作条件的猜牌任务,发现只有跨块保持并更新状态的架构(负特征值线性注意力、TTT )能外推,纯 KV 缓存式 Transformer 无法追踪。
9
Ziliang Xiong, Henglin Shi, Per-Erik Forssen
任务设定
多视角 2D 热图三角化恢复 3D 人体姿态
痛点动机
热图坍缩成单峰会丢失遮挡下的多峰分布信息
解决方案
提出 MEOM 目标,用全热图定位各视角概率质量一致的 3D 关节,并用 HDR 校准 评估热图可靠性
10
Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau
任务设定
针对具身智能体的图像式 3D 视觉定位任务
痛点动机
现有基准忽略时序顺序与观测对齐,定位不准确
解决方案
用体素记忆筛选多视角证据,渐进式语言-体素融合做粗到精推理定位
11
Minhas Kamal, Hiranya Garbha Kumar, Mahedi Kamal, Balakrishnan Prabhakaran
任务设定
面向 3D 场景的物体级网格泼溅重建与编辑任务
痛点动机
整体化重建缺少物体级结构,遮挡区域网格保真度低
解决方案
先分割物体并修复背景,再用网格泼溅分别重建后合成场景
12
Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen
任务设定
长时程具身导航与开放式问答任务
痛点动机
VLM 推理强但导航执行脆弱,导航模型缺乏持续任务级推理
解决方案
提出 NavMCP 框架,用 VLM 智能体调度导航基座模型执行闭环子目标,三通道积累记忆实现持久具身交互
13
Youngchae Chee, Hosu Lee, Sungjune Park, Junho Kim, Yong Man Ro
任务设定
跨视角(第一/第三人称)视频动作表征学习
痛点动机
现有方法将视角无关与视角相关语义纠缠,专门去纠缠的模型也难幸免
解决方案
提出 PRISM ,将视频分解为视角不变与视角相关隐变量,在语言监督下重组以促进解耦
14
Botong Zhao, Fang Yu, Tim, Senhua Zhu, Xinyuan Chen, Yue Lu
任务设定
视觉-语言-动作( VLA )机器人策略学习
痛点动机
行为克隆表征未显式建模场景演化,轨迹质量参差未加区分利用
解决方案
结合 JEPA 式多时间尺度对齐与分布价值评论家,用流匹配按优势条件生成动作
15
Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu
任务设定
面向灵巧操作的自我进化通用世界模型
痛点动机
现有世界模型未将动作与预测评估形成闭环
解决方案
单一共享权重模型兼任策略、模拟器与评估器,形成闭环自我进化
16
Jiahao Wu, Jie Liang, Die Hu, Jiayu Yang, Kaiqiang Xiong, Xiang Li, Xiaoyun Zheng, Chao Wang, Ronggang Wang
任务设定
长序列复杂运动的自由视角视频重建
痛点动机
现有方法逐点追踪长时运动,易造成时序不稳定和伪影
解决方案
用时间条件锚点组织高斯基元,配合时间窗口激活和多级锚点特征保稳定
17
Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh
任务设定
免训练修正 VLA 模型部署时的执行失败
痛点动机
策略权重难以随时微调,动作幅度偏差难纠正
解决方案
把人类语言反馈转成动作幅度的附加调整,无需改动策略权重
18
Yafei Zhang, Nan Wu
任务设定
构建模块化潜在世界-动作模型用于紧凑机器人策略
痛点动机
原始 LaWAM 模型各组件耦合紧密,难以替换与部署
解决方案
拆分为策略适配器、世界解码器与流匹配动作专家,换用更小骨干网络性能几乎不降
19
R. James Cotton, J. D. Peiffer, Lucinda Williamson, John Leske, Georgios Pavlakos
任务设定
从单张 RGB 图像回归生物力学关节角度
痛点动机
现有人体网格恢复方法输出角度非生物力学定义,难满足临床分析需求
解决方案
在 SAM-3D-Body 基础上加装生物力学预测头,用逆运动学优化结果蒸馏训练
20
Daeyun Shin, Yunhan Zhao, Shu Kong, Alexander C. Berg, Charless Fowlkes
任务设定
多人第一视角(egocentric)3D 人体姿态估计
痛点动机
他人的第三人称观测稀疏、间歇且可靠性不稳定,难以融合
解决方案
提出扩散模型融合头部运动与他人观测,按可靠性动态加权
21
Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li
任务设定
实时流式交互世界模型的长时程一致生成
痛点动机
自回归长时程生成难同时保持场景几何、动态一致性与相机控制
解决方案
提出几何感知记忆(patch-memory)与静态-动态解耦表示,结合两阶段蒸馏实现分钟级实时生成
22
Hai Nguyen-Truong, Tuan-Anh Vu, Dang Huynh
任务设定
用冻结世界模型引导视频生成器提升物理合理性
痛点动机
视频生成器常出现悬浮、轨迹违反重力等物理错误,现有修正方法开销大
解决方案
推理时利用 V-JEPA 2.1 惊讶能量梯度,在采样中途注入修正,引导轨迹更符合物理
23
Xinyao Qin, Linxiang Peng, Youbao Ye, Di Yang, Jiangtao Wang
任务设定
无监督骨骼动作时序分割
痛点动机
空间掩码与离散量化结合易导致动作边界处编码抖动
解决方案
提出关节级结构化丢弃与掩码感知速度损失,解耦空间推断与时间平滑
24
NeoteAI Team, Fudan TEAI Team
任务设定
构建触觉赋能的具身操作基础设施与数据集
痛点动机
现有操作数据集缺乏大规模同步视触觉数据
解决方案
打造视触觉采集系统及 3 万小时数据集 NeoData,训练可迁移的触觉表征模型 NeoForce
25
Hongbo Gao, Zeyu Ni, Xin Wen, Siyu Xu, Ruifeng Li
任务设定
冻结 VLA 策略执行操作时缺乏任务进度跟踪
痛点动机
开环执行易将失败动作误判为已完成,导致状态错误累积
解决方案
提出成就锚定记忆,凭物理证据验证子目标后才推进进度,实现闭环执行
26
Fabio F. Oberweger, Michael Schwingshackl
任务设定
将 JEPA 世界模型的隐空间规划扩展到点云几何观测
痛点动机
点云稀疏、无序且自遮挡,隐空间预测能否成立尚不明确
解决方案
把三种经典 JEPA 架构(冻结编码器/分布先验/动作敏感)迁移到点云,验证其规划能力与图像基线相当,动作敏感模型表现最强
27
Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang
任务设定
稀疏视角下的 3D 高斯泼溅场景重建
痛点动机
视角监督分布不均,导致过拟合与几何伪影
解决方案
提出相机势场量化监督缺口,引导虚拟视角采样与保守高斯更新
28
Juhwan Song, Heejung Kim, Juntae Noh, Jonghak Ryu, Huiju Park, Junseong Lee, Dohyeon Ahn, Byungwoo Jo
任务设定
站立测量足压体态并驱动 3D 人体化身评估
痛点动机
传统按增益把角度映射到骨架不够精确
解决方案
用同一测量函数同时评估真人与化身姿态,求解至二者一致,脊柱角度误差显著降低
29
Jin Hyuk Cho
任务设定
构建训练视频生成模型的火柴人动作数据集
痛点动机
视频生成模型训练迭代慢、数据难获取、评测粗放
解决方案
发布小型合成动作数据集,含骨骼关节、深度等标注辅助精细评测
30
Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti
任务设定
智能体在陌生环境中进行视觉语言导航并持续探索
痛点动机
现有场景表示难以同时支持语义记忆与探索引导
解决方案
提出认知图场记忆融合场景图与语义前沿场,构建闭环导航框架
31
Yanchen Huo, Ziying Song, Yadan Luo
任务设定
JEPA 世界模型中预测未来潜在状态序列
痛点动机
自回归预测误差累积,且对视觉噪声敏感
解决方案
提出 Flow-JEPA ,用条件流匹配联合生成未来潜在轨迹替代逐步回归
32
Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao
任务设定
机器人导航世界模型的实时规划与控制
痛点动机
生成模型与规划器流形不对齐,需解码像素才能评估候选动作,拖慢实时性
解决方案
提出 Hydra ,用离散隐空间规划统一视觉/位姿/动作表征,再以流匹配生成连续执行轨迹
33
Giuseppe Stracquadanio, Kevin Raj, Julia Grabinski, Stefan Roth
任务设定
前馈式 3D 场景重建与未观测视角生成
痛点动机
现有方法难以兼顾外推视角合理性与几何一致性
解决方案
结合 3D 高斯溅射与多视角潜在扩散模型联合优化外观和深度
34
Yunge Wen
任务设定
从情感文本联合生成人体姿态、光照与相机配置
痛点动机
现有生成方法独立建模各要素,难以协同表达叙事情感
解决方案
从绘画重建 SMPL 人体及光照相机参数建数据集,训练 flow-matching 模型生成 3D 场景编排
35
Tianyi Wang, Jiazhou Chen, Yiming Xu, Xiangyu Li, Tianyi Zeng, Chih-Hsien Chou, Ning Lu, Liang Peng, Junfeng Jiao, Christian Claudel
任务设定
评估世界模型生成视频的 3D 场景一致性
痛点动机
现有基准缺乏统一 3D 协议,难分重建与生成误差
解决方案
构建 RoboPhys-3D 基准,用同一 3D 重建流程处理生成与真实视频,提出 RoboPhyscore 等指标
36
Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi
任务设定
人形机器人根据语音实时生成同步手势
痛点动机
数据稀缺、模态遮蔽和 sim-to-real 安全差距三大难题
解决方案
用分层语义-声学对齐器提取音频线索,以扩散 Transformer 流式生成手势,MPC 保障安全执行