1
Dairu Liu, Zekun Qi, Jiayu Zeng, Ruixi Yu, Yu Guan, Yintianrun Zhang, Xuchuan Chen, Sikai Liang, Zekai Li, Chenghuai Lin, Xinqiang Yu, Wenyao Zhang, He Wang, Li Yi
任务设定
评估类人机器人运动跟踪质量的基准与指标
痛点动机
现有运动学误差忽略接触伪影,测试集也不够多样
解决方案
收集 153 小时动作数据,训练偏好对齐的 HumanScore 指标
2
Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao
任务设定
用智能体玩家评测长时程交互世界模型
痛点动机
固定动作序列难以公平比较不同模型达成同一长时目标的能力
解决方案
让多模态智能体追求指定目标,在几何一致性等 4 个维度打分,含 171 个场景
3
Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao
任务设定
交互式世界模型的长时程记忆与生成
痛点动机
上下文或 KV 缓存随时长增长,记忆与会话长度难以兼顾
解决方案
用外部相机索引场景状态库存储记忆,稀疏注意力教师蒸馏出三步学生模型
4
AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao
任务设定
交互式长时程世界模型生成技术报告升级版
痛点动机
条件信号需要在潜空间和时序结构上与生成内容对齐
解决方案
改用流式三维点缓存渲染空间记忆,条件统一编码进因果 VAE 潜空间
5
DreamX Team, Rui Chen, Xiangxiang Chu, Geng Li, Jifan Li, Qingfeng Shi, Datao Tang, Jing Tang, Jun Wang, Pengfei Zhang
任务设定
面向机器人操作的动作条件视频世界模型
痛点动机
逼真的视频回放仍可能动错手臂或丢失被操作物体
解决方案
用 PRoPE 编码保持双臂位姿准确,结合深度分支与 SAM3 保持物体一致
6
Imtiaz Ul Hassan, Tasweer Ahmad, Nik Bessis, Ardhendu Behera
任务设定
区分外观相似的细粒度人体动作
痛点动机
RGB 丢失关节几何,骨架又丢失空间细节,各有短板
解决方案
融合 RGB、姿态热图与骨架图,用交叉注意力和稀疏专家路由结构化融合
7
Avinash Kori, Fabrizio Russo
任务设定
从因果视角统一梳理世界模型
痛点动机
现有世界模型缺乏统一的因果理论框架
解决方案
提出因果世界模型,连接因果表征学习、物体中心学习与结构因果模型
8
Yukun Dai, Mingzhe Dai, Tianshi Wang, Fengling Li, Jingjing Li, Lei Zhu
任务设定
评估 VLA 模型在多任务操作中的对抗鲁棒性
痛点动机
已有攻击只针对单任务,多任务 VLA 的跨任务漏洞未被探索
解决方案
用可微渲染优化单个 3D 对抗纹理,跨任务诱导目标动作偏移
9
Gehan Zheng, Matthew Johnson-Roberson, Weiming Zhi
任务设定
接触前预判机器人操作是否会失败
痛点动机
接触发生后才检测失败为时已晚,腕部相机视角尤其受限
解决方案
用动作条件潜在世界模型预测接触后果,提前触发中止信号
10
Shivam Vats, Sudarshan Harithas, Mete Tuluhan Akbulut, Arvind Raghunathan, George Konidaris
任务设定
在有限练习预算下学习序列化机器人操作技能
痛点动机
需合理分配预算,兼顾技能可学性与任务长期回报
解决方案
提出 Deliberate Practice 算法,用双线性规划求解预算最优的技能练习分配
11
Vayalet Stefanova, Diwas Lamsal, Margot Genbrugge, Maxim Yudayev, Christian Schlenstedt, Moran Gilat, Bart Vanrumste, Benjamin Filtjens
任务设定
居家场景下用第一视角视觉检测帕金森步态冻结
痛点动机
单纯惯性信号难区分动作停顿意图与病理性冻结
解决方案
对比预训练第一视角视频模型与 IMU 时序网络,发现视觉可补充情境信息辅助判断
12
Mallika Garg, Debashis Ghosh, Pyari Mohan Pradhan
任务设定
动态手势识别任务的高效网络架构设计
痛点动机
CNN 感受野有限,Transformer 全局建模但计算开销大
解决方案
提出卷积-Transformer 统一模型,金字塔式降维结构兼顾局部与全局特征
13
Weitao Chen, Hu Jiaxin, Xie Tianyidan, Yang Li, Yuyi Qian, Banghao Xu, Ziheng Tang, Shenyi Wang, Mingyue Yu, Duo Li, Jiacheng Shi, Gao Wang, Zhan Xu, Zhicheng Qiu, Xuanfu Li, Jian Yang, Lanjun Wang, Zili Yi
任务设定
提出 月级第一视角视频 长期时空记忆理解基准
痛点动机
现有基准缺乏跨天时空连续性,难以评估长期记忆能力
解决方案
收集 20 人 300 小时 第一视角 日常视频,设计 14 项认知任务评测长期记忆
14
Nico Heider, Michał Jan Włodarczyk, Katarzyna Wasielewska-Michniewska, Przemysław Hołda, Martin Schieck, Marcin Paprzycki, Maria Ganzha, Bogdan Franczyk
任务设定
为 具身智能体 空间推理提供真实场景仿真环境
痛点动机
合成环境语义可查但不真实,真实重建环境逼真却缺语义标注
解决方案
提出 语义辐射场,融合 2D 语义分割与 3D 辐射场,支持渲染、语义及空间查询
15
Dingyi Rong, Yue Shi, Chaofan Ma, Jiezhang Cao, Zongrui Wang, Zeyu Zhang, Yao Mu, Guangtao Zhai, Ning Liu
任务设定
评测人到机器人操作视频生成的跨本体迁移
痛点动机
机器人示范数据稀缺,人手与末端执行器差异大
解决方案
构建 H2R-Bench 基准,从五维度评估视频世界模型生成质量
16
Tianye Qi, Tengyue Zhang, Jiaying Ying, Tianqing Zhu, Xin Yu
任务设定
统一健全、残肢与假肢的 2D 姿态估计
痛点动机
现有姿态数据集偏向健全人,假肢结构表征不足
解决方案
提出 ProPose 基准及数据扩增,用 ProLoss 约束关键点依赖防幻觉
17
Tianyu Sun, Zhoujie Fu, Zihui Gao, Bang Zhang, Guosheng Lin
任务设定
预测人机物体交接中的意图与交接时机
痛点动机
真实人机交接数据稀缺,且存在仿真到真实差距
解决方案
构建 Hand2Bot 数据集,用 PassGen 扩散模型生成含真实噪声的交接视频
18
Andela Ilic, Rachel Schuchert, Yijing Jiang, Christian Holz
任务设定
从单张第一人称图像估计手物接触与作用力
痛点动机
现有方法只能定位接触区域,缺乏力度真实标注
解决方案
提出 EgoPHI ,用物理仿真生成力监督,联合估计接触图与 3D 力分布
19
Joyjeet Singh
任务设定
探究潜在世界模型长时程规划失效的根源
痛点动机
预测本身仍准确,但规划目标函数在远距离时失真甚至反向
解决方案
无需重训练仅替换规划目标,成功率从 26%升至 98%
20
Zekai Li, Yihao Liang, Hongfei Zhang, Jian Chen, Yesheng Liang, Zhijian Liu
任务设定
自动驾驶 VLA 模型的实时推理加速
痛点动机
视觉编码、语言预填充、推理生成、去噪四阶段均存在计算冗余
解决方案
算法-系统协同设计( KV 缓存复用、推测解码、自适应步缓存),提速 4.7 倍且精度不变
21
Bing Zhan, Shuyao Shang, Jiahao Gu, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Lue Fan, Zhaoxiang Zhang
任务设定
自动驾驶规划任务,融合 VLA 语义推理与世界模型动态预测
痛点动机
两者直接融合时,语义捷径会压制预测性动态信息
解决方案
提出 BrainWAM 框架,将两者转为动作导向通路,在动作空间层面对齐协调
22
Ruting Cheng, Boyuan Feng, Chuhui Qiu, Joaquin A. Calderon, Qing Pan, Yufan Liu, James K. Hahn
任务设定
验证手机摄影测量 3D 扫描测量人体围度的准确性
痛点动机
商用深度传感器扫描仪成本高,需评估手机方案的可靠性
解决方案
用 PolyCam 手机扫描对比 Fit3D 深度扫描仪,评估孕妇人体测量一致性
23
Zhou Chen, Sathyanarayanan N. Aakur
任务设定
具身智能体根据功能查询主动探索并定位物体
痛点动机
固定视角下功能线索常被遮挡,难以判断可供性
解决方案
提出 FUSE 框架,结合不确定性驱动探索与学习式视角规划器高效选点
24
Le Zhang, Ke Sun
任务设定
长时程第一视角视频的记忆问答与证据检索
痛点动机
现有索引缺乏上下文、检索又忽视问题的时间意图
解决方案
提出 EgoCITE ,用上下文增强索引与时间感知检索构建多粒度记忆
25
Vladyslava Rudas, Dmytro Kuzmenko
任务设定
评估 VLM 从机器人第一视角判断人际距离危险等级
痛点动机
安全具身导航需视觉与情境推理,现有模型能力不明
解决方案
对比多种 VLM 的提示策略与 QLoRA 微调,发现分类正确不代表空间定位准确