1
Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang
任务设定
构建开源可扩展的长时程 视频世界模型 训练框架
痛点动机
异构数据源与视频骨干架构难以统一训练和复现
解决方案
统一数据引擎整合 1.43M 片段,结合 三阶段训练 实现分钟到小时级实时交互
2
Aidan Bradshaw, Marco Giordano, David Rode, Andreas Habersack, Elif Basokur, Annika Kruse, Markus Tilp, Michele Magno, Peter Wolf, Luca Benini, Christoph Leitner
任务设定
单手机摄像头视频估计运动员 人体质心 轨迹
痛点动机
现有 3D 姿态/网格恢复方法笨重,难以在训练场单机部署
解决方案
融合轻量 2D 姿态网络 与蒸馏单目深度网络,靠解剖先验实现度量级质心估计
3
Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Linh-Huynh, Minh-Triet Tran
任务设定
从单张广播画面实现运动员米制世界坐标定位
痛点动机
超高分辨率画面尺度差异大,透视畸变导致误差
解决方案
提出边界感知自适应切片解决尺度问题,用两点关键点姿态估计+相机标定射线投射,将 2D 地面投影提升为 3D 坐标
4
Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid
任务设定
机器人策略学习中的世界动作模型,联合预测动作与观测
痛点动机
现有世界动作模型仅用 RGB,缺乏 3D 几何信息
解决方案
复用预训练视频扩散模型,引入深度预测实现 3D 感知的动作与观测联合建模
5
Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li
任务设定
视觉-语言导航:智能体依指令在陌生环境中导航
痛点动机
现有方法依赖高开销记忆(地图/历史帧/3D 工具)且需大量步骤级监督数据
解决方案
提出 LookStep 框架,用语言驱动的未来状态建模和事件驱动滚动记忆实现高效端到端导航
6
Alexey Potapov
任务设定
构建迷宫世界模型基准,测试 Transformer 动态预测
痛点动机
需区分模型是记住特定迷宫还是学到可迁移动态
解决方案
提出伪视频空间记忆 Transformer ,用二维隐空间随动作更新状态
7
Chuhan Zhang, Seiji Ito, Kenta Hoshino, Satoshi Ikehata, Ikuro Sato
任务设定
世界动作模型通过生成视觉未来来解码机器人动作
痛点动机
候选未来预测质量参差不齐,多采样未必更可靠
解决方案
提出自验证测试时规划框架 WCD ,用生成信号给候选未来排序,并用真实反馈在线校准选择器
8
Param Thakkar, Parsika Paresh Shah, Manisha Sushant Gote
任务设定
物体中心操作任务中的世界模型状态预测
痛点动机
整体重预测浪费算力且会放大误差
解决方案
仅用变化门控+残差头预测发生变化的物体,参数量减少超 10 倍
9
R. James Cotton, Divya Joshi, Colleen Peyton
任务设定
婴儿视频的无标记 3D 姿态估计,评估神经运动健康
痛点动机
姿态基础模型多基于成人训练,婴儿人工评估耗时且主观
解决方案
用 Sapiens 2 生成伪标签做跨模型蒸馏,配合可微渲染器微调 SAM 3D Body 模型