Daily Paper Feed

2026 年 09 月 03 日 星期四 · 共 9 篇相关论文 · 全部存档
1

SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models

Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang
任务设定 构建开源可扩展的长时程 视频世界模型 训练框架
痛点动机 异构数据源与视频骨干架构难以统一训练和复现
解决方案 统一数据引擎整合 1.43M 片段,结合 三阶段训练 实现分钟到小时级实时交互
2

MuyBridge: Mobile Human Center-of-Mass Estimation from Monocular Video via Sparse Fusion

Aidan Bradshaw, Marco Giordano, David Rode, Andreas Habersack, Elif Basokur, Annika Kruse, Markus Tilp, Michele Magno, Peter Wolf, Luca Benini, Christoph Leitner
任务设定 单手机摄像头视频估计运动员 人体质心 轨迹
痛点动机 现有 3D 姿态/网格恢复方法笨重,难以在训练场单机部署
解决方案 融合轻量 2D 姿态网络 与蒸馏单目深度网络,靠解剖先验实现度量级质心估计
3

A Top-Down Framework for Metric-Scale Athlete Localization from Single Broadcast Frames

Thanh-Khoi Nguyen, Hoang-Phuc Nguyen, Linh-Huynh, Minh-Triet Tran
任务设定 从单张广播画面实现运动员米制世界坐标定位
痛点动机 超高分辨率画面尺度差异大,透视畸变导致误差
解决方案 提出边界感知自适应切片解决尺度问题,用两点关键点姿态估计+相机标定射线投射,将 2D 地面投影提升为 3D 坐标
4

Spatially Aware World Action Model via Geometric Latent Diffusion

Javier Alejandro Lopetegui Gonzalez, Paul Pacaud, Cordelia Schmid
任务设定 机器人策略学习中的世界动作模型,联合预测动作与观测
痛点动机 现有世界动作模型仅用 RGB,缺乏 3D 几何信息
解决方案 复用预训练视频扩散模型,引入深度预测实现 3D 感知的动作与观测联合建模
5

LookStep: Efficient Vision-Language Navigation with Linguistic Foresight and Event Driven Memory

Kun-Yang Yu, Yingzhe Li, Hongyu Xu, Shi-Yu Tian, Zhi Zhou, Yang Chen, Ming Yang, Sheng Wang, Qing Yu, Lan-Zhe Guo, Yu-Feng Li
任务设定 视觉-语言导航:智能体依指令在陌生环境中导航
痛点动机 现有方法依赖高开销记忆(地图/历史帧/3D 工具)且需大量步骤级监督数据
解决方案 提出 LookStep 框架,用语言驱动的未来状态建模和事件驱动滚动记忆实现高效端到端导航
6

AGI Maze Prediction Datasets: A Compact Benchmark for Learning World Dynamics with Transformers

Alexey Potapov
任务设定 构建迷宫世界模型基准,测试 Transformer 动态预测
痛点动机 需区分模型是记住特定迷宫还是学到可迁移动态
解决方案 提出伪视频空间记忆 Transformer ,用二维隐空间随动作更新状态
7

World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models

Chuhan Zhang, Seiji Ito, Kenta Hoshino, Satoshi Ikehata, Ikuro Sato
任务设定 世界动作模型通过生成视觉未来来解码机器人动作
痛点动机 候选未来预测质量参差不齐,多采样未必更可靠
解决方案 提出自验证测试时规划框架 WCD ,用生成信号给候选未来排序,并用真实反馈在线校准选择器
8

Modeling What Changes: Sparse, Residual World Models for Object-Centric Manipulation

Param Thakkar, Parsika Paresh Shah, Manisha Sushant Gote
任务设定 物体中心操作任务中的世界模型状态预测
痛点动机 整体重预测浪费算力且会放大误差
解决方案 仅用变化门控+残差头预测发生变化的物体,参数量减少超 10 倍
9

Cross-Model Distillation of a Human-Pose Foundation Model from Unannotated Infant Video for Markerless 3D Pose Estimation

R. James Cotton, Divya Joshi, Colleen Peyton
任务设定 婴儿视频的无标记 3D 姿态估计,评估神经运动健康
痛点动机 姿态基础模型多基于成人训练,婴儿人工评估耗时且主观
解决方案 Sapiens 2 生成伪标签做跨模型蒸馏,配合可微渲染器微调 SAM 3D Body 模型