Daily Paper Feed

2026 年 09 月 04 日 星期五 · 共 24 篇相关论文 · 全部存档
1

Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States

Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy
任务设定 构建统一多模态模型实现 3D 世界生成与重建
痛点动机 现有方法依赖外部离线模块,难保证物理一致性
解决方案 联合建模物理、几何、外观三种世界状态,配合 Omni-Camera 统一相机表示实现闭环交互式世界探索
2

Adaptive Vision-Language Grasping via Composable Foundation Priors and Generalizable Grasp Synthesis

Sixu Yan, Shikang Wang, Binhua Huang, Xuanlai Tang, Guohua Fan, Fan Huang, Haoxuan Li, Yongkang Li, Yuhan Li, Bencheng Liao, Zeyu Zhang, Wenyu Liu, Hangxin Liu, Xinggang Wang
任务设定 跨机械手通用的视觉-语言抓取生成任务
痛点动机 现有方法基础模型与抓取策略强耦合,难以跨手迁移
解决方案 解耦物理抓取合成与任务理解,基础模型提供可组合先验实现免重训练自适应抓取
3

The Blind Spot in 2D Infants' Pose Estimation:Robust Learning from Noisy Annotations

Emanuele Cardinale, Marco Proietti, Alessandro Cacciatore, Maria Francesca Spadea, Lucia Migliorelli, Sara Moccia
任务设定 研究早产儿 2D 姿态估计中的标注噪声问题
痛点动机 遮挡和看护干扰使婴儿关键点标注易出错,影响神经发育评估
解决方案 提出 REMIND 方法,用关键点训练动态聚类筛选可靠标签,实现无噪声训练
4

WorldReward: Reward Modeling for Camera-Conditioned World Models

Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang
任务设定 相机条件世界模型统一评估动作一致性与视觉质量
痛点动机 几何奖励评不了画面质量,图像奖励又抓不到动作执行效果
解决方案 VLM 做成对偏好打分,视频切块对齐动作再逐块投票聚合
5

Sparse auto-regressive modeling for scene generation from multi-view images

Thomas Lucas, Maxime Pietrantoni, Philippe Weinzaepfel, Wonjune Cho, Bardienus Pieter Duisterhof, Vincent Leroy, Jerome Revaud
任务设定 从稀疏多视角图像补全生成完整 3D 场景
痛点动机 前馈重建只能还原可见内容,稠密 3D 生成又受限于算力和数据稀缺
解决方案 体素对齐稀疏 3D 隐空间中用掩码自回归 Transformer 预测缺失体素
6

OctWorld: Long-Range World-Consistent Video Generation with Octree-Based 3D Mapping

Zelong Lv, Sicheng Xu, Jianfeng Xiang, Ruicheng Wang, Yue Dong, Yu Deng, Guangzhong Sun, Jiaolong Yang
任务设定 沿相机轨迹从单图生成长距离世界一致的可探索视频
痛点动机 长距离生成重访已生成区域时空间一致性极难保持
解决方案 提出 OctMap,用动态稀疏八叉树融合 TSDF 实现持久化 3D 记忆
7

GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs

Junqing Du, Fernando Ropero, Erkin Turkoz, Yanfeng Zhang, Lu Liu
任务设定 提升多模态大模型的 3D 空间推理能力
痛点动机 MLLM 几何测量、视角转换、细粒度定位不稳,微调成本又高
解决方案 免训练框架借助 3D 场景图提供符号几何、鸟瞰布局和自我中心视觉锚定
8

FWBC-VLA: Force-Aware Whole-Body Compensation for Contact-Rich Loco-Manipulation

Yutian Zhang, Siyuan Ma, Liwen Yang, Yang Li, Ce Hao, Haozhen Chi, Dong We, Qiaojun Yu, Dibo Hou
任务设定 轮腿式机器人接触丰富的腿臂协同操作力感知控制
痛点动机 VLA 模型无法感知交互力,全身控制又分不清任务力与外部扰动
解决方案 提出无传感器残余力矩估计器,将接触信息注入 VLA 动作专家指导全身补偿
9

VI3: Grounding Pretrained 3D Foundation Models with Inertial Cues

Ernesto Lozano, Alberto Jaenal, Javier Civera
任务设定 为预训练 3D 基础模型恢复真实度量尺度
痛点动机 单目图像无法感知度量尺度,导致位姿深度预测失真
解决方案 IMU 预积分得到尺度参考,锚定 3D 基础模型的位姿与深度输出
10

Rethinking World Models for Safety-Critical Embodied Systems

Kailang Ma, Heye Huang, Inhi Kim, Kitae Jang
任务设定 面向安全关键具身系统重新审视世界模型设计
痛点动机 高预测精度和视觉保真度不等于支持安全决策的证据
解决方案 提出风险感知世界模型(RIWM),整合反事实推理、情景记忆与运行时安全保障
11

Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning

Yijun Yang, Shenghe Zheng, Wenbo Li, Jianhui Liu, Haoze Sun, Yanbing Zhang, Jiaxiu Jiang, Lin Song, Haoyang Huang, Nan Duan, Lei Zhu
任务设定 提升 VLM 对 3D/4D 空间的几何推理能力
痛点动机 VLM 只学 2D 投影,难以恢复深度和时序一致性
解决方案 提出 FactoSR 框架,将空间推理拆成平面对应、深度一致、时序可逆三个子目标,用强化学习联合优化
12

Do Video Generators Track the World Across Segments? A Benchmark and Method for World-State Reasoning in Video Continuation

Yingmao Miao, Pengfei Zhang, Chaoran Xu, Meng Yu, Jing Tang, Xiangxiang Chu, Chao Shen, Chenhao Lin
任务设定 评测视频生成模型能否在续写中正确追踪世界状态
痛点动机 历史帧信息难以直接转化为准确的世界状态
解决方案 提出 Stateagent,显式维护实体状态表示并据此渲染指导帧生成视频
13

Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations

Onat Şahin, Mohammad Altillawi, George Eskandar, Carlos Carbone, Ziyuan Liu
任务设定 稀疏视角下 3D 场景表示的伪影修复与几何先验学习
痛点动机 现有生成式修复方法依赖昂贵的逐场景成对数据重建
解决方案 提出 3D 形态扰动,对高斯基元做缩放旋转剪枝实现免优化正则化,提升机器人操作策略成功率
14

FailBench: How Reliable are VLMs at Judging Robot Task Success?

Zaruhi Navasardyan, Tatul Danielyan, Hrant Davtyan
任务设定 评测 VLM 判断机器人操作任务成败的可靠性
痛点动机 现有失败检测基准跨领域泛化证据不足,模型偏向误判成功
解决方案 构建含 14 个来源 2197 次操作的 FailBench ,测试 13 个 VLM 检测器表现
15

SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving

Jinyang Wang, Shiwei Li, Junjian Wang, Zhiqiang Deng, Jianbin Gao, Yihang Zhao, Liu Liu, Yongjia Zhao, Jinlong Chen, Huirui Xu, Yifeng Pan, Kangwei Liu, Fan Ren, Ji Tao, Minghao Yang
任务设定 端到端自动驾驶的高效环视世界-动作模型
痛点动机 单前视相机世界模型限制变道合流等安全操作的空间覆盖
解决方案 环视视频预测做训练监督,推理时舍弃视频分支仅保留动作分支
16

Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving

Zhaoxin Fan, Tianbao Zhang, Wenjun Wu, Xiaofeng Wang, Yeying Jin, Jian Zhao, Zheng Zhu, Shuicheng Yan
任务设定 自动驾驶中兼顾长时预测与实时决策的分层世界模型
痛点动机 同一时间尺度联合预测难以兼顾长时预判与实时响应
解决方案 慢-快分层架构:慢模型预测多步未来表征,快模型用光流动态潜变量做单步动作生成
17

Toward Physically Grounded JEPA World Models for Goal-Conditioned Robotic Planning

Muyuan Liu, Yue Huang, Zheng Liang, Xiang Gao
任务设定 面向目标条件机器人规划的物理落地 JEPA 世界模型
痛点动机 纯潜空间预测未显式保留与控制相关的信息
解决方案 加入逆动力学状态对齐辅助目标,提升潜变量对物理状态和动作的表征
18

Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation

Haoyu Wang, Songchun Zhang, Haoran Li, Haoyang Huang, Zeyue Xue, Nan Duan
任务设定 面向世界模型预训练的动作条件视频数据构建
痛点动机 真实视频难获取与动作精确对齐的大规模标注数据
解决方案 基于虚幻引擎两阶段流水线采集轨迹并离线渲染,生成含人形角色的多视角动作条件视频
19

BRIDGE: An Open-Source Humanoid Platform via Morphology-Control Co-Design for Physical AI

Jianren Wang, Letian Qian, Zikai Wang, Weiwei Wu, Junjie Zong, Abhinav Gupta, Deepak Pathak
任务设定 形态-控制协同设计开发类人机器人平台
痛点动机 硬件与控制割裂,导致动作难以拟人流畅
解决方案 提出形态-控制协同设计框架联合优化机身与策略,发布开源人形机器人 Bridge 及控制策略
20

Air-Ground Collaborative Vision-and-Language Navigation via Shared Bird's-Eye Maps

Shuning Zhang, Liang Li, Yunheng Wang, Tao Wang, Yihang Kang, Renjing Xu
任务设定 研究无人机与无人车协同的视觉-语言导航
痛点动机 现有方法缺乏协作机制,直接通信反而降低性能
解决方案 用无人机视角构建共享鸟瞰地图标注车辆与目标,实现免训练空地协同导航
21

Mudragen: Geometrically Supervised Generation of Interacting Two-Hand Mudras for Preserving Indian Classical Dance Heritage

Jagadish Kashinath Kamble, Jayanta Mukhopadhyay, Debaditya Roy, Partha Pratim Das
任务设定 生成印度古典舞双手 Mudra 手势图像
痛点动机 手势数据稀缺,梵文描述不精确导致文生图效果差
解决方案 提出几何感知扩散模型,用关键点、偏移与形状一致性约束生成协调的双手姿态
22

RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning

Howard Qian, Yiting Chen, Yunfei Xie, Kejia Ren, Podshara Chanrungmaneekul, Gaotian Wang, Bowen Wen, Chen Wei, Kaiyu Hang
任务设定 互联网视频中检索人类演示以训练灵巧机器人策略
痛点动机 机器人真实数据采集昂贵,难以覆盖长尾操作任务
解决方案 学习基于 3D 手部轨迹的自身中心潜在运动空间,支持跨视角、大规模检索
23

VeriPhy: Agentic Physical Reasoning for World Model Evaluation and Refinement

Wenzhuo Xu, Yuchen Zhu, Chongjian Ge, Xuan Shen, Jing Shi, Jason Kuen, Yongxin Chen, Molei Tao, Christopher McComb, Noelia Grande Gutiérrez, Jiuxiang Gu
任务设定 评估生成视频是否符合物理规律的自动化验证系统
痛点动机 视频质量评分无法定位违反物理规律的具体环节
解决方案 文本规划器生成可执行验证计划,调用专家模型逐项核验并给出可追溯依据
24

Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies

Yue Yang, Diego Romeres, Chiori Hori, Gedas Bertasius, Daniel Szafir, Siddarth Jain
任务设定 提升 VLA 机器人策略在传感器失效下的鲁棒性
痛点动机 有限演示数据易致模态纠缠,传感器损坏时策略失灵
解决方案 提出证据门控正则化,按任务相关性约束单模态一致性与不变性