Daily Paper Feed

2026 年 09 月 02 日 星期三 · 共 18 篇相关论文 · 全部存档
1

Selective Agent Guidance via Entropy: Learning Autonomous Policies from Imperfect VLM Teachers

Matteo Merler, Giovanni Bonetta, Davide Zago, Rossella Cancelliere, Bernardo Magnini
任务设定 利用 VLM 教师辅助训练自主强化学习策略
痛点动机 VLM 每步查询成本高,直接当策略又无法自我提升
解决方案 仅在策略不确定时查询 VLM ,按环境优势加权蒸馏其建议到轻量 RL 策略
2

H3-World: Turning Language Understanding into World Control

Danze Chen, Zeqing Wang, Ziyue Lin, Xingyi Yang, Yeying Jin
任务设定 把大型视频生成模型改造成交互式世界模型
痛点动机 现有语言控制粗糙,缺乏精确的时序动作控制能力
解决方案 时序注意力路由对齐角色/相机指令与视频片段,仅需轻量 LoRA 微调
3

What, Where, and How: Probing Spatiotemporal Representations in Video Foundation Models

Sharon S. Musa, Fereshteh Forghani, Harrish Thasarathan, Sonia Joseph, Matthew Kowal, Konstantinos G. Derpanis
任务设定 探究视频基础模型内部表征编码了哪些时空概念
痛点动机 尚不清楚视频模型各层学到了什么、如何几何组织
解决方案 用轻量探针分析 V-JEPA 2 等模型对相机运动/物理/异常的编码,并做样条式表征引导
4

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

Jaewoo Park, Minyoung Lee, Sukmin Seo, Moonbin Yim, Hyunwook Yoon, Dohoon Ryu, Daehee Kim, Myungseo Song, Jihyuk Byun, Seunggyu Chang, Taeho Kil, Jiseob Kim, Bado Lee, Geewook Kim
任务设定 评测多模态大模型作为无人机视觉-语言-动作智能体的能力
痛点动机 现有系统过度限制模型决策空间,具身能力未被充分检验
解决方案 提出 DroneCATS-Agent 架构与基准,在接近、跟踪、搜索、编队指挥等任务中测试模型自主决策
5

EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents

Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang
任务设定 统一编排、训练与部署 VLA 机器人智能体
痛点动机 长时程任务需感知规划执行验证协同,非仅动作预测
解决方案 将技能决策视为执行提案,运行时校验前提并验证结果,用 Qwen3-VL+pi0.5 实例化
6

Seeing the World and the Self from Egocentric Video

Kai Guan, Minchao Jiang, Ruichen WangLi, Wentao Zhu, Lei Zhang
任务设定 第一视角视频联合重建场景与佩戴者全身运动
痛点动机 场景重建忽略人体,运动估计又缺场景几何且依赖外部轨迹
解决方案 几何基础模型估计相机与场景,条件扩散模型生成人体运动,再闭环运动学精修
7

REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs

Riyaaz Shaik, Chandru Venkataraman
任务设定 VLA 模型从演示中学习可复用的运动技能库
痛点动机 现有 VLA 模型是整体式输出动作,长时程任务表现差且难解释
解决方案 世界模型结合行为等价核聚类运动片段,生成类型化 lambda 程序驱动动作解码器
8

Dyn-3D: Unveiling and Resolving Ego-Motion Ambiguity in Vision-Language Models

Jiayu Ding, Zhuodong Liu, Lei Zhang, Manyu Xiong, Hongbo Jin, Haoran Tang, Hongbo Zhang, Changen Zhu, Wenbo Xing
任务设定 评估 VLM 在动态 3D 场景中的自运动感知能力
痛点动机 大位移下空间推理严重退化,模型只学到平滑轨迹先验
解决方案 提出反事实渲染基准 Dyn-3D ,并用 TempoVista 框架把物理真值嵌入策略优化训练
9

CQF-HMR: Continuous Quaternion Flows for Probabilistic 3D Human Mesh Recovery from a Single Image

Cuong Le, Bao-Long Tran, Pavlo Melnyk, Tahereh Dehdarirad, Bastian Wandt, Mårten Wadenbäck
任务设定 单张图像的概率性 3D 人体网格恢复
痛点动机 深度信息缺失导致姿态存在多解歧义, SMPL 旋转空间难建模
解决方案 提出四元数约束连续归一化流,基于 2D 姿态生成多个合理 3D 姿态假设
10

VerNav: Verifier-First Low-Latency Vision-and-Language Navigation

Zhixin Wang, Chengzheyi Yao, Leyuan Liu, Xiaosong Zhang, Yongzhao Zhang
任务设定 基于 LLM 的视觉语言导航( VLN )任务
痛点动机 逐步自回归推理导致决策延迟累积,难以实时导航
解决方案 提出 Verifier-First 框架,用批量动作验证替代自回归生成,仅对不确定情况调用生成器,延迟降低 10 倍以上
11

Towards Generalizable Visually Grounded Exploration of Household Devices

Linhao Zheng, Zeming Liu, Wangke Chen, Li Zeng, Wanxiang Che, Heyan Huang, Yuhang Guo
任务设定 评测 VLM 能否无手册探索操作家用设备
痛点动机 现有具身探索依赖模仿学习,泛化能力差
解决方案 提出 VGEBench 基准,用状态机模拟多轮交互测试视觉 grounding 能力
12

VOIM: Training-Free Open-Vocabulary 3D Instance Mapping for RGB-D and Monocular SLAM

Sangmin Song, Sarath Kodagoda, Marc G. Carmichael, Karthick Thiyagarajan, Amal Gunatilake, Kelly Prentice, Jodi Martin
任务设定 从 RGB-D 或单目视频构建开放词汇 3D 实例地图
痛点动机 在线 SLAM 系统常在证据不足时过早提交实例标签
解决方案 提出免训练的体素级实例管理器,延迟标签判定直到多视角证据充分累积
13

Feed-Forward Multi-view Multi-person Reconstruction with Contrastive Human-Aware 3D Representation

Yuanwang Yang, Buzhen Huang, Zongxuan Ren, Jing Huang, Kun Li
任务设定 无约束场景下的多视角多人 3D 人体重建
痛点动机 传统自下而上方法依赖精确标定和跨视角匹配,遮挡下易失败
解决方案 构建统一的实例中心 3D 空间,用对比学习联合标定、匹配与重建,前馈回归 SMPL 参数
14

Streaming4D: Accelerate 4D World Models via Block-wise Video Generation and Incremental Reconstruction

Xiaoyan Liu, Jiaxin Liu, Kangrui Li, Sifan Zhou
任务设定 面向实时交互的 4D 世界模型生成任务
痛点动机 传统方法视频生成与 3D 重建串行执行,导致交互延迟高
解决方案 提出 Streaming4D ,将分块自回归视频生成与增量式 3D 重建并行执行,边生成边重建以降低延迟
15

Potential-Guided Particle Steering for Negation-Constrained Dexterous Grasping

Geonho Kim, SooGon Kim, Jongmin Lee
任务设定 研究带否定约束的语言驱动灵巧抓取(哪里不能抓)
痛点动机 训练数据几乎没有避让指令,模型易把禁止部位误当抓取目标
解决方案 推理阶段用序列蒙特卡洛结合无分类器引导采样,避开禁止区域,无需额外训练数据
16

Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation

Vida Adeli, Soroush Mehraban, Jacob Rommann, Harrison Sanborn, Cole Clifford, Babak Taati
任务设定 生成与语音同步、感知物体的协同手势动作
痛点动机 现有语音驱动手势方法忽略姿态约束与物体空间关系
解决方案 因果隐空间扩散模型编码手势基元,结合姿态和物体几何条件生成手势
17

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

Xionghao Wu, Yijun Yang, Shiyang Zhou, Haoze Sun, Jianhui Liu, Songsong Yu, Jiyao Zhang, Wenbo Li, Bo Wang, Guoqing Ma, Lin Song, Renjie Liao, Shenghe Zheng, Wei Tang, Xiaojuan Qi, Yanwei Li, Yuan Zhang, Zhuotao Tian, Haoyang Huang, Nan Duan
任务设定 从大规模第一视角视频中学习可泛化的世界动作模型做机器人操控
痛点动机 带动作标签的机器人轨迹数据稀缺昂贵,难以覆盖多样场景
解决方案 三阶段课程训练+慢快双系统架构,把视频动力学迁移到目标机器人,实现 30 Hz 实时控制
18

IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training

Rongze Tang, Jianjie Fang, Zhaolu Wang, Ziyou Wang, Xvyuan Liu, Haisheng Su, Xin Zhang, Wei Wu, Chen Gao, Yong Li, Zhibo Chen
任务设定 训练能建模物体交互的动作条件世界模型
痛点动机 MSE 去噪目标下静态内容主导,交互区域监督不足
解决方案 跨注意力构建交互图,据此重新加权去噪监督