Daily Paper Feed

2026 年 09 月 09 日 星期三 · 共 71 篇相关论文 · 全部存档
1

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah
任务设定 杂乱室内环境中人形机器人的全身导航
痛点动机 2D 路径规划难以应对全身级避障与协调运动
解决方案 提出全身视觉-语言-动作模型 TANGO ,仿真合成数据训练后零样本部署到真实 G1 机器人
2

SyncWorld: Visual Calibration Enables World Models as Zero-Shot Simulators

Yuncong Yang, Zhengtao Han, Furkan Ozyurt, Zeyuan Yang, Han Yang, Junyi Cao, Haoyu Zhen, Yilun Du, Chuang Gan
任务设定 世界模型成为跨环境零样本机器人仿真器
痛点动机 同一数值动作在不同视觉环境下表现各异,泛化差
解决方案 视觉标定片段建立动作-视觉映射,实现无需额外训练的新环境泛化
3

Point4D: Long-range 4D Motion Reconstruction

Minsik Jeon, Jay Karhade, Deva Ramanan, Shubham Tulsiani
任务设定 长视频序列的 4D 重建与逐点长程运动跟踪
痛点动机 现有 4D 方法仅支持几十帧短窗口,长视频易失效
解决方案 提出 3D 查询式运动解码器,解耦轨迹预测与可见性,实现数百帧长程跟踪
4

DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination

Yankai Fu, Ning Chen, Junkai Zhao, Heng Zhang, Guocai Yao, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang
任务设定 接触丰富场景下灵巧操作的视觉-语言-动作建模
痛点动机 视觉遮挡与复杂接触动力学让现有 VLA 模型难以应对
解决方案 提出 DeCAL ,通过自适应视触觉融合门控和视触觉潜在共想象建模物理动态
5

GoDeep: Annotation-Free Open-Vocabulary 3D Scene Understanding via Language-Space Lifting

Thodoris Betsas, Anastasios Doulamis, Andreas Georgopoulos
任务设定 无需标注的开放词汇 3D 场景理解与分割
痛点动机 CLIP 特征直接提到 3D 空间易出现词袋式语义偏差
解决方案 视觉语言模型生成结构化文本描述,直接聚合到纯语言嵌入空间,无需 3D 训练语料
6

FIRE3D: Feed-forward Interactive 3D Scene Reconstruction Within A Minute

Hongchi Xia, Tianhang Cheng, Wei-Chiu Ma, Shenlong Wang
任务设定 从单张 RGB 图像/视频秒级重建可交互 3D 场景
痛点动机 现有方法耗时优化,物体难以物理解耦以供交互
解决方案 前馈网络直接预测每个物体的位姿、网格与纹理,一分钟内生成仿真就绪场景
7

ArmPoser: Real-Time, Calibration-Free Arm Pose Estimation from Smartwatch IMU

Bishnu Dev, Vasco Xu, Xi-Aan Loh, Chenfeng Gao, Henry Hoffmann, Karan Ahuja
任务设定 仅用单个智能手表 IMU 实时估计手臂姿态
痛点动机 传统方法依赖校准姿势,易受漂移和误差影响
解决方案 在手表原生传感器坐标系下直接训练,免校准且适配不同佩戴方式
8

Hi-FLoop: Hierarchical State-Feedback Loops for Multi-Timescale World Modeling

Rx Fan, Zhan H
任务设定 多智能体交通场景的长时域闭环仿真世界模型
痛点动机 长时域生成难以兼顾多时间尺度的一致性与适应性
解决方案 提出分层状态反馈框架,用目标多时间尺度分支逐级反馈生成状态
9

CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation

Tinghe Ding, Jiahao Li, He Wang
任务设定 多阶段机器人操作任务的策略学习
痛点动机 动作块跨多个阶段,但标签仅描述首步,语义粗糙
解决方案 用 VLM 切分演示阶段,蒸馏动作块级语义目标指导策略训练
10

From Where to How: Continuous 4D Interaction Forecasting from Egocentric Video

Qiaohui Chu, Haoyu Zhang, Meng Liu, Haoxiang Shi, Dongmei Jiang, Liqiang Nie
任务设定 第一视角视频预测未来交互位置与全身动作
痛点动机 语义理解难转化为精确 3D 定位,且动作多样性与结构一致性难兼顾
解决方案 提出 HIGFlow 级联框架,先定位交互点,再用残差流匹配生成全身动作
11

GOLF: Global Observation with Local Focus for Calibration-Aware Stereo Interaction Field Estimation

Minqiang Zou, Riqiang Jin, Zhi Lv, Dong Luo, Lianghai Tian, Zhenyu Zhao, Qi Xu, Tong Wu, Mochen Yu, Yao Tang
任务设定 自我中心双目视角估计手-物交互场
痛点动机 需同时兼顾全局场景语境与局部精细手物证据
解决方案 融合 DINOv3 全局特征、局部采样证据与 Plücker 射线几何联合解码
12

CLAMP: Constrained Decoding for Vision-Language Embodied Planning

Tianyi Ma, Parisa Kordjamshidi
任务设定 具身规划中让 VLM 生成可执行动作序列
痛点动机 VLM 计划常引用未观测物体或违反动作约束,导致不可执行
解决方案 用场景证据构造解码时约束,结合 HMM 世界状态前瞻剔除不可行候选
13

AURORA: Active Uncertainty-Driven Re-Orientation for In-Hand Reconstruction

Feiyu Zhao, Yuetong Li, Chenxi Xiao
任务设定 主动重定向实现机器人手持物体的 3D 重建
痛点动机 机器人抓握时视觉遮挡严重,物体表面难以完整观测
解决方案 Ray-GPIS 沿视线估计各方向重建不确定性,据此规划手内旋转动作暴露未观测区域,并结合无 CAD 的位姿跟踪融合 RGB-D 数据渐进重建
14

ReMoMask-2: Latent Retrieval-Augmented Masked Motion Generation

Yiran Wang, Zeyu Zhang, Ling Shao, Hao Tang
任务设定 文本驱动的人体动作生成( T2M )任务
痛点动机 检索证据与生成器隐空间存在语义鸿沟,检索粒度粗糙
解决方案 在生成器预量化隐空间内重建检索库,蒸馏投影器对齐文本查询
15

CoVeR: Coverage-Based Token Pruning for Multi-View 3D Reasoning in VLMs

Nhat-Tan Bui, Varshini Elangovan, Arun Reddy Anugu, Sreyas Mohan, Wei Ye, Dilin Wang, JQ Huang, Rakesh Ranjan, Aviral Chharia, Fernando De la Torre
任务设定 多视图 3D 场景推理下的视觉 token 剪枝任务
痛点动机 现有剪枝方法丢失空间覆盖,导致 3D 推理性能下降
解决方案 提出 CoVeR ,按坐标选覆盖全场景的 token ,训练无关且预算可控
16

VeriScene: Reconstructing Crime Scenes from Legal Evidence via World-Model Agent

Kevin Chuanpu Fu, Yongsen Zheng, Zee Kin Yeong, Kwok-Yan Lam
任务设定 融合法律证据重建犯罪现场并生成再现视频
痛点动机 原始证据直接喂世界模型会丢信息、动作违背记录
解决方案 智能体编排世界模型,融合证据生成可追溯叙事并做物理验证
17

RoboCousin: Build Your Own Simulation Playground for Robust Bimanual Robotic Manipulation

Jingxuan Zhu, Jingyi Li, LiangLiang Chen, Zhiyuan Jing, Jidong Zhang, Hongming Li
任务设定 双臂机器人操作的仿真数据生成平台
痛点动机 真实采集昂贵,现有仿真资产库难以扩展新物体场景
解决方案 将用户观测自动转为仿真资产,构建数字孪生变体生成专家轨迹
18

Supervised Cross-Modal Feature Alignment for Zero-Wearable Freezing of Gait Detection in Parkinsonism

Aryan Singh, Chandan Biswas
任务设定 无需穿戴设备的帕金森步态冻结检测
痛点动机 转身时骨骼关键点易被自遮挡,视觉检测精度下降
解决方案 用 IMU 数据蒸馏引导视觉模型,跨模态对齐提升遮挡下检测精度
19

ActionSplice: In-Flight Action Editing for Interactive World Models

Pardis Taghavi, Tingyu Guo, Jonas Lossner, Gaurav Pandey, Reza Langari
任务设定 交互式视频世界模型推理中实时切换动作条件
痛点动机 换动作需等待下一 chunk 或触发昂贵的回滚重算
解决方案 提出反事实状态迁移,用轻量校正器把中断状态迁移到新动作对应状态,冻结模型且无需重算已完成步骤
20

3DWay: Generalizing Robot Manipulation via 3D Consistent Waypoints

Ziqin Huang, Yingyue Li, Chenyangguang Zhang, Ruida Zhang, Yuxin Chen, Gu Wang, Xingyu Liu, Masayoshi Tomizuka, Xiangyang Ji
任务设定 让 VLM 为机器人操作预测 3D 一致路径点
痛点动机 2D 图像空间轨迹存在深度歧义,限制 3D 空间推理
解决方案 先生成多视角一致的 2D 路径点,再通过几何三角化得到 3D 路径点,保留预训练 VLM 先验
21

WorldAgen: Unified State-Action Prediction with Test-Time World Model Training

Chi Wan, Kangrui Wang, Yuan Si, Pingyue Zhang, Manling Li
任务设定 让 VLA 模型在部署时适应新环境动态变化
痛点动机 现有方法只做静态预训练,无法应对环境动态偏移
解决方案 共享 Transformer 双头联合预测状态与动作,用测试时训练在线更新世界模型
22

DISEIL: Demonstration Distillation for Sample-Efficient Imitation Learning

Suyog Khanal, Arun Kumar A, Santu Rana
任务设定 交互式模仿学习中自动决定该请求怎样的示教
痛点动机 以往方法只判断何时打断,示教内容仍随意选取
解决方案 几何特征将失败聚类成失效模式,用 VLM/LLM 生成针对性示教请求
23

DriveMotion: A Large-Scale Multi-Source Benchmark for Driver Motion Sequence Modeling and Forecasting

Yuhang Wang, Chuheng Wei, Jingxin Yang, Xishun Liao, Hao Zhou
任务设定 预测车内驾驶员的连续身体运动
痛点动机 现有数据集多为短片段分类,缺乏连续运动预测基准
解决方案 构建 393 小时多源数据集,提出动态锚定评估聚焦机动前后关键动作
24

SynthGait-19K: A Physically Grounded Synthetic Video Dataset for Gait Parameter Estimation

Soroush Mehraban, Xin Lei Lin, Vida Adeli, Majid Mirmehdi, Amirhossein Dadashzadeh, Clint Hansen, Andrea Iaboni, Babak Taati
任务设定 从单目视频估计临床步态参数
痛点动机 真实步态数据规模小、视角单一,限制模型泛化
解决方案 SMPL 驱动合成 19272 段步态视频,训练 GaitXFormer 等模型
25

Flexible Motion Generation from Language and Style References

Kai Weixian Lan, Bodie Criswell, Briana Fedkiw, Zhan Zhang, Joseph Teran, Daniel Holden
任务设定 根据文本和风格参考生成人体运动
痛点动机 文本难以描述动作的细粒度风格,如节奏与力度
解决方案 联合训练风格编码器与文本到运动扩散模型,支持长时多风格生成
26

A Black-Box Adversarial Attack on Human Pose Estimation and Keypoint-Based Action Recognition Models

Kacper Mroczek, Michal Kepski
任务设定 研究人体姿态估计与关键点动作识别的黑盒对抗攻击
痛点动机 传统边界框式反馈无法衡量关键点姿态的退化程度
解决方案 提出 OKS Attack ,以目标关键点相似度作为反馈信号,直接攻击姿态关键点空间结构
27

Zero-Shot Sim-to-Real Contact-Rich Assembly via Proprioception-Anchored Cross-Modal Pretraining

Yuhan Wang, Yurou Chen, Hongye Jiang, Wenzhao Lian
任务设定 接触式装配任务的零样本仿真到真实迁移
痛点动机 视觉与力/力矩测量存在仿真-真实差距,策略难迁移
解决方案 提出 PACE 编码器,用本体感觉监督视觉和力矩表征,抑制域相关噪声
28

CosmoH2G: A Hand-to-Gripper Transfer Dataset and Baseline Method for Object Manipulation with Complex Spatial Movements

Hongxiang Zhao, Mutian Xu, Zeyu Jin, Yiming Hao, Shuguang Cui, Xiaoguang Han
任务设定 把人手复杂空间抓取动作迁移到机器人 夹爪
痛点动机 现有方法难以处理旋转、翻转等复杂空间轨迹
解决方案 构建大规模手-夹爪配对数据集,两阶段框架先预测关键帧再生成连续动作序列
29

Self-Supervised Multi-View 3D Gaze Target Estimation via Probabilistic Ray Marching

Keqi Chen, Vinkle Srivastav, Nicolas Padoy
任务设定 多视角图像自监督估计 3D 注视目标 位置
痛点动机 现有方法只能估计 2D 注视点且依赖真实场景标注
解决方案 3D 注视向量 构建光线锥,概率光线投射 估计空间似然分布
30

Social Intuition vs. Machine Reasoning: Anticipating Human-Robot Interaction from multiple modalities

Raphael Lorenzo-Louis, Bertrand Luvison, Serena Ivaldi
任务设定 姿态/视频预测人是否想与服务机器人互动
痛点动机 人机交互意图预测对社交机器人而言仍很具挑战性
解决方案 对比人类标注者、轻量姿态模型视觉语言模型在 HUI360 数据集上的预测表现
31

PV-WM: A Heterogeneous Micro-Macro World Model for Articulated Pedestrian-Vehicle Co-Rollout

Haozhuang Chi, Jingsong Liang, Ziying Song, Lei Yang, Shihao Li, Haoruo Zhang, Chen Lv
任务设定 联合预测行人姿态车辆运动的场景演化
痛点动机 现有方法要么忽略行人关节动作要么忽略车辆未来运动
解决方案 提出异构世界模型 PV-WM ,循环推演行人根节点、15 个关节姿态与车辆状态
32

World Models Under Asynchronous Sensor Observations

Akash Anand, Abhay Anand, Yash Vishe
任务设定 研究世界模型在异步传感器观测下的预测建模
痛点动机 真实传感器采样率不一致,插值或降采样都会丢失信息
解决方案 零阶保持读数,并加入陈旧度和待刷新时间作为 Transformer 世界模型的输入特征
33

LightSplat: Real-Time High-Fidelity 3D Gaussian SLAM with Loop Closure

Junze Bao, Ye Gao, Yiming Huang, Xiaolong Yu, Chen Dong, Qing Gao, Wei Wang, Jinhu Lü
任务设定 实时 3D 高斯泼溅 SLAM 的稠密场景重建与回环检测
痛点动机 现有 3DGS SLAM 系统难以兼顾实时性地图一致性
解决方案 稀疏特征实现快速跟踪,双线程构建高斯子地图,特征加速配准实现在线回环校正
34

MV-STRIDE: Enabling MLLMs to Master Multi-View Spatial Reasoning via Hierarchical Capability Modeling

Jin Xu, Xiaojian Huang, Zhuodong Luo, Zhihong Zhang, Xin Liu, Jiansheng Wei, Xinzhi Wang, Jie Zhao, Xuejin Chen
任务设定 构建多视角空间推理数据集提升 MLLM 的 3D 场景理解
痛点动机 现有数据集缺乏结构化 3D 认知路径,多视角空间推理薄弱
解决方案 分层建模感知、场景理解与复杂推理的依赖关系,配合思维链监督训练
35

Ambient @ EgoLongQA 2026: Distilling Long-Video perception into a Sub-2B Model

Logesh Kumar Umapathi
任务设定 十分钟第一视角视频的多选问答任务
痛点动机 智能体流程虽准确但参数量大,难以在端侧部署
解决方案 把大模型感知模块知识蒸馏进 2B 视觉语言模型,单次前向完成推理
36

NutriBench-Kitchen: Benchmarking Embodied AI for Nutrition Management

Yulin Wei, Xiangchen Wang, Jianhui Pan, Jinyu Xiao, Zheng Tan, Ruozai Tian, Guanhua Chen, Feng Zheng
任务设定 评测具身智能体在厨房中的营养管理能力
痛点动机 现有基准不测试食材状态的持续跟踪与知识推理
解决方案 提出 NutriBench-Kitchen 基准,并设计带长时记忆的 Nutri-Vgent 智能体
37

From LLM-Generated Specifications to Learned Quadruped Locomotion

Merve Atasever, Keyan Azbijari, Cagan Bakirci, Alfredo Reina Corona, Tolga Izdas, Richard Yang, Erdem Biyik, Jyotirmoy V. Deshmukh
任务设定 用 LLM 生成规范训练四足机器人步态策略
痛点动机 手工设计奖励函数依赖专家经验、难保证效果
解决方案 LLM 生成 PSTL 时序逻辑模板,结合专家轨迹筛选后转为奖励,用 PPO 训练
38

Ambient @ EgoProactive 2026 : Proactive Egocentric Assistance with Visually Grounded Supervision

Logesh Kumar Umapathi
任务设定 判断可穿戴设备何时该主动介入提醒用户
痛点动机 标注数据稀缺,介入时机难以准确判断
解决方案 将介入时机转为单 token 分类,用视频智能体生成额外监督信号
39

One for All: Generalist Foundation Model for Cross-Sensor Skeleton Representation Learning

Jeonghyeok Do, Yun Chen, Munchurl Kim
任务设定 跨传感器统一学习人体骨骼动作表征
痛点动机 不同传感器关节数、拓扑各异,难共享模型
解决方案 可学习关节槽统一维度,配合语义关节嵌入对齐骨架
40

Large Discrete Policy: Advancing Explicit Behavior Modeling with Stochastic Iterative Scoring

Zhenxin Li, Nadine Chang, Xinglong Sun, Jingde Chen, Wenhao Yao, Zi Wang, Maying Shen, Yu-Gang Jiang, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez
任务设定 提出离散化行为策略,用于自动驾驶与机器人操作等决策任务
痛点动机 连续生成式策略可解释性差,易产生不合理动作
解决方案 通过随机迭代打分在大规模候选动作库中逐步筛选,兼顾表达力与可解释性
41

MEMOBench: A Process Level Memory Benchmark for Robotic Manipulation

Haiyang Sun, Haoxiao Wang, Junming Chen, Weicheng Fang, Zihao Su, Jingkun Yi, Wenyou Yi, Hao Chen, Zhou Zhao
任务设定 面向机器人操作的过程级记忆评测基准
痛点动机 现有 VLA 评测依赖任务成功率,混淆遗忘与操作失败
解决方案 标注存储/更新/压缩三类记忆操作,细粒度评估策略的记忆能力
42

GIFT: Goal-Injected Fine-Tuning for Efficient Manipulation Policy Adaptation

Xiaoyuan Fang, Shuo Feng, Yuxuan Wang, Enhua Cheng, Peng Zhou, Piji Li
任务设定 面向 VLA 模型的目标图像引导式微调,提升操作策略性能
痛点动机 现有基础模型因训练成本高,未系统引入目标图像条件
解决方案 零初始化卷积渐进注入生成的目标图像特征,实现轻量高效微调
43

Mind the Phase: Effective Rank and Representation Health in Legged Locomotion

Felipe Tommaselli, Thiago H. Segreto, Juliano D. Negri, Ricardo V. Godoy, Marcelo Becker
任务设定 研究腿式机器人运动策略的内部表征质量
痛点动机 策略表征难理解,缺乏训练期预测硬件表现的信号
解决方案 按步态相位分析策略雅可比有效秩,据此改进使 Spot 机器人关节抖动降低约 3 倍
44

Joint-Conditioned Stereo Surface Reasoning for Interaction Field Estimation

Yanlin Jin, Yifan Yang, Bowen Yang, Kai Zhu
任务设定 从立体视频估计手-物体交互场(关节到表面最近点)
痛点动机 遮挡和局部图像证据不足使关节级表面定位困难
解决方案 提出 JSSR 框架,联合预测 3D 关节与交互场,结合跨视角候选搜索和残差门控修正
45

Noisy-Space Policy Gradient for Diffusion Policies in Offline Reinforcement Learning

Mahmoud Selim, Cristina Cipriani, Karl H. Johansson
任务设定 离线强化学习中训练扩散策略做连续控制
痛点动机 扩散策略与 RL 结合缺乏严谨的价值函数定义
解决方案 提出噪声空间 Q 函数噪声空间策略梯度,避免对去噪过程反向传播
46

Contextual Observer Grounding: Evaluating Situated Spatial Reasoning in Vision-Language Models

Mimo Shirasaka, Haochen Zhang, Yonatan Bisk
任务设定 评估 VLM 在具身场景中从说话者视角推理空间关系
痛点动机 现有 VLM 能否像人一样推断说话者视角尚不清楚
解决方案 构建 POVBench 基准,用 3D 场景和多视角图像测试观察者视角定位能力
47

Generalist Open-World Temporal Perception

Cristian Sminchisescu
任务设定 构建通用开放世界时序感知系统
痛点动机 现有视频生成模型缺乏显式的几何语义时序结构
解决方案 提出以多模态世界模型为核心的感知范式,融合几何、语义与交互结构
48

Diagnosing and Dynamically Filtering Occupancy World Models for Active Mapping

Jiahui Zhang, Gongbo Liang, Yu Zhang
任务设定 研究占据世界模型误差如何影响机器人主动建图
痛点动机 占据预测误差会同时改变探索目标和可达路径,但影响未被充分诊断
解决方案 对比不同占据表示做诊断,提出动态过滤策略结合在线观测抑制虚假占据
49

MemCorr-DP: Counterfactual Correspondence Conditioning for a Diffusion Policy Guided by a Reference

Tan Su, Haoxiang Yang, Ruxin Wang, Binghui Xie
任务设定 物体位置和相机视角同时变化时的机器人视觉运动策略泛化
痛点动机 参考轨迹含可迁移几何信息,但需与当前场景对齐且保持敏感
解决方案 RoMa v2 匹配构建 3D 对应关系,结合反事实配对目标训练扩散策略
50

Learning to Use Imagination: Progress-Conditioned Future Utilization for World Action Models

Yijie Zhu, Zitong Yu, Wei Li, Hui Ma, Wen Li, Rui Shao, Liqiang Nie
任务设定 世界动作模型中如何自适应利用想象未来来指导动作生成
痛点动机 现有方法固定利用想象特征,忽略执行进度变化带来的干扰线索
解决方案 提出 ProWAM ,用双时间尺度进度编码器和层级化调制模块按阶段自适应利用想象
51

One MLLM, One Call: Efficient Zero-Shot Vision-and-Language Navigation via Spatial-Aware Waypoints

Shiqi Pan, Qi Zheng, Hanqin Sun, Youjian Zhang, Daquan Feng, Xu Wang
任务设定 连续环境中零样本视觉语言导航( VLN-CE )
痛点动机 现有方法依赖路点预测器或多次调用大模型,延迟高
解决方案 候选路点标记在图像上,单次 MLLM 调用选目标,再用 FMM 规划器避障导航
52

CST-WM: A Causally Structured World Model for Embodied Visual Tracking

Junyi Hu, Shuaihang Yuan, Yi Fang
任务设定 具身视觉跟踪任务,预测目标未来可观测性以规划动作
痛点动机 动作条件预测易产生因果幻觉,误导跟踪决策
解决方案 提出因果结构化世界模型,分离目标/机器人/观测分支阻断虚假因果,结合模型预测控制规划
53

IM-ENGINE: Image Editing for Embodied Data Generation

Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan
任务设定 图像编辑生成可执行的机器人操作训练数据
痛点动机 人类演示成本高有具身差距,仿真数据又缺语义
解决方案 编辑渲染场景注入任务语义,借助仿真先验恢复 3D 状态并物理精修,生成抓取与目标轨迹
54

MobileVLA-R1 2.0: RL-Enhanced Reasoning for Mobile Robot Control

Ting Huang, Yue Huang, Zeyu Zhang, Shuicheng Yan, Hao Tang
任务设定 移动机器人的语言指令导航与操作控制
痛点动机 高层语义推理与底层运动控制之间存在脱节
解决方案 思维链监督与强化学习耦合推理和动作,配推理条件化动作解码器输出可执行指令
55

From Gaze to Meaning: A Training-Free AI Agent for Unified Grounding and Explanation

Shayan Nasiriboukani, Sara Atito, Mohammad Nezamipour, Muhammad Awais
任务设定 无训练地联合完成注视目标预测与语义解释
痛点动机 现有方法依赖大量监督训练且可解释性差
解决方案 利用预训练视觉语言模型加视觉引导提示与记忆检索机制推理注视目标
56

PhysWeep: Does a Video Generator Realize the Physics You Ask For?

Rasul Khanbayov, Hasan Kurban
任务设定 审计视频生成模型是否真正实现指定物理参数
痛点动机 现有合理性评分测不出错误物理量下的以假乱真视频
解决方案 把生成器当黑盒,从像素中反推物理参数并与请求值量化对比
57

PASTEL: Panoramic Alignment for Monocular 4D Scene Reconstruction

Yuankun Yang, Yi Wei, Bo Bai, Wenyang Zhou, Li Zhang
任务设定 单目视频重建 4D 场景,含相机视野外区域
痛点动机 现有方法无法恢复相机视野之外的不可见区域
解决方案 提出全景场景对齐,把 3D 不可见区域探索转化为 2D 方向轨迹规划,结合生成先验补全场景
58

LayerRoute: Action-Conditioned Mixture-of-Layers Routing for Vision-Language-Action Policies

Zheng Lu, Haoran Liao, Wanqi Zhong, Yunhe Ni, Lijie Wang, Xingjie Fan, Zhisheng Chen, Yantang Qu, Meijia Chen, Tianyu Xin, Zirui Song, Yiming Li
任务设定 研究 VLA 策略如何自适应利用 VLM 多层视觉语义特征
痛点动机 现有方法固定分配 VLM 层,动作中间状态未显式复用
解决方案 提出 LayerRoute 动态路由 VLM 层并复用动作状态,提升操作性能
59

DriveZero: End-to-End Driving Beyond Human Demonstrations

Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu, Jinke Li, Haochen Tian, Zhenwei Shen, Hongyang Li, Zhichao Li, Yunchen Yang, Bochao Huang, Siyu Zhang, Kuangye Chen, Xiongjie Zhang, Wentao Dai, Hengchen Dai, Siyuan Liu, Zehao Huang, Naiyan Wang
任务设定 端到端自动驾驶中超越人类示范数据学习驾驶策略
痛点动机 模仿学习受限于人类日志的质量与行为覆盖范围
解决方案 拆分感知与动作模型,用闭环强化学习训练教师策略并蒸馏为纯视觉规划器
60

FineHOI: Part-Aware Dense Representations for Zero-Shot Human-Object Interaction Detection

Francesco Tonini, Lorenzo Vaquero, Mohammad Mahdi Derakhshani, Cees Snoek, Elisa Ricci, Cigdem Beyan
任务设定 零样本人体-物体交互(HOI)检测
痛点动机 全局特征压缩交互线索,难以做细粒度空间推理
解决方案 部件级注意力分解人和物体,经区域感知 Transformer 融合生成交互表示
61

PAI-Actor: Cinematic Multi-Character Replacement in Dynamic Scenes

Bangxun Tang, Heyuan Gao, Yiren Song, Guian Fang, Zijian He, Jie Yang, Mike Zheng Shou
任务设定 电影动态场景中的多角色替换与动画生成
痛点动机 需在替换角色同时保持原始运动、镜头与光影一致
解决方案 将任务建模为结构引导的人体恢复问题,用双向到自回归蒸馏实现高清长视频生成
62

UniFusion: Sparse-View 4D Reconstruction via Unified Spatio-temporal Depth Alignment

Yongzhe Lyu, Shaofei Wang, Yixin Chen, Siyuan Huang
任务设定 从稀疏视角视频进行 4D 场景重建
痛点动机 单目深度在跨视角、跨时间预测不一致,重建困难
解决方案 时空神经场统一对齐深度,提升动态高斯溅射重建的几何一致性
63

Learning Counterfactual World Models for Embodied Reasoning under Partial Observability

Todd Y. Zhou, Daniel Zhang
任务设定 研究具身智能体在部分可观测环境下的世界模型学习
痛点动机 预训练表征只优化感知相似性,导致反事实坍塌无法区分干预后果
解决方案 提出反事实潜在世界模型,用对比目标区分不同干预的后果
64

SeRV: Semantic-Aligned Residual Vector Quantization for American Sign Language Generation

Hongyu Wu, Xu Wu, Tianhao Wu, Jiawei Yu, Phuc Nguyen, Jian Liu, Yi Wu
任务设定 根据文本生成 3D 美国手语( ASL )动作
痛点动机 现有分词器只优化重建,缺语义监督导致动作与文本对不齐
解决方案 提出 SeRV 语义对齐残差向量量化分词器,配合分层 GPT 由粗到细生成动作 token。
65

Time-Aware Assistive Navigation

Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar
任务设定 面向视障人士的第一视角实时辅助导航指令生成
痛点动机 现有 MLLM 缺乏时机把控,指令过早或过晚都影响体验
解决方案 构建大规模基准,监督模型预测指令背后原因,提升实时响应能力
66

SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution

Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo, Bo Dai
任务设定 生成多样、可仿真的室内 3D 场景用于具身智能
痛点动机 智能体式方法逼真但耗时,参数化方法快但物理不合理
解决方案 先用图像先验生成初始场景,再由 VLM 智能体分块局部演化优化
67

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao et al. (15 additional authors not shown)
任务设定 面向机器人操作任务世界-动作模型预训练与扩展
痛点动机 现有 WAM 多依赖预训练视频生成器,预训练与扩展规律尚不明确
解决方案 从零训练控制导向自编码器与单步视觉规划器,结合行为对齐优化联合训练
68

An overview of 3D Vision-Language Models

Márcus Lobo, Vitor Matias, Afonso Paiva, Jeová Farias, Tiago Novello, Moacir Ponti
任务设定 综述 3D 视觉-语言模型的原理与应用
痛点动机 传统 3D 深度学习模型难以支持跨模态检索与开放词汇识别
解决方案 系统梳理对比学习对齐、3D 高斯泼溅语言引导及具身智能应用
69

SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

Cheng Yin, Wang Xu, Junpeng Yang, Sikyuen Tam, Hanyu Liu, Yuan Yao, Xiangrui Zeng, Junbo Cui, Yequan Wang, Zhouping Yin, Yankai Lin
任务设定 长时程机器人操作设计历史记忆机制
痛点动机 现有记忆压缩方法需提前决定保留信息,但不知未来任务需求
解决方案 保留完整历史视频序列直接输入 VLA 骨干,用 flow-matching 动作头解码,无需专门记忆模块
70

ECHO: Dyadic 3D Facial Motion Generation with Asymmetric Deterministic Articulation and Stochastic Reaction

Zhuoqiang Cai, Yujie Sun, Chaoyue Niu, Hongyun Yu, Zhiwen Chen, Chengfei Lv, Fan Wu
任务设定 双人对话场景下生成 3D 面部动作
痛点动机 说话动作确定、倾听反应却一对多,难统一建模
解决方案 将动作拆分为确定性说话锚点随机倾听残差,用 Motion Memory 正则化微调
71

ARC-Bench: Closed-Loop Replanning Masks Broken Action Ranking in Frozen JEPA World Models

Zhengshu Zhang, Zhiyuan Li
任务设定 评测 JEPA 世界模型在导航、操作任务中的动作排序能力
痛点动机 潜空间距离能否代表真实代价排序从未被验证,闭环重规划掩盖了排序失效
解决方案 提出 ARC-Bench 无泄漏固定候选协议,审计发现冻结 JEPA 世界模型排序严重失效