Daily Paper Feed

2026 年 07 月 31 日 星期五 · 共 16 篇相关论文 · 全部存档
1

TurboVLA: Real-Time Vision-Language-Action Model at 32 Hz on an RTX 4090 with <1 GB VRAM

Hengyi Xie, Chenfei Yao, Xianjin Wu, Xuanyang Xi, Yiping Tang, Di Xu, Yingying Zhu, Dingkang Liang, Xiang Bai, Han Ding
任务设定 设计能在消费级 GPU 上实时运行的机器人操作模型
痛点动机 现有 VLA 模型依赖大语言模型中转,推理慢、显存占用高
解决方案 跳过 LLM 中枢,用轻量双向视觉语言交互直接映射到动作, 32Hz、<1GB 显存下仍高精度
2

VidMap: Exploiting Temporal Structure for Video-Based Structure-from-Motion

Zador Pataki, Paul-Edouard Sarlin, Marc Pollefeys
任务设定 对任意无标定长视频恢复相机标定和度量姿态
痛点动机 SLAM 易受初始化影响失败, SfM 又缺乏鲁棒性
解决方案 融合 SLAM 的时序约束与 SfM 的全局优化,结合稠密匹配与单目深度先验做度量重建
3

HumanCLAW: Can Vision-Language Models Act Through a Body?

Siyao Li, Jiawei Gu, Shuai Liu, Kairui Hu, Zekun Li, Linjie Li, Chengcheng Tang, Po-Chen Wu, Ivan Shugurov, Lingni Ma, Michael Zollhoefer, Sizhe An, Abhay Mittal, Amy Zhao, Ranjay Krishna, Manling Li, Ziwei Liu, Chuan Guo
任务设定 评估 VLM 能否通过全身实体执行长时序具身任务
痛点动机 任务失败时难区分是决策错误还是动作执行失误
解决方案 将决策与执行解耦, VLM 只发原子技能指令驱动全身动作,量化模型的具身自我感知能力
4

DLAM: Distributional Latent Actions with Temporal Constraints

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma
任务设定 从无动作标签视频中学习潜在动作辅助机器人策略
痛点动机 确定性潜在动作在递归组合下误差会累积传播
解决方案 对角高斯分布建模每次转移,靠组合与反转约束均值方差,提升时序一致性
5

Mitigating Compounding Error via Video Representation Regularization

Taiye Chen, Qi Zhang, Yisen Wang
任务设定 视频扩散世界模型长程自回归生成易累积误差
痛点动机 误差累积与表征维度坍塌相关,机制此前不明
解决方案 提出视频表征正则化,稳定潜在表征抑制长程误差累积
6

SymmGrid: Super-Scaling On-Robot Learning with Parallelized Symmetries and Egocentric-Exocentric Visual Perception

Gabe Everett, Brice Gunter, Ryan Vander Stelt, Cleiver Ruiz-Martinez, Blake Hull, Juan Rojas
任务设定 真实机器人在线强化学习训练耗时长、收敛慢
痛点动机 样本效率低,第一/第三人称视觉数据利用不充分
解决方案 提出 SymmGrid ,用对称群变换并行增广轨迹数据加速训练
7

From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence

Jia Luo
任务设定 人类演示视频转化为机器人可学习数据
痛点动机 人机具身形态差异大,机器人难直接学习人类视频
解决方案 构建任务图并转为机器人规划图指导视频生成,用物理验证器过滤不合理结果
8

StatePlay: State-Aware Game World Models for Mechanics-Consistent Generation

Zijun Lin, Zeqing Wang, Cheston Tan, Bihan Wen, Yeying Jin
任务设定 让游戏世界模型同时生成画面与内部游戏状态
痛点动机 现有世界模型只求画面真实,常违反游戏机制规则
解决方案 提出 StatePlay ,用混合专家架构联合建模视觉与状态,以状态指导画面生成
9

Genie Sim PanoWorld: An Infinite Indoor 3D World Generation Pipeline via Panoramic Scene Modeling and Simulation

Yongxin Su, Linjie Hou, Feng Wang, Jialin Tang, Zhijun Li, Qian Wang, Maoqing Yao
任务设定 从单张全景图生成可漫游的室内 3D 场景
痛点动机 现有方法难兼顾轨迹可控性与大范围遮挡处理
解决方案 轨迹可控的全景视频扩散模型生成视频,再前馈重建为 3D 高斯场景,可作具身智能仿真资产
10

ContactFlow: A video action conditioning that transfers across embodiments

Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum
任务设定 构建跨具身的机器人操作视频世界模型
痛点动机 现有视频世界模型难建模操作中的接触约束,动作条件局限特定夹爪
解决方案 3D 接触点轨迹 作为通用动作表征,训练跨人类与机器人复用的生成式世界模型
11

Speech2Grasp: Data-Efficient Transfer of Text-Conditioned Grasp Detection to Speech in Humanoid Robots

Hung Nguyen, Kim Nhat Minh Nguyen, Van Duc Vu, Van-Danh Le, Hoang Huy Le, Dinh Tuan Nguyen, Pham Tuyen Le, Van-Truong Nguyen, Quan Nguyen
任务设定 让人形机器人根据语音指令完成抓取检测
痛点动机 现有抓取检测多依赖文本输入,语音更自然但数据稀缺
解决方案 轻量 MLP 投影器把文本条件抓取模型迁移到语音,无需级联 ASR
12

CG-World: A Large-Scale World-State Dataset and Protocol for World Models

Yiming Cai, Fangjie Yu, Meiqing Yu, Ziyue Shi, Pengfei Yuan, Yong Guo
任务设定 构建面向世界模型训练的大规模世界状态数据集
痛点动机 现有视频/机器人数据集只捕捉部分状态,难支撑完整动力学学习
解决方案 从工业 CG 制作流程提取骨骼、动作曲线等多模态状态,含干预/反事实分支,验证 VLA 策略闭环迁移
13

Reinforcement Learning on Cost-Constrained Quadrupedal Hardware

Javier C. Weddington, Bence P. Ölveczky, Stephen A. Baccus
任务设定 低成本四足机器人硬件上的强化学习运动控制
痛点动机 传输延迟和噪声反馈使任务变为部分可观测,拉大 sim-to-real 差距
解决方案 用执行器延迟前向模型配合时间感知网络,学出类中枢模式发生器的鲁棒步态
14

MoSAIC: Aligned Intervention Supervision for Part-Local Motion Style Transfer

Nazanin Amini, Kevin Desai
任务设定 对角色局部身体部位做动作风格迁移编辑
痛点动机 成对局部编辑数据稀缺,自重建训练易致模型忽略参考动作
解决方案 提出 MoSAIC ,用潜在扩散模型按身体部位路由参考动作,并以对齐干预监督构造反事实目标来训练。
15

Lag-aware cross-hand alignment for dual-hand action segmentation

Fatemeh Ziaeetabar
任务设定 双手协同动作分割,需处理左右手时间错位问题
痛点动机 现有方法假设双手时间同步,忽略动作转换的可变延迟
解决方案 提出滞后感知跨手对齐模块,估计双手特征间的时序偏移并融合跨手信息
16

Weight and Height Estimation from a Single Human Image Captured in the Wild

Hira Yaseen, Arif Mahmood, Waqas Sultani
任务设定 从单张野外人像估计体重、身高与 BMI
痛点动机 姿态、相机、外观差异大,且缺乏公开数据集
解决方案 融合 RGB、深度、姿态等多模态特征训练单/多任务网络,并发布新数据集