Daily Paper Feed

2026 年 07 月 23 日 星期四 · 共 17 篇相关论文 · 全部存档

Masked Visual Actions for Unified World Modeling

Hadi Alzayer, Wenlong Huang, Haonan Chen, Christopher Luey, Lvmin Zhang, Maneesh Agrawala, Gordon Wetzstein, Li Fei-Fei, Yilun Du, Jiajun Wu, Jia-Bin Huang
任务设定 面向机器人操作的统一视频世界模型动作控制接口
痛点动机 动作表达需贴合视频模型学到的视觉交互先验,又要落地物理操作
解决方案 提出掩码视觉动作,用部分揭示的轨迹表达动作,可预测场景响应也可反推机器人动作

IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer

Zhengyu Zou, Hao Li, Kuixuan Jiao, Liu Liu, Tingyang Xiao, Xiaolin Zhou, Fangzhou Hong, Zhizhong Su, Dingwen Zhang, Ziwei Liu
任务设定 从连续视频流实现 4D 场景的几何与实例联合理解
痛点动机 现有流式方法以几何为中心,缺乏时序一致的物体级理解
解决方案 提出 IGGT4D ,通过因果时空建模联合更新相机、几何与物体身份,并构建大规模 4D 实例数据集

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo et al. (11 additional authors not shown)
任务设定 单卡桌面 GPU 上的实时长时程交互式世界模型
痛点动机 长程自回归生成易发生漂移,云端算力需求也难以本地部署
解决方案 教师蒸馏结合 LongForcing 对齐长程 rollout ,配合低比特流式推理实现单卡实时生成

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen
任务设定 将真实机器人交互录像转换为可仿真的物理世界孪生体
痛点动机 传统 real2sim 流程依赖大量人工调参,跨场景难以规模化
解决方案 视觉语言智能体自主完成几何重建与物理参数推断,组装成可运行仿真环境

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

Lisa Weijler, Irene Ballester, Guofeng Mei, Tolga Birdal, Pedro Hermosilla
任务设定 从稀疏视角生成一致的 3D 场景几何与外观
痛点动机 现有 3D 基础模型只能前馈重建,无法生成超出输入视角的合理几何
解决方案 VGGT 潜空间上做黎曼流匹配,使生成 token 保持在超球面流形上

FlexiAvatar: Unified 3D Gaussian Human Avatars Under Arbitrary Body Visibility

Yihalem Yimolal Tiruneh, Muhammad Salman Ali, Uyoung Jeong, Muneeb A. Khan, MD Khalequzzaman Chowdhury Sayem, Allanur Bayramgeldiyev, Binod Bhattarai, Seungryul Baek
任务设定 从单目视频重建任意可见范围的 3D 人体化身
痛点动机 联合优化全身区域会因不可见肢体拖累可见部位的重建质量
解决方案 仅优化可见区域SMPL-X 跟踪与残差细化,用扩散模型补全未见纹理

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interactio

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen
任务设定 打造具身智能机器人的端侧大脑模型
痛点动机 通用智能与具身交互能力难以兼得
解决方案 Athena-Brain-8B 经多阶段训练融合通用与具身专家能力,回复简洁高效

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation

Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang
任务设定 图像到视频生成中显式控制物理参数(力、材质、重力)
痛点动机 现有视频运动看似合理却缺乏物理因果约束,多物体易纠缠
解决方案 构建 PhyParam 数据集,用物理注意力路由扩散模型将力/质量/摩擦等绑定到具体实例

Wave2Body: Rethinking mmWave Human Pose Estimation as Radar-to-Body Token Translation

Bo Liang, Chen Gong, Wei Gao, Chenren Xu
任务设定 用毫米波雷达点云估计人体 3D 姿态
痛点动机 雷达点云稀疏且视角相关,直接回归关节易学到数据集捷径
解决方案 提出 Wave2Body ,用自监督雷达分词器与预训练人体分词器解耦感知和姿态先验,轻量转换器对齐两者

Reliability-Aware 3D Geometric Injection for Universal Person Re-identification

Bohan Su, Jiashuo Wang, Fangyi Liu, Mang Ye
任务设定 跨遮挡、换衣、跨模态场景的通用行人重识别
痛点动机 2D 特征缺乏深度和拓扑信息,直接引入单目 3D 先验又易造成负迁移
解决方案 提出 UniGeo ,用一致性可靠性门控把单目 3D 关节结构作为残差安全融合进 2D 特征

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si
任务设定 3D 高斯泼溅场景中开放词汇、多目标指代分割
痛点动机 现有方法仅支持单目标查询,且需逐场景训练语义特征,开销大
解决方案 提出免训练的 ZeroSplat ,用多视角几何把 2D VLM 先验直接提升到 3D 点级理解

UVFaceFusion: Fast Multi-view Topologically Consistent Face Reconstruction in the Wild via UV-space Neural Fusion

Xin Ming, Yuxuan Han, Junhai Yong, Feng Xu
任务设定 多视角图像的固定拓扑人脸几何重建
痛点动机 现有自动化方法难兼顾几何精度与真实场景泛化能力
解决方案 UV 空间神经融合多视角点图,直接采样出固定拓扑网格

DWM: Separating World Effects from Actions in Latent World Models

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang
任务设定 解耦潜在世界模型中的动作与环境本征效应
痛点动机 单一监督信号难以区分动作驱动与环境本征变化的成因
解决方案 增设动作无关的 world head ,通过正交约束显式分解隐变化

Generative World Renderer at the Speed of Play

Guixu Lin, Zheng-Hui Huang, Siqi Yang, Ming-Hsuan Yang, Kaipeng Zhang, Zhixiang Wang
任务设定 由物理引擎世界状态实时渲染出 RGB 画面
痛点动机 原模型仅 0.56 FPS ,远达不到实时游玩速度
解决方案 转为少步自回归流式模型,搭配轻量蒸馏编解码器,提速至 31.54 FPS

The Open Ant: A Robot Platform for Reinforcement Learning Research

Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil
任务设定 为强化学习研究打造开源物理机器人平台
痛点动机 RL 研究多依赖仿真,向真实机器人迁移存在不确定性
解决方案 开源 Open Ant 机器人平台,可在实机上约 1 小时训练出行走策略,并验证仿真到现实的迁移

AlayaWorld: Interactive Long-Horizon World Modeling -- Full Technical Report

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao
任务设定 由文本/图像/视频生成可交互的长时程虚拟世界视频
痛点动机 长视频生成易产生漂移,需兼顾时空一致性与响应效率
解决方案 基于 15B 视频扩散 Transformer ,结合锚帧与空间记忆抑制误差累积,蒸馏后仅需 4 步推理

Physical Self-Supervised Learning: IMU Sensing without Manual Labels

Yuyang Leng, Renyuan Liu, Shaohan Hu, Peijun Zhao, Chun-Fu Chen, Songqing Chen, Shuochao Yao
任务设定 面向 IMU 传感器的无标注全身运动捕捉与追踪
痛点动机 标注成本高,且跨设备、跨用户泛化能力差
解决方案 提出物理自监督学习,用可学习运动学方程解码器替代神经解码器,结合多视角运动学树建模