Daily Paper Feed

2026 年 08 月 06 日 星期四 · 共 21 篇相关论文 · 全部存档
1

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan
任务设定 3D 场景理解任务中动态编排多模态输入
痛点动机 固定模态组合引入噪声、浪费算力,未按查询自适应
解决方案 提出 SmartMage ,用语义路由模块按需选模态并激活专家,实现自适应多模态推理
2

Robust and Efficient Motion Reasoning for Privacy-Aware Classroom Incident Recognition

Paritosh Parmar, Landy Lan, Hong Yang, Chen Yi, Chiat Pin Tay
任务设定 隐私保护场景下的课堂异常行为识别
痛点动机 监控视频需保护隐私,现有方法难兼顾效率与泛化
解决方案 构建层级化运动学表征,将大教师模型的多阶运动推理蒸馏给轻量学生模型
3

HelloWorld: Enabling Socially Interactive Characters in Video World Models

Liangyang Ouyang, Ruicong Liu, Xuangeng Chu, Kaipeng Zhang, Yoichi Sato
任务设定 视频世界模型中的角色能与用户社交互动
痛点动机 现有视频世界模型缺乏用户与角色的互动能力
解决方案 提出自蒸馏训练管道学习互动与镜头运动,推理时用训练无关模块定位互动响应时机
4

WorldCycle: Self-Verifiable Reinforcement Learning for Long-Horizon Video World Models

Bohai Gu, Yueyang Yuan, Taiyi Wu, Dazhao Du, Jian Liu, Xiaoyi Pang, Jie Zhang, Xiaocheng Lu, Haobin Zhong, Xiaotong Zhao, Alan Zhao, Song Guo
任务设定 提升视频世界模型长时程动作预测一致性
痛点动机 长程动作序列无真值状态,漂移误差难以验证
解决方案 构造可逆动作循环做自监督验证,用空间闭合与时间一致性奖励做强化学习
5

Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen

Chengming Feng, Hesam Araghi, Liming Zheng, Julien Dupeyroux, Xucong Zhang, Jan van Gemert, Nergis Tömen
任务设定 构建自视角双目事件相机厨房烹饪数据集
痛点动机 现有事件相机数据集缺少自然、无脚本的人类日常动作标注
解决方案 10 人在 13 个厨房自然烹饪,头盔采集双目事件相机、RGB、深度、IMU 数据,标注动作与物体框
6

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li
任务设定 个性化烹饪机器人的可信自动化控制
痛点动机 纯规则控制难个性化,大模型控制又不透明不可靠
解决方案 多智能体把语言指令转成结构化流程程序,基于原子动作库生成可执行代码并闭环执行
7

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

Houze Xu, Jizhong Li, Ziyi Ye
任务设定 VLA 模型的长时程任务规划与执行
痛点动机 任务时序难保持一致,执行误差易累积
解决方案 分层架构:高层 VLM 语义推理并更新语言记忆与子任务指令,低层 VLA 负责精细连续控制
8

Multi-View Face and Gesture Animation with Dynamic Gaussians

Alireza Javanmardi, Vippin Kumar Jeetmal, Christen Millerdurai, Alain Pagani, Didier Stricker
任务设定 上半身虚拟人的面部表情手势联合重建动画
痛点动机 现有方法难兼顾面部精细度与手部姿态精度
解决方案 分别建模面部和双手并融合进参数化上半身网格,再用 3D 高斯泼溅渲染多视角动态形象
9

MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight

Zehua Fan, Junjie He, Wenxuan Song, Xi Wang, Wenqi Lyu, Linge Zhao, Fuhao Li, Zihan You, Yifei Yang, Kaiming Xu, Qi Jiang, Yue Jiang, Haoang Li, Cheng Chi, Bailin Li, Yan Wang
任务设定 世界动作模型扩展到移动操作的全身控制
痛点动机 现有模型局限桌面操作,忽视移动时场景动力学耦合
解决方案 融合视频扩散主干与动作专家,用混合专家分离移动/操作动力学,链式预测提供密集监督
10

Overcoming Statistical Bias in Action-Controllable World Models

Yuhong Shi, Zhenhao Chu, Jie Wei, Jun Hao, Jianyi Liu, Jingwen Fu
任务设定 提升动作条件世界模型的动作可控性
痛点动机 模型易走视觉惯性捷径,动作与预测未真正因果关联
解决方案 提出反事实一致性框架 CoCo ,约束多步及镜像场景下预测保持动作依赖,并给出 ARC/DE 新指标
11

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

Jiuhe Qu, Yingping Liang, Ying Fu
任务设定 压缩 3D 视觉语言模型的冗余视觉 token
痛点动机 多视角 3D 场景 token 冗余度高,推理开销大
解决方案 提出分层空间聚类压缩框架:先跨视角合并冗余 token ,再在聚类内剪枝保留细节
12

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma
任务设定 跨领域第一视角视频问答基准与挑战赛
痛点动机 检验 MLLM 能否泛化到手术等罕见第一视角场景
解决方案 组织 EgoCross 挑战赛,设受限/开源两赛道评测跨域第一视角问答
13

ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields

Seunghyeon Song, Joo Chan Lee, Chanung Park, Jun Young Jeong, Minseo Lee, Eunbyung Park, Jong Hwan Ko
任务设定 压缩 4D 高斯泼溅动态辐射场的存储开销
痛点动机 现有锚点方法参数容量固定,难以兼顾运动复杂度与压缩率
解决方案 提出自适应容量锚点,按时空复杂度动态分配高斯数量与特征维度
14

PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang
任务设定 基于视频构建可执行世界模型做物理推理
痛点动机 VLM 难以理解物体运动交互及反事实变化
解决方案 免训练重建动态场景与 6D 位姿,拟合解析动力学支持推演与反事实提问
15

EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang
任务设定 给定第一视角观测和任务,规划下一步并分割功能区域
痛点动机 现有方法难以联系语义角色多步规划
解决方案 提出 EgoAfford 基准与 EgoLens 模型,用角色专属掩码解码器分割物体、工具与目标区域
16

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta
任务设定 测试时检测扩散式 VLA 策略的失败风险
痛点动机 策略可能生成脱离视觉语言依据的合理动作
解决方案 通过消融 KV 缓存 关键条目构造反事实对比,提取接地诊断信号判断失败
17

Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models

Weiheng Zhao, Haoyi Jiang, Xin Shi, Liu Liu, Fan Huang, Zhizhong Su, Wei Sui, Xinggang Wang
任务设定 机器人操作中高效的世界动作模型推理
痛点动机 现有 WAM 在推理速度与未来推理带来的鲁棒性间难兼得
解决方案 提出 Faster-WAM :仅计算一次未来表征后稀疏复用,兼顾速度与分布外泛化能力
18

CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention

Yan Zhang, Yinan Wu, Haoran Duan, Jungong Han
任务设定 解决 VLA 模型操作任务中的视觉压制问题
痛点动机 视觉信息远比语言指令密集,策略易绕过指令产生因果混淆
解决方案 提出反事实干预框架 CofactVLA ,构建语言掩码反事实分支,在动作与特征两级抑制视觉混淆项
19

SAFECAST: Robust Failure Detection for VLA Policies with Contrast-Set Training and Calibration

Harshitha Rajaprakash, Aditeya Prajapati, Rong Xue, Abrar Anwar, Jesse Thomason
任务设定 检测 VLA 策略部署时的执行失败
痛点动机 分布偏移下风险探针校准易失配部署场景
解决方案 对比集扰动改进隐藏状态风险探针的训练与校准,提升失败检测能力
20

SiMDex: Mining Similar Egocentric Videos for Cross-Embodiment Dexterous Manipulation

Nie Lin, Takehiko Ohkawa, Sijin Chen, Ruoshi Wen, Zhuohang Li, Liqun Huang, Zhengming Zhu, Yiming Bao, Yunfei Li, Minjie Cai, Xiao Ma, Wei Xu, Yoichi Sato
任务设定 跨本体灵巧操作挖掘有效的人类视频训练数据
痛点动机 海量自我中心视频中难辨哪些数据真正有用
解决方案 借鉴推荐系统三层筛选流程,仅用 <5% 数据使成功率从 47.7% 升至 61.1%
21

Teaching Foundation Models to Read mmWave: Pose-Guided Kinematic Representation for Human Behavior Understanding

Duo Zhang, Zhehui Yin, Zhiyun Yao, Haotong Qin, Xusheng Zhang, Hongliu Yang, Jianyu Sun, Junzhe Wang, Zizhou Fan, Michele Magno, Daqing Zhang
任务设定 毫米波雷达感知人体行为并生成语言描述
痛点动机 雷达信号难与语言对齐,且缺乏人体结构监督
解决方案 用同步 3D 姿态作为训练期监督预训练雷达编码器,再对齐 LLM 实现行为描述与问答