Daily Paper Feed

2026 年 08 月 26 日 星期三 · 共 17 篇相关论文 · 全部存档
1

Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning

Sixiang Chen, Jiaming Liu, Jixian Wu, Yichen Guo, Tinghao Wang, Siyuan Qian, Hao Chen, Jiajun Cao, Jian Tang, Shanghang Zhang
任务设定 诊断动作条件世界模型能否真实遵循任意动作
痛点动机 现有基准仅测专家演示,忽略非专家动作跟随评估
解决方案 提出 WorldEcho 诊断基准与 WorldSync 对齐方法,强化动作跟随能力
2

From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms

Jiangning Zhang, Haojun Chen, Yong Liu
任务设定 综述智能眼镜作为第一人称智能平台的感知-行动闭环
痛点动机 现有研究分散于设备、任务和基准,缺乏统一框架
解决方案 提出 L0-L5 能力分级框架,统一第一人称视觉感知与具身交互研究
3

LeFlow: Generative Latent Flow Planning for World Models

Hsiang-Wei Huang, Jianxu Shangguan, Junbin Lu, Jenq-Neng Hwang
任务设定 隐空间世界模型学习可复用的规划先验
痛点动机 现有方法每次重新做迭代轨迹优化,规划经验难复用
解决方案 整流流模型在隐空间生成目标轨迹,逆动力学解码为动作并由世界模型验证
4

Game2World Engine: Unlocking In-the-Wild Gameplay Videos for World Model Training

Wenxuan Shen, Dongna Jin, Dongping Chen
任务设定 从野外游戏视频中去除 UI 界面,构建世界模型训练数据
痛点动机 游戏 UI 遮挡场景内容,引入游戏特有偏差干扰训练
解决方案 提出 G2WEngine 自动提取并合成 UI 配对数据,训练无掩码的 GameCleaner 去除 UI 保留场景动态
5

Markerless Pose Estimation for Resistance Training Technique Assessment

Joseph Turner, Jeff Clark, Nawid Keshtmand
任务设定 用视频对抗阻训练(深蹲等)动作技术进行评估
痛点动机 实验室动作分析准确但难普及,需低成本替代方案
解决方案 BlazePose 从视频提取关节角度轨迹,与参考动作比较 RMSE 评估技术一致性
6

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng
任务设定 文本条件下的人体动作生成,需设计离散动作分词器
痛点动机 现有分词器只为重建优化,语义与运动细节混杂难分
解决方案 提出 SeMoCo :动作 token 拆分为语义与残差运动学部分,双轴生成器分层建模两者
7

NeoWorld-Pro: Programming Interactive Scenes from Monocular Images for Embodied Simulation

Yumeng He, Yichen Song, Xiaotian Yang, Weijia Zhang, Zanwei Zhou, Junru Gong, Xiaokang Yang, Yunbo Wang
任务设定 从单张单目图像生成可交互的 3D 仿真场景
痛点动机 现有 image-to-URDF 方法缺乏物理真实性和场景交互性
解决方案 MLLM 把图像转成可执行程序,靠物理引擎闭环迭代校验优化
8

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang
任务设定 评估第一视角下程序性错误理解能力的 VQA 基准
痛点动机 现有基准忽视自我中心视角下的错误检测这一关键能力
解决方案 提出 EgoErrorVQA 基准及 Ego-ADR 解耦推理框架提升错误理解
9

PonderPounce: A Pretrained MLLM as an Episode Context Engine for Robot Control

Suhwan Choi, Jaeyoon Jung, Sungkyung Kim, Yunsung Lee, Youngjae Yu
任务设定 复用 MLLM 原生上下文作为机器人控制的情节记忆
痛点动机 VLA 模型未充分利用 MLLM 长时程推理能力做记忆
解决方案 System2 的 Ponder(MLLM)与 System1 的 Pounce(VLA)异步协作共享认知 token
10

Hierarchical Skill Retrieval for Data-Efficient Adaptation of Vision-Language-Action Models

Haoran Hao, Shahram Najam Syed, Jeff Schneider, Jeffrey Ichnowski
任务设定 面向 VLA 模型的少样本任务适应中的经验检索
痛点动机 长程操作任务完整匹配稀少,但可复用技能片段丰富
解决方案 提出分层技能检索,先拆解任务为技能序列,再做子任务级混合检索,两阶段微调策略
11

SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image

Zefan Tian, Yuteng Ye, Yiheng Zhang, Yuhang Yang, Xueqiang Lv, Shizhou Zhang, Le Liu, Di Xu
任务设定 从单张图像重建完整 3D 场景
痛点动机 物体生成先验与场景重建存在坐标系错位
解决方案 提出选择性位姿分解,用 DiT 生成器补全物体网格并对齐拼装到场景坐标系
12

GlanceWAM: Sparse Test-Time Imagination for World-Action Models

Linhan Wang, Zijian An, Mingyuan Zhang, Chen Dai, Yi Xu, Can Cui, Zichong Yang, Yinlin Chen, Lifeng Zhou, Chang-Tien Lu
任务设定 世界动作模型的实时控制与视觉想象
痛点动机 同步生成视频延迟高,舍弃想象又降低任务成功率
解决方案 提出 GlanceWAM ,异步在潜空间中低频想象未来帧,动作头按控制频率解码
13

Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization

Yapeng Liu, Yuanzhao Zhai, Xudong Gong, Dawei Feng, Bo Ding, Lin Wang, Huaimin Wang
任务设定 评估具身智能体系统在开放环境中的韧性表现
痛点动机 现有成功率等结果指标掩盖了智能体的恢复过程
解决方案 提出韧性评估框架,定义反弹、稳定性等指标,在 400 个家庭任务上测试 10 个具身系统
14

Primate vision reveals a missing principle for robust dynamic AI

Matteo Dunnhofer, Christian Micheloni, Kohitij Kar
任务设定 对比灵长类视觉与神经网络的动态物体表征
痛点动机 视频模型外观变化时泛化差,不如人脑鲁棒
解决方案 发现预测式世界模型泛化最强,且与猴脑 IT 皮层表征最吻合
15

More Motion Is Not Always Better Motion: Corpus Composition Governs Whether Augmentation Helps SMPL-Based Parkinsonian Gait Severity Estimation

Michael Caiola, Andrew C. Weitz
任务设定 基于 SMPL 运动评估帕金森步态严重程度
痛点动机 数据增强效果取决于语料构成而非数据量
解决方案 发现仅含步速差异的语料才能提升效果,其余反而无效
16

Platonic Representation Hypothesis on World Models

Wenhow Li, Chengwei MA, Hui Xiong, Ying-Cong Chen, Lei Zhang
任务设定 探究世界模型学习到的表征是否趋于一致
痛点动机 不同世界模型内部表征的本质尚不清楚
解决方案 提出预测一致性假设,发现异构世界模型收敛出共享潜在结构,可模型缝合互换
17

Progressively Learning Heterogeneous Skills in a Unified Latent Space

Yue-Yi Zhang, Ming Gong, Linpu He, Wei-Shi Zheng, Zhilin Zhao
任务设定 统一潜空间中渐进学习异构技能,实现物理角色控制
痛点动机 多数据源、多任务的技能难以融合,文本转动作易走捷径丢语义
解决方案 先学运动追踪技能建共享解码器,再用运动直觉蒸馏和任务引导模块扩展文本转动作等技能