Daily Paper Feed

2026 年 09 月 07 日 星期一 · 共 18 篇相关论文 · 全部存档
1

WorldSculpt: Generating Compositional Worlds from Grounded Videos

Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang
任务设定 从多视角视频生成杂乱场景的组合式 3D 表示
痛点动机 密集遮挡场景中物体几何难以完整重建
解决方案 单物体 3D 生成先验扩展到多视角观测,无需场景级训练即可生成数百物体的复杂场景
2

UniMate: One Unified Model to Animate Diverse Skeletons

Linzhan Mou, Jiahui Lei, Zhiyang Dou, Chenyue Cai, Chaoyue Song, Adam Finkelstein, Szymon Rusinkiewicz
任务设定 给定绑定骨骼和文本,生成任意拓扑角色的动作
痛点动机 现有动画模型受限于固定骨骼模板,需逐骨骼微调
解决方案 提出拓扑感知扩散 Transformer ,用图注意力和谱旋转编码统一任意骨骼运动生成
3

RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

Zhenxuan Fan, Bo Zhang, Yutong Lin, Yuqian Yuan, Juekai Lin, Liang Liang, Zhuoyi Huang, Wenqiao Zhang, Juncheng Li, Siliang Tang, Jun Xiao, Yueting Zhuang
任务设定 构建评测 VLA 模型空间推理与长程规划能力的基准
痛点动机 现有基准场景简单、任务短程,难诊断具身推理短板
解决方案 提出 RoboSPA 基准,含 280 种难度变体、52.7 万条轨迹及细粒度诊断指标
4

A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning

Chongwen Dong, Mithun Paul Saint-Germain, Pinjari Asif, Carlo R. daCunha
任务设定 分散式多机器人导航中用 LLM 优化策略,避免破坏局部学习
痛点动机 LLM 策略推理与底层控制更新节奏不同步,易导致局部学习不稳定
解决方案 结合 LLM 策略代理、UCB 老虎机选择精化模式,与 Double DQN 执行动作,分层解耦决策
5

Temporal Residual Neural Radiance Fields for Monocular Video Dynamic Human Body Reconstruction

Tianle Du, Jie Wang, Xiaolong Xie, Wei Li, Pengxiang Su, Jie Liu
任务设定 利用单目视频重建动态人体并渲染新视角
痛点动机 MLP 容量有限,动态场景训练慢且重建质量受限
解决方案 构建独立于 MLP 的时序残差场,结合多维度损失函数提升精度并大幅加速渲染
6

MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision

Zijie Zhu, Weiren Cai, Yizhou Wang, Zhenjie Yang, Yide Liu, Jiahao Chen, Guanqi He
任务设定 第一人称视频估计相机与双手世界坐标运动
痛点动机 现有方法分阶段处理相机、深度、手部,开销大且无法联合建模
解决方案 提出统一基础模型,从共享时空表征联合预测相机轨迹与手部状态并转换到世界坐标;大规模伪标签预训练后精调
7

TourPhysics: Bringing Physics to World Models for Exploration and Manipulation from a Single Image

Xin Zhang, Yabo Chen, Zixuan Duan, Haibin Huang, Chi Zhang, Feng Xu, Xuelong Li
任务设定 基于单张图像构建可交互的物理世界模型
痛点动机 现有视频世界模型偏重外观先验,长时序易失去物理一致性
解决方案 结合确定性物理仿真与视频生成,分离仿真状态、几何证据与外观记忆,支持持续探索与操作
8

InterSing: Explicit Interaction Dynamics for 3D Duet Singing Animation and Beyond

Yihan Zhou, Zikai Huang, Yuyang Yu, Xuemiao Xu, Cheng Xu, Shengfeng He
任务设定 生成双人对唱的 3D 头部动画
痛点动机 对唱互动稀疏且依赖节奏,现有音频驱动动画方法难以建模
解决方案 提出交互 logits 表示互动强弱,条件化扩散模型联合音频与互动信号生成动画
9

Sound-based Multi-Person 3D Pose Estimation

Yusuke Oumi, Yuto Shibata, Go Irie, Akisato Kimura, Yoshimitsu Aoki, Mariko Isogawa
任务设定 仅用声学信号估计多人 3D 姿态
痛点动机 多人声学信号相互叠加,难以区分个体运动特征
解决方案 提出 SoundMHPE 框架,多尺度声学编码器提特征,注意力解耦多人信息逐帧重建姿态
10

Linguistic Trajectory Encoding for Efficient Long-Horizon Spatial Memory in Embodied Agents

Tianyidan Xie, Shenyi Wang, Qiang Tang, Mingjie Wang, Zhicheng Qiu, Xuanfu Li, Zhan Xu, Jian Yang, Lanjun Wang, Zili Yi
任务设定 具身智能体长时序动态物体空间记忆检索
痛点动机 现有记忆丢失运动细节或无法语言查询
解决方案 提出语言化轨迹编码,融合语言描述、空间与视觉锚点压缩运动轨迹
11

Where to Look Matters: Learning Influential Views for VLM-based 3D Visual Grounding

Tsung-Chih Chiang, Hsuan-Kung Yang, Jou-Min Liu, Ting-Ru Liu, Chun-Wei Huang, Quan Kong, Chun-Yi Lee
任务设定 基于 VLM 的 3D 视觉定位,需挑选关键相机视角
痛点动机 现有方法靠启发式选视角,未考虑与定位相关性
解决方案 训练视角选择器预测查询相关视角,交给 VLM 比较定位
12

An Evaluation Framework for Generating Multi-View Images of a Person in a Scene

Mahir Majid, Young Kyung Kim, Guillermo Sapiro
任务设定 评估场景中人物多视角图像生成的空间一致性
痛点动机 相机转动时头部朝向与背景常出现幻觉、不一致
解决方案 提出 HSRD 指标,解耦相机运动与头部姿态,量化 3D 视差一致性
13

Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI

Amarjot Singh, Tanmay R. Pancholi, Jainam Kothari, Shrirang Mahajan, Ketan Bansal, Zackory Erickson, Giuseppe Loianno, Alexandre M. Bayen, Jeff Schneider, Vince Nakayama
任务设定 面向部署后具身智能体的持续在线适应与技能学习
痛点动机 现场数据稀缺、仅有机载算力,还要不遗忘已有能力
解决方案 提出 CFAM 架构,慢速核心+快速 Capsule Field ,实现跨机械臂、四足、人形等本体的少样本持续学习
14

SocioGesture: Real-Time and Adaptive Social Gesture Perception for Human-Robot Interaction

Wenjin Fu, Li-Fan Wu, Jerin Peter, Chip Huyen, Boyuan Chen, Jan Liphardt
任务设定 机器人实时识别人类社交手势与意图
痛点动机 遮挡、视角变化和低延迟约束下手势感知很困难
解决方案 置信度感知骨骼表征融合身体与手部动作,配合遮挡增强训练提升边缘端实时鲁棒性
15

STyMo: Fast and Controllable Few-Shot Motion Style Transfer

Jose Luis Ponton, Alexander Winkler, Ladislav Kavan, Yuting Ye, Petr Kadlecek
任务设定 少样本实现虚拟角色的运动风格迁移
痛点动机 现有方法依赖大量风格化数据或泛化能力
解决方案 将风格拆解为静态姿态与时序动态两部分,几分钟内训练完成并支持运行时可控调节
16

VLA-Precision: Asymmetric Co-Bootstrapping for Efficient Real-World Online RL of Vision-Language-Action Models

Chenyu Su, Zhaolong Shen, Yuan Qian, Chen Qian, Rui Zhang, Feng Yan, Weixing Chen, Fei Zhang, Jiamin Wang, Shuang Cong, Weiwei Shang
任务设定 真实场景中对 VLA 模型做在线强化学习微调
痛点动机 价值信号不稳、大模型开销高,精度和可重复性受限
解决方案 提出非对称协同自举算法与 ACoB-Stream 流式架构,抑制策略漂移并大幅提升吞吐
17

FailureSpot: Label-Efficient Timestamp-Level Failure Detection for Vision-Language-Action Models

Jie Ma, Zongxi Liu, Yi Zhu
任务设定 面向 VLA 机器人操作策略的时间戳级失败检测
痛点动机 轨迹级标签把失败前正常行为误标,导致定位不准
解决方案 动作弱监督信号捕捉异常模式,配合主动学习挑选样本标注微调
18

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

Chengqian Ma, Wei Tao, Haoyu Zhang, Yiwen Guo
任务设定 端到端联合生成语音与全身动作的对话数字人
痛点动机 传统级联方案语音动作分离,二次推理且无法联合优化
解决方案 对话大模型直接从隐藏状态同步输出语音与全身动作,联合训练保持对齐