Daily Paper Feed

2026 年 09 月 01 日 星期二 · 共 36 篇相关论文 · 全部存档
1

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

Weiqi Wang, Zhi Li, Yudong Lei, David Martinez, Xiaofeng Gao, Yuxin Jiang, Chenfanfu Jiang, Yingnian Wu, Demetri Terzopoulos, Ran Gong
任务设定 从语言指令合成机器人长时程操作策略
痛点动机 现有方法丢弃任务语义,奖励人工设计导致行为漂移
解决方案 提出 SUN 程序统一定义几何语义,编译为 MPC 代价与 RL 奖励,自动训练分阶段策略
2

FaceSnap: Real-Time Personalized Lightstage Facial Performance Capture

Rukhshanda Hussain, Noé Artru, Emeline Got, Luiz Gustavo Hafemann, Alexandre Messier, Brandon Dearlove, Rafael M. O. Cruz, Abdallah Dib, Eric Granger
任务设定 单目相机实现高保真人脸表演实时捕捉
痛点动机 多视角 lightstage 采集耗时耗力,难以快速迭代
解决方案 先离线构建个性化人脸模型,再单目实时估计 4K 纹理与几何
3

SMG: Semantic Motion Graph for Monocular Dynamic Gaussian Splatting

Haozheng Yu, Xinyu Yang, Rundong Luo, Jennifer J. Sun, Bharath Hariharan
任务设定 单目视频的动态高斯泼溅场景重建
痛点动机 遮挡和欠约束区域下动态高斯易过拟合训练视角
解决方案 构建语义运动图,用可靠节点的运动引导邻近不可靠区域
4

DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception

Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal, Shahram Rahimi, Noorbakhsh Amiri Golilarz
任务设定 双臂多视角机器人感知的标定数据集
痛点动机 单视角感知因自遮挡导致物体表面观测不完整
解决方案 双臂各装 RGB-D-IR 相机,自动定位与跨臂确认采集多视角数据
5

LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation

Shaoan Wang, Aocheng Luo, Fei Huang, Jingyi Xu, Xiaoyang Wang, Yueyu Wang, Qianli Ma, Fan Yang, Ran Mei, Jia Wei, Jiangpeng Hu, Xuhao Liu, Hongming Chen, Yuanbin Shao, Yiyang Lin, Ziliang Li, Liang Pan, Xinhang Liu, Yuntao Ma, Tingxiang Fan
任务设定 用预训练 VLM 实现跨任务、跨本体的具身导航
痛点动机 现有导航系统按任务/本体拆分模块,泛化能力弱
解决方案 双通道指向统一表达空间意图,配合残差 VQ 动作分词器转成具体轨迹,单模型端到端完成导航
6

CAER: Causal Action Effect Reweighting for World Model Training

Jianjie Fang, Xvyuan Liu, Ziyou Wang, Rongze Tang, Zhaolu Wang, Zhuohang Li, Xin Zhang, Haisheng Su, Chen Gao, Wei Wu, Xinlei Chen, Yong Li
任务设定 训练动作条件下的世界模型视频生成器
痛点动机 均匀 MSE 训练让背景像素主导梯度,动作因果区域反而欠优化
解决方案 对比有无动作条件的预测差异,在线定位因果动作效应区域并据此重加权训练损失
7

Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling

Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li
任务设定 将真实室内场景重建为可编辑的 3D 物体资产集合
痛点动机 真实拍摄常有遮挡和几何缺失,难满足现有方法苛刻输入要求
解决方案 先解析场景图并逐实例生成完整资产,再用 VLM 策略 GizmoAct 闭环调整摆放位置
8

Can Video World Models Track Unobserved World States?

Joonghyuk Shin, Yicong Hong, Jaesik Park, Xun Huang
任务设定 测试视频世界模型能否追踪未观测的隐藏状态
痛点动机 视觉逼真度不代表模型真正维护了世界隐状态
解决方案 设计动作条件的猜牌任务,发现只有跨块保持并更新状态的架构(负特征值线性注意力、TTT )能外推,纯 KV 缓存式 Transformer 无法追踪。
9

MEOM: Multi-View Expected-OKS Maximization for Human Pose Triangulation

Ziliang Xiong, Henglin Shi, Per-Erik Forssen
任务设定 多视角 2D 热图三角化恢复 3D 人体姿态
痛点动机 热图坍缩成单峰会丢失遮挡下的多峰分布信息
解决方案 提出 MEOM 目标,用全热图定位各视角概率质量一致的 3D 关节,并用 HDR 校准 评估热图可靠性
10

SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding

Yi Zhang, Yi Wang, Yueting Wu, Kaiyue Yang, Yuejiao Su, Lap-Pui Chau
任务设定 针对具身智能体的图像式 3D 视觉定位任务
痛点动机 现有基准忽略时序顺序与观测对齐,定位不准确
解决方案 体素记忆筛选多视角证据,渐进式语言-体素融合做粗到精推理定位
11

ObjectSplat: Improving Mesh Fidelity and Interactivity for 3D Scenes via Object-Level Mesh Splatting

Minhas Kamal, Hiranya Garbha Kumar, Mahedi Kamal, Balakrishnan Prabhakaran
任务设定 面向 3D 场景的物体级网格泼溅重建与编辑任务
痛点动机 整体化重建缺少物体级结构,遮挡区域网格保真度低
解决方案 先分割物体并修复背景,再用网格泼溅分别重建后合成场景
12

Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation

Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen
任务设定 长时程具身导航与开放式问答任务
痛点动机 VLM 推理强但导航执行脆弱,导航模型缺乏持续任务级推理
解决方案 提出 NavMCP 框架,用 VLM 智能体调度导航基座模型执行闭环子目标,三通道积累记忆实现持久具身交互
13

PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning

Youngchae Chee, Hosu Lee, Sungjune Park, Junho Kim, Yong Man Ro
任务设定 跨视角(第一/第三人称)视频动作表征学习
痛点动机 现有方法将视角无关与视角相关语义纠缠,专门去纠缠的模型也难幸免
解决方案 提出 PRISM ,将视频分解为视角不变视角相关隐变量,在语言监督下重组以促进解耦
14

PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies

Botong Zhao, Fang Yu, Tim, Senhua Zhu, Xinyuan Chen, Yue Lu
任务设定 视觉-语言-动作( VLA )机器人策略学习
痛点动机 行为克隆表征未显式建模场景演化,轨迹质量参差未加区分利用
解决方案 结合 JEPA 式多时间尺度对齐分布价值评论家,用流匹配按优势条件生成动作
15

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu
任务设定 面向灵巧操作的自我进化通用世界模型
痛点动机 现有世界模型未将动作与预测评估形成闭环
解决方案 单一共享权重模型兼任策略、模拟器与评估器,形成闭环自我进化
16

ATGS: Anchored Temporal Gaussian Splatting for Long Volumetric Video Representation

Jiahao Wu, Jie Liang, Die Hu, Jiayu Yang, Kaiqiang Xiong, Xiang Li, Xiaoyun Zheng, Chao Wang, Ronggang Wang
任务设定 长序列复杂运动的自由视角视频重建
痛点动机 现有方法逐点追踪长时运动,易造成时序不稳定和伪影
解决方案 时间条件锚点组织高斯基元,配合时间窗口激活和多级锚点特征保稳定
17

Training-Free Action Correction for VLA Model Failures via Language Feedback

Owen Kwon, Pablo Ortega-Kral, Arthur Bucker, Jean Oh
任务设定 免训练修正 VLA 模型部署时的执行失败
痛点动机 策略权重难以随时微调,动作幅度偏差难纠正
解决方案 把人类语言反馈转成动作幅度的附加调整,无需改动策略权重
18

AcrossWAM1.0:A Modular Latent World-Action Stack for Compact Robot Policies

Yafei Zhang, Nan Wu
任务设定 构建模块化潜在世界-动作模型用于紧凑机器人策略
痛点动机 原始 LaWAM 模型各组件耦合紧密,难以替换与部署
解决方案 拆分为策略适配器、世界解码器与流匹配动作专家,换用更小骨干网络性能几乎不降
19

Biomechanical 3D Body: Self-Supervised Distillation of Biomechanical Pose from a 3D Body Foundation Model

R. James Cotton, J. D. Peiffer, Lucinda Williamson, John Leske, Georgios Pavlakos
任务设定 从单张 RGB 图像回归生物力学关节角度
痛点动机 现有人体网格恢复方法输出角度非生物力学定义,难满足临床分析需求
解决方案 SAM-3D-Body 基础上加装生物力学预测头,用逆运动学优化结果蒸馏训练
20

Everybody Tracking Every Body

Daeyun Shin, Yunhan Zhao, Shu Kong, Alexander C. Berg, Charless Fowlkes
任务设定 多人第一视角(egocentric)3D 人体姿态估计
痛点动机 他人的第三人称观测稀疏、间歇且可靠性不稳定,难以融合
解决方案 提出扩散模型融合头部运动与他人观测,按可靠性动态加权
21

Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory

Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li
任务设定 实时流式交互世界模型的长时程一致生成
痛点动机 自回归长时程生成难同时保持场景几何、动态一致性与相机控制
解决方案 提出几何感知记忆(patch-memory)与静态-动态解耦表示,结合两阶段蒸馏实现分钟级实时生成
22

Off-Manifold Refinement: Guiding Video Generators with a Frozen World Model

Hai Nguyen-Truong, Tuan-Anh Vu, Dang Huynh
任务设定 用冻结世界模型引导视频生成器提升物理合理性
痛点动机 视频生成器常出现悬浮、轨迹违反重力等物理错误,现有修正方法开销大
解决方案 推理时利用 V-JEPA 2.1 惊讶能量梯度,在采样中途注入修正,引导轨迹更符合物理
23

MASQ: Mask-Aware Spatiotemporal Quantization for Unsupervised Skeleton Action Segmentation

Xinyao Qin, Linxiang Peng, Youbao Ye, Di Yang, Jiangtao Wang
任务设定 无监督骨骼动作时序分割
痛点动机 空间掩码与离散量化结合易导致动作边界处编码抖动
解决方案 提出关节级结构化丢弃与掩码感知速度损失,解耦空间推断与时间平滑
24

$\mathcal{N}_0$-Foundation: Towards the Age of Tactile Intelligence

NeoteAI Team, Fudan TEAI Team
任务设定 构建触觉赋能的具身操作基础设施与数据集
痛点动机 现有操作数据集缺乏大规模同步视触觉数据
解决方案 打造视触觉采集系统及 3 万小时数据集 NeoData,训练可迁移的触觉表征模型 NeoForce
25

AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies

Hongbo Gao, Zeyu Ni, Xin Wen, Siyu Xu, Ruifeng Li
任务设定 冻结 VLA 策略执行操作时缺乏任务进度跟踪
痛点动机 开环执行易将失败动作误判为已完成,导致状态错误累积
解决方案 提出成就锚定记忆,凭物理证据验证子目标后才推进进度,实现闭环执行
26

Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations

Fabio F. Oberweger, Michael Schwingshackl
任务设定 JEPA 世界模型的隐空间规划扩展到点云几何观测
痛点动机 点云稀疏、无序且自遮挡,隐空间预测能否成立尚不明确
解决方案 把三种经典 JEPA 架构(冻结编码器/分布先验/动作敏感)迁移到点云,验证其规划能力与图像基线相当,动作敏感模型表现最强
27

GSPotential: Camera Potential Field for Sparse-View 3D Gaussian Splatting

Zeyuan An, Yanghang Xiao, Zhiying Leng, Yijun Feng, Xiaohui Liang
任务设定 稀疏视角下的 3D 高斯泼溅场景重建
痛点动机 视角监督分布不均,导致过拟合与几何伪影
解决方案 提出相机势场量化监督缺口,引导虚拟视角采样与保守高斯更新
28

FISICA: A Deployed Service for Plantar-Pressure and Posture Assessment with Ontology-Grounded Recommendation

Juhwan Song, Heejung Kim, Juntae Noh, Jonghak Ryu, Huiju Park, Junseong Lee, Dohyeon Ahn, Byungwoo Jo
任务设定 站立测量足压体态并驱动 3D 人体化身评估
痛点动机 传统按增益把角度映射到骨架不够精确
解决方案 同一测量函数同时评估真人与化身姿态,求解至二者一致,脊柱角度误差显著降低
29

Dancing Stick Figures: An Introductory Dataset for Training Video Generation Models

Jin Hyuk Cho
任务设定 构建训练视频生成模型的火柴人动作数据集
痛点动机 视频生成模型训练迭代慢、数据难获取、评测粗放
解决方案 发布小型合成动作数据集,含骨骼关节、深度等标注辅助精细评测
30

CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation

Yuxiang Xiao, Xibei Chen, Xin Zhou, Jie Chen, Yifeng Zhang, Guillaume Sartoretti
任务设定 智能体在陌生环境中进行视觉语言导航并持续探索
痛点动机 现有场景表示难以同时支持语义记忆与探索引导
解决方案 提出认知图场记忆融合场景图与语义前沿场,构建闭环导航框架
31

Flow-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models

Yanchen Huo, Ziying Song, Yadan Luo
任务设定 JEPA 世界模型中预测未来潜在状态序列
痛点动机 自回归预测误差累积,且对视觉噪声敏感
解决方案 提出 Flow-JEPA ,用条件流匹配联合生成未来潜在轨迹替代逐步回归
32

Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution

Mohammad Nazeri, Alexandyr Card, Samira Huber, Anuj Pokhrel, Yujun Wang, Ruben Hammele, Daeun Song, Sören Pirk, Xuesu Xiao
任务设定 机器人导航世界模型的实时规划与控制
痛点动机 生成模型与规划器流形不对齐,需解码像素才能评估候选动作,拖慢实时性
解决方案 提出 Hydra ,用离散隐空间规划统一视觉/位姿/动作表征,再以流匹配生成连续执行轨迹
33

ReconSplat: Generalizable 3D Scene Reconstruction Beyond Observed Views

Giuseppe Stracquadanio, Kevin Raj, Julia Grabinski, Stefan Roth
任务设定 前馈式 3D 场景重建与未观测视角生成
痛点动机 现有方法难以兼顾外推视角合理性与几何一致性
解决方案 结合 3D 高斯溅射与多视角潜在扩散模型联合优化外观和深度
34

Text-Driven Artistic Staging: Pose, Lighting, and Camera References from Paintings

Yunge Wen
任务设定 从情感文本联合生成人体姿态、光照与相机配置
痛点动机 现有生成方法独立建模各要素,难以协同表达叙事情感
解决方案 从绘画重建 SMPL 人体及光照相机参数建数据集,训练 flow-matching 模型生成 3D 场景编排
35

RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction

Tianyi Wang, Jiazhou Chen, Yiming Xu, Xiangyu Li, Tianyi Zeng, Chih-Hsien Chou, Ning Lu, Liang Peng, Junfeng Jiao, Christian Claudel
任务设定 评估世界模型生成视频的 3D 场景一致性
痛点动机 现有基准缺乏统一 3D 协议,难分重建与生成误差
解决方案 构建 RoboPhys-3D 基准,用同一 3D 重建流程处理生成与真实视频,提出 RoboPhyscore 等指标
36

RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction

Zifan Wang, Ziang Ren, Pengyang Shi, Zirui Wang, Chenghuai Lin, Tianze Wang, Zekun Qi, Liangliang Zhao, He Wang, Li Yi
任务设定 人形机器人根据语音实时生成同步手势
痛点动机 数据稀缺、模态遮蔽和 sim-to-real 安全差距三大难题
解决方案 分层语义-声学对齐器提取音频线索,以扩散 Transformer 流式生成手势,MPC 保障安全执行