Daily Paper Feed

2026 年 09 月 11 日 星期五 · 共 15 篇相关论文 · 全部存档
1

Revisiting Avatar-As-Image: High-Fidelity Registration is All You Need

Margaret Kostyrko, Yuxuan Xue, Garvita Tiwari, Gerard Pons-Moll
任务设定 从穿衣扫描恢复高保真 SMPL(-X)+D 配准与 UV 纹理化身
痛点动机 现有 UV 化身方法因配准精度不足导致质量受限
解决方案 符号绕数约束保证身体在衣内,配合由粗到细位移优化恢复细节
2

ActSafeGuard: Differentiable and Training-Aligned Constraint Enforcement for Flow-Matching Policies

Jianming Ma, Rongjun Jin, Xiaxi Si, Yang Zhang, Yiheng Li, Yue Gao
任务设定 VLA/世界动作模型 生成的动作施加硬性物理约束
痛点动机 现有方法缺乏逐步安全保证或训练推理不一致
解决方案 设计可微安全层,用射线缩放算子把约束嵌入训练,实现 100% 步安全率
3

MMGait: Benchmarking and Unifying Gait Recognition across Heterogeneous Modalities

Saihui Hou, Chenye Wang, Qingyuan Cai, Aoqi Li, Yongzhen Huang
任务设定 统一评测 RGB、红外、深度、LiDAR、雷达等多模态步态识别
痛点动机 现有步态识别局限于 RGB 数据,跨模态融合与检索评测缺失
解决方案 提出 MMGait 基准与 OmniGait++ 模型,共享身份编码器统一单/跨/多模态识别
4

World in World: Explore the World with World Models

Chenxi Song, Yanming Yang, Chi Zhang
任务设定 基于世界模型的自由视角探索与长时域视频重访
痛点动机 现有方法依赖任务专属模块或额外训练,控制不够灵活
解决方案 提出免训练的推理时接口,复用冻结视频模型自注意力融合多源证据实现可控生成
5

Recursive Code World Models: Building Complex Worlds through Recursive Scene Programs

Zhiqi Li, Yuxuan Liao, Bo Zhu
任务设定 从单张图像重建复杂 3D 场景为可执行代码
痛点动机 代码世界模型知道怎么表示,却不知如何构建复杂场景
解决方案 提出递归场景程序表示,用全局-局部-全局递归求解器逐层细化重建
6

BridgeMatch: Conditional Transport Bridges in Matching Matrix Space for 3D Deformable Registration

Qianliang Wu, Haobo Jiang, Guangwei Gao, Shuo Chen, Jin Xie, Jian Yang, Yaqing Ding
任务设定 非刚性点云的可变形配准,含人体等动态重建场景
痛点动机 粗到细方法剪枝会丢弃正确但弱的匹配假设
解决方案 扩散模型估计全分辨率软匹配矩阵,再通过条件传输桥精细化
7

Multi-Modal Controlled Coherent Motion Generation

Yifei Liu, Qiong Cao, Hongwei Yi, Huaiguang Jiang, Changxing Ding
任务设定 语音、文本、轨迹联合驱动 3D 人体动作生成
痛点动机 多模态对齐数据稀缺,直接拼接易致动作不协调
解决方案 提出扩散模型框架 MOCO ,各模态独立生成动作后按空间规则组合,迭代去噪协调统一
8

2AM: Grounding Agent-Side Memory as Guidance for Steerable Action Models in Long-Horizon Manipulation

Yutong Hu, Fengjiao Chen, Xuezhi Cao, Renaud Detry
任务设定 长时程机器人操作中记忆与动作模型的解耦
痛点动机 VLA 与规划器耦合,失败难以归因于策略还是语言接口
解决方案 多模态 Agent 持有任务记忆并生成子任务提示,无状态动作模型 仅按提示执行
9

SAMV-DUSt3R: Instance-Centric 3D Scene Decoupling from Sparse Multi-Views

Langxu Zhao, Zuan Gu, Yingdan Zhang, Pengfei Zhao, Tianhan Gao
任务设定 从稀疏多视角图像重建并解耦 3D 场景中的物体实例
痛点动机 现有重建方法多阶段拼接,难以做到物体级解耦
解决方案 SAM2 掩码注入 MV-DUSt3R ,端到端引导网络聚焦目标实例并选优参考视角
10

From Evaluation to Enhancement: Benchmarking and Improving Think-with-Video Reasoning for Video Generative Models

Meng Luo, Yicheng Liu, Jiahao Wang, Yuanxing Zhang, Xin Tao, Pengfei Wan, Kun Gai, Hao Fei
任务设定 评估视频生成模型能否'用视频思考'物理规律与意图
痛点动机 现有基准混淆视觉质量与认知正确性,难以诊断推理短板
解决方案 提出 VWG-Bench 多维诊断基准,并用 Vid-PRE 提示重写器把推理负担转移给专用 VLM
11

Beyond Visual Quality: Evaluating Physical Consistency under Ego-Motion with EgoGenEval

Yilin Long, Chenming Zhu, Zitang Gou, Jingli Lin, Tai Wang
任务设定 评估视觉生成器自运动下的物理一致性
痛点动机 现有基准只看单帧画质,忽略具身场景的空间一致性
解决方案 提出无位姿几何基准 EgoGenEval ,分离评测相机运动定位与场景状态保持
12

IMLE-VLA: Fast Single-Step Action Generation for Vision-Language-Action Policies

Kian Hosseinkhani, Qinhe Peng, George Shramko, Mehran Aghabozorgi, Jianing Qian, Tristan Engst, Alireza Moazeni, Dinesh Jayaraman, Ke Li
任务设定 VLA 策略单步生成机器人动作,替代多步采样
痛点动机 扩散/流匹配动作头需多步迭代,推理慢导致机器人动作卡顿
解决方案 提出 IMLE-VLA ,用 cIMLE 目标训练单步条件生成器,兼顾多模态动作覆盖与高频推理
13

ReactHuman: A Physics-Grounded Benchmark for Human-Like Reactive Decision-Making in Embodied Multimodal LLMs

Yizhan Li, Jianxin You, Mengyang Xiong, Yinhuan Chen, Zicheng Zhao, Dekun Wu, Dongqing Zhang, Bang Liu
任务设定 评测具身多模态 LLM 对突发家居危险的反应式决策能力
痛点动机 现有基准只做被动物理问答或长时任务,缺乏即时安全反应的检验
解决方案 构建物理仿真基准 ReactHuman ,让模型操控虚拟人形应对上千个刚体仿真危险场景并多指标打分
14

MHE-Former: Multi-Hypothesis Transformers via Entropy Maximization for 3D Mesh Recovery

Boshu Jia, Rongyu Chen, Linlin Yang, Zihao Liu, Yingjie Chen, Zhongqun Zhang, Zhulin Tao, Shaohui Lin, Xiaoyu Wu, Libiao Jin, Baochang Zhang, Angela Yao
任务设定 单目 3D 手部/身体网格恢复中的遮挡歧义问题
痛点动机 确定性方法只回归单一解,遮挡时过度自信
解决方案 提出多假设 Transformer (熵最大化)生成多样假设,再借助 VLM 语义理解选出最优解
15

HuRo: Robotizing Human Videos for Scalable VLA Pretraining

Jinho Jeong, Se June Joo, Jaehyun Kang, Dongyun Kim, Yena Kim, Hanjung Kim, Seon Joo Kim
任务设定 将人类视频转化为可用于 VLA 预训练的机器人数据
痛点动机 真实机器人数据昂贵,人机具身差距难以弥合
解决方案 构建机器人化流水线将人类视频对齐为机器人观测与动作轨迹,形成 HuRo 数据集预训练