Daily Paper Feed

2026 年 09 月 14 日 星期一 · 共 18 篇相关论文 · 全部存档
1

Embodied-BenchForge: A Closed-Loop Agentic Workflow for Embodied Benchmark Construction

Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Zhe Ji, Jinshan Lai, Xi Ren, Danyang Li, Zheng Yang, Jianwei Hu, Qiang Ma
任务设定 用智能体工作流自动构建具身智能评测基准
痛点动机 现有构建方法各阶段孤立,中间产物缺乏校验易致缺陷传播
解决方案 技能编排合成生成基准产物,结合校验-修复闭环保证质量
2

Dynin-Robotics: Omnimodal Unified Diffusion Vision-Language-Action Model

Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do
任务设定 统一扩散模型实现视觉-语言-动作机器人策略学习
痛点动机 现有方法难以在同一模型中融合目标预测与动作生成
解决方案 全模态掩码扩散统一编码语言/观测/目标/动作,支持目标引导与动作联合优化
3

UniPart: Towards Zero-shot Language-Grounded 3D Part Segmentation for Embodied Interaction

Xinqiang Yu, Zekun qi, Jiawei He, Wenyao Zhang, Xuchuan Chen, Guaocai Yao, Li Yi, Zhaoxiang Zhang, He Wang
任务设定 面向具身交互的开放词汇 3D 部件分割
痛点动机 现有 3D 模型难以零样本泛化到细粒度部件理解
解决方案 提出跨模态 Transformer UniPart ,结合 CLIP 文本嵌入,并构建大规模数据集 LangPart-1M 训练
4

VideoTok4D: A 4D-Aware Video Tokenizer for Compact World Representation

Xinyi Chen, Hanxin Zhu, Xijun Wang, Xingrui Wang, Sen Liang, Xin Li, Zhibo Chen
任务设定 视频转 4D 场景的高效压缩表征
痛点动机 现有视频编码仅按 2D 图像处理,难紧凑表达 4D 动态场景
解决方案 提出 4D 感知视频分词器,分离静态/动态 token ,结合轨迹感知注意力与扩散先验实现高效 4D 生成
5

MGAvatar: Mesh-Bound Gaussians for Head Avatar Geometry and Appearance Modeling

Lei Shi, Sen Peng, Zhiyang Deng, Zhonggui Chen, Xiaohu Guo, Baorong Yang, Xiao Dong
任务设定 基于网格绑定高斯建模头部几何与外观
痛点动机 FLAME 等参数模板缺乏个性化先验,难建模发丝服饰
解决方案 提出高斯-网格混合表示,顶点绑定高斯建几何,面片绑定高斯建外观
6

SCQ: Stabilizing Conservative Q-Learning with Sigmoid-Bounded Entropy

Xiefeng Wu, Shu Zhang, Zhaojie Chu, Mingyu Hu
任务设定 解决离线到在线强化学习中值估计不稳定问题
痛点动机 标准 log-entropy 项可能为负,导致策略更新不稳定
解决方案 提出 SCQ ,用 Sigmoid 有界熵替代原熵项,在人形机器人等真实机器人平台验证有效
7

Assisted Spatial Cognition Through Vision-Language Models

H. Riaz, J. B. Fernandez, I. Mills, D. Hickey, F. Cleary, M. I. Ali
任务设定 为视障与神经多样性人群提供空间认知导航辅助
痛点动机 现有导航辅助缺乏完整的 3D 场景理解能力,自主性受限
解决方案 手机拍视频经 SLAM3R 生成点云,结合 SpatialLM 构建 3D 场景供 LLM 解读
8

KAD-Net: Kinematics-Aware Decoupled Learning for Robust 3D Hand Pose Estimation from a Single Depth Image

Jun Lu, Zhenming Chen, Lin Chen, Kanlun Tan, Xiaoling Li, Qiao Liu
任务设定 基于单张深度图的 3D 手部姿态估计
痛点动机 手部拓扑关系复杂、自遮挡严重,多任务特征相互干扰
解决方案 提出运动学感知解耦网络,用手指拓扑约束增强远端关节表征,解耦 2D 定位与深度估计任务
9

PhysioAI: Clinical Knowledge-Guided Semantic Supervision for Skeleton-Based Physiotherapy Action Recognition

Jie Cao, Euijoon Ahn, Anwar Hassan, Jinman Kim
任务设定 基于骨骼序列识别物理治疗康复动作
痛点动机 康复数据稀缺、动作类间差异细微,易识别混淆
解决方案 CLIP 编码临床知识词典生成语义锚点,指导骨骼时空模型训练,推理仅用骨骼
10

Partition-Invariant Tuning for 3D Scene Understanding

Hongqiang Lin, Tianle Wang, Shuiwang Li, Dongxu Zhang, Yiding Sun, Zihao Guo, Dongfu Yin
任务设定 3D 场景级点云的参数高效微调
痛点动机 全量微调点云基础模型成本高,现有 PEFT 忽略分块导致的表征偏移
解决方案 场景感知结构适配器融合局部与全局特征,梯度子空间优化稳定更新方向
11

IMPLY: Physically Anchored Consistency for World-Model Rollouts

Aman Mehta, Riya Baviskar
任务设定 检验世界模型多次推演结果的物理一致性
痛点动机 现有自一致性检验不懂物理,可能给忽略物体的模型打满分
解决方案 逆向物理模拟器读取推演隐含的物理参数,以标定推动锚定一致性打分
12

UniMo: Unifying Human and Animal Motion Generation

Zeyu Zhang, Zhiyuan Zhang, Siheng Wang, Yiran Wang, Danning Li, Ian Reid, Richard Hartley
任务设定 统一人类与动物的运动生成任务
痛点动机 动物骨骼拓扑多样,专用数据集规模有限
解决方案 转换骨骼为点云表示并动态采样关节,构建大规模数据集 UniML3D
13

AnchorVLN: Geometry-Anchored Vision-Language Grounding Reasoning for Open-Vocabulary Navigation

Long Giang Vu, Chengkai Yao, Yuxin Liu, FNU Aryan, Rajath Chandrashekar Aralikatti
任务设定 无地图室内环境的开放词汇导航任务
痛点动机 VLM 难以直接输出精确的距离/方位等度量信息
解决方案 让 VLM 只负责语义推理,几何模块单独计算距离与方位
14

Amortized Low-Rank Adaptation for Model-Based Reinforcement Learning

Fernando Palafox, David Fridovich-Keil
任务设定 世界模型快速适应未知测试环境
痛点动机 梯度微调太慢,上下文学习表达能力又不足
解决方案 用超网络生成 LoRA 适配器,测试时几秒内完成适配
15

Single-Query Person-Centric Bimanual Hand-Object Interaction Detection

Jonghyun Kim, Junho Roh, Yubin Yoon, Hyotae Lee, Jongkuk Park, Taehwan Hwang, Jaechul Kim, Jungho Lee
任务设定 检测多人场景中人体级双手物体交互
痛点动机 现有方法以手为中心,多人场景易致手部归属混淆
解决方案 单个 query 预测人体框、姿态、双手及交互目标,通过 手部-query 匹配 直接定位交互对象
16

Does Video Memory Use What It Retrieves? A Causal Audit of Memory Specificity

Aditi Tiwari, Akshit Bhalla, Darshan Prasad, Heng Ji
任务设定 审计视频 世界模型 的记忆检索是否真正被使用
痛点动机 传统记忆消融只测有无增益,无法判断内容是否关键
解决方案 提出 读时记忆替换 法,替换检索内容观察性能变化,分离记忆增益与 内容特异性
17

MoPA: Coordinated Mobile Manipulation via Subsystem-Specific Perception Alignment

Guangyu Chen, Qiwei Liang, Shaolong Zhu, Tianxing Chen, Zikuan Xiao, Yifan Xie, Lingfeng Zhang, Ping Luo, Renjing Xu, Wenbo Ding
任务设定 协调移动机器人 底盘机械臂 的感知-动作对齐
痛点动机 现有策略共享感知表征,子系统感知-动作对应关系隐式化
解决方案 双感知流 分别提取底盘/机械臂特征,结合 耦合流匹配 生成协同动作
18

Pelican-Sim 1.0: A General World Model Simulator for Embodied Intelligence

Shilong Zou, Shilin Zhang, Yingji Zhang, Yuhang Huang, Yi Zhang, Zeyuan Ding, Han Dong, Junwei Liao, Yong Dai, Jian Tang, Xiaozhu Ju
任务设定 构建通用世界模型模拟器,预测机器人动作后的未来观测
痛点动机 现有模型难以统一多种机器人本体,动作可控性不足
解决方案 用统一动作空间和动作-视觉注入桥接像素与动作,结合稀疏 MoE 及因果蒸馏实现 4 步快速 rollout