Daily Paper Feed

2026 年 08 月 04 日 星期二 · 共 55 篇相关论文 · 全部存档
1

WorldExam: Benchmarking World Models from Apparent Appearance to Inherent Reactivity

Yuxue Yang, Shuyao Shang, Jiahe Wang, Zitong Zhou, Liang Tan, Junhan Zeng, Ruizhi Li, Junyan Li, Yu Liu, Xiao Yang, Yong Li, Jun Zhu, Hongsheng Li, Tieniu Tan, Lue Fan, Zhaoxiang Zhang
任务设定 构建评测世界模型内在反应性的分级基准
痛点动机 现有基准只看画面质量与指令遵循,忽略世界反应性
解决方案 提出 WorldExam 四层次基准,含场景外推、目标导向行为的合理性评测
2

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su
任务设定 为双臂机器人策略设计世界动作模型的选择性干预层
痛点动机 预测未来合理≠该改动作,需保证协调有效性才干预
解决方案 提出协调契约机制,仅在满足所有约束且有明显收益时才替换动作
3

DF$^3$: World Modeling via Decoder-Free Feature Forecasting in Autonomous Navigation

Jiaming Chen, Guoan Xu, Aoshen Huang, Haozhuo Zhang, Yang Li, Wei Pan
任务设定 自动驾驶/机器人导航中基于视频的世界模型未来状态预测
痛点动机 像素级生成开销大,隐空间方法仍依赖笨重解码器
解决方案 提出无解码器特征预测框架 DF3 ,在冻结视觉基础模型末端注入可学习查询,结合运动感知上下文融合直接预测未来帧特征供下游任务使用
4

GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience

Sitong Gong, Caixin Kang, Tianyu Yan, Guo Chen, Bo Zheng, Kaipeng Zhang, Yunzhi Zhuge, Xiang Ruan, Huchuan Lu, Yifei Huang
任务设定 可穿戴设备基于连续视频流构建记忆,支持问答与主动提醒
痛点动机 现有视频记忆系统仅支持查询检索,被动与主动辅助机制割裂
解决方案 提出免训练框架 GROVE ,将视频流增量整合为分层记忆(时刻/片段/跨天模式),共享统一检索接口
5

Faster-WAM: Do World Action Models Need Deep Action Modules?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang
任务设定 探究世界动作模型的动作模块是否需要与视频骨干等深
痛点动机 现有 WAM 动作模块深度绑定视频骨干,计算开销大、推理延迟高
解决方案 提出 Dock of Transformer 范式,用单层动作头对接预训练视频骨干多层特征,推理仅需 66.5ms
6

Sen-Cap: Sensor-Flexible and Noise-Resilient Human Motion Capture via LiDAR-Camera Integration

Aoru Xue, Yujing Sun, Yiming Ren, Kwok-Yan Lam, Mao Ye, Yuexin Ma
任务设定 融合 LiDAR 与相机实现灵活、抗噪的 3D 人体动作捕捉
痛点动机 多传感器显式标定易出错,噪声/失效场景下鲁棒性差
解决方案 提出免标定的跨传感器姿态估计器,配合抗噪轨迹跟踪迭代优化
7

GenPrior: Unleashing Text-to-Motion Generative Priors for Zero-Shot Skeleton-based Action Recognition

Jidong Kuang, Hongsong Wang, Jie Gui
任务设定 零样本骨骼动作识别,对齐骨骼特征与文本语义
痛点动机 文本原型缺乏几何结构,存在语义-运动学鸿沟
解决方案 利用预训练文本到动作生成先验提炼运动学原型,通过门控特征融合注入文本嵌入
8

VARPose: Flexible 2D Pose Densification via Visual Autoregressive Modeling for Enhanced 3D Lifting

Kaiyuan Pu, Tiantian Yang, Dan Zeng
任务设定 将稀疏 2D 姿态自适应致密化,增强 3D 姿态提升与网格恢复
痛点动机 稀疏 2D 姿态解剖信息不足,限制下游 3D 任务精度
解决方案 提出视觉自回归建模的姿态分词器,以由粗到细的下一尺度预测统一多密度姿态表示
9

PhyCheck: Fine-Grained Evidence-Grounded Dataset for Physical Law Understanding in Video-LLMs

Zhongjie Ba, Shengwang Xu, Peng Cheng, Jinyang Zou, Ting Yu, Zhibo Wang, Zhan Qin
任务设定 评估 Video-LLM 对物理规律的理解能力
痛点动机 现有基准只测生成视频质量,难以系统评测物理理解
解决方案 构建 PhyCheck 问答数据集,含粗/细粒度物理合规判断及诊断子集校准
10

HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams

Shivani Mall, Swarnim Jain, Joao F. Henriques
任务设定 研究超高分辨率(含第一视角)视频的高效识别
痛点动机 分辨率提升使卷积/Transformer 计算内存呈平方级增长
解决方案 用残差流做高分辨率缓冲,经 log-polar 形变实现类眼动局部聚焦
11

MANGO-Grasp: Mahalanobis Fields over Geometry-Oriented 3D Gaussians for Cross-Embodiment Dexterous Grasping

Heng Zhang, Kevin Yuchen Ma, Mike Zheng Shou, Weisi Lin, Yan Wu
任务设定 为异构多指灵巧手合成跨形态稳定抓取姿态
痛点动机 现有方法物体几何表征弱,机器人描述子未兼顾形态与运动学
解决方案 几何朝向 3D 高斯表征物体表面,关键点编码形态-运动学描述子,以马氏距离场建模接触并指导抓取优化。
12

UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation

Liming Tan, Ye Chen, Hao Zhang, Lirong Qian, Feifei Li, Bingbing Ni
任务设定 多人场景下人体运动与相机的联合可控视频生成
痛点动机 运动图与相机嵌入异构,两者难以协同推理归因
解决方案 提出运动相机视觉代理( MCVP ),把 3D 人体几何与相机轨迹统一渲染为视觉线索
13

ProWorld: Progress-Aware Hyperbolic World Models for Long-Horizon Visual Goal Reaching

Zihan Liu, Yuzhe Zhuang, Yuanzu Li, Wanshuang Gou, Jiahong Liu, Min Zhou, Menglin Yang
任务设定 长时程视觉目标导向的世界模型规划
痛点动机 局部预测一致不能保证轨迹持续朝目标推进
解决方案 提出双曲几何世界模型,用目标条件的进度顺序建模轨迹方向性进展
14

PhotoHOI: Synthesizing 3D Hand-Object Interactions from a Single RGB Photograph

Zhenhao Zhang, Jiajun Zhang, Wei Min, Yebin Liu
任务设定 从单张 RGB 照片+语言指令生成 3D 手物交互序列
痛点动机 现有方法依赖预定义物体几何/轨迹,难以泛化到真实场景
解决方案 VLM 解析任务并规划物体轨迹,学习接触与抓取先验生成手部动作
15

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen
任务设定 提升 VLM 的空间推理能力且不引入额外 3D 输入
痛点动机 现有方法靠外部 3D 先验/编码器,增加复杂度并损害通用能力
解决方案 设计即插即用空间模块挖掘 VLM 内在空间知识,用伪深度和相机信息监督训练
16

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills

Gaytri Jena, Kapil Wanaskar, Vinija Jain, Aman Chadha, Vasu Sharma, Amitava Das
任务设定 综述机器人学习两条路线:权重策略代码技能
痛点动机 梳理 VLA 模型与代码即策略方法在自我改进能力上的差异
解决方案 按自我改进程度对 77 个代表系统分类,探讨机器人技能市场生态问题
17

WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model

Leyang Chen, Junyi Wu, Shaoqiu Zhang, Yulun Zhang
任务设定 加速扩散世界模型的视频未来帧生成推理
痛点动机 重复 Transformer 评估使推理速度极慢
解决方案 用风险估计器追踪近似误差累积,结合条件感知的潜在代理跳过部分计算,实现 4.92 倍加速
18

G-Skin: Learning to Bind 3D Gaussians with Generative Visual Priors

Yuxin Yao, Kendong Liu, Shiqi Zhou, Jiazhi Xia, Junhui Hou
任务设定 为 3D 高斯资产绑定骨骼以实现动画化蒙皮
痛点动机 高质量高斯蒙皮数据稀缺,网格类方法难以泛化到新数据
解决方案 用 2D 视觉基础模型蒸馏运动先验生成伪监督,结合几何正则化优化蒙皮权重
19

SpatialQuery: Benchmarking Geometry-Grounded Multi-Instance Spatial Reasoning in Vision-Language Models

Hai Nguyen, Tung Vu, Cong Tran
任务设定 评估 VLM 对室内多实例物体的几何空间推理能力
痛点动机 VLM 语义理解强,但难以做同类多物体的度量距离比较
解决方案 免训练地将场景转为鸟瞰图块表示,配合不确定性感知思维链提升推理
20

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou
任务设定 把生物湿实验协议转化为机器人可执行动作序列
痛点动机 协议为人类书写,隐含状态条件难以直接映射到机器人执行
解决方案 检索增强解析加校验模块提取步骤,再用结构化 Schema 约束生成动作,支持 VLA 训练
21

StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring

Xiangyue Zhang, Jianfang Li, Jiaxu Zhang, Kaixing Yang, Steven Hoi
任务设定 流式生成与语音同步的 3D 协同手势动作
痛点动机 开环流式生成误差累积,导致长序列姿态漂移
解决方案 提出生成-检索-精化闭环框架,检索关键姿态作为锚点约束轨迹,抑制漂移
22

Dynamic Resolution Routing for Efficient Egocentric Grounding

Huixin Sun, Wangbo Zhao, Fanyue Wei, Qiuxia Lin, Pengzhan Sun, Angela Yao
任务设定 第一人称视觉中高效的小物体视觉定位任务
痛点动机 高分辨率输入才能精准定位,但视觉 token 开销过大
解决方案 提出动态分辨率路由,低分辨率获取全局信息,轻量路由器激活物体区域高分辨率图块
23

Rapid Embodiment Adaptation for Quadrupedal Locomotion

Dichen Li, Bo Ai, Nico Bohlinger, Jan Peters, Hao Su, Henrik I. Christensen
任务设定 四足机器人硬件突变后的运动控制快速适应
痛点动机 关节受限、负重等硬件变化易使学习策略失效
解决方案 具身随机化训练通用策略,配合轻量在线适配模块半秒内识别硬件变化并调整控制
24

GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization

Baihan Yang, Tiexin Li, Yuheng Liu, Xin Lin, Xinke Li, Xiaohui Xie, Truong Nguyen
任务设定 3D 高斯溅射场景中的人工引导物体选择
痛点动机 现有方法需重训练或密集多视角 SAM 观测,计算开销大
解决方案 免训练方法,将高斯基元聚合成超点图,用图割能量最小化把稀疏涂鸦传播为完整物体
25

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji
任务设定 提出 DunphyBench 评测具身智能体长时程家居决策
痛点动机 长历史多模态信息噪声大,拖累 VLM 智能体决策质量
解决方案 提出 MeMento :按用户偏好压缩记忆为固定 token 集
26

DynamicManip: Enabling Dynamic Manipulation from a Single Static Demonstration

Haoran Liao, Pengyue Wang, Shuoyu Chen, Kehan Cheng, Xuhang Chen, Yuhao Lin, Mu Lin, Zhizhao Liang, Xiaoyi Fan, Chengyi Xing, Dan Niu, Yi-Lin Wei, Wei-Shi Zheng
任务设定 从单个静态演示学习动态操作机器人策略
痛点动机 动态场景组合爆炸、决策需实时低延迟
解决方案 静态转动态数据增强 + 动态自适应低延迟模仿策略
27

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su
任务设定 具身智能体 LLM 重规划的延迟与成本控制
痛点动机 上下文膨胀导致重规划延迟长尾,易超时
解决方案 提出 BRACE 预算控制器 + E-RECAP token 剪枝降低延迟
28

GenTrack: Physical Alignment for Robot-Native Motion Generation and Zero-Shot Humanoid Tracking

Zeyu Ling, Xinyao Yu, Renye Yan, Jikang Cheng, Zhanke Wang, Qing Shuai, Changqing Zou
任务设定 零样本人形机器人动作跟踪与动作生成对齐
痛点动机 生成动作运动学合理但机器人难以执行的鸿沟
解决方案 生成器-跟踪器在线协同训练,缩小可执行性差距
29

Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them

Carlota Parés-Morlans, Nils Kuhn, Isabel Liu, Alberta Longhini, Jeannette Bohg
任务设定 分析 VLA 模型在接触密集操作任务中的失败原因
痛点动机 精度失败源于流匹配训练偏差,力失败源于力信号特性
解决方案 提出 FACT 分别针对两类失败设计机制并结合
30

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu
任务设定 策略表征空间中构建几何感知世界动作模型
痛点动机 现有 WAM 表征难兼顾动作相关性与几何感知
解决方案 提出 SG-WAM :动态 token + 自引导世界预测器联合训练
31

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen
任务设定 仅用片段级标注学习帧级运动-语言对齐
痛点动机 长文本描述缺少帧级监督,限制精细动作定位与生成
解决方案 将对齐建模为最优传输问题,用 Sinkhorn 迭代推断伪帧级对应
32

Astrolabe: Spherical-Map Guidance Across Diffusion Pipelines for Full-Body Capture from Unconstrained Images

Shuliang Zhu, Qi Wang, Ryugo Morita, Jinjia Zhou
任务设定 从非受控图像重建全身人体(几何+外观)
痛点动机 姿态遮挡多变导致对应关系不可靠,扩散先验难复用
解决方案 提出 Astrolabe ,用固定视角球面图( SPH )转噪声偏移引导扩散重建
33

Hermite Curves as Trajectory Priors for Vision-Language-Action Models

Qi Lv, Jianming Xing, Zhao Yang, Mingyuan Yao, Yinan Shi, Yawei Jueluo, Mike Zheng Shou, Xiang Deng
任务设定 VLA 机器人操作中动作轨迹的结构化建模
痛点动机 逐时间步预测导致动作生硬、边界不连续
解决方案 Hermite 曲线参数化轨迹,作为训练时归纳偏置提升平滑度和成功率
34

DynActiveGS: Active Gaussian Splatting for Dynamic Scene Reconstruction

Hongbo Duan, Pengting Luo, Chengzhi Zhao, Yuanhao Chiang, Fangming Liu, Xueqian Wang
任务设定 动态环境中机器人自主探索式 3D 场景重建
痛点动机 动态物体运动会污染观测,破坏重建质量
解决方案 基于 3D 高斯泼溅,分解结构与动态不确定性,指导视角选择与路径规划
35

MiniWorld: Democratizing the Training of Video World Models from Scratch

Yian Zhao, Ruochong Zheng, Hongcan Guo, Yu Yan, Jian Zhang, Jie Chen
任务设定 从零训练可复现的流式视频世界模型
痛点动机 现有方法依赖预训练模型改造,存在训练-推理范式不匹配问题
解决方案 块因果扩散 Transformer 结合流匹配从零训练,配合滚动 KV 缓存实现流式推理
36

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das
任务设定 预测密集拥挤全球南方城市场景的未来状态
痛点动机 现有 JEPA 世界模型难以处理高密度、遮挡严重的交互场景
解决方案 提出 FactorJEPA ,将未来分解为布局、智能体、交互三通道联合预测
37

WAM-Diff2: Hierarchical AR-to-Diffusion Distillation for Highly Efficient Autonomous Driving VLA

Zhihao Zhu, Hanlin Shang, Mingwang Xu, Feipeng Cai, Zhuolin He, Yaoyi Li, Jianhua Han, Hang Xu, Siyu Zhu
任务设定 将自回归 VLA 自动驾驶模型转为并行扩散策略
痛点动机 自回归解码延迟高且有暴露偏差,扩散策略又缺通用推理力
解决方案 提出三阶段分层蒸馏,渐进将预训练 VLA 转化为离散扩散模型
38

VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks

Dongfu Yin, Jinquan Zhang
任务设定 评估并防御 VLA 机器人的物理注意力劫持攻击
痛点动机 打印对抗补丁能严重干扰动作条件的跨模态注意力,安全隐患大
解决方案 提出 APFT 微调稳定时空注意力、加强几何一致性,零推理开销提升鲁棒性
39

KING: Embodiment-Aware Kinematic Graph Neural Network for Unified Motion Representation of Legged and Wheeled Robots

Taku Okawara, Aoki Takanose, Kenji Koide, Shuji Oishi, Masashi Yokozuka
任务设定 统一表示轮式与腿式机器人运动学以估计里程计
痛点动机 现有学习式运动学模型仅适配单一本体,难泛化到新机器人
解决方案 提出基于图神经网络的 KING 模型,将机器人本体统一建图,可少样本快速适配新机体
40

GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors

Jibao Yuan, Yuhui Zhao, Yinzhen Lv, Chao Xu, Shun Li, Chenxi Deng, Shaofei Chen
任务设定 冻结抓取检测器的候选抓取重新排序
痛点动机 检测器置信度与抓取质量不符,好抓取常被排后
解决方案 融合候选属性、局部几何与物体上下文, Transformer 预测质量并重排
41

ORCESTRA: VLM-driven Visual Robot programming in Mixed Reality

Ivan Snegirev, Elizaveta Semenyakina, Mikhail Konenkov, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou
任务设定 混合现实中通过 VLM 编程机器人数字孪生
痛点动机 语言引导的机器人编程缺少物理部署前的安全验证
解决方案 混合现实空间摆放机器人孪生并示教轨迹,用视觉语言模型把语音/文字指令转成可预览确认的结构化操作计划
42

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen
任务设定 综述动态环境下学习式机器人运动规划方法
痛点动机 传统规划难应对动态障碍、预测不确定性与多智能体交互
解决方案 提出按学习角色划分的分类法,涵盖策略学习、规划增强与混合式方法
43

Why Does the Future Branch? Identifiable Closure Tests for Stochastic Physical World Models

Yibin Dong
任务设定 检验随机物理世界模型能否区分不确定性来源
痛点动机 同一预测分布可能源于状态混叠或过程噪声,二者不可区分
解决方案 提出 ClosurePairs 干预式评估协议,配对微观状态与外生扰动实现方差分解
44

Latency-Tolerant Cloud-Edge Collaborative Vision-Language-Action Models via Emergent Representational Specialization

Daojie Peng, Fulong Ma, Bingtao Wang, Sheng Wang, Jun Ma
任务设定 云边协同部署 VLA 机器人策略模型
痛点动机 网络延迟使云端语义推理与本地闭环控制难以协同
解决方案 将时序错位视为表征学习问题,云端编码延迟观测为慢变任务特征,边缘头融合本地视觉做实时修正
45

DexMani: Human-Derived Manipulability Guidance for Dexterous Rotation

Xiaoyang Chen, Shengcheng Luo, Haoran Guo, Jiaming Jiang, Wanlin Li, Ziyuan Jiao, Chenxi Xiao
任务设定 灵巧手物体旋转操控的接触序列学习
痛点动机 现有强化学习未显式建模接触转换对后续可操作性的影响
解决方案 将人类演示转化为接触条件化操作能力先验,指导跨本体强化学习获得旋转技能
46

SSTG-Nav: Metric-Grounded Spatial-Semantic Topological Graphs for Reusable Object Navigation

Daojie Peng, Bingtao Wang, Jun Ma
任务设定 服务机器人重复执行 物体导航 任务
痛点动机 一次性探索式方法效率低,地图误差易导致任务失败
解决方案 构建可复用的 度量-语义拓扑图 记忆,融合多视角证据并保留 故障恢复 候选点
47

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao
任务设定 根据自然语言在 3D 场景中定位目标物体
痛点动机 现有方法语义理解封闭集、视角推理依赖多视图聚合,泛化弱
解决方案 利用 VLM 做开放词汇语义增强,并对 多视角假设 逐一验证
48

SpatialAfford: Teaching Compact VLMs Where to Look and Where to Ground for Affordance

Yufei Zhang, Chenlu Zhan, Donghui Sun, Xiaoxin Chen, Hongwei Wang
任务设定 让紧凑型 VLM 定位物体的 可交互功能区域
痛点动机 功能区域小且依赖任务语境,跨模态注意力难以精准锚定
解决方案 先用 注意力对齐 聚焦功能区域,再用 GRPO 优化坐标预测
49

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

Tongsheng Ding, Zhen Luo, Yixuan Yang, Boyu Wang, Luyang Xie, Jinyu Yang, Feng Zheng
任务设定 从单张图像和指令预测物体的 6-DoF 运动轨迹
痛点动机 现有方法依赖视频/深度等特权输入,或从生成视频中提取运动,成本高易出错
解决方案 直接从冻结的 视频扩散模型 中间表示解码轨迹,无需生成完整视频
50

The Gate, Not the Cache: Gate Provenance Bounds the Closed-Loop Reliability of Training-Free VLA Token Skipping

Qi Luo, Shuaijun Liu, Hao Zhao, Kunlin Li, Xiaobo Wang, Ningxing Su, Dongsheng Wang, Yun Chen
任务设定 研究 VLA 机器人模型训练无关的视觉 token 跳过加速
痛点动机 跳过所用门控源自加速前向,误差在闭环控制中累积致任务失败
解决方案 提出执行间隙刷新,借动作执行空隙插入稠密前向,提供干净门控信号
51

Decoding Children's Gait Behavior

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg
任务设定 从 RGB 视频细粒度分析 3-17 岁儿童步态行为
痛点动机 3D 传感器步态分析设备昂贵、侵入性强,难用于儿童临床评估
解决方案 构建大规模儿童步态视频与姿态序列数据集,提出统一步态解码框架
52

The 1st AI Children Challenge

Boyi Li, Yifan Shen, Houze Yang, Xu Cao, Guojun Yun, Li Gao, Turong Chen, Long Xu, Jianguo Cao, Meihuan Huang
任务设定 对儿童步态做细粒度关键点视觉分析的评测挑战
痛点动机 步态细微差异难辨识, AI 步态诊断缺乏专用数据集
解决方案 构建千级儿童 2D 关键点步态数据集,设置 EVGS 评分与脑瘫步态分类两赛道
53

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

Lihao Wang, Linlu Gao, Jiacan Yu, Yanyu Lin, Yifan Yin, Jianxin Wang, Tianmin Shu, Renjie Zhao
任务设定 仅用射频信号(无视觉)识别人体与物体交互
痛点动机 视觉方案存在隐私泄露与暗光场景下的识别限制
解决方案 融合毫米波雷达与 RFID 双模态,并用仿真数据扩充训练以提升泛化
54

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

Yanbin Hu, Jin Cui, Jun Ye, Jiepeng Zhou, Jiangcheng Song, Boran Zhao, Pengju Ren
任务设定 纯 RGB 视觉语言模型具备 3D 场景空间推理能力
痛点动机 RGB 图像缺乏 3D 线索,依赖深度输入增加部署成本
解决方案 构建特权证据蒸馏框架,将 3D 教师知识迁移到 RGB-only 学生模型,按证据敏感度降权不可靠监督
55

Video Models as Native 4D Renderers: World-Grounded Conditioning from Animated Mesh

Junhao Chen, Mingjin Chen, Henghaofan Zhang, Minglin Chen, Liaoyuan Fan, Boran Zhang, Saining Zhang, Mingze Sun, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Li
任务设定 给定动画网格和相机轨迹渲染 4D 视频
痛点动机 如何让视频模型同时遵循相机运动与场景内部动画
解决方案 提出 DAR,将跟踪、世界坐标等构成的 4D G-buffer 作为条件注入 Wan2.2 相机控制模块