arxiv · arXiv · 2026-10-07 01:30 · 评分 93
EgoLAP提出一个视觉-语言-动作(VLA)预训练框架,从人类第一视角数据中学习动作意图,并通过共享语言-动作推理跨越人类与机器人的本体差异,从而减少对昂贵机器人演示的依赖。
原文:arXiv | 返回 AI 资讯列表