AI 编程 › AI 资讯 › 正文

VISTA: A Visual Harness for Reasoning in an Interactive World

arxiv · arXiv · 2026-10-02 01:59 · 评分 82

提出VISTA视觉框架,为通用多模态模型提供长时程视觉能力。模型通过视觉观察直接感知环境,并借助无损视觉记忆保留原始历史观察、主动检索,从而在多种交互式环境中解决复杂任务。

原文:arXiv | 返回 AI 资讯列表