arxiv · arXiv · 2026-10-06 17:26 · 评分 86
该研究在一个十英雄完整MOBA(206个单位、每个英雄每tick行动、最长6000 tick)中学习结构化多智能体世界模型,仅用内部1400 tick想象轨迹训练策略,再在真实游戏中对抗内置对手。用外部胜负评判世界模型,而非只看预测损失。
原文:arXiv | 返回 AI 资讯列表