arxiv · arXiv · 2026-10-04 01:40 · 评分 85
MASBench是一个用于评测LLM多智能体系统在部分可观测条件下协作能力的基准。真实世界协作通常信息不完全,而现有研究忽视这一条件。该基准关注协作机制设计与组织,而不仅仅是智能体自身,为评估多智能体系统完成复杂任务的协同效果提供标准化测试。
原文:arXiv | 返回 AI 资讯列表