AI 编程 › AI 资讯 › 正文

MASBench: Benchmarking LLM-based Multi-Agent Collaboration under Partial Observability

arxiv · arXiv · 2026-10-04 01:40 · 评分 85

MASBench是一个用于评测LLM多智能体系统在部分可观测条件下协作能力的基准。真实世界协作通常信息不完全,而现有研究忽视这一条件。该基准关注协作机制设计与组织,而不仅仅是智能体自身,为评估多智能体系统完成复杂任务的协同效果提供标准化测试。

原文:arXiv | 返回 AI 资讯列表