arxiv · arXiv · 2026-09-27 01:54 · 评分 88
论文提出基于偏好的多智能体系统,利用人类或AI比较反馈学习,避免设计精确奖励,以改善LLM协作。作者从集中式与分散式视角形式化该方法,弥补了偏好学习在多智能体场景中的研究空白,为提升LLM协作效率提供了新思路。
原文:arXiv | 返回 AI 资讯列表