arxiv · arXiv · 2026-10-02 01:46 · 评分 77
论文揭示关键词匹配基准可能让小模型“假装”具备工具调用能力:一对结构匹配的西班牙语安全模型在宽松指标上得分相近,但大模型并未真正执行工具调用。作者提出一套廉价的分级诊断方法,用于检验小模型工具调用声称。
原文:arXiv | 返回 AI 资讯列表