AI 编程 › AI 资讯 › 正文

Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models

arxiv · arXiv · 2026-10-02 01:46 · 评分 77

论文揭示关键词匹配基准可能让小模型“假装”具备工具调用能力:一对结构匹配的西班牙语安全模型在宽松指标上得分相近,但大模型并未真正执行工具调用。作者提出一套廉价的分级诊断方法,用于检验小模型工具调用声称。

原文:arXiv | 返回 AI 资讯列表