arxiv · arXiv · 2026-10-02 01:59 · 评分 78
提出KaliBench基准,评估LLM在Kali Linux上生成可执行网络安全命令的能力。它采用无需实际运行的可验证奖励,直接衡量真实CLI工具调用中的语法与参数正确性,弥补现有评测缺口。
原文:arXiv | 返回 AI 资讯列表