AI 编程 › AI 资讯 › 正文

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

arxiv · arXiv · 2026-10-02 01:59 · 评分 78

提出KaliBench基准,评估LLM在Kali Linux上生成可执行网络安全命令的能力。它采用无需实际运行的可验证奖励,直接衡量真实CLI工具调用中的语法与参数正确性,弥补现有评测缺口。

原文:arXiv | 返回 AI 资讯列表