千问查漏洞3轮召回率追平Opus5,成本只有一半
律动BlockBeats|2026年08月05日 10:43
安全公司 Aikido 用代码审计 Agent 测试了 7 款模型,包括 Qwen3.8-Max、Claude Opus 5、Kimi K3 Max、DeepSeek V4 Flash,以及 GPT-5.6 Sol、Luna 和 Terra。测试包含 32 个近期公开漏洞,每款模型运行 3 次。Qwen3.8-Max 三轮合计找到 26 个漏洞,召回率达到 81.3%,与 Opus 5 并列第一。它的 F1 综合分(兼顾漏报和误报)为 83.2%,略低于 Opus 5、Kimi K3 Max 和 GPT-5.6 Sol。千问的问题是单次发挥不稳定。26 个漏洞中,只有 10 个连续三轮都能找到,Opus 5 和 Sol 都有 19 个。不过,千问总成本约 821 美元,只有 Opus 5 和 Sol 的一半,但仍是 DeepSeek V4 Flash 的 5 倍。[原文链接](动察 Beating)
分享至:
脈絡
熱門快訊
APP下載
X
Telegram
複製鏈接