Chinese Brief
中文案例导读
Stray Labs (straylabs-ai) 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T03:30:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。
CASE EVIDENCE / A RECORD
Stray Labs (straylabs-ai) 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T03:30:00Z。
原始记录:Kimi K2.5 驱动的自主渗透测试代理
Chinese Brief
Stray Labs (straylabs-ai) 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T03:30:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。
任务
使用 Kimi K2.5 模型构建自主 Web 应用渗透测试代理 Deadend CLI。该工具采用反馈驱动迭代架构(ADaPT),在标准工具失败时自动生成自定义 Python 漏洞利用代码,观察响应并迭代优化攻击策略。支持完全本地执行,无数据外泄。
Deadend CLI 在 XBOW 104 题验证套件上使用 Kimi K2.5 达到约 80% 的成功率,总 API 成本约 $122。在 SQL 注入(83%)、XSS(91%)、业务逻辑(86%)等类别表现突出,GraphQL 和 SSRF 达到 100%。在盲注 SQL 注入等其他代理得分为 0% 的挑战上成功突破。
Kimi K2.5 提供了强大的代码生成和推理能力,使代理能够自主生成自定义漏洞利用代码、分析 Web 应用响应并迭代优化攻击策略。模型的工具调用能力支持与 Playwright、Docker 等沙箱工具的集成。
使用 Kimi K2.5 变体(较新版本)。基准测试结果来自 2026 年 1 月的 XBOW 验证套件。