DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

Stray Labs (straylabs-ai) 使用 Kimi K2.5 处理代码审查和测试生成

Stray Labs (straylabs-ai) 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T03:30:00Z。

原始记录:Kimi K2.5 驱动的自主渗透测试代理

A

Chinese Brief

中文案例导读

Stray Labs (straylabs-ai) 公开的代码审查与测试案例,来源为 公开代码库,复核于 2026-06-27T03:30:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Kimi / Moonshot AI
模型Kimi K2.5
任务类型代码审查与测试
审核状态auto_approved

任务

真实任务背景

使用 Kimi K2.5 模型构建自主 Web 应用渗透测试代理 Deadend CLI。该工具采用反馈驱动迭代架构(ADaPT),在标准工具失败时自动生成自定义 Python 漏洞利用代码,观察响应并迭代优化攻击策略。支持完全本地执行,无数据外泄。

代码审查与测试公开代码库A 类可核验real_case
公开产物

Deadend CLI 在 XBOW 104 题验证套件上使用 Kimi K2.5 达到约 80% 的成功率,总 API 成本约 $122。在 SQL 注入(83%)、XSS(91%)、业务逻辑(86%)等类别表现突出,GraphQL 和 SSRF 达到 100%。在盲注 SQL 注入等其他代理得分为 0% 的挑战上成功突破。

模型作用

Kimi K2.5 提供了强大的代码生成和推理能力,使代理能够自主生成自定义漏洞利用代码、分析 Web 应用响应并迭代优化攻击策略。模型的工具调用能力支持与 Playwright、Docker 等沙箱工具的集成。

风险边界

使用 Kimi K2.5 变体(较新版本)。基准测试结果来自 2026 年 1 月的 XBOW 验证套件。