Chinese Brief
中文案例导读
liuqjox (via kvcache-ai/ktransformers) 公开的真实任务执行案例,来源为 公开代码库,复核于 2026-06-27T02:50:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。
CASE EVIDENCE / A RECORD
liuqjox (via kvcache-ai/ktransformers) 公开的真实任务执行案例,来源为 公开代码库,复核于 2026-06-27T02:50:00Z。
原始记录:KTransformers 用户在消费级硬件上本地部署 DeepSeek-V2.5-1210 236B 实现高效推理
Chinese Brief
liuqjox (via kvcache-ai/ktransformers) 公开的真实任务执行案例,来源为 公开代码库,复核于 2026-06-27T02:50:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。
任务
用户 liuqjox 使用 KTransformers 框架在 Windows/WSL 环境下本地部署量化版 DeepSeek-V2.5-1210 (Q2_K_L 量化, 236B 参数, 80.5GB)。硬件配置为 RTX 3090 + 96GB DDR4 3200 + i7-10700K, 环境为 Win10/WSL/Ubuntu/CUDA 12.4/PyTorch 2.6。目标是在不到一万元的消费级硬件上运行 236B 参数大模型进行本地推理。
成功实现本地推理,速度稳定在 4-6 tokens/s(初始较慢约 1 tps)。同时验证了更大量化的 DeepSeek-R1 671B (unsloth 2.51 bit, 212GB) 也可运行但速度极慢(0.05 tps)。用户指出 x99 主板 + 256G 内存方案成本不到一万元即可运行 671B 模型。
DeepSeek-V2.5-1210 提供了 236B 参数的开放权重模型,其 MoE 架构配合 KTransformers 的 CPU/GPU 异构推理技术,使得在单卡 RTX 3090 + 96GB 内存的消费级硬件上即可实现可用的本地推理(4-6 tps),证明了该模型在资源受限场景下的实用价值。
Issue 状态为 open 但用户已确认部署成功;量化版本 Q2_K_L 可能有精度损失;速度数据基于特定硬件配置,不同配置可能差异较大。