DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

vllm-project/vllm GitHub user commu… 使用 Qwen1.5 Chat 110B 处理软件工程任务执行

vllm-project/vllm GitHub user community 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T07:46:08Z。

原始记录:vLLM user runs Qwen1.5-110B-Chat-GPTQ-Int4 inference on A100 and measures request latency

A

Chinese Brief

中文案例导读

vllm-project/vllm GitHub user community 公开的代码代理与软件工程案例,来源为 公开代码库,复核于 2026-06-27T07:46:08Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Qwen / Alibaba
模型Qwen1.5 Chat 110B
任务类型代码代理与软件工程
审核状态auto_approved

任务

真实任务背景

这是一个围绕软件工程任务执行的真实任务,公开材料可以回溯到具体使用者和具体产物。 原始资料写作:A user used vLLM 0.4.2 AsyncLLMEngine to run Qwen1.5-110B-Chat-GPTQ-Int4 from ModelScope on A100 80G, tuning gpu_memory_utilization, max_model_len, max_num_seqs, and sending 330-token prompts with short outputs.

代码代理与软件工程公开代码库A 类可核验real_case
公开产物

公开材料提供公开代码、README 或项目配置,可用于核验任务结果、项目形态和模型绑定关系。 原始资料写作:The report gives observed latency/QPS figures: about 0.45s per request at QPS=1, 0.70s at QPS=2, 1.4s at QPS=4, and 2.9s at QPS=8, with effective batch size around 2.

模型作用

Qwen1.5 Chat 110B 在该案例中承担软件工程任务执行相关的生成、分析、编排或实现角色。 原始资料写作:Qwen1.5-110B-Chat-GPTQ-Int4 was the inference model being served by vLLM for low-latency short-answer generation.

风险边界

当前判断基于公开材料;若产物下线、仓库变更或模型参与比例仅来自作者自述,需要在引用前重新复核。 原始资料写作:Evidence is a performance/usage issue rather than a customer case study; it includes exact model URL, serving framework, hardware, parameters, and measured outputs.