DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

ChuanMeng (SIGIR 2026 研究团队) 使用 GLM-4.7-Flash 处理研究分析和报告生成

ChuanMeng (SIGIR 2026 研究团队) 公开的研究与报告生成案例,来源为 公开代码库,复核于 2026-06-26T23:55:00Z。

原始记录:SIGIR 2026: GLM-4.7-Flash 作为深度研究 Agent 进行文本排序评估

A

Chinese Brief

中文案例导读

ChuanMeng (SIGIR 2026 研究团队) 公开的研究与报告生成案例,来源为 公开代码库,复核于 2026-06-26T23:55:00Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Z AI / GLM
模型GLM-4.7-Flash
任务类型研究与报告生成
审核状态auto_approved

任务

真实任务背景

SIGIR 2026 论文《Revisiting Text Ranking in Deep Research》使用 GLM-4.7-Flash (30B) 作为深度研究 Agent,在 BrowseComp-Plus 数据集上评估 5 种检索器(BM25、SPLADE-v3、RepLLaMA、Qwen3-Embedding-8B、ColBERTv2)和 3 种重排器(monoT5-3B、RankLLaMA-7B、Rank1-7B)的文本排序性能。

研究与报告生成公开代码库A 类可核验real_case
公开产物

发表于 SIGIR 2026(第 49 届 ACM SIGIR 信息检索国际会议)的研究论文,提供了深度研究场景下文本排序方法的全面评估。发布了 BrowseComp-Plus 段落语料库、所有检索器索引和完整执行轨迹数据。

模型作用

GLM-4.7-Flash (30B) 作为两个深度研究 Agent 之一(与 gpt-oss-20b 并列),通过本地 vLLM 服务器部署运行,在多轮检索-重排序循环中执行信息检索和推理任务,是论文实验评估的核心 Agent 模型。

风险边界

使用 GLM-4.7-Flash (30B) 而非 GLM-4.7 主版本;属于学术研究实验而非生产应用,但有完整的论文发表和开源代码,证据等级高。