DATA CUT 2026-07-27 116 活跃模型 680 A 类案例

CASE EVIDENCE / A RECORD

University of Michigan Herbarium / … 使用 Gemini 1.5 Pro (May) 处理文档理解和结构化处理

University of Michigan Herbarium / Gene-Weaver VoucherVision 公开的文档理解与处理案例,来源为 公开代码库,复核于 2026-06-27T05:47:49Z。

原始记录:VoucherVision 用 Gemini 1.5 Pro 读取自然历史标本标签并结构化转录

A

Chinese Brief

中文案例导读

University of Michigan Herbarium / Gene-Weaver VoucherVision 公开的文档理解与处理案例,来源为 公开代码库,复核于 2026-06-27T05:47:49Z。 Model Atlas 将它标记为 A 类证据,因为它同时具备具体使用者、具体任务、公开原始证据和可访问产物。 Model Atlas 不把 benchmark、教程、发布说明或集合页包装成真实案例。

厂商Google / Gemini
模型Gemini 1.5 Pro (May)
任务类型文档理解与处理
审核状态auto_approved

任务

真实任务背景

VoucherVision 面向自然历史标本标签转录工作流,使用大语言/视觉模型从标本图片中读取标签文字并输出 JSON 或 CSV 等结构化数据;README 更新中明确列出 Google Gemini models(Gemini-1.5-Pro、Gemini-1.5-Flash、Gemini-1.5-Flash-8B)作为 OCR 引擎,并指出 Gemini-1.5-Pro 是首个/唯一能可靠读取 included demo image 中困难草写体的 OCR 引擎。

文档理解与处理公开代码库A 类可核验real_case
公开产物

公开仓库提供 VoucherVision Beta 工具、安装和 UI 文档;README 记录 MICH herbarium 已处理约 50,000 张图片,并说明 Gemini-1.5-Pro 在困难草写体 OCR 任务上的实际效果。

模型作用

Gemini 1.5 Pro 作为 OCR/VLM 引擎读取高难度手写和印刷混合的标本标签,为后续字段抽取、CSV/JSON 输出和人工校对提供文本基础。

风险边界

README 后续推荐工作流已更新到 Gemini 2.0 Flash,但历史更新明确记载 Gemini-1.5-Pro 的 OCR 使用和效果;此候选只主张 Gemini 1.5 Pro 在该工作流中的已公开用例。