Elastic正式推出jina-ocr-v1,一款专为端到端文档处理打造的光学字符识别(OCR)模型。该模型拥有5.74亿活跃参数,体积仅为当前基准测试领先模型的十分之一,却能提供前沿级的准确率。通过单次处理,jina-ocr-v1即可将复杂的视觉文档转化为结构化、机器可读的文本(如Markdown),大幅降低扫描文档在搜索、模型训练及智能体应用中的数据门槛。

传统OCR在处理清晰文本时表现尚可,但面对包含大量视觉元素的复杂文档,往往需经历页面分割、元素分类、文本识别和重组等多个步骤。这种多阶段流水线容易在各环节引入并累积误差,导致下游智能体返回不完整事实,或使检索增强生成(RAG)流程无法准确反映源文档内容。

混合专家架构与高效推理

jina-ocr-v1采用混合专家(MoE)架构,总参数量达34亿,但在推理过程中仅激活5.74亿参数,其运行速度和成本与参数量不足6亿的模型相当。此外,该模型引入FastMTP技术,通过改进多令牌预测进一步加速推理过程。

在单一模型框架下,jina-ocr-v1具备以下核心能力:

  • 广泛兼容图像文档:支持处理扫描件、拍摄文件、幻灯片以及源自PDF、PPTX和XLSX等格式的标签图像,适应不同质量的输入。
  • 保留文档结构:精准解析复杂版式,输出包含标题、章节、列表及正确阅读顺序的结构化Markdown。
  • 表格提取:将表格转换为基本HTML格式,便于导入电子表格或其他应用程序进行二次处理。
  • 手写体识别:能够读取多种语言的大段文本及英文草书。
  • 多语言支持:覆盖全球主要国际语言和文字系统,支持超过100种语言。
  • 数学符号转换:将印刷公式转换为LaTeX代码,适配文档编辑及科学应用场景。

基准测试表现优异

在olmOCR-bench基准测试中,jina-ocr-v1得分达83.4,创下参数量少于6亿模型的最高纪录。其在字符级准确性和阅读顺序保持方面,甚至超越了部分前沿大型语言模型(LLM),以更少的硬件资源实现了前沿级的准确率。

Elastic人工智能副总裁韩潇表示:“在人工智能时代,客户亟需一种简便的方式来数字化信息。传统OCR流水线在处理复杂版式、表格、手写体等高视觉密度内容时往往失效。此前,企业要么接受这些限制,要么支付高昂费用使用通用大模型处理文档。jina-ocr-v1旨在通过单一模型应对这一系列复杂性,同时保持极高的扩展效率。”