Mistral 推出 OCR 4.1:文档 AI 进入段落级时代
法国人工智能公司 Mistral 于 7 月发布 OCR 4.1 公开预览版,把文档识别从单纯的「文字提取」推进到「结构化理解」。新模型最大的变化,是能够输出段落级的边界框(Bounding Box)、结构化区块标签,以及区块级的置信度评分,让企业在把纸质或扫描文档喂给检索增强生成(RAG)系统之前,先对提取质量做更细的把控。

不只是识别文字
传统 OCR 只关心「图里是什么字」,而 OCR 4.1 试图理解文档的结构。它借助计算机视觉处理复杂排版、手写体以及数学公式,把图像和 PDF 中的文本、公式与表格布局,以较高的精度转换为结构化的 Markdown 格式。对于 RAG 管线而言,这意味着预处理步骤可以被压缩成一次 API 调用。
Mistral 在官方文档中介绍,OCR 4.1 的 API 新增了「block」级别的置信度粒度选项:除了原有的「page」(页面级)与「word」(词级)之外,开发者现在可以拿到页面级与区块级两套评分,从而判断某一段落、某张表格的提取是否可靠,再决定是自动入库还是转人工复核。
对手与定位
在企业文档智能领域,Mistral 的对手包括亚马逊的 Textract 与谷歌云的 Document AI。前者能提取文本、手写、表格与表单,后者则将 OCR 与版式分析、分类、结构化提取结合。相比这些背靠大型云生态的平台,Mistral 选择了一条更聚焦的路线:用一个连接自有模型、Studio 工具链与企业 AI 栈的专用文档模型切入。
不过价格引发了讨论。OCR 4.1 定价约为每千页 3.5 欧元(约合 4.38 美元),有开发者指出这比部分竞品贵出近一倍。但在处理历史文献、复杂版式时的稳定性,以及在合规与数据主权方面支持开放权重、可本地私有化部署的特性,让它成为文档 AI 赛道一个值得关注的变量。
为什么重要
文档摄取是智能体(agent)落地企业场景的关键入口。一个模型即便推理能力很强,只要把表格压平错了、把页脚误认成正文,或者把低置信度的数字直接写进检索索引,最终输出仍可能出错。OCR 4.1 把改进点放在「喂给搜索、智能体与自动化决策的那条文档管道」内部,用段落级输出与置信度评分,给开发者更细的检视、路由与索引能力。在头部大模型比拼通用能力的当下,押注细分工具模型,也是欧洲 AI 避开正面战场的一种务实选择。
来源:Mistral 官方文档与多家科技媒体综合整理







