智能制造 · Document AI

供应商材质智能分析平台

为全球工业制造龙头打造供应商材质报告智能分析平台:Document AI 结构化抽取、多模型共识校验化学成分、OneDrive 自动入库与人机协同门控,服务采购与质检一体化决策。

在全球供应链体系里,材质报告是采购与质检的「原始凭证」:供应商来自不同国家,版式、语言、扫描质量千差万别,有的手写批注、有的附带化学谱图。质检同事的真实工作流是——打开 PDF、肉眼读数、录入 ERP、再和同事交叉核对,一份报告动辄半小时,旺季排队积压。 传统 OCR 只能「认字」,对表格嵌套、多语言混排、手写批注往往失真;更关键的是,元素含量等字段容错极低,一个数字错误就可能导致批次拒收或错误放行。管理层希望引入 AI,但单一模型的幻觉风险在合规场景不可接受。 国科智飞采用 Document AI + 多模型共识的架构:先按供应商模板做版面分析与字段级抽取,再由多路大模型交叉验证元素检测结果,低置信度样本自动进入人工复核队列;同时对接 OneDrive 变更感知,新报告上传即触发解析。人机协同门控把「一次合格率」推到可运营、可审计的水平。

业务挑战

我们的做法

落地成果

项目深读

负责来料质检的同事,工作日里有一项固定动作:打开共享盘,把新到的供应商材质报告逐份读一遍。报告来自不同国家的供应商,版式、语言、扫描质量各不相同——有的带着手写批注,有的附了化学谱图。流程也是固定的:打开 PDF、肉眼读数、录入 ERP、再找同事交叉核对。一份报告动辄半小时,供应商集中交货的旺季,报告就在待处理文件夹里排队。

这不是一个「识别几个字」的问题。材质报告是采购与质检的原始凭证:哪一批材料可以放行、哪一批要退回,都从这张纸上的数字出发。我们为一家全球工业制造龙头做的供应商材质智能分析平台,要解决的就是这条链路——而它的难点,比「OCR 准不准」要深得多。

问题为什么难

往下拆两层,会看到两个真正的约束。

第一层是输入的脏。传统 OCR 只能「认字」,遇到嵌套表格、多语言混排、手写批注,识别结果往往失真。而材质报告恰恰集中了这几类难点,同一份 PDF 里可能同时出现印刷体、手写体和谱图。

第二层是容错的低。化学元素含量这类字段,容错接近零——一个数字错了,就可能把不合格批次放行,或者把合格批次拒收。这决定了 AI 的输出不能只是一个「参考答案」,它必须能进入正式流程,并且经得起审计。

这两层叠加,产生了最棘手的问题:技术团队可以把模型指标调得很漂亮,质检同事依然不敢用。不是不信任技术,而是没人能回答「这一条为什么可信」。用一句话概括我们的判断:这个场景缺的不是更强的模型,而是一条可验证的判断链路。

我们做的关键决定

模板优先、字段级抽取,而不是端到端丢给大模型

供应商材质报告虽然杂,但版式在单个供应商内部相对稳定。我们先按供应商做版面分析与模板适配,再落到字段级抽取——化学成分、批次、供应商等信息分别抽出、分别校验。为什么不直接端到端?因为端到端一旦出错,你不知道错在哪一步;字段级拆开之后,每个字段有独立的规则、独立的置信度、独立的责任边界。审计要的就是这个粒度。

多模型共识,而不是相信一个更聪明的模型

单一模型在合规场景有一个无法回避的问题:幻觉。它可能在没有任何依据的情况下,「补」出一个看起来合理的数字。我们的做法是让多路大模型交叉验证元素检测结果——多方一致的结论进入下一步,冲突项自动转人工。共识的目的不是「让模型永远对」,而是让分歧暴露出来,交给真正能裁决的人。

人机门控写进产品,而不是留在口号里

低置信度样本自动进入人工复核队列,配合抽检策略与审计日志,构成一道可运营的关口。我们把验收口径明确定义为「人机门控前提下的一次合格率」,没有承诺无人值守——在这个场景里,承诺无人值守本身就是不负责。门控不是兜底方案,是产品的一部分。

落到工程上:一条能审计的流水线

平台的日常是这样运转的:

采购和质检后来能够按供应商、批次、元素三个维度实时检索历史报告,也是因为入库时就把这些字段当成了结构化的一等公民,而不是 PDF 里的几行字。

上线之后

业务侧最先感知到的变化,是「抄录」这个动作基本消失了:材质报告数字化入库全自动完成,人工抄录工作量大幅下降,旺季积压得到缓解。更深一层的变化是注意力的回归——质检同事的时间从誊写数字回到判断本身,只需要处理系统标出来的争议项。在人机门控前提下,元素检测一次合格率达成 100% 目标。

采购侧的变化也不小。过去要复盘一批材料的争议,得翻邮件、找 PDF;现在按供应商、批次、元素检索,历史记录随时可调。在内控与审计眼里,这条链路每一环都留有记录——AI 的参与不是黑箱,而是一段可以倒查的过程。

这条路径的可复用价值

如果同行也在做容错极低的文档智能场景,三点经验可以直接拿走:

  1. 先承认输入是脏的。 与其期待一个模型解决所有版式,不如把版式分析、字段抽取、校验拆成可配置的流水线,让每一段可替换、可观测。
  2. 把共识当机制,不要当技巧。 多模型交叉验证的价值不在「更准」,而在于让分歧显式化——分歧正是人工介入的最佳信号。
  3. 验收标准里必须写清人的位置。 人机门控不是过渡方案,而是这类场景长期稳定运行的前提;说不清「人管哪一段」,系统就过不了合规那一关。

核心能力