阶段 1 — 文件读取
2.4 阶段 1 — 文件读取层
本阶段将收据图片或 PDF 转换为规则层可验证的文字。管线采视觉优先(vision-first):对于图片,具备视觉能力的模型直接读取收据照片,因此常见路径跳过独立的 OCR 步骤。公开契约为本阶段的标准化输出,而非供应商名称。
图片路径 — 视觉优先
对于图片上传,预处理后的图片以单次呼叫直接进入视觉提取阶段(2.5)。视觉模型同时处理读取与结构化栏位提取,这从同步路径中移除了一整个供应商往返,也避免提取品质与独立 OCR 引擎的行切分耦合。
在纯收据文字行上运作的下游阶段(规则层、商品配对)仍会收到 OCR 样式的输入:带阅读顺序的行列表由视觉输出重建,因此无论文件如何被读取,这些阶段都保持单一的输入格式。
PDF 路径 — OCR 分支
数位发票以 PDF 到达。对这类文件,管线直接提取内嵌文字,当文件没有可用的文字层时,备援为将 PDF 转换成图片走视觉路径。这是传统文字提取步骤执行的分支;图片完全绕过它。
输出标准化
无论来源为何——视觉输出、PDF 文字,或操作员提供的文字倾印——读取结果都被标准化为单一内部格式:一个全文字串加上一个有序的行列表(lineNo、text)。后续阶段消费此标准化格式,因此栏位提取不会与任何原始供应商回应格式耦合。
品质讯号
文件读取阶段将品质讯号与错误类别携带至后续阶段。在低品质情况下,管线可依营运策略重新处理、请求使用者提供新图片,或以较低信心度继续处理。
这在保留公开技术契约的同时,避免了容易被逆向工程的门槛与备援细节。