ขั้นตอนที่ 1 — การอ่านเอกสาร

2.4 ขั้นตอนที่ 1 — ชั้นการอ่านเอกสาร

ขั้นตอนนี้แปลงภาพใบเสร็จหรือ PDF ให้เป็นข้อความที่ชั้นกฎสามารถตรวจสอบได้ ไพพ์ไลน์เป็นแบบ vision-first: สำหรับภาพ โมเดลที่มีความสามารถด้าน vision อ่านภาพถ่ายใบเสร็จโดยตรง ดังนั้นการรัน OCR แยกต่างหากจึงถูกข้ามไปสำหรับเส้นทางทั่วไป สัญญาสาธารณะคือผลลัพธ์ที่ปรับมาตรฐานแล้วของขั้นตอน ไม่ใช่ชื่อผู้ให้บริการ

เส้นทางภาพ — vision-first

สำหรับการอัปโหลดแบบภาพ ภาพที่ผ่านการประมวลผลเบื้องต้นจะถูกส่งตรงไปยังขั้นตอนการแยกข้อมูลด้วย vision (2.5) ในการเรียกครั้งเดียว โมเดล vision จัดการทั้งการอ่านและการแยกฟิลด์เชิงโครงสร้างพร้อมกัน ซึ่งตัดการเรียกไป-กลับผู้ให้บริการทั้งรอบออกจากเส้นทางแบบซิงโครนัส และหลีกเลี่ยงการผูกคุณภาพการแยกข้อมูลกับการแบ่งบรรทัดของเอนจิน OCR แยกต่างหาก

ขั้นตอนดาวน์สตรีมที่ทำงานบนบรรทัดใบเสร็จแบบข้อความล้วน (ชั้นกฎ การจับคู่สินค้า) ยังคงได้รับข้อมูลเข้าในรูปแบบ OCR: รายการบรรทัดพร้อมลำดับการอ่านถูกสร้างขึ้นใหม่จากผลลัพธ์ของ vision ดังนั้นขั้นตอนเหล่านั้นจึงคงรูปแบบข้อมูลเข้าเดียว ไม่ว่าเอกสารจะถูกอ่านด้วยวิธีใด

เส้นทาง PDF — สาขา OCR

ใบแจ้งหนี้ดิจิทัลมาในรูปแบบ PDF สำหรับกรณีนี้ไพพ์ไลน์แยกข้อความฝังตัวออกมาโดยตรง และสำรองด้วยการแปลง PDF เป็นภาพเพื่อเข้าเส้นทาง vision เมื่อเอกสารไม่มีชั้นข้อความที่ใช้งานได้ นี่คือสาขาที่ขั้นตอนแยกข้อความแบบดั้งเดิมทำงาน ส่วนภาพจะข้ามขั้นตอนนี้ไปทั้งหมด

การปรับมาตรฐานผลลัพธ์

ไม่ว่าแหล่งที่มาจะเป็นอะไร — ผลลัพธ์จาก vision ข้อความจาก PDF หรือข้อความที่ผู้ปฏิบัติการป้อนเข้ามา — ผลการอ่านจะถูกปรับมาตรฐานให้อยู่ในรูปแบบภายในเดียว: สตริงข้อความเต็มพร้อมรายการบรรทัดที่เรียงลำดับ (lineNo, text) ขั้นตอนถัดไปใช้รูปแบบที่ปรับมาตรฐานแล้วนี้ ดังนั้นการแยกฟิลด์จึงไม่ผูกติดกับรูปแบบการตอบสนองดิบของผู้ให้บริการใด ๆ

สัญญาณคุณภาพ

ขั้นตอนการอ่านเอกสารนำสัญญาณคุณภาพและหมวดหมู่ข้อผิดพลาดไปสู่ขั้นตอนถัดไป ในกรณีที่มีคุณภาพต่ำ ไพพ์ไลน์สามารถประมวลผลใหม่ ขอภาพใหม่จากผู้ใช้ หรือดำเนินการต่อด้วยความเชื่อมั่นต่ำลงตามนโยบายปฏิบัติการ

สิ่งนี้รักษาสัญญาทางเทคนิคสาธารณะไว้ ในขณะที่หลีกเลี่ยงรายละเอียดเกี่ยวกับค่าเกณฑ์และพฤติกรรมสำรองที่อาจถูก reverse engineer ได้ง่าย