ขั้นตอนที่ 3 — กฎ
2.6 ขั้นตอนที่ 3 — ชั้น regex และกฎ
ชั้น regex ทำงานเสมอหลังจาก LLM LLM เป็นเครื่องมือจดจำรูปแบบที่รวดเร็ว regex เป็นเครื่องมือตรวจสอบแบบกำหนดได้
สิ่งที่ regex จับได้ แต่ LLM พลาด
ชั้นกฎเพิ่มการตรวจสอบแบบกำหนดได้ในสี่หมวดหมู่:
- การกระทบยอดรวม LLM บางครั้งปัดเศษหรือ normalize ยอดรวมทั้งหมด ชั้นกฎจะแยกข้อความยอดรวมที่พิมพ์ออกมาจากข้อความ OCR ใหม่ และแทนที่ค่า LLM เมื่อมีความไม่สอดคล้อง
- การปรับมาตรฐานวันที่ ใบเสร็จใช้รูปแบบวันที่ระดับภูมิภาคหลายแบบและชื่อเดือนที่เฉพาะเจาะจงตามท้องถิ่น ตัวแปรทั้งหมดลู่เข้าสู่ ISO 8601
- การแก้ความกำกวมสกุลเงิน โทเคนสกุลเงินที่ผสมกันถูกแก้โดยความถี่และท้องถิ่นของผู้ค้า
- การตรวจจับบรรทัดภาษี บรรทัดอัตราภาษีเฉพาะท้องถิ่น (เช่น KDV ในตุรกี) ถูกตรวจจับจากข้อความที่พิมพ์ แทนที่จะอนุมานโดย LLM
แคตตาล็อกกฎ
แคตตาล็อกจัดเรียงตามหมวดหมู่: ยอดรวม ภาษี วันที่ สกุลเงิน และตัวระบุผู้ค้า แต่ละหมวดหมู่มีครอบครัวกฎเฉพาะท้องถิ่นสำหรับภาษาที่เราดำเนินงาน รูปแบบเฉพาะและน้ำหนักต่อกฎถูกจัดการในชั้นปฏิบัติการภายใน
การเพิ่มความเชื่อมั่น
แต่ละการตรงกันของกฎที่ตรวจสอบแล้วจะเพิ่มคะแนนความเชื่อมั่นของชั้น regex ใบเสร็จที่กระทบยอดสะอาดได้คะแนนสูงกว่า ใบเสร็จที่มียอดรวมไม่สามารถกระทบยอดได้จะมีช่องโหว่ในการกระทบยอดซึ่งตัวให้คะแนนความน่าเชื่อถืออ่านเป็นข้อมูลเข้าอย่างหนึ่ง น้ำหนักที่กำหนดให้กับข้อมูลเข้านั้นถูกจัดการในชั้นปฏิบัติการภายใน