[外包接案使用調查]
公告 如何發案 如何接案 幫助中心AI OCR 文字辨識
【客戶情境】 企業日常會收到大量格式固定、內容各異的官方單據(本案應用於進出口與物流業的稅費單據處理)。每一批貨進來,單據就跟著產生,承辦人員必須逐份開啟 PDF、把欄位抄進 Excel,再與帳務資料核對。單量一大,這件事就成為固定的人力消耗;更麻煩的是抄錯一位數字,往往要等到月底對帳不平才會發現,接著就是整批回頭翻找,追查的成本遠高於當初抄錄的時間。 【我們做了什麼】 建立一條從 PDF 到結構化資料的自動化管線。系統批次讀取文件、擷取指定欄位、依客戶既有的表格格式輸出,並在寫入前套用一組驗證規則:必填欄位檢查、金額勾稽(各項費用合計是否等於總計)、編號格式檢查、重複匯入偵測。未通過驗證的資料會被獨立標記並列入異常清單,不會混進乾淨資料裡。 【交付內容】 批次擷取與結構化程式、欄位對應表、驗證規則與異常清單輸出、操作說明與後續維護文件。 【成果】 承辦人員的工作型態從「逐份抄錄」變成「檢查異常清單」,人工只需要介入系統標記出問題的少數筆數。資料錯誤的來源也從難以追查的人為抄寫,轉為可回溯的流程——出問題時能直接指出是哪一份文件、哪一個欄位。 【技術重點】 這類案子的難點不在辨識本身,而在資料正確性。當數字牽涉金額與帳務,錯一位就是實質損失,因此整條管線的設計原則是「寧可標記為異常,也不要靜默寫入錯誤資料」。所有轉換過程都保留原始對應紀錄,任何一筆結果都能回推到來源文件的位置以利稽核。
玉承科技Nexus Lab