OCR(光學字元識別)
又稱:光學字元識別 · 文字識別 · 掃描檔轉文字 · OCR 辨識 · PDF 轉文字
把圖片、掃描件、PDF 裡的「圖像文字」辨認成電腦能處理的真實文字;是紙本文件進入任何資料流程的第一步。
你會在什麼時候遇到它
你的知識庫只要有掃描的年報、合約、發票、舊報告,就得先過 OCR,否則模型看到的是一整頁無法讀取的圖像。它也是「資料莫名其妙缺一大塊」的常見元兇:OCR 沒做好,後面 RAG 再強也沒用。
打個比方
像請一位速記員,把一疊紙本文件逐字打成電腦檔。打得準,後面一切好辦;打得錯(把 0 看成 O、把表格看散),錯誤會一路帶進後面的檢索和回答,而且沒人會發現是這一步出的錯。
最小範例
一份掃描年報的兩頁:
第 1 頁(印刷體、清晰):
OCR →「營業額 12,345 千元」 ✓ 準確
第 2 頁(表格+手寫批註+模糊):
OCR →「營業額 l2,345 干元」 ✗ 錯字連篇
表格欄位對錯行、手寫幾乎全滅
→ 兩頁都「有輸出」、看起來都成功,但第 2 頁的資料已經壞了最危險的地方是:OCR 失敗通常不報錯,它照樣輸出一串文字,只是那串是錯的。下游的 embedding、檢索、回答全都建立在錯字上,而你從最終答案根本看不出源頭是 OCR。所以紙本流程一定要抽檢 OCR 結果,尤其表格和數字。
最常搞錯的地方
- 以為 PDF「有文字」就等於「能直接讀」。很多 PDF 是掃描圖像,表面看是文件,實則一整頁都是圖片,不先 OCR 就餵給模型,它只會說讀不到內容。
- 對表格、多欄排版、手寫直接套用一般 OCR。這些版面的閱讀順序、欄位對應最容易出錯,數字錯一位,整份財務分析就全錯。這類文件要用專門處理表格/版面的 OCR 流程,並人工複核關鍵數字。
相關詞條
下一步
- PaddleOCR 實戰:83 秒提取港股年報財務數據17 min
- 機器怎麼讀懂財報:從 PDF 到結構化數據10 min