Agentic Research

OCR(光學字元識別)

又稱:光學字元識別 · 文字識別 · 掃描檔轉文字 · OCR 辨識 · PDF 轉文字

把圖片、掃描件、PDF 裡的「圖像文字」辨認成電腦能處理的真實文字;是紙本文件進入任何資料流程的第一步。

你會在什麼時候遇到它

你的知識庫只要有掃描的年報、合約、發票、舊報告,就得先過 OCR,否則模型看到的是一整頁無法讀取的圖像。它也是「資料莫名其妙缺一大塊」的常見元兇:OCR 沒做好,後面 RAG 再強也沒用。

打個比方

像請一位速記員,把一疊紙本文件逐字打成電腦檔。打得準,後面一切好辦;打得錯(把 0 看成 O、把表格看散),錯誤會一路帶進後面的檢索和回答,而且沒人會發現是這一步出的錯。

最小範例

一份掃描年報的兩頁:

第 1 頁(印刷體、清晰):
  OCR →「營業額 12,345 千元」        ✓ 準確

第 2 頁(表格+手寫批註+模糊):
  OCR →「營業額 l2,345 干元」        ✗ 錯字連篇
  表格欄位對錯行、手寫幾乎全滅

→ 兩頁都「有輸出」、看起來都成功,但第 2 頁的資料已經壞了

最危險的地方是:OCR 失敗通常不報錯,它照樣輸出一串文字,只是那串是錯的。下游的 embedding、檢索、回答全都建立在錯字上,而你從最終答案根本看不出源頭是 OCR。所以紙本流程一定要抽檢 OCR 結果,尤其表格和數字。

最常搞錯的地方

  • 以為 PDF「有文字」就等於「能直接讀」。很多 PDF 是掃描圖像,表面看是文件,實則一整頁都是圖片,不先 OCR 就餵給模型,它只會說讀不到內容。
  • 對表格、多欄排版、手寫直接套用一般 OCR。這些版面的閱讀順序、欄位對應最容易出錯,數字錯一位,整份財務分析就全錯。這類文件要用專門處理表格/版面的 OCR 流程,並人工複核關鍵數字。

相關詞條

下一步