Agentic Research

Data Pipeline(資料流程/資料管線)

又稱:資料管線 · 資料流程 · data pipeline · ETL · 資料處理流程

把資料從來源送到可用狀態的一連串固定步驟:攝取 → 清洗 → 轉換 → 儲存 → 供查詢。AI 應用幾乎都建立在一條這樣的管線上。

你會在什麼時候遇到它

模型再強,餵進去的資料髒、格式亂、來源不可靠,輸出就不可靠 —— garbage in, garbage out。理解管線的每一環,你才能在「AI 答錯」時判斷問題出在攝取、清洗、轉換還是檢索,而不是籠統地怪模型。

打個比方

像自來水廠:取水(攝)→ 過濾沉澱(清洗)→ 加藥消毒(轉換)→ 存進水塔(儲存)→ 送到你家的水龍頭(供查詢)。任何一環出問題,你打開水龍頭看到的都是髒水,但你只看到水龍頭,看不到是哪一環壞的。

最小範例

一條看似正常的管線:
  攝:   從 API 抓「發票」→ 存成 {date, amount, vendor}
  清洗: 去掉重複、補齊缺的欄位
  轉換: amount 統一成整數(分)
  儲存: 寫進資料庫
  供查詢:RAG/報表來讀

AI 常在這裡悄悄弄壞它:
  · 上游某天把 amount 從「分」改成「元」→ schema 漂移,
    你的轉換照舊除以 100,金額靜默縮小 100 倍,沒人報錯
  · 讓 LLM 抽取欄位卻沒校驗 → 它偶爾把 vendor 填成日期

注意兩種壞法都不是「崩潰報錯」,而是「安靜地產出錯誤資料」。管線最危險的不是斷掉(斷掉你會發現),而是照跑、卻把錯的資料一路送到底。所以每一環都要有校驗:輸入變沒變、欄位對不對、數值範圍合不合理。

最常搞錯的地方

  • 把心力全放在模型、忽略資料管線。實務上八成問題出在資料:來源髒、schema 悄悄漂移、沒校驗。換個更強的模型,救不了餵進去的爛資料。
  • 以為管線跑通一次就永遠沒問題。上游格式會變、API 會改版、資料來源會增減。沒有監控和校驗的管線,會在某天悄悄開始產出錯資料,而你很久之後才發現。

相關詞條

下一步