研究做久了,最尷尬的時刻不是結論錯誤,而是三個月後回看自己的報告,不知道某個數字從哪來。當時查了什麼、為什麼相信它、哪些是推測——全部隨記憶蒸發。這份報告於是變成一次性消耗品:不能復用、不能修正、不能移交,更不能在結論被市場打臉時告訴你「當初哪一步錯了」。
這篇要建立的是相反的東西:一個從提問到結論、每一步都留下痕跡的投研工作流。它只需要六個步驟,核心紀律只有一條——每個結論都要能沿著記錄走回原始文件。流程本身與工具無關:用紙本、用試算表、用 AI 助手都能跑,本文最後會說明 AI 在各步驟的正確位置。
第一步:把模糊問題拆成可查證的子問題
研究工作流的失敗,九成發生在起點:問題本身就不可查證。「A 公司值得研究嗎?」不是研究問題,是決策問題——它沒有確定答案,也找不到一份文件能直接回答它。
可查證的子問題有三個特徵:有確定答案(是/否、一個數字、一份文件的存在性)、答案有來源可指(能說出「去哪份文件的哪裡查」)、有時間邊界(哪個財年、哪個時段)。拆解就是把決策問題換算成一組這樣的小問題。
以下用一家教學用的假設公司示範(非任何真實公司),假設模糊問題是「A 公司的盈利可不可靠?」:
| # | 可查證的子問題 | 答案形態 |
|---|---|---|
| 1 | A 公司最近一個財年的審計意見是什麼類型? | 一個分類(標準/非標準),有原文可抄 |
| 2 | 最近三個財年,經營活動淨現金流與淨利潤的方向是否一致? | 是/否+兩組數字 |
| 3 | 應收帳款增速與收入增速在最近兩個財年的相對關係? | 兩個比率 |
| 4 | 收入按產品或地區的分部拆分是什麼? | 年報附註裡的一張表 |
| 5 | 最近 12 個月有沒有更換核數師的公告? | 有/無+公告日期 |
| 6 | 關連交易在收入或採購中的佔比是否有披露? | 披露了什麼、在哪一頁 |
拆解的檢查方法:對每個子問題問「如果兩個人分頭去查,會不會得到同一個答案?」會,就是可查證的;不會(例如「管理層誠信嗎」),就繼續拆,或者移出本次研究範圍並記錄下來。
幾種幾乎必然出現的模糊問法,值得記住它們的改寫方向(示例為教學用假設情境):
| 不可查證的問法 | 改寫成 |
|---|---|
| 「管理層誠信嗎」 | 「過去三年有沒有延遲披露、更換核數師、監管公開行動或重大訴訟的記錄?」 |
| 「競爭優勢穩固嗎」 | 「最近五個財年,毛利率與收入增速相對同業的變化方向是什麼?」 |
| 「行業前景好嗎」 | 「行業協會或主管部門最近一次公開統計的行業規模與增速是多少?發布於何時?」 |
| 「估值便宜嗎」 | 整個拆掉——這是決策問題。先拆出「當前市值是多少」「最近四個財年的盈利與淨資產是多少」等事實子問題,便宜與否的判斷留給人 |
改寫的通用法則:把形容詞換成數字,把評價換成文件的存在性,把「好不好」換成「是什麼」。
AI 可以幫你做拆解的初稿——把決策問題丟給模型,要求輸出子問題清單。但拆解的品質決定整個研究的品質,最終的問題清單必須由你逐條改寫成你真正想查的樣子,因為模型不知道你關心什麼、也不知道哪些問題在實務上查不到。
第二步:為每個子問題指定資訊源
每個子問題在動手查之前,先指定「去哪查」與「拿什麼交叉驗證」。這一步的預設規則是本站工作流的核心:重要事實至少兩個獨立來源。
什麼叫「獨立」?判斷標準是追溯資訊的產生源頭:
| 情形 | 是否獨立 | 原因 |
|---|---|---|
| 兩家媒體轉載同一則新聞稿 | 否 | 源頭只有一個 |
| 兩個商業資料庫都收錄同一家公司的披露數據 | 部分獨立 | 原始來源相同(法定披露),但加工口徑可能不同,可互查加工錯誤 |
| 年報數字 vs 業績公告數字 | 高度獨立 | 兩份文件、兩個時點、兩套編製流程,互為印證 |
| 公司說法 vs 交易對手或供應商的公開披露 | 高度獨立 | 完全不同的源頭與利益立場 |
| AI 的回答 vs 你自己的印象 | 都不算來源 | 兩者的源頭可能都是同一批網路內容 |
來源指定表接著子問題清單寫(沿用第一步的假設示例):
| 子問題 | 首選來源 | 交叉來源 |
|---|---|---|
| 審計意見類型 | 年報核數師報告原文 | 業績公告中對審計的提及 |
| 現金流 vs 利潤 | 年報合併現金流量表+損益表 | 中期報告的對應欄位 |
| 應收 vs 收入增速 | 年報資產負債表附註 | 上一年度年報(確認基期數字) |
| 分部拆分 | 年報分部資訊附註 | 業績公告的分部說明 |
| 核數師更換 | 披露易公告檢索 | 年報的公司治理章節 |
去哪裡找這些來源、各類來源的可信度層級,港股調研資訊源地圖:披露易、年報與第三方數據 有完整地圖。
第三步:搜集,用證據卡記錄
搜集階段的最小工作單位不是「筆記」,是證據卡:一張卡只記一個事實,帶著完整的來源座標。模板如下,欄位一個都不能省:
| 欄位 | 填什麼 | 示例(假設數據) |
|---|---|---|
| 編號 | 流水號,供結論頁引用 | E-007 |
| 主張 | 一句話、一個事實 | 「FY2025 經營活動淨現金流為 X 千元」 |
| 數值與單位 | 數字、幣別、單位 | X 千港元 |
| 來源文件 | 完整文件名稱 | A 公司 2025 年報 |
| 位置 | 頁碼/章節/時間戳 | 第 88 頁,合併現金流量表 |
| 擷取日期 | 你取得文件的日期 | 2026-09-30 |
| 來源層級 | 法定披露/公司產製/第三方/媒體 | 法定披露 |
| 狀態 | 已驗證/單一來源/有衝突 | 已驗證(與業績公告一致) |
| 備註 | 口徑說明、疑點 | 含已貼現票據的處理差異,見附註 |
三個紀律:
- 一張卡一個事實。 「收入增長且毛利率下降」是兩張卡。合併的卡片在交叉驗證時無法逐項標記狀態。
- 位置欄必須精確到頁。 「年報裡有」不算位置。精確位置是可回溯的最低成本保證——三個月後你不需要重讀 300 頁,只需要翻到那一頁。
- 原文照抄,不轉述數字。 數字一旦經過「理解再輸出」,就有被改寫的機會。照抄,然後在備註裡寫你的理解。
為什麼用卡片而不用整頁筆記?因為筆記按「文件」組織,卡片按「事實」組織。到了交叉驗證階段,你需要回答的問題是「這個事實有幾個獨立來源支持」——只有卡片能直接支持這種查詢。工具上一張試算表就夠用:一行一張卡,上面的欄位當列;量大之後再考慮資料庫或知識庫。工具的高級程度不重要,欄位的完整性才重要。
用 AI 加速時,正確的姿勢是讓模型把文件內容整理成證據卡的初稿,但「來源文件+位置」兩欄必須由人抽查:模型編造頁碼是最常見的幻覺形態之一(見 AI 在金融場景的幻覺風險:三種最貴的錯誤)。抽查方法:隨機抽幾張卡,翻到指定頁面確認主張與數字確實在那裡。
第四步:交叉驗證、衝突處理與不確定性記錄
證據卡齊了之後,做三件事。
第一,配對驗證。 對每張標記為重要的卡,檢查是否有第二個獨立來源。配對成功的升級為「已驗證」;配不上的保持「單一來源」——注意,單一來源不是廢卡,法定披露的單一來源本身就有較高效力,但你要清楚它的狀態。
第二,處理衝突。 兩個來源給出不同數字時,按順序做:
| 步驟 | 動作 |
|---|---|
| 1 | 回原始來源:兩個數字各自的出處文件是什麼?有沒有哪一方其實是轉述? |
| 2 | 查口徑:是不是同名不同義?(例如「收入」含不含某類項目、「現金」含不含受限制存款) |
| 3 | 查時點:是不是同一個數字在不同日期的兩個版本?(業績公告與年報之間可能有調整) |
| 4 | 仍無法調和:把衝突本身記錄成一張新的證據卡——「兩個來源存在未調和的差異」常常是整個研究裡最有價值的發現 |
第三,標記不確定性。 每張卡、每個後續結論都強制三態標記:
| 狀態 | 定義 | 使用規則 |
|---|---|---|
| 已證實 | 有原始來源,且經交叉驗證或屬法定披露 | 可以進入結論 |
| 推論 | 基於已證實事實的推理,但無直接來源 | 進入結論時必須帶著「推論」標籤與推理依據 |
| 未知 | 查過,沒有答案;或來不及查 | 寫進「未決清單」,禁止用推論冒充 |
「查過但沒有答案」和「沒查」是兩種不同的未知,前者要記錄你查過哪裡——這也是三個月後的你最想知道的資訊。
第五步:產出帶引用的結論頁
工作流的最終產出是一頁結論,格式固定:
| 欄位 | 內容 |
|---|---|
| 研究問題 | 最初的模糊問題+拆解後的子問題清單 |
| 結論 | 每個子問題一行答案,行末標注證據卡編號(如 E-003、E-007) |
| 推論與判斷 | 與事實分開列出,逐條標明依據哪些證據卡 |
| 未決清單 | 所有「未知」項,每條註明已查過哪裡 |
| 衝突記錄 | 未調和的來源差異 |
| 署名與日期 | 撰寫人、日期;若為團隊作業,加覆核人 |
結論頁的紀律:每一行都能被質問「證據呢?」,而答案永遠是「E-xxx」。 做不出這個形式的結論,說明工作流有環節被跳過了——通常是第三步的證據卡偷懶了。
未決清單另有一條品質要求:每一條都寫成「可以直接執行」的樣子,包含去哪查、查什麼、何時查。「再深入研究現金流差異的原因」不合格;「查 FY2025 年報現金流量表附註中淨利潤與經營現金流的調節項(第 X 頁),確認差異主要來自應收帳款還是存貨變動」才合格。未決清單是寫給三個月後那個已經忘光細節的你的。
可回溯性:三個月後的測試
工作流建好後,用這組問題自測。全部答「是」,才算可回溯:
- 從結論頁的任意一行,能在兩分鐘內找到對應證據卡
- 從任意一張證據卡,能在五分鐘內打開原始文件並定位到記錄的頁面
- 所有引用過的原始文件,手上都還留有下載時的版本(來源文件可能被更新或下架)
- 每張卡的擷取日期都在,能判斷資訊的新舊
- 推論與事實的分界清晰,推論條目都寫了推理依據
- 未決清單還在,而且每條都寫了「查過哪裡」
還有一個儲存習慣值得單獨強調:引用過的原始文件,必須保存「你下載當時」的本地副本。法定披露文件通常穩定,但第三方頁面會改版、新聞會下架、資料庫的數字會被靜默修正——保留當時版本的唯一方法是自己存檔。存檔檔案用「擷取日期+來源+檔名」的規則命名,成本最低。
這個測試的意義不在形式,而在它改變了你研究時的行為:知道三個月後會被檢查,搜集時就不會抄捷徑。 這也是把個人工作流升級成系統(帶記憶、帶驗證閘的 Agent 流水線)的動機,本站在 自建投研系統:從技能庫到驗證門控的完整設計 與 從偽造到驗證:Agent 驗證架構的信任建築學 有進一步的架構討論。
AI 會在這裡出錯
把六個步驟對照 AI 的能力邊界(完整版見 AI 在投研流程的位置:哪些環節能交出去,哪些不能),典型的翻車點:
| 步驟 | AI 的出錯形態 | 防法 |
|---|---|---|
| 拆解子問題 | 拆出看似專業但查無實據的問題(例如要求查一個根本不存在的披露項目) | 每個子問題先確認來源存在,再排入計劃 |
| 指定來源 | 編造資料庫名稱、連結與檢索路徑 | 來源以 港股調研資訊源地圖:披露易、年報與第三方數據 的地圖為準,連結逐個點開 |
| 證據卡 | 頁碼與數字對不上;把兩個來源的內容寫進同一張卡 | 位置欄人工抽查;一卡一事實 |
| 交叉驗證 | 用「自己的記憶」當第二個來源——那不是獨立來源,可能只是同一批網路內容的回聲 | 第二來源必須是你能打開的文件 |
| 不確定性 | 把「未知」悄悄寫成「推論」,把「推論」寫成篤定語氣 | 三態標記由規則強制,語氣審查由人做 |
| 結論頁 | 引用編號與內容錯位 | 發出前隨機抽兩行,沿編號走回原文 |
最後重複一次本站的立場:這個工作流的所有設計都基於同一個假設——AI 會出錯,人也會出錯,所以流程要讓每個錯誤都能被追溯、被定位、被修正。 可回溯不是為了好看,是為了三個月後的你能站在今天的記錄上繼續工作,而不是從零開始。
下一步
- 港股調研資訊源地圖:披露易、年報與第三方數據:第二步的來源指定,需要這張資訊源地圖。
- AI 在金融場景的幻覺風險:三種最貴的錯誤:第四步交叉驗證的理論基礎——三種最貴的 AI 錯誤與四道防線。
- 一家公司的 30 分鐘快速盡調流程:工作流的上游場景——30 分鐘快速盡調產出的待查清單,正好是子問題拆解的輸入。
- 300 頁年報轉結構化 JSON:三表與分部數據:當證據卡多到手工管理不動時,把年報變成結構化數據是第一個自動化對象。
- 自建投研系統:從技能庫到驗證門控的完整設計:把整套工作流交給帶記憶與驗證閘的 Agent 系統來執行。