This article is not yet available in English. You are reading the Traditional Chinese original. The English edition will appear here once it is translated.
Browse articles that do have an English edition你的第一個投研工作流:從提問到可回溯結論
研究做久了,最尷尬的時刻不是結論錯誤,而是三個月後回看自己的報告,不知道某個數字從哪來。當時查了什麼、為什麼相信它、哪些是推測——全部隨記憶蒸發。這份報告於是變成一次性消耗品:不能復用、不能修正、不能移交,更不能在結論被市場打臉時告訴你「當初哪一步錯了」。
這篇要建立的是相反的東西:一個從提問到結論、每一步都留下痕跡的投研工作流。它只需要六個步驟,核心紀律只有一條——每個結論都要能沿著記錄走回原始文件。流程本身與工具無關:用紙本、用試算表、用 AI 助手都能跑,本文最後會說明 AI 在各步驟的正確位置。
第一步:把模糊問題拆成可查證的子問題
研究工作流的失敗,九成發生在起點:問題本身就不可查證。「A 公司值得研究嗎?」不是研究問題,是決策問題——它沒有確定答案,也找不到一份文件能直接回答它。
可查證的子問題有三個特徵:有確定答案(是/否、一個數字、一份文件的存在性)、答案有來源可指(能說出「去哪份文件的哪裡查」)、有時間邊界(哪個財年、哪個時段)。拆解就是把決策問題換算成一組這樣的小問題。
以下用一家教學用的假設公司示範(非任何真實公司),假設模糊問題是「A 公司的盈利可不可靠?」:
| # | 可查證的子問題 | 答案形態 |
|---|---|---|
| 1 | A 公司最近一個財年的審計意見是什麼類型? | 一個分類(標準/非標準),有原文可抄 |
| 2 | 最近三個財年,經營活動淨現金流與淨利潤的方向是否一致? | 是/否+兩組數字 |
| 3 | 應收帳款增速與收入增速在最近兩個財年的相對關係? | 兩個比率 |
| 4 | 收入按產品或地區的分部拆分是什麼? | 年報附註裡的一張表 |
| 5 | 最近 12 個月有沒有更換核數師的公告? | 有/無+公告日期 |
| 6 | 關連交易在收入或採購中的佔比是否有披露? | 披露了什麼、在哪一頁 |
拆解的檢查方法:對每個子問題問「如果兩個人分頭去查,會不會得到同一個答案?」會,就是可查證的;不會(例如「管理層誠信嗎」),就繼續拆,或者移出本次研究範圍並記錄下來。
幾種幾乎必然出現的模糊問法,值得記住它們的改寫方向(示例為教學用假設情境):
| 不可查證的問法 | 改寫成 |
|---|---|
| 「管理層誠信嗎」 | 「過去三年有沒有延遲披露、更換核數師、監管公開行動或重大訴訟的記錄?」 |
| 「競爭優勢穩固嗎」 | 「最近五個財年,毛利率與收入增速相對同業的變化方向是什麼?」 |
| 「行業前景好嗎」 | 「行業協會或主管部門最近一次公開統計的行業規模與增速是多少?發布於何時?」 |
| 「估值便宜嗎」 | 整個拆掉——這是決策問題。先拆出「當前市值是多少」「最近四個財年的盈利與淨資產是多少」等事實子問題,便宜與否的判斷留給人 |
改寫的通用法則:把形容詞換成數字,把評價換成文件的存在性,把「好不好」換成「是什麼」。
AI 可以幫你做拆解的初稿——把決策問題丟給模型,要求輸出子問題清單。但拆解的品質決定整個研究的品質,最終的問題清單必須由你逐條改寫成你真正想查的樣子,因為模型不知道你關心什麼、也不知道哪些問題在實務上查不到。
第二步:為每個子問題指定資訊源
每個子問題在動手查之前,先指定「去哪查」與「拿什麼交叉驗證」。這一步的預設規則是本站工作流的核心:重要事實至少兩個獨立來源。
什麼叫「獨立」?判斷標準是追溯資訊的產生源頭:
| 情形 | 是否獨立 | 原因 |
|---|---|---|
| 兩家媒體轉載同一則新聞稿 | 否 | 源頭只有一個 |
| 兩個商業資料庫都收錄同一家公司的披露數據 | 部分獨立 | 原始來源相同(法定披露),但加工口徑可能不同,可互查加工錯誤 |
| 年報數字 vs 業績公告數字 | 高度獨立 | 兩份文件、兩個時點、兩套編製流程,互為印證 |
| 公司說法 vs 交易對手或供應商的公開披露 | 高度獨立 | 完全不同的源頭與利益立場 |
| AI 的回答 vs 你自己的印象 | 都不算來源 | 兩者的源頭可能都是同一批網路內容 |
來源指定表接著子問題清單寫(沿用第一步的假設示例):
| 子問題 | 首選來源 | 交叉來源 |
|---|---|---|
| 審計意見類型 | 年報核數師報告原文 | 業績公告中對審計的提及 |
| 現金流 vs 利潤 | 年報合併現金流量表+損益表 | 中期報告的對應欄位 |
| 應收 vs 收入增速 | 年報資產負債表附註 | 上一年度年報(確認基期數字) |
| 分部拆分 | 年報分部資訊附註 | 業績公告的分部說明 |
| 核數師更換 | 披露易公告檢索 | 年報的公司治理章節 |
去哪裡找這些來源、各類來源的可信度層級,港股調研資訊源地圖:披露易、年報與第三方數據 有完整地圖。
第三步:搜集,用證據卡記錄
搜集階段的最小工作單位不是「筆記」,是證據卡:一張卡只記一個事實,帶著完整的來源座標。模板如下,欄位一個都不能省:
| 欄位 | 填什麼 | 示例(假設數據) |
|---|---|---|
| 編號 | 流水號,供結論頁引用 | E-007 |
| 主張 | 一句話、一個事實 | 「FY2025 經營活動淨現金流為 X 千元」 |
| 數值與單位 | 數字、幣別、單位 | X 千港元 |
| 來源文件 | 完整文件名稱 | A 公司 2025 年報 |
| 位置 | 頁碼/章節/時間戳 | 第 88 頁,合併現金流量表 |
| 擷取日期 | 你取得文件的日期 | 2026-09-30 |
| 來源層級 | 法定披露/公司產製/第三方/媒體 | 法定披露 |
| 狀態 | 已驗證/單一來源/有衝突 | 已驗證(與業績公告一致) |
| 備註 | 口徑說明、疑點 | 含已貼現票據的處理差異,見附註 |
三個紀律:
- 一張卡一個事實。 「收入增長且毛利率下降」是兩張卡。合併的卡片在交叉驗證時無法逐項標記狀態。
- 位置欄必須精確到頁。 「年報裡有」不算位置。精確位置是可回溯的最低成本保證——三個月後你不需要重讀 300 頁,只需要翻到那一頁。
- 原文照抄,不轉述數字。 數字一旦經過「理解再輸出」,就有被改寫的機會。照抄,然後在備註裡寫你的理解。
為什麼用卡片而不用整頁筆記?因為筆記按「文件」組織,卡片按「事實」組織。到了交叉驗證階段,你需要回答的問題是「這個事實有幾個獨立來源支持」——只有卡片能直接支持這種查詢。工具上一張試算表就夠用:一行一張卡,上面的欄位當列;量大之後再考慮資料庫或知識庫。工具的高級程度不重要,欄位的完整性才重要。
用 AI 加速時,正確的姿勢是讓模型把文件內容整理成證據卡的初稿,但「來源文件+位置」兩欄必須由人抽查:模型編造頁碼是最常見的幻覺形態之一(見 AI 在金融場景的幻覺風險:三種最貴的錯誤)。抽查方法:隨機抽幾張卡,翻到指定頁面確認主張與數字確實在那裡。
第四步:交叉驗證、衝突處理與不確定性記錄
證據卡齊了之後,做三件事。
第一,配對驗證。 對每張標記為重要的卡,檢查是否有第二個獨立來源。配對成功的升級為「已驗證」;配不上的保持「單一來源」——注意,單一來源不是廢卡,法定披露的單一來源本身就有較高效力,但你要清楚它的狀態。
第二,處理衝突。 兩個來源給出不同數字時,按順序做:
| 步驟 | 動作 |
|---|---|
| 1 | 回原始來源:兩個數字各自的出處文件是什麼?有沒有哪一方其實是轉述? |
| 2 | 查口徑:是不是同名不同義?(例如「收入」含不含某類項目、「現金」含不含受限制存款) |
| 3 | 查時點:是不是同一個數字在不同日期的兩個版本?(業績公告與年報之間可能有調整) |
| 4 | 仍無法調和:把衝突本身記錄成一張新的證據卡——「兩個來源存在未調和的差異」常常是整個研究裡最有價值的發現 |
第三,標記不確定性。 每張卡、每個後續結論都強制三態標記:
| 狀態 | 定義 | 使用規則 |
|---|---|---|
| 已證實 | 有原始來源,且經交叉驗證或屬法定披露 | 可以進入結論 |
| 推論 | 基於已證實事實的推理,但無直接來源 | 進入結論時必須帶著「推論」標籤與推理依據 |
| 未知 | 查過,沒有答案;或來不及查 | 寫進「未決清單」,禁止用推論冒充 |
「查過但沒有答案」和「沒查」是兩種不同的未知,前者要記錄你查過哪裡——這也是三個月後的你最想知道的資訊。
第五步:產出帶引用的結論頁
工作流的最終產出是一頁結論,格式固定:
| 欄位 | 內容 |
|---|---|
| 研究問題 | 最初的模糊問題+拆解後的子問題清單 |
| 結論 | 每個子問題一行答案,行末標注證據卡編號(如 E-003、E-007) |
| 推論與判斷 | 與事實分開列出,逐條標明依據哪些證據卡 |
| 未決清單 | 所有「未知」項,每條註明已查過哪裡 |
| 衝突記錄 | 未調和的來源差異 |
| 署名與日期 | 撰寫人、日期;若為團隊作業,加覆核人 |
結論頁的紀律:每一行都能被質問「證據呢?」,而答案永遠是「E-xxx」。 做不出這個形式的結論,說明工作流有環節被跳過了——通常是第三步的證據卡偷懶了。
未決清單另有一條品質要求:每一條都寫成「可以直接執行」的樣子,包含去哪查、查什麼、何時查。「再深入研究現金流差異的原因」不合格;「查 FY2025 年報現金流量表附註中淨利潤與經營現金流的調節項(第 X 頁),確認差異主要來自應收帳款還是存貨變動」才合格。未決清單是寫給三個月後那個已經忘光細節的你的。
可回溯性:三個月後的測試
工作流建好後,用這組問題自測。全部答「是」,才算可回溯:
- 從結論頁的任意一行,能在兩分鐘內找到對應證據卡
- 從任意一張證據卡,能在五分鐘內打開原始文件並定位到記錄的頁面
- 所有引用過的原始文件,手上都還留有下載時的版本(來源文件可能被更新或下架)
- 每張卡的擷取日期都在,能判斷資訊的新舊
- 推論與事實的分界清晰,推論條目都寫了推理依據
- 未決清單還在,而且每條都寫了「查過哪裡」
還有一個儲存習慣值得單獨強調:引用過的原始文件,必須保存「你下載當時」的本地副本。法定披露文件通常穩定,但第三方頁面會改版、新聞會下架、資料庫的數字會被靜默修正——保留當時版本的唯一方法是自己存檔。存檔檔案用「擷取日期+來源+檔名」的規則命名,成本最低。
這個測試的意義不在形式,而在它改變了你研究時的行為:知道三個月後會被檢查,搜集時就不會抄捷徑。 這也是把個人工作流升級成系統(帶記憶、帶驗證閘的 Agent 流水線)的動機,本站在 自建投研系統:從技能庫到驗證門控的完整設計 與 從偽造到驗證:Agent 驗證架構的信任建築學 有進一步的架構討論。
AI 會在這裡出錯
把六個步驟對照 AI 的能力邊界(完整版見 AI 在投研流程的位置:哪些環節能交出去,哪些不能),典型的翻車點:
| 步驟 | AI 的出錯形態 | 防法 |
|---|---|---|
| 拆解子問題 | 拆出看似專業但查無實據的問題(例如要求查一個根本不存在的披露項目) | 每個子問題先確認來源存在,再排入計劃 |
| 指定來源 | 編造資料庫名稱、連結與檢索路徑 | 來源以 港股調研資訊源地圖:披露易、年報與第三方數據 的地圖為準,連結逐個點開 |
| 證據卡 | 頁碼與數字對不上;把兩個來源的內容寫進同一張卡 | 位置欄人工抽查;一卡一事實 |
| 交叉驗證 | 用「自己的記憶」當第二個來源——那不是獨立來源,可能只是同一批網路內容的回聲 | 第二來源必須是你能打開的文件 |
| 不確定性 | 把「未知」悄悄寫成「推論」,把「推論」寫成篤定語氣 | 三態標記由規則強制,語氣審查由人做 |
| 結論頁 | 引用編號與內容錯位 | 發出前隨機抽兩行,沿編號走回原文 |
最後重複一次本站的立場:這個工作流的所有設計都基於同一個假設——AI 會出錯,人也會出錯,所以流程要讓每個錯誤都能被追溯、被定位、被修正。 可回溯不是為了好看,是為了三個月後的你能站在今天的記錄上繼續工作,而不是從零開始。
下一步
- 港股調研資訊源地圖:披露易、年報與第三方數據:第二步的來源指定,需要這張資訊源地圖。
- AI 在金融場景的幻覺風險:三種最貴的錯誤:第四步交叉驗證的理論基礎——三種最貴的 AI 錯誤與四道防線。
- 一家公司的 30 分鐘快速盡調流程:工作流的上游場景——30 分鐘快速盡調產出的待查清單,正好是子問題拆解的輸入。
- 300 頁年報轉結構化 JSON:三表與分部數據:當證據卡多到手工管理不動時,把年報變成結構化數據是第一個自動化對象。
- 自建投研系統:從技能庫到驗證門控的完整設計:把整套工作流交給帶記憶與驗證閘的 Agent 系統來執行。
More in Playbooks
- MemoryHub v2.0 Full Record of Ten-Database Sync: The 6-Hour Battle from 0 Points to 3,892 Records
- agentmemory Full Feature Deployment Log: From GitHub Trending to Four Platform Automatic Memory Capture
- Complete Guide to 14 Financial Services AI Skills: From Deal Sourcing and M&A Models to Catalyst Calendars
- Ten-Day Pitfall Log: 16 Fatal Lessons in Building an AI Assistant System