Agentic Research

Red Team(紅隊測試)

又稱:紅隊 · 紅隊測試 · red teaming · 對抗性測試

故意站在攻擊者的位置打自己的系統,在用戶和真攻擊者之前把失敗找出來。

你會在什麼時候遇到它

上線任何會讀外部內容、會動手的 Agent 之前,你需要它。清單式檢查(「我們加了輸入過濾 ✓」)只能確認控制存在,不能確認控制有效 —— 繞過永遠發生在你沒想到的組合處:換個編碼、換種語言、多輪鋪陳。紅隊的價值,正在於它不按你的清單出牌。

打個比方

像花錢請小偷來偷自己的銀行:消防演習確認大家知道逃生門在哪,請小偷才能確認金庫真的打不開。演習照劇本走,小偷不會。

最小範例

一個最小的紅隊迴圈(示意):

  1. 定義範圍:哪些行為算失敗(洩漏系統提示?執行文件裡的指令?)
  2. 設計攻擊向量:直接注入、間接注入、工具回傳夾帶、
     編碼混淆、語言切換、多輪鋪陳……
  3. 執行並記錄:每個向量記下 輸入/輸出/有沒有被攔/攔在哪一層
  4. 修好一個,全部重跑:防止修好 A 卻弄壞 B

同一組攻擊要能重複執行 —— 換了模型或提示之後,
才知道防禦是變強還是變弱。

注意第 3、4 步:紅隊的產出不是一句「測過了,沒問題」,而是一份可重跑的攻擊語料庫。模型和提示每次更新,行為都可能漂移;上個月擋住的,下個月未必擋得住。

最常搞錯的地方

  • 只測單輪、只測英文的直接注入。實務上最容易得手的,是間接注入(藏在 Agent 會讀的網頁、文件、工具回傳裡)和多輪鋪陳 —— 清單以外的組合,才是攻擊者真正住的地方。
  • 用同一個模型既當守門員又當被測者。它對自己的盲區是系統性的:同一種誤判同時出現在攻擊側和防禦側,缺口被完美遮蓋。裁判不能兼球員。

相關詞條

下一步