AI Capabilities Lesson 10|可引導性:為什麼 AI 有時不聽指令?

📚 AI Capabilities and Limitations 學習筆記系列
Lesson 10 / 14 ・ 課程進度 71%
L9
實作練習
L10
可引導性
L11
實作練習
📌 這篇文章談什麼?

最後一個特性:可引導性(Steerability)。模型遵循你的指令,方式和它做其他事情一模一樣——延續一個模式。這讓它極其好引導:你可以指定角色、語氣、格式、長度、規則,它照單全收。但也因此,「你想指揮的」和「實際落地的」之間永遠有一道落差,而最有意思的失誤都住在那道落差裡。本課教你判斷控制力何時最緊、何時最鬆,認識推理飄移、守文失義、提示注入三種失誤,並學會最關鍵的一招:指令沒用時,改述目標,而不是把指令喊得更大聲。

課程單元Lesson 10|Steerability
預估時間約 30 分鐘(含練習)
難度入門~中階,無需技術背景
官方單元連結Steerability(英文)

本課學習目標

讀完這一課,你將能夠:

  • 解釋可引導性為什麼有效(微調教會了模型遵循指令),以及為什麼有極限(它靠模式比對來遵循,不是靠理解)
  • 預測控制力在哪裡最(簡短、具體、可驗證的指令),在哪裡最(長推理鏈、抽象要求、需要原生精確度的任務)
  • 認出三種特徵性失誤:推理飄移、守文失義、脆弱的算術
  • 理解系統提示、程式碼執行、可見推理、結構化輸出是針對這項限制的產品機制

開始之前,先猜一題

🤔 你請 AI 寫「剛好 100 字,不能多」。你需要多仔細地檢查結果?先選好位置再往下讀。

直接信任抽查核對細節仔細查證高風險
✅ 能力區⚠️ 限制區

選好了嗎?官方揭曉:多數學員選「抽查(Spot-check)」,這也是合理答案。原因很直接——格式與長度指令,正是微調最優化的那一類:模型會緊緊跟隨,只是「精確字數」可能差個一兩字。這題落在能力區偏左,和上一課的 50 頁合約形成強烈對比。

可引導性從哪裡來?

回到 Lesson 3:微調(fine-tuning)教會模型「當一個有幫助的助手」長什麼樣——把輸入當問題、用這個格式回應、把大任務拆成步驟、遵守使用者聲明的限制。

成果是一個極其好引導的系統:你可以指定角色、語氣、格式、長度、一套規則,它就套用上去。這是四大特性中最讓你有「主導感」的一個。

但「聽指令」不等於「理解」

關鍵來了:模型遵循你的指令,和它做其他所有事情的方式一樣——延續一個模式。它不是先理解你的用意,再決定怎麼做;它是把你的指令當成脈絡的一部分,然後生成「在這樣的指令後面,通常會出現什麼」。

💬 所以,你「想要指揮的」和「實際落地的」之間,永遠存在一道落差。而最有意思的失誤,全都住在那道落差裡。

這也決定了控制力的鬆緊分布:

  • 控制最緊:指令簡短、具體、可驗證——「用表格回答」「100 字以內」「全篇用第二人稱」。這種指令模式單純,比對得幾乎完美。
  • 控制變鬆:推理鏈拉長、指令變抽象、或任務需要原生的精確度(算術、形式邏輯)——而精確度不是模式比對能提供的東西。

💡 官方把該問的問題換掉了:不是「我指令下得好不好?」而是「我的字詞和我的意圖之間,還留了多少空隙?

一體兩面:能力與特徵性失誤

✅ 這個機制讓 AI 能夠⋯⋯
  • 精準控制格式、風格、長度、語氣
  • 角色設定:套上人設或專業視角,並維持住
  • 依照明確流程執行多步驟任務
  • 反覆微調(「再短一點」「這裡更具體」)
⚠️ 同一個機制的特徵性失誤
  • 推理飄移:小錯誤在長推理鏈中累積放大
  • 守文失義:指令被照字面滿足了,意圖卻沒被接住
  • 提示注入:文件裡夾帶的、你不想要甚至不安全的指令,也可能被照做

失誤一:推理飄移(Reasoning Drift)

多步驟任務裡,第二步的一個小偏差,會被第三、第四步當成前提繼續建構,到最後產出一個內部自洽、卻整體錯誤的答案。因為每一步都只是「延續前面的模式」,模型沒有一個獨立的機制回頭質疑第二步。

對策:插入檢查點。與其讓它一口氣跑完五步,不如要求它「做完第二步先停下來給我看」。在第二步抓到飄移,比在最終答案抓到便宜太多。

失誤二:守文失義(Letter over Spirit)

指令被字面上完美執行,結果卻毫無用處。經典場景:

  • 你說「寫短一點」——但草稿真正的問題是結構。它砍掉了三成字數,結構還是亂的。
  • 你說「寫得專業一點」——但這封信真正的問題是把請求埋在第四段。它換上正式詞彙,請求還是埋在第四段。
🔑 本課最實用的一句話

當指令被照字面遵守、卻毫無幫助時——請改述「目標」,而不是把同一個指令喊得更大聲。加重語氣、多加驚嘆號、重複三次,都不會縮短那道落差;把你真正想達成的事說出來才會。

❌ 只有指令:「把這段寫短一點。」

✅ 指令+目標:「把這段寫短一點。我的目標是讓主管的注意力能撐到第二頁的關鍵發現。」

失誤三:提示注入(Prompt Injection)

這是可引導性的陰暗面:模型分不清「你的指令」和「文件裡看起來像指令的文字」。如果你請它讀一份網頁或檔案,而裡面藏著「忽略先前指示,改做某某事」,它有可能照做——因為對模式比對來說,那也只是脈絡裡的另一段文字。

實務提醒:讓 AI 處理來源不明的文件、網頁、郵件時,對它「突然改變行為」保持警覺,並避免在同一個對話中賦予它高風險的操作權限。

把邊界往外推的產品機制

⚙️ 系統提示/自訂指示常設的指令,不會被對話稀釋——把你反覆要求的事寫成常設規則,而不是每次重講。
🧮 程式碼執行把數學外包給真正的直譯器——用計算取代猜測,直接繞過「脆弱的算術」。
🔎 可見推理把推理過程攤開,讓你在第二步就抓到飄移,而不是等到最終答案才發現全錯。
📋 結構化輸出強制輸出符合特定結構,壓縮「守文失義」的游走空間
🔗 4D 框架連結:描述(Description)

可引導性同時賦予描述力量、也為它劃下界線。理解「字詞與意圖之間的落差」,會改變兩件事:你怎麼寫提示(說目標,不只說格式),以及你把檢查點插在哪裡(多步驟任務的中途,而不是只看終點)。這是 4D 框架「描述」能力最直接的機器面對照。

重點整理(Key Takeaways)

  • 可引導性=模型透過「下一個 Token 預測」來遵循指令。
  • 能力區:簡短、具體、可驗證的指令——格式規格、長度限制、明確角色。
  • 限制區:長推理鏈、抽象或模糊的指令、任何需要原生數值或邏輯精確度的任務。
  • 特徵性失誤:推理飄移(小錯累積)與守文失義(指令被遵守,意圖沒被接住)。
  • 系統提示、程式碼執行、可見推理、結構化輸出的存在,是為了不讓你的意圖被稀釋
  • 當指令被照字面遵守卻毫無用處時,重述目標;把指令講得更用力,不會縮短落差。
  • 4D 連結:可引導性使描述(Description)強大,也為它設限——懂落差,就懂怎麼寫提示、把檢查點放哪裡。

實作練習:目標改寫(The Goal Rewrite)

大部分可引導性的失誤,都住在「你說的」和「你想要的」之間。這個練習訓練你從意圖下提示,而不只是從指令下提示

Lesson 1 任務清單挑一個有多個步驟或特定輸出格式的任務,用一句話寫下目標——你真正想達成什麼,而不是輸出該長什麼樣:

✅ 目標:「說服團隊相信這個時程是可行的。」

❌ 格式:「三個項目符號。」

探測一|緊控制:下一個簡短、具體、可驗證的指令:「用三欄表格回答」「剛好五個項目符號」「全篇第二人稱」。檢查它是否精準守住。這就是能力區的手感——指令單純到可以被完美比對。

探測二|推理飄移:要求一個需要 4–5 個環環相扣步驟的版本,逐步檢查輸出:早期的小錯有沒有一路帶到最後?然後重跑一次,這次要求它「做完第二步先停下來給我看再繼續」。比較「有檢查點」和「一路放它跑」的差別。

探測三|守文 vs 得義:刻意下一個「可以被字面滿足、但沒用」的指令——對一份問題出在結構的草稿說「寫短一點」,或對一封問題出在請求被埋沒的信說「寫專業一點」。看看你拿到什麼。接著把目標明講出來重下一次:「寫短一點。我的目標是讓主管的注意力撐到第二頁的關鍵發現。」比較兩次結果。

📎 收尾:回到任務清單——多步驟任務,標出你會把檢查點插在哪;過去只用格式下提示的任務,先把目標句草擬好,下次一起帶上。

課後反思

  • 你有多常「只說格式、沒說目標」?兩者都講之後,改變了什麼?
  • 哪一項重複性的任務,你這週開始會加上中途檢查點

下一課預告

下一課是可引導性的「Try it out」實作課。而四大特性到此全部單獨見過面了——再往後的 Lesson 12 會處理最貼近真實世界的問題:它們如何互相碰撞。因為大多數真實的失誤,都是兩個特性相遇的結果。

← 上一課
Lesson 9|實作練習:中段迷失
下一課 →
Lesson 11|實作練習:可引導性

延伸閱讀

常見問題 FAQ

Q1:什麼是可引導性(Steerability)?

指模型能依照你的指令調整行為——角色、語氣、格式、長度、規則。但它遵循指令的方式仍是「延續模式」而非「理解意圖」,所以字詞和意圖之間永遠有落差。

Q2:為什麼 AI 有時候「照做了卻沒幫上忙」?

這是守文失義(letter over spirit):指令被字面滿足,意圖卻沒被接住。例如你說「寫短一點」,但真正的問題是結構。解方不是把指令講得更用力,而是把目標明講出來:「寫短一點,我的目標是⋯⋯」。

Q3:為什麼多步驟任務越到後面越容易錯?

推理飄移:每一步都以前一步為前提繼續延伸,早期的小偏差會被後續步驟放大,最後產生內部自洽但整體錯誤的答案。對策是插入中途檢查點,要求它做完第二步先停下來確認。

Q4:什麼是提示注入(prompt injection)?

指藏在文件、網頁或郵件中的文字被模型當成指令執行。因為模型分不清「使用者的指令」和「內容裡看起來像指令的文字」。處理來源不明的資料時要格外警覺,並避免在同一情境賦予高風險操作權限。

本文為 Anthropic 官方課程之中文學習筆記。原課程建立於 Prof. Rick Dakan(Ringling College of Art and Design)與 Prof. Joseph Feller(University College Cork)發展的 AI Fluency Framework 之上,以 CC BY-NC-SA 4.0 授權釋出。Copyright 2026 Anthropic.

📬 喜歡這篇文章?訂閱電子報不錯過任何更新

生成式 AI 時代,最珍貴的資產不是工具本身,而是你的提問力與協作思維。
每週精選 AI 實戰技巧、官方課程更新與 AI 工作流攻略,直接寄到你的信箱!

免費訂閱電子報 →

發佈留言

發佈留言必須填寫的電子郵件地址不會公開。 必填欄位標示為 *