思維鏈指的是:在一次回覆裡,讓 Claude 把推理過程一步一步寫出來,而不是只給最終答案。這跟 extended thinking(延伸思考)不是同一件事——extended thinking 是模型可以調用的內部思考預算,屬於機制層面的資源分配,思考過程不一定會顯示給你看;思維鏈則是明確要求把思考步驟寫進回覆本身,你看得到每一步。這也跟 prompt chaining(提示鏈接)不同——prompt chaining 是把一個大任務拆成好幾個獨立的 prompt,一次呼叫接著一次呼叫串起來完成;思維鏈是單一次回覆內部的推理展開,不涉及多次呼叫。三者容易被混用,但分別處理的是不同層次的問題:思維鏈管「這一次回答的推理過程要不要寫出來」,extended thinking 管「這次思考能用多少資源」,prompt chaining 管「這個任務要不要拆成好幾次呼叫」。
這個做法會被需要,是因為直接要答案跟要求展開推理,兩者的可核實程度完全不同。只有結論的情況下,一份計算結果錯了,你只知道「這個數字不對」,不知道錯在資料代錯、公式用錯、還是中間哪一步筆誤——重新來一次的唯一辦法通常是整段重跑,沒有辦法定位問題出在哪。思維鏈把推理過程攤開之後,錯誤會落在具體的某一步,你可以直接指出「第三步的假設不成立」,讓 Claude 只需要修正那一步,不需要整個重來。這個差異在職場情境裡格外重要,因為很多需要 AI 協助的任務(合約條款比對、預算試算、政策適用判斷)本身要求的不是「一個答案」,是「一個能被檢視、能被質疑的推理過程」——沒有展開的思考,本質上是一個你只能選擇相信或不相信的黑盒結論。
實際操作分兩層。表層做法是在指令裡明確要求,例如「請一步一步說明你的推理過程,再給出結論」,或指定格式如「先列出你考慮的因素,再逐項判斷,最後給結論」——這個做法對任何模型都有效,成本是回覆會變長,但换來每一步都可以被檢視。深層做法是搭配結構化要求:針對計算類任務,要求列出每一步計算式而不是只給結果;針對判斷類任務(例如「這條合約條款算不算標準」),要求先列出判斷依據的具體條文或標準,再說明依據跟結論之間的關係,而不是先講結論再補依據——順序本身會影響推理是不是真的被完整想過一遍,還是結論先出現、依據只是事後補上的裝飾。要注意的是,思維鏈不是「加了就一定更準」,對非常簡單的任務(例如查一個固定事實),要求展開推理反而會拖慢速度、增加不必要的長度,值得展開的通常是計算、多步驟判斷、或有爭議空間的推理任務。
對你來說,思維鏈真正改變的是「出錯之後你能做什麼」。沒有展開推理時,發現答案錯了,你唯一能做的是整段重問,運氣好才會問到正確版本;有展開推理時,你能直接指出哪一步的假設或資料有問題,讓修正變成針對性的,而不是碰運氣的重試。這在需要對輸出負最終責任的場合特別關鍵——如果一份預算試算或合約條款判斷要往上呈交,能不能說出「這個結論是怎麼推出來的」,本身就是責任能不能被追溯的分界。要留意的風險是:思維鏈讓推理「看起來」更可信,但寫出來的步驟本身也可能是錯的或是自圓其說——展開推理不等於推理正確,你仍然需要核對關鍵的中間步驟,尤其是涉及具體數字或外部事實的地方,不能因為過程寫得詳細就直接放行結論。
Google 研究團隊 2022 年發表的論文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》首次系統性提出這個技巧,論文中的實驗顯示,在數學應用題這類多步驟推理任務上,要求模型展開思維鏈的準確率明顯優於直接要求答案;這篇論文也是「chain of thought」這個詞在 AI 領域成為標準術語的起點,此後被廣泛應用於複雜推理任務的提示設計中。
優點是把推理過程變成可核實、可精準修正的東西,出錯時能定位到具體哪一步,不需要整段重來,特別適合需要對輸出負責、往上呈交的任務;缺點是回覆長度增加、對簡單任務反而拖慢速度沒有必要,而且展開的推理步驟本身仍可能是錯的或事後補的合理化,不能因為過程寫得詳細就直接信任結論,關鍵步驟仍需人工核對。