這個機制會被需要,是因為有些任務即使給了模型完整的推理指令,也可能因為計算資源不足而在複雜的多步驟問題上出錯——例如同時考慮多個限制條件的排程問題、需要交叉比對多份文件才能得出結論的判斷任務、或是牽涉多層條件邏輯的財務試算。這類任務不是「模型不知道該怎麼想」,而是「在標準的計算資源下,想得不夠深或不夠完整」。延伸思考存在的理由,就是針對這類任務提供額外的思考空間,讓模型有機會在正式作答前把各種可能性、條件交叉檢查得更完整,降低因為想得太快而漏掉關鍵細節的機率。
對你來說,延伸思考真正的權衡在於時間成本跟正確性之間的取捨——啟用之後回覆通常會變慢,換來的是在複雜任務上出錯機率的下降,但這個交換值不值得,取決於任務本身的錯誤代價:一份內部草稿寫錯了改一次就好,代價低,不需要為此多等;一份要送出去的財務試算或合約條款判斷寫錯了,可能造成後續連鎖的麻煩,代價高,值得多花時間讓模型想得更完整。要留意的是:延伸思考預設不會把完整思考過程顯示給你看,如果你的需求是「我要能核對每一步推理」,那你要的其實是 chain of thought,不是延伸思考——這兩者容易被搞混,選錯機制不會讓你得到想要的可核實性。
Anthropic 在發布 Claude 的 model card 與技術文件中說明,延伸思考模式讓模型在回答前有更多內部運算空間,並在數學競賽題(如 AIME)與研究所級科學問答(GPQA)等需要多步驟推理的公開基準測試中,展示了相較於標準模式更高的準確率;這類基準測試的設計本身就是刻意挑選需要多重推理步驟、容易在中途出錯的題型,用來凸顯延伸思考在這類任務上的效果差異。
優點是在複雜多步驟任務上能降低出錯機率,不需要靠寫更長的提示來補償模型的計算限制;缺點是回覆時間變長,且預設不會完整顯示思考過程,如果你需要的是可核實的推理步驟,這個機制本身無法滿足,對格式固定、邏輯簡單的任務也不會帶來明顯效益,反而多花等待時間。