LLM 每次只做一件事:猜下一個字
想像一個看過超多書、超會玩接龍的小朋友。他的遊戲規則只有兩條:
規則一
每次只能加一個字,不能一次寫一整段。
規則二
加字之前,會把前面所有的字重看一遍。
實際跑起來就像這樣,一個字一個字長出來:
注意最重要的一點:每猜出一個字,那個字就會被放回去,成為下一次要看的內容。 所以你看到的一整段回答,其實是幾百次「猜下一個字」串起來的。
它「想事情」的時間,是按字算的
模型每吐出一個字,腦袋只轉一小下。一個字 = 一次思考。
所以如果你要求它「直接告訴我答案」,等於只給了它一次轉腦袋的機會, 就要它算完整題。難題當然會出錯。
但如果它先把步驟寫出來——寫了 50 個字,就等於轉了 50 次腦袋。 每一步都不難,串起來卻能走到很遠的地方。
寫出來的字,它自己看得到
人類心算一長串數字會忘記中間結果,所以我們拿紙筆記下來。 模型也一樣——但它的「紙」,就是它剛剛寫出來的那些字。
因為規則二說了:加字之前會把前面全部重看一遍。所以只要它把 「27 × 40 = 1080」寫出來,這個數字就不會弄丟了, 下一步可以安心拿來用。
這就是 CoT(Chain of Thought,思維鏈)的全部祕密。 它不是「模型停止接龍、開始思考」,而是——
親手看一次:模型是怎麼一步步長出答案的
按「下一步」,看看它的草稿紙上多了什麼,以及那對下一步有什麼幫助。
現在的狀態:草稿紙上只有題目。如果現在就逼它講答案,它只能用「一次思考」硬猜一個四位數——很容易錯。
心算 vs 拿紙算
❌ 沒有中間步驟
答:1,141 ❌
就像被逼著心算——只有一次機會、什麼都不能記,猜錯很正常。
✅ 有 CoT
27×3 = 81
1080+81 = 1161 ✅
就像拿紙慢慢算——每一步都很簡單,而且前一步的結果還在紙上等著你用。
因為人類寫的文章裡,本來就到處都是「步驟」
模型訓練時讀過大量這種東西:
數學解題
先列式 → 計算 → 驗算 → 答案
程式除錯
看錯誤 → 找原因 → 修改 → 再測一次
食譜與說明書
第一步…第二步…最後…
教科書
因為…所以…因此…最後得到…
看多了以後,它學會的不只是「答案長什麼樣」, 還有「遇到這種問題,人類通常會怎麼一步一步走過去」。
所以它不是突然長出一顆腦袋,而是把人類寫下來的思考習慣,也一起學會了模仿。
一句話就能打開這個開關
拿同一道有點難的題目問兩次,第二次在後面加一句:
你會發現它開始寫過程了,而且答案正確率明顯變高。 現在比較新的模型很多已經內建這個習慣,不用你講也會自己先想一輪—— 有些還會把思考過程收在一個可以展開的區塊裡。
知道這三件事,你就比大部分人懂了
誤會一:它寫出來的理由,就是它真正的想法
不一定。那段「思考過程」確實幫助它算對(因為它真的當草稿紙在用), 但它寫的理由有時候只是「看起來很合理的說法」,未必是內部真正發生的事。 所以看到一段很有條理的推理,還是要自己驗算結論。
誤會二:什麼題目都該叫它一步一步想
簡單問題(「台灣的首都是哪裡?」)用 CoT 只會變慢、變貴, 有時候繞一大圈反而繞歪。難題才需要草稿紙。
誤會三:寫得越長 = 想得越好
不是。重點是有沒有真的把難題拆小,不是字數多。 一堆廢話不會讓它變聰明,而且第一步如果就錯了, 後面每一步都會踩在錯誤上繼續走——錯誤也會被接龍下去。
一句話記住
LLM 從頭到尾都沒離開「接龍」這件事。
它只是強到連「分析、計算、中間結論」都能一起接出來;
而這些寫下來的字,又變成它下一步的線索和記憶。
所以看起來,就很像在一步一步思考。