我帶著6個AI Agent的團隊,一天24小時在跑。這件事聽起來很酷,真的做起來,你會發現最磨人的不是它們不夠聰明,而是它們常常不長記性。
同一個坑,昨天踩過一次,今天換個任務又踩一次。上一輪明明已經試出來某條路走不通,下一輪它照樣興沖沖地往那條路衝。每一次它都像是第一天上班,把我上禮拜教過的東西忘得乾乾淨淨。你不是在帶一個會累積經驗的員工,你是在帶一個永遠停在第一天的實習生—只是它打字很快。
所以當我看到Google研究團隊發布的Dream-RSI,我盯著看了很久。因為它處理的,剛好就是我每天在跟它拔河的那件事。
Agent開始「做夢」了
先講清楚它在做什麼,因為名字取得很浪漫,但機制其實很務實。
一般的Agent做任務,是這樣的:接到指令、試一條路、成功或失敗、然後大多數情況下,這次的經驗就這樣蒸發了。下一次它不太記得上次為什麼卡住,也不記得哪一步其實是白費力氣。
Dream-RSI加了一個關鍵動作:Agent做完一輪任務之後,不急著往前衝,而是先「做夢」。
它把過去每一次的嘗試和結果都存下來—這次成功了、那次失敗了、這一步繞了遠路。然後它用這些舊記錄去推演:如果先試哪條路會不會更好?什麼時候該早點放棄、別再耗下去?要不要同時開幾個方案一起試,而不是一條路走到黑?
這裡是我第一次讀到覺得「喔,原來可以這樣」的地方:因為這些結果以前都已經實際跑過了,所以這些推演根本不用重新執行任務。它是在腦子裡重演,不是真的再做一遍。就像一個下完一整天棋的人,晚上躺在床上把今天的每一步在腦中複盤—這盤我要是第七手走另一邊會怎樣?他不用真的再下一整盤,他在腦中就把好幾種可能性都走過了。
推演完,它從中挑出表現更好的做法,直接拿去用在下一輪。而新的這一輪,又會留下更多的成功與失敗,於是它再「做夢」一次、再改一次策略。一輪接一輪,越做越準。這就是論文講的「遞迴自我改進(recursive self-improvement)」—它自己改自己,而且是滾動地改。
550到317,同樣的事少做四成
光講概念會有點空,Google研究團隊在演算法、數學最佳化、GPU kernel等8個任務上做了測試。我最有感的是其中一個例子。
以Gemini 3.1 Pro的一個演算法任務來說:相比一直用固定做法,套上這套會做夢、會複盤的機制之後,Agent的調用次數從550次降到317次—而且最後找到的程式,跑得還更快。
你把這個數字放進真實情境想一下。同樣一件事,少做了將近四成的功,結果不但沒變差,還更好。對一個像我這樣天天在看Agent燒掉多少次調用、多少token的人來說,這不是一個學術上的漂亮數字,這是實打實的成本跟時間。少四成的來回,意味著少四成的等待、少四成的帳單,還換來一個更好的答案。
會做夢的Agent,不是更拚命,是更會挑路。
真正厲害的,是「方法」在複利
這篇東西我讀完,真正讓我坐直起來的洞見不是「Agent變聰明了」,而是它變聰明的方式。
請注意一個很容易被跳過的重點:在整個過程裡,底層的模型本身是不變的。Google沒有換一顆更大的腦、也沒有重新訓練。被改進的,是Agent「下一步該怎麼做」的那套方法、那套策略。
換句話說,進步的不是「用什麼腦」,是「怎麼做事」。
這件事對一般人可能只是個技術細節,但對真的在帶Agent團隊、真的在靠Agent幹活的人來說,它幾乎是換了一個思考框架。我們這個圈子有一種很強的慣性反應:效果不好?換更大的模型。新模型出了?趕快升級。好像進步的唯一路徑,就是不斷去追那顆更強的腦。
Dream-RSI給了另一條路:讓方法本身複利。同一顆腦,只要它會記住、會複盤、會把上一輪的教訓變成下一輪的策略,它就能一輪比一輪好—而且這個好是會累積的、會滾雪球的。這比「換更大模型」划算太多了,因為換模型是一次性的跳一階,而方法複利是每一輪都往上疊。
我帶Agent的這段日子,越來越確定一件事:一個會記住教訓的普通Agent,長期會贏過一個記性金魚、但腦子很大的Agent。就跟人一樣。你身邊最強的那個人,多半不是最聰明的那個,是最會複盤的那個。
誠實說,它現在還不是「拿來即用」
我不想把它講得像明天就能裝進你家Agent的外掛,那不誠實。
目前Dream-RSI是研究成果,測的是演算法、數學最佳化、GPU kernel這類有明確對錯、跑得出結果的特定任務。這類任務有個共同點:你能清楚存下「這次成功還是失敗、跑得多快」,所以Agent才有東西可以「做夢」。它還不是一個丟給你、什麼場景都能通用即插即用的東西。
所以請把它當成一個很值得盯著看的方向,而不是一個今天下午就能複製的教學。方向對,不代表路已經鋪好。這中間還有距離,而且越是模糊、沒有明確對錯的任務,這條路要怎麼走,還有得研究。
但方向這種東西,往往比當下能不能用更重要。因為它告訴你,聰明的人現在在往哪裡使力。
帶得走的一個念頭
如果你也在用Agent,或正準備讓Agent幫你做事,我想留給你的不是一個工具,是一個問法的轉變。
我們太習慣問:「我該換哪個更強的模型?」
Dream-RSI讓我更想問另一個問題:「我要怎麼讓我的Agent,記住上一次的教訓?」
這兩個問題,會把你帶到完全不同的地方。追模型,你永遠在等下一個發布、永遠在花錢升級,而且升完很快又覺得不夠。追方法,你是在打造一個會自己越變越好的東西—它今天可能還很笨,但它每做一輪,就往上疊一點。
我不知道Dream-RSI這條路最後會走多遠。但它至少幫我把一件事想清楚了:與其一直換腦,不如先想清楚,怎麼讓你手上這顆腦,別再從零開始。
會做夢的,不一定是更強的。但一定是,更不會白走一遍的。
參考來源:Google研究團隊發布Dream-RSI。相關報導:https://m.theblockbeats.info/flash/367592