📰 重點摘要

OpenAI 發現只要調整兩個 API 設定,就能讓 GPT-5.6 在 ARC-AGI-3 測試中的分數大幅提升,同時改善效率。第一個設定是保留推理過程(retaining reasoning),讓模型在多輪互動或多步驟任務中,能延續先前的推理鏈,而不是每次都從零開始重新思考,這樣可以維持邏輯連貫性並減少重複運算。第二個設定是啟用壓縮(compaction),將先前的推理內容壓縮精簡後再傳遞給後續步驟,藉此在不犧牲關鍵資訊的前提下,大幅降低上下文長度與運算負擔。這兩項設定搭配使用後,讓 GPT-5.6 在 ARC-AGI-3 這類需要長鏈推理與多步驟解題的測試中,分數幾乎達到三倍提升,同時因為避免了不必要的重複推理與冗長上下文,整體運算效率也同步提升。這顯示對於複雜推理任務而言,如何管理模型的「記憶」與「思考延續性」,本身就是一個可以直接優化效能與成本的關鍵槓桿,而非只能靠換模型或加大算力來提升表現。詳細的技術實作細節與完整測試數據請見原文連結。


💬 JudyAI Lab 觀點

根據原文摘要撰寫,不延伸額外事實,採用JudyAI Lab觀察者視角:

OpenAI最新測試顯示,調整兩個API設定就能讓GPT-5.6在ARC-AGI-3測試分數大幅提升,值得所有AI builder關注這個低成本最佳化路徑。

這兩個設定分別是保留推理過程與啟用壓縮:前者讓模型在多輪任務中延續先前推理鏈,避免每次從零重新思考;後者將先前推理內容壓縮精簡後再傳遞給下一步,在不犧牲關鍵資訊下降低上下文長度與運算負擔。兩者搭配後,GPT-5.6在需要長鏈推理的多步驟測試中分數近三倍提升,效率也同步改善。這個案例反映一個常被忽略的思路:複雜推理任務的表現瓶頸不一定在模型能力本身,如何管理「記憶」與「思考延續性」本身就是可直接最佳化效能與成本的槓桿,不是隻能靠換模型或加大算力解決。

下次遇到多步驟推理任務效果不理想時,不妨先檢查自己的API呼叫是否保留了推理狀態,而非急著升級模型。


📅 原文資訊


🔗 延伸閱讀