📰 핵심 요약
OpenAI가 API 설정 두 가지만 조정해도 GPT-5.6의 ARC-AGI-3 테스트 점수를 큰 폭으로 끌어올리는 동시에 효율까지 개선할 수 있다는 사실을 발견했다. 첫 번째 설정은 추론 과정 유지(retaining reasoning)로, 모델이 여러 차례의 상호작용이나 다단계 작업에서 이전의 추론 체인을 이어갈 수 있게 해, 매번 처음부터 다시 생각하지 않아도 되도록 한다. 이를 통해 논리적 일관성을 유지하면서 중복 연산을 줄일 수 있다. 두 번째 설정은 압축(compaction) 활성화로, 이전 추론 내용을 압축·정리한 뒤 다음 단계로 전달함으로써 핵심 정보를 희생하지 않으면서도 컨텍스트 길이와 연산 부담을 대폭 줄인다. 이 두 설정을 함께 적용하자 GPT-5.6은 ARC-AGI-3처럼 긴 추론 체인과 다단계 문제 해결이 필요한 테스트에서 점수가 거의 3배 향상되었고, 불필요한 중복 추론과 장황한 컨텍스트를 피한 덕분에 전체 연산 효율도 함께 개선되었다. 이는 복잡한 추론 작업에서 모델의 “기억"과 “사고의 연속성"을 어떻게 관리하느냐 자체가, 모델 교체나 연산 자원 확대에만 의존하지 않고도 성능과 비용을 직접 최적화할 수 있는 핵심 레버가 될 수 있음을 보여준다. 자세한 기술 구현 내용과 전체 테스트 데이터는 원문 링크를 참고하기 바란다.
💬 JudyAI Lab 관점
원문 요약을 바탕으로 작성했으며, 추가 사실을 덧붙이지 않고 JudyAI Lab 관찰자 시점으로 정리한다:
OpenAI의 최신 테스트에 따르면 API 설정 두 가지만 조정해도 GPT-5.6의 ARC-AGI-3 테스트 점수가 큰 폭으로 향상된다는 결과가 나왔다. 모든 AI 빌더가 주목할 만한 저비용 최적화 경로다.
이 두 설정은 각각 추론 과정 유지와 압축 활성화다. 전자는 모델이 다단계 작업에서 이전 추론 체인을 이어가게 해 매번 처음부터 다시 생각하지 않도록 하고, 후자는 이전 추론 내용을 압축·정리한 뒤 다음 단계로 전달해 핵심 정보를 희생하지 않으면서도 컨텍스트 길이와 연산 부담을 줄인다. 두 설정을 함께 적용하면 GPT-5.6은 긴 추론 체인이 필요한 다단계 테스트에서 점수가 거의 3배 향상되었고 효율도 동시에 개선되었다. 이 사례는 자주 간과되는 관점을 보여준다. 복잡한 추론 작업의 성능 병목은 반드시 모델 자체의 능력에만 있는 것이 아니며, “기억"과 “사고의 연속성"을 어떻게 관리하느냐 자체가 모델 교체나 연산 자원 확대에만 의존하지 않고도 성능과 비용을 직접 최적화할 수 있는 레버가 된다는 점이다.
다음에 다단계 추론 작업에서 결과가 만족스럽지 않을 때는, 서둘러 모델을 업그레이드하기보다 먼저 자신의 API 호출이 추론 상태를 유지하고 있는지부터 점검해보는 것이 좋겠다.
📅 원문 정보
- 발행 시각: 2026-07-29T15:00
- 원문 출처: https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores