나는 6개의 AI 에이전트로 이루어진 팀을 이끌며 하루 24시간 돌리고 있다. 이 일은 듣기엔 멋있어 보이지만, 실제로 해보면 가장 골치 아픈 건 그들이 똑똑하지 않아서가 아니라 자주 기억을 못한다는 점이라는 걸 알게 된다.

같은 함정에, 어제 한 번 빠졌다가, 오늘은 다른 작업으로 또 빠진다. 지난 라운드에서 이미 어떤 길이 안 통한다는 걸 시행착오로 확인했는데, 다음 라운드에서 여전히 신나서 그 길로 돌진한다. 매번 마치 첫 출근 날처럼, 지난주에 가르쳐준 걸 깨끗이 잊어버린다. 당신은 경험이 쌓이는 직원을 데리고 있는 게 아니라, 영원히 첫날에 머물러 있는 인턴을 데리고 있는 것이다 — 다만 타이핑만 아주 빠를 뿐.

그래서 구글 연구팀이 발표한 Dream-RSI를 보았을 때, 나는 한참을 들여다봤다. 왜냐하면 그것이 다루는 문제가 마침 내가 매일 씨름하고 있는 바로 그 문제였기 때문이다.

에이전트가 ‘꿈’을 꾸기 시작했다

먼저 이것이 무엇을 하는지 명확히 짚고 넘어가자. 이름은 낭만적으로 지어졌지만, 메커니즘 자체는 상당히 실용적이다.

일반적인 에이전트가 작업을 수행하는 방식은 이렇다. 지시를 받고, 한 가지 방법을 시도하고, 성공하거나 실패하고, 그리고 대부분의 경우 이번 경험은 그렇게 증발해버린다. 다음번에는 지난번에 왜 막혔는지 잘 기억하지 못하고, 어느 단계가 사실 헛수고였는지도 기억하지 못한다.

Dream-RSI는 여기에 핵심적인 동작 하나를 추가한다. 에이전트가 한 라운드의 작업을 마친 후, 서둘러 앞으로 나아가지 않고 먼저 ‘꿈을 꾼다’.

에이전트는 과거의 모든 시도와 결과를 저장해둔다 — 이번엔 성공했고, 저번엔 실패했고, 이 단계는 사실 돌아가는 길이었다는 식으로. 그런 다음 이 과거 기록을 이용해 추론한다. 만약 먼저 어떤 길을 시도했다면 더 낫지 않았을까? 언제쯤 일찍 포기하고 더 이상 소모하지 말아야 할까? 한 길로만 끝까지 밀어붙이는 대신, 여러 방안을 동시에 열어서 시도해봐야 할까?

여기서 처음 읽었을 때 “아, 이렇게도 되는구나” 싶었던 부분이 있다. 이 결과들은 이미 실제로 실행해본 것들이기 때문에, 이런 추론은 작업을 다시 실행할 필요가 전혀 없다는 것이다. 이건 머릿속에서 재연하는 것이지, 실제로 한 번 더 하는 게 아니다. 마치 하루 종일 바둑을 둔 사람이 밤에 침대에 누워 오늘의 매 수를 머릿속으로 복기하는 것과 같다 — 이 판에서 만약 일곱 번째 수를 반대쪽으로 뒀다면 어땠을까? 그는 실제로 판 전체를 다시 둘 필요 없이, 머릿속에서 여러 가능성을 이미 다 걸어본 것이다.

추론을 마치면, 에이전트는 그중에서 더 나은 방식을 골라 곧바로 다음 라운드에 적용한다. 그리고 이 새로운 라운드는 다시 더 많은 성공과 실패를 남기고, 그러면 에이전트는 다시 한번 ‘꿈을 꾸며’ 전략을 또 한 번 수정한다. 한 라운드씩 이어지며, 할수록 점점 더 정확해진다. 이것이 논문에서 말하는 ‘재귀적 자기개선(recursive self-improvement)‘이다 — 스스로가 스스로를 개선하되, 굴러가듯 계속 개선한다.

550에서 317로, 같은 일을 40% 덜 하다

개념만 이야기하면 좀 공허하니, 구글 연구팀은 알고리즘, 수학 최적화, GPU 커널 등 8가지 작업에서 테스트를 진행했다. 내가 가장 와닿았던 건 그중 한 사례다.

Gemini 3.1 Pro의 한 알고리즘 작업을 예로 들면, 계속 고정된 방식을 쓰는 것과 비교했을 때, 꿈을 꾸고 복기하는 이 메커니즘을 적용한 후 에이전트의 호출 횟수가 550회에서 317회로 줄었다 — 게다가 최종적으로 찾아낸 프로그램은 실행 속도도 더 빨랐다.

이 숫자를 실제 상황에 대입해서 생각해보라. 같은 일을 하는데, 거의 40%에 가까운 수고를 덜 들였는데, 결과는 나빠지기는커녕 오히려 더 좋아졌다. 나처럼 매일 에이전트가 얼마나 많은 호출과 토큰을 태우는지 지켜보는 사람에게, 이건 학술적으로 예쁜 숫자가 아니라 실질적인 비용과 시간이다. 40% 덜 왔다갔다한다는 건, 40% 덜 기다리고, 40% 덜 청구되며, 게다가 더 나은 답을 얻는다는 뜻이다.

꿈을 꾸는 에이전트는 더 열심히 하는 게 아니라, 더 길을 잘 고르는 것이다.

진짜 대단한 것은 ‘방법’이 복리로 쌓이는 것

이 글을 다 읽고 나서 정말로 나를 벌떡 일어나게 만든 통찰은 “에이전트가 똑똑해졌다"가 아니라, 똑똑해지는 방식 그 자체였다.

아주 쉽게 지나칠 수 있는 핵심 하나를 짚고 넘어가자. 이 전체 과정에서 기저 모델 자체는 변하지 않는다는 점이다. 구글은 더 큰 두뇌로 바꾸지도 않았고, 재학습을 시키지도 않았다. 개선된 것은 에이전트가 “다음 단계에서 어떻게 해야 하는가"에 대한 그 방법론, 그 전략이다.

다시 말해, 발전한 것은 “어떤 두뇌를 쓰는가"가 아니라 “어떻게 일을 하는가"이다.

이 사실은 일반인에게는 그저 기술적 디테일일 수 있지만, 실제로 에이전트 팀을 이끌고 실제로 에이전트에 의존해 일을 하는 사람에게는 거의 사고의 틀을 바꿔놓는 일이다. 이 업계에는 아주 강한 관성적 반응이 있다. 효과가 좋지 않으면? 더 큰 모델로 바꾼다. 새 모델이 나오면? 얼른 업그레이드한다. 마치 발전의 유일한 경로가 끊임없이 더 강한 두뇌를 쫓는 것뿐인 것처럼 말이다.

Dream-RSI는 또 다른 길을 제시한다. 방법 자체가 복리로 쌓이게 하라는 것이다. 같은 두뇌라도, 그것이 기억하고, 복기하고, 지난 라운드의 교훈을 다음 라운드의 전략으로 바꿀 수만 있다면, 라운드를 거듭할수록 나아질 수 있다 — 그리고 이 나아짐은 누적되고 눈덩이처럼 불어난다. 이것은 “더 큰 모델로 바꾸는 것"보다 훨씬 이득이다. 모델 교체는 한 번에 한 계단 뛰어오르는 일회성 사건이지만, 방법의 복리는 매 라운드마다 위로 쌓이기 때문이다.

에이전트를 이끌어온 이 시간 동안, 나는 점점 더 확신하게 되었다. 교훈을 기억하는 평범한 에이전트는, 장기적으로는 금붕어 같은 기억력을 가졌지만 두뇌만 큰 에이전트를 이긴다. 사람도 마찬가지다. 당신 주변에서 가장 강한 사람은, 대개 가장 똑똑한 사람이 아니라 가장 복기를 잘하는 사람이다.

솔직히 말하면, 아직 ‘바로 갖다 쓸 수 있는’ 것은 아니다

나는 이걸 마치 내일 당장 당신의 에이전트에 꽂을 수 있는 플러그인처럼 이야기하고 싶지 않다. 그건 정직하지 못한 태도다.

현재 Dream-RSI는 연구 성과이며, 테스트한 것은 알고리즘, 수학 최적화, GPU 커널 같은 명확한 정답이 있고 결과를 실행해볼 수 있는 특정 작업들이다. 이런 작업들에는 공통점이 하나 있다. “이번엔 성공했는지 실패했는지, 얼마나 빨리 실행됐는지"를 명확하게 저장할 수 있다는 것이다. 그래서 에이전트가 ‘꿈꿀’ 거리가 있는 것이다. 아직은 아무 시나리오에나 던져 넣으면 다 통용되는 즉시 사용 가능한 것이 아니다.

그러니 이것을 오늘 오후에 바로 복제할 수 있는 튜토리얼이 아니라, 눈여겨볼 가치가 아주 큰 방향으로 받아들이길 바란다. 방향이 맞다고 해서 길이 이미 다 닦여 있는 건 아니다. 그 사이에는 아직 거리가 있고, 모호하고 명확한 정답이 없는 작업일수록 이 길을 어떻게 걸어갈지는 여전히 더 연구가 필요하다.

하지만 방향이라는 것은, 종종 지금 당장 쓸 수 있는지 여부보다 더 중요하다. 그것이 지금 똑똑한 사람들이 어디에 힘을 쏟고 있는지를 알려주기 때문이다.

가지고 갈 수 있는 하나의 생각

만약 당신도 에이전트를 쓰고 있거나, 에이전트에게 일을 맡길 준비를 하고 있다면, 내가 남기고 싶은 건 도구 하나가 아니라 질문 방식의 전환이다.

우리는 너무 익숙하게 이렇게 묻는다. “어떤 더 강력한 모델로 바꿔야 할까?”

Dream-RSI는 나로 하여금 다른 질문을 던지고 싶게 만든다. “내 에이전트가 지난번의 교훈을 기억하게 하려면 어떻게 해야 할까?”

이 두 질문은 당신을 완전히 다른 곳으로 데려간다. 모델을 쫓으면, 당신은 영원히 다음 출시를 기다리고, 영원히 돈을 들여 업그레이드하고, 업그레이드를 마치고도 금방 또 부족하다고 느낀다. 방법을 쫓으면, 당신은 스스로 점점 더 나아지는 무언가를 만들고 있는 것이다 — 그것이 오늘은 아직 어리석을 수 있지만, 라운드를 돌 때마다 조금씩 위로 쌓아 올린다.

Dream-RSI라는 이 길이 최종적으로 얼마나 멀리 갈 수 있을지 나는 모른다. 하지만 적어도 한 가지는 분명히 정리하게 되었다. 계속 두뇌를 바꾸느니, 차라리 먼저 명확히 생각해보라 — 지금 당신 손에 있는 그 두뇌가, 더 이상 매번 처음부터 시작하지 않게 하려면 어떻게 해야 할지를.

꿈을 꾸는 것이, 반드시 더 강한 것은 아니다. 하지만 분명, 더는 헛걸음을 하지 않게 된다.


참고 출처: 구글 연구팀이 발표한 Dream-RSI. 관련 보도: https://m.theblockbeats.info/flash/367592