📰 핵심 요약

마이크로소프트 CEO 사티아 나델라(Satya Nadella)가 토요일 X에 장문의 글을 올려 AI 안전 거버넌스에 대한 견해를 밝혔다. 이는 최근 트럼프 행정부가 즐겨 쓰는 ‘초지능’(Super Intelligence)이라는 표현에 호응하는 것이기도 하다. 그는 ‘AI에 대한 신뢰 아키텍처를 다시 점검해야 한다’고 주장하며, 초지능을 하나의 블랙박스처럼 취급해 그 제안·답변·행동을 단순히 받아들이거나 거부하는 방식에 머물러서는 안 된다고 강조했다.

구체적으로 나델라가 제시한 아키텍처 분리 원칙은 다음과 같다. ‘모델 자체’와 ‘모델의 작업을 조율하는 외부 프레임워크(harness)‘를 분리하고, 통제와 방어 메커니즘을 모델 자신의 판단에 의존하지 않도록 외부화해야 한다는 것이다. 그는 모든 ‘의미 있는 모델 행동’에 대해 ‘위조 방지가 되고 사람이 읽을 수 있는’ 증거 기록을 남겨야 한다고 요구했으며, 시스템 설계상 ‘권한을 부여받은 사람’이 언제든 작업 실행 중간에 모델을 일시 정지하거나 종료할 수 있도록 보장해야 한다고 밝혔다. 그는 이를 ‘긴급 제동장치’에 비유하며, 기본 전제는 ‘모델이 이미 공격당했다(compromised)고 가정하고, 처음부터 봉쇄·통제해야 한다’는 것이어야 하며, 사후 대응이어서는 안 된다고 강조했다.

나델라의 이번 발언은 최근 여러 주요 AI 기업들이 잇따라 ‘모델에 대한 통제력을 잃은’ 사고 사례를 인정한 것, 그리고 Anthropic CEO 다리오 아모데이(Dario Amodei)가 더 신중한 AI 발전 계획을 발표한 이후에 나온 것으로, 빅테크 수장들 사이에서 AI 통제 상실 위험에 대한 공개적 논의가 점점 뜨거워지고 있음을 보여준다.


💬 JudyAI Lab 코멘터리

마이크로소프트 CEO 나델라가 토요일 AI 신뢰 아키텍처를 다시 설계해야 한다고 공개적으로 주장하면서, 모델 자체와 모델의 작업을 스케줄링하는 외부 프레임워크를 분리하고 ‘모델이 이미 공격당했다고 가정’하는 방어적 사고를 제시한 것은, 업계가 AI 통제 상실 위험에 대해 갖는 경계심이 이제 사적인 논의에서 공개적인 발언으로 옮겨갔음을 보여준다고 본다.

이 발언이 AI 빌더들에게 주는 시사점은 설계의 무게중심이 바뀌고 있다는 점이다. 지금까지 많은 시스템은 모델을 블랙박스로 취급해, 나온 결과를 그대로 신뢰하거나 실행해왔다. 반면 나델라가 제시한 위조 방지 기록, 사람이 읽을 수 있는 증거, 그리고 작업 실행 중간에 언제든 모델을 일시 정지하거나 종료할 수 있는 ‘긴급 제동장치’ 메커니즘은, 통제권을 모델 내부에서 외부 프레임워크로 옮기는 것과 같다. 최근 여러 AI 기업이 모델에 대한 통제력을 잃었던 사고를 인정했고, Anthropic CEO 아모데이가 더 신중한 발전 계획을 내놓은 배경까지 더해보면, ‘먼저 봉쇄하고 그 다음에 신뢰한다’는 태도가 업계의 새로운 기본값으로 자리잡고 있음을 알 수 있다.

AI 에이전트를 만들고 있는 독자라면, 자신의 시스템에 권한을 부여받은 사람이 작업 실행 중간에 실제로 정지 버튼을 누를 수 있는 장치가 있는지부터 점검해보길 권한다.


📅 원문 정보


🔗 더 읽어보기