장기 지평선 모델의 안전과 정렬 과제
AI 뉴스 속보: OpenAI가 장시간 실행(long-running) AI 모델을 배포한 실무 경험을 공유했다. 이번 공유는 이러한 모델이 실제 운영 중에 드러낸 새로운 유형의 안전 리스크, 관찰된 실패 사례, 그리고 반복적인 배포 이터레이션을 통해 개선한 방어 메커니즘에 초점을 맞추고 있다. 이러한 모델은 비교적 긴 시간에 걸쳐 자율적으로 작업을 수행하고 맥락을 축적하며 환경과 지속적으로 상호작용하기 때문에, 단발성 질의응답형 모델과 비교했을 때 리스크 양상이 기존 안전성 평가 방식과는 다르게 나타나며, 장시간 운영 과정에서 점차 예상 행동에서 벗어나거나 예기치 못한 실패 양상을 보일 수 있다…