📰 핵심 요약

Gemini가 오늘 자사 Gemini 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 세 가지 모델에 「에이전트형 영상 이해」(agentic video understanding) 신기능을 도입한다고 발표했다. Gemini API(Google AI Studio 및 Gemini Enterprise Agent Platform)를 통해 업로드한 영상과 YouTube 영상 모두에 사용할 수 있으며, 업로드 영상과 YouTube 링크 두 가지 소스를 지원한다.

기존의 「정적」 처리 방식(모델이 고정 프레임 레이트로, 기본값 초당 1프레임, API로 영상 샘플링 조정 가능)과 달리, 에이전트형 영상 이해는 모델이 능동적이고 목표 지향적으로 어느 구간을 볼지, 어떤 속도로 볼지, 어떤 모달리티(프레임, 오디오 또는 자막)를 활용할지 스스로 판단하게 하여, 실제로 필요한 구간과 신호만 추출한다. 이를 위해 내부 도구 호출을 통해 동적으로 검색·스캔·확인 작업을 수행한다. 이 개념은 이전에 소개된 「에이전트형 비전」(코드 실행과 네이티브 이미지 이해를 결합한 방식)과 유사하며, 이제 영상의 네이티브 도구 통합으로 확장된 것이다.

공식 발표에 따르면 표준 영상 분석 벤치마크 테스트에서 이 기능을 활성화하면 분석 비용은 최대 66% 절감, 토큰 소비는 최대 88% 감소, 정확도는 최대 7% 향상되었다. 특히 긴 영상(10분짜리 튜토리얼 영상부터 90분 강의, 몇 시간 분량의 녹화 영상까지)에서 효과가 두드러지는데, 정적 처리 방식은 개발자로 하여금 높은 토큰 비용과 핵심 디테일 희생 중 하나를 선택하도록 강요하는 경우가 많았기 때문이다. 세 모델 모두 성능이 향상되었으며, 그중 Gemini 3.7 Flash는 이 기능과 결합했을 때 정확도와 비용 효율의 균형에서 파레토 프론티어(pareto frontier)에 도달했다. 즉, 전반적인 품질이 가장 우수하면서도 가성비가 가장 뛰어난 지점에 위치한다.

활용 사례로는 1초 이하(sub-second) 단위의 순간 검색, 정밀한 이상 탐지, 정확한 카운팅 등이 있으며, 초당 1프레임 샘플링으로는 놓치기 쉬운 순간적인 상태 변화와 정밀한 편집 경계를 포착할 수 있다. 자세한 내용은 원문 링크를 참고하기 바란다.


💬 JudyAI Lab 코멘트

원문 요약을 바탕으로 작성함:

Gemini가 오늘 3.7 Flash, 3.6 Flash, 3.5 Flash-Lite 세 가지 모델에 「에이전트형 영상 이해」 기능을 도입했다. 이제 모델은 고정된 초당 1프레임 방식이 아니라, 어느 구간을 어떤 샘플링 속도와 모달리티로 볼지 능동적으로 판단한다. 이 변화는 AI 관찰자라면 주목할 만한 지점이다.

기존의 정적 샘플링 방식은 개발자가 토큰 비용과 디테일 완전성 사이에서 하나를 선택하도록 강요하는 경우가 많았고, 특히 긴 영상(10분짜리 튜토리얼부터 몇 시간 분량의 녹화까지)에서 불리했다. 공식 데이터에 따르면 이 기능을 활성화하면 분석 비용은 최대 66% 절감, 토큰 소비는 최대 88% 감소, 정확도는 최대 7% 향상되며, 그중 Gemini 3.7 Flash는 파레토 프론티어에 도달했다. 이는 더 큰 설계 사고의 전환을 보여준다. 모델이 고정된 형식의 입력을 수동적으로 받아들이기보다, 사람처럼 「여기는 자세히 볼 필요가 있고, 저기는 건너뛰어도 된다」를 능동적으로 판단하게 하여, 도구 호출 능력을 추론 레이어뿐 아니라 인식 레이어 자체로 확장한 것이다. 이러한 「목표 지향적 샘플링」 로직은 앞으로 다른 장문 입력 시나리오에도 확산될 가능성이 높다.

만약 당신의 제품이 긴 영상이나 몇 시간 분량의 녹화 영상을 처리하고 있다면, 이 기능이 기존 파이프라인의 토큰 비용을 바로 낮출 수 있는지 우선적으로 검토해볼 만하다.


📅 원문 정보


🔗 함께 보면 좋은 글