3.7 플래시와 동일 가격 … 장기 소프트웨어·에이전트 작업 성능 개선사이버 특화 모델도 공개 … 취약점 탐지 성공률 70% 넘어
-
- ▲ 제미나이 3.8 플래시, 제미나이 3.8 플래시 사이버. ⓒ구글
구글이 인공지능(AI) 모델 '제미나이 3.8 플래시(Gemini 3.8 Flash)'와 사이버 보안에 특화된 '제미나이 3.8 플래시 사이버(Gemini 3.8 Flash Cyber)'를 공개했다.3일 구글에 따르면 제미나이 3.8 플래시는 소프트웨어 엔지니어링과 에이전트 작업, 다단계 추론 성능을 전작인 제미나이 3.7 플래시보다 강화한 모델이다. 구글이 제미나이 3.7 플래시를 발표한 지 3주 만에 내놓은 후속 모델이다.가격은 제미나이 3.7 플래시와 동일하다. 출시 기념 가격 기준 100만 입력 토큰당 0.75달러, 100만 출력 토큰당 3.75달러에 이용할 수 있다.구글은 이번 모델을 장시간 코딩 작업과 자율 에이전트 환경에 맞춰 설계했다. 복잡한 작업을 수행할 때 추가적인 추론 단계를 거치고 도구를 반복적으로 호출하는 방식이다. 다만 높은 수준의 추론이 필요한 작업에서는 더 많은 토큰을 사용할 수 있다.구글에 따르면 복잡한 엔지니어링 문제를 처음부터 끝까지 자율적으로 해결하는 능력을 평가하는 장기 소프트웨어 엔지니어링 벤치마크 'DeepSWE v1.1'에서 제미나이 3.8 플래시는 더 큰 규모의 프론티어 모델 대부분을 낮은 비용으로 앞섰다.전문 분야 추론 성능도 개선됐다. 금융·법률 에이전트 벤치마크인 'Vals Finance Agent V2'와 'Harvey's Legal Agent Benchmark'에서 전작과 다른 프론티어 모델보다 높은 성능을 기록했다. 이공계(STEM)와 인문학, 전문 실무 분야의 다단계 추론을 평가하는 'HLE-Verified'에서는 54.9%를 기록했다.구글은 사이버 보안에 특화된 '제미나이 3.8 플래시 사이버'도 함께 공개했다. 취약점 탐지와 자동 패치에 초점을 맞춘 모델로, '페어윈드 프로그램(Fairwind Program)'을 통해 신뢰할 수 있는 보안 기관과 담당자 등에 우선 제공된다.제미나이 3.8 플래시 사이버는 취약점 탐지 벤치마크 '사이버짐(CyberGym)'에서 이전 모델인 제미나이 3.5 플래시 사이버와 더 큰 규모의 프론티어 모델보다 높은 성능을 기록했다.20개 프로그래밍 언어로 작성된 복잡한 코드베이스를 대상으로 진행한 구글 내부 평가에서는 취약점 탐지 성공률이 70%를 넘어섰다.취약점 패치 생성 능력을 평가하는 외부 벤치마크 'CWE-Bench'에서는 47.2%의 pass@1을 기록했다. 해당 벤치마크 최고 모델의 47.8%에 근접한 수준이다.구글은 실제 서비스 보안에도 해당 모델을 활용하고 있다. 크롬 보안팀의 취약점 패치 테스트에서는 기존 최고 수준의 대형 상용 모델보다 정확한 패치 코드를 2.6배 더 많이 생성했다. 구글 클라우드 취약점 연구팀은 해당 모델을 활용해 2시간 이내에 중대한 핵심 기반 취약점을 발견했다고 밝혔다.안전장치도 적용했다. 제미나이 3.8 플래시는 구글의 '프론티어 안전 프레임워크'에 따라 화학·생물학·방사능·핵(CBRN)과 사이버 공격 영역에서의 오용을 방지하기 위한 안전장치를 적용했다. 사이버 모델은 보다 포괄적인 사이버 역량을 필요로 하는 신뢰할 수 있는 보안 전문가 등을 대상으로 제한적으로 제공한다.제미나이 3.8 플래시는 구글 AI 스튜디오와 안드로이드 스튜디오 등을 통해 개발자가 이용할 수 있다. 기업 고객은 제미나이 엔터프라이즈에서 사용할 수 있으며, 구글 AI 프로·울트라 구독자는 제미나이 앱과 구글 검색의 AI 모드, 구글 스프레드시트 등에서 이용할 수 있다.





