Google, 장기 코딩 및 에이전트를 위한 Gemini 3.8 Flash 출시
Gemini 3.8 Flash는 강화된 코딩 및 에이전틱 추론, 100만 토큰 컨텍스트 윈도우, 조정 가능한 노력 수준, 도입 API 가격을 제공한다.
목차 · 13
- 1. Google, 6주 만에 세 번째 Flash 업데이트 출시
- 2. 더 긴 추론 루프가 핵심 제품 변화
- 3. Google, 코딩 및 에이전트 평가에서 가장 큰 향상 보고
- 4. 마이그레이션에는 모델 이름 변경 이상의 작업 필요
- 5. 가격은 초기에는 동일하지만 1월에 두 배로 상승
- 6. 모델 카드는 중요한 한계를 유지
- 자주 묻는 질문
- Gemini 3.8 Flash는 언제 출시됐나요?
- Gemini 3.8 Flash의 API 모델 ID는 무엇인가요?
- Gemini 3.8 Flash는 이미지, 오디오, 동영상을 지원하나요?
- Gemini 3.8 Flash의 가격은 얼마인가요?
- Gemini 3.8 Flash Cyber는 일반적으로 제공되나요?
- 참고 자료
1. Google, 6주 만에 세 번째 Flash 업데이트 출시
Google은 9월 2일 Gemini 3.8 Flash를 출시하며, 이 모델을 소프트웨어 엔지니어링, 자율 에이전트, 다단계 전문 업무를 위한 가장 강력한 Flash 등급 시스템으로 내세웠다. 안정 API 식별자는 gemini-3.8-flash이며, 이 모델은 프리뷰가 아닌 정식 출시로 제공됐다.
이번 출시는 8월 13일에 소개된 Gemini 3.7 Flash와 7월 21일에 출시된 Gemini 3.6 Flash에 이은 것이다. 이로써 Gemini 3.8 Flash는 6주 만에 나온 Google의 세 번째 Flash 릴리스가 됐다. Google은 새 모델이 3.7 Flash의 속도와 도입 가격을 유지하면서도, 더 긴 작업에서 추론과 도구 사용을 지속하는 능력을 개선했다고 밝혔다.
Gemini 3.8 Flash는 텍스트, 이미지, 오디오, 동영상, PDF 문서를 입력으로 받는다. 컨텍스트 윈도우는 입력 토큰 1,048,576개이며, 최대 출력은 65,536토큰이다. 출력은 여전히 텍스트 전용이다. 즉, 모델은 멀티모달 자료를 분석할 수 있지만 이미지나 오디오는 생성하지 않는다.
이 모델은 함수 호출, 파일 검색, 코드 실행, 구조화된 출력, URL 컨텍스트, Google Search 및 Maps 그라운딩, 컨텍스트 캐싱을 지원한다. 컴퓨터 사용은 프리뷰로 지원된다. Live API, 이미지 생성, 오디오 생성은 지원되지 않는다.
Google은 범용 릴리스와 함께 두 번째 모델인 Gemini 3.8 Flash Cyber도 발표했다. 회사에 따르면 두 모델은 동일한 기반 지능을 공유하지만, Cyber 버전은 더 관대한 사이버보안 기능을 제공하며 Google DeepMind의 Fairwind Program을 통해 검증된 정부, 핵심 인프라 운영자, 소프트웨어 유지관리자 및 기타 신뢰할 수 있는 방어자에게만 제한된다.
2. 더 긴 추론 루프가 핵심 제품 변화
Gemini 3.7 Flash와 비교했을 때 결정적인 변화는 더 큰 컨텍스트 윈도우나 새로운 출력 모달리티가 아니다. 이러한 핵심 한계는 변하지 않았다. 대신 Google은 3.8 Flash가 작업을 한 번에 안정적으로 완료할 수 없을 때 추가 추론 단계를 수행하고, 장애물에서 회복하며, 도구를 반복적으로 호출하는 데 더 적극적이라고 밝혔다.
이 동작은 대규모 코드베이스 탐색, 장애 진단, 여러 파일 편집, 결과 테스트, 구현 수정과 같은 작업을 위한 것이다. Google은 Antigravity에서 모델이 3D 게임을 만들고, 오류를 식별하기 위해 이를 플레이한 뒤, 이어지는 에이전트 루프 안에서 코드 변경을 적용하는 모습을 시연했다. 그 밖의 시연에는 DOS 스타일의 Google Maps 애플리케이션, 데이터 기반 지형 시각화 도구, Three.js 하드웨어 분해 도구가 포함됐다.
이러한 시연은 독립적인 제품 테스트가 아니라 통제된 사례다. 그 관련성은 워크플로에 있다. Gemini 3.8 Flash는 단순히 코드 샘플을 반환하는 대신, 추론, 도구 호출, 실행, 관찰, 수정을 번갈아 수행하도록 설계됐다.
추가된 신중함에는 측정 가능한 비용이 따른다. Google은 특히 높은 추론 설정에서 3.8 Flash가 3.7 Flash보다 더 많은 토큰을 소비할 수 있다고 명시적으로 경고한다. 개발자는 thinking_level 파라미터를 통해 LOW, MEDIUM, 또는 HIGH를 선택할 수 있으며, 기본값은 MEDIUM이다. 이 모델은 MINIMAL 수준을 허용하지 않으며, 이를 요청하면 검증 오류가 발생한다.
지연 시간에 민감하거나 대량 처리하는 애플리케이션의 경우 Google은 노력 수준을 낮추거나 Gemini 3.7 Flash를 계속 사용할 것을 권장한다. 따라서 실질적인 선택은 워크로드에 달려 있다. 3.8 Flash는 어려운 작업에 더 높은 지속성을 제공하지만, 예측 가능한 토큰 소비가 최대 작업 완료율보다 중요한 배포에서는 3.7 Flash가 계속 지원된다.
3. Google, 코딩 및 에이전트 평가에서 가장 큰 향상 보고
Google이 공개한 평가는 여러 코딩 및 도구 중심 테스트에서 개선을 보여주지만, 결과는 여전히 벤더 보고치이며 벤치마크 성능이 특정 프로덕션 환경에서의 신뢰성을 입증하지는 않는다.
Terminal-bench 2.1에서 Gemini 3.8 Flash는 90.8%를 기록했으며, Gemini 3.7 Flash의 81.6%와 비교된다. SWE-Atlas 점수는 48.0%에서 51.9%로 상승했고, SWE-Bench Pro는 60.4%에서 61.6%로 올랐다. 다단계 상호작용을 처리하는 에이전트를 테스트하는 τ³-bench의 뱅킹 하위 집합에서 보고된 점수는 30.9%에서 38.1%로 상승했다.
이 모델은 또한 Vals Finance Agent v2에서 61.4%에 도달했으며, Google의 비교에서 Gemini 3.7 Flash의 59.0%를 앞섰다. Harvey의 Legal Agent Benchmark에서는 각각 10.0%와 8.8%를 기록했다.
전문가 수준의 다학제 추론 벤치마크인 HLE-Verified에서 Google은 Gemini 3.8 Flash가 54.9%, 3.7 Flash가 53.6%를 기록했다고 보고했다. 공개된 비교에서 3.8 Flash는 GPT-5.6 Sol의 54.5%와 Claude Opus 5의 54.4%를 근소하게 앞섰다. 이 정도 규모의 작은 차이를 한 모델이 관련 없는 워크로드 전반에서 다른 모델보다 일관되게 우수하다는 증거로 받아들여서는 안 된다.
Google은 Gemini 3.8 Flash가 더 큰 모델보다 낮은 비용으로 DeepSWE v1.1 장기 소프트웨어 엔지니어링 평가를 선도한다고도 밝혔다. Ars Technica의 이번 출시 리뷰는 많은 일반 테스트에서 개선 폭이 크지 않았으나 코딩 평가에서는 더 컸다고 평가했다. 또한 새 모델이 OSWorld 2.0에서 3.7 Flash보다 개선됐음에도, 해당 컴퓨터 사용 벤치마크에서는 여전히 Claude Opus에 크게 뒤처졌다고 지적했다.
이러한 혼합된 양상은 배포 결정에 중요하다. 업그레이드를 뒷받침하는 가장 강력한 공개 근거는 터미널 작업, 코딩 에이전트, 장시간 작업 실행에 관한 것이며, 모든 추론 또는 컴퓨터 제어 테스트에서의 일률적인 도약은 아니다.
4. 마이그레이션에는 모델 이름 변경 이상의 작업 필요
Gemini 3.7 Flash 또는 3.6 Flash에서 이전하는 개발자는 모델 식별자를 gemini-3.8-flash로 변경해야 한다. Google의 엔터프라이즈 마이그레이션 가이드는 또한 이전의 정수 기반 thinking_budget 구성을 thinking_level 열거형으로 대체하도록 안내한다.
여러 레거시 생성 제어 기능은 사용할 수 없다. Google은 temperature, top_p, top_k가 백엔드에서 무시되는 반면, frequency_penalty, presence_penalty, candidate_count는 API 오류를 발생시킨다고 밝혔다. 이러한 필드에 의존하는 애플리케이션은 단순한 모델명 교체가 아니라 구성 변경이 필요하다.
함수 호출은 더 엄격하게 검증된다. 함수 응답 턴은 직전 함수 호출의 식별자, 이름, 실행 횟수와 일치해야 한다. 멀티모달 자산은 응답 페이로드 안에 배치해야 하며, 채팅 기록은 모델 역할 턴으로 끝날 수 없고, 미리 채운 모델 응답은 지원되지 않는다.
이러한 제약은 이전 배포에서 허용됐던 통합 오류를 드러낼 수 있다. 업그레이드를 평가하는 팀은 고립된 프롬프트를 비교하기보다 재시도, 도구 응답, 구조화된 출력, 대화 기록 재구성을 포함한 완전한 에이전트 트레이스를 테스트해야 한다.
모델의 문서화된 지식 컷오프는 2026년 3월이지만, Google은 일부 도메인의 범위가 더 광범위한 Gemini 3 계열과 연관된 2025년 1월 컷오프와 여전히 유사할 수 있다고 경고한다. 최신 정보 또는 빠르게 변하는 정보에는 Search 그라운딩이나 다른 검색 증강 계층이 계속 필요하다.
5. 가격은 초기에는 동일하지만 1월에 두 배로 상승
2026년 12월 31일까지 표준 Gemini API 사용료는 추론 토큰을 포함해 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75이다. 이는 Gemini 3.7 Flash에 명시된 도입 요금과 동일하다.
요금은 2027년 1월 1일에 입력 토큰 100만 개당 $1.50, 출력 토큰 100만 개당 $7.50로 두 배가 된다. 컨텍스트 캐싱 요금도 토큰 100만 개당 $0.075에서 $0.15로 상승하며, 캐시 저장 비용은 토큰 100만 개당 시간당 $0.50에서 $1로 증가한다.
배치 및 Flex 추론은 도입 기간에 입력 토큰 100만 개당 $0.375, 출력 토큰 100만 개당 $1.875이다. 두 요금은 1월에 각각 $0.75와 $3.75로 오른다. Priority 추론은 더 높은 가격이 적용되며, 12월까지 입력 토큰 100만 개당 $1.35, 출력 토큰 100만 개당 $6.75이다.
출력 가격에는 내부 추론 토큰이 포함되므로, 노력 수준 선택은 비용 모델의 일부가 된다. 더 많은 추론 단계를 호출하는 작업은 최종적으로 보이는 응답이 짧더라도 더 많은 비용이 들 수 있다. 따라서 프로덕션 평가는 단순히 정가만 비교하지 말고 총 청구 토큰, 완료율, 지연 시간, 도구 호출 횟수를 기록해야 한다.
개발자는 Google AI Studio, Gemini API, Android Studio, Stitch, Antigravity를 통해 Gemini 3.8 Flash에 액세스할 수 있다. 엔터프라이즈는 Gemini Enterprise Agent Platform을 통해 사용할 수 있다. 소비자는 Gemini 앱, Google Search의 AI Mode, Google Sheets의 Gemini에서 사용하려면 Google AI Pro 또는 Ultra 구독이 필요하다.
6. 모델 카드는 중요한 한계를 유지
Google의 모델 카드는 Gemini 3.8 Flash가 환각을 일으킬 수 있으며, 때때로 응답이 느리거나 타임아웃되거나 높은 노력 수준에서 예상보다 더 많은 토큰을 소비할 수 있다고 명시한다. 멀티모달 입력 지원과 에이전트 도구는 생성된 코드, 금융 분석, 법률 업무 또는 외부 시스템을 통해 수행된 작업을 검증할 필요성을 없애지 않는다.
회사는 Gemini 3.7 Flash와 비교해 유사하거나 개선된 일반 콘텐츠 안전 성능을 보고했지만, 자동화된 테스트에서는 일부 비영어권 안전성 평가에서 소폭의 성능 저하가 발견됐다. Google은 수동 검토를 통해 표시된 손실이 대부분 거짓 양성 또는 심각하지 않은 사례라고 판단했다고 밝혔다.
Google DeepMind의 Frontier Safety Framework에 따라, 회사는 Gemini 3.8 Flash가 프레임워크가 추적하는 고위험 도메인에서 3.7 Flash 대비 중요한 역량을 추가하지 않으며 Tracked 또는 Critical Capability Level을 넘을 가능성이 낮다고 결론지었다. 제한 없는 모델은 사이버 공격 및 화학적, 생물학적, 방사능적, 핵 관련 오용을 다루는 안전장치를 유지하며, 더 강력한 Cyber 변형은 제한된 액세스 하에 별도로 배포된다.
자주 묻는 질문
Gemini 3.8 Flash는 언제 출시됐나요?
Google은 Gemini 3.7 Flash 출시 3주 후인 2026년 9월 2일에 안정 모델을 출시했다.
Gemini 3.8 Flash의 API 모델 ID는 무엇인가요?
안정 API 식별자는 gemini-3.8-flash이다.
Gemini 3.8 Flash는 이미지, 오디오, 동영상을 지원하나요?
텍스트, 이미지, 오디오, 동영상, PDF를 입력으로 받지만 텍스트만 출력한다.
Gemini 3.8 Flash의 가격은 얼마인가요?
표준 API 가격은 2026년 12월 31일까지 입력 토큰 100만 개당 $0.75, 출력 토큰 100만 개당 $3.75이다. 요금은 2027년 1월 1일에 각각 $1.50와 $7.50로 상승한다.
Gemini 3.8 Flash Cyber는 일반적으로 제공되나요?
아니다. Google은 Fairwind Program을 통해 승인된 방어자에게만 Cyber 변형을 제한한다. 범용 Gemini 3.8 Flash 모델은 정식 제공된다.
참고 자료
Share