Google DeepMind의 파운데이션 모델입니다.
파라미터
Undisclosed
컨텍스트
1M
라이선스
Proprietary
출시일
2026-07-21
API 가격
입력 가격 (1M 토큰당)
$0.3
출력 가격 (1M 토큰당)
$2.5
과금 모드: standard
강점
약점
활용 사례
심층 분석
컨텍스트 윈도우
1,048,576 토큰
1M 멀티모달 (텍스트·이미지·오디오·영상·PDF)
Artificial Analysis 지능 지수
36
152개 모델 중 #12, 동급 최상위
입력 가격
$0.30 / 1M 토큰
출력 $2.50 / 1M; 배치 50% 할인
처리량
~490 tok/s
Artificial Analysis 측정 2번째로 빠름
SWE-Bench Pro
54.2%
Gemini 3.1 Flash-Lite 38% 대비
Terminal-Bench 2.1
54.0%
Gemini 3.1 Flash-Lite 31% 대비
OSWorld-Verified
74.0%
컴퓨터 사용; 전 세대 약 2배
강점
- ・입력 $0.30/출력 $2.50으로 가장 저렴한 유료 Gemini 3 티어, GPT-5.4 mini·Claude Haiku 4.5 대비 입력 가격 우위
- ・1M 토큰 멀티모달 컨텍스트에 thinking·함수 호출·구조화 출력·코드 실행·검색 근거 지원
- ・~490 tok/s의 상위권 속도로 고처리량·저지연 프로덕션 트래픽에 적합
약점
- ・지속적 다단계 추론(Terminal-Bench 2.1, GDPval-AA v2)에서 GPT-5.4 mini에 밀림
- ・컴퓨터 사용·이미지·오디오 생성·Live API 미지원 — 볼륨용 텍스트 입출력 엔진
- ・첫 토큰 지연 약 6초(thinking 포함)로 즉응형 채팅보다 백그라운드 작업에 적합
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| Gemini 3.5 Flash-Lite | N/A | 54.2% | N/A | $0.30 / $2.50 per 1M |
| GPT-5.4 mini | N/A | N/A | N/A | $0.75 / $4.50 per 1M |
| Claude Haiku 4.5 | N/A | N/A | N/A | $1.00 / $5.00 per 1M |
| Gemini 3.1 Flash-Lite | N/A | 38% | N/A | 이전 예산 티어 |
Gemini 3.5 Flash-Lite는 Google DeepMind의 가장 저렴한 Gemini 3 모델로, 2026년 7월 21일 Gemini 3.6 Flash와 함께 번역·분류·태깅 등 고처리량·저지연 워크로드용으로 공개되었다. 1,048,576 토큰 멀티모달 컨텍스트(텍스트·이미지·오디오·영상·PDF)를 입력 100만 토큰당 $0.30, 출력 $2.50에 제공하며, 비실시간 작업 배치 모드에서는 50% 정액 할인이 적용된다.
Google은 Flash-Lite를 Gemini 3.6 Flash 아래 계층으로 위치시킨다. 3.6 Flash는 복잡한 에이전트 작업, 3.5 Flash-Lite는 대부분의 프로덕션 트래픽(에이전트 검색·문서 처리·번역·분류)을 이루는 고처리량·저지연 작업용이다. Artificial Analysis에서 지능 지수 36(152개 중 #12, 동급 평균 크게 상회)을 기록하면서 약 490 tok/s로 서비스가 측정한 두 번째로 빠른 모델이다. 2026년 3월 프리뷰 전 세대 Gemini 3.1 Flash-Lite 대비 세대 도약이 핵심으로, SWE-Bench Pro은 16점 격차를 거의 메우고(54.2% vs 38%), OSWorld-Verified는 20점 가까이 오른 74.0%, Terminal-Bench 2.1은 54.0%로 두 배가 된다.
출처
분석 생성일: 2026-09-02