Google DeepMind가 개발한 고성능 멀티모달 모델. 텍스트, 이미지, 영상을 통합적으로 처리합니다.
파라미터
Undisclosed
컨텍스트
라이선스
Proprietary
출시일
2026-05-07
일본어 처리 능력
✅High-Quality JP
Multilingual model with strong Japanese language processing capabilities.
API 가격
이 모델의 API 가격 정보는 현재 공개되지 않았습니다
강점
약점
활용 사례
심층 분석
Release
2026년 3월 3일 (프리뷰)
Gemini 3 제품군 중 최저가·최고속 경량형; 정식 GA는 2026-05-07로 카탈로그 수록
Context Window
1,000,000 토큰
출력 상한 64K-65.5K 토큰; 텍스트/이미지/오디오/비디오/PDF 입력, 텍스트 출력
Pricing
백만 토큰당 $0.25 / $1.50
Gemini 3.1 Pro의 약 1/8 비용; 공개된 캐시 할인 없음
Speed
363 토큰/초
Gemini 2.5 Flash 대비 첫 토큰 지연 약 2.5배 빠름
GPQA Diamond
86.9%
GPT-5 mini 82.3%, Gemini 2.5 Flash 82.8% 대비 (no tools)
강점
- ・Gemini 3 제품군 중 토큰당 가격이 가장 낮다($0.25/$1.50, Pro의 약 1/8). 100만 토큰 컨텍스트와 네이티브 멀티모달 입력을 갖춘다.
- ・처리량 기준 강자: 363 토큰/초, 첫 토큰 지연은 Gemini 2.5 Flash보다 약 2.5배 빠르다. 대량·저지연 작업용으로 설계됐다.
- ・reasoning effort와 reasoning budget 조절로 분류·번역은 얕게, 어려운 작업은 깊게 사고시킬 수 있다.
- ・GPQA Diamond 86.9%, MMMU-Pro 76.8%로 훨씬 비싼 모델에 필적하는 수치다.
약점
- ・의도적으로 에이전트 모델이 아니다. Google은 데이터 처리 작업으로 한정하고 에이전틱 벤치마크 점수를 공개하지 않는다.
- ・사고 깊이는 3.1 Pro 대비 제한적이다. 가장 어려운 장문 검색(MRCR 1M pointwise)은 약 12%로 Pro에 한참 뒤진다.
- ・출력 속도와 성능은 최전선 추론 모델에 미치지 못한다. 워크호스로 쓰되 플래그십으로 보지는 말 것.
- ・오픈 가중치 없음. Google과 승인된 파트너만 서비스한다.
경쟁사 비교
| Model | Arena | GPQA | Price |
|---|---|---|---|
| Gemini 3.1 Flash-Lite (본 모델) | 1432 | 86.9% | $0.25/$1.50 |
| GPT-5 mini | - | 82.3% | $1.00/$5.00 |
| Claude 4.5 Haiku | - | 84.3% | $1.00/$5.00 |
| Gemini 2.5 Flash | - | 82.8% | $0.30/$2.50 |
Gemini 3.1 Flash-Lite는 Google DeepMind가 내놓은 Gemini 3 제품군 중 최저가·최고속 경량형으로, Gemini 3 Pro를 증류해 번역·분류·문서 파이프라인 같은 대량·저지연 작업용으로 만들었다. 백만 토큰 컨텍스트에 토큰당 $0.25/$1.50.
출처
분석 생성일: 2026-09-08