Alibaba 통의의 Qwen3-VL 시리즈 8B 비전 언어 모델. 텍스트, 이미지, 비디오를 입력으로 처리하며 256K 컨텍스트(1M까지 확장 가능) 지원. 32개 언어 OCR, GUI 에이전트 기능, 공간 인식 능력 탑재. Apache 2.0 라이선스. 2025년 10월 15일 출시.
파라미터
8B
컨텍스트
256K
라이선스
Apache 2.0
출시일
2025-10-15
API 가격
입력 가격 (1M 토큰당)
$0.18
출력 가격 (1M 토큰당)
$0.7
과금 모드: per-token
강점
약점
활용 사례
심층 분석
Release
2025년 10월 15일
Qwen3-VL 시리즈 비전-언어 모델
Parameters
8B
컴팩트 인스트럭션 튜닝 VLM
Context Window
256K 토큰
장문 비전-언어 처리
Modalities
텍스트+이미지(+비디오) 입력, 텍스트 출력
Qwen3-VL 라인
Type
채팅 / 비전-언어
강점
- ・8B급 컴팩트 VLM에 256K 컨텍스트. 싱글 컨슈머 GPU로 긴 문서와 다수 이미지를 처리한다.
- ・OCR, 차트/표 이해, 근거 기반 이미지 Q&A 같은 실용 비전 작업에 인스트럭션 튜닝됐다.
- ・Qwen 오픈 생태계 이점: 공개 가중치와 저장소로 파인튜닝·자체 호스팅이 쉽다.
- ・텍스트·이미지·비디오 입력(Qwen3-VL 라인)으로 문서와 UI 이해에 맞다.
약점
- ・8B 규모라 최상위 VLM보다 추론이 약하다. 복잡한 다단계 비주얼 추론에 격차가 있다.
- ・카탈로그에 공개된 토큰당 API 가격이 없다. 배포처에 따라 비용이 달라진다.
- ・출력은 텍스트만. 이미지·비디오 생성은 안 된다.
- ・정확한 벤치마크 세트 공개가 부족하다. 실제 비전 과제로 검증할 것.
경쟁사 비교
| Model | Arena | GPQA | Price |
|---|---|---|---|
| Qwen3-VL-8B-Instruct (본 모델) | - | - | self-host / 비율별 |
| Qwen3-VL-Plus | - | - | API |
| GLM-4.5V | - | - | open |
Qwen3-VL-8B-Instruct는 Alibaba의 Qwen3-VL 시리즈 컴팩트 인스트럭션 튜닝 비전-언어 모델로, 8B 파라미터에 256K 토큰 컨텍스트를 더해 싱글 GPU에 들어가는 문서·차트·이미지 이해용으로 쓴다.
분석 생성일: 2026-09-08