OpenAI 개발의 최고 품질 기초 모델. 최상의 출력 품질과 추론 능력을 제공하며, GPT-5.6 Sol의 전신 모델입니다.
파라미터
Undisclosed
컨텍스트
1000K
라이선스
Proprietary
출시일
2026-04-23
일본어 처리 능력
Multilingual model with strong Japanese language processing capabilities.
API 가격
입력 가격 (1M 토큰당)
$30
출력 가격 (1M 토큰당)
$
과금 모드: standard
강점
약점
활용 사례
심층 분석
Arena Elo
N/A
BenchLM 공개 리더보드 제외 — 안전하게 순위 매기기에 충분한 비생성 벤치마크 커버리지 부족
BrowseComp
90.1%
심층 웹 리서치 최고 수준; 기본 GPT-5.5(84.4%) 대비 +5.7점
GPQA Diamond
~94%
대학원 수준 과학 추론 (pricepertoken.com 경유, TopReviewed 인용)
SWE-Bench Verified
82.6–89%
출처 충돌: LLMReference는 82.6(동점), TopReviewed는 ~89% 인용
입력 가격
$30/1M
기본 GPT-5.5($5/1M)의 6배; 출력 $180/1M — 캐시 입력 할인 없음
컨텍스트 윈도
1.05M 토큰
기본 GPT-5.5와 동일; 128K 최대 출력; 272K 초과 시 장문 surcharge
강점
- ・어려운 추론·수학·리서치에서 OpenAI 라인업 중 최고 품질 — BrowseComp 90.1%, FrontierMath T4 39.6%
- ・레거시 o3-deep-research 및 o4-mini-deep-research 모델을 위한 깔끔한 대체 엔드포인트
- ・더 깊은 숙고로 의료·법률·금융 등 고위험 과제에서 자신 있게 틀린 답을 줄이는 비율 감소
약점
- ・출력 비용 프리미엄 6배($180/1M)에 캐시 입력 할인이 없고 별도 공개 벤치마크가 빈약(코딩·컴퓨터 사용·장문 행은 OpenAI가 공란)
- ・스트리밍 미지원 — 긴 요청은 background-mode 폴링 필요, 인터랙티브·지연 민감 애플리케이션 부적합
- ・기본 GPT-5.5 대비 축소된 도구 표면 — apply_patch·computer use·skills·tool search 없어 에이전틱 코딩 워크플로 제한
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| Claude Opus 4.7 (Anthropic) | N/A | SWE-Bench Verified 87.6%, Pro 64.3% | 94.2% | $5/$25 |
| Claude Fable 5 (Anthropic, suspended) | N/A | SWE-Bench Pro 80.3% | 별도 공개 없음 | $10/$50 |
| GPT-5.5 base (OpenAI) | N/A | SWE-Bench Verified 82.6%, Pro 58.6% | 93.6% | $5/$30 |
GPT-5.5 Pro는 2026년 4월 23일 기본 GPT-5.5와 함께 출시된 OpenAI의 프리미엄 추론 티어다. 별도 모델이나 다른 아키텍처가 아니라, 동일한 GPT-5.5 가중치에 추론 effort를 상위 티어(medium/high/xhigh)에 고정하고 답하기 전 여러 추론 경로를 탐색하는 병렬 test-time compute를 배치한 것이다. 이로써 OpenAI가 판매하는 최고 품질의 답을 제공하며, 출력 비용 프리미엄 6배($30 입력 / $180 출력 per 1M 토큰, 기본은 $5/$30)를 동반한다. Pro 티어는 레거시 o3-deep-research 및 o4-mini-deep-research 모델을 공식 대체해 딥리서치 팀에 단일 깔끔 엔드포인트를 제공한다.
모델의 공개 벤치마크는 강하지만 좁다. BrowseComp(90.1%), FrontierMath Tier 4(39.6%), GPQA Diamond(~94%)에서 Pro는 기본 대비 유의미한 상승을 보인다. 그러나 OpenAI는 코딩(SWE-Bench Pro), 컴퓨터 사용(OSWorld-Verified), 사이버보안, 장문 컨텍스트 행을 공개 평가표에서 완전히 공란으로 남겼다. 가장 중요한 주의점은 이 6배 가격 프리미엄이 브라우징과 수학 향상에 크게 의존하며, 가장 수요가 많은 에이전틱·코딩 벤치마크에는 Pro 전용 수치가 하나도 없다는 것이다. 다수의 독립 애널리스트(techsy.io, TopReviewed, BenchLM)가 이 격차를 명시적으로 지적한다. BenchLM은 비생성 벤치마크 커버리지 부족으로 GPT-5.5 Pro를 공개 리더보드에서 완전히 제외했다.
포지셔닝 측면에서 GPT-5.5 Pro는 좁은 틈새를 차지한다. 대부분의 프로덕션 트래픽이 GPT-5.4 mini나 기본 GPT-5.5에 머무는 모델 라우터의 에스컬레이션 티어다. 프런티어 수학·과학 리서치, 심층 다단계 웹 리서치, 규제 도메인 분석 합성, 그리고 신중히 추론한 하나의 답이 여러 저렴한 호출과 애널리스트 검토를 대체하는 워크플로에 입지를 갖는다. 일상적인 작업 — 초안, 코드 리뷰, 요약, 일반 채팅 — 에는 DataCamp·FluxHire·TopReviewed의 합의대로 90% 이상의 사용 사례에서 6배 프리미엄이 정당화되지 않는다.
출처
- GPT-5.5 Pro vs Fable 5: Benchmarks & What's Unpublished — Techsy.io
- GPT-5.5-Pro — Benchmarks, Specs & Release Date — AIReleaseTracker
- GPT-5.5 Pro Benchmarks 2026 — BenchLM.ai
- GPT-5.5 Pro Review — TopReviewed.ai
- Claude Opus 4.7 vs GPT-5.5 vs GPT-5.5 Pro — FluxHire.AI
- GPT-5.5 vs GPT-5.5 Pro: Benchmarks & Pricing — LLMReference
- GPT-5.5 Pro · Models · VerdictPal
- gpt-5.5-pro-2026-04-23 — model deep-dive · Tokonomix
- OpenAI GPT-5 and GPT-5.5 — ChatForest Review
- GPT-5.5 vs GPT-5.5 Pro — OpenTools.ai
분석 생성일: 2026-08-05