개요
GPT-5.5는 2026년 4월 23일 출시된 OpenAI의 가장 강력한 범용 모델이자 GPT-4.5 이후 처음으로 완전히 재학습된 베이스 모델입니다. 네이티브 옴니모달 아키텍처 위에 NVIDIA GB200/GB300 NVL72 하드웨어와 공동 설계되어, 지능이 크게 높아졌음에도 GPT-5.4와 토큰당 지연을 맞춥니다. 모델은 Artificial Analysis 지능 지수(점수 60)에서 선두이며, Terminal-Bench 2.0(82.7%) 같은 에이전틱 코딩 벤치마크에서 최첨단, SWE-bench Verified에서 OpenAI 신기록(88.7%)을 세웠습니다. none부터 xhigh까지 구성 가능한 추론 노력 다이얼로 개발자가 지연과 비용을 거래해 깊이를 조절할 수 있습니다.
모델 포지셔닝은 에이전틱 작업(다단계 코딩, 컴퓨터 사용, 장시간 연구, 도구 호출 에이전트 루프)에 맞춰져 있습니다. OpenAI의 코딩 에이전트 Codex가 주 배포 표면이며 OpenAI 직원의 85% 이상이 매주 사용합니다. GPT-5.5는 장시간 컨텍스트 유지(1M 토큰에서 74.0%, GPT-5.4의 36.6%에서 상승)와 ARC-AGI-2 추상 추론(85.0%, 73.3%에서 상승)에서 진짜 도약을 보입니다. 아키텍처는 커뮤니티 추정 활성 100~200B의 MoE를 쓴다고 알려졌으나 OpenAI는 구체적으로 공개하지 않았습니다.
GPT-5.5는 프리미엄 가격(입출력 100만 토큰당 $5/$30, GPT-5.4의 2배)이지만, OpenAI는 약 40% 토큰 효율 향상이 인상을 일부 상쇄한다고 봅니다. Pro 변형($30/$180)은 가장 어려운 추론 작업을 위한 상위 계층입니다. 모델의 주 경쟁 약점은 광범위 지식 작업에서 Claude Opus 4.7 대비 높은 환각률, SWE-bench Pro(더 어렵고 덜 암기된 코딩 벤치마크)에서 Opus 패배, 무지성 이전 비용입니다. 에이전틱 시스템·도구 사용 에이전트·컴퓨터 사용 워크플로를 짜는 팀에게 GPT-5.5는 현재 OpenAI의 가장 강력한 기초 모델입니다.
벤치마크 및 성능
## 핵심 벤치마크 점수
| 벤치마크 | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 | Gemini 3.1 Pro |
|---|---|---|---|---|
| SWE-bench Verified | 88.7% | ~80% | ~87.6% | — |
| SWE-bench Pro | 58.6% | 57.7% | 64.3% | 54.2% |
| Terminal-Bench 2.0 | 82.7% | 75.1% | 69.4% | 68.5% |
| GPQA Diamond | 93.6% | 92.8% | 94.2% | 94.3% |
| ARC-AGI-2 | 85.0% | 73.3% | 75.8% | 77.1% |
| FrontierMath T1~3 | 51.7% | 47.6% | 43.8% | 36.9% |
| FrontierMath T4 | 35.4% | 27.1% | 22.9% | 16.7% |
| HLE (도구 없음) | 41.4% | 39.8% | 46.9% | 44.4% |
| HLE (도구 포함) | 52.2% | 52.1% | 54.7% | 51.4% |
| BrowseComp | 84.4% | 82.7% | 79.3% | 85.9% |
| OSWorld-Verified | 78.7% | 75.0% | 78.0% | — |
| GDPval | 84.9% | 83.0% | 80.3% | 67.3% |
| Tau2-bench Telecom | 98.0% | 92.8% | — | — |
| CyberGym | 81.8% | 79.0% | 73.1% | — |
| GeneBench | 25.0% | 19.0% | — | — |
| MMLU-Pro | 92.4% | — | — | — |
| AIME 2026 | 97.50% | — | — | — |
## 장시간 컨텍스트 성능 (MRCR v2)
| 컨텍스트 범위 | GPT-5.5 | GPT-5.4 | Claude Opus 4.7 |
|---|---|---|---|
| 8K~16K | 93.0% | 91.4% | — |
| 32K~64K | 90.0% | 90.5% | — |
| 128K~256K | 87.5% | 79.3% | 59.2% |
| 256K~512K | 81.5% | 57.5% | — |
| 512K~1M | 74.0% | 36.6% | 32.2% (Opus 4.6) |
## 핵심 요약
GPT-5.5는 에이전틱 코딩(Terminal-Bench 2.0), 추상 추론(ARC-AGI-2), 1M 토큰 장시간 컨텍스트 유지에서 선두입니다. SWE-bench Pro와 Humanity's Last Exam(도구 없음)에서는 Claude Opus 4.7에 뒤지고, GPQA Diamond에서는 Gemini 3.1 Pro와 비슷합니다. FrontierMath 성능은 프론티어 모델 중 가장 강한 수학 진전을 보여줍니다.
상세 비교
## GPT-5.5 vs Claude Opus 4.7
| 항목 | GPT-5.5 | Claude Opus 4.7 |
|---|---|---|
| API 가격 (입출력/1M) | $5 / $30 | $5 / $25 |
| Pro 가격 | $30 / $180 | 해당 없음 |
| 컨텍스트 윈도우 | 100만 토큰 | 50만 토큰 |
| Arena Elo | ~1474 | ~1492 |
| AAII 점수 | 60 (1위) | 58.1 (3위) |
| SWE-bench Pro | 58.6% | 64.3% |
| Terminal-Bench 2.0 | 82.7% | 69.4% |
| GPQA Diamond | 93.6% | 94.2% |
| AA-Omniscience 환각 | 86% | 36% |
| 도구 호출 성공 (첫 시도) | 97.4% | 94.2% |
GPT-5.5는 에이전틱 터미널 워크플로, 도구 신뢰성, 장시간 컨텍스트 유지, 도구 표면의 폭(호스트 셸, apply_patch, 컴퓨터 사용, MCP)에서 승리합니다. Claude Opus 4.7은 SWE-bench Pro, 대화 선호도, 사실 정확도, 다중 파일 리팩터, 환각률에서 앞섭니다. 프로덕션 코딩 에이전트에는 GPT-5.5가 더 나은 도구 호출 신뢰성을, 지식 집약적 검색에는 Opus 4.7의 낮은 환각률이 의미 있는 이점입니다.
## GPT-5.5 vs Gemini 3.1 Pro
| 항목 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|
| API 가격 (입출력/1M) | $5 / $30 | $2~3.50 / $12 |
| 컨텍스트 윈도우 | 100만 | 200만 |
| GPQA Diamond | 93.6% | 94.3% |
| Terminal-Bench 2.0 | 82.7% | 68.5% |
| FrontierMath T1~3 | 51.7% | 36.9% |
| 번역 (N5) | 84 | 92 |
| BrowseComp | 84.4% | 85.9% |
Gemini 3.1 Pro는 더 큰 컨텍스트(200만 대 100만), 더 강한 GPQA Diamond, 더 나은 번역 품질, 크게 낮은 가격을 제공합니다. GPT-5.5는 에이전틱 코딩, 추상 추론(ARC-AGI-2), 도구 호출 신뢰성, 성숙한 개발자 생태계(SDK 커버리지, Azure 통합, ChatGPT 유통)에서 우위입니다. Gemini의 이점은 Google Workspace 생태계에 묶인 팀이나 비용 민감성이 지배적인 대량 워크로드에 가장 큽니다.
## GPT-5.5 vs DeepSeek V4 Pro
| 항목 | GPT-5.5 | DeepSeek V4 Pro |
|---|---|---|
| API 가격 (입출력/1M) | $5 / $30 | ~$0.30 / $1.10 |
| AAII 점수 | 60 | ~54.7 |
DeepSeek V4 Pro는 약 10분의 1 API 비용으로 여러 벤치마크에서 비슷한 능력을 제공합니다. 가격 격차로 인해 비용 민감적 대량 추출·분류 작업의 기본 선택이 됩니다. GPT-5.5는 에이전틱 코딩, 도구 신뢰성, 기업 준수(SOC 2, HIPAA BAA, GDPR)에서 명확한 우위를 유지합니다. OpenAI 생태계 이점이 필요 없는 팀에게 DeepSeek은 프론티어 계층에서 가장 강한 비용 효율 옵션입니다.
커뮤니티 평가
개발자와 연구자의 GPT-5.5 평가는 강하지만 명확한 기준으로 양극화되어 있습니다.
**긍정적 반응**은 에이전틱 코딩 성능과 도구 신뢰성에 집중됩니다. Every의 CEO Dan Shipper는 GPT-5.5를 '진지한 개념 명료성을 가진 첫 코딩 모델'이라 불렀고, 이전에 GPT-5.4와 그의 최고 엔지니어가 고치지 못한 출시 후 디버깅 문제를 해결했습니다. MagicPath의 CEO Pietro Schirano는 GPT-5.5가 수백 개 프론트엔드·리팩터 변경을 크게 갈라진 메인 브랜치에 한 번에 병합하는 데 성공했다고 합니다. Cursor의 CEO Michael Truell은 GPT-5.5가 '조기 중단 없이 훨씬 더 오래 과제를 유지한다'고 보고했습니다. NVIDIA 기업 AI VP Justin Boitano은 1만 명 이상의 NVIDIA 직원이 GPT-5.5 기반 Codex를 쓴다고 했고, Jensen Huang은 이를 '빛의 속도로 도약' 순간이라 불렀습니다. 한 NVIDIA 엔지니어는 'GPT-5.5 접근을 잃는 건 사지가 절단된 느낌'이라고 했습니다.
**비판적 반응**은 세 영역에 집중됩니다. 가격(GPT-5.4 대비 2배 인상은 특히 대량 API 사용자에게 논란), 환각률(AA-Omniscience 86% 대 Claude 36%는 물질적 제약으로 널리 인용), 대화 품질(LMArena Elo가 Claude Opus 4.7에 뒤져 인간이 일반적으로 Claude 대화 출력을 선호함을 시사). 샘 올트먼이 브리핑에서 GPT-5.5를 '자폐성 천재'라 부한 것은 장애 옹호자들의 강한 반발을 불렀고, OpenAI 공식 답변 없이 X에서 광범위히 논의되었습니다.
**도입 패턴**은 GPT-5.5가 에이전틱 코딩 툴체인(Cursor, GitHub Copilot, Codex 모두 출시 즈음 또는 그때 통합)의 기본이 되어 감을 보여줍니다. 기업 도입은 Azure OpenAI를 통해 가속화되고 Microsoft 365 Copilot 통합이 뒤이어 이루어집니다. 다만 비용 민감적 대량 워크로드나 광범위 도메인 검색의 높은 사실 정확도를 요구하는 팀은 GPT-5.5(어려운 작업용)와 더 저렴하거나 신뢰할 수 있는 대안(일상 쿼리용) 사이에 트래픽을 분산합니다. '작업별 라우팅' 패턴(가장 어려운 20% 쿼리에 GPT-5.5, 나머지에 더 저렴한 모델)은 엔지니어링 팀 사이에 점점 일반화되고 있습니다.
활용 사례
### 1. 에이전틱 코딩 및 자율 개발 워크플로
GPT-5.5의 Terminal-Bench 2.0 점수 82.7%(Claude Opus 4.7의 69.4% 대비)는 복잡한 명령줄 코딩 워크플로에 가장 강한 모델입니다. 저장소 단위 리팩터, 자동화된 디버깅 루프, 다단계 CI/CD 파이프라인 작업, 세션 간 도구 호출을 연결하는 모든 코딩 에이전트에 사용하세요. 첫 시도 도구 호출 성공률 97.4%(Opus의 94.2% 대비)는 프로덕션 에이전트 시스템의 재시도 루프를 줄입니다. 에이전트가 터미널/셸 환경에서 작동하거나 단일 자율 실행에서 여러 도구(파일 편집, 테스트, 배포)를 조율할 때 Claude 대신 GPT-5.5를 선택하세요. 단, 다중 파일 리팩터에서는 Claude Opus 4.7이 여전히 파일 간 일관성에서 앞섭니다.
### 2. 100만 토큰 이하 장문서 분석 및 지식 작업
GPT-5.5의 MRCR v2 512K~1M 토큰에서 74.0%(GPT-5.4의 36.6% 대비)는 전체 코드베이스, 법률 코퍼스, 대형 문서 세트를 한 번에 처리하는 워크플로에 독보적으로 적합합니다. GDPval의 44개 전문 직업군 84.9%와 결합해 투자 은행 모델링(내부 평가 88.5%), 금융 문서 검토(OpenAI 금융 팀이 Codex의 GPT-5.5로 K-1 세금 서식 24,771건 처리), 운영 연구 종합, 다중 소스 경쟁 분석에 탁월합니다. 도구 신뢰성과 구조화 출력 품질이 raw 컨텍스트 크기(Gemini는 200만)보다 중요한 때 Gemini 3.1 Pro 대신 선택하세요.
### 3. 과학 연구 및 도메인 특화 데이터 분석
GPT-5.5는 생정보학·유전학 워크플로에서 GeneBench(25.0%, 19.0%에서 상승), BixBench(80.5%, 74.0%에서 상승)에서 의미 있는 향상을 보입니다. 조합론에서 Ramsey 수에 관한 새로운 증명을 Lean으로 검증했습니다. 연구자는 GPT-5.5 Pro를 써서 다중 패스 원고 비평, 기술 논증 스트레스 테스트, 맞춤 수학 시각화 도구(11분 만에 단일 프롬프트로 대수기하 앱) 구축, 대형 유전자 발현 데이터세트 분석을 보고했습니다. 작업이 전체 연구 루프(탐색·증거 수집·가설 검증·반복)를 관통할 것을 요구할 때 일회성 질의응답 대신 GPT-5.5를 선택하세요.
### 4. 기업 에이전트 오케스트레이션 및 도구 사용 파이프라인
여러 소프트웨어 도구(브라우징, 코드 실행, 문서 생성, 데이터 분석)를 넘나드는 프로덕션 에이전트 시스템을 짜는 팀에게 GPT-5.5의 도구 표면(MCP, 호스트 셸, apply_patch, 컴퓨터 사용, 웹 검색, 파일 검색)은 시장에서 가장 성숙합니다. Tau2-bench Telecom의 98.0%는 신뢰할 수 있는 다중 턴 고객 서비스 워크플로를 보여줍니다. BrowseComp의 84.4%는 강한 다단계 웹 연구를 확인합니다. 모델의 구조화 출력 준수(98.1% 스키마 유효 JSON)와 낮은 도구 호출 오류율은 실패한 도구 호출이 전체 체인을 깨는 에이전트 루프에 가장 안전한 선택입니다. 도구 호출 신뢰성과 스키마 준수가 프로덕션 배포의 게이팅 요건일 때 대안 대신 선택하세요.
최신 뉴스
## 주요 개발 타임라인
- **2026년 4월 23일**: GPT-5.5와 GPT-5.5 Pro를 API에 출시. 100만 컨텍스트 윈도우, $5/$30 표준 가격, 역대 OpenAI 최강 안전 장치와 함께 출시. ChatGPT의 Plus·Pro·Business·Enterprise 사용자 이용 가능.
- **2026년 4월 24일**: API 배포 가동. 시스템 카드에 추가 안전 장치 반영. Responses·Chat Completions API에서 GPT-5.5와 Pro 이용 가능.
- **2026년 5월 5일**: GPT-5.5 Instant가 기본 ChatGPT 모델이 되어 GPT-5.3 Instant 교체. Gmail 통합, 메모리 출처 투명 패널, 대화 기록 검색 추가.
- **2026년 7월 9일**: 후속 모델 GPT-5.6 출시로 GPT-5.5는 BenchLM에서 폐기됨 분류. GPT-5.6이 Microsoft 365 Copilot의 선호 모델이 됨.
## 가격 변경
표준 API 가격($5/$30)은 GPT-5.4($2.50/$15) 대비 2배 인상. 주요 비용 계층:
- 캐시 입력: $0.50/1M(90% 할인)
- Batch/Flex: $2.50/$15(50% 할인)
- Priority: $12.50/$75(2.5배)
- 초과(입력 272K 초과): 세션 전체 입력 2배, 출력 1.5배
- Pro 계층: $30/$180(표준의 6배)
## 주요 파트너십
- NVIDIA GB200/GB300 NVL72 공동 설계: GPT-5.5는 NVIDIA 최신 랙 규모 시스템에서 학습·서빙되어 더 높은 능력에도 GPT-5.4 지연 동등을 달성. NVIDIA는 1만 명 이상의 직원이 GPT-5.5 기반 Codex 사용을 보고.
- Microsoft Azure: Azure OpenAI 서비스를 통한 전체 가용성과 기업 준수(SOC 2, HIPAA, GDPR).
- Trusted Access for Cyber: 검증된 사이버 방어자에게 제한 완화된 GPT-5.5 고급 능력 접근을 제공하는 신규 프로그램.
## 안전 개발
OpenAI는 사이버 위험에 더 엄격한 분류기를 배포하고, 도메인별 계층형 안전 수준(생물·화학 및 사이버 보안 능력을 Preparedness Framework에서 '높음' 분류)을 도입했으며, 출시 전 테스트를 위해 거의 200개 신뢰 early-access 파트너를 참여시켰습니다. chatgpt.com/cyber의 Trusted Access 프로그램은 검증된 보안 전문가가 사이버 허용형 모델 변형에 접근할 수 있게 합니다.