OpenAI독점

GPT-5.5

이 모델 비교

OpenAI가 개발한 고성능 기반 모델. 높은 추론 능력과 광범위한 작업 대응을 구현합니다. GPT-5.6 Terra의 선행 모델입니다.

파라미터

Undisclosed

컨텍스트

라이선스

Proprietary

출시일

2026-04-23

벤치마크 성능

AA Intelligence Index

LMArena Elo

HLE

ARC-AGI-2

SWE-bench Verified

GPQA Diamond

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

일본어 처리 능력

High-Quality JP

Multilingual model with strong Japanese language processing capabilities.

API 가격

입력 가격 (1M 토큰당)

$2.5

출력 가격 (1M 토큰당)

$

과금 모드: standard

강점

    약점

      활용 사례

        심층 분석

        Arena Elo

        1474

        BenchLM 기준 3위 검증, 코딩 하위 아레나 1507

        SWE-bench Verified

        88.7%

        Claude Opus 4.7 대비 ~87.6%

        Artificial Analysis 지수

        60

        출시 시 1위, Anthropic·Google과의 삼자 동률을 깨고

        Terminal-Bench 2.0

        82.7%

        Claude Opus 4.7 대비 69.4%, 최첨단

        GPQA Diamond

        93.6%

        Claude Opus 4.7 94.2%, Gemini 3.1 Pro 94.3% 대비

        입력/출력 가격

        $5 / $30 per 1M

        GPT-5.4의 2배, Pro 계층 $30 / $180

        강점

        • 업계 선두의 에이전틱 코딩(82.7% Terminal-Bench 2.0, 88.7% SWE-bench Verified)과 최고 수준의 도구 호출 신뢰성(첫 시도 성공 97.4%)
        • 장시간 컨텍스트 대폭 개선 — 1M 토큰 MRCR v2에서 74.0%(GPT-5.4의 36.6%에서 상승), 실제 100만 토큰 API 컨텍스트 윈도우
        • 가장 성숙한 기업 생태계 — 1차 SDK(Python/TS/Java/Go/.NET), Azure OpenAI 통합, SOC 2/HIPAA/GDPR 준수, 압도적인 ChatGPT 유통

        약점

        • 프론티어 API 가격 중 최고인 출력 100만 토큰당 $30, 숨은 추론 토큰 팽창이 고노력 호출 체감 비용을 3~5배 키울 수 있음
        • AA-Omniscience 환각률 86%(Claude Opus 4.7의 36% 대비) — 광범위 지식 작업에서 프론티어 모델 중 사실 신뢰성 최약
        • SWE-bench Pro(58.6% 대 64.3%)와 다중 파일 리팩터 작업에서 Claude Opus 4.7에 패배, 대화 선호도도 뒤짐(LMArena Elo ~1474 대 ~1492)

        경쟁사 비교

        ModelArenaGPQAPrice
        Claude Opus 4.7~149294.2%$5/$25 per 1M
        Gemini 3.1 Pro~147094.3%$2–3.50/$12 per 1M
        DeepSeek V4 Pro~1450N/A~$0.30/$1.10 per 1M

        GPT-5.5는 2026년 4월 23일 출시된 OpenAI의 가장 강력한 범용 모델이자 GPT-4.5 이후 처음으로 완전히 재학습된 베이스 모델입니다. 네이티브 옴니모달 아키텍처 위에 NVIDIA GB200/GB300 NVL72 하드웨어와 공동 설계되어, 지능이 크게 높아졌음에도 GPT-5.4와 토큰당 지연을 맞춥니다. 모델은 Artificial Analysis 지능 지수(점수 60)에서 선두이며, Terminal-Bench 2.0(82.7%) 같은 에이전틱 코딩 벤치마크에서 최첨단, SWE-bench Verified에서 OpenAI 신기록(88.7%)을 세웠습니다. none부터 xhigh까지 구성 가능한 추론 노력 다이얼로 개발자가 지연과 비용을 거래해 깊이를 조절할 수 있습니다.

        모델 포지셔닝은 에이전틱 작업(다단계 코딩, 컴퓨터 사용, 장시간 연구, 도구 호출 에이전트 루프)에 맞춰져 있습니다. OpenAI의 코딩 에이전트 Codex가 주 배포 표면이며 OpenAI 직원의 85% 이상이 매주 사용합니다. GPT-5.5는 장시간 컨텍스트 유지(1M 토큰에서 74.0%, GPT-5.4의 36.6%에서 상승)와 ARC-AGI-2 추상 추론(85.0%, 73.3%에서 상승)에서 진짜 도약을 보입니다. 아키텍처는 커뮤니티 추정 활성 100~200B의 MoE를 쓴다고 알려졌으나 OpenAI는 구체적으로 공개하지 않았습니다.

        GPT-5.5는 프리미엄 가격(입출력 100만 토큰당 $5/$30, GPT-5.4의 2배)이지만, OpenAI는 약 40% 토큰 효율 향상이 인상을 일부 상쇄한다고 봅니다. Pro 변형($30/$180)은 가장 어려운 추론 작업을 위한 상위 계층입니다. 모델의 주 경쟁 약점은 광범위 지식 작업에서 Claude Opus 4.7 대비 높은 환각률, SWE-bench Pro(더 어렵고 덜 암기된 코딩 벤치마크)에서 Opus 패배, 무지성 이전 비용입니다. 에이전틱 시스템·도구 사용 에이전트·컴퓨터 사용 워크플로를 짜는 팀에게 GPT-5.5는 현재 OpenAI의 가장 강력한 기초 모델입니다.

        분석 생성일: 2026-08-06