Claude Sonnet 5 출시
2026년 6월 30일, Anthropic이 **Claude Sonnet 5**를 정식 출시했다. Sonnet 시리즈 역사상 가장 강력한 모델로, Free/Pro 사용자의 새 기본 모델로 제공된다. Sonnet 5는 7개 공유 벤치마크 중 5개에서 GPT-5.5를 제쳤으며(5승 2패), 가격은 Opus 4.8의 5분의 1에 불과하다.
이번 업그레이드는 단순한 성능 향상이 아니다. Sonnet 5의 등장은 중간급 모델이 처음으로 여러 핵심 지표에서 전 세대 플래그십을 넘어섰다는 것을 의미한다. 한국의 개발자와 기업 사용자 입장에서는 어떤 모델을 선택하고, 비용과 성능을 어떻게 균형 맞춰야 할지가 그 어느 때보다 복잡해졌다.
기본 사양 비교
| 항목 | Claude Sonnet 5 | Claude Sonnet 4.6 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| 출시일 | 2026년 6월 30일 | 2026년 3월 | 2026년 5월 28일 | 2026년 4월 23일 |
| 개발사 | Anthropic | Anthropic | Anthropic | OpenAI |
| 컨텍스트 윈도우 | 1M tokens | 200K tokens | 1M tokens | 1,050K tokens |
| 최대 출력 | 128K tokens | — | 128K tokens | — |
| 입력 가격 (/1M tokens) | $2 (한정) → $3 | $3 | $5 | $5 |
| 출력 가격 (/1M tokens) | $10 (한정) → $15 | $15 | $25 | $30 |
| 캐시 히트 할인 | 90% | 90% | 90% | 있음 |
| 배치 처리 할인 | 50% | 50% | 50% | 50% |
Sonnet 5의 가격 전략은 매우 공격적이다. 한정 프로모션 기간(2026년 8월 31일까지)에는 입력 가격이 $2/1M tokens로, Gemini 3.1 Pro와 동일한 수준이지만 성능은 이를 크게 상회한다. 정가인 $3/1M 입력 기준으로도 GPT-5.5의 60%에 불과하다.
벤치마크 비교: Sonnet 5는 얼마나 강력한가?
코딩 능력
| 벤치마크 | Sonnet 5 | Sonnet 4.6 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| SWE-bench Pro (에이전트 코딩) | 63.2% | 58.1% | 69.2% | 58.6% |
| Terminal-Bench 2.1 (터미널 코딩) | 80.4% | 67.0% | 82.7% | 78.2% |
SWE-bench Pro는 현재 AI 코딩 에이전트 능력을 측정하는 가장 권위 있는 벤치마크다. Sonnet 5의 **63.2%**는 Sonnet 4.6 대비 +5.1%p 향상에 그치지 않고, GPT-5.5의 58.6%를 넘어선다. 즉, 실제 GitHub 이슈 수정 작업에서 Sonnet 5의 성공률이 GPT-5.5보다 약 5%p 높다는 뜻이다.
Terminal-Bench 2.1은 장시간 터미널 세션에서의 코딩 능력을 평가한다. Sonnet 5는 **80.4%**로 GPT-5.5(78.2%)를 다시 한번 제치며, Opus 4.8(82.7%)에 근접했다.
컴퓨터 조작 능력
| 벤치마크 | Sonnet 5 | Sonnet 4.6 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| OSWorld-Verified (데스크톱 조작) | 81.2% | 78.5% | 83.4% | 78.7% |
OSWorld-Verified는 AI가 실제 데스크톱 환경에서 작업하는 능력을 테스트한다. Sonnet 5는 **81.2%**로 GPT-5.5(78.7%)를 넘어섰고, Opus 4.8(83.4%)과의 격차를 단 2.2%p로 좁혔다. RPA(로봇 프로세스 자동화)를 AI로 대체하려는 기업에게는 주목할 만한 신호다.
지식 추론
| 벤치마크 | Sonnet 5 | Sonnet 4.6 | Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|
| HLE (도구 사용) | 57.4% | 46.8% | 57.9% | 52.2% |
| HLE (도구 미사용) | 43.2% | 34.6% | 49.8% | 41.4% |
Humanity's Last Exam(HLE)은 현재 난이도가 가장 높은 추론 벤치마크 중 하나다. Sonnet 5는 도구 보조 사용 시 **57.4%**를 기록하며 Opus 4.8(57.9%)과 거의 동등한 수준에 도달했고, GPT-5.5(52.2%)를 크게 앞섰다. Sonnet 5의 추론 능력이 Anthropic 플래그십 수준에 근접했음을 보여준다.
가격 비교: 가성비의 제왕
| 모델 | 입력 가격 (/1M tokens) | 출력 가격 (/1M tokens) | 100K 입력 + 10K 출력 비용 |
|---|---|---|---|
| Claude Sonnet 5 (한정) | $2 | $10 | $0.30 |
| Claude Sonnet 5 (정가) | $3 | $15 | $0.45 |
| Claude Sonnet 4.6 | $3 | $15 | $0.45 |
| Claude Opus 4.8 | $5 | $25 | $0.75 |
| GPT-5.5 | $5 | $30 | $0.80 |
| Gemini 3.1 Pro | $2 | $8 | $0.28 |
典型的인 코딩 작업을 예로 들어보자. 100K tokens 입력(코드 컨텍스트) + 10K tokens 출력(생성된 코드) 기준으로, Sonnet 5의 한정 가격은 $0.30에 불과하다. GPT-5.5($0.80)의 40%도 되지 않는다. 정가로 복귀하더라도($0.45) GPT-5.5의 56% 수준이다.
참고로 Gemini 3.1 Pro는 더 낮은 가격($0.28)을 제시하지만, 코딩 및 컴퓨터 조작 벤치마크에서 Sonnet 5에 크게 뒤진다. "성능/가격 비"라는 관점에서 Sonnet 5는 현재 최적의 선택이다.
Sonnet 5 vs Sonnet 4.6: 업그레이드할 가치가 있는가?
Sonnet 5는 Sonnet 4.6 대비 전방위적 향상을 이뤘다:
| 영역 | 향상폭 | 설명 |
|---|---|---|
| SWE-bench Pro | +5.1%p | 코딩 능력 크게 향상 |
| Terminal-Bench 2.1 | +13.4%p | 터미널 조작 능력 대폭 도약 |
| OSWorld-Verified | +2.7%p | 데스크톱 조작 안정성 향상 |
| HLE (도구 사용) | +10.6%p | 추론 능력 질적 비약 |
| HLE (도구 미사용) | +8.6%p | 도구 미사용 추론 대폭 개선 |
| 컨텍스트 윈도우 | 5배 | 200K에서 1M으로 확장 |
| 입력 가격 | -33% | $3에서 $2로 인하 (한정) |
가장 눈에 띄는 부분은 Terminal-Bench 2.1이 13.4%p 상승한 것과 컨텍스트 윈도우가 200K에서 5배인 1M으로 확대된 점이다. 기존 Sonnet 4.6 사용자에게는 즉시 업그레이드할 가치가 있는 업데이트다 — 더 강력한 성능, 더 넓은 컨텍스트, 더 낮은 가격.
Sonnet 5 vs GPT-5.5: 실제 사용에서의 차이
7개 공유 벤치마크에서 Sonnet 5는 5승 2패로 승리했다:
| 벤치마크 | 승리 모델 | 격차 |
|---|---|---|
| SWE-bench Pro | Sonnet 5 | +4.6%p |
| Terminal-Bench 2.1 | Sonnet 5 | +2.2%p |
| OSWorld-Verified | Sonnet 5 | +2.5%p |
| HLE (도구 사용) | Sonnet 5 | +5.2%p |
| HLE (도구 미사용) | Sonnet 5 | +1.8%p |
| CursorBench v3.1 | GPT-5.5 | +3.1%p |
| GDPval-AA | GPT-5.5 | +151 Elo |
GPT-5.5는 CursorBench(IDE 통합 코딩)와 GDPval-AA(실제 업무 부하)에서 여전히 우위를 점하고 있어, OpenAI가 제품화와 실제 배포 경험에서 앞서 있음을 시사한다. 하지만 Sonnet 5가 핵심 역량 지표에서의 전면적 우위와 현저한 가격 이점을 결합하고 있어, 대부분의 시나리오에서 더 나은 선택지가 된다.
사용 시나리오 추천: 어떤 모델을 선택해야 하나?
개발자 추천
| 사용 시나리오 | 추천 모델 | 이유 |
|---|---|---|
| 에이전트 코딩 (복잡한 버그 수정, 리팩토링) | Claude Sonnet 5 | SWE-bench Pro 63.2%, 가성비 최적 |
| IDE 내 코딩 (일상적 코딩) | GPT-5.5 | CursorBench 64.3%, IDE 통합 더 성숙 |
| 터미널 조작, 장시간 자동화 | Claude Sonnet 5 | Terminal-Bench 80.4%, GPT-5.5 초월 |
| 최고 정밀도가 필요한 핵심 작업 | Claude Opus 4.8 | 여전히 가장 강력한 모델, 오류 용납 불가 시나리오에 적합 |
기업 추천
| 사용 시나리오 | 추천 모델 | 이유 |
|---|---|---|
| 데스크톱 자동화 / RPA 대체 | Claude Sonnet 5 | OSWorld 81.2%, Opus 대비 40% 비용 |
| 대규모 코드 리뷰 | Claude Sonnet 5 | 1M 컨텍스트 + $2 입력 가격 |
| 고객 서비스 자동화 | GPT-5.5 | GDPval-AA 더 높음, 제품화 경험 풍부 |
| 문서 분석, 대량 데이터 처리 | Gemini 3.1 Pro | 2M 컨텍스트 + $2 입력, 최저 비용 |
비용 우선 전략
| 월 예산 | 추천 전략 |
|---|---|
| 넉넉함 | Opus 4.8으로 핵심 작업 처리, Sonnet 5로 일상 작업 처리 |
| 보통 | Sonnet 5를 주력으로 ($2/1M 입력), 90% 시나리오 커버 |
| 빠듯함 | Sonnet 5 한정 프로모션 기간 최대 활용, 8월 이후 Gemini 하향 검토 |
결론: Sonnet 5는 2026년 하반기의 기본 선택지
Claude Sonnet 5의 출시는 AI 모델 경쟁이 새로운 단계에 진입했음을 알린다. 중간급 모델이 처음으로 여러 핵심 벤치마크에서 전 세대 플래그십을 넘어섰으며, 가격은 오히려 더 저렴해졌다.
핵심 결론:
- Sonnet 5는 7개 중 5개 벤치마크에서 GPT-5.5를 초월했으며, 가격은 후자의 절반 이하
- Sonnet 5의 추론 능력은 Opus 4.8에 근접 (HLE 도구 사용: 57.4% vs 57.9%), 비용은 40%에 불과
- Sonnet 4.6 사용자에게는 업그레이드가 당연한 선택 — 전면 성능 향상, 컨텍스트 5배, 가격 인하
- 한정 프로모션은 8월 31일까지 — $2/$10 가격 창구는 Sonnet 5를 체험할 최적의 타이밍
2026년 하반기의 AI 모델 선택은 명확해졌다: Sonnet 5가 기본 추천이다. 최고 정밀도가 필요하면 Opus 4.8, 최대 컨텍스트가 필요하면 Gemini 3.1 Pro, 가장 성숙한 IDE 통합이 필요하면 GPT-5.5를 고려하면 된다.
에디터의 시각
며칠 사용해 본 솔직한 소감: Opus 4.8의 5분의 1 가격으로 일상적인 코딩 작업의 90%는 충분히 커버됩니다. 다만 복잡한 다단계 에이전트 작업에서는 아직 Opus가 앞서 있습니다. Anthropic이 '대부분은 저렴한 모델로, 정말 필요할 때만 비싼 모델로' 전략을 취하고 있다는 게 명확히 보입니다.
로딩 중...