Anthropic가 개발한 최신 기반 모델. 이전 세대 대비 성능과 효율성이 크게 향상되었습니다.
파라미터
Undisclosed
컨텍스트
1M
라이선스
Proprietary
출시일
2026-05-28
벤치마크 성능
AA Intelligence Index
—
LMArena Elo
—
HLE
—
ARC-AGI-2
—
SWE-bench Verified
—
GPQA Diamond
—
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
일본어 처리 능력
Multilingual model with strong Japanese language processing capabilities.
API 가격
입력 가격 (1M 토큰당)
$5
출력 가격 (1M 토큰당)
$
과금 모드: standard
강점
약점
활용 사례
심층 분석
Arena Elo
1,477
BenchLM 종합 순위; 코딩 하위영역 1,537
SWE-bench Pro
69.2%
분야 선두 — GPT-5.5(58.6%), Gemini 3.1 Pro(54.2%) 상회
SWE-bench Verified
88.6%
Opus 4.7(87.6%) 대비 상승
GDPval-AA
1,890 Elo
GPT-5.5 대비 약 67% 승률
Intelligence Index
61.4
출시 당시 1위 — Opus 4.7 대비 +4.1
입력 / 출력 가격
$5 / $25 per 1M
Opus 4.7과 동일; Fast 모드 $10/$50
강점
- ・에이전틱 코딩 성능 분야 선두 (SWE-bench Pro 69.2%)로 GPT-5.5·Gemini 3.1 Pro 대비 큰 격차
- ・자신의 코드 결함을 지적 없이 통과시키는 비율을 약 4배 줄여 장기 에이전틱 워크플로 신뢰성 향상
- ・1M 토큰에서 가장 강한 장문 추론 (GraphWalks BFS 68.1% vs GPT-5.5 45.4%)과 선두 지식작업 Elo (GDPval-AA 1,890)
약점
- ・GPT-5.5가 터미널 기반 DevOps 코딩 (Terminal-Bench 78.2% vs 74.6%)에서 앞서고 에이전틱 작업에 약 30% 적은 턴 소요
- ・프롬프트 인젝션 저항이 이전 버전(~2.3%)에서 ~7% 공격 성공률로 후퇴해 적대적 환경에서 우려
- ・높은 토큰 소비와 출력 가격($25/M)으로 비용 민감 고볼륨 작업에서는 Gemini 3.1 Pro($12/M 출력) 대비 비용 부담
경쟁사 비교
| Model | Arena | GPQA | Price |
|---|---|---|---|
| GPT-5.5 (xhigh) | ~1480* | ~92%* | $25/$30 |
| Gemini 3.1 Pro | ~1460* | ~92%* | $2/$12 |
| Claude Fable 5 | N/A | N/A | $10/$50 |
Claude Opus 4.8은 2026년 5월 28일 출시된 Anthropic의 Opus 4 라인에서 작은 하지만 실질적인 업그레이드다. Opus 4.7을 바탕으로 에이전틱 코딩(SWE-bench Pro 64.3%→69.2%), 지식 작업(GDPval-AA 1,753→1,890 Elo), 과학 추론(Humanity's Last Exam 약 +3점)에서 유의미한 향상을 이뤘고, 가격($5/$25)과 1M 토큰 컨텍스트는 동일하게 유지했다. 출시 당시 Artificial Analysis Intelligence Index 61.4로 1위를 기록, GPT-5.5를 1.2점 차로 앞섰다.
벤치마크 수치 이상으로 중요한 것은 동작 방식의 개선이다. Opus 4.8은 이전 세대 대비 코드 결함을 지적 없이 넘기는 비율이 약 4분의 1로 줄었고, 초기 테스터들은 더 나은 판단력, 잘못된 계획에 대한 적절한 반론, 에이전틱 워크플로에서의 강한 자기 수정 능력을 일관되게 보고했다. 또한 Dynamic Workflows(Claude Code에서 최대 1,000개 병렬 서브에이전트를 가능케 하는 리서치 프리뷰), Effort Control(추론 깊이를 조절하는 5단계 다이얼), $10/$50의 Fast Mode(2.5배 처리량)를 도입했다. Anthropic은 Opus 4.8을 새로 발표된 Fable 5 및 Mythos급 모델 아래에서 더 까다로운 작업을 더 높은 가격에 처리하는 '신뢰할 수 있는 프로덕션 티어'로 포지셔닝했다.
주요 약점은 경쟁사가 구조적 우위를 가진 영역에 있다. GPT-5.5는 터미널 기반 코딩에서 앞서고 에이전틱 벤치마크에서 더 높은 턴 효율을 보이며, Gemini 3.1 Pro는 비용 민감 작업에서 출력 토큰 약 2배 저렴하고, 프롬프트 인젝션 저항은 이전 버전에서 후퇴했다. 창작 글쓰기 역시 수평 이동 수준이다. 그럼에도 에이전틱 코딩 파이프라인, 코드 리뷰 자동화, 장문 컨텍스트 분석 도구를 구축하는 팀에게 Opus 4.8은 2026년 중반 기준 가장 강한 메인스트림 티어 옵션이다.
출처
- Introducing Claude Opus 4.8 — Anthropic
- Claude Opus 4.8 Takes the Lead on the Artificial Analysis Intelligence Index
- Claude Opus 4.8 Benchmark Scores & Evals — BenchmarkList
- Claude Opus 4.8 Benchmarks, Pricing & Speed — BenchLM.ai
- Claude Opus 4.8 Review: Better At What It's Good At — Tech Yahoo
- 5 Biggest Upgrades: Claude Opus 4.8 vs 4.7 — Android Authority
- Claude Opus 4.8 Review: Reliability Over Raw Scores — Awesome Agents
- Claude Opus 4.8 Review — AI Panel Verdict — TopReviewed.ai
- Claude Opus 4.8 vs Opus 4.7: What Actually Changed — Contra Collective
- Claude Opus 4.8 Benchmarks, Scores, Rankings — AllThings.how
분석 생성일: 2026-08-05