Anthropic이 2026년 7월 24일에 공개한 Opus 계열 플래그십. 출시 당일 Artificial Analysis 인텔리전스 지수 61점으로 1위에 오르면서도 가격은 Opus 4.8과 같은 100만 토큰당 $5/$25로 동결됐다. 100만 토큰 컨텍스트에 SWE-bench Verified 96.0%, ARC-AGI-2 90.4%를 기록했다.
파라미터
Undisclosed
컨텍스트
1M
라이선스
Proprietary
출시일
2026-07-24
벤치마크 성능
AA Intelligence Index
—
LMArena Elo
—
HLE
64.7
ARC-AGI-2
90.4
SWE-bench Verified
96.0
GPQA Diamond
93.2
MMLU-Pro
—
LiveCodeBench
—
AIME 2025
—
MATH-500
—
API 가격
입력 가격 (1M 토큰당)
$5
출력 가격 (1M 토큰당)
$25
과금 모드: standard
강점
- •Opus 4.8과 동일한 $5/$25 가격에 성능만 상승
- •자체 검증이 기본 동작해 장시간 에이전트 작업에 강함
- •지식 노동(GDPval-AA v2 1,861 Elo)과 과학 영역에서 선두
약점
- •Anthropic 시스템 카드가 Fable 5보다 종합적으로 낫지 않다고 명시
- •DeepSWE v1.1에서 GPT-5.6 Sol에 열세, 보안·법률은 Mythos 5가 우위
- •장황하고 느림. xhigh/max에서 확장 사고를 끌 수 없는 파괴적 변경
활용 사례
- •장시간 에이전트 코딩과 대규모 리팩터링
- •재현이 어려운 버그의 근본 원인 분석
- •전문 지식 노동과 딥 리서치
심층 분석
Artificial Analysis 인텔리전스 지수
61
전체 1위(190개 모델 중). 2위 Fable 5(60), 3위 GPT-5.6 Sol(59)
SWE-bench Verified
96.0%
전체 1위. Mythos 5(95.5%), Fable 5(95%) 순
Frontier-Bench v0.1
43.3%
Fable 5(33.7%) 대비 +9.6p. Opus 4.8(18.7%) 대비 2.3배
ARC-AGI-3
30.2%
차순위 모델(7.8%) 대비 약 4배. Opus 4.8은 1.5%
IMO 2026
만점 42/42
금메달 컷 29점. 도구·에이전트 하네스 없이 순수 추론만으로
표준 가격
$5/$25 per 1M
Opus 4.8과 동일. Fable 5($10/$50)의 절반
강점
- ・Fable 5 대비 절반 가격으로 12개 공유 벤치마크 중 7개에서 앞서며, Frontier-Bench(+9.6p)·GDPval-AA v2(+114 Elo)·AutomationBench(+8.6p) 등 실무 코딩·에이전트 벤치마크에서 뚜렷한 우위
- ・ARC-AGI-3 30.2%로 완전히 새로운 문제 해결 능력 입증 — 차순위 모델의 4배. IMO 2026 만점으로 최상위 수준의 수학 추론도 달성
- ・노력 수준(low/medium/high) 토글로 과제 난이도에 따라 비용과 정확도를 정밀하게 조절 가능. Fast 모드로 2.5배 속도 제공
약점
- ・안전 분류기로 인해 전체 API 호출의 약 5%가 Opus 4.8로 폴백되어, 실제 사용 시 최대 성능을 항상 보장받지 못함
- ・SWE-bench Pro(79.2%)와 DeepSWE(68.8%)에서 Fable 5에 근소하게 뒤처지며, 최고 정확도가 필요한 초대형 리팩터링에는 여전히 Mythos 계열이 적합
- ・Fast 모드 사용 시 가격이 $10/$50으로 올라 Fable 5 수준이 됨. 실시간 대화형 코딩에서는 일부 사용자가 지연 시간이 길다고 보고
경쟁사 비교
| Model | Arena | Price |
|---|---|---|
| Claude Fable 5 | N/A | $10/$50 per 1M |
| GPT-5.6 Sol | N/A | OpenAI 가격 기준 |
| Claude Opus 4.8 | N/A | $5/$25 per 1M |
Claude Opus 5는 2026년 7월 24일 출시된 Anthropic의 새로운 플래그십 모델로, 2개월 사이 네 번째 모델 출시다. 가격은 Opus 4.8과 동일한 $5/$25(입력/출력 백만 토큰당)를 유지하면서, 사실상 모든 벤치마크에서 큰 폭의 성능 향상을 이뤘다. 가장 인상적인 결과는 Frontier-Bench v0.1 43.3%(Opus 4.8의 2.3배), ARC-AGI-3 30.2%(차순위 모델의 4배), IMO 2026 만점 42/42다.
이 모델의 결정적 특징은 자사 최상위 모델인 Fable 5를 절반 가격으로 압도한다는 점이다. 12개 공유 벤치마크 중 7개에서 앞섰으며, 특히 GDPval-AA v2(1861 vs 1747 Elo)와 AA-Briefcase(1720 vs 1574) 같은 장기 지식 업무에서 큰 차이를 보였다. AutomationBench에서는 26.0%로 Fable 5(17.4%)를 크게 앞서며, 단일 과제당 $0.75 수준의 최저 비용으로 모든 경쟁 모델의 최고 설정을 능가했다. Anthropic의 AI Index 61로 1위, Agentic Index 55.3으로 1위를 기록했다.
한 가지 주의할 점은 안전 분류기로 인한 5% 폴백이다. 일부 API 호출이 Opus 4.8로 라우팅되어, '순수 Opus 5' 성능보다 소폭 낮은 결과가 혼재한다. 그럼에도 Claude Code·API·AWS Bedrock·Google Vertex AI·Microsoft Foundry 등 모든 주요 플랫폼에서 즉시 이용 가능하며, Opus 4.8 사용자에게는 비용 변동 없는 업그레이드다.
출처
- Introducing Claude Opus 5 — Anthropic
- Claude Opus 5 — Anthropic Product Page
- Claude Opus 5: Benchmarks, Pricing, API & Specs — DataLearnerAI
- Claude Opus 5 Arrives: Fourth Model Launch in Two Months — AIBars
- Claude Opus 5 vs Claude Fable 5: The $25 Workhorse That Dethroned the $50 Flagship — CodingFleet
- Claude Opus 5 by Anthropic: benchmarks & pricing — DataNorth AI
- Claude Opus 5 review: near-frontier coding at half the price — eesel AI
- Claude Opus 5 pricing & specs — CloudPrice
분석 생성일: 2026-08-03