Anthropic독점

Claude Opus 5

이 모델 비교

Anthropic이 2026년 7월 24일에 공개한 Opus 계열 플래그십. 출시 당일 Artificial Analysis 인텔리전스 지수 61점으로 1위에 오르면서도 가격은 Opus 4.8과 같은 100만 토큰당 $5/$25로 동결됐다. 100만 토큰 컨텍스트에 SWE-bench Verified 96.0%, ARC-AGI-2 90.4%를 기록했다.

파라미터

Undisclosed

컨텍스트

1M

라이선스

Proprietary

출시일

2026-07-24

벤치마크 성능

AA Intelligence Index

LMArena Elo

HLE

64.7

ARC-AGI-2

90.4

SWE-bench Verified

96.0

GPQA Diamond

93.2

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

API 가격

입력 가격 (1M 토큰당)

$5

출력 가격 (1M 토큰당)

$25

과금 모드: standard

강점

  • Opus 4.8과 동일한 $5/$25 가격에 성능만 상승
  • 자체 검증이 기본 동작해 장시간 에이전트 작업에 강함
  • 지식 노동(GDPval-AA v2 1,861 Elo)과 과학 영역에서 선두

약점

  • Anthropic 시스템 카드가 Fable 5보다 종합적으로 낫지 않다고 명시
  • DeepSWE v1.1에서 GPT-5.6 Sol에 열세, 보안·법률은 Mythos 5가 우위
  • 장황하고 느림. xhigh/max에서 확장 사고를 끌 수 없는 파괴적 변경

활용 사례

  • 장시간 에이전트 코딩과 대규모 리팩터링
  • 재현이 어려운 버그의 근본 원인 분석
  • 전문 지식 노동과 딥 리서치

심층 분석

Artificial Analysis 인텔리전스 지수

61

전체 1위(190개 모델 중). 2위 Fable 5(60), 3위 GPT-5.6 Sol(59)

SWE-bench Verified

96.0%

전체 1위. Mythos 5(95.5%), Fable 5(95%) 순

Frontier-Bench v0.1

43.3%

Fable 5(33.7%) 대비 +9.6p. Opus 4.8(18.7%) 대비 2.3배

ARC-AGI-3

30.2%

차순위 모델(7.8%) 대비 약 4배. Opus 4.8은 1.5%

IMO 2026

만점 42/42

금메달 컷 29점. 도구·에이전트 하네스 없이 순수 추론만으로

표준 가격

$5/$25 per 1M

Opus 4.8과 동일. Fable 5($10/$50)의 절반

강점

  • Fable 5 대비 절반 가격으로 12개 공유 벤치마크 중 7개에서 앞서며, Frontier-Bench(+9.6p)·GDPval-AA v2(+114 Elo)·AutomationBench(+8.6p) 등 실무 코딩·에이전트 벤치마크에서 뚜렷한 우위
  • ARC-AGI-3 30.2%로 완전히 새로운 문제 해결 능력 입증 — 차순위 모델의 4배. IMO 2026 만점으로 최상위 수준의 수학 추론도 달성
  • 노력 수준(low/medium/high) 토글로 과제 난이도에 따라 비용과 정확도를 정밀하게 조절 가능. Fast 모드로 2.5배 속도 제공

약점

  • 안전 분류기로 인해 전체 API 호출의 약 5%가 Opus 4.8로 폴백되어, 실제 사용 시 최대 성능을 항상 보장받지 못함
  • SWE-bench Pro(79.2%)와 DeepSWE(68.8%)에서 Fable 5에 근소하게 뒤처지며, 최고 정확도가 필요한 초대형 리팩터링에는 여전히 Mythos 계열이 적합
  • Fast 모드 사용 시 가격이 $10/$50으로 올라 Fable 5 수준이 됨. 실시간 대화형 코딩에서는 일부 사용자가 지연 시간이 길다고 보고

경쟁사 비교

ModelArenaPrice
Claude Fable 5N/A$10/$50 per 1M
GPT-5.6 SolN/AOpenAI 가격 기준
Claude Opus 4.8N/A$5/$25 per 1M

Claude Opus 5는 2026년 7월 24일 출시된 Anthropic의 새로운 플래그십 모델로, 2개월 사이 네 번째 모델 출시다. 가격은 Opus 4.8과 동일한 $5/$25(입력/출력 백만 토큰당)를 유지하면서, 사실상 모든 벤치마크에서 큰 폭의 성능 향상을 이뤘다. 가장 인상적인 결과는 Frontier-Bench v0.1 43.3%(Opus 4.8의 2.3배), ARC-AGI-3 30.2%(차순위 모델의 4배), IMO 2026 만점 42/42다.

이 모델의 결정적 특징은 자사 최상위 모델인 Fable 5를 절반 가격으로 압도한다는 점이다. 12개 공유 벤치마크 중 7개에서 앞섰으며, 특히 GDPval-AA v2(1861 vs 1747 Elo)와 AA-Briefcase(1720 vs 1574) 같은 장기 지식 업무에서 큰 차이를 보였다. AutomationBench에서는 26.0%로 Fable 5(17.4%)를 크게 앞서며, 단일 과제당 $0.75 수준의 최저 비용으로 모든 경쟁 모델의 최고 설정을 능가했다. Anthropic의 AI Index 61로 1위, Agentic Index 55.3으로 1위를 기록했다.

한 가지 주의할 점은 안전 분류기로 인한 5% 폴백이다. 일부 API 호출이 Opus 4.8로 라우팅되어, '순수 Opus 5' 성능보다 소폭 낮은 결과가 혼재한다. 그럼에도 Claude Code·API·AWS Bedrock·Google Vertex AI·Microsoft Foundry 등 모든 주요 플랫폼에서 즉시 이용 가능하며, Opus 4.8 사용자에게는 비용 변동 없는 업그레이드다.

분석 생성일: 2026-08-03