앤트로픽, 클로드 오퍼스 4.8(Claude Opus 4.8) 공개 — 가격 동결, 성능과 정직성(Honesty) 실질적 개선
2026년 5월 28일, 앤트로픽(Anthropic)이 플래그십 모델의 최신 버전 '클로드 오퍼스 4.8(Claude Opus 4.8)'을 공개했습니다. 규모 면에서 대규모 변화는 아니지만, 방향성이 명확한 이터레이션입니다. 코딩, 에이전트 태스크, 추론, 지식 워커 대상 벤치마크 전반에서 전 세대인 오퍼스 4.7을 소폭이나마 전반적으로 상회하며, 가격은 그대로 유지되었습니다. 그리고 이번 업데이트에서 가장 강조된 개선점은 바로 '정직성(honesty)'입니다. 앤트로픽은 공식 발표에서 이를 "이전 세대에 대한 온화하지만 확실한 개선(a modest but tangible improvement)"이라고 솔직하게 평가했습니다.
주목할 점은 이터레이션 속도입니다. 오퍼스 4.8은 오퍼스 4.7 공개 후 불과 41일 만에 출시되어, 오퍼스 시리즈 역사상 가장 빠른 버전 업그레이드가 되었습니다. 모델 ID는 claude-opus-4-8이며, 입력 100만 토큰, 출력 12.8만 토큰의 컨텍스트 구성을 제공합니다.

벤치마크 테스트: 코딩은 뚜렷한 개선, 단 터미널 태스크에서는 GPT-5.5에 못 미쳐
공식 시스템 카드(System Card)에서 공개된 데이터를 살펴보면, 오퍼스 4.8의 개선은 주로 코딩과 에이전트 역량에 집중되어 있지만, 벤치마크에 따라 상승폭이 크게 다르기 때문에 항목별로 살펴볼 필요가 있습니다.
코딩 측면에서는 실질적으로 의미 있는 개선이 더 높은 난이도의 SWE-bench Pro에서 나타났습니다. 오퍼스 4.8은 69.2%를 기록하며, 오퍼스 4.7의 64.3%에서 4.9%p 상승했습니다. 반면 이미 상한선에 근접한 SWE-bench Verified는 87.6%에서 88.6%(+1.0), SWE-bench Multilingual은 80.5%에서 84.4%(+3.9)로 미미한 증가에 그쳤습니다. 즉, 이미 포화 상태에 도달한 벤치마크에서는 개선 여지가 적고, 아직 포화되지 않은 더 어려운 태스크에 개선이 집중되어 있다는 것입니다. 이는 모델의 실제 코딩 능력이 향상되었는지를 판별하는 데 있어 보다 신뢰할 수 있는 시그널이라 할 수 있습니다.
에이전트 터미널 태스크(Terminal-Bench 2.1)에서는 이번 단일 항목 중 가장 큰 상승을 보였습니다. 66.1%에서 74.6%로 8.5%p나 향상되었습니다. 그러나 솔직히 말해야 합니다. 이 상승폭이 가장 크긴 하지만, 오퍼스 4.8은 이 항목에서 여전히 GPT-5.5에 뒤처져 있습니다. 동일한 Terminus-2 공개 테스트 하네스(harness) 하에서 GPT-5.5는 78.2%를 기록했으며, GPT-5.5에 포함된 Codex CLI 하네스를 사용하면 그 점수는 더 높은 83.4%에 달합니다. 앤트로픽도 이를 각주에서 인정하고 있습니다. 결론은 명확합니다. 만약 당신의 주요 작업 환경이 터미널/CLI라면, 현재 종합 최강 모델이 반드시 당신에게 최적의 모델은 아닐 수 있습니다.
추론 계열 벤치마크 성적은 양극화되었습니다. 가장 두드러진 것은 USAMO 2026 수학 증명으로, 69.3%에서 **96.7%**로 극적으로 상승하며 단일 버전 주기에서 27.4%p나 올랐습니다. 이 변화는 점진적 개선이라기보다는 수학 추론의 깊이가 질적으로 변했음을 느끼게 합니다. 그러나 한편 GPQA Diamond는 전 세대 오퍼스 4.7의 94.2%에서 93.6%로 소폭 후퇴했습니다. Humanity's Last Exam(도구 사용)은 54.7%에서 57.9%로 상승했습니다.
지식 워커 대상 성능에서는, Artificial Analysis의 GDPval-AA 평가에서 오퍼스 4.8이 1890 Elo로 선두를 달리며, 전 세대 1753에서 137포인트 상승, 그리고 GPT-5.5의 1769도 크게 상회했습니다. 컴퓨터 활용(OSWorld-Verified)에서는 83.4%, 브라우저 에이전트(Online-Mind2Web)에서는 84%를 기록했습니다. 종합하면, 앤트로픽이 공개한 비교에서 오퍼스 4.8은 7개 항목 중 6개에서 승리를 거뒀으며, 유일하게 패배한 것이 위에서 언급한 Terminal-Bench 2.1이었습니다.
'정직성'이 이번 업데이트에서 반복 강조된 핵심 차별점
벤치마크 수치가 완만한 수준의 개선이었던 반면, 앤트로픽 발표에서 가장 많은 지면이 할애된 것은 모델의 '정직성(honesty)'이었습니다.
여기서 말하는 '정직함'에는 명확한 정의가 있습니다. 모델이 스스로 뒷받침할 수 없는 주장을 하지 않는다는 의미입니다. AI 모델에 공통으로 존재하는 문제 중 하나는, 충분한 근거 없이 성급하게 결론을 도출하거나, 태스크의 완료나 진행 상황을 과도하게 자신 있게 선언하는 것입니다. 앤트로픽에 따르면, 오퍼스 4.8은 자신의 작업에서 발생하는 불확실성을 적극적으로 드러내는 경향이 강해졌으며, 근거 없는 결론을 내리는 빈도가 줄었습니다.
정량적 지표로 환산하면, 오���스 4.8이 스스로 작성한 코드에서 결함을 별도 주석 없이 '얼버무릴' 확률은 전 세대 대비 약 4분의 1 수준(약 4배 낮음)입니다. 초기 테스터들의 피드백도 다른 모델들이 간과하기 쉬워 사용자 본인의 발견에 맡기던 부분을, 이 모델이 스스로 입력 및 출력의 문제점을 짚어낸다는 점에서 일치합니다.
코드 리뷰, 금융 분석, 법률 등 고위험 전문 워크플로우에 모델을 활용하는 사용자에게 있어, 이 개선의 실제 가치는 단일 벤치마크 점수의 향상보다 클 수 있습니다. "여기는 잘 모르겠습니다"라고 말할 수 있는 모델은, 장기간·무인 운영되는 에이전트 워크플로우에서 점수는 높지만 자신감 넘치게 오류를 범하는 모델보다 훨씬 실용적입니다.
정렬(Alignment) 평가: 탈선 행동률이 Mythos 수준에 근접
출시 전 정렬(alignment) 평가에서, 앤트로픽의 정렬 팀은 다음과 같이 결론지었습니다. 오퍼스 4.8은 "사용자의 자율성을 지원하고, 사용자의 최선의 이익을 위해 행동하는 친사회적 특성(prosocial traits) 측정에서 새로운 고점에 도달했다".
더 중요한 데이터셋이 있습니다. 오퍼스 4.8의 탈선 행동률(기만이나 악용에의 협력 등)은 오퍼스 4.7과 비교하여 현저히 낮아졌으며, 앤트로픽의 정렬 성능이 가장 뛰어난 모델인 Claude Mythos Preview 수준에 근접하고 있습니다. 완전한 정렬 평가와 일련의 배포 전 보안 테스트는 오퍼스 4.8 시스템 카드에 모두 수록되어 있습니다.
동시 발표된 세 가지 기능 업데이트
모델 자체 외에, 앤트로픽은 같은 날 세 가지 부수적 업데이트도 발표했습니다. 그중 두 가지는 오퍼스 4.7 시대에 사용자로부터 많이 제기되었던 "사고 시간이 너무 길다"는 피드백에 대응한 것입니다.
첫 번째는 **'노력 제어(Effort Control)'**입니다. claude.ai와 Cowork의 모델 셀렉터 옆에 추가되며, 사용자가 클로드가 태스크에 투입할 계산 자원과 토큰량을 수동으로 선택할 수 있습니다. 오퍼스 4.8의 기본값은 "높음(high)" 투입도로, 코딩 태스크에 소비하는 토큰은 오퍼스 4.7의 기본값과 비슷하지만 성능은 더 우수합니다. 사용자는 "extra"(Claude Code에서는 xhigh에 해당) 또는 "max"를 선택하여 더 많은 토큰을 소비하고 더 나은 결과를 얻을 수도 있습니다. 앤트로픽은 어려운 태스크나 장시간 비동기 워크플로우에는 "extra" 모드 사용을 권장하며, Claude Code의 속도 제한(rate limit)도 상향 조정되었습니다.
두 번째는 **'동적 워크플로우(Dynamic Workflows)'**입니다. 현재 리서치 프리뷰 단계로, Claude Code의 Enterprise, Team, Max 플랜에 제공되고 있습니다. 이 기능은 클로드가 먼저 태스크를 계획한 뒤, 단일 세션 내에서 수백 개의 서브에이전트(subagents)를 병렬 실행하고, 결과 보고 전에 스스로 출력을 검증할 수 있게 합니다. 공식이 제시하는 대표 시나리오는, Claude Code와 오퍼스 4.8을 결합하여 수십만 줄 규모의 코드베이스에 걸친 코드베이스 수준의 마이그레이션을, 시작부터 머지(merge)까지, 기존 테스트 스위트를 합격 기준으로 삼아 완료하는 것입니다.
세 번째는 개발자 대상입니다. Messages API에서 messages 배열 내에 system 엔트리를 삽입할 수 있게 되었습니다. 이는 태스크 실행 중 클로드에 대한 지시(예: 권한, 토큰 예산, 환경 컨텍스트 조정)를 업데이트할 수 있음을 의미합니다. 프롬프트 캐시를 끊지 않으면서도, 업데이트를 사용자 메시지의 왕복처럼 위장할 필요도 없습니다.
가격 및 제공 현황: 가격 동결, fast 모드는 3배 저렴
오퍼스 4.8은 즉시 모든 플랫폼에서 이용 가능합니다. 일반 사용 요금은 오퍼스 4.7과 완전히 동일합니다. 입력 토큰 100만당 5미국 달러, 출력 토큰 100만당 25미국 달러입니다. 개발자는 Claude API를 통해 claude-opus-4-8로 호출할 수 있습니다.
변화는 fast 모드에서 발생합니다. 이 모드는 약 2.5배 속도로 동작하며, 입력/출력 토큰 100만당 10/50미국 달러(일반 가격의 2배)에 제공되지만, 전 세대 클로드 모델의 fast 모드에 비해 단위 가격이 3배 저렴해졌습니다. 이 조정은 최근 업계 전반의 흐름—능력 향상과 동시에 단위 추론 비용을 억제하는—과 일치하며, 비용에 민감한 고빈도 호출 시나리오에 큰 영향을 미칩니다.
기타 주목할 점: Mythos급 모델이 조만간 모든 고객 대상으로
앤트로픽은 발표에서 다음 수에 대해서도 다시 한번 예고했습니다. 옍�스를 넘어서는 지능 수준의 완전히 새로운 모델 카테고리의 출시를 계획하고 있다는 것입니다. Project Glasswing의 일환으로, 현재 일부 기관이 사이버 보안 관련 작업에 Claude Mythos Preview를 사용하고 있습니다. 이 수준의 모델을 널리 출시하려면 보다 강력한 사이버 보안 대책이 필요하기 때문에, 앤트로픽은 관련 대책을 신속히 추진하고 있으며, "향후 수 주 이내"에 Mythos급 모델을 모든 고객에게 제공할 전망이라고 밝혔습니다.
참고로, 현재 공개적으로 이용 가능한 최강 모델은 여전히 오퍼스 4.8이며, Mythos급 모델은 아직 일반에 공개되지 않아 그 실제 능력과 출시 시점에는 불확실성이 남아 있습니다.
요약
클로드 오퍼스 4.8은 포지셔닝이 명확한 '강화형' 업데이트이지, 파괴적 업그레이드는 아닙니다. 가격을 동결한 상태에서 코딩(특히 높은 난이도의 SWE-bench Pro), 에이전트의 터미널 태스크, 그리고 지식 워커 대상 역량을 전반적으로 한 단계 끌어올렸으며, 수학 추론에서는 USAMO 2026 같은 이례적 수준의 단일 항목 도약을 보여주었습니다.
그러나 진정한 차별화 요인은 특정 벤치마크 수치가 아닌, 두 가지 비교적 '소프트한' 차원에 있습니다. 하나는 '정직성'—자신감 있게 오류를 범하는 일이 줄고, 불확실성을 스스로 적극적으로 드러낸다는 점입니다. 다른 하나는 정렬 성능—탈선 행동률이 Mythos 수준에 근접하고 있다는 점입니다. 절대적인 터미널 코딩 성능을 추구하는 사용자에게 GPT-5.5는 Terminal-Bench 2.1에서 여전히 우위에 있습니다. 그러나 장기간에 걸쳐 신뢰를 걸고, 저위험으로 실제 업무를 맡길 수 있는 프로페셔널 워크플로우를 필요로 하는 사용자에게, 오퍼스 4.8의 신뢰성 향상은 점수 그 자체보다 의미 있는 것일 수 있습니다.
옍�스 4.7에서 불과 41일 만에 출시되었고, 앤트로픽이 Mythos급 모델의 도래를 명확히 예고하고 있다는 점을 고려하면, 오퍼스 4.8은 정식 출시 전야의 견고한 트랜지션 모델이라 할 수 있습니다.
로딩 중...