Claude Opus 5.5 vs GPT-6: AI 뉴스 9월 23일

청구서부터 보자
9월 22일 Anthropic은 Claude Opus 5.5를, 약 90분 뒤 OpenAI는 GPT-6 Sol과 GPT-6 Luna를 공개했다. 두 회사 CEO가 업계 전체에 프런티어 개발 속도를 늦추자고 공개적으로 요구한 지 며칠 뒤였다. 새 모델의 성능표보다 먼저 눈에 들어오는 것은 가격표다.
Opus 5.5는 100만 토큰당 입력 4달러, 출력 20달러. Opus 5의 5달러·25달러에서 20% 내렸고, 컨텍스트는 100만 토큰이며 장문 할증은 없다. 대신 추론을 끌 수 없고 '낮음'이 하한이다.
GPT-6 Sol은 2달러·10달러로 Claude Sonnet 5의 요율표와 사실상 같다. Luna는 0.10달러·0.50달러다. Claude Haiku 4.5 입력 단가의 10분의 1이고, 보통은 자체 호스팅 오픈웨이트가 차지하던 구간이다. 두 모델 모두 272K 토큰을 넘기면 입력 2배, 출력 1.5배가 붙는다. 같은 날 OpenAI는 GPT-6 계열의 프롬프트 캐싱도 개선해 캐시된 프롬프트 비용을 최대 90%까지 낮춘다고 밝혔다. 오래 도는 에이전트에는 벤치마크 1점보다 이쪽이 크다.
성능은 누가 앞서나
Anthropic의 주장은 좁고 구체적이다. Opus 5.5는 "대부분의 작업에서 Claude Fable 5.1 수준"이고 Opus 5보다 실행 비용이 40% 적으며 출력 속도는 30% 이상 빠르다. Artificial Analysis의 Intelligence Index v4.3.2를 같은 운영자가 모든 추론 강도에서 돌린 결과는 기본 중간 설정 51.2, 최대 설정 57.6이었다. 작업당 비용은 각각 1.34달러와 5.98달러다.
GPT-6 Sol은 최대 설정에서 47.5, 작업당 1.06달러. 천장은 Anthropic이 약 10점 앞서지만 그 대가로 약 5.6배를 지불한다. OpenAI는 Sol이 Opus 5.5를 이긴다고 주장하지 않는다. 천장까지 갈 일이 드물다는 쪽에 걸고 있다.
안전은 이제 공시 경쟁
Opus 5.5는 대규모 정렬 테스트와 함께 METR, Frontier Design의 외부 평가를 거쳐 공개됐다. Anthropic은 격리 경계를 넘으려는 시도가 Opus 5나 Mythos 5.1보다 약 85% 줄었다고 밝혔다. OpenAI도 숫자를 냈다. 거부 회귀율은 Sol이 68%에서 64%로, Luna가 77%에서 42%로 개선됐고, 게시판을 모사한 테스트에서 Sol이 미승인 지시를 실행한 비율은 52%에서 11%로 떨어졌다. 둘 다 실질적인 개선이다. 다만 Sol과 Luna에는 출시 시점에 시스템 카드가 붙지 않았다.
어디서 돌아가나
Opus 5.5는 Claude API, Amazon Bedrock, AWS의 Claude Platform, Google Cloud, Microsoft Foundry에서 제공된다. Sol과 Luna는 OpenAI API 전용이며 ChatGPT Work와 Codex 유료 등급, 그리고 데스크톱 앱의 무료·Go 사용자용 Luna가 전부다. 아직 Chat에는 없다. 가용성은 Anthropic의 확실한 승리다.
판단
품질 대비 비용으로 라우팅한다면 물량 구간은 Sol, 긴 꼬리는 Luna다. 49개 작업 경로 검증에서 둘 다 49/49를 기록했고 비용은 Opus 5.5가 0.054달러, Sol이 0.016달러였다. 최고의 단일 결과가 필요하고 청구서가 남의 것이면 Opus 5.5다. 다만 CodeRabbit의 평가는 무거운 단서를 남겼다. 같은 입력에도 Opus 5.5의 출력 토큰이 약 50% 늘었고, 20% 인하는 청구서를 오히려 키울 수 있다. 반대로 24~48시간짜리 장기 코딩에서는 복잡한 버그 검출 수가 자사 기준선의 두 배였다.
퀵 스캔
- Anthropic의 연환산 매출이 1000억 달러를 넘었다. 두 달 만에 50% 증가다. IPO 목표는 11월이고 Astra 대응 모델도 검토 중이다.
- OpenAI는 투자자들에게 2030년까지 컴퓨트 지출이 8560억 달러, 잉여현금흐름은 마이너스 2780억 달러에 이를 것이라고 설명했다.
- NVIDIA는 분기 매출 가이던스를 1080억 달러로 제시했다(직전 962억 달러). Huang CEO는 버블 경고를 "종말론"이라고 일축했다.
- DeepSeek는 V4.1-Flash의 KV 캐시를 토큰당 890바이트로 줄였다. V1 대비 437분의 1이고 GPU당 동시 에이전트 세션이 4배가 된다. 8조 파라미터 모델 계획도 확인했다.
- 미국 하원은 Ratepayer Protection Act를 417대 3으로 통과시켰다. 대형 데이터센터가 전력망 증설 증분 비용 전액을 부담하는 내용이다.
- Meta는 프랑스~미국을 잇는 페타비트급 해저 케이블 Petal을 발표했다. xAI의 Grok 4.7(9월 21일)은 2달러·6달러를 유지하며 GitHub Copilot에 바로 들어갔다.
- OpenAI는 9월 22일 제3자 평가 원칙도 공개했다. Anthropic이 METR과 Frontier Design을 앞세운 바로 그날이다.
에디터의 시각
국내 개발자에게 이번 가격표가 던지는 질문은 다른 데 있다. Luna의 입력 0.10달러는 오픈웨이트를 국내 GPU에 직접 올려 쓰는 편이 싸다는 오랜 전제를 흔든다. 전기와 운영 인건비, 양자화 손실까지 넣으면 자체 호스팅이 유리한 구간이 눈에 띄게 줄어든다. 저는 '오픈웨이트가 곧 저비용'이라는 등식이 3개월 안에 국내 커뮤니티에서 다시 검증되지 않으면, 제 판단이 틀렸다고 보겠다. 반대로 Anthropic이 11월 상장 서류에 매출총이익률을 인하 전 기준으로 적어낸다면, 이 가격 경쟁은 전략이 아니라 증상이다. 다음에 지켜볼 것은 그 숫자 하나다.
로딩 중...