속보

Grok 4.7 공개, GPT-6 Sol 가격전 외: AI 뉴스 9월 24일

Grok 4.7 공개, GPT-6 Sol 가격전 외: AI 뉴스 9월 24일

이번 주의 본질은 벤치마크가 아니다

xAI가 일요일에 Grok 4.7을 내놓았고, 월요일에는 Anthropic이 Claude Opus 5.5를, OpenAI가 GPT-6 Sol과 Luna를 약 90분 간격으로 공개했다. 이틀 만에 프런티어 연구소 3곳, 기함 모델 3개. 내가 진짜 흥미롭게 본 건, 어느 곳도 "우리가 가장 빠르다"를 내걸지 않았다는 점이다. 셋 다 "안전"을 앞세웠다.

Grok 4.7 발표문은 코딩 점수만큼이나 "지금까지 가장 잘 맞춰진 안전 장치"에 지면을 할애한다. OpenAI의 Sol/Luna 자료는 거부 롤백률과 모의 게시판 테스트를 꺼낸다. Anthropic은 Opus 5.5를 공개 전 METR와 Frontier Design에 통과시켰다. 서로 경쟁한다는 이 연구소들이 전부 가드레일을 끌어안고 전장에 나타날 때, "경쟁"이라는 말은 안무된 것으로 보이기 시작한다.

나는 몇 주째 접근 계층과 평가 게이트는 안전이 아니라 상업적인 조절 밸브라고 써왔다. 이번 주는 그 증거로 가장 명백하다.

Grok 4.7: 가장 최신 도전자

xAI의 새 모델은 범용 기함이 아니라 코딩과 지식 작업 특화다. 사양은 구체적이다. 컨텍스트 50만 토큰, 텍스트·이미지 입력에 텍스트 출력, 출력 상한 없음, 추론 강도는 낮음/중간/높음(기본)/xhigh. 가격은 100만 토큰당 입력 2달러, 캐시된 입력 0.50달러, 출력 6달러(200k 미만), 그 이상은 2배. 고속 버전은 출력 속도 2배에 가격도 2배.

xAI가 공개한 수치(벤더 값으로 다루라)에서 CursorBench 4.0은 46.3%. Grok 4.6의 40.4%, Claude Fable 5.1 최대 51.8% 대비 코딩에서 Anthropic과의 격차를 좁혔지만 미치지 못했다. DeepSWE v1.1(높음)은 65.2%에서 71.0%로 상승. Terminal-Bench 4.0은 20.3%에서 38.0%로 도약——Fable의 57.9%에는 못 미치지만, 에이전트형 도구 조작에서 그동안 참패하던 모델의 큰 한 걸음이다. EEBench는 64.0%로 Fable의 56.4%를 앞선다.

봐야 할 건 안전 스택이다. xAI는 LatchBio 생물안전 점수 62.4%, HackerBench v0.3에서 고위험 이중용도 프롬프트 중 통과한 것은 3.3%라고 주장한다. 또 Grok Bot 하네스(에이전트 실행 환경)를 네이티브로 이해한다. 이것이 핵심이다. Grok 4.7은 채팅창에 앉으려는 게 아니라, 영속하는 클라우드 머신 위의 팀원으로 돌아가게 만들어졌다. Cursor, Grok Build, Grok API, 서드파티 하네스에서 즉시 제공.

가격전은 조연

모두가 요율표를 응시한다. Sol은 2달러·10달러, Luna는 0.10달러·0.50달러, Opus 5.5는 4달러·20달러. 나는 이걸 어제 다뤘다. 새로운 건 "조정"이다. 3사가 48시간 창 안에 기함을 떨어뜨리고, 각각 외부 평가자의 도장을 미리 받아둔다. 독립 평가가 규제의 사후 처리가 아니라 출하 기능이 되어가고 있다. OpenAI는 Anthropic이 METR을 내세운 바로 그날 "효과적인 제3자 평가 원칙"을 발표했다.

그것이 진짜 안전 문화의 변화인지, 분기 최고가 PR인지는 모르겠다. 내 돈은 "둘 다, 그리고 PR이 목적"에 걸린다.

퀵 스캔

  • 알리바바는 Qwen3.8-Max 0902 체크포인트를 갱신했다. 2.4조 파라미터, 100만 토큰 문맥, CodeArena는 22점 오른 1691에 가격 동결. Qwen3.8 27B도 함께 공개. (벤더 값)
  • Meta의 Muse Spark 1.3은 1.2 대비 토큰 사용 약 25%, 도구 호출 약 20%를 줄이고, 20명 이상 화자 식별을 갖춘 Muse Voice Transcribe를 추가한 것으로 전해진다. (보도값, 벤더 확인 요망)
  • 한 실무자 노트는 OpenAI가 오늘 9월 24일부로 Sora API를 중단한다고 쓴다. 하지만 OpenAI 뉴스 페이지에 9월 23일 시점 중단 공지는 없다. 벤더가 인정할 때까지 미확인으로 다룰 것.
  • Apple의 iOS 27.2 베타는 중국용 모션 데이터 제한을 추가해 '흔들어 광고를 여는' 동작을 무력화한다. 광고 테크와의 줄다리기가 여기까지 왔다는 작지만 시사하는 사인이다.

에디터의 시각

국내 개발자에게 이번 주가 던지는 질문은 따로 있다. Luna의 입력 0.10달러는 국내 GPU에 오픈웨이트를 직접 올려 쓰는 편이 싸다는 오래된 전제를 흔든다. 전기와 운영 인건비, 양자화 손실까지 넣으면 자체 호스팅이 유리한 구간이 눈에 띄게 줄어든다. 게다려야 할 건 성능표가 아니라 조달 경로다. 내 예측은 이렇다. 3개월 안에 이 3사 가운데 적어도 한 곳이 독립 감사 발표 이후 안전 관련 주장 하나를 조용히 수정할 것이다. 이번 주의 동시 출격은 경쟁이 아니라, 규제 당국을 향해 웃는 법을 배운 카르텔의 그것이다. 다음에 지켜볼 건 감사 로그 하나다.

스폰서 링크추천 AI 도구 보기

댓글 (0)

공유:XHatena

댓글 작성

로딩 중...