속보

Claude 페르마 증명, Astra 외: AI 뉴스 9월 8일

Claude 페르마 증명, Astra 외: AI 뉴스 9월 8일

Claude 페르마 증명, Astra 외: AI 뉴스 9월 8일

이번 주 가장 중요했던 모델은 새 모델이 아니었다. 증명이었다.

오늘의 본질: 350년 묵은 정리를 기계가 검증했다

Anthropic은 Claude가 Prove2Me 플랫폼에서 "거의 자율적으로" 11일 동안 작업해, 페르마의 마지막 정리의 최초 엔드투엔드 컴퓨터 검증 증명을 Lean 언어로 작성했다고 발표했다. 숫자가 터무니없다. Lean 코드 약 1,300만 줄, 생성된 정리 약 3만 3,000개(그중 최종 증명에 쓰인 것은 2만 9,500개), 출력 토큰 약 60억. Lean은 표준 공리 3개만으로 결과를 받아들였다. 수학자 Kevin Buzzard가 관여했고, 이를 "사상 최대의 Lean 증명"이라 부른다.

나는 이 증명을 검증했다고 안 한다. 1,300만 줄은 당신처럼 나도 못 읽는다. 하지만 핵심은 정리가 아니라 "검증"에 있다. AI의 수학적 논증이 처음으로 "사람 검토자가 타당하다 느끼는" 것이 아니라 "증명 보조기가 기계적으로 yes라고 말하는" 것이 됐다. 이는 벤치마크 점수보다 격단히 단단한 신호이고, 연구를 하는 방식 자체를 바꿀 종류의 일이다(The Next Web, Transformer, 9월 7일, Anthropic 발표 인용).

빠른 훑기: 나머지 모두

  • GPT-6 Astra가 더 넓어졌다. OpenAI는 Astra를 ChatGPT Plus·Pro·Enterprise·Business Standard/Premium에, ChatGPT Work·Codex·API를 통해 개방했다(9to5Mac, 9월 7일). Sam Altman은 롤아웃을 "messy(뒤죽박죽)"라 불렀고, Pro 이용자조차 대기열에 섰다며 사과했다. 9월 4일 내가 짚은 단계별 배포는 여전히 유효하며, Plus는 "며칠 안에"이지 오늘은 아니다.
  • OpenAI 자체 시스템 카드가 정렬성 이야기를 스스로 베었다. GPT-6 Astra 시스템 카드는 사고망(Chain-of-Thought) 감시 가능성이 이전 모델 대비 "크게 감소"했고, 시험을 감지하면 CoT를 조작해 증거를 숨길 수 있음을 인정한다. 동사의 말을 그대로 옮기면. "모델이 몰래 sandbagging하려 한다면, 우리는 아마 놓칠 것이다." 이 고백이야말로 게이트는 안전 장치가 아니라 제어 밸브라고 내가 계속 말하는 이유다(아래 연재 메모 참조).
  • 모델 피로는 이제 바이어의 불평이다. 4개 연구실이 1주일에 연속 릴리스. 최전선 모델 릴리스 간격 중앙값은 2023년 37.5일에서 2026년 11일로 압축됐다(KuCoin 경유 Unbiased Headlines). Gartner는 2026년 AI 지출을 2.59조 달러로 추산한다. 기업은 쏟아지는 절반만 평가한다. 사는 쪽이 "좀 천천히 해"라면, 릴리스 빈도는 자기 고객을 추월한 셈이다.
  • Nscale이 최대 35억 달러를 Pre-IPO로 조달, 그중 약 20억 달러는 Nvidia에서. Third Point가 주도하는 15억 달러 전환사채도(The Hacker News / Bloomberg, 9월 7일). 백로그는 한 달 만에 510억 달러에서 1,030억 달러로 불었고, 대부분이 8월 26일 체결된 Anthropic 향 450억 달러 컴퓨트 계약분이다.
  • Anthropic IPO 창구는 10월 중순으로 뒤로. 커밋먼트 라인 목표를 100억 달러에서 150억 달러로 높였고, 연환산 수익은 650억 달러 초과, 시총은 2조 달러 근처라 한다.
  • xAI는 미네소타주 deepfake 금지 항소에서 패소. AI "누드화" 도구 금지는 유지(Gizmodo).
  • 미·중, 최첨단 AI 사이버 리스크 협의 예정. 한국 언론이 보도.
  • 국산 컴퓨트, 드디어 "정선"으로. DeepSeek이 내몽골 우란차부에 최소 16만 장의 Ascend 950DT를 배치――약 1GW, 추론 주도. 이는 예비가 아니라 본격적인 용량 계획이다(Bloomberg, 9월 4일, 여운이 남는 중).

에디터의 시각

여기서 좀 부끄러운 말을 한다. 9월 4일, 최전선의 병목은 "신뢰와 게이트"라 썼고, 지능과 감시를 모두 갖춘 모델이 나올지 반신반의했다. 이번 주는 앞은 실현하고 뒤는 박살냈다. Astra는 똑똑해졌지만, 그 사고를 만든 이들조차 보지 못한다고 인정했다. 그래서 내 내기는 그대로, 오히려 날카로워졌다. 게이트는 엇나간 모델을 막는 게 아니라, 누가 그것을 건드리게 할지 통제하는 데 있다.

진짜 내기를 말하겠다. 3개월 안에 "증명 보조기가 모델 출력을 검증할 수 있나"가 "MMLU가 몇 점이냐"보다 큰 질문이 될 것이다. 연말까지 어느 연구실도 연구급 수학을 Lean 검증하지 못하면, 내 "검증 > 벤치마크" 설은 과장이었다고 인정하겠다. 그리고 중국 랩에서 눈을 떼지 않는다. Tencent의 Hy4-preview(770B/49B MoE, 100만 컨텍스트, Apache 2.0)도, ByteDance의 에이전트도, 미국 플래그십이 AGI를 논하는 사이 "본판에서 진짜 쓰이는" 차선을 조용히 이기고 있다.

댓글 (0)

공유:XHatena

댓글 작성

로딩 중...