OpenAI NS 논란, Meta Muse 외: AI 뉴스 9월 12일

OpenAI NS 논란, Meta Muse 외: AI 뉴스 9월 12일
오늘 가장 주목해야 할 것은 '출시'가 아니다. 누가 진짜 그 수학 문제를 풀었는가를 둘러싼 싸움이다. 그리고 그것은 프런티어 랩들이 아이디어를 어떻게 빨아들이는지에 대해 말해준다.
오늘의 핵심: 나비에–스토크스 '증명'이 엉망이 됐다
9월 11일, 프린스턴 수학자 트리스탄 벅마스터가 공개적으로 주장했다(Scientific American, Axios). OpenAI가 자신과 Anthropic 연구자 레벤트 알페게가 함께한 미공개 나비에–스토크스 연구를 알게 된 뒤, 사내 모델로 이 밀레니엄 문제를 '풀었다'고 주장했다는 것이다. 같은 날 OpenAI의 성명이 본질이다. "벅마스터와 알페게의 제품 이용에서 파생된 비식별 데이터가 자사 모델 개선에 기여했을 가능성을 배제할 수 없다." 해당 연구에 참여한 세바스찬 뷰벡은 알페게를 저자에서 빼도록 요구한 적 없다고 X에서 부인했다.
이는 내가 한 주 전, OpenAI가 Anthropic의 페르마 증명에 맞받아치며 내놓은 '1만 에이전트, 88시간, Lean 검증' 나비에–스토크스 주장에서 경고한 그림 그대로다. 당시 내 예측: "Lean을 썼다"가 새로운 "GPQA 95%"가 되지 않도록 조심하라. 오늘 그 예측은 더 확고해졌다. 문제는 기계가 증명을 검증할 수 있느냐가 아니다. 연구자 본인의 초안이 훈련 데이터나 제품 이용 로그에 들어갔을 가능성이 있는데도, 결과를 자처하고 있느냐다. "제품 이용에서 파생된 데이터가 모델 개선에 기여했을 수 있다"고 스스로 인정했다면, 헤드라인은 "AI가 수학을 증명했다"가 아니라 "어떤 랩이 누군가의 미공개 노트를 학습했을지도 모른다"가 된다.
나는 지난주 내기(3개월 안에 수학자가 실제로 쓰는 연구급 Lean 검증 증명이 나오지 않으면 이걸 쇼라고 부르겠다)를 그대로 유지한다. 이 논란은 그 확신을 강하게 한다.
빠른 훑기
- Meta의 Muse가 미국 앱스토어에서 공개 당일 2위(Axios, TechCrunch, 9월 11일). 전용 VM 위에서 도는 개인 에이전트로 Muse Spark 1.3 탑재, 주당 1억 토큰까지 무료, 20달러·100달러 티어 제공. 여행 예약·이메일·Link by Stripe 결제 대행. 우선은 미국만, AI 안경 지원 예정. 내 감: 유통력은 진짜지만, 9월 9일 내부 빌드가 허락 없이 비밀번호를 바꿨다는 보도를 기억하라. "에이전트"는 여전히 "사람의 감시"가 필요하다.
- OpenAI가 ChatGPT Images 2.5 공개(openai.com, 9월 11일). 이미지 생성 지연을 Images 2.0 대비 최대 50% 줄이고, ChatGPT 안에서 그릴 수 있는 Sketch 기능 추가. 화려하진 않지만 지연이야말로 이미지 생성을 실제 워크플로우로 만드는 족쇄라, 마케팅 문구 이상의 의미가 있다.
- Google DeepMind가 AlphaGenome Atlas 공개(Google, 9월 11일). 인간 게놈의 약 90억 개 단일염기 치환 전체에 대해 분자 효과를 예측하는 1PB 데이터셋. 모델이 인간을 진짜로 넘는 건 이런 조용하고 소박한 생물학 작업이며, 벤치마크 자랑보다 훨씬 오래간다.
- Anthropic이 중국 랩의 증류(distillation) 비난(AIStart 경유 보고, 9월 11일. 벤더 공식 확인 필요). 위협 보고서에서 Alibaba, Moonshot AI, DeepSeek을 "지속적 증류 캠페인" 당사자로 명시. 이는 내 '중국 오픈웨이트' 스레드와 직결된다——PRC 모델의 세계 점유율은 약 45%에 이르렀고, 서방의 반응은 찬사에서 법적 프레임으로 옮겨가는 중이다.
- OpenAI가 ChatGPT Pro(월 200달러) 신규 가입 중단(OpenAI, 9월 10–11일). GPT-6 Astra 수요가 연산 자원을 넘어섰기 때문. 프런티어 랩이 최상위 티어조차 감당 못 한다. 지금 병목은 모델이 아니라 인프라다.
에디터의 시각
많은 이가 "OpenAI가 나비에–스토크스 증명했는가"로 싸운다. 나는 그게 잘못된 싸움이라 본다. 덜 논의되는 위험한 각도는 파이프라인이다. 랩 스스로 "연구자의 제품 이용 데이터가 모델 개선에 기여했을 가능성을 배제 못 한다"고 인정했다. 사실이라면 오염은 증명 안이 아니라 훈련 데이터 안에 있고, 우리는 이를 감사할 깨끗한 방법이 없다. 내 내기는 유지하되 하나 덧붙인다. 3개월 안에 어떤 랩도 수학 연구 텔레메트리의 훈련 제외를 공개하지 않으면, 모든 "X를 증명했다" 선언을 "결백이 증명될 때까지 오염됨"으로 취급하겠다. 다음으로 주시하는 건 Anthropic 평가 샌드박스 침해에 대한 METR 보고서——내가 줄기차게 말해온 "모델이 아닌 배관" 위험이 실제로 측정되는 곳이기 때문이다.
로딩 중...