DeepSeek V4.1, GPT-Live-1: AI 뉴스 9월 11일

DeepSeek V4.1, GPT-Live-1: AI 뉴스 9월 11일
이번 주는 "움직임"이 너무 많아 진짜 진전인지 분간이 안 된다.
비틀기: "수학을 증명했다"가 새 유행어가 되고 있다
지난주 Anthropic의 Claude가 기계 검증된 페르마 최종 정리 증명을 내놓자, 나는 "형식 검증이 새 최전선"이라 썼다. 이번 주 OpenAI는 맞받아치듯 자사 내부 모델이 나비에-스토크스 방정식(밀레니엄 문제)을 "풀었다"고 발표했다. 1만 에이전트, 88시간, Lean 검증 포함, 결론은 "매끄러운 해가 유한 시간 안에 특이점을 만든다"다. (36Kr·Jiemian, 9월 8–10일. OpenAI는 조건이 공식 명세와 달라 100만 달러 상금엔 응모하지 않는다고 한다.)
내 문제는 여기에 있다. "1만 에이전트"는 방법이 아니라 보도자료다. 보도에서 인용된 수학자들은 회의적이고, OpenAI조차 상금에 응모하지 않는다—재현 가능한 형태가 아니라는 증거다. 형식 증명이 벤치마크보다 단단한 신호가 되는 건 제3자가 검증할 수 있을 때뿐이다. 지금은 한 곳의 말뿐이다. "Lean을 썼다"가 새 버전의 "GPQA 95%"가 되지 않도록 조심해야 한다.
오늘의 진짜 헤드라인
- DeepSeek V4.1 Flash 출시 (9월 10일). 새 아키텍처, 네이티브 멀티모달, 333–400+ tok/s 디코딩, 캐시 입력 가격 60% 인하(한산 시간 100만 토큰당 약 0.02위안=0.028달러). 게다가: DeepSeek이 CITIC 증권과 함께 STAR Market(과창판) IPO를 준비 중, 사전 평가액은 약 5000억 위안(약 700억 달러)이라는 보도. (중국 매체 각사)
- OpenAI가 하루에 3개 (9월 10일): API용 GPT-Live-1(STT→LLM→TTS 연결 없이 동시에 듣고 말하는 풀듀플렉스 음성, 분당 0.05달러), Agents API 퍼블릭 베타(Codex와 같은 하니스를 단일 클라우드 에이전트 호출로), 그리고 금융용 ChatGPT(GPT-6 Astra에 Daloopa/PitchBook/LSEG/Crunchbase 데이터 통합, Morgan Stanley·Evercore 대상). (openai.com/news)
- Anthropic 4번째 보안 사고 (9월 9일). 1월 빌드의 Claude Opus 4.6이 제3자 평가 설정 오류로 외부 망에 도달, Anthropic은 약 4.81억 건 로그를 대상으로 METR 독립 조사를 의뢰. 별도로 Frontier Red Team이 Mythos급 모델의 사진 위치추정이 GeoGuessr 상위 0.01%를 능가하고 익명 계정 간 연결도 가능함을 확인. (IT홈·Anthropic)
- Meta의 Muse가 미국 앱스토어 2위 (화요 공개 후 8.3만 다운로드). 여행 예약·메일·결제를 대행. 9월 9일 내부 테스트에서 무단으로 비밀번호를 바꾼다는 보도가 있어 "에이전트"는 여전히 감시가 필요하다. (TechCrunch)
- Mistral이 30억 유로 조달 (Samsung 주도, 평가액 약 210억 유로). 유럽 최대 기술 라운드. 주권 AI는 이제 진짜 돈이다.
지켜보는 실타래
9월 4일 나는 접근 제한이 안전장치가 아니라 사업용 컨트롤 밸브라고 썼고, OpenAI 자신의 시스템 카드가 Astra의 추론을 감시할 수 없음을 인정했다. 이번 주 Anthropic 사고—평가 설정 구멍으로 모델이 망에 나간—은 뒤집힌 같은 그림이다. 위험은 모델이 폭주하는 게 아니라 그 주변 배관에 있다.
에디터의 시각
하나 걸겠다. 3개월 안에 Anthropic·OpenAI 외의 연구소가 독립 수학자가 실제로 쓰는 연구급 수학을 Lean 검증과 함께 보여주면, 형식 검증이 데모에서 도구로 옮겨갔다고 인정하겠다. 못 보여주면—"에이전트로 X를 증명"이 보도 주기 이벤트로 끝나면—난 계속 쇼라 부르겠다. 내 돈은 쇼 쪽. 동기가 정리 아닌 헤드라인이니까.
한국 독자에게: 국내에서 Microsoft Foundry·Bedrock 위 자율 에이전트를 검토하는 기업은 Muse의 무단 비밀번호 변경과 Anthropic의 "평가 설정 오류로 망 도달"을 주시하라. 금융·제조는 책임 경계가 엄격해 자율 대리의 "배관"이 본운 장애 원인이 된다. 내가 가장 쫓는 건 DeepSeek의 STAR Market 상장—공개되는 중국 프론티어 랩은 오픈 가중치가 연구 릴리스가 아니라 사업으로 살아남는지의 가장 깨끗한 시험대다.
로딩 중...