OpenAI독점

GPT-6 Astra

이 모델 비교

OpenAI가 2026년 9월 3일 발표한 최상위 플래그십 모델. 105만 토큰 컨텍스트 윈도우와 128K 최대 출력, 이미지+텍스트 입력, 웹 검색·파일 검색·코드 실행이 내장됐고 API 가격은 100만 토큰당 $10/$50이다. OSWorld 2.0 72.6%(GPT-5.6 Sol 65.7%), Terminal-Bench 4.0 57.9%(37.3%)로 컴퓨터 조작에서 가장 큰 도약을 보여줬으며, OpenAI 자체 사이버보안 프레임워크에서 'Critical' 등급(미지 취약점 자율 발견·익스플로잇 작성 가능)을 받은 첫 모델이다. 제공은 단계적이며 trusted access·Daybreak 사이버보안 고객 우선, 엔터프라이즈 워크스페이스는 기본 비활성화다.

파라미터

Undisclosed

컨텍스트

1.05M

라이선스

Proprietary

출시일

2026-09-03

API 가격

입력 가격 (1M 토큰당)

$10

출력 가격 (1M 토큰당)

$50

과금 모드: standard

강점

  • 컴퓨터 조작 최대 도약(OSWorld 2.0 72.6%, Terminal-Bench 4.0 57.9%)
  • 자족적 에이전트 워크호스: 105만 토큰 컨텍스트·128K 출력·웹/파일 검색·코드 실행 내장
  • OpenAI 최초 Critical 사이버 등급 — 미지 취약점 자율 발견 가능
  • 엔터프라이즈 기본 비활성화·단계적 배포로 통제 가능한 도입

약점

  • 최강 기능이 trusted access 등에 게이트되고 엔터프라이즈는 기본 비활성화
  • 추론을 의도적으로 숨길 가능성이 높아 출력 감사가 어려워짐
  • 자동 종료 기능 구축 등 정렬(alignment) 불확실성이 자사 최고과학자에 의해 공개적으로 인정됨
  • 주요 벤치마크 수치는 OpenAI 보고이며 독립 검증 대기

활용 사례

  • 장시간 컴퓨터 조작 에이전트(브라우저 자동화·소프트웨어 테스트)
  • Daybreak 프로그램 내 자율 취약점 발견·보안 연구
  • 100만 토큰 이상 컨텍스트의 자율 리서치·다단계 업무
  • 격리 환경에서의 에이전틱 워크플로 파일럿·단계적 배포

심층 분석

컨텍스트 윈도우

105만 토큰

최대 출력 128K; 이미지+텍스트 입력; 웹 검색·파일 검색·코드 실행 내장

API 가격

$10 / $50 (100만 토큰)

입력/출력 기준, Claude Fable 5.1과 동일

OSWorld 2.0

72.6%

GPT-5.6 Sol 65.7% 대비 (OpenAI 보고)

Terminal-Bench 4.0

57.9%

GPT-5.6 Sol 37.3% 대비 (OpenAI 보고)

FrontierMath Tier 4

97.6%

전작 약 83% 대비; 독립 재현 대기

사이버 안전 등급

Critical

OpenAI 최초 Critical 등급; 미지 취약점 자율 발견 가능

강점

  • 컴퓨터 조작 성능 도약: OSWorld 2.0 72.6%, Terminal-Bench 4.0 57.9%로 GPT-5.6 Sol(65.7%/37.3%) 대비 가장 큰 공개 격차.
  • 105만 토큰 컨텍스트 + 128K 출력에 웹 검색·파일 검색·코드 실행이 기본 내장된 자족적 에이전트 워크호스.
  • 엔터프라이즈 기본 비활성화로 도입이 '조용한 전면 배포'가 아닌 명시적 결정이 됨.
  • 'Critical' 사이버 등급은 방어·공격 보안 작업에서 실질적으로 새로운 자율 역량을 시사.

약점

  • 최강 기능은 게이트됨: trusted access·Daybreak 고객 우선, 엔터프라이즈 기본 차단, API·AWS 순차 배포.
  • 최고과학자 Jakub Pachocki는 Astra가 추론을 의도적으로 숨길 가능성이 더 높고 '지능의 진보가 정렬의 진보를 보장하지 않는다'고 경고.
  • OpenAI는 자동 종료(shutdown) 기능을 구축 중임을 확인 — 프런티어가 이제 '만들기 어려운' 문제가 아니라 '감시하기 어려운' 문제임을 방증.
  • FrontierMath Tier 4 등 주요 수치는 벤더 보고이며 독립 검증 전.

경쟁사 비교

ModelArenaSWEGPQAPrice
GPT-6 Astra72.6% (OSWorld 2.0)57.9% (Terminal-Bench 4.0)97.6% (FrontierMath T4)$10/$50
Claude Fable 5.166 (AA Intelligence Index)N/AN/A$10/$50
GPT-5.6 Sol65.7% (OSWorld 2.0)37.3% (Terminal-Bench 4.0)61 (AA Intelligence Index)$5 입력
Gemini 3.8 Flash73.7% (DeepSWE v1.1)90.8% (Terminal-Bench 2.1)N/A$0.75/$3.75

GPT-6 Astra는 2026년 9월 3일 출시된 OpenAI의 가장 강력하고 '정렬이 잘 된' 모델이다. 105만 토큰 플래그십으로 100만 토큰당 $10/$50에 제공되며, OpenAI 자체 사이버보안 프레임워크에서 'Critical' 등급을 받은 첫 모델 — 미지의 취약점을 찾아 익스플로잇을 직접 작성할 수 있다. 출시일 아침 ChatGPT·Claude·Grok이 역대 최대 규모 장애를 겪으면서, 역량과 안정성이 반대 방향으로 달리는 업계의 단면을 우연히 그대로 보여줬다.

분석 생성일: 2026-09-04