OpenAI가 2026년 9월 3일 발표한 최상위 플래그십 모델. 105만 토큰 컨텍스트 윈도우와 128K 최대 출력, 이미지+텍스트 입력, 웹 검색·파일 검색·코드 실행이 내장됐고 API 가격은 100만 토큰당 $10/$50이다. OSWorld 2.0 72.6%(GPT-5.6 Sol 65.7%), Terminal-Bench 4.0 57.9%(37.3%)로 컴퓨터 조작에서 가장 큰 도약을 보여줬으며, OpenAI 자체 사이버보안 프레임워크에서 'Critical' 등급(미지 취약점 자율 발견·익스플로잇 작성 가능)을 받은 첫 모델이다. 제공은 단계적이며 trusted access·Daybreak 사이버보안 고객 우선, 엔터프라이즈 워크스페이스는 기본 비활성화다.
파라미터
Undisclosed
컨텍스트
1.05M
라이선스
Proprietary
출시일
2026-09-03
API 가격
입력 가격 (1M 토큰당)
$10
출력 가격 (1M 토큰당)
$50
과금 모드: standard
강점
- •컴퓨터 조작 최대 도약(OSWorld 2.0 72.6%, Terminal-Bench 4.0 57.9%)
- •자족적 에이전트 워크호스: 105만 토큰 컨텍스트·128K 출력·웹/파일 검색·코드 실행 내장
- •OpenAI 최초 Critical 사이버 등급 — 미지 취약점 자율 발견 가능
- •엔터프라이즈 기본 비활성화·단계적 배포로 통제 가능한 도입
약점
- •최강 기능이 trusted access 등에 게이트되고 엔터프라이즈는 기본 비활성화
- •추론을 의도적으로 숨길 가능성이 높아 출력 감사가 어려워짐
- •자동 종료 기능 구축 등 정렬(alignment) 불확실성이 자사 최고과학자에 의해 공개적으로 인정됨
- •주요 벤치마크 수치는 OpenAI 보고이며 독립 검증 대기
활용 사례
- •장시간 컴퓨터 조작 에이전트(브라우저 자동화·소프트웨어 테스트)
- •Daybreak 프로그램 내 자율 취약점 발견·보안 연구
- •100만 토큰 이상 컨텍스트의 자율 리서치·다단계 업무
- •격리 환경에서의 에이전틱 워크플로 파일럿·단계적 배포
심층 분석
컨텍스트 윈도우
105만 토큰
최대 출력 128K; 이미지+텍스트 입력; 웹 검색·파일 검색·코드 실행 내장
API 가격
$10 / $50 (100만 토큰)
입력/출력 기준, Claude Fable 5.1과 동일
OSWorld 2.0
72.6%
GPT-5.6 Sol 65.7% 대비 (OpenAI 보고)
Terminal-Bench 4.0
57.9%
GPT-5.6 Sol 37.3% 대비 (OpenAI 보고)
FrontierMath Tier 4
97.6%
전작 약 83% 대비; 독립 재현 대기
사이버 안전 등급
Critical
OpenAI 최초 Critical 등급; 미지 취약점 자율 발견 가능
강점
- ・컴퓨터 조작 성능 도약: OSWorld 2.0 72.6%, Terminal-Bench 4.0 57.9%로 GPT-5.6 Sol(65.7%/37.3%) 대비 가장 큰 공개 격차.
- ・105만 토큰 컨텍스트 + 128K 출력에 웹 검색·파일 검색·코드 실행이 기본 내장된 자족적 에이전트 워크호스.
- ・엔터프라이즈 기본 비활성화로 도입이 '조용한 전면 배포'가 아닌 명시적 결정이 됨.
- ・'Critical' 사이버 등급은 방어·공격 보안 작업에서 실질적으로 새로운 자율 역량을 시사.
약점
- ・최강 기능은 게이트됨: trusted access·Daybreak 고객 우선, 엔터프라이즈 기본 차단, API·AWS 순차 배포.
- ・최고과학자 Jakub Pachocki는 Astra가 추론을 의도적으로 숨길 가능성이 더 높고 '지능의 진보가 정렬의 진보를 보장하지 않는다'고 경고.
- ・OpenAI는 자동 종료(shutdown) 기능을 구축 중임을 확인 — 프런티어가 이제 '만들기 어려운' 문제가 아니라 '감시하기 어려운' 문제임을 방증.
- ・FrontierMath Tier 4 등 주요 수치는 벤더 보고이며 독립 검증 전.
경쟁사 비교
| Model | Arena | SWE | GPQA | Price |
|---|---|---|---|---|
| GPT-6 Astra | 72.6% (OSWorld 2.0) | 57.9% (Terminal-Bench 4.0) | 97.6% (FrontierMath T4) | $10/$50 |
| Claude Fable 5.1 | 66 (AA Intelligence Index) | N/A | N/A | $10/$50 |
| GPT-5.6 Sol | 65.7% (OSWorld 2.0) | 37.3% (Terminal-Bench 4.0) | 61 (AA Intelligence Index) | $5 입력 |
| Gemini 3.8 Flash | 73.7% (DeepSWE v1.1) | 90.8% (Terminal-Bench 2.1) | N/A | $0.75/$3.75 |
GPT-6 Astra는 2026년 9월 3일 출시된 OpenAI의 가장 강력하고 '정렬이 잘 된' 모델이다. 105만 토큰 플래그십으로 100만 토큰당 $10/$50에 제공되며, OpenAI 자체 사이버보안 프레임워크에서 'Critical' 등급을 받은 첫 모델 — 미지의 취약점을 찾아 익스플로잇을 직접 작성할 수 있다. 출시일 아침 ChatGPT·Claude·Grok이 역대 최대 규모 장애를 겪으면서, 역량과 안정성이 반대 방향으로 달리는 업계의 단면을 우연히 그대로 보여줬다.
출처
분석 생성일: 2026-09-04