개요
GPT-5.6 Terra는 OpenAI가 2026년 7월 9일에 공개한 GPT-5.6 제품군의 중간 티어 균형형 모델이다. "합리적인 기본값"으로 포지셔닝됐으며, 이전 세대 플래그십인 GPT-5.5와 경쟁할 만한 성능을 정확히 절반의 토큰 비용(100만 토큰당 입력 $2.50, 출력 $15)에 제공한다. 핵심 가치 제안은 일상적인 업무, 코딩, 에이전트 워크플로를 위한 비용 효율적 지능이다. OpenAI는 Sol이 과한 작업, Luna로는 부족한 작업 사이의 "일상 업무" 구간을 Terra가 담당하도록 설계해 워크로드 강도에 따른 3단계 제품 전략을 완성했다.
벤치마크 결과는 이 균형형 포지셔닝을 그대로 보여준다. Agents' Last Exam, Terminal-Bench 같은 주요 에이전트·코딩 지표에서 GPT-5.5에 거의 근접하거나 앞서면서 비용 효율은 크게 앞선다. Artificial Analysis의 독립 분석도 Terra가 중간 티어에서 지능 대비 비용의 새로운 파레토 프런티어를 형성한다고 확인했다. 다만 가장 복잡한 과제의 절대 상한은 플래그십 Sol에 양보하며, 일부 순수 수학 평가에서는 오히려 이전 세대에 뒤진다. 이 모델은 또한 OpenAI 최초의 캐시 쓰기 요금을 도입해, 프리픽스가 반복되는 애플리케이션에서 비용 예측 가능성을 높였다.
출시 이후에는 Terra가 진짜 성능 도약인지, 아니면 Sol을 증류해 비용을 최적화한 버전인지에 대한 논쟁이 이어졌다. 대부분의 에이전트·코딩 과제에서 GPT-5.5 대비 개선은 실재하지만 회의적인 시선은 남아 있다. 그럼에도 Terra는 전략적으로 중요하다. OpenAI가 대량 처리용 Luna 파이프라인부터 프런티어급 Sol 과제까지 전 구간에서 가격 대비 성능으로 공세를 펼 수 있게 해주며, Anthropic·Google 같은 경쟁사에 맞선 시장 입지를 굳혀준다.
벤치마크 및 성능
### 벤치마크 종합
GPT-5.6 Terra는 절반 비용으로 GPT-5.5를 에이전트·코딩 지표에서 꾸준히 앞서는 균형 잡힌 성능을 낸다.
| 분류 | 벤치마크 | GPT-5.6 Terra | 주요 비교 |
| :--- | :--- | :--- | :--- |
| **에이전트** | Agents' Last Exam | 50.4% | GPT-5.5(46.9%), Claude Opus 4.8(45.2%) 상회 |
| **코딩** | AA 코딩 에이전트 지수 | 77.4 | Claude Fable 5(77.2)와 대등, GPT-5.5(76.4) 상회 |
| **코딩** | SWE-Bench Pro | 63.4% | GPT-5.5(59.4%) 상회, Fable 5(80.3%)에 열세 |
| **터미널** | Terminal-Bench 2.1 | 87.4% | GPT-5.5(85.6%) 상회, Sol(88.8%)에 근소 열세 |
| **브라우징** | BrowseComp | 87.5% | GPT-5.5(84.4%), Opus 4.8(84.3%) 상회 |
| **컴퓨터 조작** | OSWorld 2.0 | 50.2% | GPT-5.5(47.5%) 상회, Sol(62.6%)·Opus 4.8(54.8%)에 열세 |
| **과학** | GeneBench Pro | 23.3% | GPT-5.5(12%) 대비 큰 폭 개선 |
| **복합 지표** | AA 인텔리전스 지수 | 55 | GPT-5.5(54.8) 상회, Sol(58.9)·Fable 5(59.9)에 열세 |
| **수학** | FrontierMath Tier 4 (v2) | 68.3% | GPT-5.5(72.5%)에 열세 |
| **장문 컨텍스트** | MRCR v2 (512K-1M) | 72.5% | GPT-5.5(74%)와 비슷 |
**해석 포인트:**
1. **비용 대비 성능이 핵심이다.** AA 인텔리전스 지수 기준 Terra(max)의 과제당 비용은 약 $0.55로 Sol보다 약 50% 저렴하다.
2. **에이전트 영역에서 세대 교체가 성립한다.** Agents' Last Exam, BrowseComp, OSWorld 등 모든 에이전트 지표에서 이전 플래그십 GPT-5.5와 대등하거나 앞서면서 비용은 절반이다.
3. **코딩 경쟁력이 확실하다.** 코딩 에이전트 지수에서 Claude Fable 5와 동률이고, 터미널·저장소 과제에서 GPT-5.5 대비 뚜렷한 개선을 보였다.
4. **특정 영역의 약점.** 최고 난도 수학 구간(FrontierMath Tier 4)은 이전 세대 GPT-5.5가 여전히 우위를 지키는 몇 안 되는 지점이다.
상세 비교
### 경쟁 모델과의 비교
| 항목 | GPT-5.6 Terra | GPT-5.5 (이전 플래그십) | Claude Fable 5 | GPT-5.6 Sol (플래그십) |
| :--- | :--- | :--- | :--- | :--- |
| **주 역할** | 균형형 비용 효율 상시 모델 | 이전 세대 플래그십 | 프런티어 지능 모델 | 최상위 에이전트·추론 |
| **API 가격 (입력/출력, 100만 토큰)** | $2.50 / $15.00 | $5.00 / $30.00 | 약 $10.00 / $50.00 | $5.00 / $30.00 |
| **컨텍스트 길이** | 105만 토큰 | 100만 토큰 | 20만 토큰 | 105만 토큰 |
| **강점** | 대부분의 코딩·에이전트 과제에서 최고의 가성비, 높은 신뢰성, 양호한 지연 | 검증된 성능, 강한 학술 점수(GPQA, FrontierMath) | 순수 코드 생성(SWE-Bench)과 종합 지능 지수 최고점 | 터미널 작업, 브라우징, 컴퓨터 조작, 사이버 보안, 최대 추론 |
| **약점** | 최고 난도 수학에 열세, 증류형 중간 티어라는 인식 | 비슷한 에이전트 성능에 비용은 2배 | 상당히 높은 비용, 에이전트 과제 효율 낮음 | 최상위 가격대, 단순 작업에는 과함 |
| **적합 용도** | 프로덕션 코딩, 대부분의 에이전트 워크플로, 비용 민감한 스케일링 | 일관성이 중요한 레거시 시스템 | 저장소 단위 코드 생성, 고위험 분석 | 가장 복잡하고 장기적인 고위험 에이전트 작업과 리서치 |
**핵심 정리.** Terra의 경쟁 우위는 **GPT-5.5 성능의 약 90~95%를 50% 비용으로**, 그리고 **다수 과제에서 Sol 성능의 약 95%를 50% 비용으로** 제공한다는 점이다. 프런티어 프리미엄을 지불하지 않으면서도 강력하고 안정적인 AI가 필요한 팀에게 최적의 중간 지점이다. Anthropic 대비로는 에이전트 워크로드 진입 비용이 크게 낮지만, 정밀한 코드 생성 벤치마크에서는 Claude Fable 5가 여전히 우위를 유지한다.
커뮤니티 평가
GPT-5.6 Terra에 대한 개발자와 연구자 반응은 **가치 제안에는 신중한 낙관, 진전의 성격에는 회의**가 공존하는 양상이다.
* **긍정적 평가.** Sol/Terra/Luna로 나뉜 명확한 티어 전략과 Terra의 가격 대비 성능비를 높이 사는 의견이 많다. Cursor, Lovable 같은 도구에서 조기 도입한 사용자들은 실질적인 효율 개선(단계 수 25% 감소, 도구 호출 35~48% 감소)을 보고했다. 대부분의 프로덕션 코딩과 에이전트 작업에서 Terra가 새로운 합리적 기본값이 되어, 굳이 플래그십을 기본으로 둘 필요가 없어졌다는 정서가 형성됐다.
* **회의와 비판.** Hacker News나 Reddit 같은 포럼에서는 Terra가 진짜 새로운 모델인지 아니면 Sol의 증류판인지를 두고 논쟁이 이어졌다. 대부분의 에이전트 과제에서 이기면서도 어려운 수학 문제에서는 GPT-5.5에 지는 벤치마크 결과가 이런 의구심을 키웠다. OpenAI가 제공한 벤치마크를 넘어서는 독립적인 실사용 평가를 요구하는 목소리가 꾸준하다.
* **실무 채택 방식.** 커뮤니티는 라우팅 전략을 활발히 다듬고 있다. Braintrust 평가에서 도출된 공감대는 **분해된 하위 과제와 일상 업무의 기본값으로 Terra를 쓰고**, 가장 어려운 계획·추론 단계에서만 Sol로 에스컬레이션하는 것이다. 다만 일반 ChatGPT에서는 선택할 수 없고 Work, Codex, API에 한정된다는 점이 일반 사용자에게는 제약으로 지적된다.
활용 사례
### GPT-5.6 Terra가 잘 맞는 용도
**1. 프로덕션급 에이전트 코딩 워크플로**
* **예시:** Codex나 Cursor 같은 AI 코딩 어시스턴트로 여러 파일에 걸친 신규 기능 구현, 리팩터링, 테스트 작성을 수행하는 작업.
* **선택 이유:** Terminal-Bench 2.1에서 87.4%로 Sol의 88.8%에 근접하면서 비용은 절반이다. 하루 수백 건의 에이전트 작업을 돌리는 팀이라면 품질 저하 없이 큰 폭의 비용 절감을 얻는다. CodeRabbit은 "1차 구현, 리뷰 분류, 범위가 정해진 수정에 이상적이며 필요 시 Sol로 에스컬레이션"이라고 평가했다.
**2. 대량 데이터 처리 및 변환**
* **예시:** 수천 건의 문서(청구서, 보고서, 이메일)에서 구조화된 데이터를 추출하고 분류해 데이터베이스 형식으로 재구성하는 엔터프라이즈 파이프라인.
* **선택 이유:** Braintrust 평가에서 "데이터 변환" 과제의 정확 일치율이 약 83%로 Sol과 거의 동일했다. 105만 토큰 컨텍스트로 대량 배치를 처리할 수 있고 지시 이행이 안정적이라 출력 포맷이 일관된다.
**3. 지식 노동 종합 및 문서 생성**
* **예시:** 회의록, 스프레드시트, 기존 문서 같은 정리되지 않은 자료에서 보고서, 슬라이드, 재무 모델을 만들어내는 작업.
* **선택 이유:** BrowseComp(87.5% 대 GPT-5.5의 84.4%)와 사내 경영 컨설팅 과제(37.2% 대 31.3%)에서 이전 세대를 앞서면서 비용은 더 낮다. 공유 가능한 완성도 높은 산출물을 만드는 데 비용 효율적인 선택지다.
**4. 사내 어시스턴트 백엔드**
* **예시:** 사내 문서 기반 질의응답, 일정 관리 지원, 정형 커뮤니케이션 초안 작성을 담당하는 직원용 어시스턴트.
* **선택 이유:** 강한 추론력과 신뢰성(벤치마크 관측 성공률 100%)을 100만 토큰당 $2.50/$15의 가격에 제공해 대량 질의를 감당할 수 있다. 일반 질의는 효율적으로 처리하고 복잡한 건만 상위 모델로 넘기면 된다.
**다른 모델을 골라야 하는 경우**
* **GPT-5.6 Sol:** 장기적이고 중요한 아키텍처 설계, 보안이 걸린 코드, 복잡한 컴퓨터 조작, `max`나 `ultra` 추론이 필요한 작업.
* **GPT-5.6 Luna:** 단순 분류, 추출, 요약, 초안 작성처럼 5분의 1 비용에 85% 품질이면 충분한 작업.
* **Claude Fable 5:** 낯선 저장소에서 SWE-Bench Pro 성능이 핵심 지표가 되는 최고 정밀도 단발 코드 생성.
최신 뉴스
**출시 및 제공(2026년 7월 9일).** GPT-5.6 Terra가 Sol, Luna와 함께 정식 출시됐다. OpenAI API(`gpt-5.6-terra`), ChatGPT Work, Codex를 통해 즉시 이용할 수 있다. 다만 일반 ChatGPT의 자유 대화에서는 **선택할 수 없어** 초기에 사용자 혼란이 있었다.
**가격 및 API 변경.** 이 모델과 함께 OpenAI 최초의 **캐시 쓰기 요금**이 도입됐다. 표준 입력 요금의 1.25배이며, 캐시 읽기 90% 할인은 유지된다. 100만 토큰당 $2.50/$15라는 가격은 플래그십 Sol의 절반으로 명시적으로 포지셔닝됐다.
**벤치마크 및 분석.** **Artificial Analysis**와 **Braintrust**의 독립 평가가 출시와 동시에 공개됐다. 두 평가 모두 에이전트 과제에서 Terra의 우수한 가격 대비 성능비와, 다수의 분해된 워크로드에서 Sol과 통계적으로 대등하다는 점을 확인해 OpenAI의 주장을 뒷받침했다. 토큰 사용 효율성도 함께 지적됐다.
**생태계 통합.** **Cursor**와 **Lovable** 같은 파트너가 조기 피드백을 제공하며 코딩 에이전트 제품에서의 효율성과 신뢰성을 호평했다. GitHub Copilot도 해당 요금제에서 Terra를 지원 모델로 등재했다.
**이어지는 논의.** 커뮤니티에서는 이 모델의 아키텍처적 성격(증류인지 신규인지)에 대한 논쟁이 계속되고 있으며, 큐레이션된 벤치마크를 넘어선 실제 프로덕션 과제에서의 광범위한 제3자 검증을 요구하는 목소리가 이어지고 있다.