개요
Tencent Hy3는 295B 파라미터 MoE(혼합 전문가) 모델로, 토큰당 활성 파라미터는 21B에 불과하며 2026년 7월 6일 상업적으로 허용적인 Apache 2.0 라이선스로 출시되었다. 비용 효율적이고 프로덕션 준비가 된 대형 프런티어 모델 대안으로 positioned, Hy3는 에이전트 작업, 도구 오케스트레이션, 장문 추론에서 탁월하며 환각률을 5.4%로 크게 낮춰 신뢰성을 높였다. 이 모델은 4월 프리뷰 대비 크게 개선되었으며 Tencent 내부 제품팀 50개 이상의 피드백을 반영해 추론, 에이전트 능력, 실제 배포 안정성이 크게 향상되었다.
Hy3의 전략적 포지셔닝은 GLM-5.2(744B 파라미터) 같은 더 큰 모델의 일부 비용으로 프런티어에 근접한 성능을 제공하는 데 초점을 맞춘다. 코드 작업의 절대적 최고 성능보다 비용 효율성, 라이선스 유연성, 프로덕션 신뢰성을 중시하는 조직에 매력적이다. 이 모델은 수출 규정을 준수하는 하드웨어(H20-3e 등)와 표준 서양 데이터센터 GPU에서 효율적으로 구동되며, 256K 컨텍스트 윈도우는 현대 에이전트 애플리케이션에 필수적인 복잡하고 다단계 워크플로를 지원한다.
벤치마크 및 성능
Hy3는 여러 범주에서 경쟁력 있는 벤치마크 성능을 보이며, 특히 에이전트와 추론 작업에서 강점이 있다. Tencent가 발표한 벤치마크와 독립 보고에 따르면:
| 벤치마크 | Hy3 점수 | GLM-5.2 점수 | 비고 |
|-----------|-----------|---------------|-------|
| SWE-Bench Verified | 78.0% | 84.2% | Hy3는 코딩에서 뒤처짐 |
| BrowseComp | 84.2 | 78.0 | Hy3는 에이전트 검색 선두 |
| MCP-Atlas | 79.1 | 72.0 | Hy3는 도구 오케스트레이션 선두 |
| GPQA Diamond | 90.4% | 88.0% | Hy3는 STEM 추론 선두 |
| DeepSWE | 28.0% | 46.2% | 큰 코딩 격차 |
| Terminal-Bench 2.1 | 71.7 | 81.0 | 코딩 벤치마크 |
| FrontierScience-Olympiad | 74.8 | 72.5 | 과학 추론 |
Hy3의 환각률은 프리뷰 12.5%에서 출시 5.4%로, 상식 오류율은 25.4%에서 12.7%로 떨어졌다. 에이전트 작업에서 강세를 보여 BrowseComp 84.2(Claude Opus 4.8의 84.3, GPT-5.5의 84.4와 경쟁), DeepSearchQA 91.0을 기록했다. 256K 토큰 컨텍스트와 AA-LCR 검색 73.4로 장문 성능도 견고하다.
270명의 도메인 전문가가 실제 작업으로 진행한 블라인드 평가에서 Hy3는 4점 만점에 2.67점을 받아 GLM-5.1의 2.51점을 앞섰으며, 프론트엔드 개발, CI/CD, 데이터/저장소 작업에서 우위를 보였다.
상세 비교
**Hy3 vs GLM-5.2:**
- **아키텍처 및 규모**: Hy3(전체 295B, 활성 21B) 대 GLM-5.2(전체 744B, 활성 약 40B). GLM-5.2가 토큰당 연산량이 거의 2배.
- **코딩 성능**: GLM-5.2가 모든 코딩 벤치마크 우위(SWE-Bench 84.2% 대 78.0%, DeepSWE 46.2% 대 28.0%).
- **에이전트 작업**: Hy3가 검색과 도구 오케스트레이션 선두(BrowseComp 84.2 대 78.0, MCP-Atlas 79.1 대 72.0).
- **비용**: Hy3가 훨씬 저렴(100만 토큰당 $0.14/$0.56 대 GLM-5.2의 $1.40/$4.40).
- **배포**: Hy3의 FP8 풋프린트는 300GB 미만(8x H200 노드 수용) 대 GLM-5.2의 약 744GB(최소 8x H200 필요).
- **라이선스**: Hy3는 Apache 2.0(지역 제한 없음) 대 GLM-5.2의 제한적 라이선스(유럽/영국/한국 제외).
**Hy3 vs DeepSeek V4 Flash:**
- **규모**: 전체 파라미터 유사(295B 대 284B)이나 DeepSeek V4는 더 적은 파라미터 활성화(약 13B 대 21B).
- **코딩**: DeepSeek V4 Flash가 일부 테스트에서 더 나은 코딩 벤치마크.
- **비용**: DeepSeek V4 Flash가 약간 저렴($0.14/$0.28 대 $0.14/$0.56).
- **배포**: DeepSeek V4는 공격적 양자화에 강하고, Hy3는 더 일관된 에이전트 스캐폴드 성능 제공.
- **신뢰성**: 사용자는 Hy3가 복잡한 작업에서 더 궤도를 유지한다고 보고, DeepSeek V4는 잘못된 멘탈 모델을 세울 수 있음.
**Hy3 vs 프런티어 독점 모델(GPT-5.5, Claude Opus 4.8):**
- **성능**: Hy3는 에이전트 작업에서 프런티어에 근접(BrowseComp에서 Claude Opus 4.8과 동등)하나 복잡한 코딩과 수학 벤치마크에서는 뒤처짐.
- **비용**: 독점 모델보다 압도적으로 저렴(Fable 5 대비 입력 토큰 71배 저렴).
- **유연성**: Apache 2.0 라이선스로 자체 호스팅과 커스터마이즈 가능, API 전용 접근과 대조.
커뮤니티 평가
개발자와 연구 커뮤니티는 Hy3에 큰 관심을 보이며, 반응은 크게 두 가지 주제에 집중된다.
**긍정적 반응:**
- Apache 2.0 라이선스 변경은 '진짜 헤드라인'으로 널리 칭송받으며, 이전 중국 오픈 모델을 제약하던 지역 제한을 제거했다. X의 연구자들은 '점수가 유지된다면 Tencent는 오픈소스의 선두 주자 중 하나가 되었다'고 적었다.
- 개발자는 모델의 프로덕션 중심 설계를 환영하며 'DS4 Flash는 Claude Code에서 변덕이 심했는데 Hy3는 느리더라도 훨씬 더 꾸준히 궤도를 유지한다'고 밝혔다.
- 비용 대비 성능비는 인프라 제약이 있는 조직에 큰 장점으로 꼽힌다.
- OpenRouter, Hermes, Kilo, Cline 등 여러 플랫폼 통합이 도입 장벽을 낮춘다고 본다.
**회의론과 비판:**
- 일부는 중국 모델의 '벤치maxxing' 가능성을 제기하며 벤치마크 신뢰성에 의구심을 표한다.
- GLM-5.2 대비 코딩 격차는 개발자 중심 활용에서 중요한 한계로 자주 지적된다.
- GPU 요구사항과 KV 캐시 제한('Hy3를 FP4로 양자화하면 KV 캐시에 130K 토큰분만 남는다')에 대한 실무 배포 우려가 있다.
- 프리뷰에서 출시까지 약 10주의 빠른 개발 주기는 철저함에 대한 의문을 제기한다.
**도입 패턴:**
- 에이전트 워크플로, 비용 효율성, 라이선스 유연성을 중시하는 팀에서 초기 도입이 가장 활발하다.
- Tencent 생태계(WorkBuddy, CodeBuddy, Yuanbao) 내 프로덕션에 배포되어 대기 시간 54% 감소, 성공률 99.99% 이상을 보고했다.
- Hugging Face(지난달 11,849 다운로드)와 ModelScope의 오픈소스 커뮤니티가 적극 참여하고 있다.
활용 사례
1. **에이전트 워크플로와 도구 오케스트레이션**: Hy3는 검색, 도구 협업, 다단계 계획이 필요한 복잡한 에이전트 작업에 탁월하다. BrowseComp 84.2, MCP-Atlas 79.1을 기록해 검색 중심 에이전트, 도구 접근이 가능한 고객 서비스 봇, 자동화 워크플로 시스템 구축에 적합하다. 순수 코딩 성능보다 에이전트 능력이 더 중요한 경우 GLM-5.2 대신 Hy3를 선택하라.
2. **비용 민감형 프로덕션 배포**: 100만 토큰당 $0.14/$0.56으로 Fable 5 같은 모델 대비 71배 낮은 비용에 프런티어에 근접한 성능을 제공한다. 토큰당 비용이 중요한 챗봇, 문서 처리, 기업 생산성 도구 같은 대량 애플리케이션에 최적이다. 단일 8-GPU 노드 자체 호스팅으로 운영 비용을 더 낮출 수 있다.
3. **신뢰성 우선 애플리케이션**: 환각률 5.4%와 환각 방지 명시적 학습으로 Hy3는 창의성보다 정확성이 중요한 법률 문서 분석, 의료 정보 시스템, 금융 모델링, 기업 지식 베이스에 적합하다. 다양한 개발 환경(CodeBuddy, Cline, KiloCode)에서 일관된 에이전트 스캐폴드 성능을 보인다.
4. **허용적 라이선스가 필요한 글로벌 배포**: 지역 제한이 없는 Apache 2.0 라이선스는 GLM-5.2의 라이선스가 법적 장벽이 되는 유럽/영국/한국 시장을 서비스하는 다국적 기업에 명확한 선택이다. 상업 친화적 모델 가중치가 필요한 오픈소스 프로젝트에도 이상적이다.
**대안을 선택해야 하는 경우:**
- 저장소 규모 소프트웨어 공학, 복잡한 코딩 작업, 8x H200 예산이 있는 경우 GLM-5.2를 선택하라.
- 단순 작업의 최대 비용 효율과 공격적 양자화가 필요하면 DeepSeek V4 Flash를 선택하라.
- 프런티어 복잡 추론과 최고 출력 품질이 필요하면 독점 모델(GPT-5.5, Claude Opus 4.8)을 선택하라.
최신 뉴스
1. **공식 출시(2026년 7월 6일)**: Tencent가 4월 프리뷰를 개선해 Hy3를 공식 출시했으며, 성능, 신뢰성, 프로덕션 안정성이 향상되었다. 50개 이상 내부 제품팀 피드백이 반영되었다.
2. **라이선스 변경**: Hy3는 이제 Apache 2.0 라이선스로 제공되며, 이전 중국 오픈 모델을 제약하던 지역 제한을 제거해 글로벌 기업 도입을 가능케 했다.
3. **무료 제공**: Hy3는 2026년 7월 21일까지 OpenRouter와 Novita AI에서 무료로 제공되어 개발자가 비용 부담 없이 시험할 수 있었다.
4. **플랫폼 통합**: 모델은 Hugging Face와 ModelScope 외에 OpenRouter, Hermes, Kilo, Cline, OpenClaw, OpenCode, Cherry Studio 등 글로벌 개발자 플랫폼에서 이용 가능하다.
5. **프로덕션 배포**: Hy3는 이미 Tencent 제품(WorkBuddy, CodeBuddy, Yuanbao, Marvis, ima)에 배포되어 대기 시간 54% 감소, 종단간 작업 시간 47% 단축, 에이전트 워크플로 성공률 99.99%를 보고했다.
6. **API 가격**: Tencent Cloud는 입력 100만 토큰당 약 1위안, 출력 4위안(약 $0.14/$0.56)에 제공하며, 캐시 히트 가격은 100만 토큰당 0.25위안이다.
7. **배포 생태계**: vLLM과 SGLang용 전용 배포 레시피가 제공되며, 수출 규정 준수 Nvidia H20-3e와 표준 서양 GPU(H100, H200, B200)에 최적화되어 있다.