Zhipu AI오픈소스

GLM 5.1

이 모델 비교

Zhipu AI가 개발한 고성능 기반 모델. 중국어 지원이 뛰어나며 다양한 작업에 대응합니다.

파라미터

754

컨텍스트

200K

라이선스

MIT

출시일

2026-03-27

벤치마크 성능

AA Intelligence Index

LMArena Elo

HLE

ARC-AGI-2

SWE-bench Verified

GPQA Diamond

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

일본어 처리 능력

🌐Multilingual

General multilingual model. Basic Japanese processing is possible, but inferior to specialized models.

API 가격

입력 가격 (1M 토큰당)

$1.4

출력 가격 (1M 토큰당)

$

과금 모드: standard

강점

    약점

      활용 사례

        심층 분석

        Arena Elo (텍스트)

        1472

        #16 검증 리더보드, 코딩 아레나 1524

        SWE-Bench Pro

        58.4%

        전 세계 1위 — GPT-5.4(57.7)·Claude Opus 4.6(57.3) 앞서

        SWE-Bench Verified

        77.8%

        Claude Opus 4.6(80.8%)에 3점 뒤처짐

        GPQA Diamond

        86.2%

        Claude Opus 4.6: 91.3%, GPT-5.2: 92.4%

        입력 가격

        $1.40/1M

        출력 $4.40/1M, 캐시 $0.26/1M

        파라미터 (활성/전체)

        40B / 744B

        MoE, 256 전문가, 상위 8 라우팅 + 공유 1

        컨텍스트 윈도우

        200K 토큰

        최대 출력 128K 토큰

        강점

        • 에이전틱 코딩 최강 오픈 가중치 모델 — SWE-Bench Pro(58.4%)와 CyberGym(68.7%) 전 세계 1위
        • 뛰어난 장시간 자율 실행 — 1,700단계로 8시간 중단 없는 에이전틱 세션 실증
        • MIT 라이선스로 완전 오픈, 경쟁력 있는 API 가격(약 $1.40/$4.40 per 1M)으로 Claude Opus 대비 10~17배 저렴

        약점

        • GPT-5.4·Claude Opus 4.6·Gemini 3.1 Pro와 달리 멀티모달 입력(이미지·오디오·비디오) 없음(텍스트 전용)
        • 일반 추론에서 프론티어 모델에 뒤처짐 — GPQA Diamond 86.2% 대 GPT-5.2 92.4%, HLE 31.0 대 Claude Opus 4.6 45.0
        • 생성 속도 느림(약 40~44 tok/s) 및 출력 장황해 대화형 사용의 지연과 실효 비용 증가

        경쟁사 비교

        ModelArenaSWEGPQAPrice
        Claude Opus 4.6 (Anthropic)~150380.8%91.3%$15/$75
        GPT-5.4 (OpenAI)N/AN/AN/A~$12/$60 추정
        DeepSeek V3.2N/A73.1%N/A$0.27/$1.10

        GLM-5.1은 Zhipu AI(현 Z.AI)가 개발한 744B 파라미터 MoE 모델로, 2026년 4월 7일 출시되었습니다. 현재 오픈 가중치 코딩·에이전틱 AI의 정점으로, SWE-Bench Pro에서 가장 높은 공개 점수(58.4%)를 기록해 GPT-5.4와 Claude Opus 4.6을 근소하게 앞섭니다. 이 모델은 NVIDIA 하드웨어 없이 10만 개 Huawei Ascend 910B 칩만으로 학습되어, 미국 수출 통제 속 중국 AI 자립의 이정표입니다. Z.AI는 2026년 1월 홍콩 IPO에서 약 $31.3B 기업가치로 상장해 세계 최초의 상장 기초 모델 기업이 되었습니다.

        아키텍처상 GLM-5.1은 GLM-5의 사후 학습 정제판으로 동일한 MoE 백본(전체 744B, 토큰당 활성 40B, 256 라우팅 전문가에 상위 8 선택)을 공유하되 코딩·에이전틱·장시간 능력을 크게 강화했습니다. 정의적 혁신은 확장된 자율 실행입니다. 모델은 인간 체크포인트 없이 계획-실행-분석-최적화 루프를 최대 8시간 유지하며, 655회 반복으로 완전한 Linux 데스크톱 환경을 구축하고 벡터 DB 처리량을 6.9배로 최적화한 사례가 있습니다. 모델은 MIT 라이선스로 Hugging Face에 가중치를 공개합니다.

        GLM-5.1이 부족한 부분은 범용 추론과 멀티모달 작업입니다. GPQA Diamond(86.2%), Humanity's Last Exam(31.0 기본), AIME 2026(95.3%)에서 프론티어 폐쇄형 모델에 512점 뒤집니다. 텍스트 전용이며 이미지나 오디오 처리가 없습니다. 생성 속도(약 4044 tok/s)는 경쟁 중앙값보다 낮고, 장황한 출력 스타일이 토큰 사용을 늘립니다. 자율 코딩 에이전트나 장시간 엔지니어링 파이프라인을 구축하는 조직에는 가장 강력한 오픈 가중치 선택지이며, 멀티모달 워크플로나 최대 추론 능력이 필요하면 폐쇄형 대안이 우수합니다.

        분석 생성일: 2026-08-07