アリババ독점

Qwen3.6-Max-Preview

이 모델 비교

Alibaba에서 개발한 고성능 MoE 모델. 다국어 지원과 높은 추론 능력이 특징입니다.

파라미터

1

컨텍스트

262K

라이선스

Proprietary

출시일

2026-04-20

벤치마크 성능

AA Intelligence Index

LMArena Elo

HLE

ARC-AGI-2

SWE-bench Verified

GPQA Diamond

MMLU-Pro

LiveCodeBench

AIME 2025

MATH-500

일본어 처리 능력

High-Quality JP

Multilingual model with strong Japanese language processing capabilities.

API 가격

입력 가격 (1M 토큰당)

$1.3

출력 가격 (1M 토큰당)

$

과금 모드: standard

강점

    약점

      활용 사례

        심층 분석

        AA Intelligence Index

        52

        전 세계 3위, GPT-5.4와 Claude Opus 4.7 다음

        SWE-bench Pro

        #1

        ~58.4%, 평가된 모든 모델 중 1위

        Terminal-Bench 2.0

        65.4%

        Claude Opus 4.6과 동점

        GPQA Diamond

        88.8%

        강하지만 Gemini 3.1 Pro(94.3%)에는 뒤처짐

        입력 가격

        $1.30/1M

        OpenRouter 기준 ~$1.04 (20% 할인)

        컨텍스트 윈도우

        262K 토큰

        Claude Opus 4.7와 GPT-5.4는 1M

        강점

        • SWE-bench Pro, SciCode(Plus 대비 +10.8), SkillsBench(Plus 대비 +9.9)를 포함해 6개 에이전틱 코딩 벤치마크 동시 1위
        • preserve_thinking 기능이 다중 턴 에이전틱 워크플로에서 추론 흔적을 유지해 복잡한 도구 호출 체인의 컨텍스트 손실 감소
        • OpenAI 및 Anthropic SDK 형식 모두와 API 호환 — 모델 문자열 한 줄만 바꾸면 즉시 대체 가능

        약점

        • 첫 폐쇄형 가중치 Qwen 플래그십으로 3년간 이어온 오픈소스 전통을 깨뜨림. 자체 호스팅이나 파인튜닝 불가
        • 느린 출력 속도(~38–45 tok/s)가 유사 추론 모델 중앙값 62 t/s에 못 미쳐 지연 문제 발생
        • 262K 컨텍스트 윈도우는 Claude Opus 4.7과 GPT-5.4(둘 다 1M)의 4분의 1로 대규모 코드베이스·장문서 작업 제약

        경쟁사 비교

        ModelArenaSWEGPQAPrice
        Claude Opus 4.6N/A80.8%~90%$15/$75
        GPT-5.4N/A88.7%~92%$2.50/$10
        Qwen3.6-PlusN/A78.8%88.2%$0.29/$1.65

        Qwen3.6-Max-Preview는 Alibaba의 첫 번째 독점적 폐쇄형 가중치 플래그십 모델로, 2026년 4월 20일 공개되었다. 약 1조 총 파라미터로 추정되는 희소 MoE 아키텍처를 바탕으로 에이전틱 코딩, 과학 프로그래밍, 다단계 도구 호출 워크플로를 목표로 한다. 출시 시 SWE-bench Pro, Terminal-Bench 2.0, SkillsBench, SciCode, QwenClawBench, QwenWebBench 등 6개 코딩 벤치마크에서 1위를 차지했고, Artificial Analysis Intelligence Index에서 52점으로 전 세계 3위에 올랐다. 핵심 혁신은 preserve_thinking 기능으로, 대화 턴 간 모델의 사고흐름을 유지해 순차적 도구 호출이 반복되는 다단계 에이전트 루프에서 컨텍스트 일관성이 깨지는 치명적 실패를 해결한다.

        폐쇄형 가중치 결정은 오픈소스로 전 Qwen 라인의 글로벌 개발자 평판을 쌓아온 Alibaba에게 큰 전략적 전환이다. 같은 주에 Apache 2.0으로 공개된 두 오픈 가중치 형제 모델(Qwen3.6-27B, Qwen3.6-35B-A3B)은 의도된 계층화 전략을 시사한다. 커뮤니티용 오픈 모델, 수익화용 독점 플래그십. 이로써 Max-Preview는 프론티어 API 계층에서 GPT-5.4와 Claude Opus 4.7과 정면 대치하며, 저비용 옵션인 Qwen3.6-Plus($0.29/$1.65 per 1M 토큰)는 비용 민감 워크로드를 계속 담당한다.

        Alibaba는 개발이 진행 중임을 명시하며 '프리뷰'로 출시했다. 에이전틱 코딩 점수는 진짜 경쟁력이 있으나 SWE-bench Verified에서는 Claude Opus 4.6(80.8% 대 ~73%)과 GPT-5.4에 뒤처지고 종합 벤치마크에서도 밀린다(BenchLM 89 대 81). 262K 컨텍스트, 텍스트 전용, 중앙값 밑도는 출력 속도는 실무상 제약이다. $1.30/$7.80 per 1M 토큰 가격은 저렴한 Plus 계층과 서구 프론티어 가격 사이로, 에이전틱 코딩을 최적화하는 팀을 위한 중간 옵션이다.

        분석 생성일: 2026-08-08