StepFunAI오픈소스

Step 3.7 Flash

이 모델 비교

StepFun AI가 개발한 고속 기초 모델. 낮은 지연 시간과 높은 처리량을 동시에 달성합니다.

파라미터

1980

컨텍스트

256K

라이선스

Apache 2.0

출시일

2026-05-29

일본어 처리 능력

🌐Multilingual

General multilingual model. Basic Japanese processing is possible, but inferior to specialized models.

API 가격

이 모델의 API 가격 정보는 현재 공개되지 않았습니다

강점

    약점

      활용 사례

        심층 분석

        ClawEval-1.1

        67.1

        전체 1위. 차상위는 Claude 4 Opus(59.8)

        SWE-Bench PRO

        56.3

        전체 2위. Claude 4 Opus(64.3)에 이어 2위

        SimpleVQA (Search)

        79.2

        1위. GPT 5.5(79.1)를 앞섬

        Input Price

        $0.20/1M tokens

        캐시 히트 시 $0.04/1M. Claude Opus 대비 약 25배 저렴

        Throughput

        400 tok/s

        클라우드 API 기준. DGX Spark 로컬에서는 약 27 tok/s

        Context Window

        256K tokens

        약 384페이지 분량의 텍스트

        강점

        • ClawEval-1.1 점수 67.1로 최고 수준의 에이전트 신뢰성을 갖추어, 뛰어난 다단계 도구 오케스트레이션과 적대적 함정에 대한 저항력을 보여줌
        • Advisor Mode는 작업당 $1.76인 Claude Opus 4.6 대신 $0.19로 그 코딩 성능의 97%를 제공하며, 프로덕션 에이전트 워크플로에서 실질적인 9배 비용 절감을 실현
        • 폭넓은 로컬 배포 유연성: Mac Studio, DGX Spark, AMD Ryzen AI Max+ 395에서 구동되며, BF16·FP8·NVFP4·GGUF 양자화가 첫날부터 제공됨

        약점

        • Terminal-Bench 2.1(59.5, GPT 5.5는 82.7)과 GDPVal-AA(45.8, 프런티어 모델은 63%)에서 큰 격차가 있어, 복잡한 터미널 및 일반 전문 직무 활용에 제약이 됨
        • 자체 보고 벤치마크 데이터. 경쟁 모델 점수 상당수가 표준화된 제3자 평가가 아닌 StepFun 자체 재실행 결과라 비교 신뢰도가 낮아짐
        • 로컬 배포 최소 사양이 128GB라 소비자용 노트북과 대부분의 프로슈머 환경이 제외되며, BF16 풀 정밀도는 394GB 필요

        경쟁사 비교

        ModelArenaSWEPrice
        Claude Opus 4.6N/A64.3%$5.00/$25.00
        DeepSeek V4 FlashN/A55.6%$0.22/$0.87
        Gemini 3.5 FlashN/A55.1%$0.15/$0.60

        Step 3.7 Flash는 StepFun AI가 2026년 5월 29일에 공개한 198B 파라미터 희소 MoE(전문가 혼합) 비전-언어 모델입니다. 방대한 전체 파라미터에도 불구하고 전문가 라우팅(288개 중 8개 전문가)을 통해 토큰당 약 11B 파라미터만 활성화하여, 소형 밀집 모델 수준의 추론 비용으로 프런티어에 가까운 지능을 제공합니다. 이 모델은 196B 언어 백본에 1.8B 네이티브 비전 인코더를 결합하고, 256K 컨텍스트 창을 지원하며, 클라우드 API에서 초당 최대 400토큰의 처리량을 달성합니다.

        이 모델의 핵심 차별점은 절대적 지능 상한이 아니라 에이전트 워크플로 신뢰성에 있습니다. ClawEval-1.1 벤치마크에서 67.1(전작 Step 3.5 Flash 대비 23.5포인트 상승)로 1위, SWE-Bench PRO에서는 56.3으로 2위입니다. 가장 혁신적인 기능은 Advisor Mode로, 일상적인 도구 호출과 반복은 Step 3.7 Flash가 처리하고 진짜 의사결정 지점에서만 더 큰 프런티어 모델로 에스컬레이션하는 2단계 실행 전략이며, 작업당 비용을 약 9분의 1(Claude Opus 4.6의 $1.76 대비 $0.19)로 줄이면서 Claude Opus 4.6 코딩 성능의 약 97%를 달성합니다.

        이 모델은 Apache 2.0으로 완전히 오픈웨이트이며, HuggingFace를 통해 양자화 체크포인트(BF16, FP8, NVFP4, GGUF)와 함께 제공되어 NVIDIA DGX Spark나 Mac Studio 같은 128GB 이상 통합 메모리 기기에서 로컬 배포가 가능합니다. StepFun 자체 플랫폼, OpenRouter, NVIDIA NIM을 통해 이용할 수 있으며, DeepInfra·Fireworks AI·Modal과의 파트너십도 예정되어 있습니다. 부족한 부분은 순수 추론 벤치마크(HLE w/ tools 47.2% 대 Claude Opus 4.7의 54.7%), 터미널 중심 워크플로(Terminal-Bench 2.1 59.5 대 GPT 5.5의 82.7), 일반 전문 직무(GDPVal-AA 45.8% 대 프런티어 모델 63%)입니다.

        분석 생성일: 2026-08-09