블로그 목록으로
AI 에이전트

스텝 3.7 플래시: Claude Opus 4.6 대비 1/9 비용으로 AI 에이전트 효율 극대화

1492년, 콜럼버스는 대양의 깊은 곳으로 항해를 떠났습니다. 원양 항해에는 당연히 속도가 필요했지만, 선단이 대항해에 도착할 수 있을지를 결정한 것은 담수, 식량, 선체, 마스트, 돛과 밧줄이 긴 폭풍을 견딜 수 있었는지 여부였습니다. 해외 무역을 바꾼 것은 이러한 비로맨틱한 공학적 논리였습니다. 이후 네덜란드인들은 '플루트' 상선을 설계했습니다: 비용이 낮고, 선원이 적고, 화물실이 크며, 대서양 항로를 안정적으로 왕복할 수 있었습니다. 원양 항해는 모험가의 고독한 용기에서 복제 가능하고, 계산 가능하며, 확장 가능한 사업으로 변모했습니다.

이미지

오늘날 AI 모델 경쟁도 유사한 갈림길에 서 있습니다. 지난 몇 년간 사람들은 모델을 논할 때 매개변수, 리더보드, 피크 성능에 대해 이야기하기 일쑤였지만, APPSO는 Claude Code나 Codex 같은 코딩 에이전트를 사용한 후, AI 에이전트가 실제 프로덕션 환경에 진입하면서 정말로 중요한 문제가 다소 달라졌다고 느꼈습니다: 높은 빈도의 요청을 지속적으로 처리할 수 있는지, 도구를 안정적으로 호출할 수 있는지, 복잡한 인터페이스를 이해할 수 있는지, 기업의 기존 워크플로에 통합되어 장기적으로 운영될 수 있는지. 이러한 답들은 대부분 벤치마크 점수에는 없습니다.

최근, 階躍星辰(StepFun)은 Step 3.7 Flash를 정식 출시하고 오픈소스화했습니다. 프로덕션 수준의 에이전트를 위한 차세대 플래시 모델로서, 주로 에이전트, 코딩, 검색 및 멀티모달 워크플로를 대상으로 합니다. 이 등장 타이밍은 바로 이 교차점을 포착한 것입니다. 프로덕션 수준의 에이전트가 원하는 것은 단순히 빠르고 저렴한 것만이 아니라, 신뢰성, 사용 편의성, 배포 용이성 그리고 실제 워크플로에서 매일 성과를 낼 수 있는 능력이 더욱 중요합니다.

플래시 모델, 더 이상 플래그십의 대안이 아니다

전통적으로 플래시 모델은 플래그십 모델의 경량 버전으로 간주되어, 장점은 속도와 가격만이었습니다. 그러나 에이전트가 워크플로의 핵심이 되면서, 플래시 모델의 역할은 변했습니다. 모델이 멀티태스크에서 목표에서 벗어나기 쉽다면, 기업이든 개인이든 안심하고 채택하기 어렵습니다. 반면, 속도, 비용, 도구 호출, 멀티모달 이해, 생태계 호환성의 균형을 맞출 수 있는 모델이어야만 에이전트 시스템의 진정한 핵심 기반이 될 수 있습니다.

어떤 의미에서, 에이전트 시대에 필요한 플래시 모델은 "더 빠른 작은 모델"에서 "생산 효율이 가장 높은 기반 모델"로 진화하고 있습니다. 플래그십 모델의 능력 상한선에 근접하면서도, 대규모 에이전트 호출의 효율적 압력을 견뎌내야 합니다. Step 3.7 Flash의 포지셔닝은 바로 후자 - 차세대 에이전트형 기반 모델입니다.

이미지

프로덕션 수준의 에이전트의 첫 번째 관문은 실제 작업 환경을 이해하는 것입니다. 대량의 에이전트 태스크는 복잡한 인터페이스, 사무 문서, 차트 시스템, 브라우저 페이지, 전문 소프트웨어, 사내 도구 사이를 이동합니다. 텍스트 질의응답에만 특화된 에이전트로는 이러한 태스크를 처리하기 어렵습니다.

Step 3.7 Flash가 집중적으로 강화한 것은 네이티브 멀티모달 이해 및 실행 능력입니다. UI, 차트, 문서, 이미지, 애플리케이션 인터페이스를 이해할 수 있으며, 복잡한 시각적 문제에서 자발적으로 이미지를 크롭하고, 확대하고, 다시 읽을 수도 있습니다. 정보가 불확실할 경우, 모델은 능동적으로 검색을 시작하고 텍스트와 이미지 정보를 교차 확인할 수도 있습니다.

여기서 다소 직관에 반하는 설계 사고가 있습니다. 11B 활성화 파라미터의 플래시 모델에게 방대한 시각 지식을 가중치에 억지로 압축하는 것은 비용 대비 효율이 좋지 않습니다. 階躍星辰은 반대 접근법을 취했습니다: 가중치에는 최적의 추론 엔진만 남기고, 지각의 경계와 세계 지식을 추론 단계에 외부화하여, 극도로 빠른 속도로 "여러 번 보고, 여러 번 조사함으로써" "매개변수가 본래 부족한" 부분의 능력을 보충합니다. 낮은 지연 시간과 높은 처리량은 여기서 배포 시 이점에 그치지 않고, 능력 그 자체의 일부가 되며, 기발하고 현명합니다. 예를 들어, 이 조종석 조작 데모에서 사용자가 "어떻게 이륙하는지"만 입력하면, 모델은 자동으로 조종석 영역을 프레이밍하고, 계기, 버튼, 주요 조작 정보를 식별하며, 현재 인터페이스의 조작 로직을 이해하여 단계별 튜토리얼을 생성합니다.

이미지

여기서 핵심은 조종석 이미지를 식별할 수 있을 뿐만 아니라, 밀집하고 낯선, 컨텍스트에 강하게 의존하는 시각적 환경을 사람이 실천할 수 있는 태스크 가이드로 변환할 수 있다는 점입니다. 이해하는 것과 실제로动手 하도록 가르치는 것의 난이도는 완전히 다릅니다.

또한, Step 3.7 Flash를 모바일 GUI 에이전트 워크플로에 통합하고 vivo 스마트폰으로 데모를 진행했습니다. 스마트폰은 USB로 Mac에 연결하고 ADB 디버그 인증을 활성화하면, 터미널은 현재 스크린샷을 얻을 수 있고 scrcpy로 동기화 표시됩니다. 그런 다음 스크립트는 이 스크린샷을 Step 3.7 Flash에 전송하고 화면에서 무슨 일이 일어나고 있는지 판단하게 합니다.

예를 들어, Step 3.7 Flash에게 스마트폰의 WeChat 독서 히트 차트를 보게 했습니다. 단순히 페이지의 글자를 읽는 것뿐만 아니라, 차트의 구조도 이해했습니다: 어떤 것이 서명(書名)이고, 어떤 것이 표지이며, 현재 순위는 몇 위인지, 몇 명이 읽고 있는지, 추천 지수는 어떤 책에 해당하는지. 이 능력의 의미는 에이전트가 실제 앱을 대면하고, 정돈된 스크린샷이 아니라 먼저 페이지를 이해한 다음, 사용자가 책을 찾고, 인기를 비교하고, 차트를 정리하며, 나아가 다음 조작을 실행할 수 있게 된다는 점에 있습니다.

이미지

다음으로, 메이퇀(美团) 판결관 같은 페이지에 투입하여 상인의 이의 제기 시나리오를 처리하게 했습니다. 페이지에는 사용자의 리뷰, 이미지 증거, 상인의 답변, "사용자가 더 합리적" "상인이 더 합리적" 같은 처리 버튼이 동시에 존재합니다. 모델에게 이것은 단순한 OCR이 아니라, 비즈니스 워크플로의 이해입니다: 누가 불평을 하고 있는지, 쟁점은 무엇인지, 증거는 무엇인지, 플랫폼은 다음으로 무엇을 허용하고 있는지. 멀티모달 에이전트가 실제 워크플로에 진입할 때, 만나는 것은 텍스트, 이미지, 판단, 조작 입구가 혼재하는 이 종류의 인터페이스입니다.

이미지

Blender 씬으로 전환하면, 사용자가 "이 박스를 어떻게 삭제하나요"를 입력하면, 모델은 Blender의 인터페이스 구조, 레이어, 도구 모음, 현재 편집 상태를 식별하여 지정된 박스를 삭제하는 절차를 제공합니다.

이미지

다음으로 애플리케이션의 인터페이스 디자인 분석을 살펴보겠습니다. 사용자가 "이 디자인들의 재미있는 부분을 설명해줘"라고 요구하면, 모델은 서로 다른 이미지 내의 정보를 식별하고 디자인 요소 간의 관계를 이해하여 전문적인 분석을 생성합니다.

이미지

Step 3.7 Flash의 또 다른 중요한 능력은 네트워크 연결과 시각적 검색의 강화입니다. 에이전트가 실제 비즈니스에서 만나는 문제는 동적 정보, 외부 자료, 다수의 소스 증거, 그리고 불완전한 입력에 관련되는 경우가 많습니다. 모델이 자기 내부의 지식만 의존하면, 시의성과 정확성에서 실패하기 쉽습니다.

"瑞石楼" 데모는 전형적입니다. 모델은 먼저 사용자가 업로드한 이미지에서 보이는 단서를 읽고, 이 단서를 중심으로 검색 키워드를 생성하며, 웹 스크래핑 도구로 외부 자료를 조사하고, 마지막으로 이미지의 시각 정보와 웹의 텍스트 정보를 통합하여 완전한 답변을 구성합니다.

이미지

검색은 여기서 단순히 일련의 웹 링크를 반환하는 것이 아니라, 태스크 목표를 중심으로 능동적으로 찾고, 필터링하고, 대조하고, 증거를 조직합니다. 이것은 검색 에이전트나 리서치 에이전트가 정말로 필요로 하는 작업 방식입니다.

공식에 따르면, Step 3.7 Flash는 SimpleVQA Search, V* (Python) 같은 복잡한 시각 태스크 벤치마크에서 더 대규모인 플래그십 모델에 가까운 성능을 보였습니다. 이는 정보가 불충분한 상황에서도 태스크를 추진할 수 있고, 검증되지 않은 답변을 줄일 수 있음을 의미합니다.

이미지

40개 에이전트 동시 가동, 대규모 모델의 본래 모습

에이전트와 일반 챗봇의 차이는 호출 밀도가 높다는 점입니다. 일반적인 질의응답은 1회의 대화로 끝나지만, 에이전트가 태스크를 완료하려면 환경을 관찰하고, 도구를 호출하고, 결과를 읽는 것을 반복해야 합니다. 코딩 에이전트는 코드를 읽고, 파일을 수정하고, 명령을 실행합니다. 검색 에이전트는 검색, 확인, 정보 정리를 수행합니다. 오피스 에이전트는 스프레드시트, 문서, 이메일을 처리합니다. 호출 횟수가 크게 증가하면, 모델의 속도와 비용은 시스템 수준의 문제가 됩니다.

Step 3.7 Flash는 스파스 MoE 아키텍처를 채택했으며, 총 매개변수는 196B에 1.8B ViT이고, 활성화 매개변수는 겨우 11B이며, 최대 생성 속도는 400 Tokens/s에 도달합니다. 고빈도 에이전트, 코딩 에이전트, 검색 에이전트, 멀티모달 에이전트, 기업 지식 워커 에이전트에게 이는 같은 시간 내에 더 많은 관찰, 호출, 추론을 완료할 수 있음을 의미합니다.

예를 들어, Step 3.7 Flash는 에이전터 클러스터를 구축하여 40개의 다른 인격을 가진 버추얼 페르소나가 제품 리뷰 팀을 연기하고, 제품 문제에 대해 병렬 판단하며, 5개 MVP 방향에 대한 선호도를 실시간으로 집계할 수 있습니다.

이미지

배치로 에이전트를 가동시키는 가치는 여기에 있습니다. 이전에는 하나의 모델이 1회 분석을 수행하는 비용과 지연 시간도 허용 범위였지만, 기업이 동시에 수십 개의 에이전트를 가동하고, 각각이 사용자, 전문가, 영업, 제품, 운영, 고객 지원을 연기한다면, 처리량 능력은 즉시 전제 조건이 됩니다. 속도가 충분하지 않으면 피드백이 지연되고, 비용이 너무 높으면 확장성이 전혀 성립하지 않습니다.

마찬가지로, 에이전트가 병렬로 실시간으로 대형 지식 그래프를 구축할 때도, 고빈도의 다단계 태스크에 해당합니다. 모델의 가치는 생성 속도뿐만 아니라, 단위 시간 내에 더 많은 관찰, 검색, 추론을 완료할 수 있는 점에 있습니다.

이미지

더 나아가 정보 정리를 살펴보겠습니다. "자율주행 총론을 쓰고 싶으니, 기술 노선, 정책 법규, 시장 구조, 대표 기업 4가지 방향으로 각각 조사해줘"라고 한 마디 던졌습니다. 이러한 종류의 태스크는 자료를 정리하는 것처럼 보이지만, 실제로는 다수의 검색, 소스 확인, 내용 분류, 구조화 출력을 트리거합니다. 태스크 체인이 길고 호출 횟수가 밀집될수록, 모델 처리량의 차이가 쉽게 증폭됩니다.

이미지

Step 3.7 Flash의 직관적인 인상은 속도이지만, 속도와 동시에 품질도 떨어뜨리지 않았습니다 - 전체 웹에서 4가지 방향의 자료를 각각 해당 섹션에 모으고, 기술 노선은 명확하게 설명하며, 정책 법규와 시장 구조의 정보도 분리하고, 서로 다른 방향을 한데 묶지 않으며, 구조화 출력에 필요한 계층은 모두 있습니다.

이미지

주목할 점은 Step 3.7 Flash가 태스크를 완료하는 비용 대비 성능이 매우 높고, 특히 에이전트와 같은 고빈도 태스크 형태에 친화적이라는 것입니다. 1회의 에이전트 태스크에는 분해, 검색, 웹 페이지 읽기, 도구 호출, 결과 비교, 출력 정리가 포함되며, 호출 횟수는 일반 질의응답보다 훨씬 많습니다. 단일 회 비용의 차이는 완전한 태스크 체인에서 빠르게 증폭됩니다.

공식 데이터에 따르면, 어드바이저 모드를 활성화하면, Step 3.7 Flash의 코딩 능력은 Claude Opus 4.6의 97%에 도달하고, 태스크당 비용은 후자의 약 1/9입니다.

이미지

바로 이것이 이유입니다, Step 3.7 Flash의 가치는 단순히 "빠르다"만으로 요약할 수 없습니다. 에이전트 워크로드를 놓고 보면, 3가지 문제를 동시에 해결하고 있습니다: 높은 처리량이 대기 시간을 단축시키고, 더 낮은 태스크 비용이 확장 가능한 운영을 뒷받침하며, 정상급 모델에 가까운 코딩 능력이 실제 워크플로에 진입하여 지속적이고 복잡한 태스크를 맡을 기회를 제공합니다.

더 나아가, 에이전트가 프로덕션 시스템에 진입하려면 중요한 것은 도구를 안정적으로 호출하는 것입니다. Step 3.7 Flash는 고신뢰성 도구 호출과 오케스트레이션을 최적화했습니다. 공식에 따르면, 장거리 다단계 에이전트 워크플로에서 API, 브라우저, 터미널, Office 도구, 외부 시스템을 안정적으로 호출하고, 태스크 궤도를 일관되게 유지하며, 태스크의 이탈과 실행 실패 확률을 낮출 수 있습니다.

공식은 일부 데이터를 공개했습니다. Step 3.7 Flash는 멀티도구 연동을 검증하는 Toolathlon에서 49.5%를 달성했고, 실제 환경에서의 일상 자율 태스크 실행을 검증하는 ClawEval 1.1에서 67.1%를 달성했으며, 44종의 직업 태스크에 걸친 GDPval에서 45.8%를 달성했습니다. τ²-bench Telecom의 저, 중, 고 3단계 추론 난이도에서 통과율은 모두 98% 이상입니다.

물론, 에이전트의 프로덕션화에는 과소평가되기 쉬운 조건이 있습니다: 모델이 워크플로에 적응하는 것입니다. 모델은 보통 힌트 템플릿, 도구 프로토콜, 브라우저 환경, 파일 시스템, 코드 실행 엔진, 평가셋, 권한 시스템, 비즈니스 워크플로를 둘러싼 하네스 안에 배치됩니다.

이에 대해, Step 3.7 Flash는 Claude Code, Kilo Code, Roo Code, OpenCode, Hermes Agent, OpenClaw 등 주요 코딩 및 에이전트 도구에 대한 호환성 최적화를 수행했으며, MCP, Skills 등의 도구 호출 프로토콜과 개발 체인에도 대응하고 있습니다.

이미지

개발자는 이를 통해 기존 에이전트 프레임워크에 모델을 쉽게 통합할 수 있고, 워크플로 전체를 재설계할 필요가 없습니다. 기업에게 적응의 가치는 명확합니다: 모델이 기존 시스템에 쉽게 들어갈수록, 시도와 배포의 사이클이 짧아지고, 엔지니어링 비용이 낮아집니다.

현재, Step 3.7 Flash는 Kilo Code, Nous Research, Lemonade 등 에이전트 및 개발자 생태계 프로젝트에서 통합 검증을 완료했습니다. 階躍星辰은 Fireworks AI, DeepInfra, Modal Labs 등 AI 인프라 및 추론 플랫폼과의 적응을 추진하고 있으며, 향후 OpenRouter, ZenMux 등 해외 모델 통합 및 개발자 플랫폼에도 통합할 계획입니다.

이미지

🔗 https://huggingface.co/stepfun-ai/Step-3.7-Flash

현재까지, 공식은 Step 3.7 Flash에 관한 Model Page, GitHub, Hugging Face, ModelScope, 국내 오픈 플랫폼 API, 해외 오픈 플랫폼 API, Studio 온라인 체험 및 階躍AI 앱으로의 입구를 제공하고 있습니다. 이러한 입구는 개발자 체험, 기업 API 통합, 오픈소스 생태계 사용 모두에 대응하고 있습니다. 더욱 중요한 것은 Step 3.7 Flash가 클라우드 및 로컬 배포를 지원한다는 것입니다. 공식은 개인 워크스테이션 또는 로컬 환경에 최적화된 에지 멀티정밀 버전도 제공하고 있습니다.

해외 개발자의 실측 피드백은 공식 데이터 이외의 관점을 보완하고 있습니다. 로컬 MoE 테스트에서 DeepSeek V4 Flash, Step 3.7 Flash, Minimax M2.7을 비교한 결과, Step 3.7 Flash는 agg@64에서 2123.13 tok/s에 도달해 다른 모델을 초월했습니다.

이미지

또한, 개발자는 Gemini 3.5 Flash로 코드를 작성한 후 Step 3.7 Flash에게 검사를 맡기면, 7개 이상의 작은 버그나 오류를 검출할 수 있었다고 말했습니다. 로컬 처리량이든 코드 디버깅이든, Step 3.7 Flash가 실제 개발 워크플로에 진입하기 시작했고, 개발자가 장기적으로 사용할 수 있는 생산성 도구로 인식되기 시작했음을 실제로 보여줍니다.

기반 모델, 에이전트를 위해 태어나야 한다

Step 3.7 Flash를 체험한 후, APPSO는 특정 차원의 벤치마크 점수를 추구하기보다는, 엔지니어링의 실용성을 중시하고 있음을 알아차렸습니다. 멀티모달, 네트워크 검색, 도구 호출, 프레임워크 호환성, 로컬 배포, 저비용, 높은 처리량. 이것을 개별적으로 보면新鲜 하지 않지만, 조합되면恰恰히 에이전트가 프로덕션 환경에서 가장 필요로 하는 단점을 보완하고 있습니다.

이 경로는 화려하지 않지만, 에이전트가 현재 처해 있는 단계에 매우 적합합니다. 이전에는 모델에게 질문할 때, 똑똑한지 여부를 물었지만, 에이전트 시대에 정말로 물어야 할 것은 다른 문제입니다: 이 모델은 누구를 위해 설계되었는가.

이 두 가지 질문의 배경에 있는 출발점은 다릅니다. 하나는 모델이 인간에게 최적화되어 있으며, 기본적으로 읽을 수 있고, 기다릴 수 있고, 스스로 보완할 수 있는 인간을 대상으로 한다는 것을 의미합니다. 한 마디 물어보고, 한 마디 답하고, 몇 초 늦어도 문제없으며, 가끔 모호해도 인간이 보완할 수 있습니다.

그러나 에이전트는 그렇지 않습니다. 에이전트는 관찰, 호출, 추론, 수정의 사이클을 연속으로 순환하며, 하루에 발하는 요청은 사람이 1년 동안 말하는 양보다 많을 수 있습니다. 모델의 실패를 수습하지 않으며, 모델이 벗어나면, 에이전트도 벗어납니다. 인간 최적화된 모델은 에이전트에 적합하지 않습니다. 이것이야말로 플래시라는 단어가 에이전트 시대에 새로운 의미를 갖게 된 이유입니다. 더 이상 플래그십의 저렴한 대용이 아니라, 처음부터 에이전트의 성격에 맞춰 재설계된 것입니다.

Step 3.7 Flash의 이러한 특징들은 바로 이 논리에 대응합니다. 네이티브 멀티모달은 에이전트가 먼저 태스크 현장을 봐야 하기 때문에; 400 Tokens/s는 고빈도 호출에 지연이 용납되지 않기 때문에; 도구 호출의 안정성은 장거리 태스크가 한 번 끊기면 모두 끊기기 때문에; 하네스 적응은 모델이 아무리 강해도 기존 시스템에 들어가지 못하면白紙 이기 때문입니다.

이것은 벤치마크 점수를 향해 간 것이 아니라, "에이전트가 어떻게 효율적이고 비용 효과적으로 작업할 수 있는가"를 향해 간 것입니다. Step 3.5 Flash에서 Step 3.7 Flash까지, 際躍星辰이 일관되게 강화해 온 것은 사실 같은 것입니다: 모델을 에이전트를 위해 탄생시키고, 에이전트의 확장 가능한 상용화를 추진하는 것입니다. 이것도 모델 향후 중요한 진화 경로가 될 것이며, Step 3.7 Flash는 아직 종착점이 아닙니다. 그러나, 에이전트 시대의 모델을 평가할 때, 단순히 얼마나 똑똑한지를 주시할 것이 아니라, 어떤 엔지니어링의 회계를 하나씩 명확히 할 수 있는지를 봐야 한다는 것을 우리에게 보여주었습니다.

1492년에 세계를 바꾼 것은 사실 콜럼버스의 그 위험한 횡단이 아니라, 오히려 이후 플루트 상선이 한 번씩 안정적으로 출항하고, 귀항하고, 화물을 싣고, 다시 출발할 수 있었던 것이었습니다. 모험가는 대항해에 도착하고, 상선은 대항해를 항로로 바꿉니다. 모델 경쟁이 에이전트 단계에 이르러, 이치도 마찬가지입니다. 차이를 만드는 것은 벤치마크 점수의 경이뿐만 아니라, 에이전트가 반복적으로 출발하고, 신뢰하여 도착하며, 능력을 항로에 침전시킬 수 있는 모델인 것입니다.

댓글 (0)

공유:XHatena

댓글 작성

로딩 중...