중국 스텝펀이 6000억 모델을 100만 토큰 1달러에 열었습니다 — 스텝5 프리뷰와 10월 15일 가중치 공개

중국 스텝펀이 6000억 모델을 100만 토큰 1달러에 열었습니다 — 스텝5 프리뷰와 10월 15일 가중치 공개

새 AI 모델이 나왔다는 소식은 이제 드물지 않습니다. 그런데 가끔은 모델 자체보다 옆에 붙은 가격표가 더 큰 뉴스가 됩니다.

중국 상하이의 스텝펀이 9월 20일 스텝5 프리뷰를 공개했습니다. 6000억 파라미터짜리 모델인데, 입력 100만 토큰에 1달러, 출력 100만 토큰에 2달러 70센트를 받겠다고 했습니다. 그리고 10월 15일에는 가중치를 그냥 열겠다고 덧붙였습니다.

숫자가 여럿 나오지만 어렵지 않습니다. 하나씩 천천히 풀어 보겠습니다.

어두운 공간에 떠 있는 거대한 다면체 안쪽에서 작은 청록 사면체가 홀로 빛나는 개념 이미지 — 6000억 중 270억만 쓰는 구조를 표현했습니다

스텝펀이 9월 20일 스텝5 프리뷰를 열었습니다

스텝펀은 2026년 9월 20일 자사의 새 대형 모델인 스텝5 프리뷰를 공개하고 같은 날 API를 열었습니다. 이름에 붙은 프리뷰는 아직 정식판이 아니라는 뜻입니다.

이 모델이 겨냥하는 곳은 분명합니다. 한 번 시켜 놓으면 오래 혼자 돌아가는 작업, 그러니까 코딩과 소프트웨어 수정, 금융 분석, 전문 지식 업무입니다. 요즘 말로 에이전트 작업이라고 부르는 영역입니다.

발표 당일부터 유료 API로 쓸 수 있고, 가중치 공개는 10월 15일로 예고돼 있습니다.

6000억 중에 270억만 깨어 있습니다 — 스파스 MoE가 무엇인가요

스텝5 프리뷰의 전체 파라미터는 약 6000억 개입니다. 그런데 토큰 하나를 처리할 때 실제로 쓰이는 것은 약 270억 개뿐입니다.

이런 구조를 스파스 MoE, 우리말로 희소 전문가 혼합이라고 부릅니다. 커다란 회사에 전문가가 수백 명 있는데 질문 하나가 들어오면 그중 관련 있는 몇 명만 불러서 답하게 하는 방식이라고 생각하시면 쉽습니다.

나머지 전문가는 그 순간 쉬고 있으니 계산이 훨씬 적게 듭니다. 덩치는 6000억인데 실제 계산 비용은 270억짜리에 가깝습니다. 아래에서 볼 가격표가 가능한 이유가 여기에 있습니다.

흩어진 어두운 육각형 무리 가운데 단 세 개만 청록으로 밝게 빛나는 이미지 — 필요한 전문가만 깨우는 스파스 구조를 표현했습니다

100만 토큰 맥락은 얼마나 긴 것인가요

스텝5 프리뷰는 한 번에 100만 토큰까지 읽습니다. 토큰은 단어 조각을 세는 단위인데, 한글은 대략 한 글자에 1개에서 2개 정도로 잡습니다.

감을 잡자면 이렇습니다. 장편소설 여러 권 분량, 또는 중간 규모 프로젝트의 소스코드 전체를 한 번에 넣고 질문할 수 있는 크기입니다.

맥락이 길면 좋은 이유는 단순합니다. 작업 도중에 앞부분을 잊어버리지 않기 때문입니다. 긴 작업을 맡기려면 이 숫자가 먼저 커져야 합니다.

출력은 6만 4천 토큰까지 나옵니다

읽는 쪽이 100만이라면 쓰는 쪽은 6만 4천 토큰이 상한입니다. 한 번 요청에 이 정도 분량까지 이어서 써 낼 수 있다는 뜻입니다.

코드로 치면 파일 여러 개를 한 번에 고쳐 내놓을 수 있는 크기이고, 글로 치면 꽤 긴 보고서 한 편에 해당합니다.

읽기와 쓰기 상한이 따로 있다는 점은 실무에서 자주 걸리는 부분이라 기억해 두시면 좋습니다.

한 줄로 곧게 늘어선 작은 청록 정육면체들 가운데 한쪽 끝의 하나만 훨씬 크게 빛나는 이미지 — 100만 토큰 맥락의 길이를 표현했습니다

입력에 글과 이미지와 영상이 함께 들어갑니다

스텝5 프리뷰는 텍스트뿐 아니라 이미지와 영상도 입력으로 받습니다. 화면을 찍어 보여 주면서 여기 이 부분을 고쳐 달라고 말할 수 있다는 뜻입니다.

에이전트 작업에서 이 기능은 장식이 아닙니다. 사람이 컴퓨터를 쓸 때 보는 것을 모델도 보게 해 주는 통로이기 때문입니다.

다만 출력은 글입니다. 그림을 만들어 주는 모델이 아니라 그림을 읽는 모델입니다.

가격표가 이 발표의 진짜 본문입니다

입력 100만 토큰에 1달러, 출력 100만 토큰에 2달러 70센트입니다. 우리 돈으로 대략 입력 1400원 안팎, 출력 3800원 안팎입니다.

이 가격대는 최상위 모델들이 받는 금액의 몇 분의 일 수준입니다. 같은 일을 시켜도 청구서 자릿수가 달라집니다.

성능이 낮아서 싼 것이라면 이야기가 안 되겠지만, 아래 벤치마크를 보면 그렇지도 않습니다. 그래서 이 발표의 핵심은 모델이 아니라 가격이라는 말이 나옵니다.

화면을 비스듬히 가로지르는 거대한 청록 빛덩어리 이미지 — 6만 4천 토큰까지 이어지는 출력을 표현했습니다

캐시가 맞으면 95퍼센트가 깎입니다

여기에 캐시 할인이 하나 더 붙습니다. 이전에 보낸 것과 같은 입력이 다시 들어오면 100만 토큰당 5센트만 받습니다. 정가의 20분의 1입니다.

긴 문서를 붙여 놓고 질문을 여러 번 바꿔 가며 물을 때, 그 문서 부분은 두 번째부터 거의 공짜가 됩니다.

에이전트가 같은 지침과 같은 코드베이스를 반복해서 읽는다는 점을 생각하면, 이 할인은 실사용 비용을 크게 바꿉니다.

인텔리전스 인덱스 44 — 같은 가격대 중앙값은 24입니다

독립 평가 기관인 아티피셜 애널리시스의 인텔리전스 인덱스에서 스텝5 프리뷰는 44점을 받았습니다.

비슷한 가격대에 있는 추론 모델들의 중앙값은 24점입니다. 같은 돈을 내고 거의 두 배에 가까운 점수를 받는 자리에 앉은 셈입니다.

점수 하나로 모델을 단정할 수는 없습니다. 다만 가격과 성능을 두 축에 놓고 보면 이 모델이 지금 어디쯤 있는지는 분명해집니다.

서로 다른 세 방향에서 온 청록 광선이 어두운 팔면체 한 곳에서 만나는 이미지 — 글과 이미지와 영상이 함께 들어오는 입력을 표현했습니다

코딩 벤치마크에서 오픈 가중치 1위를 찍었습니다

스텝5 프리뷰는 딥SWE 1.1에서 67.7점, 스텝코드벤치에서 49점, 프로그램벤치에서 80.5점을 기록했습니다.

가중치가 공개된 모델들 중에서는 딥SWE 1.1과 스텝코드벤치 두 곳에서 1위입니다. 키미 K3와 GLM-5.3을 앞섰습니다.

코딩 벤치마크는 실제 저장소에서 버그를 고치게 하는 식으로 채점합니다. 객관식 문제 풀이보다 실무에 가깝습니다.

터미널벤치 4.0에서 키미 K3의 2.6배였습니다

터미널 환경에서 혼자 명령을 내려 가며 일을 끝내는 능력을 재는 터미널벤치 4.0에서는 33.3퍼센트를 받았습니다.

같은 시험에서 키미 K3의 2.6배, 딥시크 V4.1 플래시의 1.24배였습니다. 에이전츠 라스트 이그잼에서는 29.5퍼센트였습니다.

절대 점수만 보면 33퍼센트가 낮아 보일 수 있습니다. 그런데 이 시험 자체가 아주 어렵게 설계돼 있어서 지금은 이 정도가 상위권입니다.

아주 큰 흐릿한 청록 쐐기와 아주 작지만 강렬한 청록 쐐기가 나란히 떠 있는 이미지 — 덩치와 가격의 대비를 표현했습니다

앞에 남은 것은 클로드 오퍼스 5와 GPT-6 아스트라뿐입니다

여러 비교에서 스텝5 프리뷰보다 위에 있는 것은 덩치가 훨씬 큰 비공개 모델들, 그러니까 클로드 오퍼스 5와 GPT-6 아스트라 정도로 정리됩니다.

참고로 키미 K3는 2조 8000억 중 1040억을 쓰고, 딥시크 V4.1 플래시는 5520억 중 입력에 80억, 출력에 160억을 씁니다. 스텝5 프리뷰의 270억은 그 사이 어딘가입니다.

정리하면 가중치를 여는 모델들 중에서는 선두, 전체로는 최상위 두 곳 바로 아래라는 위치입니다.

10월 15일에 가중치를 연다고 했습니다

스텝펀은 10월 15일에 스텝5 프리뷰의 가중치를 공개하겠다고 밝혔습니다. API가 먼저 열리고 가중치가 나중에 따라오는 순서입니다.

이런 순서에는 이유가 있습니다. 먼저 API로 반응을 보고 문제를 잡은 뒤에 파일을 푸는 편이 안전하기 때문입니다.

물론 예고는 예고입니다. 날짜가 밀리는 일은 이 업계에서 드물지 않으니 계획을 세우실 때는 여유를 두시는 편이 좋습니다.

강렬하게 빛나는 청록 육각기둥과 그 옆의 거의 보이지 않는 같은 모양 윤곽 이미지 — 캐시 할인 95퍼센트를 표현했습니다

가중치를 연다는 말이 왜 중요한가요

가중치는 모델의 실체인 숫자 덩어리입니다. 이것이 공개되면 누구나 내려받아 자기 컴퓨터나 자기 회사 서버에서 돌릴 수 있습니다.

그러면 세 가지가 달라집니다. 첫째, 데이터가 밖으로 나가지 않습니다. 둘째, 서비스가 중단되거나 가격이 오르는 일에 휘둘리지 않습니다. 셋째, 필요하면 내 자료로 추가 학습을 시킬 수 있습니다.

회사 내부 자료를 다루는 곳에서 오픈 가중치 모델을 눈여겨보는 이유가 바로 이것입니다.

스텝펀은 어떤 회사인가요 — 2023년 상하이, AI 타이거

스텝펀은 2023년 4월 6일 상하이에서 설립됐습니다. 중국에서 프런티어 모델을 만들겠다고 나선 자금력 있는 스타트업 무리를 AI 타이거라고 부르는데, 스텝펀은 그중 하나입니다.

우리에게 익숙한 딥시크나 알리바바의 큐원에 비하면 국내 인지도는 낮은 편입니다. 그래도 모델을 꾸준히 내놓아 온 곳입니다.

회사 이름의 스텝은 걸음이라는 뜻입니다. 모델 이름도 스텝1, 스텝2 하는 식으로 이어져 왔고 이번이 스텝5입니다.

가로로 지나는 넓고 밝은 청록 광선과 세로로 지나는 좁고 흐린 광선이 날카롭게 교차하는 이미지 — 점수 44와 중앙값 24의 대비를 표현했습니다

올해에만 32억 달러를 모았습니다

스텝펀은 2026년 1월 50억 위안, 약 7억 1700만 달러 규모의 시리즈 B 플러스를 마감했습니다. 이어서 25억 달러 규모의 추가 라운드를 마무리한 것으로 전해집니다.

두 라운드를 합치면 올해에만 약 32억 달러입니다. 새 투자자로 화친 테크놀로지와 옴니비전, ZTE가 들어왔고 홍콩의 국부 성격 투자기관도 주주 명단에 올랐습니다.

이 정도 자금이 들어왔다는 것은 모델을 한두 번 내고 끝낼 생각이 아니라는 뜻으로 읽힙니다.

중국 모델 발표가 한 주에 몰리는 이유

요즘 중국 연구소들의 발표가 며칠 간격으로 이어집니다. 우연만은 아닙니다. 경쟁사가 내놓기 전에 먼저 자리를 잡아야 개발자들이 자기 모델을 먼저 써 보기 때문입니다.

여기에 가중치 공개라는 카드가 더해집니다. 가격으로도 싸고 파일까지 준다고 하면 쓰는 쪽에서는 한 번 시험해 볼 이유가 생깁니다.

결과적으로 이 경쟁의 혜택은 쓰는 사람에게 돌아옵니다. 반년 전과 비교하면 같은 성능을 훨씬 싸게 쓸 수 있게 됐습니다.

밝은 청록 다면체 하나가 어두운 덩어리 무리보다 훨씬 위에 떠 있는 이미지 — 오픈 가중치 코딩 1위를 표현했습니다

최신 칩 없이는 못 좁힌다던 예측은 어떻게 됐나요

몇 해 전만 해도 최신 반도체 없이는 벤치마크 격차를 좁힐 수 없다는 전망이 자주 나왔습니다. 수출 통제가 그 전제 위에 서 있었습니다.

그런데 지금 나오는 숫자들은 그 전제를 흔듭니다. 스텝5 프리뷰의 점수는 제약 속에서도 상위권에 도달할 수 있음을 보여 줍니다.

다만 벤치마크 점수와 대규모 서비스 운영 능력은 다른 문제입니다. 점수가 좁혀졌다고 모든 격차가 사라진 것은 아닙니다.

에이전트 작업이 왜 긴 맥락을 요구하나요

에이전트는 한 번 대답하고 끝나지 않습니다. 코드를 읽고, 고치고, 실행해 보고, 실패하면 다시 고칩니다. 이 과정이 수십 번 반복됩니다.

그 모든 시도와 결과가 계속 맥락에 쌓입니다. 맥락이 짧으면 앞에서 왜 그렇게 고쳤는지를 잊어버리고 같은 실수를 되풀이합니다.

100만 토큰이라는 숫자가 에이전트 모델의 홍보 문구에 늘 따라붙는 이유가 이것입니다.

좁은 틈에서 강한 청록 빛이 터져 나오는 어두운 정육면체와 같은 자리에 희미한 빛만 남은 또 하나의 정육면체 이미지 — 2.6배 격차를 표현했습니다

긴 작업에서 비용이 폭발하는 구조

그런데 맥락이 길어지면 요금이 무섭게 올라갑니다. 대화가 길어질수록 매 요청마다 앞의 내용을 통째로 다시 보내야 하기 때문입니다.

열 번 주고받으면 비용이 열 배가 아니라 그보다 훨씬 더 늘어나는 구조입니다. 에이전트를 실제로 돌려 본 분들이 가장 먼저 놀라는 지점이기도 합니다.

그래서 입력 단가와 캐시 할인이 중요합니다. 스텝5 프리뷰의 1달러와 5센트는 바로 이 문제를 겨냥한 숫자입니다.

실제로 써 보려면 — API와 자체 호스팅

지금 당장은 스텝펀의 API를 통해 쓰는 방법뿐입니다. 발표 당일부터 열려 있습니다.

10월 15일 이후에는 가중치를 내려받아 직접 돌리는 길이 생깁니다. 다만 6000억 파라미터급은 개인 장비로 감당하기 어렵습니다.

현실적으로는 클라우드 GPU를 빌려 돌리거나, 나중에 나올 축소판과 양자화 버전을 기다리는 쪽이 될 가능성이 큽니다.

높이 떨어져 떠 있는 두 개의 거대한 어두운 프리즘과 그 아래 훨씬 작은 청록 프리즘이 있는 이미지 — 위에 남은 두 모델과의 위치를 표현했습니다

6000억 파라미터를 집에서 돌릴 수 있나요

솔직히 말씀드리면 지금 구성으로는 어렵습니다. 가중치를 메모리에 올리는 것만으로도 수백 기가바이트가 필요합니다.

계산에 쓰이는 것이 270억뿐이어도 파일 자체는 전부 어딘가에 있어야 합니다. 활성 파라미터가 적다는 것은 속도가 빠르다는 뜻이지 용량이 작다는 뜻이 아닙니다.

가정에서 로컬 AI를 돌리신다면 이런 대형 모델은 API로 쓰고 작은 모델을 로컬에 두는 조합이 현실적입니다.

프리뷰라는 이름에 담긴 단서

프리뷰라는 꼬리표는 보통 두 가지를 뜻합니다. 아직 다듬는 중이라는 것, 그리고 정식판이 뒤에 온다는 것입니다.

실제로 몇몇 분석은 긴 맥락을 끝까지 안정적으로 쓰는 부분과 일부 영역의 편차를 남은 과제로 꼽습니다.

업무에 바로 넣기보다는 시험용 작업으로 먼저 감을 잡아 보시길 권합니다. 정식판이 나오면 성능과 가격이 다시 조정될 가능성도 있습니다.

모서리를 따라 강한 청록 빛이 흐르는 밝은 정육면체 이미지 — 10월 15일 가중치 공개를 표현했습니다

저시력 사용자에게 이 소식이 갖는 의미

값싼 긴 맥락 모델은 화면을 읽기 어려운 분들에게 실질적인 도움이 됩니다. 긴 문서를 통째로 넣고 필요한 부분만 말로 정리해 달라고 할 수 있기 때문입니다.

비용이 내려가면 이런 사용 방식을 마음 편히 반복할 수 있습니다. 요금이 비싸면 꼭 필요할 때만 아껴 쓰게 되는데, 그러면 도구가 일상에 들어오지 못합니다.

가중치가 공개돼 로컬에서 돌릴 수 있게 되면 한 걸음 더 나아갑니다. 개인 문서를 바깥에 보내지 않고도 같은 도움을 받을 수 있습니다.

한국 개발자가 지금 확인해 둘 것

첫째는 한국어 성능입니다. 공개된 벤치마크는 영어와 코딩 위주라 한국어 품질은 직접 시험해 보셔야 합니다.

둘째는 데이터가 어디로 가는지입니다. 중국 사업자의 API를 쓰실 때는 회사의 보안 규정을 먼저 확인하시는 편이 안전합니다.

셋째는 10월 15일입니다. 가중치가 실제로 공개되는지, 어떤 라이선스가 붙는지에 따라 선택지가 완전히 달라집니다.

작은 청록 구체를 중심으로 점점 커지고 밝아지는 세 개의 고리가 퍼져 나가는 이미지 — 상하이 스타트업의 성장을 표현했습니다

핵심 정리

스텝펀이 9월 20일 스텝5 프리뷰를 공개했습니다. 6000억 파라미터 중 270억만 쓰는 스파스 MoE이고 맥락은 100만 토큰, 출력은 6만 4천 토큰입니다.

가격은 입력 100만 토큰당 1달러, 출력 2달러 70센트, 캐시가 맞으면 5센트입니다. 인텔리전스 인덱스 44점으로 같은 가격대 중앙값 24점을 크게 웃돕니다.

코딩과 터미널 작업 벤치마크에서 가중치 공개 모델 중 선두이고 앞에는 클로드 오퍼스 5와 GPT-6 아스트라 정도가 남았습니다. 가중치 공개는 10월 15일 예정입니다.

참고하실 만한 것

SVIL 블로그에서는 새 AI 모델이 나올 때마다 성능과 가격을 함께 짚어 정리하고 있습니다. 숫자만 나열하지 않고 실제로 무엇이 달라지는지를 같이 적으려 합니다.

로컬에서 AI를 돌리는 방법, 저시력 환경에서 쓰기 좋은 설정에 대한 글도 함께 올리고 있으니 편하실 때 둘러보셔도 좋겠습니다.

읽으시다가 더 알고 싶은 부분이 있으시면 아래 메일로 알려 주세요. 다음 글에 반영하겠습니다.

출처


협업문의 : kuroicode@gmail.com
블로그 : https://blog.svil.dev/
홈페이지 : https://svil.dev/