7월 16일, 중국 Moonshot AI가 Kimi K3를 공개했습니다. 총 파라미터 2.8조(2.8T) — 지금까지 공개된 오픈 웨이트 모델 중 가장 큽니다. 숫자만 보면 그저 또 하나의 대형 모델 발표처럼 보이지만, 이 릴리스가 업계에서 유독 시끄러운 이유는 크기가 아니라 어떻게 그 크기를 감당했는가에 있습니다.
미국의 반도체 수출 통제로 최신 학습용 가속기를 살 수 없는 회사가, 컴퓨트를 무한정 늘리는 정공법을 포기하고 아키텍처와 메모리 쪽으로 우회해 프런티어 근처까지 올라왔습니다. 그 결과 Kimi K3는 사람이 직접 투표하는 코딩 아레나에서 Claude Fable 5를 밀어내고 1위에 올랐고, 동시에 Moonshot 스스로 “Fable 5와 GPT-5.6 Sol에는 아직 못 미친다”고 인정하는 이중적인 성적표를 받았습니다.
이 글에서는 Kimi K3를 스펙 → 벤치마크 → 아키텍처 3대 알고리즘 → 메모리 전략 → 가격 → 실사용 → 한계와 논란 → 중국 오픈 웨이트 지형도까지 순서대로 해부합니다. 공식 기술 블로그에 실린 수치를 기준으로 삼고, 확인되지 않은 주장은 그렇다고 분명히 표시했습니다.
Kimi K3 스펙 한눈에 정리
Kimi 공식 워드마크 로고 — 출처: Moonshot AI
먼저 숫자부터 정리하겠습니다. 이 표 하나만 이해하면 아래 내용의 8할은 따라올 수 있습니다.
| 항목 | 값 | 이게 왜 중요한가 |
|---|---|---|
| 총 파라미터 | 2.8조 (2.8T) | 공개된 오픈 웨이트 모델 중 최대 — 3조급에 처음 진입 |
| 구조 | MoE (전문가 혼합) | 전체를 다 켜지 않고 일부만 켜서 연산비를 낮춤 |
| 전문가 수 | 896개 중 토큰당 16개 활성 | 희소성 98.2% — 극단적으로 성긴 라우팅 |
| 토큰당 활성 파라미터 | 약 500억 (50B) | 2.8조를 담고도 실연산은 500억급 |
| 컨텍스트 윈도 | 1,048,576 토큰 (100만) | 대형 저장소 전체·장편 문서를 한 번에 적재 |
| 기본 출력 한계 | 131,072 토큰 (최대 100만) | 한 번에 수천 줄 생성 가능 |
| 멀티모달 | 네이티브 비전(vision) 내장 | 스크린샷·문서·차트를 별도 모델 없이 이해 |
| 추론 모드 | Thinking 상시 활성 (기본 max) | 끌 수 없음 — 비용 구조에 직결 |
| 정밀도 | MXFP4 가중치 / MXFP8 활성값 | 4비트 학습 인식 양자화로 메모리 1/4 |
| 가중치 용량 | 약 1.4TB (FP16 환산 5.6TB) | 그래도 데이터센터급 — 개인 GPU 불가 |
| API 가격 | $3.00 입력 / $15.00 출력 (100만 토큰당) | 약 4,200원 / 21,000원 — Sonnet급 |
| 공개 일정 | 7월 16일 API · 7월 27일까지 가중치 | 이 글을 쓰는 오늘이 가중치 공개 예정일 |
“2.8조 파라미터를 담고, 그중 500억만 켜서, 100만 토큰을 4비트로 굴린다.”
역대 최대 오픈 웨이트라는 말의 정확한 뜻
오픈 소스가 아니라 오픈 웨이트입니다
먼저 용어를 정리하겠습니다. Kimi K3는 흔히 오픈 소스 모델로 보도되지만, 정확한 표현은 오픈 웨이트(open weight, 가중치 공개) 입니다. 학습이 끝난 모델의 가중치 파일을 내려받아 자기 서버에서 돌릴 수 있게 공개하는 방식이고, 학습에 쓴 데이터셋·학습 코드·전체 레시피까지 다 공개하는 전통적 오픈 소스와는 다릅니다.
- 공개되는 것: 모델 가중치, 모델 구조 정보, 추론에 필요한 설정
- 공개되지 않는 것: 학습 데이터 구성, 전체 학습 파이프라인, 내부 평가 하네스 상세
- 라이선스: 가중치 배포와 함께 확정 예정 (주: 직전 세대 Kimi K2는 Modified MIT 라이선스로 배포됐습니다.)
그래도 의미는 큽니다. API 호출만 가능한 폐쇄 모델과 달리, 가중치를 받으면 망 분리 환경에 자체 배포하거나 자사 데이터로 추가 학습하는 게 가능해집니다. 규제 산업·공공·국방처럼 데이터를 외부로 못 보내는 조직에는 이게 유일한 프런티어급 선택지입니다.
얼마나 큰가 — 숫자로 비교
| 모델 | 총 파라미터 | 공개 방식 | 비고 |
|---|---|---|---|
| Kimi K3 | 2.8조 | 오픈 웨이트 | 3조급 최초 진입 |
| DeepSeek V4 Pro | 약 1.6조 | 오픈 웨이트 (MIT) | K3가 약 75% 더 큼 |
| Kimi K2.6 (직전 세대) | 약 1조 | 오픈 웨이트 | K3가 약 2.8배 |
| GLM-5.2 (Z.ai) | 비공개 | 오픈 웨이트 (MIT) | 지수 기준 오픈 진영 선두였음 |
| Claude Fable 5 / GPT-5.6 Sol | 비공개 | 폐쇄 (API) | 파라미터 미공개 |
한 가지 흥미로운 통계가 있습니다. 오픈 모델 크기의 상한선을 Kimi 계열이 최근 12개월 중 9개월간 쥐고 있었다는 점입니다. 오픈 진영의 대형화 경쟁을 사실상 Moonshot AI가 끌고 왔다는 뜻입니다.
벤치마크 정면 대결 — 프런티어와 몇 점 차이인가
Kimi K3가 프롬프트 한 번으로 생성한 3D 오픈월드 게임 데모 — 출처: Moonshot AI
위 이미지는 Moonshot AI가 공식 기술 블로그에 올린 Kimi K3의 실제 생성 결과물입니다. 프롬프트에서 출발해 브라우저에서 돌아가는 3D 오픈월드를 만들어낸 데모인데, 아래 코딩 벤치마크 수치가 실제로 어떤 산출물로 나타나는지 보여주는 사례입니다.
코딩·소프트웨어 엔지니어링 (최대 추론 노력 기준)
아래는 Moonshot AI 공식 발표 수치입니다. 모두 max reasoning effort 조건에서 측정된 값이라, 실사용 기본 설정과는 차이가 날 수 있습니다.
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 88.3 [2위] | 84.6 | 88.8 | 84.6 | 83.4 |
| Program Bench | 77.8 [1위] | 76.8 | 77.6 | 71.9 | 70.8 |
| SWE Marathon | 42.0 [1위] | 35.0 | 39.0 | 40.0 | 14.0 |
| FrontierSWE | 81.2 | 86.6 | — | — | — |
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 |
읽는 법이 중요합니다. Terminal-Bench 2.1에서 K3는 88.3으로 2위인데, 1위 GPT-5.6 Sol과 격차가 0.5점입니다. Program Bench·SWE Marathon에서는 아예 1위를 가져갔습니다. 반면 FrontierSWE에서는 81.2 대 86.6으로 5.4점 뒤처지고, DeepSWE에서도 하위권입니다.
즉 어떤 벤치마크를 고르느냐에 따라 K3는 1위이기도 하고 3~4위이기도 합니다. 발표 자료에서 유리한 지표만 뽑아 쓰기 쉬운 구간이라, 표 전체를 봐야 합니다.
에이전트·지식 업무·멀티모달
| 벤치마크 (분야) | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| BrowseComp (에이전트 웹 탐색) | 91.2 [1위] | 88.0 | 90.4 |
| DeepSearchQA (심층 검색, F1) | 95.0 [1위] | 94.2 | — |
| GPQA-Diamond (대학원급 과학 추론) | 93.5 | 92.6 | 94.1 |
| MMMU-Pro (전문가급 멀티모달) | 81.6 | 81.2 | 83.0 |
| CharXiv (차트 이해, Python 병용) | 91.3 | 93.5 | 89.1 |
| GDPval-AA v2 (지식 업무, Elo) | 1,668 | 1,760 | 1,748 |
| AutomationBench (업무 자동화) | 30.8 | — | — |
| SpreadsheetBench 2 (스프레드시트) | 34.8 | — | — |
| MathVision (시각 수학) | 97.8 | — | — |
| OmniDocBench (문서 파싱) | 91.1 | — | — |
여기서 K3의 성격이 드러납니다. 웹을 뒤지고 문서를 읽고 도구를 호출하는 에이전트형 작업(BrowseComp 91.2, DeepSearchQA 95.0, OmniDocBench 91.1)에서는 프런티어를 앞서거나 동급인데, 범용 지식 업무 품질(GDPval-AA v2 1,668 대 1,760)에서는 Fable 5에 92점 차이로 벌어집니다.
(주: MMMU 계열은 측정 하네스에 따라 점수 차가 큽니다. 독립 평가 플랫폼에서는 같은 모델의 MMMU-Pro 점수가 훨씬 낮게 나온 사례도 있어, 위 수치는 공식 발표 기준으로만 받아들이는 게 안전합니다.)
Frontend Code Arena 1위 — 사람 눈으로 뽑은 첫 오픈 모델
Kimi K3가 생성한 야경 도시 웹 스윙 인터랙션 데모 — 출처: Moonshot AI
벤치마크 표보다 업계가 더 크게 반응한 건 이쪽입니다. LMArena의 Frontend Code Arena에서 Kimi K3가 1,679점으로 1위에 올라 Claude Fable 5를 끌어내렸습니다.
Frontend Code Arena가 뭔가
- 모델에게 같은 프롬프트로 실제 HTML·CSS·JavaScript를 생성시킵니다.
- 두 결과물을 나란히 놓고 사람이 어느 쪽이 나은지 블라인드 투표합니다.
- 그 승패를 Elo 방식으로 누적해 순위를 냅니다.
정답이 정해진 자동 채점이 아니라 사람의 선호를 재는 지표라는 점이 핵심입니다. 자동 벤치마크는 하네스 설정·프롬프트 최적화로 점수를 끌어올릴 여지가 있지만, 블라인드 인간 투표는 그 여지가 훨씬 작습니다.
점프 폭이 더 놀랍습니다
| 항목 | 내용 |
|---|---|
| 순위 | 1위 (1,679점) — Claude Fable 5 추월 |
| 직전 세대 순위 | Kimi K2.6은 18위 → 17계단 상승 |
| 세부 도메인 | 7개 중 6개에서 1위 |
| 1위 도메인 | 브랜드·마케팅, 레퍼런스 기반 디자인, 데이터·분석, 소비자 제품, 시뮬레이션, 콘텐츠 제작 도구 |
| 유일한 2위 | 게임 — Fable 5에 밀림 |
한 세대 만에 18위에서 1위로 올라간 건 단순한 파라미터 증설로 설명되지 않습니다. 아래에서 다룰 3가지 아키텍처 변경이 그 간격을 만들었다는 게 Moonshot의 주장입니다.
종합 지능 지수와 작업당 비용 — 냉정한 3위
인간 투표에서 1위를 했다고 전 영역 1위는 아닙니다. 독립 평가 기관 Artificial Analysis의 종합 지능 지수(Intelligence Index v4.1) 기준으로 보면 위치가 더 정확하게 보입니다.
| 모델 | 종합 지능 지수 | 작업 1건당 비용 | 원화 환산 |
|---|---|---|---|
| Claude Fable 5 | 60 | $2.75 | 약 3,850원 |
| GPT-5.6 Sol | 59 | $1.04 | 약 1,456원 |
| Kimi K3 | 57.1 | $0.94 | 약 1,316원 |
| Claude Opus 4.8 | 57.1 미만 | $1.80 | 약 2,520원 |
- 전체 189개 모델 중 4위, 모델 패밀리 단위로 묶으면 3위 수준입니다.
- GPT-5.6 Sol의 최고 설정과는 지수 차이가 0.54점으로, 측정 오차 범위에 가깝습니다.
- 그런데 작업 1건당 비용은 K3가 가장 저렴합니다. Fable 5의 약 1/3 수준입니다.
단, 숨은 비용이 있습니다
평가 기관은 K3가 동급 모델 중위값의 약 2배에 달하는 출력 토큰을 뱉었다고 지적했습니다. Thinking이 상시 켜져 있고 기본값이 최대 노력이라, 추론 과정에서 토큰을 많이 씁니다.
실제로 한 테스트에서는 네 번의 요청이 사용 가능한 4,096 완성 토큰 중 4,093 토큰을 추론에만 쓰고 출력 한계에 걸려 답을 하나도 반환하지 못한 사례가 보고됐습니다. 단가가 싸다고 총비용이 싸지는 게 아니라는 뜻이고, 프로덕션에 붙일 때는 출력 토큰 상한을 넉넉하게 잡는 게 필수입니다.
아키텍처 해부 ① Stable LatentMoE — 896명 중 16명만 출근한다
896개 전문가 중 16개만 선택적으로 활성화되는 희소 라우팅 개념도 — 출처: Moonshot AI 공식 발표 아키텍처 기반 자가 생성
MoE란 무엇인가
MoE(Mixture of Experts, 전문가 혼합) 는 모델 내부를 여러 개의 전문가(expert) 로 쪼개고, 입력 토큰마다 일부 전문가만 골라 켜는 구조입니다. 어떤 전문가를 켤지 고르는 부품을 라우터(router) 라고 부릅니다.
- 밀집(dense) 모델: 토큰 하나를 처리할 때 파라미터 전체가 계산에 참여
- MoE 모델: 토큰 하나에 극히 일부만 참여 → 같은 파라미터 수로 연산비 대폭 절감
Kimi K3는 이 구조를 극단까지 밀었습니다. 전문가 896개 중 토큰당 16개 — 비율로 1.8%, 뒤집으면 희소성 98.2% 입니다. 그래서 총 2.8조 파라미터를 담고도 토큰당 실제 연산은 500억 파라미터급에 머무릅니다.
극단적 희소성의 함정 — 죽은 전문가
희소성을 높일수록 문제가 하나 커집니다. 라우터가 특정 전문가만 계속 고르면, 나머지 전문가는 학습 신호를 못 받아 죽은 전문가(dead expert) 가 됩니다. 파라미터는 메모리를 잡아먹는데 아무 기여도 못 하는 상태입니다. 라우팅이 무너지면 모델 전체가 붕괴합니다.
Moonshot이 K3에 넣은 대응책이 Stable LatentMoE이고, 네 가지 장치로 구성됩니다.
| 장치 | 역할 |
|---|---|
| Quantile Balancing | 라우터 점수의 분위수에서 전문가 배분을 직접 유도 — 특정 전문가 독점을 구조적으로 차단 |
| Latent-space routing | 잠재 공간에서 라우팅해 전문가별 전문화를 토큰 단위로 분석 가능하게 함 |
| Soft dropping | 특정 전문가로 토큰이 넘칠 때(overflow) 부드럽게 흘려보내 학습 안정화 |
| Per-Head Muon + SiTU | 헤드별 최적화와 Sigmoid Tanh Unit 활성 함수로 죽은 뉴런 발생 억제 |
여기에 Gated MLA(메모리 효율적 KV 캐시 관리)까지 붙어, Moonshot은 K3가 직전 세대 K2 대비 종합 스케일링 효율 약 2.5배를 달성했다고 밝혔습니다. 같은 컴퓨트를 넣었을 때 능력으로 전환되는 비율이 2.5배 좋아졌다는 주장입니다.
“컴퓨트를 못 늘리면, 컴퓨트당 효율을 2.5배로 만든다.”
아키텍처 해부 ② Kimi Delta Attention — 채널마다 다른 망각률
어텐션의 근본 비용 문제
트랜스포머의 어텐션(attention)은 토큰마다 다른 모든 토큰을 참조하기 때문에, 시퀀스 길이가 N일 때 연산량이 O(N²) 로 늘어납니다. 컨텍스트가 1,000 토큰이면 100만 번, 100만 토큰이면 1조 번 수준으로 폭발합니다. 100만 토큰 컨텍스트를 정직하게 구현하면 비용이 감당되지 않습니다.
대안이 선형 어텐션(linear attention) 입니다. 과거 정보를 하나의 순환 상태(recurrent state) 에 압축해서 들고 가는 방식으로, 비용이 길이에 비례해 늘어납니다. 대신 압축 과정에서 정보가 손실돼 품질이 떨어지는 게 고질적 약점이었습니다.
KDA의 핵심 아이디어 — 망각을 차원별로 쪼갠다
Kimi Delta Attention(KDA) 는 이 순환 상태가 어떻게 잊어버리는가를 손봤습니다.
- 기존 방식: 상태 전체에 하나의 스칼라 감쇠율을 곱해 균일하게 잊는다
- KDA: 상태의 차원마다 독립적인 망각률을 준다 — 스칼라 곱 대신 대각 행렬을 쓴다
효과가 직관적입니다. 어떤 채널은 “함수 시그니처” 같은 장기 정보를 오래 붙잡고, 다른 채널은 “직전 줄의 변수명” 처럼 금방 버려도 되는 정보를 빨리 흘려보낼 수 있습니다. 균일하게 잊으면 둘 중 하나를 반드시 희생해야 했던 트레이드오프가 풀립니다.
그리고 전부 선형으로 가지는 않았습니다
K3는 선형 어텐션 레이어와 주기적인 전체(full) 어텐션 레이어를 3:1 비율로 교차시킵니다. 대부분은 값싼 선형으로 처리하되, 네 번째마다 정직한 전체 어텐션을 끼워 넣어 표현력 손실을 막는 하이브리드입니다.
| 지표 | 개선 폭 |
|---|---|
| 프리필(prefill) 속도 | H20 GPU 기준 1.72~2.22배 |
| 디코딩 속도 (100만 토큰 컨텍스트) | 최대 6.3배 |
| KV 캐시 사용량 | 최대 75% 감소 |
| 품질 | 공정 비교에서 전체 MLA와 동등 이상 |
KV 캐시(입력을 처리하며 쌓아두는 중간 결과 저장소)가 75% 줄었다는 게 특히 중요합니다. 100만 토큰 구간에서는 KV 캐시가 모델 파라미터보다 더 큰 메모리를 먹는 지배적 소비자가 되기 때문입니다. 이 절감이 K3가 100만 토큰 전 구간에 롱컨텍스트 할증 없이 균일 단가를 매길 수 있는 근거입니다.
아키텍처 해부 ③ Attention Residuals — 깊이를 검색 문제로 바꾸다
잔차 연결의 한계
잔차 연결(residual connection) 은 각 레이어의 출력에 입력을 그대로 더해주는 기법입니다. 덕분에 아주 깊은 신경망도 학습이 가능해졌고, 현대 트랜스포머의 표준 부품이 됐습니다.
문제는 이 더하기가 모든 레이어에 균일하게 일어난다는 점입니다. 층이 아주 깊어지면 초기 레이어가 만든 유용한 표현이 이후 수십 개 레이어의 출력에 섞여 희석(signal dilution) 됩니다. 깊이를 늘려도 그 깊이를 제대로 못 쓰는 상태가 됩니다.
AttnRes의 발상 전환
Attention Residuals(AttnRes) 는 깊이를 누적 문제가 아니라 검색 문제로 재정의합니다.
각 레이어가 질의(query)처럼 행동해서, 이전의 모든 레이어를 되돌아보며 지금 필요한 표현만 골라 가져옵니다. 균일하게 다 더하는 게 아니라, 선택적으로 회수(retrieve) 하는 겁니다. K3는 연산 부담을 줄이기 위해 Block AttnRes를 씁니다 — 블록 내부는 기존 잔차를 쓰고, 블록 사이에만 이 어텐션 방식을 적용하는 절충안입니다.
| 지표 | 결과 |
|---|---|
| GPQA-Diamond 개선 | +7.5점 |
| 컴퓨트 등가 효과 | 컴퓨트를 25% 더 투입한 베이스라인과 동급 |
| 추가 연산 비용 | 2% 미만 |
2% 미만의 오버헤드로 25% 컴퓨트 증설과 같은 효과를 냈다는 건, 컴퓨트를 살 수 없는 회사에게 정확히 필요했던 종류의 개선입니다.
3대 알고리즘 요약
| 알고리즘 | 무엇을 바꿨나 | 핵심 수치 |
|---|---|---|
| Kimi Delta Attention | 순환 상태의 망각률을 차원별로 분리 (스칼라 → 대각 행렬), 선형·전체 어텐션 3:1 하이브리드 | 디코딩 최대 6.3배, KV 캐시 75% 절감 |
| Attention Residuals | 깊이를 누적이 아닌 검색으로 재정의, 레이어가 이전 레이어를 질의 | GPQA +7.5점, 컴퓨트 25% 등가, 오버헤드 2% 미만 |
| Stable LatentMoE | 896개 중 16개만 켜는 98.2% 희소 라우팅을 붕괴 없이 안정화 | K2 대비 스케일링 효율 2.5배 |
컴퓨트가 아니라 메모리에 건 베팅 — MXFP4 양자화
4비트 양자화로 모델 메모리 사용량을 4분의 1로 압축하는 개념도 — 출처: Moonshot AI 공식 발표 수치 기반 자가 생성
K3의 설계 철학을 한 문장으로 압축하면 컴퓨트를 메모리로 바꿔치기했다는 것입니다. 그 대표 장치가 양자화입니다.
MXFP4 가중치 + MXFP8 활성값
양자화(quantization) 는 숫자를 더 적은 비트로 저장해 용량과 대역폭을 줄이는 기법입니다. 통상 모델은 가중치를 16비트로 저장하는데, K3는 4비트(MXFP4) 로 저장합니다. 가중치마다 블록 단위 스케일 팩터를 붙여 4비트 부동소수점으로 담고, 수치가 불안정해지기 쉬운 중간 활성값은 8비트(MXFP8) 로 처리해 안정성을 지킵니다.
결정적인 차이는 언제 양자화하는가입니다.
- 일반적 방식(사후 양자화): 16비트로 다 학습한 뒤 4비트로 눌러 담는다 → 품질 손실 발생
- K3 방식(QAT): 지도 미세조정(SFT) 단계부터 양자화를 인식한 채로 학습한다 → 모델이 4비트 환경에 적응한 상태로 완성
| 항목 | FP16 기준 | K3 (MXFP4) | 효과 |
|---|---|---|---|
| 가중치 용량 | 약 5.6TB | 약 1.4TB | 4분의 1 |
| 메모리 대역폭 부담 | 기준 | 4배 감소 | 추론 처리량 확보 |
| 하드웨어 네이티브 지원 | — | NVIDIA Blackwell, AMD MI400 | 최신 가속기에서 직접 처리 |
여기에 묘한 아이러니가 있습니다
MXFP4를 네이티브로 지원하는 대표 하드웨어가 NVIDIA Blackwell 계열인데, 미국은 Blackwell 세대의 중국 수출을 전면 제한하고 있습니다. Moonshot은 이 선택을 “폭넓은 하드웨어 호환성을 위해” 라고 설명했는데, 업계에서는 NVIDIA 이외의 실리콘(중국산 가속기 포함)에서 돌릴 준비로 읽는 해석이 나왔습니다.
메모리는 모을 수 있지만 컴퓨트는 모을 수 없다
Moonshot은 K3 운용에 64개 이상의 가속기를 하나의 메모리 시스템으로 묶는(supernode) 구성을 권장합니다. 이 방식이 전략의 핵심입니다.
- 메모리: 성능이 평범한 칩을 여러 개 엮어 총량을 합산할 수 있다
- 학습급 컴퓨트: 같은 식으로 합산되지 않는다 — 최상급 칩이 반드시 필요하다
MoE로 연산량을 줄이면 남는 요구는 전체 파라미터를 메모리에 상주시키는 것이고, 그건 칩을 많이 엮어서 해결됩니다. 이 구조는 Huawei의 CloudMatrix 아키텍처가 지향하는 방향과 같습니다. 즉 수출 통제가 막은 쪽(최상급 학습 컴퓨트)을 피해, 아직 모을 수 있는 쪽(메모리 총량)으로 설계를 밀어붙인 것입니다.
수출 통제의 그림자 — H200S·L20·이름 없는 GPGPU
회사가 직접 밝힌 제약
Moonshot AI 사장 Yutong Zhang은 이렇게 말했습니다.
우리에게는 컴퓨트를 그냥 늘리는 사치가 없다는 걸 알고 있었습니다.
그래서 기초 연구와 효율로 방향을 틀었고, 그 결과가 위에서 본 희소 활성 MoE 구조라는 설명입니다.
공식 블로그의 칩 테스트 목록이 말해주는 것
공식 기술 블로그의 칩 수준 성능 테스트에 등장한 하드웨어가 흥미롭습니다.
| 하드웨어 | 성격 |
|---|---|
| NVIDIA H200S | 고대역폭 메모리 탑재 상위 가속기 |
| NVIDIA L20 | 수출 규정에 맞춰 사양을 낮춰 중국에 판매되는 카드 |
| 이름을 밝히지 않은 대체 벤더 GPGPU | 명시 안 됨 — 중국산 가속기로 추정 |
특히 H200 테스트가 어디서 수행됐는지는 블로그에 나오지 않습니다. 미국이 해외 클라우드 임대를 통한 제한 가속기 우회 접근을 막는 입법을 진행한 상황이라, 이 공백 자체가 주목받았습니다.
진짜 병목은 로직이 아니라 메모리라는 신호
수출 통제 논의에서 자주 놓치는 대목이 있습니다. 2025년 8월 무역 협상에서 중국이 완화를 요청한 항목은 노광 장비나 TSMC 접근이 아니라 고대역폭 메모리(HBM) 규제였습니다.
- 중국의 연간 메모리 스택 생산 능력은 약 200만 스택 규모로 추정됩니다.
- 이는 Huawei Ascend 910C급 칩 25만~30만 개분에 그칩니다.
- 반면 반도체 제조 능력 자체는 이 병목을 훨씬 상회합니다.
Bank of America 애널리스트들은 K3를 두고 “컴퓨트 제약에도 불구하고, 대규모 사전학습과 아키텍처 작업을 결합하면 중국 플래그십 모델에서 여전히 단계적 도약이 가능함을 보여준다” 고 평가했습니다.
출시 48시간 만에 드러난 GPU 한계
전략의 취약점도 곧바로 노출됐습니다. K3는 출시 48시간 안에 GPU 용량 한계에 부딪혀 구독 판매를 일시 중단했습니다(7월 21일 보도). 모델을 만들 능력과 그 모델을 대규모로 서비스할 인프라는 별개라는 점이 확인된 셈입니다. 가중치를 공개해 외부 인프라에 부담을 분산시키는 오픈 웨이트 전략이, 이 제약 아래서는 선택이 아니라 필요일 수 있습니다.
백악관의 의혹 제기 — 확인되지 않은 주장입니다
여기서부터는 사실 확인이 끝나지 않은 영역이라 성격을 분명히 구분해 적습니다.
7월 22일, 백악관 과학기술정책실(OSTP) 실장 Michael Kratsios가 Moonshot AI를 공개적으로 지목했습니다.
| 구분 | 내용 | 상태 |
|---|---|---|
| 주장 1 | 수출 금지된 NVIDIA Blackwell GB300 칩을 확보해, 태국 서버를 경유해 접근하며 K3를 개발했다 | 미확인 주장 |
| 주장 2 | Anthropic의 Fable 모델을 대규모로 증류(distillation) 했고, 탐지를 회피하도록 설계된 내부 플랫폼을 구축했다 | 미확인 주장 |
| 근거 공개 | 백악관이 확보한 정보라고만 언급 — 구체적 증거·출처는 제시되지 않음 | 미제시 |
| Moonshot 측 반응 | 해당 보도에는 회사 측 입장이 담기지 않음 | 확인 안 됨 |
| 정책 시사 | 재무장관 Scott Bessent이 해외 모델이 “우리 훌륭한 기업들로부터 훔치고 있다면” 제재 가능성을 시사 | 검토 단계 |
용어 정리 — 증류란
증류(distillation) 는 성능이 좋은 큰 모델(교사)의 출력을 대량으로 받아, 그 응답 패턴을 다른 모델(학생)에게 학습시키는 기법입니다. 개발 비용을 크게 줄일 수 있지만, 대부분의 상용 API 이용 약관에서는 경쟁 모델 학습 목적의 출력 사용을 금지하고 있습니다.
제재로 되돌릴 수 없는 구조
한 가지 지적할 점이 있습니다. K3의 가중치는 이미 전 세계에 배포되는 방향으로 공개됐습니다. 제재는 향후 행위를 억제할 수는 있어도, 이미 퍼진 모델 파일을 회수할 수는 없습니다. 오픈 웨이트 배포는 그 자체로 되돌릴 수 없는 사실을 만듭니다.
위 두 주장은 현재까지 독립적으로 검증되지 않았습니다. 이 글에서는 업계가 실제로 논의하고 있는 쟁점이라 소개하되, 확정된 사실로 다루지 않습니다.
가격표 해부 — 오픈 모델이 Sonnet급 가격으로 올라섰다
공식 API 단가 (100만 토큰당)
| 구분 | 단가 | 원화 환산 | 비고 |
|---|---|---|---|
| 입력 (캐시 히트) | $0.30 | 약 420원 | 256 토큰 초과 프리픽스 재사용 시 |
| 입력 (캐시 미스) | $3.00 | 약 4,200원 | 새 프리픽스 |
| 출력 | $15.00 | 약 21,000원 | 추론 토큰 포함 |
| 롱컨텍스트 할증 | 없음 | — | 100만 토큰 전 구간 균일 |
캐시 히트 단가가 미스의 1/10이라는 게 실전에서 큰 의미를 갖습니다. Moonshot은 코딩 워크로드에서 캐시 히트율이 90%를 넘는다고 밝혔는데, 같은 저장소·같은 시스템 프롬프트를 반복해서 보내는 코딩 에이전트는 실효 입력 단가가 표시가에 한참 못 미치게 됩니다.
경쟁 모델과 비교하면
- Claude Sonnet 5의 정가와 사실상 동급입니다 (단, Sonnet 5의 8월 프로모션가 $2/$10 기준으로는 K3가 50% 비쌉니다).
- GPT-5.6 Sol 대비 입력 약 40%, 출력 약 50% 저렴합니다.
- Claude Fable 5 대비로는 입출력 모두 약 70% 저렴합니다.
가장 중요한 변화 — 오픈 모델의 저가 정체성이 끝났습니다
| 세대 | 입력 (캐시 미스) | 출력 | 성격 |
|---|---|---|---|
| Kimi K2.6 / K2.7 Code | 기준 | 기준 | 프런티어 대비 약 10분의 1 수준의 파격가 |
| Kimi K3 | 약 3.2배 인상 | 약 3.75배 인상 | Sonnet급 정가 진입 |
직전 세대 Kimi K2.6은 Claude Opus 4.7 대비 약 10분의 1 가격이라는 파격적 위치에 있었습니다. K3는 그 할인을 스스로 접었습니다. 오픈 모델은 저렴한 대안이라는 프레임에서, 프런티어와 같은 가격표를 붙이고 정면으로 경쟁하는 제품으로 자기 정의를 바꾼 것입니다.
참고로 같은 중국 오픈 진영의 DeepSeek V4는 입력 $0.87 수준이라, 저가 구간은 여전히 다른 모델이 지키고 있습니다.
가격의 의미는 단가가 아니라 완료된 작업당 비용으로 측정해야 합니다 — 추론 오버헤드와 라우팅 신뢰성까지 포함해서.
실제로 써보는 5가지 경로
Kimi K3가 생성한 복셀 콜로세움 시뮬레이션 (FPS 120 실시간 렌더링) — 출처: Moonshot AI
| 경로 | 접근 방법 | 조건 |
|---|---|---|
| Kimi 모바일 앱 | 앱스토어에서 최신 버전 설치 | iOS · Android · HarmonyOS |
| kimi.com | 웹 에이전트 채팅 | 로그인 계정 |
| Kimi Work | 데스크톱 앱 | Windows · Apple Silicon macOS 3.1.0 이상 |
| Kimi Code | 터미널 에이전트 CLI, /model 로 전환 | OAuth 또는 API 키 |
| Kimi API | platform.kimi.ai | 최소 $1 충전 후 이용, 등급별 레이트 리밋 |
출시 프로모션도 진행 중입니다(2026년 8월 12일 PDT까지). 충전 금액에 따라 $20~$99 구간 10%, $100~$299 구간 20%, $300~$999 구간 25%, $1,000 이상 30% 보너스가 적용되며 최대 $4,000 바우처·유효기간 90일 조건입니다.
API 설정에서 반드시 알아야 할 것들
| 파라미터 | 동작 |
|---|---|
| model | **kimi-k3** (필수) · 엔드포인트 https://api.moonshot.ai/v1 |
| reasoning_effort | low / high / max (기본 **max**) — 세션 중간에 바꾸면 프리픽스 캐시가 무효화됨 |
| temperature | 1.0 고정 — 요청에 넣지 말 것 |
| top_p | 0.95 고정 — 요청에 넣지 말 것 |
| max_completion_tokens | 기본 131,072 / 최대 1,048,576 |
| thinking | 항상 활성 — 이 파라미터를 전달하지 말 것 |
| tool_choice | auto / none / required 지원 |
| response_format | JSON Schema strict 모드 지원 (content만 파싱) |
프로덕션에서 자주 밟는 함정 3가지
- **reasoning_content를 버리면 품질이 무너집니다.** 멀티턴 대화에서 이전 추론 내용을 보존하지 않거나, 세션 중간에 모델을 바꾸면 성능이 급락합니다.
- 모호한 지시에 스스로 범위를 넘어갑니다. 시스템 프롬프트를 촘촘하게 조여 놓는 게 안전합니다.
- **reasoning_effort를 세션 시작 전에 고정하세요.** 중간에 바꾸면 캐시 히트율이 떨어져 비용이 튑니다.
(주: 공식 코딩 벤치마크 점수는 Moonshot의 KimiCode 하네스에서 측정된 값입니다. 다른 에이전트 하네스에서는 같은 점수가 재현되지 않을 수 있습니다.)
셀프 호스팅 현실 점검 — 1.4TB를 어디에 올리나
가중치가 공개된다고 해서 개인이 돌릴 수 있는 모델은 아닙니다.
| 항목 | 요구 사항 |
|---|---|
| 가중치 용량 | 약 1.4TB (MXFP4) |
| 실용 최소 구성 | 8노드 × 80GB GPU 8장 (총 5.12TB) |
| 권장 구성 | 64개 이상 가속기를 단일 메모리 도메인으로 묶은 슈퍼노드 |
| 병렬화 | 전문가 병렬(expert-parallel) + HBM 도메인 사이징 |
| 서빙 스택 | vLLM (KDA 프리필 캐시 PR, 가중치 공개와 함께 반영 예정) |
| Moonshot 자체 서빙 | Mooncake — 프리필·디코드 분리 + 프리픽스 캐싱 |
현실적으로 대부분의 조직은 하드웨어를 사기보다 용량을 임대하게 됩니다. 게다가 K3의 아키텍처 혁신(KDA·AttnRes)이 아직 표준 오픈 소스 서빙 도구에 완전히 지원되지 않아, 소프트웨어 생태계가 모델을 따라잡는 시차가 존재합니다. 가중치 공개 시점 이전에 셀프 호스팅 계획을 확정하는 건 이르다는 뜻입니다.
Moonshot AI가 스스로 인정한 3가지 한계
발표 자료에서 회사가 직접 명시한 한계라, 그대로 옮깁니다.
| 한계 | 내용 |
|---|---|
| 추론 이력 민감성 | 에이전트 하네스에서 사고 과정(chain-of-thought)이 잘리면 품질이 불안정해짐 |
| 과도한 능동성 | 사소한 모호함에도 되묻지 않고 스스로 판단해 행동하는 경향 |
| 사용 경험 격차 | 벤치마크 점수와 별개로, Claude Fable 5·GPT-5.6 Sol 대비 체감 마감 품질이 뒤처짐 |
두 번째 항목이 실무에서 특히 성가십니다. 에이전트가 확인 질문을 던져야 하는 지점에서 그냥 실행해버리면, 작업 범위를 넘어선 변경이 조용히 쌓입니다. 코드 저장소를 다루는 에이전트라면 리뷰 부담으로 직결됩니다.
세 번째는 벤치마크와 체감 품질이 갈라지는 전형적 사례입니다. K3는 자동 평가에서 프런티어와 0.5점 차이까지 붙었고 사람 투표 아레나에서도 1위를 했지만, 회사 스스로 마감의 차이가 있다고 말합니다. 점수표만 보고 프로덕션 모델을 교체하면 안 되는 이유입니다.
중국 오픈 웨이트 지형도 — K3는 혼자가 아니다
K3를 단발 사건으로 보면 그림이 안 보입니다. 2026년 중국 오픈 웨이트 진영은 역할을 나눠 동시에 밀어붙이는 구도에 들어갔습니다.
| 모델 | 개발사 | 공개 시점 | 라이선스 | 승부수 |
|---|---|---|---|---|
| Kimi K3 | Moonshot AI | 2026-07-16 | 가중치와 함께 확정 예정 | 최대 규모 + 프런티어급 코딩·에이전트 |
| GLM-5.2 | Z.ai (Zhipu) | 2026-06-13 | MIT | 순수 지능과 장기 코딩 — 종합 지수 오픈 진영 선두였음 |
| DeepSeek V4 (Pro/Flash) | DeepSeek | 2026-04-24 | MIT | 가격과 알고리즘 추론 — 비용 하한선을 다시 낮춤 |
| MiniMax M3 | MiniMax | 2026-06-01 | 커스텀 커뮤니티 | 저가 100만 토큰 컨텍스트 + 네이티브 멀티모달 |
| Qwen 3.6 | Alibaba | 2026년 상반기 | 오픈 웨이트 | 접근성 — GPU 한 장에서 돌아가는 컴팩트 MoE |
특징이 두 가지 보입니다. 첫째, 라이선스가 관대합니다 — GLM-5.2와 DeepSeek V4는 MIT입니다. 둘째, 포지션이 겹치지 않습니다 — 규모(K3), 지능(GLM), 가격(DeepSeek), 컨텍스트(MiniMax), 접근성(Qwen)으로 갈라져 있습니다.
오픈 웨이트 모델이 예산 옵션에서 프런티어 랩과 정면으로 겨루는 선택지로 이동한 흐름이, 한 회사의 성과가 아니라 진영 단위 현상이라는 뜻입니다.
Moonshot AI는 어떤 회사인가 — 2년 만에 밸류 67배
회사와 창업자
- 설립: 2023년 3월, 베이징
- 창업자: Yang Zhilin — Google Brain·Meta AI 연구자 출신. 공동창업자 3인은 칭화대 동문
- 초기 강점: 초장문 컨텍스트 처리로 이름을 알림 → 이후 오픈 웨이트 대형 모델(Kimi K2 계열)과 에이전트 코딩으로 축을 옮김
- 제품 브랜드: Kimi (회사명은 Moonshot AI)
자금 조달 궤적
| 시점 | 라운드 | 기업가치 | 원화 환산 |
|---|---|---|---|
| 2023-06 | 엔젤 | $3억 | 약 4,200억원 |
| 2025-12 | 시리즈 C ($5억, IDG Capital 주도 · Alibaba·Tencent 참여) | $43억 | 약 6조원 |
| 2026-05 | $20억 규모 라운드 | $200억 | 약 28조원 |
| (보도) | 프리 IPO 추진 | 목표 $500억 | 약 70조원 |
2년 만에 약 67배입니다. 특히 2025년 말 $43억에서 2026년 5월 $200억으로, 6개월 만에 약 5배 뛰었습니다. 2026년 5월 라운드는 당시 중국 LLM 부문 단일 최대 규모 조달이었습니다. 최대 외부 주주는 Alibaba로 약 36% 지분을 보유한 것으로 추정됩니다.
가중치를 공짜로 공개하는 회사에 이 정도 자금이 몰리는 구조가 흥미롭습니다. 오픈 웨이트는 자선이 아니라 유통 전략입니다. 모델이 표준으로 깔리면 API·엔터프라이즈 계약·클라우드 파트너십으로 수익화 경로가 열립니다.
그래서 무엇이 달라지나 — 3가지 관전 포인트
1. 오픈 웨이트와 프런티어의 시차가 몇 달 단위로 좁혀졌습니다
Terminal-Bench 2.1에서 0.5점, 종합 지능 지수에서 0.54점 차이입니다. 측정 오차 범위에 들어왔습니다. 가중치를 받아 자체 배포할 수 있는 모델이 이 위치에 왔다는 건, 데이터를 외부로 보낼 수 없는 조직의 선택지가 근본적으로 달라졌다는 뜻입니다.
2. 아키텍처가 컴퓨트를 부분적으로 대체할 수 있음이 실증됐습니다
AttnRes 하나가 오버헤드 2% 미만으로 컴퓨트 25% 증설과 같은 효과를 냈고, 세 알고리즘을 합쳐 스케일링 효율 2.5배를 얻었습니다. 컴퓨트 총량만이 능력을 결정한다는 전제에 예외가 생겼습니다. 다만 이건 상한을 없앤 게 아니라 주어진 컴퓨트를 더 잘 쓴 것이고, 출시 48시간 만에 GPU 용량에 막힌 사실이 그 한계를 보여줍니다.
3. 오픈 모델의 저가 정체성이 끝났습니다
K3는 직전 세대 대비 입력 3.2배·출력 3.75배 인상을 감행해 Sonnet급 가격표를 붙였습니다. 앞으로 오픈 모델을 고를 때 싸니까라는 근거는 약해집니다. 남는 근거는 자체 배포 가능성, 파인튜닝 자유도, 벤더 종속 회피이고, 이건 가격보다 훨씬 전략적인 판단 영역입니다.
Kimi K3는 컴퓨트를 살 수 없는 조건에서 아키텍처와 메모리로 프런티어 근처까지 올라온 모델입니다 — 점수표는 거의 붙었고, 마감의 차이는 회사 스스로 인정했습니다.
마지막으로 하나 짚고 갑니다. 이 글의 수치는 대부분 Moonshot AI가 자체 하네스로 측정해 발표한 값이고, 가중치 공개는 오늘(7월 27일)까지로 예고돼 있습니다. 독립적인 재현 검증은 가중치가 실제로 풀린 뒤에야 가능합니다. 발표 수치와 커뮤니티 재현 결과가 얼마나 일치하는지가, K3의 진짜 성적을 결정할 다음 관문입니다.
참고 출처
- [Kimi / Moonshot AI] Kimi K3 Tech Blog: Open Frontier Intelligence (공식 기술 블로그 — 아키텍처·벤치마크·한계)
- [Kimi API Platform] Kimi K3 Quickstart (모델 ID·파라미터·가격·프로모션)
- [VentureBeat] China’s Moonshot AI releases Kimi K3, the largest open-source model ever, rivaling top U.S. systems
- [Artificial Intelligence News] Kimi K3 open-weight model: China’s biggest AI is a bet on memory, not compute (칩 테스트·HBM 병목·Yutong Zhang 발언)
- [Hugging Face Blog] Kimi K3 Model Overview: 2.8T Parameters, MXFP4 Quantization, and What the Open Weights Mean for the Community
- [Ken Huang / Substack] Demystifying Kimi K3: The Three Algorithms Behind the #1 Frontend Coding Model (KDA·AttnRes·Stable LatentMoE 해설)
- [Trilogy AI] Kimi K3 Is Live: Pricing, Benchmarks, and the Wait for Public Weights (Artificial Analysis 지수·작업당 비용)
- [Arena.ai] Frontend Code Arena 1위 발표 (1,679점 · 6/7 도메인 1위)
- [Tom’s Hardware] China’s 2.8-trillion-parameter Kimi K3 beats Claude Fable 5 in Frontend Code Arena benchmark
- [TechTimes] Kimi K3 Subscription Pause Exposes GPU Crunch Behind Open-Weight Strategy
- [TFTC] White House: Moonshot AI Accessed Banned Nvidia GB300 Chips to Build Kimi K3 (미확인 주장 — 백악관 OSTP 발언 보도)
- [TechCrunch] China’s Moonshot AI raises $2B at $20B valuation as demand for open source AI skyrockets
- [Forbes] Chinese AI Model Developer Kimi Raising Funds Valuing It At $20 Billion
- [Kingy AI] Best Open-Weight AI Models in 2026: GLM-5.2 vs DeepSeek V4 vs Kimi K2.6 vs Qwen vs Mistral (중국 오픈 웨이트 지형도)
- 환율: 1달러 ≈ 1,400원 기준 환산