2026년 7월 20일 월요일

생각정리 314 (* Kimi K3, 추가 제재-1)

자기 전 침대에 누워 X.com App을 켰다가,
추천 알고리즘을 통해 과거 Kimi 창업자의 GTC 강연 영상을 보게 됐다.

How We Scaled Kimi K2.5 | Zhilin Yang's full GTC 2026 Keynote

영상에서는 Kimi가 적용한 새로운 학습기법과 모델 구조, 효율화 성과가 자신감 있게 소개되고 있었다. 그런데 발표를 볼수록 기술적 감탄보다 묘한 불쾌감이 먼저 밀려왔다.

Claude를 상대로 한 대규모 비인가 증류 의혹이 제기된 상황에서도, Kimi의 성과는 마치 온전히 자체적인 연구와 기술혁신만으로 만들어진 결과처럼 설명되고 있었다.

내가 Anthropic이나 다른 Frontier LLM 개발에 참여한 연구자였다면, 이처럼 태연하게 기술적 성과를 나열하는 모습을 보며 상당한 허탈감과 어처구니없음을 느꼈을 것 같다.

이번 글에서는 화려한 Kimi K3의 성과 뒤에 가려진 데이터의 출처와 자본의 성격, 그리고 이를 모두 생략한 채 독자적인 기술혁신만을 강조하는 그들의 뻔뻔함에 대해 기록해보고자 한다.  


https://t.me/givme23
claude를 불법 증류 복제했다는 증거..


Kimi3 은 Fable5 를 증류 ( distillation ) 했을 가능성 ( 파란색에 가까울 수록 답변 유사도가 높음 )
https://t.me/migukstocksailor


효율화 뒤에 가려진 비용


Kimi K3는 순수한 기술 혁신의 결과인가


최근 중국 Moonshot AI의 창업자 양즈린이 NVIDIA GTC 무대에서 Kimi 모델의 확장 전략을 설명했다.

발표만 놓고 보면 Kimi의 급성장은 상당히 인상적이다. 새로운 최적화 알고리즘과 Attention 구조를 도입해 학습 효율을 높였고, 긴 문맥과 다수의 에이전트를 동시에 처리할 수 있도록 모델 구조를 개선했다.

이후 Moonshot은 총 2.8조 개의 파라미터를 보유한 Kimi K3를 공개했다. K3는 896개 전문가 가운데 토큰당 16개만 선택적으로 활성화하는 Sparse MoE 구조를 사용하며, Kimi Delta Attention과 Attention Residuals를 결합했다. Moonshot은 이러한 기술을 통해 K2보다 약 2.5배 높은 스케일링 효율을 확보했다고 주장한다. (Kimi AI 플랫폼)

그러나 기술 발표와 회사가 제시한 벤치마크만으로 K3의 등장을 설명하기에는 빠진 부분이 너무 많다.

Kimi의 기술적 성과는 분명 존재한다. 다만 K3를 Moonshot AI라는 스타트업의 독자적인 기술 혁신만으로 설명하기는 어렵다.

그 배경에는 미국 Frontier Model에서 추출한 것으로 의심되는 고품질 데이터, 알리바바와 텐센트의 자본, 중국의 국유·정부계 자금과 컴퓨팅 인프라 정책이 함께 놓여 있다.


1. Kimi CEO의 강연은 무엇을 말했나


양즈린의 강연 핵심은 단순히 모델의 파라미터를 늘리는 데 있지 않았다.

같은 데이터와 컴퓨팅에서 더 많은 지능을 학습하고, 더 긴 문맥을 처리하며, 여러 에이전트를 병렬로 작동시키는 방법을 설명하는 자리였다.

같은 데이터에서 더 많이 학습하는 Muon

첫 번째는 토큰 효율성이다.

대부분의 대규모 언어모델은 Adam 또는 AdamW라는 최적화 알고리즘을 사용한다. 최적화기는 학습 과정에서 모델의 파라미터를 어느 방향으로 얼마나 수정할지를 결정한다.

Moonshot은 이를 Muon으로 대체하고, 초대형 모델에서 발생하는 학습 불안정성을 MuonClip으로 보완했다.

Moonshot의 설명에 따르면 Muon은 AdamW보다 같은 성능에 도달하는 데 필요한 학습 연산량을 크게 줄일 수 있다. Kimi K2는 MuonClip을 적용해 1조 파라미터 모델을 15.5조 토큰 동안 큰 Loss Spike 없이 학습했다.

즉 MuonClip은 새로운 지능을 만들어내는 단일 알고리즘이라기보다, 거대한 모델을 보다 안정적으로 학습하고 같은 데이터에서 더 많은 성능을 끌어내는 기술이다.


https://www.youtube.com/watch?v=CwePo4847ho


긴 문맥을 처리하는 Kimi Linear


두 번째는 Long Context 효율성이다.

기존 Transformer는 입력 문맥이 길어질수록 Attention 연산량과 KV Cache 사용량이 크게 증가한다. 모델이 대규모 코드베이스를 읽고 장기간 작업하려면, 과거에 읽은 정보와 작업 이력을 계속 기억해야 한다.

Moonshot은 이를 해결하기 위해 Kimi Delta Attention을 중심으로 한 Kimi Linear 구조를 개발했다.

회사 측 실험에서는 100만 토큰 문맥에서 KV Cache 사용량을 최대 75% 줄이고, 디코딩 처리량을 최대 약 6배 높였다고 보고했다.

이 구조는 모든 정보를 똑같이 기억하는 대신, 채널마다 서로 다른 기억 주기를 부여한다.

  • 일부 정보는 오랫동안 유지

  • 일부 정보는 빠르게 갱신

  • 불필요한 정보는 선택적으로 제거

쉽게 말하면 모델 내부에 단기기억과 장기기억을 담당하는 경로를 나누는 구조에 가깝다.


https://www.youtube.com/watch?v=CwePo4847ho


하나의 에이전트에서 에이전트 집단으로


세 번째는 Agent Swarm이다.

기존 AI 에이전트는 하나의 모델이 검색, 분석, 코딩, 검증 작업을 순차적으로 수행하는 경우가 많다. 이 방식은 작업이 복잡해질수록 실행시간이 길어진다.

Kimi는 하나의 Orchestrator가 복잡한 과제를 여러 하위 작업으로 분해한 뒤, 최대 100개의 Sub-agent를 생성하도록 설계했다.

각 에이전트는 서로 다른 조사와 분석을 병렬로 수행하며, 전체적으로 최대 1,500회의 Tool Call을 실행할 수 있다. Moonshot은 이를 통해 단일 에이전트 방식보다 일부 복잡한 작업의 실행시간을 최대 4.5배 단축했다고 주장한다.


https://www.youtube.com/watch?v=CwePo4847ho


깊이 방향의 정보를 선택하는 Attention Residuals


또 다른 핵심 기술은 Attention Residuals다.

일반적인 Transformer는 각 레이어의 출력을 다음 레이어에 계속 더한다. 모델이 깊어질수록 어떤 레이어에서 생성된 정보가 중요한지 구분하기 어려워지고, 여러 정보가 뒤섞일 수 있다.

Attention Residuals는 이전 레이어의 출력을 무조건 더하지 않는다. 현재 입력에 따라 어느 레이어의 정보를 얼마나 가져올지를 Attention으로 결정한다.

기존 Attention이 과거 토큰 가운데 필요한 정보를 선택한다면, Attention Residuals는 과거 레이어 가운데 필요한 표현을 선택하는 구조다.

이 기술은 이후 Kimi K3의 핵심 아키텍처 가운데 하나로 적용됐다.


https://www.youtube.com/watch?v=CwePo4847ho

기술적 성과 자체는 인정해야 한다


MuonClip, Kimi Delta Attention, Kimi Linear, Attention Residuals와 Agent Swarm은 단순한 마케팅 용어만으로 치부하기 어렵다.

Moonshot은 초대형 모델의 학습 안정성, KV Cache 부담, 장문 문맥, 에이전트 병렬처리라는 실제 문제를 해결하기 위해 상당한 기술적 진전을 이뤘다.

따라서 Kimi의 성능을 모두 외부 데이터나 중국 정부의 지원으로만 설명하는 것도 정확하지 않다.

다만 여기서 질문해야 할 부분은 따로 있다.

이러한 기술만으로 Kimi K3의 성능과 비정상적으로 빠른 개발 속도 전체를 설명할 수 있는가.


2. Kimi는 효율화로 컴퓨팅을 줄인 것이 아니다


Kimi K3는 총 2.8조 개의 파라미터를 보유하지만, 매 토큰마다 전체 파라미터를 사용하는 Dense Model은 아니다.

896개 전문가 가운데 16개만 활성화하는 Sparse MoE 구조를 사용한다. 따라서 2.8조 파라미터 Dense Model과 동일한 연산량이 필요한 것은 아니다.

그러나 Sparse MoE라고 해서 전체 컴퓨팅 부담이 사라지는 것은 아니다.

  • 2.8조 개의 전체 가중치를 메모리에 저장해야 함

  • 896개 전문가를 다수의 GPU와 서버에 배치해야 함

  • 토큰을 적절한 전문가로 전송해야 함

  • GPU 사이의 All-to-All 통신을 처리해야 함

  • 대규모 체크포인트와 학습 데이터를 저장해야 함

  • 장애가 발생했을 때 분산학습을 복구해야 함


파라미터가 커질수록 HBM 용량, GPU 수, 네트워크 대역폭과 스토리지 수요는 여전히 증가한다.

실제로 K3 출시 직후 사용자 수요가 급증하자 Moonshot은 신규 구독을 일시 중단했다. 회사는 현재 컴퓨팅 용량이 한계에 근접했다고 밝혔고, 외부 분석가 역시 K3가 매우 많은 컴퓨팅을 요구하는 모델이라고 평가했다. (AP News)

따라서 Kimi의 효율화는 다음과 같이 이해해야 한다.

효율성 향상 → 총컴퓨팅 감소

보다는

효율성 향상 → 더 큰 모델·더 긴 문맥·더 많은 에이전트로 재투자

Kimi는 알고리즘을 통해 컴퓨팅의 필요성을 제거한 사례가 아니다.

막대한 컴퓨팅 자본의 생산성을 높인 뒤, 절약된 자원을 모델의 절대 규모 확대에 다시 투입한 사례에 가깝다.

결국 K3를 설명하는 핵심 변수는 알고리즘만이 아니라 데이터와 자본으로 확장된다.


3. Anthropic이 제기한 Moonshot의 Claude 증류 의혹


Anthropic은 2026년 2월 DeepSeek, Moonshot AI와 MiniMax가 Claude의 능력을 추출하기 위해 산업적 규모의 증류 캠페인을 운영했다고 발표했다.

Anthropic에 따르면 세 기업은 약 2만4,000개의 허위 계정을 통해 Claude와 1,600만 건 이상의 대화를 생성했다.

이 가운데 Moonshot 관련 트래픽으로 분류된 대화는 340만 건 이상이었다.

Moonshot이 집중적으로 추출한 것으로 지목된 능력은 다음과 같다.

  • Agentic reasoning과 Tool use

  • 코딩과 데이터 분석

  • Computer-use agent

  • Computer vision

  • Claude의 추론 과정 재구성


이는 일반적인 웹 문서나 사전학습 데이터와 성격이 다르다.

사용자의 질문을 어떻게 분해하고, 어떤 도구를 선택하며, 오류를 어떻게 수정하고, 최종 결과를 어떻게 검증하는지 보여주는 고부가가치 후처리 데이터에 해당한다.

Anthropic은 IP 주소, 요청 메타데이터, 인프라 지표와 다른 사업자가 관찰한 행위 등을 바탕으로 캠페인을 특정 기업에 귀속했다고 밝혔다.

다만 이 내용은 현재까지 Anthropic의 자체 조사 결과다. Moonshot의 형사상 범죄가 법원에서 확정됐거나, Claude 출력이 Kimi K3에 정확히 얼마나 사용됐는지는 공개적으로 검증되지 않았다.

따라서 법적으로는 ‘불법 증류가 확정됐다’고 단정하기보다, Anthropic이 제기한 대규모 비인가 증류 의혹이라고 표현하는 편이 정확하다.

Hydra Cluster는 어떻게 작동했나


Anthropic은 이러한 대규모 우회 접근 인프라를 Hydra Cluster라고 설명했다.

하나의 계정이나 서버에서 대량의 요청을 보내는 방식은 쉽게 탐지된다. Hydra Cluster는 수많은 정상 이용자처럼 보이는 계정과 접근 경로로 요청을 분산시킨다.

Anthropic이 설명한 방식은 다음과 같다.

  • 중국 외부의 상업용 프록시 사업자로부터 Claude 접근권 구매

  • 수천~수만 개 계정으로 요청 분산

  • 교육·스타트업·연구·보안 목적 등 여러 계정 유형 활용

  • 계정이 차단되면 새로운 계정으로 교체

  • 증류용 트래픽과 일반 사용자의 요청을 혼합

  • 동일한 능력을 묻는 질문을 다양한 형태로 반복


이는 Claude의 내부 서버를 직접 해킹해 가중치나 원본 데이터베이스를 가져간 방식과는 다르다.

보다 정확하게는 Claude를 Teacher Model이자 합성데이터 생산공장으로 사용한 의혹이다.

Claude에 고난도 코딩, 추론, Agent 과제를 반복적으로 입력하고, 그 답변과 작업 과정을 대규모로 수집한 뒤 이를 자체 모델의 학습 데이터로 활용하는 방식이다.


4. 증류는 미국 모델이 먼저 부담한 비용을 흡수하는 수단이다


LLM은 인터넷 문서를 대량으로 학습한다고 곧바로 완성되는 것이 아니다.

원시 데이터를 실제 서비스에 사용할 수 있는 지능으로 바꾸려면 여러 단계가 필요하다.

데이터 수집 → 중복 제거 → 유해 데이터 정제 → 전문가 라벨링 → 지도학습 → 인간 선호학습 → 강화학습 → 안전성 평가 → Agent 학습 → 반복적인 실패 수정

미국의 Frontier AI 기업은 이 과정에서 막대한 인력, 데이터, 법률비용과 컴퓨팅을 먼저 부담했다.

OpenAI의 데이터 정제 비용


OpenAI는 케냐의 외주업체 Sama를 통해 노동자들이 폭력, 혐오, 성적 학대 등 유해한 텍스트를 분류하도록 했다.

이들이 인터넷 전체를 읽으면서 유해한 문장을 하나씩 삭제한 것은 아니다. 사람이 수만 건의 샘플에 라벨을 붙이면, 이를 바탕으로 별도의 분류 모델과 필터를 학습해 대규모 데이터와 모델 출력을 자동으로 정제하는 구조였다.

특정 Sama 계약의 명목상 규모만 보면 수십만달러 수준이었기 때문에, 이 계약 하나를 두고 천문학적인 비용이라고 표현하면 과장이다.

그러나 서비스가 가능한 LLM을 만드는 전체 과정에는 다음과 같은 비용이 반복적으로 발생한다.

  • 유해성 기준 설계

  • 인간의 경계 사례 판단

  • Reward Model과 분류기 구축

  • 레드팀과 취약점 점검

  • 과도한 거부와 위험한 응답 사이의 균형 조정

  • 새로운 모델이 나올 때마다 반복되는 안전성 평가


중요한 것은 하나의 외주 계약 액수가 아니라, 모델 뒤에 누적된 인간 노동과 수많은 시행착오다.

https://time.com/6247678/openai-chatgpt-kenya-workers/


Anthropic의 도서 데이터 확보 비용


Anthropic 역시 고품질 도서 데이터를 확보하기 위해 수백만 권의 실물 책을 구매하고, 책등을 제거한 뒤 페이지를 스캔해 디지털 라이브러리를 구축했다.

이는 모든 작가에게 별도의 AI 학습 저작권료를 지급했다는 의미는 아니다. 적법하게 구매한 실물 책을 스캔해 내부 학습용으로 사용한 방식이었다.

동시에 Anthropic은 불법 복제 사이트에서 수백만 권의 도서를 내려받아 보관한 문제로 대규모 저작권 분쟁도 겪었다.

따라서 미국 AI 기업이 데이터 문제에서 완전히 도덕적이고 합법적이었다고 평가하기도 어렵다.

미국 기업 역시 다음 논란에서 자유롭지 않다.

  • 저작권자의 동의 없는 웹 데이터 학습

  • 불법 복제 데이터 취득

  • 저임금 데이터 라벨링

  • 작가와 출판사에 대한 보상 문제

  • 모델 학습과 공정이용의 경계


그럼에도 이들이 실제로 부담한 비용은 남는다.

  • 원시 데이터를 확보하는 비용

  • 데이터를 디지털화하고 정제하는 비용

  • 법적 분쟁과 합의를 감당하는 비용

  • 고품질 데이터를 선별하는 비용

  • 인간 피드백과 안전성 평가 비용

  • 수없이 실패한 모델과 실험의 컴퓨팅 비용



https://techcrunch.com/2026/07/20/anthropics-landmark-1-5b-copyright-settlement-is-approved/
클로드는 $1.5bn 저작권 위반 벌금을 물었는데, 이를 불법 증류 및 추출한 kimi k3는 아무런 법적 조취를 안받는게 말이 되는건가?   


Kimi가 우회했을 가능성이 있는 비용


Claude의 최종 출력은 이러한 과정을 거친 뒤 생산된 결과물이다.

Claude가 만든 하나의 고품질 Agent 작업 궤적에는 다음 정보가 압축돼 있다.

  • 문제를 어떤 순서로 분해해야 하는지

  • 어떤 도구를 선택해야 하는지

  • 오류가 발생하면 어떻게 수정해야 하는지

  • 코드의 정확성을 어떻게 검증해야 하는지

  • 최종 답변을 어떤 구조로 작성해야 하는지


경쟁 모델이 이를 대량으로 학습하면, 좋은 답을 만들어내는 방법을 처음부터 발견하는 비용을 크게 줄일 수 있다.

미국 선도 모델이 원석을 채굴하고 제련공정을 개발했다면, 비인가 증류 모델은 이미 제련된 고순도 결과물을 훨씬 낮은 한계비용으로 반복 채취한 것에 가깝다.


Kimi가 OpenAI와 Anthropic의 원본 데이터 전체를 가져간 것은 아니다.

그러나 Anthropic의 주장이 맞다면, 선도 모델들이 막대한 비용을 들여 만들어낸 고부가가치 후처리 결과와 능력의 일부를 훨씬 짧은 시간과 낮은 비용으로 흡수했을 가능성은 높다.

증류는 컴퓨팅을 없애주는 기술이 아니다.

대신 미국 모델이 먼저 지불한 연구·실패·정렬·평가 비용을 외부화하고, 모델 개발의 시간과 비용을 압축하는 수단이다.


5. Moonshot을 둘러싼 자본은 일반적인 스타트업 투자와 다르다


Moonshot은 더 이상 창업자와 소규모 벤처캐피털만으로 운영되는 독립 스타트업으로 보기 어렵다.

알리바바는 Moonshot에 약 8억달러를 투자해 초기 기준 약 36%의 지분을 확보한 것으로 알려졌다. 텐센트 역시 주요 투자자로 참여했다.

알리바바와 텐센트는 단순한 재무투자자가 아니다.

  • 대규모 클라우드 데이터센터

  • AI GPU와 네트워크

  • 방대한 사용자와 데이터

  • 개발자 생태계

  • 서비스 유통망

  • 장기간의 적자를 감당할 자본


을 동시에 보유한 중국 최대 플랫폼 기업들이다.

이후 Moonshot에는 중국의 국유기업과 정부계 투자자도 참여한 것으로 보도됐다.

따라서 Moonshot을 둘러싼 자본은 세 가지 층으로 나눠 볼 수 있다.

미국 모델이 선행 지출한 지적자본


Anthropic의 주장이 사실이라면 Moonshot은 Claude가 먼저 개발한 Agent·코딩·추론 능력의 일부를 대규모 출력 데이터로 흡수했다.

여기에는 Anthropic이 부담한 데이터 선별, 강화학습, 평가, Agent 환경 구축과 실패 실험의 결과가 압축돼 있다.

중국 민간 플랫폼의 금융·컴퓨팅 자본


알리바바와 텐센트는 현금투자뿐 아니라 클라우드, GPU, 네트워크와 서비스 운영 역량을 제공할 수 있다.

다만 K3가 구체적으로 어느 클라우드 클러스터에서 학습됐는지, 투자자들이 얼마의 GPU 크레딧이나 인프라를 제공했는지는 공개되지 않았다.

중국 국가 산업정책의 자본


중국은 AI를 국가전략산업으로 육성하고 있다.

  • 국유·정부계 펀드의 직접 투자

  • 대규모 데이터센터 건설

  • 컴퓨팅 바우처와 보조금

  • 국산 AI 반도체 생태계

  • 공공기관과 국유기업의 AI 도입

  • 오픈웨이트 모델의 해외 확산


Moonshot은 이러한 정책 생태계 안에서 성장하고 있다.

따라서 중국 정부와 국유자본의 지원 가능성을 단순한 음모론으로 치부하기는 어렵다.

다만 중국 공산당이 Claude 증류 캠페인을 직접 지시했다거나, K3의 전체 학습비용을 비밀리에 부담했다고 단정할 공개 증거는 아직 없다.

확인되는 사실은 Moonshot이 중국의 민간 플랫폼 자본, 국유·정부계 자금과 국가 컴퓨팅 정책이 결합된 생태계 안에 있다는 점이다.


6. 미국 정부는 증류를 국가안보 문제로 보기 시작했다


미국 정부는 경쟁 모델의 비인가 증류를 단순한 기업 간 서비스 약관 분쟁으로만 바라보지 않고 있다.

미국의 Frontier Model이 막대한 비용을 들여 구축한 능력을 중국 기업이 조직적으로 추출할 경우, 다음 문제가 동시에 발생한다.

  • 미국 기업의 연구개발 비용이 중국에 외부화

  • 중국 모델의 개발 기간 단축

  • 첨단 반도체 수출통제의 실효성 약화

  • 군사·정보·사이버 분야로의 전용 가능성

  • 중국의 저가 모델을 통한 글로벌 AI 생태계 장악


따라서 향후 미국의 대응은 단순한 API 계정 차단을 넘어설 가능성이 있다.

  • 중국 AI 기업의 Frontier API 접근 제한

  • 프록시·리셀러와 허위 계정 규제

  • 고객확인과 실소유자 확인 강화

  • 제3국 클라우드를 통한 중국 기업의 모델 학습 제한

  • 특정 중국 AI 기업의 Entity List 등재

  • 미국 공공기관의 중국 LLM 사용 제한


아직 Moonshot에 대한 구체적인 제재가 확정된 것은 아니다.

그러나 비인가 증류가 미국의 지적·컴퓨팅 자본을 우회 추출하는 국가안보 문제로 전환될 정책적 조건은 이미 마련되고 있다.

chrome-extension://efaidnbmnnnibpcajpcglclefindmkaj/https://www.whitehouse.gov/wp-content/uploads/2026/04/NSTM-4.pdf?utm_source=chatgpt.com


The secret Trump administration battle to fight Chinese AI



7. Kimi 창업자의 공개 강연이 불편하게 보이는 이유


Kimi 창업자가 NVIDIA GTC와 같은 공개 무대에서 기술을 설명한 행위 자체를 범법행위의 법적 두둔으로 보기는 어렵다.

강연은 MuonClip, Kimi Linear와 Agent Swarm 등 모델의 기술적 구조를 소개하는 자리였다. 주최자가 발표 기회를 제공했다는 이유만으로 비인가 증류를 공모하거나 방조했다고 볼 수도 없다.

그럼에도 해당 강연이 불편하게 느껴지는 이유는 분명하다.

성능의 인과관계가 알고리즘만으로 설명된다


기술 발표에서는 알고리즘과 모델 구조가 성능 향상의 핵심 원인으로 제시된다.

그러나 Anthropic의 주장이 사실이라면 Claude에서 추출한 Agent·코딩·추론 데이터도 Kimi의 성능 형성에 기여했을 가능성이 있다.

이 부분이 빠지면 청중은 Kimi의 발전을 모두 Moonshot의 독자적인 연구개발 성과로 받아들이기 쉽다.

데이터 출처와 후처리 비용이 보이지 않는다


Kimi가 Agent 능력을 어떤 데이터로 학습했는지, 외부 Frontier Model의 출력이 어느 정도 포함됐는지, 데이터 확보 과정에서 어떤 권한과 계약이 있었는지는 공개되지 않았다.

알고리즘 효율만 설명하고 데이터 출처를 제외하면, 모델 성능을 만든 가장 중요한 생산요소 가운데 하나가 사라진다.

권위 있는 무대가 성과에 정당성을 부여한다


GTC와 같은 국제 기술행사는 단순한 발표장이 아니다. 연구자와 투자자, 언론이 해당 기업의 기술적 정당성을 확인하는 공간이기도 하다.

증류 의혹이 해소되지 않은 기업의 성과가 별다른 검증 없이 순수한 혁신 사례로 소개될 경우, 국제 AI 생태계가 논란 있는 성과를 정상적인 기술 추격으로 인정해주는 효과가 발생할 수 있다.

따라서 가장 정확한 비판은 ‘범죄를 공개적으로 옹호했다’보다 다음에 가깝다.

Claude 비인가 증류 의혹과 데이터 출처를 배제한 채 알고리즘 혁신만 강조한다면, 논란 있는 방식으로 축적했을 가능성이 있는 성과를 순수한 독자 기술로 포장하고, 국제 기술 생태계가 이를 세탁해주는 것으로 비칠 수 있다.

 


8. Kimi K3는 실제로 얼마나 강한 모델인가


현재 Kimi K3를 무조건 성능이 낮은 모델이라고 단정할 수는 없다.

출시 직후 K3는 Arena의 Frontend Coding 분야에서 최상위권에 올랐고, Artificial Analysis의 Intelligence Index에서도 상위권을 기록했다. 일부 외부 개발자와 기업 역시 웹 개발과 코딩 분야에서 높은 성능을 확인했다. (Business Insider)

반면 실제 사용 과정에서 오류와 신뢰성 문제도 나타나고 있다.

Wharton의 Ethan Mollick은 K3에 복잡한 통계 검증을 맡겼을 때 핵심 통계기법을 잘못 적용하는 등 다수의 오류를 발견했다고 지적했다. (Business Insider)

이처럼 현재 외부 평가는 엇갈린다.

  • Frontend Coding에서는 강한 결과

  • 공개 벤치마크에서는 Frontier급에 근접

  • 일부 복잡한 실제 작업에서는 오류 발생

  • 장기 Agent 작업의 안정성은 충분히 검증되지 않음

  • 내부 평가와 실제 서비스 성능 사이의 차이 불명확

  • 2.8조 파라미터 규모 대비 비용효율성 검증 부족


특히 공개 벤치마크 점수만으로 모델의 실질적 경쟁력을 판단하기는 어렵다.

모델이 특정 문제를 풀 수 있는지뿐 아니라 다음 지표가 함께 확인돼야 한다.

  • 동일한 작업을 반복했을 때의 성공률

  • 긴 작업에서 오류가 누적되는 정도

  • Tool Call 실패와 복구 능력

  • 환각과 사실 오류

  • 작업 완료당 비용

  • 실제 서비스 환경의 지연시간

  • GPU와 메모리 사용량

  • 사용자 개입 없이 완수할 수 있는 작업 범위


파라미터 숫자와 최고점 몇 개가 모델의 경제성과 신뢰성을 대신할 수는 없다.


결론: 7월 27일은 Kimi K3 검증의 첫 관문이다


Kimi는 K3의 전체 기술보고서와 아키텍처·훈련·평가 세부사항을 추후 공개하겠다고 밝히고 있으며, 전체 가중치도 2026년 7월 27일까지 공개할 예정이라고 설명하고 있다.

해당 결과가 나오기 전까지 K3의 실제 능력을 단정하는 것은 이르다. 이미 일부 외부 평가에서 상당한 코딩 성능이 확인됐기 때문에, K3를 전부 허상이라고 평가할 수도 없다.

다만 현재까지 공개된 정보만 놓고 보면 Kimi K3는 기술적 실체보다 서사가 앞서가고 있다는 인상을 지우기 어렵다.

2.8조 파라미터라는 압도적인 숫자, 세계 최대 오픈 모델이라는 표현, 제한적인 벤치마크의 최고점과 미국 모델 대비 낮은 가격이 하나의 강력한 이야기로 묶였다.

반면 다음과 같은 핵심 정보는 공개되지 않았다.

  • 전체 학습 토큰과 총 FLOPs

  • GPU 종류와 수량

  • 전체 학습비용

  • Alibaba Cloud 등 투자자의 컴퓨팅 지원

  • Post-training 데이터의 출처

  • Claude 출력의 사용 여부와 규모

  • 복잡한 실제 업무에서의 반복 성공률

  • 2.8조 파라미터를 서비스하는 실제 추론비용


Moonshot은 K3 공개 직후 투자자들에게 이르면 6개월 내 홍콩 상장을 추진하기 위한 주주결의안을 배포한 것으로 보도됐다. 기업가치는 300억달러 이상이 거론되고 있다. (타이페이 타임스)

이는 K3를 둘러싼 기술적 서사와 자본시장 이해관계를 분리해서 보기 어렵게 만든다.

K3가 미국의 Frontier Model을 위협하는 역사적 돌파구로 인식될수록 Moonshot의 기업가치는 높아지고, IPO를 통한 외부자금 조달도 쉬워진다. 반대로 증류 의혹, 높은 컴퓨팅 비용, 불완전한 외부 검증과 실제 성능의 한계를 먼저 강조할 유인은 크지 않다.

중국 정부와 국유자본이 K3의 실제 성능 한계를 어디까지 알고 있는지는 확인할 수 없다. 중국 정부가 의도적으로 문제를 은폐하고 있다고 단정할 직접적인 증거도 없다.

그러나 중국이 AI를 국가전략산업으로 육성하고 있고, Moonshot의 성공이 중국의 기술자립과 미국 제재 극복을 상징한다는 점을 고려하면, IPO와 추가 자금조달을 앞둔 시점에 정부와 국유자본이 현재의 성공 서사를 스스로 약화시킬 유인은 거의 없어 보인다.

지금까지의 정황 증거들을 미뤄보아,
현재 단계의 Kimi K3는 상당 부분 과대포장돼 있을 가능성이 높다고 *개인적으로 생각하고 있다.


#글을 마치며


미국이 이번 Kimi K3 사례를 확인하고도 프론티어 LLM에 대한 불법 증류와 성능 복제를 사실상 방치한다면, 막대한 비용을 지불하며 미국산 모델을 사용할 유인은 점차 약해질 수밖에 없다. 규제가 느슨한 국가에서 우회 계정과 API, VPN 등을 활용해 모델의 능력을 추출하고, 이를 기반으로 저가의 유사 모델을 출시하는 일이 반복될 가능성이 높기 때문이다.

이러한 구조가 고착되면 연구개발비와 컴퓨팅 비용은 미국 기업이 부담하고, 그 성과는 중국과 제3국이 저비용으로 복제하는 상황이 이어질 수 있다. 글로벌 이용자 역시 비싼 프론티어 모델보다 성능이 유사한 중국산 오픈웨이트 모델을 선택할 가능성이 커진다.

개인적으로 불법 증류 자체를 기술적으로 완전히 차단하는 것은 현실적으로 쉽지 않다고 본다. 그렇다면 규제의 초점은 모델 접근 통제에만 머물 것이 아니라, 대규모 증류와 복제를 가능하게 하는 첨단 AI 반도체와 제조 장비, 고대역폭 메모리, 네트워크 장비 등 물리적 컴퓨팅 인프라로 이동할 필요가 있다.

프론티어 AI의 지식재산권은 보호하지 못하면서, 이를 복제할 수 있는 컴퓨팅 자원까지 계속 공급하는 정책은 지속되기 어렵다. 이번 Kimi K3 사례는 단순한 모델 경쟁을 넘어, 미국의 AI 수출통제 전략을 다시 점검해야 할 계기에 가깝다고 생각한다.

https://bloomingbit.io/feed/news/116471


내 예상대로 추가 제재가 현실화된다면, 중국의 공급 확대가 제한되면서 반사이익을 얻는 글로벌 IDM중국향 매출 감소로 실적 부담이 커지는 반도체 장비업체 사이에 묘한 긴장 관계가 형성될 가능성도 염두에 둘 필요가 있지 않나 싶다.

中기업들, 독자 AI 생태계 구축 프로젝트 '은하계획' 발족
중국도 어느정도 추가제재 가능성에 대해 눈치 채고 있지 않나 싶다.

제3국이 자국 LLM을 불법 증류하거나 추출해 복제하는 상황을 우려한 중국 당국은, 같은 방식으로 기술을 탈취당하기 전에 관련 수출 통제부터 선제적으로 강화하는 모습 (*도둑이 제발저리는 꼴)

China considers tighter export controls on AI models and chips


=끝

댓글 없음:

댓글 쓰기