레이블이 AI인프라-GPU컴퓨트인 게시물을 표시합니다. 모든 게시물 표시
레이블이 AI인프라-GPU컴퓨트인 게시물을 표시합니다. 모든 게시물 표시

2026년 8월 18일 화요일

생각정리 343 (* Cerebras)

AGI, ASI의 시대가 더 이상 먼 미래의 이야기가 아닐지도 모르겠다.

Frontier Lab에서는 AI가 AI 연구 자체를 가속하는 RSI(Recursive Self-Improvement) 연구개발이 본격화되고 있고, 최첨단 모델의 성능이 빠르게 높아지면서 새로운 모델의 공개와 배포에서도 보안과 통제 가능성이 점점 더 중요한 문제로 부상하고 있다.

https://x.com/sama


동시에 LLM 내부에서 우리가 흔히 ‘자아’나 ‘의식’이라고 부르는 현상과 유사한 특성이 나타날 가능성을 탐구하는 연구까지 접하다 보면, 지금의 발전 속도가 단순한 성능 개선을 넘어 AGI와 ASI로 이어지는 전환점에 가까워지고 있는 것은 아닌가 하는 생각도 든다.

아직 많은 부분이 검증되지 않은 영역이지만, 적어도 AI가 수행하는 작업의 복잡성과 자율성이 빠르게 높아지고 있다는 방향성만큼은 분명해 보인다.

Emergent Introspective Awareness in Large Language Models

이처럼 AI가 급변하는 시점에서 최근 조금 다른 시각으로 바라보기 시작한 기업이 Cerebras이다. 지금까지 AI 인프라 경쟁의 중심이 더 많은 연산능력과 HBM을 중심으로 한 대용량 메모리 계층에 있었다면, Agentic AI가 확산되면서 얼마나 많은 정보를 기억할 수 있는가뿐 아니라 얼마나 빠르게 생각하고 반응할 수 있는가가 새로운 가치로 부상하고 있기 때문이다.

Cerebras가 가진 저지연·초고속 Decode라는 특성은 단순히 Chatbot의 답변을 빨리 보여주는 기능이 아니다. Coding Agent, Cybersecurity, 실시간 Research, Voice AI처럼 여러 번 추론하고 검증하며 즉시 행동해야 하는 산업에서는 Latency 자체가 AI의 생산성과 제품 성능을 결정하는 변수가 될 수 있다.


OpenAI (@OpenAI) / X

따라서 Cerebras를 기존 GPU나 HBM을 대체하는 또 하나의 AI Chip으로 보기보다는, 앞으로 AI Memory Hierarchy가 세분화되는 과정에서 HBM이 대규모 Context와 기억을 담당하고, Cerebras와 같은 SRAM 중심의 저지연 Architecture가 빠른 추론과 반응을 담당하는 새로운 Layer가 형성될 가능성에 주목할 필요가 있다고 생각한다.

아래는 이러한 관점에서 Cerebras의 최근 성장, 저지연 inference가 만들어내는 새로운 수요, Cybersecurity를 비롯한 실사용 사례, 그리고 HBM 중심 Architecture와의 경쟁과 분업 가능성을 살펴본 리서치 기록이다.
 

Cerebras의 급성장은 무엇을 의미하는가: HBM 시대에 ‘빠른 디코딩’이 만드는 새로운 시장


Cerebras를 처음 보면 가장 직관적인 설명은 간단하다. NVIDIA GPU보다 훨씬 빠르게 토큰을 생성하는 특수 AI 칩을 만들었고, AI inference 시장이 커지면서 그 수요가 늘고 있다는 것이다.

하지만 최근 Cerebras의 성장 속도를 설명하기에는 이것만으로 부족하다. 더 중요한 변화는 시장이 ‘빠른 inference’를 단순한 사용자 편의가 아니라, AI가 실제로 할 수 있는 일의 범위를 결정하는 하나의 자원으로 재평가하기 시작했다는 것이다.

특히 Agentic AI가 확산되면서 AI는 질문에 한 번 답하고 끝나는 것이 아니라 계획을 세우고, 검색하고, 코드를 작성하고, 결과를 검증하고, 다시 판단하는 과정을 반복한다. 이 환경에서는 한 번의 응답을 10초에서 1초로 줄이는 것이 단순한 UX 개선을 넘어 같은 시간 안에 수행할 수 있는 reasoning·tool call·validation의 횟수를 늘리는 효과를 갖는다.

다만 여기에는 중요한 반대편도 존재한다. Agent가 장시간 작동하고 context와 KV cache가 계속 커지면 속도보다 메모리 용량이 더 중요한 문제가 된다. 바로 이 지점에서 대용량 HBM을 중심으로 발전하는 NVIDIA·AMD 계열의 GPU architecture가 Cerebras와 전혀 다른 강점을 갖는다.

따라서 Cerebras와 HBM의 관계를 누가 누구를 대체하는 경쟁으로 보는 것보다, 앞으로 AI inference가 “대용량 Context를 보관하고 처리하는 계층”과 “최종 답을 극도로 빠르게 생성하는 계층”으로 분리될 가능성에 주목하는 것이 더 중요하다.


1. Cerebras는 왜 갑자기 빠르게 성장하고 있는가


2026.08.13 Cerebras

최근 숫자부터 보면 변화가 상당히 선명하다. Cerebras의 2026년 2분기 Core Revenue는 2억990만달러로 전년 대비 103% 증가했다. 그런데 Hardware Revenue는 17% 증가한 8,210만달러였던 반면, Cloud & Other Services Revenue는 1억2,770만달러로 287% 증가했다.

즉 최근 Cerebras의 성장을 단순히 “AI 칩을 더 많이 팔고 있다”고 이해하면 핵심을 놓친다. 회사의 성장축이 Wafer-Scale Engine이라는 하드웨어 판매에서, 그 하드웨어가 생산하는 고속 token을 Cloud를 통해 판매하는 사업으로 빠르게 이동하고 있기 때문이다.

회사는 2026년 Core Revenue 가이던스를 8억8,000만~8억9,000만달러로 높였고, 2027년에는 Core Revenue가 다시 3배 이상 증가할 것이라고 밝혔다. 2026년 6월 말 RPO도 254억달러에 달한다.

현재 문제는 수요 부족이 아니라 오히려 공급능력이다. Cerebras는 최근 7개월 동안 2027년 말까지 공급될 600MW 이상의 데이터센터 Capacity를 확보했고 추가 Pipeline은 GW 단위라고 설명한다. 제조 Capacity도 2026년에 10배 이상 확대할 예정이다.

여기에서 성장의 인과관계가 나온다.

Fast Inference Demand → Data Center Capacity 확보 → Cerebras System 설치 → High-speed Token 공급 증가 → Cloud Revenue 증가

즉 현재 Cerebras에서는 데이터센터를 얼마나 빨리 확보하고 시스템을 설치하느냐가 매출 성장률을 결정하는 병목이다.

물론 숫자의 질을 볼 때는 한 가지 주의해야 한다. 현재 RPO와 성장의 상당 부분은 OpenAI 같은 대형 고객에 기반하며, 회사도 OpenAI가 2027년까지 상당한 매출 비중을 차지할 것이라고 인정한다. 반면 AWS, Coding, Security 등의 비중이 커지면서 장기적으로 고객 집중도가 낮아질 것이라는 것이 회사의 주장이다.

따라서 빠른 성장이 곧바로 광범위한 산업 수요가 완전히 검증됐다는 의미는 아니다. 지금부터 중요한 것은 OpenAI 이후 두 번째, 세 번째 수요처가 실제 매출로 얼마나 빠르게 확대되는가이다.

또 하나의 성장 배경: HBM·CoWoS·선단공정 병목에서 상대적으로 자유로운 공급망


여기에 Cerebras의 최근 성장을 이해할 때 하나 더 주목해야 할 부분이 있다. Cerebras의 공급망 구조가 기존 고성능 GPU와 상당히 다르다는 점이다.

현재 최첨단 AI GPU를 증산하려면 GPU Logic Chip만 충분해서는 안 된다. 선단 Logic Wafer뿐 아니라 HBM과 CoWoS 같은 Advanced Packaging Capacity가 동시에 확보되어야 최종 AI Accelerator를 출하할 수 있다. 따라서 Logic, HBM, Packaging 가운데 어느 하나라도 공급이 부족하면 전체 시스템 출하량이 제한될 수 있다.

반면 Cerebras의 WSE-3는 TSMC 5nm 공정에서 생산되며, HBM 대신 대규모 SRAM을 Wafer-Scale Processor 내부에 직접 집적하는 구조를 사용한다. Cerebras 경영진 역시 현재 AI 반도체 산업의 주요 공급 제약인 HBM Memory, CoWoS Packaging, 3nm Fab Capacity를 필요로 하지 않는다는 점을 공급망상의 장점으로 강조하고 있다. 또한 5nm 공정을 사용하기 때문에 3nm나 그 이하의 최신 선단공정에 비해 Wafer 가격이 낮고 공급 역시 상대적으로 덜 제약되어 있다고 설명한다.

이를 단순화하면 최신 GPU의 공급망은 대략

Leading-edge Logic → HBM → CoWoS → System

이라는 여러 병목을 동시에 통과해야 한다.

반면 Cerebras는 상대적으로

5nm Wafer → Wafer-Scale Engine → System

에 가까운 구조이다.

이 차이는 AI 수요가 공급을 크게 초과하는 현재 환경에서 특히 중요하다. 아무리 inference 성능이 좋더라도 시스템을 충분히 생산하지 못하면 매출로 전환할 수 없기 때문이다.

Cerebras는 현재 TSMC로부터 향후 성장에 필요한 Wafer를 확보했다고 밝히고 있으며, 제조 Capacity를 2026년 중 10배 이상 확대할 계획이다.

따라서 Cerebras의 성장 논리는 단순히

“빠른 칩이기 때문에 수요가 증가한다”

에서 끝나는 것이 아니라,

Fast Inference Demand
→ HBM·CoWoS·최선단공정 의존도가 낮은 Supply Chain
→ 상대적으로 빠른 Manufacturing Ramp
→ System Deployment 증가
→ Token Capacity 증가
→ Revenue Growth

라는 공급 측 인과관계까지 포함한다.

물론 이것이 Cerebras에 공급망 문제가 없다는 의미는 아니다. Wafer-Scale Processor 자체의 제조 난이도는 매우 높으며 TSMC에 대한 의존도도 존재한다. 또한 Cerebras 경영진이 현재 가장 큰 물리적 병목으로 지목하고 있는 것은 반도체보다 데이터센터 전력과 공간이다.

다만 NVIDIA·AMD 계열의 최신 AI Accelerator가 선단 Logic + HBM + Advanced Packaging이라는 여러 공급 제약을 동시에 관리해야 하는 것과 비교하면, Cerebras는 현재 AI 공급망에서 가장 타이트한 일부 병목을 구조적으로 우회하고 있다는 점에서 Capacity 확대에 상대적으로 유리한 위치에 있다고 볼 수 있다.

세 가지 설명을 경쟁시켜보면


현재 증거를 종합하면 첫 번째 설명이 Cerebras의 현재 매출 성장을 가장 잘 설명한다. 하지만 장기적인 기업가치를 결정할 가능성이 더 높은 것은 두 번째와 네 번째 설명이다.


2. 빠른 응답속도의 의미가 바뀌고 있다


과거 inference speed를 이야기할 때 가장 흔한 설명은 “ChatGPT 답변이 더 빨리 나온다”였다.

이 관점에서는 10초가 1초로 줄어드는 것이 편리하기는 하지만 반드시 수십억달러의 새로운 반도체 시장을 만들 이유는 없어 보인다.

Accelerating GPT-5.6 Sol Ultrafast with OpenAI


하지만 Agent 시대에는 구조가 달라진다.

일반적인 Agent는 다음과 같이 움직인다.

Think → Search → Reason → Tool Call → Observe → Reason → Validate → Act

각 단계 사이에 LLM inference가 들어가면 이전 단계가 끝나기 전 다음 단계로 갈 수 없다. 즉 많은 과정이 Sequential Critical Path 위에 있다.

예를 들어 각 inference 단계가 5초이고 10번의 reasoning loop가 필요하면 모델에서만 50초가 소비된다. 같은 inference가 0.5초라면 5초가 된다.

따라서 Agent에서는 inference latency가 단순히 “답변을 기다리는 시간”이 아니라 Task Completion Time을 결정하기 시작한다.

Lovable과 Cerebras가 2026년 8월 발표한 협업은 이 구조를 잘 보여준다. Lovable은 소프트웨어 생성이 하나의 요청이 아니라 planning, scaffolding, component 작성, 오류 수정, 재작성 등이 연결된 연속적인 작업이라고 설명하며, 일부 latency-sensitive workload를 Cerebras에서 실행하기로 했다. Cerebras–Lovable 발표

여기에서 한 단계 더 중요한 재해석이 가능하다.

빠른 AI는 같은 답을 빨리 주는 것이 아니라, 같은 시간 안에 더 좋은 답을 만들 수 있게 한다.

10초의 latency budget이 있다고 가정해보자. 느린 inference에서는 reasoning을 두 번 하고 답을 내야 할 수도 있다. inference가 10배 빨라지면 같은 10초 동안 검색하고, 두 개의 가설을 비교하고, 결과를 검증하고, 한 번 더 수정할 수 있다.

Cerebras도 현재 자사 inference의 가치를 단순 interactivity가 아니라 동일한 latency budget 안에서 더 많은 reasoning을 수행하여 output quality를 높이는 것으로 설명하고 있다. Cerebras Inference

따라서 Speed의 가치 함수가 변한다.

Latency ↓ → Reasoning Steps ↑ → Validation ↑ → Output Quality ↑

이것이 Cerebras에 대한 가장 중요한 재평가라고 본다.


3. Cybersecurity는 왜 Cerebras의 좋은 실사용 사례인가


이 변화가 가장 직관적으로 나타날 가능성이 높은 산업 중 하나가 Cybersecurity이다.

Coding에서는 응답시간을 10초에서 1초로 줄이면 개발자의 생산성이 좋아진다. 하지만 Cybersecurity에서는 10초를 1초로 줄이는 것이 경우에 따라 공격을 막는 것과 공격 이후 사고 원인을 설명하는 것의 차이가 될 수 있다.

실제로 CrowdStrike는 2026년 7월 Cerebras와 전략적 협업을 발표했고, Falcon AI Detection and Response(AIDR)에 Cerebras inference를 활용하기로 했다. CrowdStrike는 AI 시대에는 공격자가 여러 domain을 수초 안에 이동할 수 있기 때문에 더 크고 정교한 모델을 실시간으로 실행할 필요가 있다고 설명했다. CrowdStrike–Cerebras 발표

보안 시스템을 단순화하면 다음과 같다.

Endpoint·Network·Cloud Telemetry → Log/Data Lake → Relevant Evidence Retrieval → AI Reasoning → Decision → Block/Remediation

여기서 중요한 것은 Cerebras가 수십 PB의 보안 로그를 전부 읽거나 저장하는 역할을 맡는 것이 아니라는 점이다.

방대한 로그는 Data Lake에 저장한다. 특정 공격이 발생하면 관련 Endpoint, Process Tree, Identity, Network Connection, Threat Intelligence 등을 선별해 AI에게 Context로 제공하고, AI는 그 증거를 바탕으로 공격인지 판단하고 추가 조사를 수행한다.

즉,

Huge Security Data ≠ Huge Active LLM Context

이다.

이 차이 때문에 Cybersecurity는 Cerebras의 구조적 약점을 상대적으로 피하면서 장점을 살릴 가능성이 있다.

필요한 사건 Context만 가져온 뒤,

Reason → Check → Validate → Decide

를 최대한 빨리 반복하면 되기 때문이다.

Palo Alto Networks의 Cortex XSIAM도 업계가 이 방향으로 움직이고 있음을 보여준다. XSIAM은 SIEM·XDR·NDR·SOAR 등의 telemetry를 통합 Data Layer에 모으고 Agentic AI가 investigation, threat hunting, multi-step action을 수행하는 구조로 발전하고 있다.

Palo Alto Cortex XSIAM Architecture


Cybersecurity에서 Cerebras의 기회는 단순 SIEM 시장을 가져오는 것이 아니다. 오히려 핵심은 지금까지 latency 때문에 LLM을 넣기 어려웠던 Inline Decision Loop에 AI가 들어갈 수 있게 만드는 것이다.

이것은 시장 자체를 확장할 수 있다.


4. 어떤 산업에서 Cerebras의 가치가 추가로 커질 수 있을까


두 번째로 명확한 시장은 AI Coding과 Software Creation이다.

Coding Agent는 코드를 한 번 생성하고 끝나는 것이 아니라 파일을 읽고, 계획하고, 코드를 작성하고, 컴파일하고, 오류를 읽고, 수정한다. Lovable뿐 아니라 AWS도 agentic coding을 fast inference가 특히 중요한 workload로 지목하고 있다. Cerebras–Lovable 발표

세 번째는 금융·기업정보·Research Intelligence이다.

AlphaSense는 Cerebras를 Generative Search architecture에 적용하고 있다. Query를 해석하고, Research Plan을 만들고, 여러 문서를 검색하고, 여러 Agent와 Tool을 실행하는 과정에서 inference latency를 낮추면 같은 시간 동안 더 많은 자료를 검색하고 더 많은 검증을 수행할 수 있다. Cerebras–AlphaSense 사례

여기서도 중요한 것은 단순 답변 속도가 아니다.

More Searches + More Tool Calls + More Validation within the same waiting time

이 핵심이다.

네 번째는 Voice AI와 실시간 Customer Service이다. 사람과 대화하는 AI에서는 매 문장마다 몇 초씩 기다리게 되면 제품 경험 자체가 무너진다. Cerebras도 coding, research, voice, automation 등을 대표적인 interactive inference workload로 제시하고 있다. Cerebras Inference

다섯 번째 후보는 Robotics와 실시간 산업제어다. AMD와 Cerebras도 2026년 파트너십에서 robotics와 scientific discovery를 low-latency token generation의 잠재 응용영역으로 언급했다. AMD–Cerebras 발표

다만 Robotics에는 중요한 반론이 있다. 로봇의 의사결정 시간이 수십 ms 수준이어야 한다면 Cerebras chip 자체가 아무리 빨라도 Cloud 왕복 Network latency가 병목이 될 수 있다. 따라서 이 시장은 On-premise 또는 Edge와 가까운 Cerebras deployment가 가능할 때 더 현실적인 기회가 된다.

마찬가지로 “저지연이 중요하다”는 이유만으로 HFT나 Packet Filtering까지 Cerebras 시장으로 보는 것도 잘못이다. 이 영역은 LLM reasoning이 아니라 FPGA, ASIC, 전통적인 ML이 훨씬 효율적이다.

결국 Cerebras가 필요한 조건은 단순히 Low Latency가 아니다.

LLM Reasoning이 Critical Path에 있고, 그 Reasoning의 지연시간을 줄였을 때 시스템의 실제 결과가 좋아지는 산업이어야 한다.


5. 그렇다면 Cerebras는 왜 모든 inference를 가져갈 수 없는가


여기서 HBM과 비교해야 한다.

Cerebras WSE-3가 빠른 근본 이유는 메모리 구조가 GPU와 다르기 때문이다. WSE-3는 44GB의 SRAM을 chip 위에 배치하고 약 21PB/s의 on-chip memory bandwidth를 제공한다. Cerebras는 모델 weight를 WSE들의 SRAM 가까이에 배치해 decode 과정의 데이터 이동을 최소화한다. Cerebras WSE-3



https://www.cerebras.ai/cs4

GPU는 다른 선택을 한다.

NVIDIA B300은 GPU당 288GB HBM3e와 최대 8TB/s bandwidth를 제공한다. 이후 GPU architecture 역시 HBM capacity와 bandwidth를 지속적으로 확대하면서 long-context와 agentic inference를 동시에 대응하는 방향으로 발전하고 있다.

숫자만 놓고 보면 Cerebras SRAM bandwidth가 압도적이다.

그러나 21PB/s 대 수 TB/s라고 해서 실제 AI inference가 수백~수천 배 빨라진다는 뜻은 아니다. 모델 partitioning, compute utilization, interconnect, KV movement, batch scheduling, networking 및 software overhead가 모두 존재하기 때문이다.

더 중요한 차이는 Capacity이다.

SRAM은 매우 빠르지만 비싸고 면적을 많이 차지한다. HBM은 SRAM보다 느리지만 훨씬 많은 정보를 보관할 수 있다.

바로 이 차이가 Long-context Agent에서 중요해진다.

Transformer의 KV Cache는 단순화하면 다음과 같이 증가한다.

KV Cache ∝ Batch Size × Active Context Length × Model Size

예를 들어 긴 Context를 가진 Agent 하나는 문제가 없더라도, 이런 Agent를 수십 개, 수백 개 동시에 처리하면 KV memory 요구량은 급격하게 증가한다.

Context ↑ × Concurrency ↑ → KV Capacity 급증

이때 Cerebras의 매우 빠른 SRAM bandwidth가 해결하지 못하는 문제가 생긴다.

저장할 공간 자체가 부족해지는 Capacity Bottleneck이다.

즉 장시간 Agent라고 무조건 Cerebras에 불리한 것은 아니다.

Long Decode / 많은 Output Token → Cerebras 유리

하지만

Long Persistent Context × High Concurrency → HBM 유리

이다.

Cerebras도 이 문제를 모르는 것은 아니다. 회사는 Prompt Caching을 통해 반복되는 긴 Prompt의 Prefill 비용을 줄이고 있으며, Sparse Attention 연구를 통해 KV Cache 사용량을 줄이는 방법도 연구해왔다. Cerebras Prompt Caching

다만 Prompt Cache는 주로 반복되는 input processing을 줄이는 방법이지, 장시간 decode 동안 필요한 모든 active KV capacity 문제를 없애주는 것은 아니다.


6. Cerebras와 HBM을 경쟁관계로만 보면 중요한 것을 놓친다


AI 시스템의 메모리를 단순화하면 다음과 같은 Hierarchy로 볼 수 있다.


Cerebras가 한 일은 본질적으로 이 Hierarchy의 가장 빠른 SRAM Tier를 기존 accelerator보다 극단적으로 크게 만든 것이다.

반대로 NVIDIA의 전략은 HBM을 더 크고 빠르게 만들고 NVLink를 통해 여러 GPU를 하나의 거대한 memory domain처럼 묶는 방향이다.

여기에 Context Memory, CPU DRAM, CXL, Storage까지 더해지면서 앞으로 AI inference는 하나의 chip이 모든 데이터를 들고 처리하는 구조보다,

Storage → Context Memory → HBM / Prefill → Ultra-fast Decode

로 더욱 세분화될 가능성이 있다.

실제로 Cerebras 자체가 AWS와 추진하는 architecture도 이 방향이다.

AWS Trainium이 Prompt와 Context를 처리해 KV Cache를 만든 뒤, 이를 Cerebras WSE에 전달하고 Cerebras가 Decode를 담당한다. AWS–Cerebras 발표

AMD와의 협업 역시 유사하다. AMD Helios가 Prefill을 담당하고 Cerebras가 Decode를 담당하는 구조다. Cerebras 경영진은 이 조합이 Cerebras의 speed를 유지하면서 Throughput을 최대 5배 확대할 수 있다고 설명한다.

이것은 사실 Cerebras의 약점을 인정하면서 동시에 가장 강한 부분만 떼어내는 전략이다.

HBM/GPU가 잘하는 일을 빼앗으려 하지 않고, Cerebras가 가장 잘하는 Decode만 가져가는 것이다.


7. 그렇다면 어느 산업이 어느 Architecture를 필요로 할까


여기서 가장 중요한 것은 산업 전체를 Cerebras 산업과 HBM 산업으로 나누면 안 된다는 점이다.

한 기업 안에서도 workload마다 필요한 Memory Hierarchy가 다르기 때문이다.


Cybersecurity를 다시 보면 이 구조가 특히 잘 보인다.

수년간 축적된 모든 보안 로그를 Cerebras SRAM 안에 넣을 이유는 없다.

Data Lake에 모든 로그를 보관하고 → 필요한 Context만 HBM/Prefill Engine이 처리하고 → Cerebras가 빠르게 판단한 뒤 → Security System이 차단한다.

이 구조에서는 HBM과 Cerebras가 경쟁자가 아니라 한 inference pipeline의 서로 다른 계층이 된다.

Coding 역시 비슷하다. 전체 Code Repository와 장기 Agent state는 HBM 또는 별도 Context Memory에 보관하고, 사용자가 기다리고 있는 Coding·Debugging·Validation loop만 Cerebras가 빠르게 처리할 수 있다.

반대로 하루 동안 수십만 token의 history를 유지하는 Autonomous Agent 수천 개를 동시에 서비스한다면 Cerebras보다 HBM capacity와 KV-management architecture가 훨씬 중요해질 가능성이 높다.

따라서 앞으로 AI chip 경쟁을 판단할 때 단순 tokens/sec benchmark는 충분하지 않다.

실제로 확인해야 할 숫자는 다음과 같은 형태가 된다.

Tokens/sec per user
at X Context Length
at Y Concurrent Users
within Z Power Budget

결국 Latency × Context × Concurrency × Power를 동시에 봐야 한다.


8. 결국 시장은 Cerebras와 HBM 중 하나를 선택할까


현재 가장 가능성이 높은 답은 아니다라고 본다.

Cerebras의 성공이 HBM의 실패를 의미하지 않고, HBM 수요 증가가 Cerebras의 실패를 의미하지도 않는다.

오히려 Agentic AI가 커질수록 두 종류의 메모리 요구가 동시에 증가한다.

Reasoning Token 증가 → Decode Bandwidth 요구 증가

동시에

Agent 수·Context 증가 → KV Cache Capacity 요구 증가

가 발생한다.

첫 번째 문제에서는 Cerebras의 massive SRAM architecture가 강력하다. 두 번째 문제에서는 HBM과 Context Memory가 훨씬 유리하다.

따라서 가장 가능성 높은 Architecture는 다음과 같다.

Large Context / Prefill / KV State
→ HBM·Context Memory

Latency-sensitive Sequential Decode
→ Cerebras 같은 SRAM-centric Accelerator

이런 관점에서 보면 AMD와 AWS가 Cerebras와 Disaggregated Inference를 만드는 것은 단순한 파트너십 이상의 의미가 있다. 두 회사 모두 Cerebras를 GPU나 Trainium의 완전한 대체재가 아니라 Decode Specialist로 이용하려 하고 있기 때문이다.

그리고 이것이 Cerebras 투자 Thesis에서 가장 과소평가될 수 있는 부분이라고 생각한다.

Cerebras가 NVIDIA를 대체해야 성공하는 것이 아니다.

전체 AI Compute의 일부이지만 경제적 가치가 가장 높은 Latency-sensitive Decode 시장을 장악해도 충분히 큰 사업이 될 수 있다.


9. 최종적으로 무엇을 봐야 하는가


가장 가능성이 높은 시나리오는 AI inference infrastructure가 workload별로 분화되는 것이다. HBM GPU는 Training, Prefill, Long Context, High Concurrency에서 핵심 지위를 유지하고, Cerebras는 latency-sensitive Decode에서 특화된 시장을 형성할 가능성이 높다.

재평가가 시급한 부분은 inference speed가 단순한 UX 변수가 아니라는 점이다. 빠른 inference는 동일한 시간 안에서 더 많은 reasoning, validation, tool call을 가능하게 한다. Cybersecurity에서는 그 차이가 생산성을 넘어 실제 공격을 방어할 수 있는 시간적 여유로 전환될 수도 있다.

여기에 Cerebras가 가진 또 하나의 장점이 결합된다. 5nm 공정과 on-chip SRAM을 사용하는 구조 덕분에 HBM, CoWoS, 최신 3nm급 Logic Capacity라는 현재 AI 반도체 공급망의 주요 병목에 대한 의존도가 상대적으로 낮다.

즉 Cerebras의 성장 Thesis는 수요 측면에서만 존재하지 않는다.

**Fast Decode라는 새로운 수요

  • 공급망 병목을 일부 우회하는 Architecture

  • 데이터센터 Capacity 확대
    = 빠른 Revenue Ramp**

라는 공급과 수요의 결합으로 봐야 한다.

반면 Highest Asymmetric Impact를 갖는 변수는 Long-context Agent의 발전 방향이다.

만약 미래 Agent가 수십만~수백만 token의 Context를 장시간 유지하고 수천 개의 세션을 동시에 서비스하는 방향으로 발전한다면 HBM Capacity와 Context Memory의 중요성은 지금보다 더욱 커질 수 있다.

반대로 Context Compression, Sparse Attention, External Memory, Retrieval 기술이 발전해 실제 Accelerator가 유지해야 하는 Active KV를 작게 만들 수 있다면 Cerebras가 가진 초고속 SRAM Decode의 적용 범위는 훨씬 넓어진다.

그래서 Cerebras와 HBM의 미래를 판단하는 가장 중요한 질문은 결국 하나로 수렴한다.

“미래의 Agent가 얼마나 많이 기억해야 하는가, 그리고 얼마나 빨리 생각해야 하는가.”

많이 기억해야 한다면 HBM이 중요하다.

빠르게 생각해야 한다면 Cerebras가 중요하다.

그리고 현재 AI 산업이 향하는 방향은 둘 중 하나가 아니라, 더 많이 기억하면서 동시에 더 빨리 생각하는 시스템에 가깝다.

그렇다면 장기적으로 가장 설득력 있는 그림은 Cerebras와 HBM의 승자독식 경쟁이 아니다.

HBM과 Context Memory가 AI의 거대한 기억을 담당하고, Cerebras와 같은 SRAM-centric Accelerator가 그 기억을 바탕으로 가장 빠르게 생각하는 구조.

AI infrastructure가 이 방향으로 발전한다면 Cerebras의 최근 급성장은 단순히 또 하나의 AI accelerator가 시장에 진입했다는 사건이 아니다.

오히려 지금까지 GPU 하나가 담당하던 inference pipeline이 Memory Capacity와 Decode Speed라는 서로 다른 문제로 분리되기 시작했다는 신호일 수 있다.


#글을 마치며


마침 아침에 그동안 NVIDIA, 메모리와 관련해 다소 부정적인 시각을 반복적으로 제기해 온 기자와, 어느 외국계 펀드매니저의 인터뷰 기사를 접했다. 

여기에 일부 중국계 매체에서는 Cerebras의 아키텍처를 근거로 HBM의 필요성이 크게 낮아질 수 있다는 식의 주장까지 확산되고 있었다. 개인적으로는 기술 구조와 실제 AI 인프라의 병목을 충분히 검토하지 않은 채 결론이 앞선 해석으로 보인다.

=끝

2026년 8월 12일 수요일

생각정리 339 (* Naver x Nvidia, Neocloud)

NAVER를 바라보는 시각의 변화가 있어 관련 리서치를 기록으로 남겨본다.

NAVER × NVIDIA를 다시 보다

Agentic AI, Asset-light Capital, CLOUD Act가 바꾼 판단


지난 NAVER AI Factory 글의 첫 문장은 사실상 “Good luck, Naver..”였다.

당시 나는 NAVER가 제시한 AI Factory 계획을 상당히 부정적으로 봤다. 1GW Capacity에서 20조원의 매출과 20% 후반대 영업이익률을 만들겠다는 목표는 지나치게 공격적으로 느껴졌고, NVIDIA와의 협력 역시 NAVER만의 독점적인 관계라기보다 수많은 Cloud Partner 가운데 하나가 추가되는 정도로 생각했다.

솔직히 말하면 과거 두나무 인수 사례처럼 불리한 사업을 떠안았거나, 젠슨 황의 립서비스를 지나치게 긍정적으로 받아들인 것이 아닌가 하는 생각도 했다. NVIDIA 입장에서 NAVER는 있으면 좋지만 없어도 큰 문제가 없는 One of them에 불과하다고 봤다.

지금도 NAVER가 제시한 1GW·20조원 매출·20% 후반대 OPM을 Base Case로 반영하는 데에는 반대한다.

그러나 최근 Nebius의 실적발표와 CoreWeave·Nebius 같은 Neocloud의 전략 변화를 다시 살펴보고, NVIDIA가 AI Factory의 Software와 Financing Layer까지 확장하는 과정을 공부하면서 NAVER × NVIDIA의 산업적 의미에 대한 판단은 상당히 달라졌다.

여기에 미국의 CLOUD Act와 Sovereign AI, Data Sovereignty의 중요성이 커지는 흐름을 연결하면 새로운 가능성이 보인다.

NAVER가 NVIDIA GPU를 대규모로 구매해 임대하는 저ROIC Infrastructure 사업자가 아니라, 외부 Capital과 NVIDIA의 Compute Stack 위에 지역별 Data·Cloud·Agent·Application을 결합하는 Sovereign AI Production Platform으로 발전할 가능성이다.

이 글은 NAVER AI Factory에 대한 기존 판단을 완전히 뒤집기 위한 글은 아니다.

오히려 내가 과거에 무엇을 맞게 봤고, 무엇을 지나치게 단순하게 봤으며, 어떤 새로운 Evidence 때문에 판단을 얼마나 수정하게 됐는지 정리하기 위한 글이다.


판단 변화 요약


업로드 중: 총 34387바이트 중 34387바이트가 업로드되었습니다.


전략적 가능성에 대한 평가는 크게 올렸다.

그러나 2027~2030년 실적 추정치에 반영할 수 있는 가시성은 아직 크게 달라지지 않았다.

즉 Strategic Thesis는 상향했지만 Earnings Thesis는 아직 유보적이다.


1. 이전 판단이 틀렸다기보다 분석 단위가 너무 좁았다


NAVER가 모든 MW를 직접 소유한다는 전제


기존 글에서 내가 가장 우려했던 것은 NAVER의 기존 사업과 AI Factory 사업의 성격이 완전히 다르다는 점이었다.

검색·커머스·콘텐츠·핀테크는 플랫폼을 먼저 구축한 뒤 이용자와 거래가 증가할수록 추가 매출이 발생하는 구조다. 반면 AI Factory는 GPU, 서버, 네트워크, 냉각설비, 데이터센터, 전력과 금융비용을 먼저 투입한 뒤 고객과 Utilization을 확보해야 하는 자본집약적 사업이다.

당시 내 머릿속의 사업구조는 다음과 같았다.

NAVER Balance Sheet
→ GPU·서버·Data Center 투자
→ 전력과 냉각설비 확보
→ 고객 유치
→ Utilization Risk 부담
→ 감가상각과 이자비용 부담
→ GPU 세대교체 Risk 부담


이 구조에서는 AI 수요가 증가하더라도 초과이익의 상당 부분이 NVIDIA와 HBM·Networking 공급망에 귀속될 가능성이 높다.

NAVER는 경쟁이 심해지는 AI Cloud 시장에서 고객 가격을 낮춰야 하지만, NVIDIA와 부품 공급업체에는 높은 가격을 지급해야 한다. 따라서 매출이 빠르게 증가하더라도 ROIC와 Free Cash Flow가 나빠질 위험이 있었다.

이 문제의식은 지금도 유효하다.


1GW라는 숫자보다 계약이 중요하다는 판단도 유지한다


기존 글에서는 NAVER를 CoreWeave와 비교하면서 단순히 “1GW를 구축하겠다”는 목표만으로는 부족하다고 봤다.

실제로 확인해야 할 것은 전력이 연결된 Energized MW, 설치된 GPU, 장기 Capacity Reservation, Take-or-pay 여부, 고객 선급금, Cost Pass-through 조항과 실제 매출 Backlog다. 고객이 관심을 보이는 단계와 장기간 사용료를 의무적으로 지급하는 계약은 전혀 다른 의미를 가진다.

이 판단도 바뀌지 않았다.

NAVER는 아직 Nebius처럼

  • Revenue/MW

  • 계약기간

  • 고객 선급금

  • 계약 Capacity

  • Payback Period

  • Backlog

  • Take-or-pay 조건

을 충분히 공개하지 않았다.

따라서 NAVER AI Factory를 Earnings Model에 본격적으로 반영하기에는 여전히 정보가 부족하다.


달라진 것은 ‘누가 자산을 소유하는가’라는 질문이다


과거에는 AI Factory의 경제성을 사실상 다음 식으로 생각했다.

AI Factory Revenue = NAVER가 직접 소유한 MW × Revenue/MW


그러나 지금은 이 식 자체가 잘못된 출발점일 수 있다고 본다.

NAVER가 모든 Physical Capacity를 직접 소유할 필요는 없다.

외부 투자자가 Data Center와 Compute Asset에 Capital을 제공하고, NVIDIA가 Silicon과 Infrastructure Software를 공급하며, NAVER가 Cloud Operation·Customer·Data·Model·Application을 제공할 수 있다.

이 경우 NAVER가 인식하는 매출은 AI Factory 전체 매출보다 작아질 수 있다.

반대로 NAVER가 투입하는 자기자본과 감가상각 부담도 크게 줄어들 수 있다.

즉 투자자에게 중요한 것은 AI Factory 전체의 Gross Revenue가 아니라 NAVER Equity Capital 한 단위가 가져가는 Earnings와 Cash Flow이다.


2. 첫 번째 판단 변화: Neocloud는 단순한 GPU Rental 사업이 아닐 수 있다


AI의 병목이 Model에서 Execution으로 이동하고 있다


CoreWeave와 Nebius를 처음 볼 때는 이들을 대규모 GPU를 확보한 뒤 높은 레버리지를 이용해 임대하는 사업자로 생각했다.

GPU 공급 부족이 해소되면 차별화가 사라지고, 구형 GPU 가격은 하락하지만 감가상각과 부채는 남는 구조라고 봤다.

하지만 최근 AI 산업의 발전방향을 보면 Compute 수요는 더 이상 일회성 Training이나 단순 Inference에서 끝나지 않는다.

AI는 점차 다음과 같은 Production Loop로 이동하고 있다.

Model
→ Agent
→ Tool Use
→ Execution
→ Verification
→ Evaluation
→ Retry
→ Learning

Agent가 장시간 작업하고, 외부 시스템을 사용하며, 결과를 검증하고, 실패하면 다시 실행하는 구조에서는 같은 업무를 완료하기 위해 훨씬 더 많은 Compute와 다양한 Runtime이 필요하다.

중요한 것은 단순히 몇 개의 Token을 생성했는지가 아니다.

얼마나 많은 검증된 작업을 안정적으로 완료했는가

가 더 중요한 경제적 단위가 된다.

내가 Neocloud를 단순 GPU Rental이 아니라 Model과 Silicon 사이에서 AI의 실행과 반복개선을 담당하는 Merchant AI Factory로 다시 보기 시작한 이유도 여기에 있다.


Software Attach의 목적은 Software 매출 자체가 아니다


CoreWeave와 Nebius가 Software Layer를 강화하는 이유를 단순히 높은 Valuation Multiple을 받기 위한 전략으로만 보면 부족하다.

Software는 Training, Inference, Evaluation, Sandbox, RL, Agent Runtime을 하나의 Workflow로 연결한다.

이렇게 서로 다른 Workload를 결합하면 Training 수요가 낮은 시간에는 Inference와 Evaluation을 배치하고, Inference가 낮은 시간에는 Batch Processing이나 Synthetic Data Generation을 수행할 수 있다.

그 결과 다음과 같은 구조가 만들어진다.

Software Attach
→ Workload Diversity
→ Utilization 상승
→ 동일 MW에서 더 많은 Compute 판매
→ Revenue/MW 상승
→ Gross Margin 개선
→ ROIC 개선

즉 Software의 가치는 별도의 SaaS 매출보다 기존 Compute Asset의 경제성을 높이는 것에 있을 수 있다.

Nebius가 Open Model의 Fine-tuning과 Inference, Quantization, Orchestration, Search와 Grounding을 연결하려는 것도 같은 방향이다.

고객이 Model을 교체하더라도 Training History, Evaluation Trace, Runtime Configuration, Inference Endpoint와 Capacity Workflow는 플랫폼에 남는다. 이 과정에서 Neocloud는 일종의 Execution Gravity를 만들 수 있다.


이 논리를 NAVER에 적용하면 기존 자산이 다르게 보인다


NAVER는 순수한 AI Infrastructure Startup이 아니다.

검색, 커머스, 지도, 결제, 콘텐츠, Cloud, HyperCLOVA X, Digital Twin과 Robotics를 이미 운영하고 있다. 과거에는 이러한 Application 자산과 AI Factory가 다소 분리된 사업처럼 보였다.

그러나 Agentic AI가 확산될수록 NAVER의 기존 서비스와 Data는 AI Factory의 Utilization을 높이는 내부 Workload이자 외부 고객을 확보하는 Product Layer가 될 수 있다.

예를 들어 다음과 같은 Loop가 가능하다.

NAVER Search·Commerce·Map Data
→ Domain Model·Agent 개발
→ NVIDIA 기반 Training·Post-training
→ 검색·쇼핑·광고·지도 서비스에 배치
→ 실제 사용자 행동과 Outcome 축적
→ Evaluation·RL Data 생성
→ 추가 Training과 Inference
→ 다시 Compute Consumption

이 구조에서는 Software와 Application이 Compute를 소비하고, Compute가 다시 더 좋은 Software와 Application을 만든다.

NAVER가 이 Loop를 외부 기업과 정부에 Platform 형태로 제공할 수 있다면 AI Factory는 단순 GPU Rental이 아니라 Data–Model–Execution–Application이 연결된 Production Infrastructure가 된다.


다만 Execution Layer의 주인이 NVIDIA가 될 수도 있다


여기에서 중요한 반론이 있다.

NVIDIA의 DSX는 단순한 GPU Reference Architecture가 아니다.

DSX는 Chip, System, Networking, Power, Cooling, Infrastructure Software와 운영체계를 하나의 AI Factory Stack으로 통합한다. DSX OS는 Lifecycle Management, Runtime Consistency, Health Automation, Resiliency, Scheduling과 Multi-tenant Operation을 제공하고, DSX MaxLPS는 제한된 전력 안에서 Token Throughput/MW를 높이는 것을 목표로 한다.

NAVER 역시 DSX 위에서 HyperCLOVA X를 NVIDIA Nemotron과 결합하고, NemoClaw 기반 Agent Platform과 Cosmos 기반 Seoul World Model을 개발할 계획이다.

따라서 NAVER가 DSX를 설치하고 NVIDIA Software를 재판매하는 데 그친다면 Switching Cost와 Execution Gravity는 NAVER가 아니라 NVIDIA에 쌓일 수 있다.

NAVER가 별도의 경쟁우위를 만들려면 NVIDIA Stack 위에 다음 자산을 축적해야 한다.

  • Local Data와 Domain Context

  • Enterprise Connector

  • Identity와 Permission

  • Local Regulation과 Governance

  • Application Workflow

  • Evaluation Dataset

  • Human Approval과 Audit

  • 실제 업무 결과와 Outcome History


모델과 Hardware는 NVIDIA가 공급하더라도 고객의 업무 의미와 실행결과가 NAVER Platform 안에 축적되어야 한다.


3. 두 번째 판단 변화: Brookfield가 Capital Structure를 바꿀 수 있다


200MW보다 중요한 것은 $9bn의 외부 Capital이다


2026년 7월 NAVER, NVIDIA와 Brookfield는 NAVER의 NVIDIA DSX AI Factory를 기존 55MW에서 2028년 200MW까지 확대하는 계획을 발표했다.

NVIDIA는 NAVER에 $1bn을 투자할 계획이며, Brookfield는 프로젝트에 최대 $9bn을 공급하는 Nonbinding Term Sheet를 체결했다. NVIDIA 투자는 NAVER가 NVIDIA 투자와 별도로 최소 $9bn의 확정 Financing을 확보하는 등의 조건을 충족해야 한다.

여기에서 중요한 것은 200MW라는 숫자 자체가 아니다.

NAVER가 AI Factory 구축비용 전부를 자신의 Balance Sheet로 부담하지 않을 가능성이 공식화됐다는 점이 더 중요하다.

기존 구조는 다음과 같았다.

NAVER Capital
→ Data Center
→ GPU
→ Customer
→ Revenue

앞으로 가능한 구조는 다음에 가깝다.

Brookfield Capital·Physical Infrastructure
× NVIDIA Silicon·Networking·DSX
× NAVER Operation·Customer·Data·Application

Brookfield는 Data Center, 전력과 장기 실물자산 투자에 필요한 자본을 제공한다.

NVIDIA는 Accelerator와 Network뿐 아니라 AI Factory Architecture와 Runtime Software를 제공한다.

NAVER는 Data Center 운영, Cloud Platform, 고객 확보, Model과 Agent, Sovereign AI Application을 담당한다.


NVIDIA도 GPU 판매를 넘어 Financing과 Revenue Sharing으로 이동하고 있다


NVIDIA는 2026년 7월 AI Cloud의 대규모 Multi-tenant AI Factory 구축을 지원하기 위해 Revenue Sharing과 Credit Support를 결합한 새로운 사업모델을 공개했다.

모델 개발기업이나 AI Startup의 장기 Compute 계약만으로 Financing이 어려울 경우 NVIDIA가 AI Cloud와 자본 제공자 사이에서 계약 안정성과 자금조달을 지원하고, 향후 발생하는 Cloud Revenue의 일부를 공유하는 구조다.

NAVER–Brookfield 거래가 이 구조를 그대로 사용한다고 확인된 것은 아니다.

그러나 NVIDIA의 방향은 분명하다.

NVIDIA는 GPU Vendor에서 AI Factory Platform·Demand Aggregator·Financing Enabler로 확장하고 있다.

NVIDIA가 모든 AI Factory를 직접 소유할 필요는 없다.

대신 외부 자본과 Cloud Partner를 연결해 더 많은 NVIDIA Capacity가 더 빠르게 구축되고, 그 위에서 지속적으로 Token이 생산되는 생태계를 만들면 된다.

NAVER는 이 생태계의 지역 사업자 중 하나가 될 수 있다.


Asset-light는 매출을 줄이고 ROIC를 높일 수 있다


Brookfield가 대부분의 Physical Asset을 소유하고 NAVER가 운영·Platform Revenue를 가져가는 구조라면 NAVER가 회계상 인식하는 매출은 AI Factory 전체 매출보다 작을 수 있다.


예를 들어 1GW에서 20조원의 Gross Compute Revenue가 발생하더라도, NAVER가 그중 일부 Operating Fee와 Platform Take Rate만 인식한다면 회사 매출은 20조원보다 크게 작아진다.

그러나 NAVER가 투입한 자기자본과 감가상각, 금융비용 역시 크게 줄어들 수 있다.

그렇다면 투자자에게 중요한 식은 다음과 같이 바뀐다.

NAVER AI Factory Equity Value
= NAVER-funded Capacity의 Infrastructure Earnings
+ Partner-funded Capacity의 Platform Take Rate
+ Model·Inference·Agent Software Revenue
+ Sovereign AI·Physical AI·Application Revenue
− NAVER가 실제 부담하는 Invested Capital

즉 1GW가 모두 NAVER 매출로 잡히는지가 중요한 것이 아니다.

NAVER가 자기자본을 얼마나 적게 투입하면서 AI Factory에서 발생하는 Economics를 얼마나 많이 가져갈 수 있는가

가 더 중요하다.


아직 Asset-light가 확정된 것은 아니다


여기에서 지나치게 앞서가면 안 된다.

Brookfield의 $9bn은 아직 Nonbinding Term Sheet다. 최종 계약에서 NAVER가 장기 임차료, 최소 Capacity 사용료, 수익률 보장 또는 추가 출자 의무를 부담할 수 있다. NVIDIA의 $1bn 투자 역시 선행조건이 붙어 있다.

따라서 이번 발표만으로

  • NAVER의 CapEx가 거의 없다

  • Project Financing이 완전히 Non-recourse다

  • NAVER가 높은 Platform Margin을 확보한다

  • Brookfield가 모든 잔존가치 Risk를 부담한다

고 결론 내릴 수는 없다.

정확한 판단을 위해서는 최종 계약에서 Asset Ownership, Debt Guarantee, Lease Commitment, Revenue Share, Minimum Payment와 Residual Value Risk를 확인해야 한다.

그럼에도 기존 Bear Thesis 가운데 하나였던

“NAVER가 수십조원의 AI Infrastructure를 전부 자기자본으로 구축해야 한다”

는 전제는 상당히 약해졌다.


4. 세 번째 판단 변화: Sovereign AI는 단순한 Data Localization이 아니다


CLOUD Act의 핵심은 데이터 위치보다 Control이다


2018년 3월 23일 미국에서 CLOUD Act가 포함된 법률이 발효됐다.

CLOUD Act는 미국의 관할 대상인 전자통신·Remote Computing Service Provider가 보유·관리·통제하는 데이터에 대해, 적법한 법적 절차가 있다면 데이터가 미국 안에 있는지 해외에 있는지와 무관하게 제출의무가 발생할 수 있음을 명확히 했다.

다만 이를

“미국 회사를 사용하면 미국 정부가 어느 나라의 데이터든 마음대로 가져갈 수 있다”

고 표현하는 것은 지나친 단순화다.

CLOUD Act에 따른 접근에는 법적 절차가 필요하며, 핵심 판단기준은 사업자가 미국 관할에 놓이는지와 해당 데이터가 그 사업자의 Possession, Custody or Control 안에 있는지다. 미국 법무부 역시 CLOUD Act가 어떤 사업자가 미국 관할 대상인지 자체를 새롭게 확장한 것은 아니라고 설명한다.

그럼에도 투자 관점에서 중요한 결론은 남는다.

Data가 어느 국가의 서버에 저장되어 있는지만으로는 완전한 데이터 주권을 설명할 수 없다.

누가 Encryption Key를 관리하는지, 누가 Control Plane을 운영하는지, 누가 Remote Access 권한을 가지는지, 데이터에 대한 법적·실질적 Control을 누가 보유하는지를 함께 봐야 한다.


NVIDIA GPU를 사용한다고 데이터가 자동으로 미국 관할에 들어가는 것은 아니다


CLOUD Act의 문언을 기준으로 보면 NVIDIA GPU를 사용했다는 사실 자체보다, NVIDIA 또는 다른 미국 사업자가 고객 데이터에 대한 실질적인 Possession·Custody·Control을 갖는지가 더 중요하다.

즉 NAVER가 현지 법인 또는 JV를 통해 다음 구조를 만들 수 있다면 미국 CSP와 다른 Sovereign Architecture를 제공할 여지가 있다.

  • Data는 현지 Data Center에 저장

  • Encryption Key는 현지 고객 또는 JV가 관리

  • Control Plane은 현지에서 운영

  • 미국 본사의 관리자 접근을 기술적으로 제한

  • 현지 인력이 운영과 장애 대응을 담당

  • Model Weight와 Fine-tuning Data를 현지에서 통제

  • 고객 Workflow와 Application도 현지 Platform에 배치

이는 법률적으로 개별 계약과 법인구조에 대한 검토가 필요한 영역이다.

NAVER가 한국 기업이라는 사실만으로 모든 미국 관할 리스크에서 자동으로 벗어나는 것도 아니다. 미국 내 법인, 계약관계, 지원조직과 실제 데이터 통제구조에 따라 판단이 달라질 수 있다.

따라서 NAVER의 Sovereign AI 경쟁력은 단순한 국적에서 나오는 것이 아니다.

기술·계약·법인·운영구조를 얼마나 실제로 분리할 수 있는가

에서 발생한다.


Sovereign AI는 여러 단계로 나누어야 한다


Sovereign AI를 단순히 자국 Data Center에서 AI를 운영하는 것으로 정의하면 NAVER의 차별화는 크지 않다.

AWS, Microsoft, Google과 Oracle도 Local Region, Local Key Management, Partner-operated Cloud, Dedicated Region과 Air-gapped Cloud를 제공할 수 있기 때문이다. Microsoft는 Azure Local을 통해 Local 또는 Disconnected 환경을 지원하고 있으며, Google Distributed Cloud는 Public Internet이나 Google Cloud 연결 없이 운영할 수 있는 Air-gapped Option을 제공한다. AWS 역시 European Sovereign Cloud와 Dedicated Local Zone을 확대하고 있다.

따라서 Sovereign AI를 다음과 같이 나눌 필요가 있다.


Data Residency만 중요하다면 미국 CSP도 충분히 대응할 수 있다.

하지만 요구조건이

Data must stay here

에서

Foreign operator must not access it

그리고 다시

Foreign government must not be able to compel the operator controlling it

로 이동하면 사업자 선택기준이 달라질 수 있다.

이 단계에서는 법인구조와 운영주체 자체가 Product Feature가 된다.


Sovereignty-sensitive Workload가 별도 시장을 만들 수 있다


모든 AI Workload가 높은 수준의 주권성을 요구하지는 않는다.

일반적인 Marketing, Customer Service, Coding이나 공개정보 기반 Application은 가격과 성능, 개발자 Ecosystem이 더 중요할 수 있다.

반면 다음 영역에서는 Data와 Operation의 통제권이 구매조건이 될 가능성이 높다.

  • 정부와 공공행정

  • 국방과 안보

  • 금융과 중앙은행

  • 의료와 국민 데이터

  • 국가 Digital Twin

  • 전력·교통·통신 등 Critical Infrastructure

  • 제조업의 핵심 설계·공정 데이터

  • Physical AI와 Autonomous System

이 시장에서는 가장 좋은 Model이나 가장 싼 Token만으로 사업자가 결정되지 않는다.

어느 나라의 사업자가 운영하는지, 누가 Access 권한을 보유하는지, 장애·제재·분쟁 상황에서도 독립적으로 운영할 수 있는지가 중요해진다.

NAVER가 미국 CSP 전체보다 우월하다는 의미는 아니다.

다만 Sovereignty-sensitive Workload라는 별도의 시장이 커질 경우, 미국계 Neocloud보다 유리한 Position을 확보할 가능성은 존재한다.


5. 중동과 아시아에서 NAVER가 가질 수 있는 새로운 위치


사우디에서 NAVER는 갑자기 GPU를 팔러 들어가는 회사가 아니다


NAVER의 사우디 진출과정을 다시 보면 중요한 순서가 보인다.

NAVER는 2024년 Aramco Digital과 Sovereign AI, Cloud, Super App과 Smart City 관련 MOU를 체결했다. 같은 해 사우디 정부 및 NHC와 주요 도시의 Digital Twin Platform 구축을 시작했다.

2025년에는 메카·메디나·제다 3개 도시, 약 6,800㎢와 92만 개 이상의 건물을 대상으로 한 Digital Twin Platform의 초기 구축을 완료했다. 또한 NAVER Cloud와 NHC Innovation은 사우디 현지 JV인 NAVER Innovation 설립 계약을 체결했고, 이 JV는 Digital Twin을 기반으로 주거·교통 등 생활서비스를 연결하는 Map-based Super App의 개발과 운영을 추진한다.

즉 NAVER의 사우디 진입경로는 다음과 같다.

정부 관계와 Project 수주
→ Digital Twin Infrastructure
→ Spatial Data 축적
→ Smart City Application
→ Local JV 설립
→ Super App과 Cloud
→ Sovereign AI
→ AI Factory

이 구조는 단순한 GPU 판매보다 훨씬 중요하다.

국가의 도시·교통·주거 Data와 Application Workflow 안으로 먼저 들어간 뒤, 그 위에 Cloud와 AI Infrastructure를 추가하는 방식이기 때문이다.


사우디의 규제 방향도 Local Control을 강화하고 있다


사우디의 Personal Data Protection Law는 해외 데이터 이전 자체를 전면 금지하지는 않는다.

그러나 해외 이전 시 사우디의 국가안보와 핵심이익을 침해해서는 안 되며, 해외에서도 적절한 보호수준과 Safeguard가 확보되어야 한다. 민감정보를 지속적·대규모로 해외 이전하는 경우에는 별도의 Risk Assessment가 요구된다.

사우디 National Cybersecurity Authority의 Cloud Cybersecurity Controls도 Data Localization 관련 요구사항을 반영하도록 업데이트됐다. 정부기관의 Cloud 도입 지침 역시 Data Classification에 따라 Service Provider를 선정하도록 요구한다.

이는 사우디가 모든 데이터를 반드시 국내에만 두겠다는 의미는 아니다.

그러나 정부·금융·도시·Critical Infrastructure처럼 민감도가 높은 Workload일수록 Local Data, Local Operation과 Local Governance의 가치가 높아질 가능성을 보여준다.

NAVER가 이미 Digital Twin과 현지 JV를 통해 Government Workflow와 Local Partner를 확보하고 있다는 점은 이 시장에서 의미가 있다.


동남아에서도 같은 구조를 복제하려 하고 있다


NAVER Cloud는 2025년 NVIDIA와 함께 동남아 Sovereign AI 시장을 공략하고, LLM·Infrastructure·Application 영역의 현지 Partner를 발굴하겠다는 계획을 공개했다.

NAVER는 자신이 AI Service, Data, Supercomputing, Cloud와 Data Center를 아우르는 End-to-end Value Chain을 보유하고 있어 국가별 기술 수준과 정책요구에 맞춘 Sovereign AI를 제공할 수 있다고 설명했다.

2026년 NAVER와 NVIDIA의 협력도 한국에만 한정되지 않는다.

양사는 아시아·중동·유럽을 대상으로 Gigawatt-scale AI Factory 사업을 공동 추진하고, 글로벌 수요 발굴에서 Capital 협력까지 사업 Risk와 성과를 공유하는 파트너십을 지향한다고 밝혔다.

아직 회사의 목표와 실제 계약을 구분해야 한다.

다만 NAVER가 단순히 한국에서 NVIDIA GPU를 구매하는 고객이 아니라, NVIDIA Stack을 지역별 Sovereign AI 사업으로 연결하는 Operator를 지향하고 있다는 점은 이전보다 분명해졌다.


NVIDIA가 NAVER를 필요로 할 이유도 달라진다


NVIDIA가 원하는 것은 가능한 많은 국가와 기업이 NVIDIA GPU, CUDA, Networking, DSX, Nemotron과 Agent Software를 사용하도록 만드는 것이다.

하지만 NVIDIA가 모든 국가에서 직접 Data Center를 소유하고, 정부와 계약하며, 현지 규제에 대응하고, 기업 Application을 구축하기는 어렵다.

미국 CSP에 대한 정치적·법적 경계가 강한 국가에서는 NVIDIA가 직접 Cloud Operator로 들어가는 것 역시 미국 기업이라는 문제를 해결하지 못한다.

이 경우 NVIDIA에게 이상적인 구조는 다음과 같다.

Local·Sovereign Capital
× Non-US Regional Operator
× NVIDIA Compute and Software

NAVER가 NVIDIA에게 제공할 수 있는 자산은 단순한 GPU 구매력이 아닐 수 있다.

Sovereign Market Access

즉 미국 Cloud 사업자에게 국가 Data와 AI 운영권을 전적으로 맡기고 싶지는 않지만, NVIDIA의 최신 Compute를 원하는 국가에 대해 NAVER가 법적·운영적·상업적 중간계층을 제공하는 것이다.

이를 한 문장으로 정리하면 다음과 같다.

NVIDIA Technology without a U.S. Cloud Operator

이 구조가 실제로 성립한다면 NAVER의 협상력은 단순한 GPU 고객일 때보다 높아질 수 있다.


6. NAVER가 미국 CSP보다 무조건 유리한 것은 아니다


미국 Hyperscaler도 이미 Sovereign Cloud를 만들고 있다


CLOUD Act와 Data Sovereignty 문제가 커진다고 해서 미국 CSP가 시장에서 자동으로 밀려나는 것은 아니다.

Microsoft는 현지 인력에 의한 Access Approval, 고객관리 Encryption Key, Azure Local과 Fully Disconnected 환경을 제공하고 있다. Google은 Local Partner가 Sovereign Control을 관리하는 모델과 Public Internet에서 완전히 격리된 Distributed Cloud를 제공한다. AWS와 Oracle 역시 별도 Sovereign Region과 Dedicated Cloud를 확대하고 있다.

이들은 NAVER보다 훨씬 많은 Cloud Service, 개발자, Enterprise Customer, Security Certification과 글로벌 운영 경험을 보유하고 있다.

따라서 Sovereign AI가 확산된다고 해서 NAVER가 AWS·Azure·Google을 광범위하게 대체할 가능성은 낮다.

NAVER의 기회는 더 좁고 구체적으로 정의해야 한다.

미국 사업자가 직접 운영하는 구조를 원하지 않으면서, NVIDIA Compute와 Full-stack AI Platform은 필요로 하는 국가·정부·기업

이 시장이다.


Sovereignty는 기술력 부족을 보완하는 면허가 아니다


고객이 Data Sovereignty를 중요하게 생각하더라도 성능, 안정성, 가격과 Service 수준이 크게 떨어지는 사업자를 선택하기는 어렵다.

따라서 Sovereignty는 기술경쟁을 없애는 것이 아니다.

최소한의 성능과 가격 경쟁력을 충족한 사업자 사이에서 선택을 바꾸는 추가 경쟁축

에 가깝다.

NAVER가 미국 Neocloud보다 유리하려면 다음 조건이 필요하다.

  • NVIDIA 최신 Architecture를 비슷한 시점에 확보

  • 경쟁력 있는 Token Cost와 Network Performance

  • 장기간 안정적인 Capacity 제공

  • 현지 Data Center와 Local Operation

  • 현지 Regulation에 맞춘 Governance

  • 정부·기업 Application 구축 능력

  • Local Partner와 장기 Customer Relationship

이 가운데 하나라도 부족하면 고객은 결국 더 강한 Hyperscaler나 현지 국영사업자를 선택할 수 있다.


NAVER의 경쟁우위는 Non-US라는 사실 하나가 아니다


NAVER가 한국 기업이라는 사실은 잠재적인 장점이다.

그러나 그것만으로 충분한 Moat가 되지는 않는다.

NAVER가 가질 수 있는 차별화는 다음 요소의 결합에서 발생한다.


이 중 Local Data, Application과 Outcome Loop가 없다면 NAVER는 결국 다른 NVIDIA Cloud Partner와 유사해진다.

반대로 이 Loop가 만들어지면 고객의 Switching Cost는 Hardware가 아니라 Data·Workflow·Governance와 실제 운영이력에서 발생한다.


7. 가장 큰 역설: NAVER도 Silicon Sovereignty는 제공할 수 없다


NAVER의 Sovereign AI는 완전한 기술자립을 의미하지 않는다.

AI Factory의 최하단에는 여전히 NVIDIA GPU, Networking, CUDA와 DSX가 존재한다. NVIDIA는 미국 기업이며 미국의 반도체 수출통제와 외교정책의 영향을 받는다.

따라서 NAVER가 현지 Data Center와 현지 JV를 구축하더라도 해당 국가가 Compute Supply Chain까지 완전히 통제하는 것은 아니다.

즉 NAVER가 제공할 수 있는 것은

Full Sovereignty

가 아니라

Maximum Sovereignty while retaining frontier NVIDIA compute

에 가깝다.

그런데 현실적으로는 이 중간지점이 가장 실용적인 선택일 수 있다.

중동이나 동남아 국가가 단기간에 NVIDIA를 대체하는 자체 Accelerator, Networking, Compiler와 Developer Ecosystem을 모두 구축하기는 어렵다.

그렇다면 가능한 전략은 다음과 같다.

미국 Compute Technology는 활용
→ Data는 자국에 보관
→ Key와 Control Plane은 현지에서 관리
→ Model은 자국 Data로 조정
→ Application과 Workflow는 자국이 소유
→ 현지 JV가 운영권 확보

NAVER가 노릴 수 있는 위치가 바로 이 지점이다.


8. NAVER × NVIDIA의 새로운 산업구조


지금까지의 논리를 하나로 연결하면 다음과 같다.

Agentic AI 확산
→ Training뿐 아니라 Inference·RL·Evaluation·Simulation 수요 증가
→ AI Factory의 상시 운영과 Workload 다양성 확대
→ 대규모 전력·GPU·Capital 필요
→ NVIDIA 혼자 모든 지역의 Data Center와 Distribution을 소유하기 어려움
→ Brookfield 같은 외부 Capital이 Physical Capacity 제공
→ NVIDIA가 Silicon·Networking·DSX·Open Model 제공
→ NAVER가 지역별 Cloud·Data·Agent·Application Layer 담당
→ 현지 정부·기업·JV가 Data와 운영권 통제
→ Software Attach와 Utilization 상승
→ NAVER의 직접 Capital Intensity 완화
→ Revenue/MW와 ROIC 개선 가능

이 구조에서 각 사업자의 역할은 다음과 같이 나뉜다.


여기에서 NAVER의 가장 중요한 전략과제는 명확하다.

NVIDIA와 Brookfield가 만든 AI Factory를 단순히 운영하는 데서 끝나지 않고, 고객의 Data·Agent·Application이 NAVER Platform에 축적되도록 만들어야 한다.

 


9. Earnings Model도 MW 중심에서 Take Rate 중심으로 바꿔야 한다


과거 방식대로라면 NAVER AI Factory 매출을 다음과 같이 계산하게 된다.

Connected MW × Revenue/MW × Utilization

그러나 Asset-light와 JV 구조가 확대되면 이 계산만으로는 부족하다.

앞으로는 다음과 같이 나누어야 한다.

NAVER 직접투자 Capacity

NAVER-funded MW
× Utilization
× Revenue/MW
× Infrastructure Margin

Partner 투자 Capacity

Partner-funded MW
× Gross Compute Revenue/MW
× Utilization
× NAVER Economic Take Rate

Software·Application

  • Cloud Platform Fee

  • Model Training·Fine-tuning

  • Inference Optimization

  • Agent Platform

  • Sovereign AI Operation

  • Digital Twin·Physical AI

  • Industry-specific Application

  • Maintenance·Governance·Security

이를 합치면 다음과 같다.

NAVER AI Factory Earnings
= Infrastructure Earnings
+ Platform Take Rate
+ Software Attach
+ Model·Agent Revenue
+ Sovereign Application Revenue
− NAVER-funded CapEx와 Operating Cost


따라서 향후 핵심 KPI는 GPU 수나 1GW 목표만이 아니다.


내가 Neocloud를 평가할 때 중요하다고 본 Verified Tasks per MW는 NAVER에도 적용할 수 있다. GPU의 수보다 동일한 전력과 투자자본으로 얼마나 많은 검증된 경제적 결과를 생산하는지가 중요하다.


10. 투자 Thesis는 어디까지 바뀌었는가


Bear Case에서 Conditional Bull Case로 한 단계 이동했다


이전 NAVER AI Factory 판단은 다음에 가까웠다.

성공 가능성은 존재하지만, 대부분의 Risk를 NAVER가 부담하는 저품질 CapEx 사업일 가능성이 높다. 200MW는 Option Value로 인정할 수 있으나 1GW와 20조원 매출은 Bull Case에 가깝다.


현재의 판단은 다음과 같다.

NAVER가 외부 Capital과 NVIDIA Stack을 이용해 지역별 Sovereign AI의 Data·Cloud·Agent·Application Layer를 장악할 수 있다면, AI Factory는 저ROIC GPU Rental이 아니라 Asset-light AI Production Platform이 될 수 있다.


전략적 판단은 회의적 부정에서 조건부 긍정으로 이동했다.

하지만 Earnings Model은 아직 크게 올리지 않는다.


Scenario별로 보면 더 명확하다




현재는 Base와 Bull 사이의 전략적 가능성이 이전보다 높아졌지만, 실적 Evidence는 여전히 Bear와 Base 사이에 가깝다.

이 차이를 구분해야 한다.


11. 이 Thesis를 훼손하는 조건


NAVER × NVIDIA Thesis가 틀렸다는 것을 확인할 수 있는 조건도 명확하다.

첫째, Brookfield Financing이 실질적으로 NAVER의 Risk를 줄이지 못하는 경우

Brookfield가 투자하더라도 NAVER가 장기 최소임차료와 Capacity 사용의무를 대부분 부담한다면 경제적 Risk는 여전히 NAVER에 남는다.

둘째, 외부 Anchor Customer가 없는 경우

AI Factory Capacity의 대부분이 NAVER 내부 수요에 의존하고, 외부 고객의 Take-or-pay 계약이 없다면 1GW 확장은 공격적인 선투자가 된다.

셋째, NAVER의 Economic Take Rate가 낮은 경우

고객 매출의 대부분이 Brookfield의 자본수익과 NVIDIA의 Hardware·Software Revenue로 귀속되고 NAVER가 낮은 운영수수료만 받는다면 Equity Upside는 제한된다.

넷째, Execution Gravity가 NVIDIA에만 축적되는 경우

고객의 Model, Runtime, Evaluation과 Agent Workflow가 DSX와 NVIDIA Software에만 종속되고 NAVER는 Reseller 역할에 머문다면 Software Moat가 만들어지지 않는다.

다섯째, Local Sovereignty가 형식에 그치는 경우

Data Center만 현지에 있고 Encryption Key, Control Plane, Remote Support와 실제 운영권은 외국 사업자가 보유한다면 Sovereign AI의 차별화가 약해진다.

여섯째, 사우디 사례가 다른 국가로 복제되지 않는 경우

사우디 Digital Twin과 JV가 일회성 Project Revenue로 끝나고 동남아·중동의 다른 국가에서 반복되지 않는다면 Global Platform Thesis는 성립하기 어렵다.

일곱째, 미국 CSP의 Sovereign Offering이 충분한 대체재가 되는 경우

AWS·Azure·Google이 Local Partner, Air-gapped Cloud, 현지 운영인력과 고객관리 Key를 이용해 정부의 요구조건을 충족한다면 NAVER의 Non-US Premium은 제한될 수 있다.


12. 앞으로 확인해야 할 데이터


NAVER AI Factory를 판단하기 위해 가장 중요한 다음 데이터는 MW 목표가 아니다.

다음 계약과 경제구조다.


이 가운데 가장 중요한 것은 두 가지다.

① 실제 고객계약


그리고

② NAVER의 Economic Take Rate


이 두 숫자가 확인되면 NAVER AI Factory가 NVIDIA와 Brookfield가 만든 인프라를 NAVER가 저마진으로 운영하는 사업인지, 아니면 NAVER의 Data·Software·Application이 높은 ROIC를 만드는 Platform 사업인지 구분할 수 있다.


13. 최종 Investment Thesis


지금 NAVER × NVIDIA에 대한 내 투자 Thesis는 다음과 같다.

Agentic AI의 확산은 AI Infrastructure의 경쟁축을 단순 GPU 보유량에서 Training·Inference·Evaluation·Agent Workflow를 안정적으로 통합 운영하는 Execution Layer로 이동시키고 있다. 

NVIDIA는 Silicon과 공통 AI Factory Stack을 공급하지만, 모든 국가의 Capital·Data·Regulation·Enterprise Distribution을 직접 소유하기 어렵다.

NAVER가 Brookfield와 현지 파트너의 Capital을 활용해 Physical Capacity를 확보하고, 그 위에 자신의 Cloud·Local Data·Agent·Application을 결합한다면 AI Factory는 자본집약적 GPU Rental이 아니라 Asset-light Sovereign AI Production Platform으로 발전할 수 있다.

특히 CLOUD Act와 Data Sovereignty에 대한 경계가 강화될수록, 미국 CSP의 직접 운영을 원하지 않지만 NVIDIA의 Frontier Compute는 필요로 하는 중동·아시아 국가에 대해 NAVER가 제3의 Full-stack AI Partner가 될 가능성이 있다.

이 Thesis의 핵심은 1GW가 아니다.

외부 Capital로 확보한 MW 위에서 NAVER가 얼마나 높은 Software Attach, Customer Ownership과 Economic Take Rate를 확보하는가

이다.

따라서 시장이 NAVER AI Factory를 단순히

“막대한 돈을 들여 NVIDIA GPU를 임대하는 저품질 CapEx 사업”

으로만 평가하고 있다면 지나치게 부정적일 수 있다.

반대로 회사의 1GW와 20조원 매출 목표를 그대로 적용해 NAVER의 Earnings를 추정하는 것도 지나치게 낙관적이다.

현재 가장 합리적인 판단은 두 극단의 중간에 있다.

NAVER AI Factory는 아직 Earnings Base Case가 아니라 Strategic Option이다. 그러나 그 Option의 질과 성공확률은 Agentic AI, External Capital과 Sovereign AI의 확산으로 이전보다 분명히 높아졌다.

 


글을 마치며


과거에는 NAVER가 NVIDIA에게 그저 수많은 GPU 고객 가운데 하나라고 생각했다.

지금도 NAVER가 NVIDIA의 독점적인 Partner라고 생각하지는 않는다. NVIDIA는 CoreWeave, Nebius, SK Telecom을 비롯해 수많은 Cloud·통신·산업기업과 협력할 것이다.

그러나 NVIDIA가 AI Factory 생태계를 세계 각국으로 확대하려 할수록, 단순히 GPU를 구매하는 회사보다 현지 Data와 Application, 정부관계, Cloud 운영능력과 Local Partner Network를 함께 가진 사업자가 더 중요해질 수 있다.

이 관점에서 NAVER의 역할은 달라진다.

NAVER가 NVIDIA에게 제공하는 것은 Compute 수요가 아니라 Sovereign Market Access일 수 있다.

그리고 NAVER가 가져갈 수 있는 가치는 GPU Rental Margin이 아니라, NVIDIA Compute 위에서 축적되는 Local Data·Workflow·Agent·Application의 경제성일 수 있다.

결국 앞으로의 질문은 다음과 같다.

1GW의 AI Factory를 누가 소유하는가?

보다

그 AI Factory에서 실행되는 Agent와 Application, Data와 Outcome을 누가 소유하는가?

에 가까워질 가능성이 높다.

NAVER가 후자의 영역까지 장악할 수 있다면 AI Factory는 단순한 인프라 신사업을 넘어, 기존 인터넷 플랫폼의 성장 둔화를 보완할 수 있는 새로운 성장축으로 발전할 가능성이 있다.

반대로 Physical Infrastructure와 NVIDIA Stack만 남고, 실제 고객의 Data·Workflow·Agent·Outcome이 NAVER Platform에 축적되지 않는다면 결국 다시 자본집약적인 AI Infrastructure 사업으로 돌아갈 수밖에 없다. 그 경우에는 과거의 부정적인 판단을 다시 적용해야 한다.

아직 어느 쪽으로 결론이 날지는 알 수 없다. 다만 Agentic AI와 Sovereign AI의 확산으로 전방시장의 크기와 전략적 중요성이 과거보다 훨씬 커졌다는 점만큼은 분명해 보인다. 이제는 적어도 하나의 의미 있는 장기 Option으로 지켜볼 필요가 있다.

그럼에도 개인적으로 마지막까지 의심의 눈초리로 확인하고 싶은 부분은 결국 NAVER라는 회사 자체의 실행역량이다.

산업의 방향이 맞고, NVIDIA와 Brookfield라는 좋은 파트너가 있으며, Sovereign AI라는 순풍까지 불어온다고 해도 그것만으로 NAVER의 성공이 보장되는 것은 아니다.

결국 남은 질문은 하나다.

NAVER가 이 거대한 산업적 기회를 실제 고객계약과 Software, Data, Workflow의 축적으로 전환할 만큼 충분한 실행역량을 가지고 있는가?

개인적으로는 이제 산업 자체를 의심하기보다, NAVER가 그 산업의 성장곡선에 실제로 올라탈 수 있는 회사인지를 확인해야 할 시점에 가까워진 것 같다.


=끝

2026년 7월 20일 월요일

생각정리 315 (* Kimi K3, 추가 제재-2)

이전 글에 이어, 미국이 중국산 LLM에 대해 추가 제재에 나설 경우 어떤 시나리오가 전개될 수 있을지 좀 더 생각해보니 미국에는 생각보다 강력한 카드가 남아 있다.

바로 OpenRouter를 비롯한 미국 내 클라우드·라우팅 플랫폼이 중국산 LLM을 호스팅하거나 제공하지 못하도록 행정적으로 제한하는 방안이다.

이는 중국 모델의 미국 내 접근성을 낮추는 데 그치지 않고, 그동안 서방 인프라에 분산돼 있던 추론 수요를 중국 내부로 되돌려 중국의 컴퓨팅 자원 부족을 더욱 부각시킬 수 있다.


Scott Bessent: US to control 80% of global compute power soon
클라우드 AI H/W 주도권을 강조하는 스콧 베센트


중국 LLM 제재가 오히려 AI 하드웨어 투자를 늘리는 이유


Kimi K3 증류 의혹에서 메모리 중복투자까지


Kimi K3의 등장 이후 시장의 관심은 주로 성능과 가격에 집중됐다.

하지만 더 중요한 문제는 따로 있다. Anthropic은 Moonshot AI가 수백 개의 부정 계정을 이용해 Claude와 340만 건 이상의 대화를 수행하고, 코딩·추론·컴퓨터 사용 능력을 조직적으로 추출하려 했다고 주장했다.

물론 현재 공개된 자료만으로 Kimi K3가 Anthropic의 Fable을 불법 복제해 개발됐다고 확정할 수는 없다. 그러나 미국 정부가 이번 사태를 단순한 기업 간 분쟁이 아니라 미국의 AI 기술을 탈취하려는 국가안보 문제로 받아들일 가능성은 충분하다.

미국이 이를 계기로 중국산 LLM에 대한 추가 제재를 강화한다면, 가장 먼저 흔들리는 것은 중국 모델의 미국 시장점유율이 아닐 수 있다.

오히려 그동안 낮은 토큰 가격과 서방 클라우드 활용 뒤에 가려져 있던 중국의 컴퓨팅 인프라 부족이 더 선명하게 드러날 가능성이 있다.

그리고 그 결과는 역설적으로 GPU·메모리·네트워크를 포함한 AI 하드웨어 투자의 확대로 이어질 수 있다.


중국 LLM의 성장은 낮은 가격에 기반하고 있다


2026년 7월 기준 Zhipu, DeepSeek, MiniMax, Kimi 등 중국 주요 독립계 LLM 4사의 합산 ARR는 약 21억 달러로 추정된다.

OpenAI의 연환산 매출 프록시는 약 240억 달러, Anthropic은 최근 월평균 매출을 기준으로 약 729억 달러로 추정된다.


중국 독립계 LLM의 매출 규모는 여전히 미국 프론티어 모델 기업보다 작지만, 글로벌 토큰 사용량에서는 빠르게 존재감을 높이고 있다.

그 이유는 분명하다.

  • 미국 프론티어 모델에 근접한 성능

  • 훨씬 낮은 API 가격

  • 적극적인 오픈웨이트 정책

  • 개발자 친화적인 API와 에이전트 기능

  • 중국 내 경쟁과 가격전쟁


중국 LLM 기업은 높은 마진보다 사용량과 시장점유율을 우선하고 있다. 낮은 가격으로 개발자를 끌어들이고 모델 생태계를 확대하는 전략이다.

그러나 이 전략에는 중요한 전제가 있다.

중국 모델이 증가하는 글로벌 추론 수요를 모두 중국 데이터센터에서 직접 처리할 필요가 없어야 한다는 점이다.


중국 모델의 토큰은 반드시 중국에서 만들어지지 않는다


현재 중국산 오픈웨이트 모델은 AWS, OpenRouter, 네오클라우드와 기업 자체 데이터센터에서도 실행된다.

여전히 압도적인 중국산 LLM

이 경우 모델을 개발한 기업은 중국 기업이지만 실제 토큰을 생성하는 GPU와 메모리는 미국이나 유럽 데이터센터에 있을 수 있다.

예를 들어 AWS가 DeepSeek나 Kimi의 오픈웨이트를 자체 서버에 배포하면 AWS가 GPU, HBM, 네트워크와 전력 비용을 부담한다. 중국 모델 기업은 전 세계 데이터센터를 직접 구축하지 않고도 글로벌 사용량을 확대할 수 있다.

즉, 중국의 오픈웨이트 전략은 단순한 기술 공개가 아니다.

모델은 중국이 개발하지만 글로벌 추론 CAPEX는 서방 클라우드와 기업 고객이 부담하게 만드는 구조이기도 하다.

이 구조 덕분에 중국 LLM 기업은 제한된 자체 인프라로도 글로벌 토큰 점유율을 빠르게 확대할 수 있다. Sparse MoE, 캐싱, 양자화 같은 기술적 효율화까지 더해지면서 낮은 토큰 가격도 일정 부분 유지할 수 있다.

하지만 미국의 추가 제재가 이 연결고리를 끊는다면 상황은 달라진다.


미국의 추가 제재는 컴퓨팅 수요를 다시 중국으로 돌려보낼 수 있다


미국이 중국산 LLM을 규제할 때 선택할 수 있는 수단은 다양하다.

연방정부와 공공기관에서 중국 모델의 사용을 금지할 수 있고, 금융·국방·통신·의료와 같은 핵심 산업으로 제한 범위를 확대할 수도 있다.

여기에 AWS·Azure·Google Cloud가 중국산 모델을 호스팅하지 못하도록 하거나, 중국 LLM 기업의 공식 API와 결제를 차단하는 조치가 더해질 수 있다. 신규 모델 가중치의 다운로드와 미국 내 배포를 제한하는 방안도 가능하다.

규제가 이 수준까지 확대되면 중국 LLM 기업은 더 이상 미국 클라우드와 제3의 추론 사업자에게 글로벌 컴퓨팅 수요를 분산하기 어렵다.

그동안 서방 데이터센터에서 처리되던 중국 모델의 추론 수요가 다시 중국 내부 인프라로 돌아오게 된다.

문제는 미국이 모델과 서비스만 규제하는 것이 아니라 첨단 GPU와 HBM에 대한 중국의 접근도 동시에 제한하고 있다는 점이다.

결국 중국은 다음 두 가지 압력을 동시에 받게 된다.

처리해야 할 추론 수요는 증가하지만
이를 처리할 첨단 GPU와 메모리의 조달은 더 어려워지는 구조이다.


이는 중국 LLM의 가격경쟁력보다 먼저 서비스 공급능력의 한계를 드러낼 수 있다.

(참고로, 이미 미국 프론티어 LLM의 수익성과 하위 중국 오픈웨이트 LLM간의 격차는 상당히 벌어져 있음..)


2026.07.21 Anthropic 

2026.07.21 OpenAI


2026.03.31 Zhipu AI

2026.03.02 MiniMax



Kimi K3 구독 중단은 그 가능성을 미리 보여줬다


Kimi K3는 출시 직후 예상보다 강한 수요가 몰리면서 약 48시간 만에 신규 유료 가입을 중단했다.

Moonshot은 수요가 현재 GPU 용량의 한계에 접근했으며 기존 가입자를 우선하겠다고 설명했다.

이는 단순히 Kimi K3가 큰 인기를 얻었다는 의미에 그치지 않는다.

낮은 가격으로 수요를 폭발시키는 데는 성공했지만, 그 수요를 처리할 컴퓨팅 인프라는 충분히 확보하지 못했다는 뜻이기도 하다.

LLM 서비스는 낮은 가격만으로 유지되지 않는다. 사용량이 증가할수록 더 많은 GPU, HBM, 네트워크와 전력이 필요하다. 그러나 토큰 가격을 지나치게 낮추면 추가 인프라 투자를 내부 현금흐름으로 조달하기 어려워진다.

수요가 공급능력을 넘어설 경우 기업이 선택할 수 있는 방법은 제한적이다.

  • 토큰 가격 인상

  • 신규 가입 및 사용량 제한

  • 응답 속도와 서비스 품질 저하

  • 외부 클라우드에서 고가의 GPU 임차

  • 자체 데이터센터 대규모 증설


Moonshot은 그중 신규 가입 제한을 선택했다.

미국의 본격적인 규제가 시행되기도 전에 이 같은 병목이 발생했다는 점이 중요하다. 향후 미국 클라우드에서 중국 모델의 호스팅이 제한되고, 첨단 GPU와 HBM 수출통제까지 강화된다면 Kimi K3와 유사한 용량 부족이 다른 중국 LLM에서도 반복될 가능성이 있다.

미국의 제재는 중국 모델의 수요를 없애기보다, 기존에 서방 인프라로 분산되던 수요를 중국 내부로 집중시킬 수 있다.


중국의 수출통제까지 더해지면 두 개의 생태계가 만들어진다


Financial Times에 따르면 중국 상무부 역시 첨단 AI 모델과 반도체 기술에 대한 수출통제 강화를 검토하고 있다.

핵심 훈련 데이터의 해외 이전과 외국 사용자의 모델 가중치 다운로드를 제한하되, 해외에는 중국 기업이 통제하는 API와 서비스 형태로만 접근을 허용하는 방안이다.

중국의 조치가 현실화되고 미국의 제재가 동시에 강화되면 양쪽의 규제가 서로 맞물리게 된다.

  • 중국은 첨단 모델의 가중치 반출을 제한한다.

  • 미국은 중국 기업이 통제하는 API와 클라우드 서비스를 차단한다.

  • 미국은 중국으로의 첨단 GPU와 HBM 공급도 제한한다.

  • 중국은 국산 모델과 국산 하드웨어 생태계 구축을 가속한다.

그 결과 AI 시장은 다음과 같은 두 개의 생태계로 분리될 가능성이 높다.

  • 미국 모델·미국 클라우드·서방 반도체 공급망

  • 중국 모델·중국 클라우드·중국산 가속기 공급망

하나의 글로벌 시장에서는 특정 지역의 컴퓨팅 부족을 다른 지역의 클라우드 용량으로 보완할 수 있다.

하지만 생태계가 분리되면 미국과 중국은 각각 독립적인 학습 클러스터, 추론 데이터센터와 예비 연산능력을 구축해야 한다.

글로벌 차원에서는 같은 기능을 양쪽이 따로 구축하는 중복투자가 발생한다.


소프트웨어의 분리는 하드웨어 시장의 파이를 키울 수 있다


생태계 분리는 소프트웨어 기업에는 부정적일 수 있다.

접근 가능한 시장이 줄어들고, 모델과 데이터의 이동이 제한되며, 클라우드의 가동률과 효율성도 낮아질 수 있다.

그러나 하드웨어 관점에서는 이야기가 달라진다.

AI 인프라가 통합된 환경에서 필요한 설비는 글로벌 평균 수요와 피크 수요를 기준으로 결정된다. 반면 생태계가 분리되면 미국과 중국이 각자 다음 설비를 확보해야 한다.

Required capacity
= Local peak demand

  • Reserve margin

  • Sovereign redundancy

미국은 중국 모델을 대체할 자체 모델과 추론 인프라를 확대해야 한다. 중국은 서방 클라우드와 첨단 GPU에 대한 접근이 제한되는 만큼 자국 내 AI 데이터센터와 반도체 공급망을 더 빠르게 구축해야 한다.

그 결과 양쪽에서 다음 투자가 중복된다.

  • 프론티어 모델 학습 클러스터

  • 대규모 추론 데이터센터

  • 피크 수요에 대비한 예비 GPU 용량

  • HBM·DDR·NAND 및 Enterprise SSD

  • 스케일업·스케일아웃 네트워크

  • 첨단 패키징

  • 전력·변압기·냉각 인프라

물론 전체 수요가 정확히 두 배가 되는 것은 아니다. 가격 상승과 서비스 제한으로 일부 토큰 수요가 감소할 수 있고, 모델 효율화가 하드웨어 부담을 낮출 수도 있다.

하지만 글로벌 인프라를 공유하지 못하게 되면 시스템 전체의 가동률은 낮아진다. 동일한 수요를 처리하기 위해 더 많은 예비용량을 설치해야 한다.

AI 생태계의 분리는 효율을 낮추지만, 그 비효율이 오히려 하드웨어 투자수요를 증가시키는 구조이다.


특히 메모리의 전략적 중요성이 커진다


GPU 수혜는 생태계별로 나뉠 가능성이 높다.

미국과 서방에서는 NVIDIA, AMD, Google TPU, AWS Trainium과 자체 ASIC이 중심이 된다. 중국에서는 Huawei Ascend, Cambricon과 중국산 가속기 생태계가 확대될 것이다.

중국의 AI CAPEX가 늘어난다고 해서 그 수요가 모두 NVIDIA 매출로 연결되는 것은 아니다.

반면 메모리와 스토리지는 양쪽 생태계에서 공통으로 필요하다.

  • HBM은 GPU와 AI 가속기의 메모리 대역폭을 담당한다.

  • DDR·LPDDR는 CPU 오케스트레이션과 긴 컨텍스트 처리를 지원한다.

  • Enterprise SSD는 데이터레이크와 영속적 KV 캐시를 담당한다.

  • NAND는 모델 데이터와 추론 결과의 장기 저장에 필요하다.

특히 중국이 첨단 GPU 조달에 어려움을 겪을수록 제한된 가속기를 최대한 효율적으로 활용하기 위한 HBM·DDR·SSD 및 네트워크 투자 중요성은 오히려 커질 수 있다.

다만 첨단 HBM은 미국의 수출통제 대상이기 때문에 중국의 수요 증가가 기존 글로벌 메모리 기업의 매출로 모두 연결되지는 않는다.

서방 데이터센터 증설은 기존 HBM 기업에 직접적인 수혜가 될 가능성이 높지만, 중국의 증설은 중국산 메모리와 반도체 장비의 국산화를 동시에 촉진할 수 있다.

(*그러나 여전히 중국 CXMT의 HBM 내재화는 아직 쉽지 않아보인다.)

그럼에도 산업 전체로 보면 방향은 분명하다.

미국과 중국이 각각 독립적인 AI 인프라를 구축할수록 글로벌 메모리와 스토리지의 총 설치량은 증가할 가능성이 높다.


결론


Kimi K3의 불법 증류 및 모델 추출 복제 의혹은 단순한 기술 논쟁으로 끝나지 않을 가능성이 있다.

미국 정부가 이를 국가안보와 지식재산권 문제로 판단해 중국산 LLM에 대한 추가 제재를 강화한다면, 중국 모델은 서방 클라우드와 미국 컴퓨팅 인프라를 활용해 글로벌 추론 수요를 분산하기 어려워질 수 있다.

그 결과 그동안 낮은 토큰 가격과 오픈웨이트 전략 뒤에 가려져 있던 중국의 GPU·HBM·네트워크 부족이 더욱 뚜렷하게 드러날 가능성이 있다.

Kimi K3가 출시 직후 신규 가입을 중단한 사례는 이를 미리 보여준다.

중국 LLM의 저가정책은 수요를 만드는 데는 성공했지만, 그 수요를 감당할 인프라와 가격체계가 충분히 준비됐는지는 아직 확인되지 않았다. 미국의 클라우드·API·반도체 제재가 강화되면 현재의 낮은 토큰 가격을 유지하기는 더 어려워질 것이다.

그러나 AI 하드웨어 산업에는 이것이 반드시 악재인 것만은 아니다.

미국은 중국 모델을 배제한 독자적인 생태계를 구축해야 하고, 중국은 서방 인프라에 의존하지 않는 자체 AI 공급망을 만들어야 한다.

소프트웨어 시장은 두 개로 나뉘지만, 하드웨어는 같은 기능을 양쪽에 다시 설치해야 한다.

결국 AI 생태계의 분리는 컴퓨팅 자원의 효율을 떨어뜨리는 대신 GPU, HBM, DDR, NAND, Enterprise SSD, 네트워크와 전력 인프라에 대한 중복투자를 확대할 수 있다.

특히 메모리 사업자 입장에서는 미국과 중국의 모델 경쟁 그 자체보다, 양국이 각자의 학습·추론 인프라와 예비용량을 별도로 구축해야 한다는 점이 더 중요하다.

Kimi K3 사태로 촉발될 수 있는 추가 제재는 중국 LLM의 인프라 부족을 드러내는 동시에, AI 하드웨어 시장의 전체 파이를 키우는 순풍으로 작용할 가능성이 있다.


참고자료


공부하고 기록하고 생각할수록
중국은 미국과 AI경쟁을 할 준비가 전혀 되어 있지않은게 아닐까하는 의문이든다. 

=끝

생각정리 314 (* Kimi K3, 추가 제재-1)

자기 전 침대에 누워 X.com App을 켰다가,
추천 알고리즘을 통해 과거 Kimi 창업자의 GTC 강연 영상을 보게 됐다.

How We Scaled Kimi K2.5 | Zhilin Yang's full GTC 2026 Keynote

영상에서는 Kimi가 적용한 새로운 학습기법과 모델 구조, 효율화 성과가 자신감 있게 소개되고 있었다. 그런데 발표를 볼수록 기술적 감탄보다 묘한 불쾌감이 먼저 밀려왔다.

Claude를 상대로 한 대규모 비인가 증류 의혹이 제기된 상황에서도, Kimi의 성과는 마치 온전히 자체적인 연구와 기술혁신만으로 만들어진 결과처럼 설명되고 있었다.

내가 Anthropic이나 다른 Frontier LLM 개발에 참여한 연구자였다면, 이처럼 태연하게 기술적 성과를 나열하는 모습을 보며 상당한 허탈감과 어처구니없음을 느꼈을 것 같다.

이번 글에서는 화려한 Kimi K3의 성과 뒤에 가려진 데이터의 출처와 자본의 성격, 그리고 이를 모두 생략한 채 독자적인 기술혁신만을 강조하는 그들의 뻔뻔함에 대해 기록해보고자 한다.  


https://t.me/givme23
claude를 불법 증류 복제했다는 증거..


Kimi3 은 Fable5 를 증류 ( distillation ) 했을 가능성 ( 파란색에 가까울 수록 답변 유사도가 높음 )
https://t.me/migukstocksailor


효율화 뒤에 가려진 비용


Kimi K3는 순수한 기술 혁신의 결과인가


최근 중국 Moonshot AI의 창업자 양즈린이 NVIDIA GTC 무대에서 Kimi 모델의 확장 전략을 설명했다.

발표만 놓고 보면 Kimi의 급성장은 상당히 인상적이다. 새로운 최적화 알고리즘과 Attention 구조를 도입해 학습 효율을 높였고, 긴 문맥과 다수의 에이전트를 동시에 처리할 수 있도록 모델 구조를 개선했다.

이후 Moonshot은 총 2.8조 개의 파라미터를 보유한 Kimi K3를 공개했다. K3는 896개 전문가 가운데 토큰당 16개만 선택적으로 활성화하는 Sparse MoE 구조를 사용하며, Kimi Delta Attention과 Attention Residuals를 결합했다. Moonshot은 이러한 기술을 통해 K2보다 약 2.5배 높은 스케일링 효율을 확보했다고 주장한다. (Kimi AI 플랫폼)

그러나 기술 발표와 회사가 제시한 벤치마크만으로 K3의 등장을 설명하기에는 빠진 부분이 너무 많다.

Kimi의 기술적 성과는 분명 존재한다. 다만 K3를 Moonshot AI라는 스타트업의 독자적인 기술 혁신만으로 설명하기는 어렵다.

그 배경에는 미국 Frontier Model에서 추출한 것으로 의심되는 고품질 데이터, 알리바바와 텐센트의 자본, 중국의 국유·정부계 자금과 컴퓨팅 인프라 정책이 함께 놓여 있다.


1. Kimi CEO의 강연은 무엇을 말했나


양즈린의 강연 핵심은 단순히 모델의 파라미터를 늘리는 데 있지 않았다.

같은 데이터와 컴퓨팅에서 더 많은 지능을 학습하고, 더 긴 문맥을 처리하며, 여러 에이전트를 병렬로 작동시키는 방법을 설명하는 자리였다.

같은 데이터에서 더 많이 학습하는 Muon

첫 번째는 토큰 효율성이다.

대부분의 대규모 언어모델은 Adam 또는 AdamW라는 최적화 알고리즘을 사용한다. 최적화기는 학습 과정에서 모델의 파라미터를 어느 방향으로 얼마나 수정할지를 결정한다.

Moonshot은 이를 Muon으로 대체하고, 초대형 모델에서 발생하는 학습 불안정성을 MuonClip으로 보완했다.

Moonshot의 설명에 따르면 Muon은 AdamW보다 같은 성능에 도달하는 데 필요한 학습 연산량을 크게 줄일 수 있다. Kimi K2는 MuonClip을 적용해 1조 파라미터 모델을 15.5조 토큰 동안 큰 Loss Spike 없이 학습했다.

즉 MuonClip은 새로운 지능을 만들어내는 단일 알고리즘이라기보다, 거대한 모델을 보다 안정적으로 학습하고 같은 데이터에서 더 많은 성능을 끌어내는 기술이다.


https://www.youtube.com/watch?v=CwePo4847ho


긴 문맥을 처리하는 Kimi Linear


두 번째는 Long Context 효율성이다.

기존 Transformer는 입력 문맥이 길어질수록 Attention 연산량과 KV Cache 사용량이 크게 증가한다. 모델이 대규모 코드베이스를 읽고 장기간 작업하려면, 과거에 읽은 정보와 작업 이력을 계속 기억해야 한다.

Moonshot은 이를 해결하기 위해 Kimi Delta Attention을 중심으로 한 Kimi Linear 구조를 개발했다.

회사 측 실험에서는 100만 토큰 문맥에서 KV Cache 사용량을 최대 75% 줄이고, 디코딩 처리량을 최대 약 6배 높였다고 보고했다.

이 구조는 모든 정보를 똑같이 기억하는 대신, 채널마다 서로 다른 기억 주기를 부여한다.

  • 일부 정보는 오랫동안 유지

  • 일부 정보는 빠르게 갱신

  • 불필요한 정보는 선택적으로 제거

쉽게 말하면 모델 내부에 단기기억과 장기기억을 담당하는 경로를 나누는 구조에 가깝다.


https://www.youtube.com/watch?v=CwePo4847ho


하나의 에이전트에서 에이전트 집단으로


세 번째는 Agent Swarm이다.

기존 AI 에이전트는 하나의 모델이 검색, 분석, 코딩, 검증 작업을 순차적으로 수행하는 경우가 많다. 이 방식은 작업이 복잡해질수록 실행시간이 길어진다.

Kimi는 하나의 Orchestrator가 복잡한 과제를 여러 하위 작업으로 분해한 뒤, 최대 100개의 Sub-agent를 생성하도록 설계했다.

각 에이전트는 서로 다른 조사와 분석을 병렬로 수행하며, 전체적으로 최대 1,500회의 Tool Call을 실행할 수 있다. Moonshot은 이를 통해 단일 에이전트 방식보다 일부 복잡한 작업의 실행시간을 최대 4.5배 단축했다고 주장한다.


https://www.youtube.com/watch?v=CwePo4847ho


깊이 방향의 정보를 선택하는 Attention Residuals


또 다른 핵심 기술은 Attention Residuals다.

일반적인 Transformer는 각 레이어의 출력을 다음 레이어에 계속 더한다. 모델이 깊어질수록 어떤 레이어에서 생성된 정보가 중요한지 구분하기 어려워지고, 여러 정보가 뒤섞일 수 있다.

Attention Residuals는 이전 레이어의 출력을 무조건 더하지 않는다. 현재 입력에 따라 어느 레이어의 정보를 얼마나 가져올지를 Attention으로 결정한다.

기존 Attention이 과거 토큰 가운데 필요한 정보를 선택한다면, Attention Residuals는 과거 레이어 가운데 필요한 표현을 선택하는 구조다.

이 기술은 이후 Kimi K3의 핵심 아키텍처 가운데 하나로 적용됐다.


https://www.youtube.com/watch?v=CwePo4847ho

기술적 성과 자체는 인정해야 한다


MuonClip, Kimi Delta Attention, Kimi Linear, Attention Residuals와 Agent Swarm은 단순한 마케팅 용어만으로 치부하기 어렵다.

Moonshot은 초대형 모델의 학습 안정성, KV Cache 부담, 장문 문맥, 에이전트 병렬처리라는 실제 문제를 해결하기 위해 상당한 기술적 진전을 이뤘다.

따라서 Kimi의 성능을 모두 외부 데이터나 중국 정부의 지원으로만 설명하는 것도 정확하지 않다.

다만 여기서 질문해야 할 부분은 따로 있다.

이러한 기술만으로 Kimi K3의 성능과 비정상적으로 빠른 개발 속도 전체를 설명할 수 있는가.


2. Kimi는 효율화로 컴퓨팅을 줄인 것이 아니다


Kimi K3는 총 2.8조 개의 파라미터를 보유하지만, 매 토큰마다 전체 파라미터를 사용하는 Dense Model은 아니다.

896개 전문가 가운데 16개만 활성화하는 Sparse MoE 구조를 사용한다. 따라서 2.8조 파라미터 Dense Model과 동일한 연산량이 필요한 것은 아니다.

그러나 Sparse MoE라고 해서 전체 컴퓨팅 부담이 사라지는 것은 아니다.

  • 2.8조 개의 전체 가중치를 메모리에 저장해야 함

  • 896개 전문가를 다수의 GPU와 서버에 배치해야 함

  • 토큰을 적절한 전문가로 전송해야 함

  • GPU 사이의 All-to-All 통신을 처리해야 함

  • 대규모 체크포인트와 학습 데이터를 저장해야 함

  • 장애가 발생했을 때 분산학습을 복구해야 함


파라미터가 커질수록 HBM 용량, GPU 수, 네트워크 대역폭과 스토리지 수요는 여전히 증가한다.

실제로 K3 출시 직후 사용자 수요가 급증하자 Moonshot은 신규 구독을 일시 중단했다. 회사는 현재 컴퓨팅 용량이 한계에 근접했다고 밝혔고, 외부 분석가 역시 K3가 매우 많은 컴퓨팅을 요구하는 모델이라고 평가했다. (AP News)

따라서 Kimi의 효율화는 다음과 같이 이해해야 한다.

효율성 향상 → 총컴퓨팅 감소

보다는

효율성 향상 → 더 큰 모델·더 긴 문맥·더 많은 에이전트로 재투자

Kimi는 알고리즘을 통해 컴퓨팅의 필요성을 제거한 사례가 아니다.

막대한 컴퓨팅 자본의 생산성을 높인 뒤, 절약된 자원을 모델의 절대 규모 확대에 다시 투입한 사례에 가깝다.

결국 K3를 설명하는 핵심 변수는 알고리즘만이 아니라 데이터와 자본으로 확장된다.


3. Anthropic이 제기한 Moonshot의 Claude 증류 의혹


Anthropic은 2026년 2월 DeepSeek, Moonshot AI와 MiniMax가 Claude의 능력을 추출하기 위해 산업적 규모의 증류 캠페인을 운영했다고 발표했다.

Anthropic에 따르면 세 기업은 약 2만4,000개의 허위 계정을 통해 Claude와 1,600만 건 이상의 대화를 생성했다.

이 가운데 Moonshot 관련 트래픽으로 분류된 대화는 340만 건 이상이었다.

Moonshot이 집중적으로 추출한 것으로 지목된 능력은 다음과 같다.

  • Agentic reasoning과 Tool use

  • 코딩과 데이터 분석

  • Computer-use agent

  • Computer vision

  • Claude의 추론 과정 재구성


이는 일반적인 웹 문서나 사전학습 데이터와 성격이 다르다.

사용자의 질문을 어떻게 분해하고, 어떤 도구를 선택하며, 오류를 어떻게 수정하고, 최종 결과를 어떻게 검증하는지 보여주는 고부가가치 후처리 데이터에 해당한다.

Anthropic은 IP 주소, 요청 메타데이터, 인프라 지표와 다른 사업자가 관찰한 행위 등을 바탕으로 캠페인을 특정 기업에 귀속했다고 밝혔다.

다만 이 내용은 현재까지 Anthropic의 자체 조사 결과다. Moonshot의 형사상 범죄가 법원에서 확정됐거나, Claude 출력이 Kimi K3에 정확히 얼마나 사용됐는지는 공개적으로 검증되지 않았다.

따라서 법적으로는 ‘불법 증류가 확정됐다’고 단정하기보다, Anthropic이 제기한 대규모 비인가 증류 의혹이라고 표현하는 편이 정확하다.

Hydra Cluster는 어떻게 작동했나


Anthropic은 이러한 대규모 우회 접근 인프라를 Hydra Cluster라고 설명했다.

하나의 계정이나 서버에서 대량의 요청을 보내는 방식은 쉽게 탐지된다. Hydra Cluster는 수많은 정상 이용자처럼 보이는 계정과 접근 경로로 요청을 분산시킨다.

Anthropic이 설명한 방식은 다음과 같다.

  • 중국 외부의 상업용 프록시 사업자로부터 Claude 접근권 구매

  • 수천~수만 개 계정으로 요청 분산

  • 교육·스타트업·연구·보안 목적 등 여러 계정 유형 활용

  • 계정이 차단되면 새로운 계정으로 교체

  • 증류용 트래픽과 일반 사용자의 요청을 혼합

  • 동일한 능력을 묻는 질문을 다양한 형태로 반복


이는 Claude의 내부 서버를 직접 해킹해 가중치나 원본 데이터베이스를 가져간 방식과는 다르다.

보다 정확하게는 Claude를 Teacher Model이자 합성데이터 생산공장으로 사용한 의혹이다.

Claude에 고난도 코딩, 추론, Agent 과제를 반복적으로 입력하고, 그 답변과 작업 과정을 대규모로 수집한 뒤 이를 자체 모델의 학습 데이터로 활용하는 방식이다.


4. 증류는 미국 모델이 먼저 부담한 비용을 흡수하는 수단이다


LLM은 인터넷 문서를 대량으로 학습한다고 곧바로 완성되는 것이 아니다.

원시 데이터를 실제 서비스에 사용할 수 있는 지능으로 바꾸려면 여러 단계가 필요하다.

데이터 수집 → 중복 제거 → 유해 데이터 정제 → 전문가 라벨링 → 지도학습 → 인간 선호학습 → 강화학습 → 안전성 평가 → Agent 학습 → 반복적인 실패 수정

미국의 Frontier AI 기업은 이 과정에서 막대한 인력, 데이터, 법률비용과 컴퓨팅을 먼저 부담했다.

OpenAI의 데이터 정제 비용


OpenAI는 케냐의 외주업체 Sama를 통해 노동자들이 폭력, 혐오, 성적 학대 등 유해한 텍스트를 분류하도록 했다.

이들이 인터넷 전체를 읽으면서 유해한 문장을 하나씩 삭제한 것은 아니다. 사람이 수만 건의 샘플에 라벨을 붙이면, 이를 바탕으로 별도의 분류 모델과 필터를 학습해 대규모 데이터와 모델 출력을 자동으로 정제하는 구조였다.

특정 Sama 계약의 명목상 규모만 보면 수십만달러 수준이었기 때문에, 이 계약 하나를 두고 천문학적인 비용이라고 표현하면 과장이다.

그러나 서비스가 가능한 LLM을 만드는 전체 과정에는 다음과 같은 비용이 반복적으로 발생한다.

  • 유해성 기준 설계

  • 인간의 경계 사례 판단

  • Reward Model과 분류기 구축

  • 레드팀과 취약점 점검

  • 과도한 거부와 위험한 응답 사이의 균형 조정

  • 새로운 모델이 나올 때마다 반복되는 안전성 평가


중요한 것은 하나의 외주 계약 액수가 아니라, 모델 뒤에 누적된 인간 노동과 수많은 시행착오다.

https://time.com/6247678/openai-chatgpt-kenya-workers/


Anthropic의 도서 데이터 확보 비용


Anthropic 역시 고품질 도서 데이터를 확보하기 위해 수백만 권의 실물 책을 구매하고, 책등을 제거한 뒤 페이지를 스캔해 디지털 라이브러리를 구축했다.

이는 모든 작가에게 별도의 AI 학습 저작권료를 지급했다는 의미는 아니다. 적법하게 구매한 실물 책을 스캔해 내부 학습용으로 사용한 방식이었다.

동시에 Anthropic은 불법 복제 사이트에서 수백만 권의 도서를 내려받아 보관한 문제로 대규모 저작권 분쟁도 겪었다.

따라서 미국 AI 기업이 데이터 문제에서 완전히 도덕적이고 합법적이었다고 평가하기도 어렵다.

미국 기업 역시 다음 논란에서 자유롭지 않다.

  • 저작권자의 동의 없는 웹 데이터 학습

  • 불법 복제 데이터 취득

  • 저임금 데이터 라벨링

  • 작가와 출판사에 대한 보상 문제

  • 모델 학습과 공정이용의 경계


그럼에도 이들이 실제로 부담한 비용은 남는다.

  • 원시 데이터를 확보하는 비용

  • 데이터를 디지털화하고 정제하는 비용

  • 법적 분쟁과 합의를 감당하는 비용

  • 고품질 데이터를 선별하는 비용

  • 인간 피드백과 안전성 평가 비용

  • 수없이 실패한 모델과 실험의 컴퓨팅 비용



https://techcrunch.com/2026/07/20/anthropics-landmark-1-5b-copyright-settlement-is-approved/
클로드는 $1.5bn 저작권 위반 벌금을 물었는데, 이를 불법 증류 및 추출한 kimi k3는 아무런 법적 조취를 안받는게 말이 되는건가?   


Kimi가 우회했을 가능성이 있는 비용


Claude의 최종 출력은 이러한 과정을 거친 뒤 생산된 결과물이다.

Claude가 만든 하나의 고품질 Agent 작업 궤적에는 다음 정보가 압축돼 있다.

  • 문제를 어떤 순서로 분해해야 하는지

  • 어떤 도구를 선택해야 하는지

  • 오류가 발생하면 어떻게 수정해야 하는지

  • 코드의 정확성을 어떻게 검증해야 하는지

  • 최종 답변을 어떤 구조로 작성해야 하는지


경쟁 모델이 이를 대량으로 학습하면, 좋은 답을 만들어내는 방법을 처음부터 발견하는 비용을 크게 줄일 수 있다.

미국 선도 모델이 원석을 채굴하고 제련공정을 개발했다면, 비인가 증류 모델은 이미 제련된 고순도 결과물을 훨씬 낮은 한계비용으로 반복 채취한 것에 가깝다.


Kimi가 OpenAI와 Anthropic의 원본 데이터 전체를 가져간 것은 아니다.

그러나 Anthropic의 주장이 맞다면, 선도 모델들이 막대한 비용을 들여 만들어낸 고부가가치 후처리 결과와 능력의 일부를 훨씬 짧은 시간과 낮은 비용으로 흡수했을 가능성은 높다.

증류는 컴퓨팅을 없애주는 기술이 아니다.

대신 미국 모델이 먼저 지불한 연구·실패·정렬·평가 비용을 외부화하고, 모델 개발의 시간과 비용을 압축하는 수단이다.


5. Moonshot을 둘러싼 자본은 일반적인 스타트업 투자와 다르다


Moonshot은 더 이상 창업자와 소규모 벤처캐피털만으로 운영되는 독립 스타트업으로 보기 어렵다.

알리바바는 Moonshot에 약 8억달러를 투자해 초기 기준 약 36%의 지분을 확보한 것으로 알려졌다. 텐센트 역시 주요 투자자로 참여했다.

알리바바와 텐센트는 단순한 재무투자자가 아니다.

  • 대규모 클라우드 데이터센터

  • AI GPU와 네트워크

  • 방대한 사용자와 데이터

  • 개발자 생태계

  • 서비스 유통망

  • 장기간의 적자를 감당할 자본


을 동시에 보유한 중국 최대 플랫폼 기업들이다.

이후 Moonshot에는 중국의 국유기업과 정부계 투자자도 참여한 것으로 보도됐다.

따라서 Moonshot을 둘러싼 자본은 세 가지 층으로 나눠 볼 수 있다.

미국 모델이 선행 지출한 지적자본


Anthropic의 주장이 사실이라면 Moonshot은 Claude가 먼저 개발한 Agent·코딩·추론 능력의 일부를 대규모 출력 데이터로 흡수했다.

여기에는 Anthropic이 부담한 데이터 선별, 강화학습, 평가, Agent 환경 구축과 실패 실험의 결과가 압축돼 있다.

중국 민간 플랫폼의 금융·컴퓨팅 자본


알리바바와 텐센트는 현금투자뿐 아니라 클라우드, GPU, 네트워크와 서비스 운영 역량을 제공할 수 있다.

다만 K3가 구체적으로 어느 클라우드 클러스터에서 학습됐는지, 투자자들이 얼마의 GPU 크레딧이나 인프라를 제공했는지는 공개되지 않았다.

중국 국가 산업정책의 자본


중국은 AI를 국가전략산업으로 육성하고 있다.

  • 국유·정부계 펀드의 직접 투자

  • 대규모 데이터센터 건설

  • 컴퓨팅 바우처와 보조금

  • 국산 AI 반도체 생태계

  • 공공기관과 국유기업의 AI 도입

  • 오픈웨이트 모델의 해외 확산


Moonshot은 이러한 정책 생태계 안에서 성장하고 있다.

따라서 중국 정부와 국유자본의 지원 가능성을 단순한 음모론으로 치부하기는 어렵다.

다만 중국 공산당이 Claude 증류 캠페인을 직접 지시했다거나, K3의 전체 학습비용을 비밀리에 부담했다고 단정할 공개 증거는 아직 없다.

확인되는 사실은 Moonshot이 중국의 민간 플랫폼 자본, 국유·정부계 자금과 국가 컴퓨팅 정책이 결합된 생태계 안에 있다는 점이다.


6. 미국 정부는 증류를 국가안보 문제로 보기 시작했다


미국 정부는 경쟁 모델의 비인가 증류를 단순한 기업 간 서비스 약관 분쟁으로만 바라보지 않고 있다.

미국의 Frontier Model이 막대한 비용을 들여 구축한 능력을 중국 기업이 조직적으로 추출할 경우, 다음 문제가 동시에 발생한다.

  • 미국 기업의 연구개발 비용이 중국에 외부화

  • 중국 모델의 개발 기간 단축

  • 첨단 반도체 수출통제의 실효성 약화

  • 군사·정보·사이버 분야로의 전용 가능성

  • 중국의 저가 모델을 통한 글로벌 AI 생태계 장악


따라서 향후 미국의 대응은 단순한 API 계정 차단을 넘어설 가능성이 있다.

  • 중국 AI 기업의 Frontier API 접근 제한

  • 프록시·리셀러와 허위 계정 규제

  • 고객확인과 실소유자 확인 강화

  • 제3국 클라우드를 통한 중국 기업의 모델 학습 제한

  • 특정 중국 AI 기업의 Entity List 등재

  • 미국 공공기관의 중국 LLM 사용 제한


아직 Moonshot에 대한 구체적인 제재가 확정된 것은 아니다.

그러나 비인가 증류가 미국의 지적·컴퓨팅 자본을 우회 추출하는 국가안보 문제로 전환될 정책적 조건은 이미 마련되고 있다.

chrome-extension://efaidnbmnnnibpcajpcglclefindmkaj/https://www.whitehouse.gov/wp-content/uploads/2026/04/NSTM-4.pdf?utm_source=chatgpt.com


The secret Trump administration battle to fight Chinese AI



7. Kimi 창업자의 공개 강연이 불편하게 보이는 이유


Kimi 창업자가 NVIDIA GTC와 같은 공개 무대에서 기술을 설명한 행위 자체를 범법행위의 법적 두둔으로 보기는 어렵다.

강연은 MuonClip, Kimi Linear와 Agent Swarm 등 모델의 기술적 구조를 소개하는 자리였다. 주최자가 발표 기회를 제공했다는 이유만으로 비인가 증류를 공모하거나 방조했다고 볼 수도 없다.

그럼에도 해당 강연이 불편하게 느껴지는 이유는 분명하다.

성능의 인과관계가 알고리즘만으로 설명된다


기술 발표에서는 알고리즘과 모델 구조가 성능 향상의 핵심 원인으로 제시된다.

그러나 Anthropic의 주장이 사실이라면 Claude에서 추출한 Agent·코딩·추론 데이터도 Kimi의 성능 형성에 기여했을 가능성이 있다.

이 부분이 빠지면 청중은 Kimi의 발전을 모두 Moonshot의 독자적인 연구개발 성과로 받아들이기 쉽다.

데이터 출처와 후처리 비용이 보이지 않는다


Kimi가 Agent 능력을 어떤 데이터로 학습했는지, 외부 Frontier Model의 출력이 어느 정도 포함됐는지, 데이터 확보 과정에서 어떤 권한과 계약이 있었는지는 공개되지 않았다.

알고리즘 효율만 설명하고 데이터 출처를 제외하면, 모델 성능을 만든 가장 중요한 생산요소 가운데 하나가 사라진다.

권위 있는 무대가 성과에 정당성을 부여한다


GTC와 같은 국제 기술행사는 단순한 발표장이 아니다. 연구자와 투자자, 언론이 해당 기업의 기술적 정당성을 확인하는 공간이기도 하다.

증류 의혹이 해소되지 않은 기업의 성과가 별다른 검증 없이 순수한 혁신 사례로 소개될 경우, 국제 AI 생태계가 논란 있는 성과를 정상적인 기술 추격으로 인정해주는 효과가 발생할 수 있다.

따라서 가장 정확한 비판은 ‘범죄를 공개적으로 옹호했다’보다 다음에 가깝다.

Claude 비인가 증류 의혹과 데이터 출처를 배제한 채 알고리즘 혁신만 강조한다면, 논란 있는 방식으로 축적했을 가능성이 있는 성과를 순수한 독자 기술로 포장하고, 국제 기술 생태계가 이를 세탁해주는 것으로 비칠 수 있다.

 


8. Kimi K3는 실제로 얼마나 강한 모델인가


현재 Kimi K3를 무조건 성능이 낮은 모델이라고 단정할 수는 없다.

출시 직후 K3는 Arena의 Frontend Coding 분야에서 최상위권에 올랐고, Artificial Analysis의 Intelligence Index에서도 상위권을 기록했다. 일부 외부 개발자와 기업 역시 웹 개발과 코딩 분야에서 높은 성능을 확인했다. (Business Insider)

반면 실제 사용 과정에서 오류와 신뢰성 문제도 나타나고 있다.

Wharton의 Ethan Mollick은 K3에 복잡한 통계 검증을 맡겼을 때 핵심 통계기법을 잘못 적용하는 등 다수의 오류를 발견했다고 지적했다. (Business Insider)

이처럼 현재 외부 평가는 엇갈린다.

  • Frontend Coding에서는 강한 결과

  • 공개 벤치마크에서는 Frontier급에 근접

  • 일부 복잡한 실제 작업에서는 오류 발생

  • 장기 Agent 작업의 안정성은 충분히 검증되지 않음

  • 내부 평가와 실제 서비스 성능 사이의 차이 불명확

  • 2.8조 파라미터 규모 대비 비용효율성 검증 부족


특히 공개 벤치마크 점수만으로 모델의 실질적 경쟁력을 판단하기는 어렵다.

모델이 특정 문제를 풀 수 있는지뿐 아니라 다음 지표가 함께 확인돼야 한다.

  • 동일한 작업을 반복했을 때의 성공률

  • 긴 작업에서 오류가 누적되는 정도

  • Tool Call 실패와 복구 능력

  • 환각과 사실 오류

  • 작업 완료당 비용

  • 실제 서비스 환경의 지연시간

  • GPU와 메모리 사용량

  • 사용자 개입 없이 완수할 수 있는 작업 범위


파라미터 숫자와 최고점 몇 개가 모델의 경제성과 신뢰성을 대신할 수는 없다.


결론: 7월 27일은 Kimi K3 검증의 첫 관문이다


Kimi는 K3의 전체 기술보고서와 아키텍처·훈련·평가 세부사항을 추후 공개하겠다고 밝히고 있으며, 전체 가중치도 2026년 7월 27일까지 공개할 예정이라고 설명하고 있다.

해당 결과가 나오기 전까지 K3의 실제 능력을 단정하는 것은 이르다. 이미 일부 외부 평가에서 상당한 코딩 성능이 확인됐기 때문에, K3를 전부 허상이라고 평가할 수도 없다.

다만 현재까지 공개된 정보만 놓고 보면 Kimi K3는 기술적 실체보다 서사가 앞서가고 있다는 인상을 지우기 어렵다.

2.8조 파라미터라는 압도적인 숫자, 세계 최대 오픈 모델이라는 표현, 제한적인 벤치마크의 최고점과 미국 모델 대비 낮은 가격이 하나의 강력한 이야기로 묶였다.

반면 다음과 같은 핵심 정보는 공개되지 않았다.

  • 전체 학습 토큰과 총 FLOPs

  • GPU 종류와 수량

  • 전체 학습비용

  • Alibaba Cloud 등 투자자의 컴퓨팅 지원

  • Post-training 데이터의 출처

  • Claude 출력의 사용 여부와 규모

  • 복잡한 실제 업무에서의 반복 성공률

  • 2.8조 파라미터를 서비스하는 실제 추론비용


Moonshot은 K3 공개 직후 투자자들에게 이르면 6개월 내 홍콩 상장을 추진하기 위한 주주결의안을 배포한 것으로 보도됐다. 기업가치는 300억달러 이상이 거론되고 있다. (타이페이 타임스)

이는 K3를 둘러싼 기술적 서사와 자본시장 이해관계를 분리해서 보기 어렵게 만든다.

K3가 미국의 Frontier Model을 위협하는 역사적 돌파구로 인식될수록 Moonshot의 기업가치는 높아지고, IPO를 통한 외부자금 조달도 쉬워진다. 반대로 증류 의혹, 높은 컴퓨팅 비용, 불완전한 외부 검증과 실제 성능의 한계를 먼저 강조할 유인은 크지 않다.

중국 정부와 국유자본이 K3의 실제 성능 한계를 어디까지 알고 있는지는 확인할 수 없다. 중국 정부가 의도적으로 문제를 은폐하고 있다고 단정할 직접적인 증거도 없다.

그러나 중국이 AI를 국가전략산업으로 육성하고 있고, Moonshot의 성공이 중국의 기술자립과 미국 제재 극복을 상징한다는 점을 고려하면, IPO와 추가 자금조달을 앞둔 시점에 정부와 국유자본이 현재의 성공 서사를 스스로 약화시킬 유인은 거의 없어 보인다.

지금까지의 정황 증거들을 미뤄보아,
현재 단계의 Kimi K3는 상당 부분 과대포장돼 있을 가능성이 높다고 *개인적으로 생각하고 있다.


#글을 마치며


미국이 이번 Kimi K3 사례를 확인하고도 프론티어 LLM에 대한 불법 증류와 성능 복제를 사실상 방치한다면, 막대한 비용을 지불하며 미국산 모델을 사용할 유인은 점차 약해질 수밖에 없다. 규제가 느슨한 국가에서 우회 계정과 API, VPN 등을 활용해 모델의 능력을 추출하고, 이를 기반으로 저가의 유사 모델을 출시하는 일이 반복될 가능성이 높기 때문이다.

이러한 구조가 고착되면 연구개발비와 컴퓨팅 비용은 미국 기업이 부담하고, 그 성과는 중국과 제3국이 저비용으로 복제하는 상황이 이어질 수 있다. 글로벌 이용자 역시 비싼 프론티어 모델보다 성능이 유사한 중국산 오픈웨이트 모델을 선택할 가능성이 커진다.

개인적으로 불법 증류 자체를 기술적으로 완전히 차단하는 것은 현실적으로 쉽지 않다고 본다. 그렇다면 규제의 초점은 모델 접근 통제에만 머물 것이 아니라, 대규모 증류와 복제를 가능하게 하는 첨단 AI 반도체와 제조 장비, 고대역폭 메모리, 네트워크 장비 등 물리적 컴퓨팅 인프라로 이동할 필요가 있다.

프론티어 AI의 지식재산권은 보호하지 못하면서, 이를 복제할 수 있는 컴퓨팅 자원까지 계속 공급하는 정책은 지속되기 어렵다. 이번 Kimi K3 사례는 단순한 모델 경쟁을 넘어, 미국의 AI 수출통제 전략을 다시 점검해야 할 계기에 가깝다고 생각한다.

https://bloomingbit.io/feed/news/116471


내 예상대로 추가 제재가 현실화된다면, 중국의 공급 확대가 제한되면서 반사이익을 얻는 글로벌 IDM과 중국향 매출 감소로 실적 부담이 커지는 반도체 장비업체 사이에 묘한 긴장 관계가 형성될 가능성도 염두에 둘 필요가 있지 않나 싶다.

中기업들, 독자 AI 생태계 구축 프로젝트 '은하계획' 발족
중국도 어느정도 추가제재 가능성에 대해 눈치 채고 있지 않나 싶다.

제3국이 자국 LLM을 불법 증류하거나 추출해 복제하는 상황을 우려한 중국 당국은, 같은 방식으로 기술을 탈취당하기 전에 관련 수출 통제부터 선제적으로 강화하는 모습 (*도둑이 제발저리는 꼴)

China considers tighter export controls on AI models and chips


=끝