레이블이 반도체-수급사이클인 게시물을 표시합니다. 모든 게시물 표시
레이블이 반도체-수급사이클인 게시물을 표시합니다. 모든 게시물 표시

2026년 9월 9일 수요일

생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)

지난주부터 Astra를 사용해 이것저것 시험해보고 있다.

처음에는 “와, 개쩐다”는 생각뿐이었다. 사람이 하던 것처럼 자료를 찾고, 문서를 읽고, 엑셀을 수정하며 결과까지 만들어내는 모습을 보면서 가능한 활용법을 하나씩 시험해봤다.

그러다 오늘 아침이 되어서야 Credit이 눈 녹듯 사라지고 있다는 사실을 뒤늦게 깨달았다.

Astra는 일반 Chatbot 형태의 이전 모델보다 Token당 단가가 높을 뿐 아니라, 하나의 업무를 처리하는 과정에서 훨씬 많은 Token을 사용한다. 자료를 읽고 끝나는 것이 아니라 계획을 세우고, 도구를 사용하고, 결과를 확인하고, 문제가 생기면 다시 시도하기 때문이다.

개인적인 Credit 사용 기반 report 


특히 9월 8~10일 3일간 XXX크레딧, 전체 사용량의 74.1%가 집중됐습니다. 최근 여러 기업의 긴 컨퍼런스콜 원문과 대형 엑셀 어닝모델을 연속해서 처리한 영향으로 보입니다.

더 중요한 부분은 토큰 구성입니다.

  • 캐시된 입력: xxxM tokens, 전체 토큰의 93.2%
  • 신규 입력: xxM
  • 출력: xxxM

즉, 답변을 길게 써서라기보다 긴 대화 문맥·첨부파일·기존 리서치 자료가 매번 모델에 다시 투입되는 구조가 크레딧 증가의 주된 원인

 - From credit report 


잠깐....

텍스트로 된 Earnings Call을 정리하고 몇 번의 Financial Modeling을 맡겼을 뿐인데도 사용량이 이 정도라면, 이미지와 영상을 만들거나 현실 세계를 계속 관찰하고 예측하는 World Model에서는 얼마나 많은 Token이 필요할까?

특히 앞으로 AI가 과학적 가설을 세우고 수많은 실험 결과를 비교하거나, 휴머노이드 로봇이 카메라와 센서를 통해 현실을 끊임없이 학습하기 시작한다면 지금과는 전혀 다른 규모의 Compute와 Memory가 필요할 수도 있다.

갑자기 그 차이가 궁금해졌다.

그래서 가장 이해하기 쉬운 해리포터를 예로 들어, AI가 책 한 권을 읽을 때와 같은 이야기를 영상과 움직이는 세계로 만들 때 필요한 Token이 얼마나 달라지는지부터 하나씩 계산해봤다.


AI가 글을 읽는 시대에서 현실 세계를 이해하는 시대로


최근 Agent와 World Model 관련 자료들을 살펴보면서 앞으로 AI가 얼마나 많은 Token과 데이터를 사용하게 될지 생각해봤다.

Token은 AI가 글이나 이미지, 영상을 이해하기 위해 정보를 잘게 나눈 조각이다.

지금까지는 주로 사람이 AI에게 질문하면 AI가 글로 답하는 과정에서 Token이 사용됐다.

하지만 Agent는 사람이 시키지 않아도 여러 단계를 거쳐 일을 수행한다. World Model은 여기서 더 나아가 카메라와 센서를 통해 현실 세계를 보고, 다음에 무슨 일이 일어날지 예상한다.

이를 가장 쉽게 이해하기 위해 해리포터 1권을 예로 들어보자.


1. 해리포터 책을 읽는 AI


『해리포터와 마법사의 돌』 영어 원서는 약 7만7,000단어로 이루어져 있다.

AI가 이 책을 처음부터 끝까지 한 번 읽으려면 약 10만 개의 Text Token이 필요하다.

Token을 이해하기 어렵다면 책을 레고 블록으로 잘게 나눈다고 생각하면 된다.

AI는 해리포터 책 전체를 약 10만 개의 작은 언어 블록으로 나누어 읽는다.

텍스트 파일로 저장하면 크기는 1MB도 되지 않는다.

즉 한 권의 책은 다음과 같이 표현할 수 있다.

Harry Potter Book
→ 약 77,000 Words
→ 약 100,000 Text Tokens
→ 1MB 이하의 Data

AI가 책을 요약하고 인물 관계를 분석하고 내용을 여러 번 검토한다면 더 많은 Token이 필요하다.

그래도 대부분 수십만 개에서 수백만 개 수준이다.

여기까지가 우리가 익숙하게 알고 있던 LLM의 세계다.


2. 같은 이야기를 영화로 만들면 어떻게 될까


이제 같은 해리포터 이야기를 영화로 만든다고 생각해보자.

책에서는 다음과 같이 한 문장으로 표현할 수 있다.

“해리는 움직이는 계단을 따라 호그와트 위층으로 올라갔다.”

그러나 영상을 만들려면 훨씬 많은 정보가 필요하다.

계단은 어떻게 생겼는지, 해리는 어디에 서 있는지, 옷은 어떻게 움직이는지, 주변 조명은 얼마나 어두운지, 카메라는 어느 방향에서 촬영하는지를 모두 표현해야 한다.

그리고 이 정보는 매 순간 달라진다.

텍스트는 한 문장으로 장면을 설명할 수 있지만 영상은 매초 수많은 화면의 변화를 기록해야 한다.

NVIDIA는 현실의 영상과 로봇 데이터를 이해하고 미래 장면을 생성하는 World Model인 Cosmos를 개발했다.

Cosmos는 2,000만 시간의 실제 영상 데이터를 약 9,000조 개의 Visual Token으로 바꿔 학습했다. 이를 단순하게 나누면 영상 1시간당 약 4억5,000만 개, 1초당 약 12만5,000개의 Visual Token에 해당한다.

NVIDIA Cosmos

해리포터 1편 영화는 약 152분이다.

이를 Cosmos 기준으로 계산하면 완성된 영화 한 편을 표현하는 데 약 11억 개의 Visual Token이 필요하다.

Harry Potter Book
→ 약 10만 Text Tokens

Harry Potter Movie
→ 약 11억 Visual Tokens

같은 이야기를 표현하는데도 영상은 텍스트보다 약 1만1,000배 많은 Token을 사용한다.

Text는 이미 정리된 이야기를 읽는다.

World Model은 이야기 속의 세계 전체를 직접 만들어야 한다.


3. 실제 영화 제작에는 완성본보다 훨씬 많은 데이터가 필요하다


영화는 처음 촬영한 장면을 그대로 사용하는 경우가 많지 않다.

같은 장면을 여러 번 촬영하고, 다른 카메라 각도를 사용하며, 특수효과와 배경도 여러 번 수정한다. 그렇게 만들어진 수많은 장면 가운데 가장 좋은 결과만 최종 영화에 들어간다.

World Model도 비슷하다.

AI가 하나의 미래만 생각하는 것이 아니라 여러 미래를 동시에 만들어보고 그중 가장 적절한 결과를 선택한다.

예를 들어 해리포터가 움직이는 계단 앞에 서 있다고 생각해보자.

AI는 다음과 같은 여러 미래를 만들 수 있다.

  • 계단이 왼쪽으로 움직이는 미래

  • 계단이 오른쪽으로 움직이는 미래

  • 해리가 계단을 놓치는 미래

  • 론과 헤르미온느가 나타나는 미래

  • 계단 위에서 위험한 일이 생기는 미래

가능한 미래를 10개 만들면 필요한 Token도 대략 10배 늘어난다.

30개의 장면과 수정본을 만든다면 약 342억 개의 Token이 필요할 수 있다.

여러 미래를 반복해서 만들고 비교하면 수요는 다시 커진다.


Text AI는 책에 적힌 세계를 읽는다.

World Model은 그 세계가 실제로 움직이는 모습을 만들고, 앞으로 일어날 수 있는 여러 미래까지 계산한다.

Words
→ Images
→ Video
→ Interactive Worlds
→ Multiple Possible Futures

AI가 Text에서 World로 이동할수록 처리해야 하는 정보량이 폭발적으로 증가하는 이유다.




4. Agent는 Token을 사용하는 주체를 사람에서 AI로 바꾼다


기존 Chatbot은 사람이 질문할 때만 작동했다.

사람이 질문을 한 번 입력하면 AI도 답변을 한 번 생성했다.

하지만 Agent는 다르다.

예를 들어 “해리포터 영화의 흥행 성과를 분석해줘”라고 요청하면 Agent는 필요한 자료를 찾고, 숫자를 정리하고, 계산하고, 결과가 맞는지 확인한다. 오류가 발견되면 다시 자료를 찾고 계산을 수정한다.

질문
→ 계획
→ 자료 검색
→ 계산
→ 결과 확인
→ 오류 수정
→ 최종 답변

하나의 업무 안에서 AI가 수십 번 판단하는 구조다.

따라서 Agent는 사람이 Chatbot에 질문할 때보다 훨씬 많은 Token을 사용한다.

OpenRouter 데이터에서 Agent가 사용한 Token은 약 6개월 동안 0.5조 개에서 7.3조 개로 14배 증가했다.

2026년 2월에는 Agent의 Token 사용량이 인간의 직접 사용량을 추월했다. 현재 그래프 기준으로는 Agent가 사람보다 약 5배 많은 Token을 사용하고 있다.


OpenRouter Usage Rankings


중요한 변화는 AI 사용자가 늘어난 것만이 아니다.

Token을 사용하는 주체 자체가 사람에서 Agent로 바뀌고 있다.

사람은 쉬고 잠을 잔다.

Agent는 필요한 경우 하루 종일 여러 작업을 동시에 수행할 수 있다.

한 사람이 3개, 5개, 10개의 Agent를 사용하기 시작하면 AI 사용자 수는 사람 수보다 훨씬 빠르게 늘어난다.


5. AI는 기술기업 밖으로 빠르게 확산되고 있다


처음 AI를 적극적으로 사용한 곳은 기술기업이었다.

하지만 이제 금융, 제조업, 유통업과 같은 전통 산업도 AI를 빠르게 도입하고 있다.

Ramp 고객 기업 표본에서 유료 AI 서비스를 사용하는 비중은 다음과 같이 상승했다.

  • Technology and Media: 80.6%

  • Finance and Insurance: 73.1%

  • Manufacturing: 60.4%

  • Retail: 49.0%

  • Health Care: 42.9%

  • Construction: 42.0%

Ramp AI Index

이 수치는 미국 전체 기업의 정확한 보급률이 아니라 Ramp가 관찰할 수 있는 고객 기업의 결제 데이터를 기준으로 한다.

그럼에도 방향은 분명하다.

기술기업만 사용하던 AI가 은행, 보험회사, 공장, 병원, 건설회사와 식당까지 확산되고 있다.

사용하는 기업이 많아지고, 기업마다 여러 Agent가 일하기 시작하면 Token 수요는 다음과 같이 커진다.

More Companies
× More Employees
× More Agents per Employee
× More Tasks per Agent
× More Tokens per Task


https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com

https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com

https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com



6. 2030년까지 Token 수요는 얼마나 증가할까


Goldman Sachs는 Agent 확산으로 글로벌 월간 Token 사용량이 2026년 약 5경 개에서 2030년 120경 개로 증가할 것으로 전망했다.

4년 동안 약 24배 증가하는 수치다.

Goldman Sachs Research

왜 이렇게 빠르게 증가할까.

첫째, AI를 사용하는 사람이 늘어난다.

둘째, 한 사람이 여러 Agent를 사용하게 된다.

셋째, Agent는 하나의 일을 수행하기 위해 여러 번 모델을 호출한다.

넷째, AI가 글을 넘어 이미지·영상·음성까지 처리한다.

다섯째, 앞으로는 로봇과 자율주행차가 현실 세계의 데이터를 계속 만들어낸다.

Goldman Sachs의 120경 개는 주로 Chatbot과 Consumer·Enterprise Agent를 중심으로 한 전망이다.

World Model과 Physical AI가 빠르게 보급될 경우 여기에 추가 수요가 붙을 수 있다.



기준 시나리오에서는 2030년까지 전 세계에서 활동하는 휴머노이드 로봇이 약 100만 대에 도달하고, 제한된 카메라와 센서 데이터만 World Model 학습에 사용된다고 가정했다.

다만 이는 아직 공식 전망이 아니라 자체 계산이다.

로봇 보급이 늦어지거나 영상 압축기술이 빠르게 발전하면 수요는 낮아질 수 있다. 반대로 휴머노이드 외에 자율주행차, 드론, 산업용 로봇과 스마트 카메라까지 포함하면 수요는 예상보다 훨씬 커질 수 있다.





7. 다음 단계는 현실 세계에서 일하는 AI다


AI가 Text만 처리할 때는 사람이 만든 문서와 인터넷 자료가 주요 학습 데이터였다.

하지만 휴머노이드 로봇은 스스로 새로운 데이터를 만든다.

로봇은 카메라로 주변을 보고, 마이크로 소리를 듣고, 센서로 힘과 거리와 움직임을 측정한다. 물건을 잡다가 실패하면 그 과정도 새로운 학습 데이터가 된다.

한 대의 로봇이 새로운 동작을 배우면 그 결과를 다른 로봇들과 공유할 수도 있다.

Robot Deployment
→ Real-world Data
→ World Model Training
→ Better Robot Intelligence
→ More Robot Deployment

로봇이 늘어날수록 현실 데이터가 늘어난다.

데이터가 늘어날수록 World Model은 더 똑똑해진다.

World Model이 똑똑해질수록 로봇이 할 수 있는 일이 늘어난다.

그러면 더 많은 로봇이 판매되고, 다시 더 많은 데이터가 만들어진다.

인터넷 시대에는 사람이 데이터를 만들었다.

Physical AI 시대에는 기계가 스스로 데이터를 생산하기 시작한다.


8. 휴머노이드 한 대보다 더 큰 것은 데이터센터 수요다


휴머노이드 로봇 한 대에는 DRAM, NAND Flash, 센서, 통신칩과 여러 반도체가 들어간다.

이들 반도체 탑재액을 대당 600~800달러로 가정하면 다음과 같다.

  • 100만 대: 6억~8억달러

  • 1,000만 대: 60억~80억달러

다만 이 금액 전체가 순수한 메모리 매출은 아니다. 센서와 통신칩 등 다른 반도체도 포함되어 있으므로 실제 Memory Content는 이보다 작다.

더 큰 기회는 로봇이 작동하는 동안 계속 만들어내는 데이터에 있을 가능성이 높다.

로봇 한 대가 하루에 0.1~1TB의 카메라·센서 데이터를 만든다고 가정해보자.

100만 대가 작동하면 하루에 0.1~1EB, 1년이면 36.5~365EB의 원시 데이터가 만들어질 수 있다.

물론 모든 데이터를 영구적으로 보관하지는 않는다.

중복되거나 가치가 낮은 영상은 지우고, 실패하거나 새로운 상황을 담은 중요한 데이터만 남길 것이다.

전체의 1%만 저장하더라도 연간 약 0.4~3.7EB다. 10%를 남기면 3.7~36.5EB가 된다.

따라서 Physical AI의 메모리 수요는 두 곳에서 발생한다.

로봇 안의 Memory

  • DRAM: 주변 상황을 실시간으로 계산

  • NAND: 지도·모델·작업 기록을 저장

  • 고성능 메모리: 더 복잡한 AI를 로봇 내부에서 실행

데이터센터의 Memory와 Storage

  • HBM: World Model 학습과 추론

  • Server DRAM: 대규모 데이터 처리

  • Enterprise SSD: 자주 사용하는 학습 데이터

  • HDD: 장기간 보관하는 영상과 센서 데이터


로봇 한 대에 들어가는 메모리도 중요하다.

하지만 로봇이 평생 만들어내는 데이터를 학습하고 저장하는 인프라의 가치가 더 클 수 있다.


9. 효율이 좋아지면 Memory 수요가 줄어들까


영상 압축과 Tokenizer 기술이 발전하면 같은 영상을 더 적은 Token으로 표현할 수 있다.

NVIDIA는 Cosmos Tokenizer가 기존 기술보다 더 높은 압축률과 빠른 처리 속도를 제공한다고 설명한다.

그렇다면 메모리와 Compute 수요가 줄어들까.

반드시 그렇지는 않다.

영상 한 시간을 처리하는 비용이 10분의 1로 낮아지면 기업은 영상 10시간만 처리하고 멈추지 않을 수 있다.

더 많은 카메라를 연결하고, 더 긴 시간을 기록하고, 더 많은 미래를 시뮬레이션하게 된다.

Token Cost ↓
→ More Cameras Connected
→ More Operating Hours
→ More Simulations
→ More Robots Trained
→ Total Token Demand ↑

자동차가 연료 효율이 좋아졌다고 사람들이 자동차를 완전히 사용하지 않게 되는 것은 아니다.

오히려 이동 비용이 낮아지면서 자동차 사용이 늘어날 수도 있다.

AI도 비슷하다.

토큰당 비용은 하락하지만 전체 Token 사용량은 더 빠르게 증가할 수 있다.


10. AI는 세 번에 걸쳐 Memory 시장을 확장한다


첫 번째 변화는 Training AI였다.

거대한 LLM을 학습하기 위해 GPU와 HBM이 필요해졌다.

두 번째 변화는 Agent AI다.

AI가 사람 대신 도구를 사용하고 오랫동안 일하면서 추론 Token과 KV Cache, Server DRAM 수요가 증가한다.

세 번째 변화는 World Model과 Physical AI다.

AI가 현실 세계를 보고 행동하기 시작하면서 영상·공간·센서 데이터가 계속 만들어진다.

Training AI
→ HBM 중심

Agent AI
→ HBM + Server DRAM + Enterprise SSD

Physical AI
→ HBM + DRAM + NAND + Enterprise SSD + HDD

AI는 데이터센터에서 첫 번째 메모리 사이클을 만들었다.

Agent는 Token을 사용하는 주체를 인간에서 소프트웨어로 확장한다.

World Model과 휴머노이드 로봇은 데이터 생성 장소를 인터넷에서 현실 세계로 확장한다.


글을 마치며


해리포터 책 한 권을 읽는 데 필요한 정보는 약 10만 개의 Text Token이다.

하지만 그 이야기를 영화처럼 움직이는 세계로 표현하면 약 11억 개의 Visual Token이 필요할 수 있다.

여러 장면과 미래를 만들고 비교하면 필요한 Token은 다시 수십 배, 수백 배 늘어난다.

이 차이는 단순히 영상 파일이 글보다 크다는 이야기가 아니다.

기존 AI는 사람이 이미 만들어놓은 지식을 읽었다.

앞으로의 AI는 현실을 직접 보고, 다음 상황을 예상하고, 행동하고, 실패한 결과를 다시 학습한다.

Chatbot은 사람이 질문해야 움직인다.

Agent는 일이 끝날 때까지 스스로 움직인다.

휴머노이드 로봇은 현실 세계에서 움직이면서 하루 종일 새로운 데이터를 만들어낸다.

Human Prompt
→ AI Agent
→ World Model
→ Physical AI

AI가 이 방향으로 발전할수록 Token을 사용하는 주체와 시간, 데이터의 종류가 함께 늘어난다.

Goldman Sachs의 전망대로 Agent만으로도 2030년 Token 수요는 2026년 대비 약 24배 증가할 수 있다. World Model과 Physical AI가 예상보다 빠르게 확산되면 약 35~60배 이상도 생각해볼 수 있다.

이 과정에서 가장 중요한 것은 단순히 로봇이 몇 대 판매되는지가 아닐 수 있다.

로봇이 얼마나 오랫동안 현실을 관찰하고, 얼마나 많은 데이터를 만들며, 그 데이터를 몇 번이나 학습과 시뮬레이션에 다시 사용하는지가 더 중요하다.

AI가 글을 읽던 시대에는 Compute가 필요했다.
AI가 현실을 보기 시작하는 시대에는 Compute와 Memory, Storage가 모두 필요하다.

다음 Memory Supercycle은 데이터센터 안에서만 만들어지지 않을 수 있다.

현실 세계를 돌아다니며 매일 새로운 데이터를 생산하는 수백만 대의 기계 안에 숨어 있을 가능성이 있다.

문뜩 AGI시대가 도래할지라도 너무 비싸서 쓸 수가 없으면 무슨 소용일까 싶다. 


=끝

2026년 7월 30일 목요일

생각정리 325 (* Memory Premium)

엊그제 Amazon 실적발표에서는 AI 데이터센터와 Cloud 사업의 투자회수기간, 수익성, Capacity 수요를 가늠할 수 있는 의미 있는 지표들이 연달아 공개됐다.

이 수치들을 따라가다 보니, 현재의 Memory 가격이 AI Cloud가 창출하는 경제적 가치에 비해 얼마나 낮게 평가돼 있는지, 그리고 Cloud 사업자가 감당할 수 있는 Memory의 적정가격 상단이 어디까지인지 역산해볼 수 있었다.

오늘은 그 리서치 과정을 정리해 기록으로 남겨본다.

만약 내가 바라보는 메모리의 적정가치의 논리와 전제, 가정들이 '어느정도' 맞다면, 현재의 메모리 컨센서스는 수요량 증가를 어느 정도 반영하고 있더라도, 메모리 업체가 확보할 수 있는 가격과 이익의 상단은 여전히 충분히 반영되지 못하고 있을 가능성이 매우 크다.

Memory Premium


AI Cloud는 Memory 가격을 어디까지 감당할 수 있는가


AI 데이터센터 투자를 둘러싼 논쟁은 주로 CAPEX의 절대 규모에 집중돼 있다.

수백억달러를 들여 데이터센터와 GPU를 계속 증설해도 투자비를 회수할 수 있는지, AI 수요가 둔화되면 막대한 설비가 유휴자산으로 남는 것은 아닌지에 대한 우려다.

그러나 최근 Amazon의 실적과 어닝콜을 보면 논의의 출발점을 조금 바꿀 필요가 있다.

현재 AI Cloud 사업자는 매출이 발생하지 않는 미래를 위해 투자하는 단계에만 머물러 있지 않다. 이미 가동 중인 AI 서버에서는 충분한 매출과 이익이 발생하고 있으며, 서버와 Network 장비의 투자비도 평균 3년 이내에 회수되고 있다.

Jamin Ball (@jaminball) / X


이제 Cloud 사업자의 핵심 질문은 데이터센터 투자를 계속할 것인지에 머물지 않는다.

이미 확보한 전력과 GPU를 활용해 얼마나 많은 유료 TOKEN을 생산할 수 있는가.

이 질문을 따라가면 Memory의 경제적 가치가 보이기 시작한다.

GPU는 AI 데이터센터에서 가장 비싼 핵심자산이지만, HBM의 용량과 Bandwidth가 부족하면 GPU 연산기는 데이터를 기다리며 놀게 된다. 더 많은 Memory가 이러한 대기시간을 줄여 TOKEN 생산량을 늘린다면, Memory 가격의 상단도 과거 DRAM 가격이나 제조원가만으로 설명하기 어려워진다.

Memory에 지불할 수 있는 최대가격은 추가 Memory가 회복시키는 GPU 가동시간과 그 시간에 생산되는 유료 TOKEN의 가치에 의해 결정된다.


핵심 요약

  • Amazon은 AWS 서버와 Network 장비의 투자비를 평균 3년 미만에 회수하고 있으며, 장비는 최소 5~6년 동안 사용하고 있다고 밝혔다.

  • LLM 추론에서는 GPU에 작업이 배정돼 있어도 HBM에서 데이터를 기다리면서 Tensor Core가 충분히 활용되지 못하는 Memory Wall이 발생한다.

  • H100에서 H200으로 넘어가면서 HBM 용량은 76%, Bandwidth는 43% 늘었고, Llama 2 70B 처리량은 최대 90% 증가했다.

  • Blackwell과 Rubin에서는 GPU 연산성능이 더 빠르게 증가하므로, Memory 부족으로 발생하는 GPU의 기회비용도 함께 커진다.

  • 기준 시나리오에서 Rubin의 전체 Memory System은 GPU당 약 10만~11만달러의 경제적 가치를 창출할 수 있다.

  • 이에 따라 HBM 가격은 현실적으로 현재의 3~5배까지 상승하더라도 Cloud 사업자의 장기 경제성이 유지될 가능성이 있다.


1. AI 데이터센터는 이미 투자비를 회수하고 있다


Amazon의 2026년 2분기 AWS 매출은 422억달러로 전년 대비 37% 증가했다. 영업이익은 166억달러로 64% 증가했으며, 영업이익률은 39.4%에 달했다.

AWS의 AI 사업과 자체 AI Chip 사업도 각각 연환산 매출 250억달러를 넘어섰다. AI 인프라 투자가 아직 매출로 연결되지 않은 선행투자에만 머무르는 것이 아니라, 실제 매출과 영업이익으로 전환되고 있다는 의미다. (Amazon)

2026.07.31 Amazon

Amazon은 어닝콜에서 AI 데이터센터의 투자회수 구조를 다음과 같이 설명했다.

  • 데이터센터 건물과 전력설비는 서버 설치 약 2년 전부터 투자가 시작된다.

  • 데이터센터는 30년 이상 활용할 수 있다.

  • 서버와 Network 장비는 실제 고객 수요를 확인한 뒤 가동 몇 달 전에 구매한다.

  • 서버와 Network 장비의 평균 투자회수기간은 3년 미만이다.

  • 서버의 경제적 사용기간은 최소 5~6년이다.

  • 최근 AI Capacity 계약은 대부분 5년 이상으로 체결된다.




서버를 6년 사용하면서 3년 이내에 투자비를 회수한다면, 이후 남은 2~3년은 상당한 잉여현금흐름을 창출하는 기간이 된다. Amazon은 AI 사업의 Margin과 Return이 과거 AWS Core 사업의 초기 단계보다 조금 앞서가고 있다고 평가했다. (알파스트리트 뉴스)


2026.07.31 Amazon

Amazon이 구체적인 AI ROIC 수치를 공개한 것은 아니다.

다만 3년 미만의 투자회수기간은 단순 현금회수 속도로 보면 매년 투자원금의 33% 이상을 회수하는 구조다. 회계상 ROIC와 완전히 같은 개념은 아니지만, AI 서버 투자의 경제성이 이미 상당히 높은 수준에 도달했음을 보여준다.


2026.07.31 Amazon

그럼에도 Amazon의 Free Cash Flow가 감소하는 이유는 기존 AI 서버가 돈을 벌지 못해서가 아니다.

현재 매출을 창출하는 데이터센터와 함께, 앞으로 사용할 데이터센터와 전력설비를 동시에 건설하고 있기 때문이다. 데이터센터는 완공되기 전까지 현금만 지출하지만, 서버가 설치되고 고객이 사용하기 시작하면 매출이 바로 발생한다.

Amazon은 2026년 Cash CAPEX 전망을 기존 2,000억달러에서 2,200억달러로 상향했다. 상향 원인 가운데 하나로 Memory 가격 상승을 직접 언급했다.

그럼에도 회사는 2026년 수요를 모두 충족하지 못할 것으로 예상했고, 2027년에도 Capacity 부족이 이어질 가능성이 높다고 설명했다. 2028년 Capacity에 대해서도 이미 상당한 고객 수요가 확인되고 있다. (marketbeat.com)

여기서 중요한 결론을 얻을 수 있다.

Memory 가격이 올라가고 있지만, Memory를 포함한 AI 데이터센터 투자의 예상수익이 여전히 비용보다 크기 때문에 Cloud 사업자는 투자를 줄이지 않고 있다.

 


2. AI Cloud의 핵심은 GPU 개수가 아니라 TOKEN 생산량이다


앞선 「Token Empire」에서 AI Cloud의 경쟁력을 다음과 같이 정의했다.

투자자본 1달러와 전력 1MW, Rack 한 개당 얼마나 많은 유료 TOKEN을 생산하는가.

AI Cloud의 원가구조를 단순화하면 다음과 같다.

TOKEN당 총원가

= GPU·Memory·Network·Data Center의 연간 고정비 ÷ 연간 유료 TOKEN 생산량
+ TOKEN 생산에 사용되는 전력·냉각·운영비

GPU와 Memory, Network, 데이터센터 건물은 일단 구매하면 사용량이 줄어도 감가상각비가 계속 발생한다.

따라서 TOKEN 생산량이 늘어나면 동일한 고정비를 더 많은 TOKEN에 나눠 부담할 수 있다.

예를 들어 연간 고정비가 100이라고 가정해보자.

  • TOKEN을 100개 생산하면 TOKEN당 고정비는 1이다.

  • TOKEN을 200개 생산하면 TOKEN당 고정비는 0.5로 낮아진다.

새로운 데이터센터를 건설하지 않고 기존 GPU의 TOKEN 생산량을 두 배로 늘릴 수 있다면, TOKEN당 감가상각비는 절반 가까이 낮아질 수 있다.

이 때문에 Cloud 사업자가 중요하게 보는 지표도 GPU 한 개의 구매가격에만 머물지 않는다.

  • TOKEN당 총소유비용

  • GPU당 TOKEN 처리량

  • Rack당 TOKEN 생산량

  • 전력 1MW당 매출

  • 고객의 응답시간 기준을 만족하는 Goodput

  • 생산된 TOKEN 중 실제 과금으로 연결되는 비율


Memory는 이 지표 대부분에 영향을 준다.


3. Memory Wall은 왜 GPU를 놀게 만드는가


GPU를 거대한 연산공장이라고 생각하면 이해하기 쉽다.

Tensor Core는 공장 안의 생산설비이고, HBM은 생산설비에 원재료를 공급하는 고속 컨베이어에 해당한다.

생산설비가 아무리 빨라도 컨베이어에서 원재료가 제때 도착하지 않으면 공장은 기다릴 수밖에 없다. AI GPU에서도 같은 현상이 발생한다.

LLM 추론은 크게 두 단계로 나뉜다.

Prefill

사용자가 입력한 Prompt 전체를 한꺼번에 읽고 처리하는 과정이다.

큰 행렬연산이 집중되므로 상대적으로 GPU 연산성능의 영향을 많이 받는다.

Decode

답변 TOKEN을 한 개씩 순차적으로 생성하는 과정이다.

TOKEN 하나를 만들 때마다 Model Weight와 이전 TOKEN의 정보를 저장한 KV Cache를 반복해서 불러와야 한다. 이 과정에서는 연산능력보다 HBM 용량과 Bandwidth가 병목이 되기 쉽다.

결국 Decode에서는 GPU에 작업이 배정돼 있고 전력도 소비하고 있지만, Tensor Core가 Memory에서 데이터가 도착하기를 기다리는 시간이 길어질 수 있다.

여기서 말하는 GPU 유휴가동률은 고객이 없어 GPU 전원이 꺼져 있는 비율과 다르다.

작업은 수행 중이지만 Memory와 Software 병목 때문에 GPU의 최대 연산능력을 매출로 전환하지 못하는 비중을 의미한다.

공개 연구에서는 Batch 1 Decode를 수행한 H100이 이론적 HBM Bandwidth의 약 27%만 활용한 사례가 확인됐다. CUDA Graph를 적용해 Kernel 실행 오버헤드를 줄이자 성능이 약 1.26배 개선됐다.

이는 LLM Decode가 Memory의 영향을 크게 받지만, Memory만 늘린다고 성능이 자동으로 비례 상승하는 것은 아니라는 점도 보여준다. Software, Kernel과 Scheduling이 함께 개선돼야 추가 Memory의 가치가 실현된다. (arXiv)

반대로 Memory 관리방식을 개선하는 것만으로 처리량이 크게 상승한 사례도 있다.

vLLM의 PagedAttention은 KV Cache의 파편화와 중복을 줄여 같은 GPU와 유사한 응답시간 조건에서 기존 Serving System보다 2~4배 높은 처리량을 기록했다. 물리적인 GPU를 추가하지 않고 Memory 활용방식만 바꿔 TOKEN 생산량을 늘린 사례다. (arXiv)

arXiv

vLLM의 PagedAttention은 KV Cache의 파편화와 중복을 줄여 같은 GPU와 유사한 응답시간 조건에서 기존 Serving System보다 2~4배 높은 처리량을 기록



GPU 유휴율을 어떻게 가정할 것인가


모든 Cloud 사업자에 적용할 수 있는 단일 GPU 유휴율은 존재하지 않는다.

Model 크기, Context 길이, Batch, 고객 요청량, Serving Software와 Network 구성에 따라 결과가 크게 달라지기 때문이다.

따라서 아래 계산에서는 업계 평균을 단정하지 않고, 이해를 돕기 위한 기준 시나리오를 설정했다.

  • 실제 TOKEN 생산에 사용되는 GPU 연산능력: 30%

  • Memory와 Software 병목으로 활용되지 못하는 연산능력: 70%


이 상태에서 Memory 개선으로 처리량이 증가하면 GPU의 생산적 활용률은 다음과 같이 변한다.


처리량이 60% 증가한다고 GPU 전체가 60% 더 바빠지는 것은 아니다.

기존 생산적 활용률 30%에 1.6배를 곱하면 48%가 된다.

그 결과 GPU 유휴 비중은 70%에서 52%로 낮아진다. Memory가 새로운 GPU를 만들어내는 것은 아니지만, 기존 GPU 안에서 놀고 있던 연산능력 18%p를 TOKEN 생산으로 전환하는 셈이다.




4. H100과 H200이 보여준 Memory의 경제성


Memory가 GPU 성능에 미치는 영향을 가장 쉽게 확인할 수 있는 사례가 H100과 H200이다.

두 GPU는 모두 Hopper Architecture를 기반으로 한다. H200의 가장 큰 변화는 HBM이다.


NVIDIA의 Llama 2 70B Benchmark에서 H200은 H100보다 최대 1.9배 높은 처리량을 기록했다. H100은 Batch 8, H200은 Batch 32가 적용됐다. (nvidia.com)

이는 Memory만 교체한 완벽한 통제실험으로 볼 수는 없다.

그러나 Batch를 8에서 32로 확대할 수 있었던 핵심 이유가 HBM 용량과 Bandwidth 확대라는 점이 중요하다. 추가 Memory가 더 많은 사용자의 KV Cache를 동시에 보관할 수 있게 만들면서 GPU의 연산설비를 더 효율적으로 활용한 것이다.

앞서 설정한 기준 시나리오에 적용하면 다음과 같다.

  • 개선 전 생산적 활용률: 30%

  • H200 처리량 개선: 최대 90%

  • 개선 후 생산적 활용률: 30% × 1.9 = 57%

  • 연산 유휴 비중: 70% → 43%


61GB의 추가 HBM과 더 높은 Bandwidth가 GPU의 연산 유휴 비중을 약 27%p 줄일 수 있다는 계산이다.

물론 모든 Model과 Workload에서 1.9배가 반복되지는 않는다.

그럼에도 H100에서 H200으로의 변화는 Memory가 단순히 GPU BOM을 높이는 부품을 넘어, 이미 구매한 Tensor Core를 실제 매출로 전환하는 자산이라는 점을 보여준다.




5. Blackwell과 Rubin에서는 Memory의 가치가 더 커진다


Hopper 이후 NVIDIA의 GPU 연산성능은 빠르게 증가하고 있다.

B200은 DGX H100보다 최대 15배의 추론성능을 제공한다고 NVIDIA는 설명한다. 이 수치에는 FP4 연산, Transformer Engine, NVLink와 Software Stack의 개선이 모두 포함돼 있으므로 전부를 Memory의 효과로 볼 수는 없다. (nvidia.com)

다만 GPU 연산성능이 Memory Bandwidth보다 빠르게 증가하면 새로운 문제가 발생한다.

연산기는 더 빨라졌지만 데이터를 공급하는 속도가 이를 따라오지 못하면서 Memory Wall이 오히려 커질 수 있다.

주요 NVIDIA GPU의 Memory 사양을 비교하면 다음과 같다.


DGX B200은 8개 GPU에 총 1,440GB의 HBM3E와 64TB/s의 Memory Bandwidth를 제공한다. GPU당으로 환산하면 180GB와 8TB/s다. (nvidia.com)

GB300은 약 288GB의 HBM3E를 탑재한다. NVIDIA는 더 큰 Memory가 Batch를 확대하고, 긴 Context를 사용하는 AI Reasoning의 최대 처리량을 높인다고 설명한다. (nvidia.com)

Rubin은 HBM 용량을 288GB로 유지하면서 Bandwidth를 22TB/s로 높인다. GB300 대비 약 2.75배에 해당한다.

Vera Rubin NVL72의 CPU Memory도 Rack당 54TB로 확대된다. GB300 NVL72의 17TB와 비교하면 세 배가 넘는 수준이다. (nvidia.com)

NVIDIA는 Vera Rubin NVL72가 GB200 NVL72보다 동일 전력에서 최대 10배 많은 TOKEN을 생산하고, 백만 TOKEN당 비용을 10분의 1로 낮출 수 있다고 제시한다. (nvidia.com)

다만 이 10배는 HBM4만으로 만들어지는 성능이 아니다.

  • NVFP4 연산성능

  • Rubin GPU

  • Vera CPU

  • HBM4

  • NVLink 6

  • Network

  • Attention 최적화

  • Prefill·Decode 분리

  • Serving Software


이 모든 요소가 함께 개선된 결과다.

따라서 Memory의 경제적 가치를 계산할 때는 전체 10배를 사용하지 않고, 그중 Memory가 직접 만들어내는 처리량만 보수적으로 분리해야 한다.


차세대 GPU에서 Memory가 기여하는 처리량 가정


아래 수치는 NVIDIA가 제시한 공식 Benchmark가 아니라, Capacity와 Bandwidth 변화에서 Memory의 기여분만 추출한 분석 가정이다.




B200은 전체 추론성능이 H200보다 훨씬 높지만, 그중 상당 부분은 FP4와 Tensor Core의 개선에서 발생한다. 따라서 Memory에 귀속되는 처리량은 60%로 제한했다.

GB300은 Bandwidth보다 Memory Capacity 확대가 중심이다. Long Context와 큰 Batch에서는 가치가 크지만, 짧은 Context에서는 일부 Memory가 남을 수 있어 처리량 증가를 35%로 가정했다.

Rubin은 Bandwidth가 2.75배 높아지지만, Network와 Kernel 등 다른 병목이 남아 있다. 이에 따라 Memory가 만들어내는 처리량 개선은 175%가 아닌 100%, 즉 두 배로 가정했다.


6. 추가 Memory는 Cloud 매출과 이익을 얼마나 늘리는가


Memory의 경제적 가치는 다음 식으로 계산할 수 있다.

추가 Memory의 경제적 가치

= GPU 시간당 매출
× 연간 시간
× 유료가동률
× Memory로 인한 처리량 증가율
× Cloud 사업자가 가져가는 매출 비중
× 추가 매출의 영업이익률
× 장비 사용기간의 현재가치

계산에는 다음과 같은 기준을 적용했다.


여기서 유료가동률 70%는 앞서 언급한 GPU 연산 유휴율 70%와 다른 개념이다.

  • 유료가동률은 고객이 GPU를 사용하며 요금을 지불하는 시간의 비율이다.

  • 연산 유휴율은 유료작업을 수행하는 도중에도 Tensor Core가 Memory를 기다리며 충분히 활용되지 못하는 비율이다.


처리량 증가분의 매출 회수율은 60%로 설정했다.

Cloud 사업자가 추가 처리량을 전부 가격으로 가져가기 어렵기 때문이다. 일부는 TOKEN 가격 인하, 더 빠른 응답속도와 고객 SLA 개선의 형태로 고객에게 돌아간다.

반면 Capacity가 부족한 Cloud 사업자는 기존 고객을 더 적은 GPU로 처리하고, 남는 GPU를 다른 고객에게 재판매할 수 있다.

Cloud 가격의 대리치로 CoreWeave의 공개가격을 사용했다.

  • H200: GPU당 시간당 6.31달러

  • B200: GPU당 시간당 8.60달러

  • GB200: GPU당 시간당 10.50달러

  • GB300: 4GPU당 시간당 61.44달러, GPU당 약 15.36달러


Rubin 가격은 공개되지 않아 GPU당 시간당 18달러를 분석 가정으로 사용했다. 실제 Hyperscaler의 장기계약 가격은 공개 On-demand 가격보다 낮을 수 있다. (CoreWeave)


H200에서 B200으로 전환할 경우


B200의 Memory 개선으로 처리량이 60% 증가한다고 가정했다.


계산 과정은 다음과 같다.

연간 추가 매출
= 8.60달러 × 8,760시간 × 70% × 60% × 60%
= 약 1.90만달러

여기에 추가 매출 영업이익률 60%와 4년 현재가치를 적용하면 GPU당 약 3.61만달러가 된다.

B200에 추가된 HBM Capacity와 Bandwidth를 확보하기 위해 GPU당 3만달러 이상의 Premium을 지불하더라도, Cloud 사업자는 4년간 발생하는 추가 영업이익으로 이를 회수할 수 있다는 의미다.


GB200에서 GB300으로 전환할 경우


GB300은 HBM Capacity 확대를 통해 더 큰 Batch와 긴 Context를 지원한다.

처리량 증가를 35%로 가정하면 다음과 같다.


GB300의 Memory 가치는 모든 워크로드에서 동일하지 않다.

짧은 Context의 소형 Model에서는 288GB의 HBM을 전부 활용하지 못할 수 있다. 반대로 긴 Context와 Reasoning, Agentic AI처럼 KV Cache가 빠르게 증가하는 환경에서는 추가 Capacity가 Batch와 TOKEN 매출로 직접 연결될 가능성이 높다.


GB300에서 Rubin으로 전환할 경우

Rubin은 HBM Capacity보다 Bandwidth 증가가 핵심이다.

HBM Bandwidth가 8TB/s에서 22TB/s로 2.75배 증가하지만, 계산에서는 Memory에 귀속되는 처리량 개선을 100%로 제한했다.



Rubin의 전체 성능은 GB200보다 최대 10배 높아질 수 있지만, 본 계산은 그중 Memory에 귀속되는 효과를 두 배로만 반영했다.

그럼에도 HBM4가 창출하는 경제적 가치는 GPU당 약 12.6만달러로 추정된다.

Rubin의 실제 Cloud 가격이 시간당 15달러에 그친다면 이 가치는 약 10.5만달러로 낮아진다. 시간당 20달러라면 약 14만달러까지 올라간다.

따라서 Rubin HBM4의 경제적 가치는 GPU당 약 10만~14만달러의 범위로 보는 것이 적절하다.


7. HBM·Server DRAM·NAND의 가치는 서로 다르다


모든 Memory가 GPU 유휴시간을 같은 정도로 줄이는 것은 아니다.

GPU 연산기와 가까울수록 TOKEN 처리량에 직접적인 영향을 주고, 더 높은 가격을 정당화할 수 있다.


HBM


HBM은 GPU Package에 직접 연결된다.

Decode 과정에서 Model Weight와 KV Cache를 Tensor Core에 공급하기 때문에, Capacity와 Bandwidth 증가는 GPU 처리량과 직접 연결될 가능성이 가장 높다.

  • Batch 확대

  • 더 큰 Model 상주

  • KV Cache 증가

  • CPU Memory Offloading 감소

  • GPU 간 통신 감소

  • TOKEN당 응답시간 단축


HBM이 가장 높은 가격결정력을 확보할 수 있는 이유다.


Server DRAM과 LPDDR


Host Memory는 HBM보다 느리지만 다음 데이터를 저장할 수 있다.

  • Cold KV Cache

  • 오래된 Context State

  • Model과 Activation

  • Prefix Cache

  • HBM에서 밀려난 데이터

  • GPU에서 곧 사용할 데이터의 Staging 영역


Rubin의 CPU Memory는 GB300 대비 GPU당 약 514GB 증가한다.

추가 Host Memory가 전체 처리량을 10% 개선한다고 가정하면 GPU당 4년 경제적 가치는 약 1.26만달러가 된다.

추가 DRAM 1GB당 가치는 다음과 같다.

1.26만달러 ÷ 514GB = 약 25달러/GB

처리량 개선 정도에 따라 가격경계도 달라진다.


Server DRAM은 HBM을 보조하지만 HBM Bandwidth를 완전히 대체하지 못한다. 따라서 HBM만큼 높은 가격 상승을 흡수하기는 어렵다.


Enterprise NAND


NAND는 정상적으로 Model이 HBM에 올라간 Steady-state Decode에서는 TOKEN을 직접 생산하지 않는다.

대신 GPU가 작업을 시작하기 전후의 대기시간을 줄인다.

  • Model Loading

  • Training Checkpoint 이동

  • Prefix Cache 저장

  • Cold KV Cache

  • Model 교체

  • Serverless 추론의 Scale-up

  • 데이터와 Model Repository


GPU당 4TB의 고성능 NAND가 전체 처리량을 3% 높인다고 가정하면 4년 경제적 가치는 약 3,800달러다.

3,800달러 ÷ 4TB = 약 950달러/TB

처리량 개선에 따른 가격경계는 다음과 같다.


NAND는 Model 전환과 Cache 재사용이 많은 환경에서 가치가 높아진다. 반면 같은 Model을 계속 실행하는 단순한 Batch Inference에서는 경제적 가치가 낮다.


8. 현재 Memory 가격은 경제적 상단에 도달했는가


HBM 계약가격은 고객과 공급업체 간의 장기계약으로 결정되기 때문에 정확한 가격이 공개되지 않는다.

공개된 Teardown과 시장자료에서는 B200의 HBM3E 비용을 GPU당 약 2,400~2,900달러 수준으로 추정한다. 일부 분석에서는 Packaging과 공급부족 Premium을 반영해 약 4,000달러까지 적용한다.

공식 계약가격이 아닌 분석용 대리치라는 점은 고려해야 한다. (Silicon Analysts)

(Silicon Analysts)


Rubin NVL72의 HBM4와 LPDDR5X, NAND를 합친 전체 Memory 비용은 Rack당 약 200만달러, GPU당 약 2.8만달러로 추정되고 있다. 이 역시 NVIDIA가 공개한 공식 BOM이 아니라 공급망 자료를 이용한 추정치다. (tomshardware.com)

Rubin의 전체 Memory 가치를 정리하면 다음과 같다.

  • HBM4 Bandwidth 개선 가치: GPU당 약 12.6만달러

  • 추가 Host Memory 가치: 약 1.26만달러

  • NAND 가치: 약 0.38만달러

  • 단순 합계: 약 14.2만달러


이 효과들은 일부 중복된다.

예를 들어 HBM이 충분하면 Host Memory Offloading의 가치가 낮아지고, Host Memory가 충분하면 NAND Cache의 추가효과도 줄어든다.

중복효과를 20~30% 할인하면 Rubin 전체 Memory System의 경제적 가치는 GPU당 약 10만~11만달러로 추정된다.

NVL72 Rack 기준으로는 약 720만~800만달러다.

현재 Memory 비용 추정치가 GPU당 약 2.8만달러라면, 전체 Memory 가격이 약 3~4배가 되기 전까지는 추가 TOKEN이 창출하는 영업이익으로 비용을 회수할 수 있다는 계산이다.

TrendForce도 일반 DDR5의 수익성이 HBM에 근접하거나 일부 조건에서 추월하면서 Memory 공급업체가 HBM 가격을 더 높여야 할 경제적 유인이 커지고 있다고 분석했다. HBM 생산은 일반 DRAM Wafer를 사용하기 때문에 HBM 가격이 충분히 높지 않으면 공급업체가 일반 DRAM 생산을 선호할 수 있다. (trendforce.com)

Cloud 사업자가 높은 Memory 가격을 수용하는 이유는 Memory 자체가 저렴해서가 아니라, Memory 부족으로 더 비싼 GPU가 놀면서 발생하는 손실이 더 크기 때문이다.


9. 최종 적정가격 경계


아래 수치는 Memory 업체의 실제 계약가격 전망이 아니다.

추가 Memory가 GPU 유휴시간을 줄여 만들어내는 Cloud 사업자의 매출과 영업이익을 역산한 경제적 경계다.

가격 상승 가능성은 두 단계로 나눠 봐야 한다.

이론적 가격 상승 범위


추가 Memory가 창출하는 경제적 가치를 Memory 공급업체가 모두 가격으로 가져간다고 가정한 최대 상단이다.

현실적 가격 상승 허용범위


NVIDIA의 GPU 가격 인상, TOKEN 가격 하락, 고객에게 이전되는 성능개선 효과, Software 최적화 실패와 낮은 가동률을 함께 반영한 범위다.

Memory 가격 상승 허용범위



표에서 현재 대비 3배는 가격이 기존 가격의 세 배가 된다는 의미다. 상승률로 표현하면 약 200% 상승에 해당한다.


이론적 상단과 현실적 상단이 다른 이유


B200 HBM3E의 경제적 가치는 GPU당 약 3.6만달러로 계산된다.

현재 HBM3E 비용을 2,400~4,000달러로 가정하면 이론적으로는 현재 가격의 약 9~15배까지 지불할 수 있다.

그러나 HBM 공급업체가 이 가치를 전부 가져갈 수는 없다.

Blackwell의 높은 TOKEN 생산성은 HBM뿐 아니라 다음 요소가 함께 만든다.

  • Tensor Core

  • FP4

  • NVLink

  • Network

  • Software Stack

  • Cooling

  • Rack 설계


NVIDIA도 GPU와 Rack 가격을 올릴 수 있고, Cloud 사업자는 성능개선 일부를 더 낮은 TOKEN 가격이나 더 빠른 응답속도로 고객에게 돌려줘야 한다.

따라서 B200 HBM3E의 이론적 상승 여력은 9~15배지만, 현실적으로 Cloud 사업자가 안정적으로 감당할 수 있는 범위는 약 3~5배로 보는 편이 적절하다.

GB300은 이론적으로 약 8~13배까지 가능하다.

다만 GB300의 가치는 Bandwidth보다 HBM Capacity 확대에서 발생한다. 짧은 Context에서는 추가 Memory가 남을 수 있으므로 현실적인 가격 상승 허용범위는 약 3~4배로 낮아진다.

Rubin HBM4의 이론적 가격 여력은 가장 크다.

HBM Bandwidth가 8TB/s에서 22TB/s로 증가하면서 Memory-bound Decode의 TOKEN 처리량을 직접 높일 수 있기 때문이다. GPU당 HBM4 비용을 8,000~1.2만달러로 가정하면, 경제적 가치 10만~14만달러는 현재 가격의 약 8~18배에 해당한다.

그럼에도 Rubin의 성능에는 GPU 연산, NVLink, Vera CPU와 Software 개선이 함께 반영된다.

이를 고려하면 Rubin HBM4의 현실적인 가격 상승 허용범위는 현재 대비 약 3~5배로 추정된다.

반면 Server DRAM과 NAND는 GPU 연산기에 직접 데이터를 공급하지 않는다.

HBM을 보조하고 GPU 대기시간을 줄일 수 있지만, Steady-state Decode의 핵심 병목을 완전히 제거할 수 없기 때문에 가격 상승을 흡수할 수 있는 범위도 상대적으로 낮다.


핵심 결론


Amazon의 실적과 어닝콜은 AI 데이터센터 투자의 경제성이 이미 확인되고 있음을 보여준다.

AWS 매출과 영업이익은 각각 37%, 64% 증가했고, 서버와 Network 장비의 투자비는 평균 3년 미만에 회수된다. 서버는 최소 5~6년 동안 사용되며, AI Capacity 계약도 대부분 5년 이상이다. (Amazon)

Cloud 사업자는 이미 가동 중인 AI 서버에서 충분한 현금흐름을 창출하고 있다.

이제 경쟁의 중심은 GPU를 얼마나 많이 구매했는지보다, 그 GPU로 얼마나 많은 유료 TOKEN을 생산하는지로 이동하고 있다.

이 과정에서 HBM은 단순한 원가 항목에 머물지 않는다.

HBM은 이미 구매한 GPU와 데이터센터의 유휴시간을 줄여 TOKEN 생산량을 늘리는 생산설비다.

H100에서 H200으로 넘어갈 때 HBM 용량은 76%, Bandwidth는 43% 증가했고, Llama 2 70B 처리량은 최대 90% 늘었다.

Blackwell과 Rubin에서는 GPU 연산성능이 더 빠르게 높아진다. 따라서 Memory가 충분하지 않을 때 놀게 되는 Tensor Core의 기회비용도 함께 커진다.

Rubin HBM4는 GB300보다 Bandwidth가 2.75배 높다. 전체 성능개선 가운데 Memory에 귀속되는 처리량을 두 배로 제한해도, GPU당 약 10만~14만달러의 경제적 가치가 발생한다.

결론은 분명하다.

HBM은 가격이 크게 상승해도 Cloud 사업자의 경제성이 유지될 가능성이 높다.


HBM의 적정가격 상단은 과거 Commodity DRAM 가격이나 제조원가만으로 결정되지 않는다.

다음 세 가지가 실제 가격경계를 결정한다.

  1. 추가 HBM이 얼마나 많은 GPU 대기시간을 줄이는가

  2. 회복된 GPU가 얼마나 많은 유료 TOKEN을 생산하는가

  3. 추가 TOKEN이 Cloud 사업자에게 얼마나 많은 영업이익을 남기는가


기준 시나리오에서 B200·GB300·Rubin HBM은 현재 대비 약 3~5배까지 가격이 높아져도 Cloud 사업자의 장기 경제성이 유지될 수 있다.

Server DRAM과 NAND의 가격 상승 여력은 HBM보다 낮다. GPU Tensor Core에 직접 데이터를 공급하는 정도가 낮기 때문이다.

Memory의 가격결정력은 다음 순서로 정리할 수 있다.

HBM4 > HBM3E > Server DRAM·LPDDR > Enterprise NAND


다만 최종적으로 봐야 할 지표는 HBM 가격 하나가 아니다.

NVIDIA가 GPU와 Rack 가격을 동시에 크게 올리고, TOKEN 가격은 빠르게 하락하며, Cloud의 유료가동률까지 낮아진다면 Memory의 경제적 가치도 줄어든다.

따라서 실질적인 가격경계는 다음 지점에서 형성된다.

GPU와 Memory를 포함한 Rack 전체 가격 상승률이 동일 전력당 유료 TOKEN 생산량 증가율을 넘어서는 시점


그 이전까지 Cloud 사업자에게 더 비싼 Memory는 비용 부담인 동시에 더 많은 매출과 이익을 생산하는 자산이다.

현재의 AI Cloud 투자회수기간과 차세대 GPU의 TOKEN 생산성 개선을 함께 고려하면, 적어도 HBM 가격은 시장의 기존 예상보다 훨씬 높은 수준까지 상승할 경제적 근거를 확보하고 있다.

주: 본 추정치는 본문에서 산출한 메모리 프리미엄의 적정 상방 가격을 SKH의 기존 출하량과 비용구조에 적용한 이론적 연간 실적 상단임.

정상적인 컨센서스 전망이 아닌 가격 민감도에 따른 기계적 Ceiling 추정치로 해석해야 함.
즉, AI Cloud 경제성이 훼손되기 전까지의 이론적·현실적 Ceiling으로 해석

주: 본 추정치는 본문에서 산출한 메모리 프리미엄의 적정 상방 가격을 SEC의 기존 출하량과 비용구조에 적용한 이론적 연간 실적 상단임.

정상적인 컨센서스 전망이 아닌 가격 민감도에 따른 기계적 Ceiling 추정치로 해석해야 함.
즉, AI Cloud 경제성이 훼손되기 전까지의 이론적·현실적 Ceiling으로 해석

=끝

2026년 7월 27일 월요일

생각정리 321 (* China DUV, 메모리 시나리오 테스트 )

어제 장을 마친 뒤 집으로 돌아와 아내와 저녁을 먹고 산책을 했다.

집에 돌아온 뒤 잠깐 잠이 들었다가 눈을 떴는데, 중국의 DUV 노광장비 자립화와 관련된 뉴스를 접하게 됐다.

기사를 읽는 순간 머리가 띵하게 울렸다. 중국의 반도체 장비 자립화가 예상보다 빠르게 진행될 수 있다는 생각에 조금씩 스트레스가 밀려왔다.

다만 뉴스의 제목과 첫인상만으로는 실제 파급효과를 판단하기 어려웠다.

중국산 DUV가 어느 정도의 성능과 양산 안정성을 확보했는지, CXMT와 YMTC의 생산능력 확대로 얼마나 연결될 수 있는지, 중국의 메모리 내수 자립이 삼성전자·SK하이닉스·마이크론의 실적에 어떤 영향을 줄지 하나씩 수치로 확인해 봐야 했다.

내일 회사에 출근하면 여러 시나리오를 세우고 직접 숫자를 넣어봐야 이번 뉴스의 대략적인 영향력을 가늠할 수 있겠다고 생각했다.

그렇다고 밤새 자료를 들여다보는 것은 좋은 선택이 아니었다.

잠을 제대로 자지 못한 상태로 출근하면 뉴스에서 받은 불안감에 휘둘려 상황을 과도하게 해석하거나 잘못된 판단을 내릴 가능성이 높았다. 그래서 마음에 걸리는 부분은 잠시 내려놓고, 억지로라도 일찍 잠을 청했다.

아침에 눈을 떴지만 푹 잔 느낌은 아니었다. 여전히 머리가 조금 무거웠다.

그래도 가능한 한 빨리 회사로 출근했다. 전날 밤 머릿속에 정리해 둔 질문과 가정을 하나씩 숫자로 옮기면서 이번 리서치 기록을 남겨본다.

21세기경제보도(21世纪经济报道) 기자: 자오윈판(赵云帆) 2026년 5월 20일


China Begins Mass Production of Homegrown DUV Chip Tools


AI 메모리 수요 확대와 중국 자립화


End Market별 노출을 반영한 삼성전자·SK하이닉스·마이크론 시나리오 분석


핵심 결론


중국 메모리 자립화 위험은 중국이 글로벌 DRAM과 NAND 수요의 약 4분의 1을 차지한다는 사실만으로 판단하기 어렵다.

현재 중국계 고객 비중은 모바일·자동차·통신장비에서 30~40%대로 높다. 반면 HBM과 고성능 enterprise SSD에서는 매우 낮다. 문제는 2030년까지 메모리 시장의 성장축이 스마트폰과 PC에서 HBM·AI Host DDR·SOCAMM2·AI eSSD·CMX로 이동한다는 점이다.

따라서 중국 자립화의 충격은 두 단계로 나뉜다.

  • 범용 DRAM·NAND 자립: 삼성전자 중심의 중국 매출 감소

  • HBM·AI 서버 DRAM·eSSD 진입: IDM 3사의 가격과 초과이익 훼손


세 시나리오 모두 AI 확산에 따른 글로벌 메모리 수요 증가는 동일하게 반영했다. 차이는 늘어나는 수요를 IDM 3사와 중국 업체가 어떻게 나누는지에 있다.

2030년 시장 컨센서스 대비 영업이익 변화는 다음과 같이 추정했다.

  • Bull: 삼성전자 +8%, SK하이닉스 +10%, 마이크론 +12%

  • Base: 삼성전자 -8%, SK하이닉스 -8%, 마이크론 -7%

  • Bear: 삼성전자 -22%, SK하이닉스 -21%, 마이크론 -23%





1. 중국 메모리 수요는 어디에서 발생하는가


이번 분석에서 중국 수요는 중국에서 조립된 전자제품이 아니라, 중국에 본사를 둔 스마트폰·PC·서버·클라우드·자동차·통신장비 업체의 글로벌 메모리 구매량으로 정의했다.

중국에서 조립되는 아이폰용 메모리는 애플 수요로 분류한다. 반대로 샤오미가 유럽이나 인도에서 판매하는 스마트폰용 메모리는 중국계 고객 수요에 포함한다.

국가와 End Market을 교차한 공식 메모리 수요 데이터는 공개되지 않는다. 아래 중국 비중은 스마트폰·PC 출하량, 클라우드 투자, 자동차 판매량, 통신장비 점유율과 기기당 메모리 탑재량을 결합한 모델 추정치다.

중국계 고객은 글로벌 DRAM 매출의 약 23~27%, NAND 매출의 약 23~28%를 차지하는 것으로 추정된다. 다만 제품별 노출은 크게 다르다.


2. DRAM End Market별 중국 비중


Mobile LPDDR


중국계 스마트폰 업체에는 Xiaomi·OPPO·vivo뿐 아니라 Huawei·Honor·Transsion·Lenovo·realme가 포함된다.

2026년 2분기 Xiaomi·OPPO·vivo의 글로벌 스마트폰 점유율만 합산해도 약 29%다. 여기에 Huawei·Honor·Transsion 등 기타 중국계 브랜드를 더하면 출하량 기준 중국계 비중은 40%를 넘어설 가능성이 높다. 다만 애플과 삼성전자 프리미엄 모델의 기기당 메모리 용량과 구매가격이 높다는 점을 반영해 중국의 모바일 메모리 매출 비중은 **36~42%**로 추정했다. (Chartle)


PC·Client


2026년 2분기 Lenovo는 글로벌 PC 출하량의 약 25%를 차지했다. Huawei와 중국계 중소 OEM을 더하면 중국계 고객의 PC DRAM·client SSD 수요 비중은 **25~28%**로 추정된다. PC용 DDR와 SSD는 제품 표준화 수준이 높아 중국산 메모리의 내수 대체와 해외 수출이 비교적 빠르게 진행될 수 있는 시장이다. (Omdia)


Server·Cloud


2025년 4분기 중국 본토의 클라우드 인프라 지출은 147억달러였다. 같은 기간 글로벌 클라우드 인프라 지출은 1,109억달러로, 중국 비중은 약 13%였다. 기업용 온프레미스 서버와 통신사 서버를 포함한 중국계 server DRAM 수요 비중은 **11~15%**로 추정된다. (Omdia)


HBM


현재 중국의 HBM 수요는 첨단 AI 가속기와 HBM 수출통제의 영향을 받는다. IDM 3사가 실제로 접근할 수 있는 중국 HBM 시장은 글로벌 수요의 약 **1~3%**로 추정된다.

수출통제가 없다면 중국의 잠재 HBM 수요는 5~8%까지 높아질 수 있다. 따라서 중국 HBM 자립화는 현재 매출을 빼앗는 문제보다, 미래 성장기회를 중국 업체에 넘기는 위험에 가깝다.


Automotive


2025년 중국 자동차 판매량은 약 3,440만대로 글로벌 판매량 9,980만대의 **34.5%**를 차지했다. 중국은 전기차·ADAS·스마트 콕핏 채택률이 높기 때문에 차량당 메모리 탑재량도 글로벌 평균보다 높을 가능성이 크다. 이를 반영한 자동차용 DRAM과 NAND의 중국 수요 비중은 **38~43%**로 추정된다. (세계자동차제조협회)


Networking·Telecom


2025년 상반기 글로벌 통신장비 매출에서 Huawei는 31%, ZTE는 10%를 차지했다. 두 업체만 합산해도 41%다. 통신장비와 네트워크용 DRAM·NAND는 모바일과 함께 중국 내수 대체 위험이 높은 영역이다. (Telecom Lead)

중국의 직접적인 DRAM 위험은 모바일·자동차·통신장비에 집중돼 있다. 반면 2030년까지 가장 빠르게 커지는 HBM과 미국계 CSP 서버 시장에서는 현재 중국 비중이 낮다.




3. NAND End Market별 중국 비중


Mobile UFS·eMMC


스마트폰 업체 구성이 모바일 DRAM과 동일하기 때문에 중국계 고객은 모바일 NAND 수요의 약 **36~42%**를 차지하는 것으로 추정된다.

YMTC가 이미 모바일·소비자용 NAND에서 점유율을 높이고 있어 삼성전자와 SK하이닉스가 가장 먼저 물량을 잃을 수 있는 시장이다.


Client SSD


Lenovo를 포함한 중국계 PC 업체의 글로벌 점유율을 반영하면 client SSD 수요의 중국 비중은 **25~28%**로 추정된다.

Client SSD는 컨트롤러와 펌웨어의 장벽이 enterprise SSD보다 낮다. 중국산 NAND가 중국 내수에서 해외 시장으로 이동할 때 가장 먼저 가격경쟁이 발생할 수 있다.


Consumer·Removable


USB, 메모리카드, 저가형 SSD 등 소비자용 NAND는 중국 제조·유통업체 비중이 높다. 중국계 수요 비중은 35~45%, 현재 자급률은 50% 이상으로 추정된다.


Enterprise SSD


2026년 1분기 enterprise SSD는 전체 NAND 매출의 43%를 차지했다. 그러나 중국의 글로벌 클라우드 투자 비중은 약 13%에 불과하고, 고성능 eSSD는 컨트롤러·펌웨어·내구성·지연시간·CSP 인증이 필요하다. 따라서 중국계 enterprise SSD 수요는 글로벌 시장의 10~14%, 중국 내부 자급률은 5~10% 수준으로 추정했다. (Counterpoint Research)

중국 NAND 자립률이 상승해도 처음 영향을 받는 시장은 모바일·client·소비자용이다. AI 데이터센터용 eSSD로 충격이 확대되려면 YMTC의 bit 생산량 증가뿐 아니라 SSD 시스템과 고객 인증까지 확보돼야 한다.




4. 중국 수요와 현재 중국 업체 공급능력의 차이


2026년 1분기 CXMT의 글로벌 DRAM 매출 점유율은 8%, YMTC의 NAND 점유율은 13%였다. 같은 기준으로 중국계 고객은 글로벌 DRAM 수요의 약 25~29%, NAND 수요의 약 28~33%를 차지하는 것으로 추정된다. (Counterpoint Research)

단순하게 보면 CXMT는 현재 중국 DRAM 수요의 약 30% 안팎, YMTC는 중국 NAND 수요의 40% 안팎을 공급할 수 있는 규모다. 실제 자급률은 해외 판매량, 제품 믹스와 재고를 고려하면 달라질 수 있다.

현재 글로벌 메모리 재고는 극단적으로 낮아져있는 상황으로 메모리 IDM 단기실적에는 큰 영향이 없을 것
Citi Research 


HBM은 중국 수요 자체가 수출통제로 제한돼 있고, 상업적 글로벌 공급 점유율도 아직 미미하다.

따라서 중국이 2030년까지 내수 100%를 대체하려면 CXMT와 YMTC가 현재 글로벌 점유율을 단순히 몇 퍼센트 높이는 수준을 넘어야 한다.

특히 DRAM에서는 현재 CXMT 생산규모를 두 배 이상 확대하면서 DDR5·LPDDR5X·서버 DRAM 수율도 함께 확보해야 한다.




5. 2030년에는 DRAM 수요의 중심이 바뀐다


이전 글의 모델에서는 글로벌 DRAM bit 수요가 2025년 약 39EB에서 2030년 약 118EB로 세 배 증가한다.

생각정리  320 (* CXMT, DRAM, LPDDR, HBM)

2030년 HBM 수요는 27.1EB, AI Host DDR와 SOCAMM2는 35.5EB로 추정된다. 두 시장을 합하면 AI 데이터센터가 전체 DRAM 수요의 약 53%를 차지한다.

모바일 LPDDR도 12.5EB에서 17.5EB로 약 40% 증가한다. 다만 전체 시장이 더 빠르게 성장하기 때문에 모바일 비중은 32%에서 약 15%로 낮아진다.

이 변화는 중국 리스크의 성격을 바꾼다.

현재 중국 노출이 높은 모바일·PC 시장의 절대 수요는 증가한다. 그러나 IDM 3사의 이익을 결정하는 핵심 시장은 점차 HBM과 AI 서버 DRAM으로 이동한다.

중국이 범용 DRAM을 완전히 자립하더라도 HBM과 SOCAMM2에 진입하지 못하면 IDM 3사의 핵심 이익원은 상당 부분 유지될 수 있다.




6. NAND도 AI 데이터센터 중심으로 재편된다


이전 기본 모델에서는 AI 데이터센터용 eSSD 수요가 2025년 약 24EB에서 2030년 약 704EB로 증가한다.

생각정리  319 (* NAND, eSSD)

2030년 AI eSSD 수요는 2025년 전체 enterprise SSD 시장 244EB의 약 2.9배에 해당한다. 전체 eSSD 시장에서 AI 수요가 차지하는 비중도 10%에서 약 58%로 상승한다.

CMX 수요는 2030년 약 185.5EB로 추정된다. 이는 2025년 전체 eSSD 시장의 약 76%다. 

중국 NAND 증산은 소비자용 NAND 가격에는 직접적인 압력을 줄 수 있다.

그러나 AI eSSD 수요가 모델대로 증가하면 범용 NAND 공급과 데이터센터 인증제품 공급은 서로 다른 사이클을 보일 가능성이 크다.

Bear 시나리오에서도 NAND 시장 자체가 축소되는 것이 아니라, YMTC와 중국 SSD 업체가 증가하는 AI 수요의 일부를 가져가는 구조로 설정했다.




7. 중국산 DUV가 의미하는 범위


최근 보도된 중국산 침지 DUV는 소량 장비 제작과 고객사 검증 단계로 보는 것이 적절하다.

장비의 장기 가동률, 오버레이 안정성, 시간당 처리량과 실제 웨이퍼 수율이 공개적으로 검증되지 않았다. 따라서 Bear 시나리오에서 중국산 DUV가 양산에 안정적으로 투입된다는 가정은 현재 확인된 수준보다 강한 스트레스 조건이다.

DUV 내재화만으로 메모리 공급망이 완성되지는 않는다.

  • 식각·증착·세정·CMP

  • 계측·검사

  • EDA와 공정 제어

  • 포토레지스트와 소재

  • HBM TSV·적층·테스트

  • SSD 컨트롤러와 펌웨어

  • 고객사 장기 인증


이 공정들이 함께 안정화돼야 중국산 메모리가 내수 대체를 넘어 글로벌 시장에서 가격경쟁을 할 수 있다.


8. 미국의 블랙리스트 변수


2026년 6월 기준 CXMT는 미국 국방부의 Section 1260H 중국 군사기업 명단에 포함돼 있다. 다만 1260H는 BIS Entity List와 동일한 수출통제가 아니다. (U.S. Department of War)

YMTC는 2022년 BIS Entity List에 추가됐다. 미국 의회에서는 CXMT의 Entity List 추가, 중국산 메모리의 미국 공급망 진입 제한과 동맹국 장비통제 강화를 요구하는 움직임이 이어지고 있다. (Select Committee on the CCP)

정책 변수는 세 시나리오를 나누는 핵심 기준이다.

  • Bull: CXMT 추가 제재와 동맹국 공조

  • Base: 추가 제재 없이 현행 통제 유지

  • Bear: 추가 제재가 없고 중국 장비 내재화가 예상보다 빠르게 진행


9. Bull·Base·Bear 시나리오


세 시나리오는 모두 다음의 AI 수요를 공통으로 반영한다.

  • 2030년 DRAM bit 수요 118EB

  • AI 관련 DRAM 비중 53%

  • HBM 27.1EB

  • AI Host DDR·SOCAMM2 35.5EB

  • AI 데이터센터 eSSD 704EB

  • CMX 185.5EB


시나리오 차이는 AI 수요의 강도가 아니라 중국이 해당 수요를 얼마나 공급할 수 있는가에서 발생한다.

Bull


CXMT가 Entity List에 추가되고 미국의 규제가 일본·한국·네덜란드 장비와 서비스까지 확대된다.

중국 업체는 모바일·소비자용 메모리에서 자립률을 높이지만 HBM·SOCAMM2·enterprise SSD 진입은 지연된다.

Base


CXMT는 추가 블랙리스트에 등재되지 않는다.

중국산 DUV와 일부 공정장비가 상용화되며 범용 DRAM과 NAND 자급률이 높아진다. 중국산 제품은 동남아·중동·중남미에 일부 수출되지만 HBM과 고성능 eSSD 격차는 유지된다.

Bear


AI 수요는 Bull·Base와 동일하게 증가한다.

그 위에 중국산 DUV가 양산라인에서 안정화되고, CXMT와 YMTC가 중국 내수의 대부분을 대체한다. HBM과 AI 서버 DRAM, enterprise SSD에서도 중국 수요의 상당 부분을 공급한다.

해외 수출은 범용 DRAM·NAND 중심으로 확대되며 기존 IDM 3사보다 10~20% 낮은 가격을 제시한다. 다만 중국산 HBM이 미국 CSP와 서방 가속기 시장을 전면 장악하는 극단적인 가정은 제외했다.

Bear에서도 HBM과 enterprise SSD의 중국 자급률은 100%로 설정하지 않았다.

중국이 범용 제품에서는 내수 자립을 완성하지만, 고부가 제품에서는 중국 AI 생태계의 일부만 충족하는 수준이다.




10. 시장 컨센서스 기준선


2026~2028년은 2026년 7월 27일 기준 공개 시장 컨센서스를 사용했다.

  • 삼성전자 2026~2028년 매출: 730.8조원, 940.4조원, 1,012.5조원

  • 삼성전자 영업이익: 387.7조원, 538.5조원, 547.0조원

  • SK하이닉스 매출: 358.3조원, 534.0조원, 587.9조원

  • SK하이닉스 영업이익: 276.8조원, 418.6조원, 436.2조원

  • 마이크론 FY2026~FY2028 매출: 1,297.8억달러, 2,388.2억달러, 2,592.2억달러

  • 마이크론 영업이익: 980.4억달러, 1,966.6억달러, 2,066.6억달러 (MarketScreener)


2029~2030년은 2028년 컨센서스에서 매출 성장률과 영업이익률을 점진적으로 정상화한 모델 추정치다.

2030년 기준선은 다음과 같다.


삼성전자는 연결 실적 기준이다. 중국 자립화 충격은 메모리 사업에 적용한 뒤 연결 실적으로 환산했다.


11. 2030년 시나리오 결과


매출 영향


Bull에서는 중국산 메모리의 글로벌 공급망 진입이 제한되면서 HBM·AI 서버 DRAM·eSSD의 가격과 점유율이 컨센서스보다 높아진다.

Base에서는 중국의 모바일·PC·소비자용 메모리 대체와 일부 수출이 발생하지만, AI 메모리 수요가 공급 증가분을 대부분 흡수한다.

Bear에서는 중국 내수 상실과 비중국 범용 메모리 가격 하락이 겹친다. 다만 AI 데이터센터 수요가 강하기 때문에 매출 감소폭은 10% 안팎에 머문다.

영업이익 영향


영업이익 충격은 매출보다 크다.

중국에서 판매하지 못한 물량이 비중국 시장으로 이동하면 기존 판매물량의 ASP까지 낮아진다. 팹 감가상각비와 연구개발비는 단기간에 줄이기 어려워 가격 하락분의 상당 부분이 영업이익 감소로 연결된다.




12. 삼성전자


삼성전자는 중국 모바일·PC·자동차와 NAND 노출이 가장 넓다.

Bull에서는 중국산 메모리의 미국·동맹국 공급망 진입이 제한되면서 HBM·서버 DRAM·enterprise SSD의 가격이 보호된다. 2030년 연결 영업이익은 617.2조원으로 기준선보다 8% 높아진다.

Base에서는 LPDDR·UFS·client SSD 중국 매출이 감소하지만 AI 메모리 증가가 상당 부분 상쇄한다. 2030년 영업이익은 525.8조원으로 기준선보다 8% 낮다.

Bear에서는 중국 내수 상실과 범용 DRAM·NAND ASP 하락이 동시에 발생한다. 2030년 영업이익은 445.8조원으로 컨센서스보다 22% 낮아진다. 그럼에도 2026년 영업이익 387.7조원보다는 약 15% 높다.

삼성전자의 가장 큰 위험은 HBM 경쟁보다 중국 모바일·PC·자동차와 NAND 노출의 합산이다.

다만 삼성전자는 완제품과 디스플레이·가전·하만을 보유해 연결 매출 충격은 메모리 사업 자체보다 완화된다.




13. SK하이닉스


SK하이닉스는 Base까지 가장 높은 방어력을 보인다.

중국이 범용 DDR·LPDDR·NAND에서 자립률을 높이더라도 HBM과 AI 서버 DRAM의 공급자 수가 제한돼 있기 때문이다.

Bull에서는 HBM과 AI Host Memory의 희소성 프리미엄이 강화되면서 2030년 영업이익이 501.2조원으로 기준선보다 10% 증가한다.

Base에서는 419.2조원으로 기준선보다 8% 낮지만, HBM 믹스가 범용 제품의 가격 하락을 방어한다.

Bear에서는 중국산 HBM이 중국 AI 가속기에 탑재되고, 서버 DRAM과 enterprise SSD도 일부 중국산으로 전환된다. 영업이익은 359.9조원으로 기준선보다 21% 낮아진다. 다만 2026년보다 약 30% 높은 수준이다.

SK하이닉스의 중국 리스크는 범용 메모리보다 중국 HBM의 실제 양산 여부에 좌우된다.

CXMT 또는 중국 후공정 업체가 HBM을 생산하더라도 중국 AI 가속기에 대량 탑재되지 못하면 SK하이닉스의 핵심 이익은 크게 훼손되지 않는다.




14. 마이크론


마이크론은 중국의 기존 보안 규제 때문에 중국 직접 매출 노출이 삼성전자와 SK하이닉스보다 낮다.

Bull에서는 미국 내 유일한 대형 메모리 IDM이라는 정책적 지위가 가장 큰 강점으로 작용한다. 2030년 영업이익은 2,382억달러로 기준선보다 12% 높아진다.

Base에서는 중국 내수 상실보다 중국산 DRAM·NAND의 해외 수출에 따른 ASP 하락이 주요 위험이다. 2030년 영업이익은 1,978억달러로 기준선보다 7% 낮다.

Bear에서는 미국 시장이 보호되더라도 중국산 제품이 비미국 시장의 계약가격을 낮춘다. 영업이익은 1,638억달러로 기준선보다 23% 감소한다. 그래도 FY2026 영업이익 980억달러보다 약 67% 높다.

마이크론은 중국 고객 노출보다 글로벌 ASP 민감도가 더 중요하다.

중국산 제품이 미국에 직접 판매되지 않더라도 해외 고객이 중국산 가격을 협상 기준으로 사용하면 미국 고객 가격에도 간접적인 하방 압력이 발생할 수 있다.




15. 2027~2030년 누적 이익 영향


연간 실적보다 누적 영업이익을 보면 중국 자립화가 장기 기업가치에 미치는 영향이 더 분명해진다.

2027~2030년 누적 영업이익은 기준선 대비 다음과 같이 변한다.

  • 삼성전자: Bull +5.6%, Base -4.3%, Bear -11.4%

  • SK하이닉스: Bull +6.7%, Base -4.0%, Bear -10.1%

  • 마이크론: Bull +7.8%, Base -3.4%, Bear -11.3%


Bear에서도 누적 이익이 절반으로 감소하지 않는 이유는 AI 메모리 수요가 모든 시나리오에서 동일하게 증가하기 때문이다.

중국 공급은 늘어나는 시장을 붕괴시키기보다, IDM 3사가 가져갈 수 있었던 매출과 희소성 프리미엄의 일부를 가져간다.




16. End Market별 IDM 3사 위험도


삼성전자는 중국 내수 대체에 가장 취약하다.

SK하이닉스는 중국 업체가 HBM에 진입하기 전까지 가장 방어적이다.

마이크론은 중국 직접 노출은 작지만 중국산 메모리의 해외 수출과 글로벌 가격 하락에 민감하다.


최종 판단


중국계 고객은 현재 글로벌 DRAM과 NAND 수요의 약 4분의 1을 차지한다.

그러나 이 수요는 모바일·PC·자동차·통신장비에 집중돼 있다. 2030년 가장 빠르게 성장할 HBM·SOCAMM2·AI Host DDR·enterprise SSD에서는 중국의 현재 공급능력이 낮다.

따라서 중국이 범용 DRAM과 NAND를 자립하는 것만으로 IDM 3사의 장기 성장성이 사라지지는 않는다.

AI 확산에 따른 메모리 수요가 전망대로 증가한다면 Bear 시나리오에서도 2030년 절대 영업이익은 2026년보다 높다.

  • 삼성전자: 387.7조원 → 445.8조원

  • SK하이닉스: 276.8조원 → 359.9조원

  • 마이크론: 980억달러 → 1,638억달러


다만 시장 컨센서스와 비교하면 20% 이상의 이익이 훼손된다.

중국 리스크는 메모리 수요 붕괴가 아니라 IDM 3사가 독점적으로 누릴 것으로 예상됐던 AI 메모리 성장과 희소성 프리미엄을 중국과 나누게 되는 위험이다.

향후 확인해야 할 지표는 다음 여섯 가지로 압축된다.

  1. 중국산 침지 DUV의 장기 가동률과 웨이퍼당 비용

  2. CXMT의 DDR5·LPDDR5X와 서버 DRAM 수율

  3. 중국산 HBM의 실제 AI 가속기 탑재량

  4. YMTC 기반 enterprise SSD의 CSP 인증

  5. 중국산 메모리의 해외 판매가격과 수출지역

  6. 중국 공급이 글로벌 계약가격에 미치는 영향


이 가운데 HBM과 enterprise SSD의 대량 고객 인증이 확인되기 전까지 중국 자립화는 IDM 3사의 성장을 제거하는 변수보다, 모바일·PC·범용 NAND 사업의 마진을 낮추는 변수로 해석하는 편이 적절하다.

#글을 마치며


중국산 침지 DUV 개발이 실제로 진전되고 있을 가능성까지 부정할 필요는 없다.

중국 DUV 및 EUV 포토리소그래피 기술 발전 전망

다만 최근 두 기사는 제조사, 출하시점, 생산 규모와 성능 지표가 서로 충돌하고 있으며, 장비 제조사와 고객사의 공식 확인도 없다. 따라서 기술의 존재 여부보다 기사에 포함된 세부 정보의 신뢰도가 낮다는 점이 더 큰 리스크다.










특히 CXMT와 YMTC의 상장을 전후해 중국 반도체 산업의 기술 자립 기대를 높이고 기업가치를 부각하려는 이해관계가 커질 수 있다. 이 과정에서 초기 투자자와 기존 주주의 엑시트 및 차익 실현에 유리한 분위기를 만들기 위해, 충분한 사실 검증을 거치지 않은 기술 기사가 의도적으로 확산됐을 가능성도 배제하기 어렵다.

결국 이번 보도는 중국산 DUV의 기술적 진전을 확인해 준 최종 증거라기보다, 상장과 자본 회수 국면에서 반복될 수 있는 정보 신뢰도 리스크를 보여준 사례로 보는 편이 적절하다.


China trials its first advanced tools for AI chipmaking 


China's largest chipmaker testing first homegrown immersion DUV litho tool


글을 정리하면서 들었던 생각은 중국의 DUV 자립화와 내재화 수준을 계속 추적하는 것보다, AI 확산에 따른 메모리 반도체 수요를 점검하는 편이 더 생산적일 수 있지 않을까 했다.

중국 장비의 실제 성능과 양산 상황은 외부에서 확인하기 어렵고, 관련 기사 역시 이해관계가 얽혀 있어 그대로 신뢰하기 힘들다. 반면 AI 인프라 투자와 서버 출하량, HBM·DRAM·NAND 수요는 비교적 구체적인 데이터로 추적할 수 있다.

결국 검증하기 어려운 중국 DUV 관련 보도에 과도하게 반응하기보다, 실제 실적과 산업 수급으로 연결되는 AI 메모리 수요의 변화를 지속적으로 확인하는 것이 더 중요하지 않을까 한다.

=끝