레이블이 반도체메모리인 게시물을 표시합니다. 모든 게시물 표시
레이블이 반도체메모리인 게시물을 표시합니다. 모든 게시물 표시

2026년 9월 9일 수요일

생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)

지난주부터 Astra를 사용해 이것저것 시험해보고 있다.

처음에는 “와, 개쩐다”는 생각뿐이었다. 사람이 하던 것처럼 자료를 찾고, 문서를 읽고, 엑셀을 수정하며 결과까지 만들어내는 모습을 보면서 가능한 활용법을 하나씩 시험해봤다.

그러다 오늘 아침이 되어서야 Credit이 눈 녹듯 사라지고 있다는 사실을 뒤늦게 깨달았다.

Astra는 일반 Chatbot 형태의 이전 모델보다 Token당 단가가 높을 뿐 아니라, 하나의 업무를 처리하는 과정에서 훨씬 많은 Token을 사용한다. 자료를 읽고 끝나는 것이 아니라 계획을 세우고, 도구를 사용하고, 결과를 확인하고, 문제가 생기면 다시 시도하기 때문이다.

개인적인 Credit 사용 기반 report 


특히 9월 8~10일 3일간 XXX크레딧, 전체 사용량의 74.1%가 집중됐습니다. 최근 여러 기업의 긴 컨퍼런스콜 원문과 대형 엑셀 어닝모델을 연속해서 처리한 영향으로 보입니다.

더 중요한 부분은 토큰 구성입니다.

  • 캐시된 입력: xxxM tokens, 전체 토큰의 93.2%
  • 신규 입력: xxM
  • 출력: xxxM

즉, 답변을 길게 써서라기보다 긴 대화 문맥·첨부파일·기존 리서치 자료가 매번 모델에 다시 투입되는 구조가 크레딧 증가의 주된 원인

 - From credit report 


잠깐....

텍스트로 된 Earnings Call을 정리하고 몇 번의 Financial Modeling을 맡겼을 뿐인데도 사용량이 이 정도라면, 이미지와 영상을 만들거나 현실 세계를 계속 관찰하고 예측하는 World Model에서는 얼마나 많은 Token이 필요할까?

특히 앞으로 AI가 과학적 가설을 세우고 수많은 실험 결과를 비교하거나, 휴머노이드 로봇이 카메라와 센서를 통해 현실을 끊임없이 학습하기 시작한다면 지금과는 전혀 다른 규모의 Compute와 Memory가 필요할 수도 있다.

갑자기 그 차이가 궁금해졌다.

그래서 가장 이해하기 쉬운 해리포터를 예로 들어, AI가 책 한 권을 읽을 때와 같은 이야기를 영상과 움직이는 세계로 만들 때 필요한 Token이 얼마나 달라지는지부터 하나씩 계산해봤다.


AI가 글을 읽는 시대에서 현실 세계를 이해하는 시대로


최근 Agent와 World Model 관련 자료들을 살펴보면서 앞으로 AI가 얼마나 많은 Token과 데이터를 사용하게 될지 생각해봤다.

Token은 AI가 글이나 이미지, 영상을 이해하기 위해 정보를 잘게 나눈 조각이다.

지금까지는 주로 사람이 AI에게 질문하면 AI가 글로 답하는 과정에서 Token이 사용됐다.

하지만 Agent는 사람이 시키지 않아도 여러 단계를 거쳐 일을 수행한다. World Model은 여기서 더 나아가 카메라와 센서를 통해 현실 세계를 보고, 다음에 무슨 일이 일어날지 예상한다.

이를 가장 쉽게 이해하기 위해 해리포터 1권을 예로 들어보자.


1. 해리포터 책을 읽는 AI


『해리포터와 마법사의 돌』 영어 원서는 약 7만7,000단어로 이루어져 있다.

AI가 이 책을 처음부터 끝까지 한 번 읽으려면 약 10만 개의 Text Token이 필요하다.

Token을 이해하기 어렵다면 책을 레고 블록으로 잘게 나눈다고 생각하면 된다.

AI는 해리포터 책 전체를 약 10만 개의 작은 언어 블록으로 나누어 읽는다.

텍스트 파일로 저장하면 크기는 1MB도 되지 않는다.

즉 한 권의 책은 다음과 같이 표현할 수 있다.

Harry Potter Book
→ 약 77,000 Words
→ 약 100,000 Text Tokens
→ 1MB 이하의 Data

AI가 책을 요약하고 인물 관계를 분석하고 내용을 여러 번 검토한다면 더 많은 Token이 필요하다.

그래도 대부분 수십만 개에서 수백만 개 수준이다.

여기까지가 우리가 익숙하게 알고 있던 LLM의 세계다.


2. 같은 이야기를 영화로 만들면 어떻게 될까


이제 같은 해리포터 이야기를 영화로 만든다고 생각해보자.

책에서는 다음과 같이 한 문장으로 표현할 수 있다.

“해리는 움직이는 계단을 따라 호그와트 위층으로 올라갔다.”

그러나 영상을 만들려면 훨씬 많은 정보가 필요하다.

계단은 어떻게 생겼는지, 해리는 어디에 서 있는지, 옷은 어떻게 움직이는지, 주변 조명은 얼마나 어두운지, 카메라는 어느 방향에서 촬영하는지를 모두 표현해야 한다.

그리고 이 정보는 매 순간 달라진다.

텍스트는 한 문장으로 장면을 설명할 수 있지만 영상은 매초 수많은 화면의 변화를 기록해야 한다.

NVIDIA는 현실의 영상과 로봇 데이터를 이해하고 미래 장면을 생성하는 World Model인 Cosmos를 개발했다.

Cosmos는 2,000만 시간의 실제 영상 데이터를 약 9,000조 개의 Visual Token으로 바꿔 학습했다. 이를 단순하게 나누면 영상 1시간당 약 4억5,000만 개, 1초당 약 12만5,000개의 Visual Token에 해당한다.

NVIDIA Cosmos

해리포터 1편 영화는 약 152분이다.

이를 Cosmos 기준으로 계산하면 완성된 영화 한 편을 표현하는 데 약 11억 개의 Visual Token이 필요하다.

Harry Potter Book
→ 약 10만 Text Tokens

Harry Potter Movie
→ 약 11억 Visual Tokens

같은 이야기를 표현하는데도 영상은 텍스트보다 약 1만1,000배 많은 Token을 사용한다.

Text는 이미 정리된 이야기를 읽는다.

World Model은 이야기 속의 세계 전체를 직접 만들어야 한다.


3. 실제 영화 제작에는 완성본보다 훨씬 많은 데이터가 필요하다


영화는 처음 촬영한 장면을 그대로 사용하는 경우가 많지 않다.

같은 장면을 여러 번 촬영하고, 다른 카메라 각도를 사용하며, 특수효과와 배경도 여러 번 수정한다. 그렇게 만들어진 수많은 장면 가운데 가장 좋은 결과만 최종 영화에 들어간다.

World Model도 비슷하다.

AI가 하나의 미래만 생각하는 것이 아니라 여러 미래를 동시에 만들어보고 그중 가장 적절한 결과를 선택한다.

예를 들어 해리포터가 움직이는 계단 앞에 서 있다고 생각해보자.

AI는 다음과 같은 여러 미래를 만들 수 있다.

  • 계단이 왼쪽으로 움직이는 미래

  • 계단이 오른쪽으로 움직이는 미래

  • 해리가 계단을 놓치는 미래

  • 론과 헤르미온느가 나타나는 미래

  • 계단 위에서 위험한 일이 생기는 미래

가능한 미래를 10개 만들면 필요한 Token도 대략 10배 늘어난다.

30개의 장면과 수정본을 만든다면 약 342억 개의 Token이 필요할 수 있다.

여러 미래를 반복해서 만들고 비교하면 수요는 다시 커진다.


Text AI는 책에 적힌 세계를 읽는다.

World Model은 그 세계가 실제로 움직이는 모습을 만들고, 앞으로 일어날 수 있는 여러 미래까지 계산한다.

Words
→ Images
→ Video
→ Interactive Worlds
→ Multiple Possible Futures

AI가 Text에서 World로 이동할수록 처리해야 하는 정보량이 폭발적으로 증가하는 이유다.




4. Agent는 Token을 사용하는 주체를 사람에서 AI로 바꾼다


기존 Chatbot은 사람이 질문할 때만 작동했다.

사람이 질문을 한 번 입력하면 AI도 답변을 한 번 생성했다.

하지만 Agent는 다르다.

예를 들어 “해리포터 영화의 흥행 성과를 분석해줘”라고 요청하면 Agent는 필요한 자료를 찾고, 숫자를 정리하고, 계산하고, 결과가 맞는지 확인한다. 오류가 발견되면 다시 자료를 찾고 계산을 수정한다.

질문
→ 계획
→ 자료 검색
→ 계산
→ 결과 확인
→ 오류 수정
→ 최종 답변

하나의 업무 안에서 AI가 수십 번 판단하는 구조다.

따라서 Agent는 사람이 Chatbot에 질문할 때보다 훨씬 많은 Token을 사용한다.

OpenRouter 데이터에서 Agent가 사용한 Token은 약 6개월 동안 0.5조 개에서 7.3조 개로 14배 증가했다.

2026년 2월에는 Agent의 Token 사용량이 인간의 직접 사용량을 추월했다. 현재 그래프 기준으로는 Agent가 사람보다 약 5배 많은 Token을 사용하고 있다.


OpenRouter Usage Rankings


중요한 변화는 AI 사용자가 늘어난 것만이 아니다.

Token을 사용하는 주체 자체가 사람에서 Agent로 바뀌고 있다.

사람은 쉬고 잠을 잔다.

Agent는 필요한 경우 하루 종일 여러 작업을 동시에 수행할 수 있다.

한 사람이 3개, 5개, 10개의 Agent를 사용하기 시작하면 AI 사용자 수는 사람 수보다 훨씬 빠르게 늘어난다.


5. AI는 기술기업 밖으로 빠르게 확산되고 있다


처음 AI를 적극적으로 사용한 곳은 기술기업이었다.

하지만 이제 금융, 제조업, 유통업과 같은 전통 산업도 AI를 빠르게 도입하고 있다.

Ramp 고객 기업 표본에서 유료 AI 서비스를 사용하는 비중은 다음과 같이 상승했다.

  • Technology and Media: 80.6%

  • Finance and Insurance: 73.1%

  • Manufacturing: 60.4%

  • Retail: 49.0%

  • Health Care: 42.9%

  • Construction: 42.0%

Ramp AI Index

이 수치는 미국 전체 기업의 정확한 보급률이 아니라 Ramp가 관찰할 수 있는 고객 기업의 결제 데이터를 기준으로 한다.

그럼에도 방향은 분명하다.

기술기업만 사용하던 AI가 은행, 보험회사, 공장, 병원, 건설회사와 식당까지 확산되고 있다.

사용하는 기업이 많아지고, 기업마다 여러 Agent가 일하기 시작하면 Token 수요는 다음과 같이 커진다.

More Companies
× More Employees
× More Agents per Employee
× More Tasks per Agent
× More Tokens per Task


https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com

https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com

https://openai.com/ko-KR/index/how-agents-are-transforming-work/?utm_source=chatgpt.com



6. 2030년까지 Token 수요는 얼마나 증가할까


Goldman Sachs는 Agent 확산으로 글로벌 월간 Token 사용량이 2026년 약 5경 개에서 2030년 120경 개로 증가할 것으로 전망했다.

4년 동안 약 24배 증가하는 수치다.

Goldman Sachs Research

왜 이렇게 빠르게 증가할까.

첫째, AI를 사용하는 사람이 늘어난다.

둘째, 한 사람이 여러 Agent를 사용하게 된다.

셋째, Agent는 하나의 일을 수행하기 위해 여러 번 모델을 호출한다.

넷째, AI가 글을 넘어 이미지·영상·음성까지 처리한다.

다섯째, 앞으로는 로봇과 자율주행차가 현실 세계의 데이터를 계속 만들어낸다.

Goldman Sachs의 120경 개는 주로 Chatbot과 Consumer·Enterprise Agent를 중심으로 한 전망이다.

World Model과 Physical AI가 빠르게 보급될 경우 여기에 추가 수요가 붙을 수 있다.



기준 시나리오에서는 2030년까지 전 세계에서 활동하는 휴머노이드 로봇이 약 100만 대에 도달하고, 제한된 카메라와 센서 데이터만 World Model 학습에 사용된다고 가정했다.

다만 이는 아직 공식 전망이 아니라 자체 계산이다.

로봇 보급이 늦어지거나 영상 압축기술이 빠르게 발전하면 수요는 낮아질 수 있다. 반대로 휴머노이드 외에 자율주행차, 드론, 산업용 로봇과 스마트 카메라까지 포함하면 수요는 예상보다 훨씬 커질 수 있다.





7. 다음 단계는 현실 세계에서 일하는 AI다


AI가 Text만 처리할 때는 사람이 만든 문서와 인터넷 자료가 주요 학습 데이터였다.

하지만 휴머노이드 로봇은 스스로 새로운 데이터를 만든다.

로봇은 카메라로 주변을 보고, 마이크로 소리를 듣고, 센서로 힘과 거리와 움직임을 측정한다. 물건을 잡다가 실패하면 그 과정도 새로운 학습 데이터가 된다.

한 대의 로봇이 새로운 동작을 배우면 그 결과를 다른 로봇들과 공유할 수도 있다.

Robot Deployment
→ Real-world Data
→ World Model Training
→ Better Robot Intelligence
→ More Robot Deployment

로봇이 늘어날수록 현실 데이터가 늘어난다.

데이터가 늘어날수록 World Model은 더 똑똑해진다.

World Model이 똑똑해질수록 로봇이 할 수 있는 일이 늘어난다.

그러면 더 많은 로봇이 판매되고, 다시 더 많은 데이터가 만들어진다.

인터넷 시대에는 사람이 데이터를 만들었다.

Physical AI 시대에는 기계가 스스로 데이터를 생산하기 시작한다.


8. 휴머노이드 한 대보다 더 큰 것은 데이터센터 수요다


휴머노이드 로봇 한 대에는 DRAM, NAND Flash, 센서, 통신칩과 여러 반도체가 들어간다.

이들 반도체 탑재액을 대당 600~800달러로 가정하면 다음과 같다.

  • 100만 대: 6억~8억달러

  • 1,000만 대: 60억~80억달러

다만 이 금액 전체가 순수한 메모리 매출은 아니다. 센서와 통신칩 등 다른 반도체도 포함되어 있으므로 실제 Memory Content는 이보다 작다.

더 큰 기회는 로봇이 작동하는 동안 계속 만들어내는 데이터에 있을 가능성이 높다.

로봇 한 대가 하루에 0.1~1TB의 카메라·센서 데이터를 만든다고 가정해보자.

100만 대가 작동하면 하루에 0.1~1EB, 1년이면 36.5~365EB의 원시 데이터가 만들어질 수 있다.

물론 모든 데이터를 영구적으로 보관하지는 않는다.

중복되거나 가치가 낮은 영상은 지우고, 실패하거나 새로운 상황을 담은 중요한 데이터만 남길 것이다.

전체의 1%만 저장하더라도 연간 약 0.4~3.7EB다. 10%를 남기면 3.7~36.5EB가 된다.

따라서 Physical AI의 메모리 수요는 두 곳에서 발생한다.

로봇 안의 Memory

  • DRAM: 주변 상황을 실시간으로 계산

  • NAND: 지도·모델·작업 기록을 저장

  • 고성능 메모리: 더 복잡한 AI를 로봇 내부에서 실행

데이터센터의 Memory와 Storage

  • HBM: World Model 학습과 추론

  • Server DRAM: 대규모 데이터 처리

  • Enterprise SSD: 자주 사용하는 학습 데이터

  • HDD: 장기간 보관하는 영상과 센서 데이터


로봇 한 대에 들어가는 메모리도 중요하다.

하지만 로봇이 평생 만들어내는 데이터를 학습하고 저장하는 인프라의 가치가 더 클 수 있다.


9. 효율이 좋아지면 Memory 수요가 줄어들까


영상 압축과 Tokenizer 기술이 발전하면 같은 영상을 더 적은 Token으로 표현할 수 있다.

NVIDIA는 Cosmos Tokenizer가 기존 기술보다 더 높은 압축률과 빠른 처리 속도를 제공한다고 설명한다.

그렇다면 메모리와 Compute 수요가 줄어들까.

반드시 그렇지는 않다.

영상 한 시간을 처리하는 비용이 10분의 1로 낮아지면 기업은 영상 10시간만 처리하고 멈추지 않을 수 있다.

더 많은 카메라를 연결하고, 더 긴 시간을 기록하고, 더 많은 미래를 시뮬레이션하게 된다.

Token Cost ↓
→ More Cameras Connected
→ More Operating Hours
→ More Simulations
→ More Robots Trained
→ Total Token Demand ↑

자동차가 연료 효율이 좋아졌다고 사람들이 자동차를 완전히 사용하지 않게 되는 것은 아니다.

오히려 이동 비용이 낮아지면서 자동차 사용이 늘어날 수도 있다.

AI도 비슷하다.

토큰당 비용은 하락하지만 전체 Token 사용량은 더 빠르게 증가할 수 있다.


10. AI는 세 번에 걸쳐 Memory 시장을 확장한다


첫 번째 변화는 Training AI였다.

거대한 LLM을 학습하기 위해 GPU와 HBM이 필요해졌다.

두 번째 변화는 Agent AI다.

AI가 사람 대신 도구를 사용하고 오랫동안 일하면서 추론 Token과 KV Cache, Server DRAM 수요가 증가한다.

세 번째 변화는 World Model과 Physical AI다.

AI가 현실 세계를 보고 행동하기 시작하면서 영상·공간·센서 데이터가 계속 만들어진다.

Training AI
→ HBM 중심

Agent AI
→ HBM + Server DRAM + Enterprise SSD

Physical AI
→ HBM + DRAM + NAND + Enterprise SSD + HDD

AI는 데이터센터에서 첫 번째 메모리 사이클을 만들었다.

Agent는 Token을 사용하는 주체를 인간에서 소프트웨어로 확장한다.

World Model과 휴머노이드 로봇은 데이터 생성 장소를 인터넷에서 현실 세계로 확장한다.


글을 마치며


해리포터 책 한 권을 읽는 데 필요한 정보는 약 10만 개의 Text Token이다.

하지만 그 이야기를 영화처럼 움직이는 세계로 표현하면 약 11억 개의 Visual Token이 필요할 수 있다.

여러 장면과 미래를 만들고 비교하면 필요한 Token은 다시 수십 배, 수백 배 늘어난다.

이 차이는 단순히 영상 파일이 글보다 크다는 이야기가 아니다.

기존 AI는 사람이 이미 만들어놓은 지식을 읽었다.

앞으로의 AI는 현실을 직접 보고, 다음 상황을 예상하고, 행동하고, 실패한 결과를 다시 학습한다.

Chatbot은 사람이 질문해야 움직인다.

Agent는 일이 끝날 때까지 스스로 움직인다.

휴머노이드 로봇은 현실 세계에서 움직이면서 하루 종일 새로운 데이터를 만들어낸다.

Human Prompt
→ AI Agent
→ World Model
→ Physical AI

AI가 이 방향으로 발전할수록 Token을 사용하는 주체와 시간, 데이터의 종류가 함께 늘어난다.

Goldman Sachs의 전망대로 Agent만으로도 2030년 Token 수요는 2026년 대비 약 24배 증가할 수 있다. World Model과 Physical AI가 예상보다 빠르게 확산되면 약 35~60배 이상도 생각해볼 수 있다.

이 과정에서 가장 중요한 것은 단순히 로봇이 몇 대 판매되는지가 아닐 수 있다.

로봇이 얼마나 오랫동안 현실을 관찰하고, 얼마나 많은 데이터를 만들며, 그 데이터를 몇 번이나 학습과 시뮬레이션에 다시 사용하는지가 더 중요하다.

AI가 글을 읽던 시대에는 Compute가 필요했다.
AI가 현실을 보기 시작하는 시대에는 Compute와 Memory, Storage가 모두 필요하다.

다음 Memory Supercycle은 데이터센터 안에서만 만들어지지 않을 수 있다.

현실 세계를 돌아다니며 매일 새로운 데이터를 생산하는 수백만 대의 기계 안에 숨어 있을 가능성이 있다.

문뜩 AGI시대가 도래할지라도 너무 비싸서 쓸 수가 없으면 무슨 소용일까 싶다. 


=끝

2026년 8월 30일 일요일

생각정리 355 (* HBM hegemony, NVHBM)

언제나 좋은 자료들을 무료로 배포해주시는 인포마켓에  많은 도움을 받고있다.

메모리 헤게모니는 엔비디아로? - NVHBM의 정체 | 인포마켓 강용운 대표

이번엔 NVIDIA가 새롭게 재시한 NVHBM에 대해 정리해본다.

NVIDIA NVHBM: 메모리 컨트롤러가 HBM으로 이동한다


핵심 결론


NVIDIA는 2026년 8월 26일 NVHBM이라는 커스텀 고대역폭 메모리 아키텍처를 공개했다.

핵심 변화는 기존 XPU 내부에 있던 메모리 컨트롤러를 HBM 스택의 베이스 다이로 옮기는 것이다. NVIDIA는 여기에 자체 설계한 커스텀 PHY를 결합해 표준 HBM4E보다 높은 대역폭과 낮은 전력을 구현하겠다는 계획이다.

NVHBM은 단순한 고성능 HBM이 아니다. NVIDIA가 GPU·XPU뿐 아니라 HBM 베이스 다이, 메모리 컨트롤러, 물리 인터페이스와 공급사 인증 기준까지 직접 설계하는 방향으로 사업영역을 확장했다는 점에서 의미가 크다.


1. 기존 HBM과 NVHBM의 차이


기존 HBM은 여러 개의 DRAM 다이와 최하단 베이스 다이로 구성된다. 실제 메모리 요청을 스케줄링하고 주소를 관리하는 메모리 컨트롤러는 대부분 GPU·XPU 내부에 위치한다.

NVHBM은 이 컨트롤러를 HBM 베이스 다이로 이동시킨다.


구조를 단순화하면 다음과 같다.

표준 HBM4E


XPU 메모리 컨트롤러 → 광폭 HBM PHY → 인터포저 → HBM 베이스 다이 → DRAM 스택

NVIDIA NVHBM


XPU 커스텀 PHY → 커스텀 인터페이스 → NVIDIA 컨트롤러가 통합된 HBM 베이스 다이 → DRAM 스택

복잡한 메모리 제어 기능을 XPU에서 HBM 쪽으로 이동시키면서 XPU의 회로 면적을 줄이고, NVIDIA가 메모리 동작을 시스템 수준에서 최적화할 수 있게 되는 구조다.

출처: NVIDIA NVHBM 공식 기술자료, 2026년 8월 26일


2. NVIDIA가 제시한 성능 개선


NVIDIA는 표준 HBM4E와 비교해 NVHBM이 다음과 같은 효과를 제공한다고 설명한다.


이 수치들은 독립적인 학술 실험 결과가 아니라 NVIDIA가 제시한 자체 설계 및 시스템 비교 결과다. 모두 최적 조건을 전제로 한 up to 수치이므로 실제 성능은 XPU 구조와 워크로드에 따라 달라질 수 있다.

대역폭 증가가 중요한 이유


AI 추론에서는 모델 가중치와 KV Cache를 HBM에서 연산기로 계속 불러와야 한다. 연산성능이 아무리 높더라도 HBM이 데이터를 충분히 빠르게 공급하지 못하면 GPU의 연산기가 대기하게 된다.

NVHBM의 대역폭 개선은 다음 경로로 성능에 영향을 준다.

HBM 대역폭 증가 → 모델 가중치·KV Cache 전송속도 상승 → 연산기 유휴시간 감소 → XPU 이용률 상승 → 추론 처리량 증가

대역폭 병목이 큰 워크로드일수록 NVHBM의 효과가 크게 나타날 수 있다.


3. 메모리 컨트롤러를 옮기면 왜 XPU 면적이 늘어나는가


메모리 컨트롤러는 단순한 신호 전달 회로가 아니다. 다음 기능을 담당한다.

  • 메모리 주소 해석

  • 읽기·쓰기 요청 스케줄링

  • 뱅크 및 채널 관리

  • 요청 순서 재배치

  • 오류 검출·정정

  • 전력 및 리프레시 관리

  • 데이터 버퍼링

  • 메모리 일관성 및 트래픽 관리


AI 가속기의 HBM 채널 수와 대역폭이 증가할수록 컨트롤러와 PHY가 차지하는 면적도 커진다. 이 회로를 베이스 다이로 옮기면 XPU에는 상대적으로 작은 커스텀 PHY만 남길 수 있다.

확보된 면적은 다음과 같은 영역에 재배분할 수 있다.

  • Tensor Core 및 행렬연산기

  • Vector unit

  • SRAM과 캐시

  • Network-on-Chip

  • NVLink 인터페이스

  • 워크로드별 전용 가속회로


즉, 동일한 패키지 크기 안에서 메모리 인터페이스 면적을 줄이고 연산회로 비중을 높이는 것이 NVHBM의 중요한 목적이다.


4. NVHBM과 NVLink Fusion의 역할


NVHBM과 NVLink Fusion은 하나의 플랫폼 안에서 사용되지만 담당하는 영역은 다르다.


현재 NVIDIA가 공개한 구조는 다음과 같다.

NVHBM ↔ XPU ↔ NVLink Fusion chiplet ↔ NVLink Switch ↔ 다른 XPU·GPU

NVHBM은 개별 XPU의 로컬 메모리를 개선하고, NVLink Fusion은 여러 개의 XPU와 GPU를 하나의 대규모 연산 도메인으로 묶는다.

NVIDIA는 NVHBM과 NVLink Fusion을 결합하면 메모리 대역폭, XPU 면적 및 전력 효율 개선이 복합적으로 작용해 XPU당 전체 성능을 최대 30% 높일 수 있다고 설명한다.

출처: NVIDIA NVLink Fusion 공식 페이지


5. AWS Trainium4가 첫 번째 협력 사례


AWS의 반도체 설계조직 Annapurna Labs가 최초의 NVHBM 협력사로 참여한다.

AWS는 Trainium4부터 NVLink Fusion을 적용해 자체 AI ASIC을 NVIDIA의 NVLink 6와 MGX 랙 아키텍처에 통합할 계획이다.

주요 사양은 다음과 같다.


AWS는 XPU 자체 설계에는 집중하되, HBM 베이스 다이, NVLink, 스위치, 랙, 냉각 및 전력 인프라는 NVIDIA 생태계를 활용할 수 있다.

이는 NVIDIA가 범용 GPU 공급업체를 넘어 하이퍼스케일러의 커스텀 ASIC을 위한 반제품형 AI 플랫폼 공급자로 확장하고 있음을 의미한다.

출처: AWS Trainium4와 NVIDIA NVLink Fusion 기술자료


6. NVHBM의 기술적 선행 사례: Hybrid Memory Cube


NVHBM과 가장 유사한 과거 메모리 아키텍처는 마이크론이 개발했던 HMC, Hybrid Memory Cube다.

HMC는 적층된 DRAM 아래에 로직 베이스 다이를 배치하고, 여기에 다음 기능을 통합했다.

  • 고급 메모리 컨트롤러

  • Crossbar switch

  • DRAM 요청 스케줄링

  • 링크 인터페이스 컨트롤러

  • 전력 및 리프레시 관리

  • 오류 검출·정정


프로세서는 DRAM의 세부 타이밍을 직접 관리하지 않고 추상화된 메모리 요청만 보낸다. 로직 베이스 다이가 실제 DRAM 동작을 관리하는 구조다.

HMC의 외부 인터페이스


HMC는 기존 DRAM의 광폭 병렬 인터페이스 대신 고속 직렬 링크를 사용했다.

  • 프로세서와 HMC를 고속 직렬 링크로 연결

  • HMC와 다른 HMC를 연결해 메모리 네트워크 구성

  • Ring·Mesh·Tree 구조 지원

  • 메모리 모듈 또는 보드 실장 가능

  • 장기적으로 전기 SerDes와 광인터페이스 사용 가능



두 기술은 메모리 제어 기능을 로직 베이스 다이에 넣는다는 설계 철학이 유사하다. 그러나 NVIDIA는 NVHBM의 외부 인터페이스가 직렬인지, 메모리를 인터포저 밖에 배치할 수 있는지는 공개하지 않았다.

출처:


7. NVIDIA의 메모리 공동설계 연구


NVIDIA Research는 2017년 GPU용 DRAM과 메모리 컨트롤러를 공동 설계하는 연구를 발표했다.

논문이 지적한 문제


GPU는 수많은 스레드가 작은 단위의 데이터를 동시에 요청한다. 기존 DRAM은 필요한 데이터보다 훨씬 큰 행을 활성화하기 때문에 사용하지 않는 영역에서도 전력이 소비된다.

또한 메모리 내부의 뱅크 충돌과 비효율적인 요청 스케줄링 때문에 이론상 HBM 대역폭을 모두 사용하지 못하는 문제가 발생한다.

제안한 기술


연구진은 DRAM 뱅크를 더 작은 서브채널로 분할하고, 메모리 컨트롤러가 관련 명령을 합쳐 필요한 서브채널만 활성화하는 구조를 제안했다.

결과는 다음과 같다.


이 연구는 메모리 컨트롤러를 베이스 다이로 옮기는 방식을 직접 다루지는 않는다. 다만 표준 HBM을 사용하는 것보다 GPU·DRAM·메모리 컨트롤러를 공동 설계하는 편이 실제 대역폭과 전력 효율을 개선할 수 있다는 기술적 근거를 제공한다.

출처: NVIDIA Research, Architecting an Energy-Efficient DRAM System for GPUs


8. 장기적으로 HBM도 광연결될 수 있는가


2026년 8월 Nature Electronics에 게재된 CPO 연구는 장기적으로 광인터커넥트를 메모리 인터페이스까지 확대하는 아키텍처를 제시한다.

연구에는 SK하이닉스와 MIT·버지니아대·UIUC·연세대 등 글로벌 연구진이 참여했다.

전기 인터커넥트의 한계


구리 배선은 전송속도와 거리가 증가할수록 다음 문제가 심해진다.

  • 저항 손실 증가

  • 신호왜곡

  • 복잡한 보정회로 필요

  • 전력 소비 증가

  • 지연시간 증가

  • 연결 가능한 메모리 수 제한

  • 패키지 면적과 발열 제약

논문이 제시한 구조


장기적으로 XPU와 메모리를 하나의 패키지 안에 고정하지 않고 광링크를 통해 연결한다.

XPU pool ↔ Photonic interposer ↔ Optical link ↔ Memory pool

이 구조에서는 여러 XPU가 대규모 메모리 풀을 공유할 수 있다. 메모리를 XPU 바로 옆에 모두 배치할 필요가 없어 패키지 면적과 열 제약을 완화할 수 있다.

기술 목표



해결해야 할 문제

  • 전기·광 신호 변환 전력

  • 메모리 일관성 프로토콜

  • 광소자의 발열과 온도 민감도

  • 패키징 수율

  • 인터페이스 표준화

  • HBM 수준의 낮은 지연시간

  • 제조비용

광연결 메모리는 충분한 기술적 근거가 있는 중장기 방향이다. 다만 NVHBM의 초기 구현 방식으로 공개된 것은 아니며, 상용화 시점 역시 확정되지 않았다.

출처:


9. Google의 광연결 HBM 특허


Google은 HBM을 ASIC 패키지에서 분리해 광섬유로 연결하는 기술 특허를 보유하고 있다.

특허에 제시된 HBM 광모듈에는 다음 부품이 들어간다.

  • HBM DRAM

  • HBM PHY

  • HBM 컨트롤러

  • Die-to-Die 인터페이스

  • Optical chiplet

  • 광섬유 연결 포트


구조는 다음과 같다.

ASIC·TPU ↔ Optical chiplet ↔ Optical fiber ↔ HBM controller·PHY ↔ HBM

이 방식의 장점은 다음과 같다.

  • ASIC 패키지 크기와 관계없이 더 많은 HBM 연결

  • HBM을 연산칩에서 물리적으로 더 멀리 배치

  • 패키지 발열 분산

  • 여러 연산기가 대규모 메모리 풀 공유

  • 고장 난 HBM 모듈만 교체 가능

  • ASIC 전체를 폐기해야 하는 비용 절감


이는 메모리 컨트롤러를 HBM 모듈 쪽으로 이동한 뒤 광인터커넥트로 프로세서와 연결하는 구조가 기술적으로 구현 가능한 방향임을 보여준다.

출처: Google 특허: Optical Communication for Memory Disaggregation in HPC


10. 베이스 다이 고도화와 파운드리 경쟁


베이스 다이에 메모리 컨트롤러와 커스텀 PHY가 들어가면 베이스 다이는 단순한 지원회로가 아니라 고성능 로직 반도체에 가까워진다.

이에 따라 다음 역량이 중요해진다.

  • 첨단 로직 공정

  • 고속 PHY 설계

  • 전력관리

  • 발열 제어

  • 인터포저 배선 최적화

  • HBM DRAM과 로직 다이의 공동 검증

  • 고급 패키징 수율

SK하이닉스와 TSMC


SK하이닉스는 HBM4부터 TSMC의 첨단 로직 공정을 베이스 다이에 적용하기로 했다. 또한 TSMC의 CoWoS와 SK하이닉스 HBM의 패키지 통합을 공동 최적화하고 있다.

이 구조에서는 NVIDIA가 컨트롤러와 베이스 다이를 설계하고, TSMC가 로직 베이스 다이를 생산하며, SK하이닉스가 DRAM 적층과 HBM 완제품을 공급할 가능성이 있다.

출처: SK하이닉스·TSMC HBM4 협력 발표

삼성전자


삼성전자는 HBM4에 자체 파운드리의 4nm 로직 베이스 다이를 적용하고 있다. 메모리, 파운드리, 로직 설계와 첨단 패키징을 내부에서 결합할 수 있다는 점이 차별화 요소다.

삼성 HBM4의 주요 사양은 다음과 같다.

  • 핀 속도 11.7Gbps

  • 최대 13Gbps 확장 가능

  • 스택당 최대 대역폭 3.3TB/s

  • HBM3E 대비 전력효율 40% 개선

  • 12단 24~36GB

  • 향후 16단 48GB 확대


출처: 삼성전자 HBM4 공식 발표

따라서 TSMC는 주요 수혜자가 될 가능성이 높지만 독점적인 베이스 다이 생산자는 아니다.


11. 하이브리드 본딩과 수직 적층의 한계


HBM의 용량을 늘리는 가장 직접적인 방법은 더 많은 DRAM 다이를 수직으로 쌓는 것이다. 그러나 적층 수가 증가하면 패키지 높이, 발열, 뒤틀림, 정렬 정밀도와 수율 문제가 커진다.

하이브리드 본딩은 기존 마이크로범프를 제거하고 구리와 구리를 직접 연결한다.


하이브리드 본딩의 장점은 다음과 같다.

  • 연결 밀도 증가

  • 칩 사이 거리 축소

  • 신호 손실과 지연 감소

  • 전력 소비 감소

  • 패키지 높이 축소

  • 열저항 감소

  • 16단 이상 적층에 유리


반면 제조비용이 기존 플립칩 패키징의 2~3배이고, 표면 평탄도와 다이 정렬, 생산속도 및 수율 문제가 남아 있다.

SK하이닉스는 기존 본딩 기술이 HBM4까지는 사용될 수 있지만, HBM4E와 HBM5부터는 하이브리드 본딩의 필요성이 커질 것으로 전망한다.

출처: SK하이닉스 하이브리드 본딩 기술자료


12. 산업적 의미


NVIDIA의 변화


NVIDIA는 지금까지 GPU와 시스템을 설계하고 HBM은 메모리 업체로부터 공급받았다. NVHBM에서는 NVIDIA가 다음 영역까지 직접 설계한다.

  • HBM 베이스 다이

  • 메모리 컨트롤러

  • 커스텀 PHY

  • 공급사 검증 규격

  • XPU와 메모리의 공동 최적화

  • NVLink 및 랙 단위 시스템 구조


NVIDIA의 영향력이 GPU → 패키지 → HBM 인터페이스 → 랙 아키텍처까지 확장되는 것이다.

메모리 3사의 변화


삼성전자·SK하이닉스·마이크론의 HBM 생산량이 감소한다는 의미는 아니다. AI 모델 확대와 추론 증가로 HBM 용량과 대역폭 수요는 계속 증가할 가능성이 높다.

다만 가치사슬 내 역할은 변할 수 있다.


NVIDIA가 여러 메모리 업체에 동일한 NVHBM 구현을 적용하면 공급 다변화와 교체가 쉬워질 수 있다. 이는 NVIDIA의 구매 협상력을 높일 가능성이 있다.

반면 베이스 다이와 패키징의 복잡도가 높아지므로, 실제 양산 수율과 첨단 공정을 보유한 메모리 업체의 희소성도 동시에 커질 수 있다.


최종 판단


NVHBM의 본질은 HBM 자체를 없애거나 메모리 생산을 NVIDIA가 직접 수행하는 데 있지 않다.

NVIDIA가 메모리 시스템의 설계권을 가져오는 변화다.

인과관계는 다음과 같다.

AI 모델·KV Cache 확대
→ 메모리 대역폭과 전력 병목 심화
→ 메모리 컨트롤러를 HBM 베이스 다이로 이동
→ XPU 면적·대역폭·전력 개선
→ NVIDIA가 베이스 다이와 인터페이스 표준 주도
→ 복수 메모리 공급사를 NVIDIA 시스템에 통합
→ NVIDIA의 시스템 통제력과 협상력 강화


중장기적으로는 커스텀 PHY가 더 고속화되고 광인터커넥트가 메모리 인터페이스까지 확장될 가능성이 있다. 이 경우 HBM은 GPU 바로 옆에 고정된 부품에서 벗어나, 여러 가속기가 공유하는 대규모 메모리 풀로 발전할 수 있다.


=끝


2026년 7월 30일 목요일

생각정리 325 (* Memory Premium)

엊그제 Amazon 실적발표에서는 AI 데이터센터와 Cloud 사업의 투자회수기간, 수익성, Capacity 수요를 가늠할 수 있는 의미 있는 지표들이 연달아 공개됐다.

이 수치들을 따라가다 보니, 현재의 Memory 가격이 AI Cloud가 창출하는 경제적 가치에 비해 얼마나 낮게 평가돼 있는지, 그리고 Cloud 사업자가 감당할 수 있는 Memory의 적정가격 상단이 어디까지인지 역산해볼 수 있었다.

오늘은 그 리서치 과정을 정리해 기록으로 남겨본다.

만약 내가 바라보는 메모리의 적정가치의 논리와 전제, 가정들이 '어느정도' 맞다면, 현재의 메모리 컨센서스는 수요량 증가를 어느 정도 반영하고 있더라도, 메모리 업체가 확보할 수 있는 가격과 이익의 상단은 여전히 충분히 반영되지 못하고 있을 가능성이 매우 크다.

Memory Premium


AI Cloud는 Memory 가격을 어디까지 감당할 수 있는가


AI 데이터센터 투자를 둘러싼 논쟁은 주로 CAPEX의 절대 규모에 집중돼 있다.

수백억달러를 들여 데이터센터와 GPU를 계속 증설해도 투자비를 회수할 수 있는지, AI 수요가 둔화되면 막대한 설비가 유휴자산으로 남는 것은 아닌지에 대한 우려다.

그러나 최근 Amazon의 실적과 어닝콜을 보면 논의의 출발점을 조금 바꿀 필요가 있다.

현재 AI Cloud 사업자는 매출이 발생하지 않는 미래를 위해 투자하는 단계에만 머물러 있지 않다. 이미 가동 중인 AI 서버에서는 충분한 매출과 이익이 발생하고 있으며, 서버와 Network 장비의 투자비도 평균 3년 이내에 회수되고 있다.

Jamin Ball (@jaminball) / X


이제 Cloud 사업자의 핵심 질문은 데이터센터 투자를 계속할 것인지에 머물지 않는다.

이미 확보한 전력과 GPU를 활용해 얼마나 많은 유료 TOKEN을 생산할 수 있는가.

이 질문을 따라가면 Memory의 경제적 가치가 보이기 시작한다.

GPU는 AI 데이터센터에서 가장 비싼 핵심자산이지만, HBM의 용량과 Bandwidth가 부족하면 GPU 연산기는 데이터를 기다리며 놀게 된다. 더 많은 Memory가 이러한 대기시간을 줄여 TOKEN 생산량을 늘린다면, Memory 가격의 상단도 과거 DRAM 가격이나 제조원가만으로 설명하기 어려워진다.

Memory에 지불할 수 있는 최대가격은 추가 Memory가 회복시키는 GPU 가동시간과 그 시간에 생산되는 유료 TOKEN의 가치에 의해 결정된다.


핵심 요약

  • Amazon은 AWS 서버와 Network 장비의 투자비를 평균 3년 미만에 회수하고 있으며, 장비는 최소 5~6년 동안 사용하고 있다고 밝혔다.

  • LLM 추론에서는 GPU에 작업이 배정돼 있어도 HBM에서 데이터를 기다리면서 Tensor Core가 충분히 활용되지 못하는 Memory Wall이 발생한다.

  • H100에서 H200으로 넘어가면서 HBM 용량은 76%, Bandwidth는 43% 늘었고, Llama 2 70B 처리량은 최대 90% 증가했다.

  • Blackwell과 Rubin에서는 GPU 연산성능이 더 빠르게 증가하므로, Memory 부족으로 발생하는 GPU의 기회비용도 함께 커진다.

  • 기준 시나리오에서 Rubin의 전체 Memory System은 GPU당 약 10만~11만달러의 경제적 가치를 창출할 수 있다.

  • 이에 따라 HBM 가격은 현실적으로 현재의 3~5배까지 상승하더라도 Cloud 사업자의 장기 경제성이 유지될 가능성이 있다.


1. AI 데이터센터는 이미 투자비를 회수하고 있다


Amazon의 2026년 2분기 AWS 매출은 422억달러로 전년 대비 37% 증가했다. 영업이익은 166억달러로 64% 증가했으며, 영업이익률은 39.4%에 달했다.

AWS의 AI 사업과 자체 AI Chip 사업도 각각 연환산 매출 250억달러를 넘어섰다. AI 인프라 투자가 아직 매출로 연결되지 않은 선행투자에만 머무르는 것이 아니라, 실제 매출과 영업이익으로 전환되고 있다는 의미다. (Amazon)

2026.07.31 Amazon

Amazon은 어닝콜에서 AI 데이터센터의 투자회수 구조를 다음과 같이 설명했다.

  • 데이터센터 건물과 전력설비는 서버 설치 약 2년 전부터 투자가 시작된다.

  • 데이터센터는 30년 이상 활용할 수 있다.

  • 서버와 Network 장비는 실제 고객 수요를 확인한 뒤 가동 몇 달 전에 구매한다.

  • 서버와 Network 장비의 평균 투자회수기간은 3년 미만이다.

  • 서버의 경제적 사용기간은 최소 5~6년이다.

  • 최근 AI Capacity 계약은 대부분 5년 이상으로 체결된다.




서버를 6년 사용하면서 3년 이내에 투자비를 회수한다면, 이후 남은 2~3년은 상당한 잉여현금흐름을 창출하는 기간이 된다. Amazon은 AI 사업의 Margin과 Return이 과거 AWS Core 사업의 초기 단계보다 조금 앞서가고 있다고 평가했다. (알파스트리트 뉴스)


2026.07.31 Amazon

Amazon이 구체적인 AI ROIC 수치를 공개한 것은 아니다.

다만 3년 미만의 투자회수기간은 단순 현금회수 속도로 보면 매년 투자원금의 33% 이상을 회수하는 구조다. 회계상 ROIC와 완전히 같은 개념은 아니지만, AI 서버 투자의 경제성이 이미 상당히 높은 수준에 도달했음을 보여준다.


2026.07.31 Amazon

그럼에도 Amazon의 Free Cash Flow가 감소하는 이유는 기존 AI 서버가 돈을 벌지 못해서가 아니다.

현재 매출을 창출하는 데이터센터와 함께, 앞으로 사용할 데이터센터와 전력설비를 동시에 건설하고 있기 때문이다. 데이터센터는 완공되기 전까지 현금만 지출하지만, 서버가 설치되고 고객이 사용하기 시작하면 매출이 바로 발생한다.

Amazon은 2026년 Cash CAPEX 전망을 기존 2,000억달러에서 2,200억달러로 상향했다. 상향 원인 가운데 하나로 Memory 가격 상승을 직접 언급했다.

그럼에도 회사는 2026년 수요를 모두 충족하지 못할 것으로 예상했고, 2027년에도 Capacity 부족이 이어질 가능성이 높다고 설명했다. 2028년 Capacity에 대해서도 이미 상당한 고객 수요가 확인되고 있다. (marketbeat.com)

여기서 중요한 결론을 얻을 수 있다.

Memory 가격이 올라가고 있지만, Memory를 포함한 AI 데이터센터 투자의 예상수익이 여전히 비용보다 크기 때문에 Cloud 사업자는 투자를 줄이지 않고 있다.

 


2. AI Cloud의 핵심은 GPU 개수가 아니라 TOKEN 생산량이다


앞선 「Token Empire」에서 AI Cloud의 경쟁력을 다음과 같이 정의했다.

투자자본 1달러와 전력 1MW, Rack 한 개당 얼마나 많은 유료 TOKEN을 생산하는가.

AI Cloud의 원가구조를 단순화하면 다음과 같다.

TOKEN당 총원가

= GPU·Memory·Network·Data Center의 연간 고정비 ÷ 연간 유료 TOKEN 생산량
+ TOKEN 생산에 사용되는 전력·냉각·운영비

GPU와 Memory, Network, 데이터센터 건물은 일단 구매하면 사용량이 줄어도 감가상각비가 계속 발생한다.

따라서 TOKEN 생산량이 늘어나면 동일한 고정비를 더 많은 TOKEN에 나눠 부담할 수 있다.

예를 들어 연간 고정비가 100이라고 가정해보자.

  • TOKEN을 100개 생산하면 TOKEN당 고정비는 1이다.

  • TOKEN을 200개 생산하면 TOKEN당 고정비는 0.5로 낮아진다.

새로운 데이터센터를 건설하지 않고 기존 GPU의 TOKEN 생산량을 두 배로 늘릴 수 있다면, TOKEN당 감가상각비는 절반 가까이 낮아질 수 있다.

이 때문에 Cloud 사업자가 중요하게 보는 지표도 GPU 한 개의 구매가격에만 머물지 않는다.

  • TOKEN당 총소유비용

  • GPU당 TOKEN 처리량

  • Rack당 TOKEN 생산량

  • 전력 1MW당 매출

  • 고객의 응답시간 기준을 만족하는 Goodput

  • 생산된 TOKEN 중 실제 과금으로 연결되는 비율


Memory는 이 지표 대부분에 영향을 준다.


3. Memory Wall은 왜 GPU를 놀게 만드는가


GPU를 거대한 연산공장이라고 생각하면 이해하기 쉽다.

Tensor Core는 공장 안의 생산설비이고, HBM은 생산설비에 원재료를 공급하는 고속 컨베이어에 해당한다.

생산설비가 아무리 빨라도 컨베이어에서 원재료가 제때 도착하지 않으면 공장은 기다릴 수밖에 없다. AI GPU에서도 같은 현상이 발생한다.

LLM 추론은 크게 두 단계로 나뉜다.

Prefill

사용자가 입력한 Prompt 전체를 한꺼번에 읽고 처리하는 과정이다.

큰 행렬연산이 집중되므로 상대적으로 GPU 연산성능의 영향을 많이 받는다.

Decode

답변 TOKEN을 한 개씩 순차적으로 생성하는 과정이다.

TOKEN 하나를 만들 때마다 Model Weight와 이전 TOKEN의 정보를 저장한 KV Cache를 반복해서 불러와야 한다. 이 과정에서는 연산능력보다 HBM 용량과 Bandwidth가 병목이 되기 쉽다.

결국 Decode에서는 GPU에 작업이 배정돼 있고 전력도 소비하고 있지만, Tensor Core가 Memory에서 데이터가 도착하기를 기다리는 시간이 길어질 수 있다.

여기서 말하는 GPU 유휴가동률은 고객이 없어 GPU 전원이 꺼져 있는 비율과 다르다.

작업은 수행 중이지만 Memory와 Software 병목 때문에 GPU의 최대 연산능력을 매출로 전환하지 못하는 비중을 의미한다.

공개 연구에서는 Batch 1 Decode를 수행한 H100이 이론적 HBM Bandwidth의 약 27%만 활용한 사례가 확인됐다. CUDA Graph를 적용해 Kernel 실행 오버헤드를 줄이자 성능이 약 1.26배 개선됐다.

이는 LLM Decode가 Memory의 영향을 크게 받지만, Memory만 늘린다고 성능이 자동으로 비례 상승하는 것은 아니라는 점도 보여준다. Software, Kernel과 Scheduling이 함께 개선돼야 추가 Memory의 가치가 실현된다. (arXiv)

반대로 Memory 관리방식을 개선하는 것만으로 처리량이 크게 상승한 사례도 있다.

vLLM의 PagedAttention은 KV Cache의 파편화와 중복을 줄여 같은 GPU와 유사한 응답시간 조건에서 기존 Serving System보다 2~4배 높은 처리량을 기록했다. 물리적인 GPU를 추가하지 않고 Memory 활용방식만 바꿔 TOKEN 생산량을 늘린 사례다. (arXiv)

arXiv

vLLM의 PagedAttention은 KV Cache의 파편화와 중복을 줄여 같은 GPU와 유사한 응답시간 조건에서 기존 Serving System보다 2~4배 높은 처리량을 기록



GPU 유휴율을 어떻게 가정할 것인가


모든 Cloud 사업자에 적용할 수 있는 단일 GPU 유휴율은 존재하지 않는다.

Model 크기, Context 길이, Batch, 고객 요청량, Serving Software와 Network 구성에 따라 결과가 크게 달라지기 때문이다.

따라서 아래 계산에서는 업계 평균을 단정하지 않고, 이해를 돕기 위한 기준 시나리오를 설정했다.

  • 실제 TOKEN 생산에 사용되는 GPU 연산능력: 30%

  • Memory와 Software 병목으로 활용되지 못하는 연산능력: 70%


이 상태에서 Memory 개선으로 처리량이 증가하면 GPU의 생산적 활용률은 다음과 같이 변한다.


처리량이 60% 증가한다고 GPU 전체가 60% 더 바빠지는 것은 아니다.

기존 생산적 활용률 30%에 1.6배를 곱하면 48%가 된다.

그 결과 GPU 유휴 비중은 70%에서 52%로 낮아진다. Memory가 새로운 GPU를 만들어내는 것은 아니지만, 기존 GPU 안에서 놀고 있던 연산능력 18%p를 TOKEN 생산으로 전환하는 셈이다.




4. H100과 H200이 보여준 Memory의 경제성


Memory가 GPU 성능에 미치는 영향을 가장 쉽게 확인할 수 있는 사례가 H100과 H200이다.

두 GPU는 모두 Hopper Architecture를 기반으로 한다. H200의 가장 큰 변화는 HBM이다.


NVIDIA의 Llama 2 70B Benchmark에서 H200은 H100보다 최대 1.9배 높은 처리량을 기록했다. H100은 Batch 8, H200은 Batch 32가 적용됐다. (nvidia.com)

이는 Memory만 교체한 완벽한 통제실험으로 볼 수는 없다.

그러나 Batch를 8에서 32로 확대할 수 있었던 핵심 이유가 HBM 용량과 Bandwidth 확대라는 점이 중요하다. 추가 Memory가 더 많은 사용자의 KV Cache를 동시에 보관할 수 있게 만들면서 GPU의 연산설비를 더 효율적으로 활용한 것이다.

앞서 설정한 기준 시나리오에 적용하면 다음과 같다.

  • 개선 전 생산적 활용률: 30%

  • H200 처리량 개선: 최대 90%

  • 개선 후 생산적 활용률: 30% × 1.9 = 57%

  • 연산 유휴 비중: 70% → 43%


61GB의 추가 HBM과 더 높은 Bandwidth가 GPU의 연산 유휴 비중을 약 27%p 줄일 수 있다는 계산이다.

물론 모든 Model과 Workload에서 1.9배가 반복되지는 않는다.

그럼에도 H100에서 H200으로의 변화는 Memory가 단순히 GPU BOM을 높이는 부품을 넘어, 이미 구매한 Tensor Core를 실제 매출로 전환하는 자산이라는 점을 보여준다.




5. Blackwell과 Rubin에서는 Memory의 가치가 더 커진다


Hopper 이후 NVIDIA의 GPU 연산성능은 빠르게 증가하고 있다.

B200은 DGX H100보다 최대 15배의 추론성능을 제공한다고 NVIDIA는 설명한다. 이 수치에는 FP4 연산, Transformer Engine, NVLink와 Software Stack의 개선이 모두 포함돼 있으므로 전부를 Memory의 효과로 볼 수는 없다. (nvidia.com)

다만 GPU 연산성능이 Memory Bandwidth보다 빠르게 증가하면 새로운 문제가 발생한다.

연산기는 더 빨라졌지만 데이터를 공급하는 속도가 이를 따라오지 못하면서 Memory Wall이 오히려 커질 수 있다.

주요 NVIDIA GPU의 Memory 사양을 비교하면 다음과 같다.


DGX B200은 8개 GPU에 총 1,440GB의 HBM3E와 64TB/s의 Memory Bandwidth를 제공한다. GPU당으로 환산하면 180GB와 8TB/s다. (nvidia.com)

GB300은 약 288GB의 HBM3E를 탑재한다. NVIDIA는 더 큰 Memory가 Batch를 확대하고, 긴 Context를 사용하는 AI Reasoning의 최대 처리량을 높인다고 설명한다. (nvidia.com)

Rubin은 HBM 용량을 288GB로 유지하면서 Bandwidth를 22TB/s로 높인다. GB300 대비 약 2.75배에 해당한다.

Vera Rubin NVL72의 CPU Memory도 Rack당 54TB로 확대된다. GB300 NVL72의 17TB와 비교하면 세 배가 넘는 수준이다. (nvidia.com)

NVIDIA는 Vera Rubin NVL72가 GB200 NVL72보다 동일 전력에서 최대 10배 많은 TOKEN을 생산하고, 백만 TOKEN당 비용을 10분의 1로 낮출 수 있다고 제시한다. (nvidia.com)

다만 이 10배는 HBM4만으로 만들어지는 성능이 아니다.

  • NVFP4 연산성능

  • Rubin GPU

  • Vera CPU

  • HBM4

  • NVLink 6

  • Network

  • Attention 최적화

  • Prefill·Decode 분리

  • Serving Software


이 모든 요소가 함께 개선된 결과다.

따라서 Memory의 경제적 가치를 계산할 때는 전체 10배를 사용하지 않고, 그중 Memory가 직접 만들어내는 처리량만 보수적으로 분리해야 한다.


차세대 GPU에서 Memory가 기여하는 처리량 가정


아래 수치는 NVIDIA가 제시한 공식 Benchmark가 아니라, Capacity와 Bandwidth 변화에서 Memory의 기여분만 추출한 분석 가정이다.




B200은 전체 추론성능이 H200보다 훨씬 높지만, 그중 상당 부분은 FP4와 Tensor Core의 개선에서 발생한다. 따라서 Memory에 귀속되는 처리량은 60%로 제한했다.

GB300은 Bandwidth보다 Memory Capacity 확대가 중심이다. Long Context와 큰 Batch에서는 가치가 크지만, 짧은 Context에서는 일부 Memory가 남을 수 있어 처리량 증가를 35%로 가정했다.

Rubin은 Bandwidth가 2.75배 높아지지만, Network와 Kernel 등 다른 병목이 남아 있다. 이에 따라 Memory가 만들어내는 처리량 개선은 175%가 아닌 100%, 즉 두 배로 가정했다.


6. 추가 Memory는 Cloud 매출과 이익을 얼마나 늘리는가


Memory의 경제적 가치는 다음 식으로 계산할 수 있다.

추가 Memory의 경제적 가치

= GPU 시간당 매출
× 연간 시간
× 유료가동률
× Memory로 인한 처리량 증가율
× Cloud 사업자가 가져가는 매출 비중
× 추가 매출의 영업이익률
× 장비 사용기간의 현재가치

계산에는 다음과 같은 기준을 적용했다.


여기서 유료가동률 70%는 앞서 언급한 GPU 연산 유휴율 70%와 다른 개념이다.

  • 유료가동률은 고객이 GPU를 사용하며 요금을 지불하는 시간의 비율이다.

  • 연산 유휴율은 유료작업을 수행하는 도중에도 Tensor Core가 Memory를 기다리며 충분히 활용되지 못하는 비율이다.


처리량 증가분의 매출 회수율은 60%로 설정했다.

Cloud 사업자가 추가 처리량을 전부 가격으로 가져가기 어렵기 때문이다. 일부는 TOKEN 가격 인하, 더 빠른 응답속도와 고객 SLA 개선의 형태로 고객에게 돌아간다.

반면 Capacity가 부족한 Cloud 사업자는 기존 고객을 더 적은 GPU로 처리하고, 남는 GPU를 다른 고객에게 재판매할 수 있다.

Cloud 가격의 대리치로 CoreWeave의 공개가격을 사용했다.

  • H200: GPU당 시간당 6.31달러

  • B200: GPU당 시간당 8.60달러

  • GB200: GPU당 시간당 10.50달러

  • GB300: 4GPU당 시간당 61.44달러, GPU당 약 15.36달러


Rubin 가격은 공개되지 않아 GPU당 시간당 18달러를 분석 가정으로 사용했다. 실제 Hyperscaler의 장기계약 가격은 공개 On-demand 가격보다 낮을 수 있다. (CoreWeave)


H200에서 B200으로 전환할 경우


B200의 Memory 개선으로 처리량이 60% 증가한다고 가정했다.


계산 과정은 다음과 같다.

연간 추가 매출
= 8.60달러 × 8,760시간 × 70% × 60% × 60%
= 약 1.90만달러

여기에 추가 매출 영업이익률 60%와 4년 현재가치를 적용하면 GPU당 약 3.61만달러가 된다.

B200에 추가된 HBM Capacity와 Bandwidth를 확보하기 위해 GPU당 3만달러 이상의 Premium을 지불하더라도, Cloud 사업자는 4년간 발생하는 추가 영업이익으로 이를 회수할 수 있다는 의미다.


GB200에서 GB300으로 전환할 경우


GB300은 HBM Capacity 확대를 통해 더 큰 Batch와 긴 Context를 지원한다.

처리량 증가를 35%로 가정하면 다음과 같다.


GB300의 Memory 가치는 모든 워크로드에서 동일하지 않다.

짧은 Context의 소형 Model에서는 288GB의 HBM을 전부 활용하지 못할 수 있다. 반대로 긴 Context와 Reasoning, Agentic AI처럼 KV Cache가 빠르게 증가하는 환경에서는 추가 Capacity가 Batch와 TOKEN 매출로 직접 연결될 가능성이 높다.


GB300에서 Rubin으로 전환할 경우

Rubin은 HBM Capacity보다 Bandwidth 증가가 핵심이다.

HBM Bandwidth가 8TB/s에서 22TB/s로 2.75배 증가하지만, 계산에서는 Memory에 귀속되는 처리량 개선을 100%로 제한했다.



Rubin의 전체 성능은 GB200보다 최대 10배 높아질 수 있지만, 본 계산은 그중 Memory에 귀속되는 효과를 두 배로만 반영했다.

그럼에도 HBM4가 창출하는 경제적 가치는 GPU당 약 12.6만달러로 추정된다.

Rubin의 실제 Cloud 가격이 시간당 15달러에 그친다면 이 가치는 약 10.5만달러로 낮아진다. 시간당 20달러라면 약 14만달러까지 올라간다.

따라서 Rubin HBM4의 경제적 가치는 GPU당 약 10만~14만달러의 범위로 보는 것이 적절하다.


7. HBM·Server DRAM·NAND의 가치는 서로 다르다


모든 Memory가 GPU 유휴시간을 같은 정도로 줄이는 것은 아니다.

GPU 연산기와 가까울수록 TOKEN 처리량에 직접적인 영향을 주고, 더 높은 가격을 정당화할 수 있다.


HBM


HBM은 GPU Package에 직접 연결된다.

Decode 과정에서 Model Weight와 KV Cache를 Tensor Core에 공급하기 때문에, Capacity와 Bandwidth 증가는 GPU 처리량과 직접 연결될 가능성이 가장 높다.

  • Batch 확대

  • 더 큰 Model 상주

  • KV Cache 증가

  • CPU Memory Offloading 감소

  • GPU 간 통신 감소

  • TOKEN당 응답시간 단축


HBM이 가장 높은 가격결정력을 확보할 수 있는 이유다.


Server DRAM과 LPDDR


Host Memory는 HBM보다 느리지만 다음 데이터를 저장할 수 있다.

  • Cold KV Cache

  • 오래된 Context State

  • Model과 Activation

  • Prefix Cache

  • HBM에서 밀려난 데이터

  • GPU에서 곧 사용할 데이터의 Staging 영역


Rubin의 CPU Memory는 GB300 대비 GPU당 약 514GB 증가한다.

추가 Host Memory가 전체 처리량을 10% 개선한다고 가정하면 GPU당 4년 경제적 가치는 약 1.26만달러가 된다.

추가 DRAM 1GB당 가치는 다음과 같다.

1.26만달러 ÷ 514GB = 약 25달러/GB

처리량 개선 정도에 따라 가격경계도 달라진다.


Server DRAM은 HBM을 보조하지만 HBM Bandwidth를 완전히 대체하지 못한다. 따라서 HBM만큼 높은 가격 상승을 흡수하기는 어렵다.


Enterprise NAND


NAND는 정상적으로 Model이 HBM에 올라간 Steady-state Decode에서는 TOKEN을 직접 생산하지 않는다.

대신 GPU가 작업을 시작하기 전후의 대기시간을 줄인다.

  • Model Loading

  • Training Checkpoint 이동

  • Prefix Cache 저장

  • Cold KV Cache

  • Model 교체

  • Serverless 추론의 Scale-up

  • 데이터와 Model Repository


GPU당 4TB의 고성능 NAND가 전체 처리량을 3% 높인다고 가정하면 4년 경제적 가치는 약 3,800달러다.

3,800달러 ÷ 4TB = 약 950달러/TB

처리량 개선에 따른 가격경계는 다음과 같다.


NAND는 Model 전환과 Cache 재사용이 많은 환경에서 가치가 높아진다. 반면 같은 Model을 계속 실행하는 단순한 Batch Inference에서는 경제적 가치가 낮다.


8. 현재 Memory 가격은 경제적 상단에 도달했는가


HBM 계약가격은 고객과 공급업체 간의 장기계약으로 결정되기 때문에 정확한 가격이 공개되지 않는다.

공개된 Teardown과 시장자료에서는 B200의 HBM3E 비용을 GPU당 약 2,400~2,900달러 수준으로 추정한다. 일부 분석에서는 Packaging과 공급부족 Premium을 반영해 약 4,000달러까지 적용한다.

공식 계약가격이 아닌 분석용 대리치라는 점은 고려해야 한다. (Silicon Analysts)

(Silicon Analysts)


Rubin NVL72의 HBM4와 LPDDR5X, NAND를 합친 전체 Memory 비용은 Rack당 약 200만달러, GPU당 약 2.8만달러로 추정되고 있다. 이 역시 NVIDIA가 공개한 공식 BOM이 아니라 공급망 자료를 이용한 추정치다. (tomshardware.com)

Rubin의 전체 Memory 가치를 정리하면 다음과 같다.

  • HBM4 Bandwidth 개선 가치: GPU당 약 12.6만달러

  • 추가 Host Memory 가치: 약 1.26만달러

  • NAND 가치: 약 0.38만달러

  • 단순 합계: 약 14.2만달러


이 효과들은 일부 중복된다.

예를 들어 HBM이 충분하면 Host Memory Offloading의 가치가 낮아지고, Host Memory가 충분하면 NAND Cache의 추가효과도 줄어든다.

중복효과를 20~30% 할인하면 Rubin 전체 Memory System의 경제적 가치는 GPU당 약 10만~11만달러로 추정된다.

NVL72 Rack 기준으로는 약 720만~800만달러다.

현재 Memory 비용 추정치가 GPU당 약 2.8만달러라면, 전체 Memory 가격이 약 3~4배가 되기 전까지는 추가 TOKEN이 창출하는 영업이익으로 비용을 회수할 수 있다는 계산이다.

TrendForce도 일반 DDR5의 수익성이 HBM에 근접하거나 일부 조건에서 추월하면서 Memory 공급업체가 HBM 가격을 더 높여야 할 경제적 유인이 커지고 있다고 분석했다. HBM 생산은 일반 DRAM Wafer를 사용하기 때문에 HBM 가격이 충분히 높지 않으면 공급업체가 일반 DRAM 생산을 선호할 수 있다. (trendforce.com)

Cloud 사업자가 높은 Memory 가격을 수용하는 이유는 Memory 자체가 저렴해서가 아니라, Memory 부족으로 더 비싼 GPU가 놀면서 발생하는 손실이 더 크기 때문이다.


9. 최종 적정가격 경계


아래 수치는 Memory 업체의 실제 계약가격 전망이 아니다.

추가 Memory가 GPU 유휴시간을 줄여 만들어내는 Cloud 사업자의 매출과 영업이익을 역산한 경제적 경계다.

가격 상승 가능성은 두 단계로 나눠 봐야 한다.

이론적 가격 상승 범위


추가 Memory가 창출하는 경제적 가치를 Memory 공급업체가 모두 가격으로 가져간다고 가정한 최대 상단이다.

현실적 가격 상승 허용범위


NVIDIA의 GPU 가격 인상, TOKEN 가격 하락, 고객에게 이전되는 성능개선 효과, Software 최적화 실패와 낮은 가동률을 함께 반영한 범위다.

Memory 가격 상승 허용범위



표에서 현재 대비 3배는 가격이 기존 가격의 세 배가 된다는 의미다. 상승률로 표현하면 약 200% 상승에 해당한다.


이론적 상단과 현실적 상단이 다른 이유


B200 HBM3E의 경제적 가치는 GPU당 약 3.6만달러로 계산된다.

현재 HBM3E 비용을 2,400~4,000달러로 가정하면 이론적으로는 현재 가격의 약 9~15배까지 지불할 수 있다.

그러나 HBM 공급업체가 이 가치를 전부 가져갈 수는 없다.

Blackwell의 높은 TOKEN 생산성은 HBM뿐 아니라 다음 요소가 함께 만든다.

  • Tensor Core

  • FP4

  • NVLink

  • Network

  • Software Stack

  • Cooling

  • Rack 설계


NVIDIA도 GPU와 Rack 가격을 올릴 수 있고, Cloud 사업자는 성능개선 일부를 더 낮은 TOKEN 가격이나 더 빠른 응답속도로 고객에게 돌려줘야 한다.

따라서 B200 HBM3E의 이론적 상승 여력은 9~15배지만, 현실적으로 Cloud 사업자가 안정적으로 감당할 수 있는 범위는 약 3~5배로 보는 편이 적절하다.

GB300은 이론적으로 약 8~13배까지 가능하다.

다만 GB300의 가치는 Bandwidth보다 HBM Capacity 확대에서 발생한다. 짧은 Context에서는 추가 Memory가 남을 수 있으므로 현실적인 가격 상승 허용범위는 약 3~4배로 낮아진다.

Rubin HBM4의 이론적 가격 여력은 가장 크다.

HBM Bandwidth가 8TB/s에서 22TB/s로 증가하면서 Memory-bound Decode의 TOKEN 처리량을 직접 높일 수 있기 때문이다. GPU당 HBM4 비용을 8,000~1.2만달러로 가정하면, 경제적 가치 10만~14만달러는 현재 가격의 약 8~18배에 해당한다.

그럼에도 Rubin의 성능에는 GPU 연산, NVLink, Vera CPU와 Software 개선이 함께 반영된다.

이를 고려하면 Rubin HBM4의 현실적인 가격 상승 허용범위는 현재 대비 약 3~5배로 추정된다.

반면 Server DRAM과 NAND는 GPU 연산기에 직접 데이터를 공급하지 않는다.

HBM을 보조하고 GPU 대기시간을 줄일 수 있지만, Steady-state Decode의 핵심 병목을 완전히 제거할 수 없기 때문에 가격 상승을 흡수할 수 있는 범위도 상대적으로 낮다.


핵심 결론


Amazon의 실적과 어닝콜은 AI 데이터센터 투자의 경제성이 이미 확인되고 있음을 보여준다.

AWS 매출과 영업이익은 각각 37%, 64% 증가했고, 서버와 Network 장비의 투자비는 평균 3년 미만에 회수된다. 서버는 최소 5~6년 동안 사용되며, AI Capacity 계약도 대부분 5년 이상이다. (Amazon)

Cloud 사업자는 이미 가동 중인 AI 서버에서 충분한 현금흐름을 창출하고 있다.

이제 경쟁의 중심은 GPU를 얼마나 많이 구매했는지보다, 그 GPU로 얼마나 많은 유료 TOKEN을 생산하는지로 이동하고 있다.

이 과정에서 HBM은 단순한 원가 항목에 머물지 않는다.

HBM은 이미 구매한 GPU와 데이터센터의 유휴시간을 줄여 TOKEN 생산량을 늘리는 생산설비다.

H100에서 H200으로 넘어갈 때 HBM 용량은 76%, Bandwidth는 43% 증가했고, Llama 2 70B 처리량은 최대 90% 늘었다.

Blackwell과 Rubin에서는 GPU 연산성능이 더 빠르게 높아진다. 따라서 Memory가 충분하지 않을 때 놀게 되는 Tensor Core의 기회비용도 함께 커진다.

Rubin HBM4는 GB300보다 Bandwidth가 2.75배 높다. 전체 성능개선 가운데 Memory에 귀속되는 처리량을 두 배로 제한해도, GPU당 약 10만~14만달러의 경제적 가치가 발생한다.

결론은 분명하다.

HBM은 가격이 크게 상승해도 Cloud 사업자의 경제성이 유지될 가능성이 높다.


HBM의 적정가격 상단은 과거 Commodity DRAM 가격이나 제조원가만으로 결정되지 않는다.

다음 세 가지가 실제 가격경계를 결정한다.

  1. 추가 HBM이 얼마나 많은 GPU 대기시간을 줄이는가

  2. 회복된 GPU가 얼마나 많은 유료 TOKEN을 생산하는가

  3. 추가 TOKEN이 Cloud 사업자에게 얼마나 많은 영업이익을 남기는가


기준 시나리오에서 B200·GB300·Rubin HBM은 현재 대비 약 3~5배까지 가격이 높아져도 Cloud 사업자의 장기 경제성이 유지될 수 있다.

Server DRAM과 NAND의 가격 상승 여력은 HBM보다 낮다. GPU Tensor Core에 직접 데이터를 공급하는 정도가 낮기 때문이다.

Memory의 가격결정력은 다음 순서로 정리할 수 있다.

HBM4 > HBM3E > Server DRAM·LPDDR > Enterprise NAND


다만 최종적으로 봐야 할 지표는 HBM 가격 하나가 아니다.

NVIDIA가 GPU와 Rack 가격을 동시에 크게 올리고, TOKEN 가격은 빠르게 하락하며, Cloud의 유료가동률까지 낮아진다면 Memory의 경제적 가치도 줄어든다.

따라서 실질적인 가격경계는 다음 지점에서 형성된다.

GPU와 Memory를 포함한 Rack 전체 가격 상승률이 동일 전력당 유료 TOKEN 생산량 증가율을 넘어서는 시점


그 이전까지 Cloud 사업자에게 더 비싼 Memory는 비용 부담인 동시에 더 많은 매출과 이익을 생산하는 자산이다.

현재의 AI Cloud 투자회수기간과 차세대 GPU의 TOKEN 생산성 개선을 함께 고려하면, 적어도 HBM 가격은 시장의 기존 예상보다 훨씬 높은 수준까지 상승할 경제적 근거를 확보하고 있다.

주: 본 추정치는 본문에서 산출한 메모리 프리미엄의 적정 상방 가격을 SKH의 기존 출하량과 비용구조에 적용한 이론적 연간 실적 상단임.

정상적인 컨센서스 전망이 아닌 가격 민감도에 따른 기계적 Ceiling 추정치로 해석해야 함.
즉, AI Cloud 경제성이 훼손되기 전까지의 이론적·현실적 Ceiling으로 해석

주: 본 추정치는 본문에서 산출한 메모리 프리미엄의 적정 상방 가격을 SEC의 기존 출하량과 비용구조에 적용한 이론적 연간 실적 상단임.

정상적인 컨센서스 전망이 아닌 가격 민감도에 따른 기계적 Ceiling 추정치로 해석해야 함.
즉, AI Cloud 경제성이 훼손되기 전까지의 이론적·현실적 Ceiling으로 해석

=끝

2026년 7월 27일 월요일

생각정리 322 (* CXMT, Bonded DRAM)

CXMT의 향 후 생산량 수율 추정에 대해 알아보다 차세대 기술 로드맵을 다시 살펴보며, 그동안 충분히 공부하지 못했던 부분을 하나씩 확인해 기록으로 남겨본다.

급락하는 시장의 움직임에 일일이 대응하기보다, 당분간은 흔들리지 않고 공부를 이어가려 한다.




CXMT는 DDR5를 따라왔지만, 수율과 원가까지 따라온 것은 아니다


CXMT는 이미 DDR5와 LPDDR5X 제품을 공개했고, 일부 제품은 양산 단계에 진입했다.

CXMT는 2025년 LPDDR5X 양산을 발표했으며, 같은 해 11월에는 최대 8,000Mbps 속도와 24Gb 용량을 지원하는 DDR5 제품군을 공개했다. 제품 사양만 보면 삼성전자·SK하이닉스·마이크론과 비슷한 세대까지 올라온 것처럼 보인다. (CXMT)

그러나 여기에는 반드시 구분해야 할 문제가 있다.

DDR5·LPDDR5X 규격을 충족하는 제품을 만드는 능력과 해당 제품을 작은 다이 면적, 높은 수율, 낮은 비트당 원가로 대량생산하는 능력은 서로 다르다.

CXMT의 기술 진전은 분명하다.

다만 제품 발표와 제한적 양산을 근거로 선두업체와의 집적도·수율·원가 격차까지 해소됐다고 해석하기에는 아직 확인되지 않은 부분이 많다.

특히 Cell-on-Periphery 기반 Bonded DRAM을 적용할 경우 다이 면적을 줄일 가능성은 있지만, 별도의 Cell Wafer와 Periphery Wafer를 만들어 결합해야 한다. 이 과정에서 수율 변수와 제조원가가 동시에 늘어난다.

Bonded DRAM의 핵심은 단순히 본딩에 성공할 수 있느냐가 아니다. 두 종류의 웨이퍼와 본딩·박막화 공정을 결합해 얼마나 많은 양품을 낮은 원가로 생산할 수 있느냐에 있다.


1. CXMT는 어떻게 DDR5·LPDDR5X를 빠르게 공개할 수 있었을까


CPU나 GPU와 같은 로직 반도체와 DRAM은 기술 발전의 중심이 다르다.

로직 반도체는 같은 면적에 더 많은 트랜지스터를 집적해 연산 성능과 전력 효율을 높여왔다.

반면 범용 DRAM은 동일한 메모리 용량을 더 작은 면적에 구현해 웨이퍼 한 장에서 생산할 수 있는 비트를 늘리고, 비트당 원가를 낮추는 방향으로 발전해왔다.

DRAM 다이는 크게 두 영역으로 구성된다.

  • Cell Array: 실제 데이터를 저장하는 메모리 셀 영역

  • Core/Periphery: 메모리 셀을 제어하고 외부 시스템과 통신하는 주변회로 영역


Cell Array는 다이 면적과 집적도, 웨이퍼당 비트 생산량에 직접적인 영향을 준다.

Core/Periphery는 센스앰프, 행·열 디코더, 클럭, 전력관리, 명령·주소 처리, 입출력 회로 등을 포함한다. DDR5와 LPDDR5X의 데이터 전송속도, 전압, 타이밍과 인터페이스 규격은 이러한 주변회로 설계의 영향을 크게 받는다.

따라서 다음 두 질문은 구분해서 봐야 한다.

  1. DDR5 규격을 충족하는 제품을 구현할 수 있는가

  2. 같은 DDR5를 얼마나 작은 다이와 높은 수율, 낮은 원가로 생산할 수 있는가


CXMT는 첫 번째 단계에서 상당한 진전을 이뤘다.

그러나 두 번째 단계에서는 여전히 선두업체와 격차가 남아 있을 가능성이 크다.

TechInsights가 분석한 CXMT G4 16Gb DDR5의 다이 면적은 66.99㎟이며 비트 밀도는 0.239Gb/㎟다. 분석된 Feature Size는 약 16nm로 제시됐다. (TechInsights)

이는 CXMT가 DDR5 기능을 구현하는 데 성공했음을 보여준다.

동시에 동일 용량을 더 작은 면적으로 구현하는 집적도와 웨이퍼당 생산성에서는 추가적인 개선이 필요하다는 의미이기도 하다.

결국 CXMT의 DDR5·LPDDR5X 출시는 실질적인 기술 진전이다.

다만 제품 규격의 추격을 집적도·수율·Cost per Bit의 추격으로 확대해석해서는 곤란하다.


2. CXMT의 실제 DRAM 수율은 공개되지 않았다


CXMT는 DDR5와 LPDDR5X의 실제 웨이퍼 수율을 공개하지 않았다.

따라서 외부에서 확인할 수 있는 것은 제품의 존재, 다이 면적, 공정 특성, 고객 샘플링과 양산 여부 정도다.

이 글에서 사용하는 수율은 CXMT의 공식 수치가 아니다.

공개된 공정 정보와 Bonded DRAM의 구조적 특성을 바탕으로 생산성을 계산하기 위한 추정값이다.

CXMT의 Monolithic DRAM 완제품 수율은 다음 범위로 가정한다.


이후 계산에서는 **기존 Monolithic DRAM 수율을 78%**로 설정한다.

이는 정확한 공장 수율을 맞히기 위한 숫자가 아니다.

Bonded DRAM 구조를 적용했을 때 물리적 수율과 웨이퍼당 생산량, 전체 제조자원당 생산성이 어떻게 달라지는지 확인하기 위한 기준값이다.


3. Bonded DRAM은 어떤 구조인가


기존 Monolithic DRAM은 Cell Array와 Core/Periphery를 하나의 다이 안에 수평으로 배치한다.

Cell Array가 다이의 대부분을 차지하고, 주변부에 Core/Periphery 회로가 배치되는 구조다.

반면 Cell-on-Periphery 기반 Bonded DRAM은 두 영역을 서로 다른 웨이퍼에서 제조한 뒤 수직으로 결합한다.

  • 상단: Cell Wafer

  • 하단: Core/Periphery Wafer

  • 연결: Wafer-to-Wafer Hybrid Bonding


이 구조에서는 기존에 Cell Array 옆에 있던 주변회로를 아래쪽 웨이퍼로 이동시킬 수 있다.

그 결과 최종 다이의 바닥 면적을 줄이고, 웨이퍼 한 장에서 얻을 수 있는 Gross Die 수를 늘릴 수 있다.

최근 발표된 16Gb Vertical-Cell-Transistor 기반 4F² DRAM 연구에서는 Cell-on-Periphery 구조와 Wafer-to-Wafer Hybrid Bonding을 적용해 동일한 설계 규칙에서도 웨이퍼당 다이 수를 20% 이상 늘릴 수 있다고 제시했다. (IEEE Xplore)

그러나 이 연구 결과를 CXMT에 그대로 적용할 수는 없다.

해당 연구의 Cell 구조와 설계 규칙, 주변회로 면적이 CXMT 제품과 같다는 근거가 없기 때문이다.

따라서 이 글에서는 Bonded DRAM의 Gross Die 증가율을 다음과 같이 설정한다.


다이 면적 감소는 Bonded DRAM의 가장 분명한 장점이다.

그러나 다이 면적이 줄어든다고 수율과 원가까지 자동으로 개선되는 것은 아니다.


4. Bonded DRAM에서는 수율 변수가 늘어난다


기존 Monolithic DRAM은 하나의 웨이퍼에서 Cell Array와 주변회로를 함께 만든다.

반면 Bonded DRAM은 다음 단계가 모두 정상적으로 완료돼야 최종 양품을 확보할 수 있다.

  1. Cell Wafer가 정상적으로 제조돼야 한다.

  2. Core/Periphery Wafer가 정상적으로 제조돼야 한다.

  3. 두 웨이퍼가 정확하게 정렬돼야 한다.

  4. Hybrid Bonding 계면이 정상적으로 연결돼야 한다.

  5. 박막화와 후면공정을 통과해야 한다.

  6. 최종 전기검사와 신뢰성 평가를 통과해야 한다.


따라서 Bonded DRAM의 판매 가능 수율은 다음과 같이 계산할 수 있다.

Bonded DRAM 최종 판매 가능 수율

= Cell Wafer 기능 수율
× Core/Periphery Wafer 기능 수율
× Bonding·박막화·후면공정 통과율
× 최종 Bin·신뢰성 통과율


이 계산은 각 공정의 불량이 서로 독립적이라고 가정한 단순 모델이다.

실제 수율은 웨이퍼맵, 결함의 공간적 분포, 여분회로, 불량 다이 매칭과 검사 방식에 따라 달라질 수 있다.

그럼에도 두 웨이퍼와 추가 본딩공정의 수율이 모두 최종 제품에 영향을 준다는 기본 구조는 변하지 않는다.


5. Wafer-to-Wafer Bonding의 가장 큰 약점


Wafer-to-Wafer 방식에서는 Cell Wafer와 Periphery Wafer를 통째로 결합한다.

두 웨이퍼에서 같은 위치에 있는 다이가 모두 양품이어야 최종 제품이 정상적으로 작동한다.

예를 들어 Cell Wafer 수율이 81%, Periphery Wafer 수율이 90%라면 두 웨이퍼가 모두 정상인 다이의 비중은 다음과 같다.

Cell·Periphery 동시 양품률

= 81% × 90%

= 72.9%


본딩공정을 시작하기 전부터 최종 후보 다이의 비중이 약 72.9%로 줄어드는 셈이다.

Die-to-Wafer 방식은 Known Good Die만 선별해 붙일 수 있다.

반면 Wafer-to-Wafer 방식은 다이별로 자유롭게 위치를 바꿀 수 없다. 양쪽 웨이퍼에서 양품 위치가 겹치지 않으면 한쪽 다이가 정상이더라도 최종 제품으로 사용할 수 없다.

Wafer-to-Wafer Bonding의 생산성은 본딩장비의 성능뿐 아니라 투입되는 두 웨이퍼의 결함밀도에 크게 좌우된다.

다만 처리속도가 빠르고, 웨이퍼 전체를 한 번에 정렬할 수 있다는 장점도 있다. Applied Materials는 Wafer-to-Wafer Hybrid Bonding이 CIS와 NAND에 사용되고 있으며 DRAM에도 적용 가능성이 있는 기술로 설명한다. HBM과 같은 다단 적층에는 Known Good Die를 활용할 수 있는 Die-to-Wafer 방식이 주로 검토되고 있다. (Applied Materials)


6. 본딩공정 자체의 수율은 얼마나 될까


Hybrid Bonding에는 다음과 같은 불량원이 존재한다.

  • 웨이퍼 표면의 미세 파티클

  • CMP 평탄도 불균일

  • Cu Pad 높이 편차

  • Cu Dishing과 유전체 Erosion

  • 웨이퍼 휨

  • 정렬 오차

  • 본딩 계면 보이드

  • 열처리 과정의 응력

  • 박막화 과정의 웨이퍼 파손

  • 본딩 이후 접촉저항 불량


본딩 피치가 좁아질수록 허용할 수 있는 오차도 작아진다.

패드가 미세해지면 표면 평탄도와 Cu Recess, 웨이퍼 전체의 Overlay를 더욱 정밀하게 관리해야 한다.

SK하이닉스는 상용 DRAM 웨이퍼에 Wafer-to-Wafer Hybrid Bonding을 적용한 연구에서 본딩 이후에도 DRAM 동작과 셀 특성이 유지되는 것을 확인했다. 다만 이는 기술 적용 가능성을 입증한 연구이며 상업 양산수율을 공개한 것은 아니다. (SK hynix Research)

따라서 시험 구조에서 확인된 높은 연결수율을 DRAM 완제품 수율로 그대로 적용해서는 안 된다.

현실적인 Bonding·박막화·후면공정 통과율은 다음 범위로 추정할 수 있다.


이 글에서는 초기 양산 기준으로 **93%**를 사용한다.

이는 본딩 연결수율만 의미하지 않는다.

정렬과 본딩, 열처리, 박막화와 후면공정을 모두 통과하는 비율을 하나의 지표로 단순화한 값이다.


7. CXMT Bonded DRAM의 현실적인 기준 가정


CXMT가 Cell-on-Periphery 기반 Wafer-to-Wafer Bonded DRAM의 초기 양산 단계에 진입했다고 가정해보자.



각 수치는 CXMT가 공개한 실적이 아니다.

CXMT의 공정 수준과 Wafer-to-Wafer Bonding의 기술적 난도를 반영한 중심 시나리오다.

Cell Wafer 수율을 기존 Monolithic DRAM보다 약간 높게 설정한 이유는 Cell과 Periphery를 분리하면 하나의 다이에 포함되는 회로 종류와 면적이 줄어들 수 있기 때문이다.

다만 Cell Array는 여전히 DRAM에서 가장 공정 민감도가 높은 영역이다. 따라서 수율이 큰 폭으로 개선된다고 가정하지 않았다.

Core/Periphery Wafer에는 고종횡비 커패시터와 같은 Cell Array 공정이 포함되지 않는다.

이에 따라 Cell Wafer보다 높은 90%의 수율을 적용했다.


8. Bonded DRAM의 최종 판매 가능 수율


기준 가정을 계산식에 대입하면 다음과 같다.

Bonded DRAM 최종 판매 가능 수율

= 81% × 90% × 93% × 95%

= 0.81 × 0.90 × 0.93 × 0.95

= 0.6441

≈ 64.4%


기존 Monolithic DRAM과 비교한 상대 수율은 다음과 같다.

상대 수율

= 64.4% ÷ 78.0%

= 82.6%


따라서 초기 양산 단계 Bonded DRAM의 현실적인 최종 판매 가능 수율은 약 60~68%, 중심값은 약 64~65%로 추정할 수 있다.

물리적 수율만 보면 기존 Monolithic DRAM보다 낮다.

그러나 Bonded DRAM은 다이 면적을 줄여 웨이퍼당 Gross Die를 늘릴 수 있다. 생산성을 판단하려면 수율과 다이 면적 효과를 함께 계산해야 한다.


9. Gross Die 증가를 반영한 Cell Wafer 생산량


Bonded DRAM의 최종 판매 가능 수율은 64.4%다.

다이 면적 감소로 웨이퍼당 Gross Die가 20% 증가한다고 가정하면 양품 다이 생산량은 다음과 같다.

Bonded DRAM 양품 다이 지수

= 1.20 × 64.4%

= 77.3

기존 Monolithic DRAM의 양품 다이 지수는 다음과 같다.

Monolithic DRAM 양품 다이 지수

= 1.00 × 78.0%

= 78.0

두 값을 비교하면 다음과 같다.

Cell Wafer 기준 상대 생산량

= 77.3 ÷ 78.0

= 99.1%


Cell Wafer 한 장만 기준으로 보면 Bonded DRAM의 양품 비트 생산량은 기존 Monolithic DRAM과 거의 비슷하다.

수율은 낮아지지만 다이 면적 축소에 따른 Gross Die 증가가 이를 대부분 상쇄하기 때문이다.

이는 Bonded DRAM의 중요한 경제적 장점이다.

다만 이 계산에는 별도의 Periphery Wafer와 본딩라인, 초기 가동손실이 포함되지 않았다.

Cell Wafer당 생산량이 비슷하다는 사실이 전체 Fab 생산성과 원가까지 비슷하다는 의미는 아니다.


10. 초기 양산에서는 가동손실이 발생한다


새로운 본딩라인은 처음부터 성숙한 Monolithic DRAM 라인과 같은 가동률을 확보하기 어렵다.

상당한 웨이퍼와 장비시간이 다음 과정에서 소진된다.

  • Engineering Lot

  • 공정 Recipe 변경

  • 장비 Calibration

  • Cell Wafer와 Periphery Wafer 매칭

  • 공정 Hold와 불량 분석

  • CMP 조건 최적화

  • Cu Recess와 표면 활성화 조정

  • 웨이퍼 휨 제어

  • 박막화 조건 최적화

  • 고객 인증

  • 장기 신뢰성 평가

  • 속도 등급 선별

Bonded DRAM은 본딩 이후 불량이 발견되면 두 웨이퍼를 다시 분리해 재작업하기 어렵다.

불량 하나가 Cell Wafer와 Periphery Wafer의 가치를 동시에 손상시킬 수 있다.

초기 양산라인의 실행효율을 성숙 Monolithic DRAM 라인의 85%로 가정하면 다음과 같다.

달력시간 기준 상대 생산량

= Cell Wafer 기준 상대 생산량
× 초기라인 실행효율

= 99.1% × 85%

= 84.2%


장비 가동손실과 개발 웨이퍼까지 반영하면 **달력시간당 Cell Wafer 기준 생산량은 기존 공정의 약 84%**로 낮아진다.


11. 전체 제조자원까지 포함한 생산성


Bonded DRAM에는 Cell Wafer 외에 별도의 Periphery Wafer가 필요하다.

여기에 CMP, 세정, 정렬, Hybrid Bonding, 열처리, 박막화와 추가 검사공정도 투입된다.

기존 Monolithic DRAM의 제조자원을 1.00으로 놓고 다음과 같이 가정한다.


여기서 1.40은 웨이퍼 장수가 아니다.

같은 DRAM 1bit를 생산하는 데 필요한 장비 사용시간과 공정단계, 원재료, 추가 검사비용을 기존 Monolithic DRAM 대비 상대적인 값으로 환산한 것이다.

Cell Wafer 공정을 1.00이 아니라 0.85로 설정한 이유는 기존 Monolithic Wafer에 포함돼 있던 일부 Core/Periphery 공정이 별도 웨이퍼로 이동하기 때문이다.

즉, 기존 Monolithic Wafer 비용을 그대로 1.00으로 놓고 Periphery Wafer 비용을 추가하면 같은 공정자원을 일부 중복 계산할 수 있다.

전체 제조자원당 생산성은 다음과 같다.

전체 제조자원당 Bit 생산성

= 초기 가동손실 반영 생산량
÷ 가중 제조자원 지수

= 84.2% ÷ 1.40

= 60.2%


따라서 CXMT가 Bonded DRAM 초기 양산에 진입할 경우 전체 제조자원당 실질 Bit 생산성은 기존 Monolithic DRAM의 약 60% 수준으로 추정할 수 있다.

이 수치는 물리적인 웨이퍼 수율이 아니다.

Cell Wafer와 Periphery Wafer, 본딩라인, 장비 점유시간, 초기 가동손실과 추가 검사공정까지 포함한 Fab 전체 자원당 판매 가능한 Bit 생산성이다.


12. 생산단계별 현실적인 범위

Bonded DRAM의 생산성은 공정 성숙도에 따라 크게 달라질 수 있다.



CXMT가 실제 Bonded DRAM을 양산하더라도 처음부터 60%의 전체 제조자원당 생산성을 확보한다는 의미는 아니다.

초기 파일럿에서는 Engineering Lot과 장비 Calibration, 불량 분석에 투입되는 웨이퍼가 많아 생산성이 40~50% 수준에 머물 수 있다.

본딩수율과 가동률이 안정화되면 초기 양산 단계에서 55~65% 수준으로 개선될 수 있다.

장기적으로는 80% 이상까지 접근할 가능성도 있다.

그러나 별도의 Periphery Wafer와 본딩·박막화·검사공정이 필요하다는 구조적 특성 때문에 성숙 Monolithic DRAM과 완전히 같은 원가구조를 확보하기는 쉽지 않다.


13. Bonded DRAM의 진짜 난도는 공정 통합에 있다


Bonded DRAM을 평가할 때 Hybrid Bonding의 연결수율만 보면 전체 난도를 제대로 이해하기 어렵다.

실제 병목은 여러 공정이 동시에 맞아야 한다는 데 있다.

두 웨이퍼의 양품 위치가 겹쳐야 한다

Wafer-to-Wafer 방식은 Known Good Die만 골라 원하는 위치에 붙이기 어렵다.

Cell Wafer와 Periphery Wafer의 같은 위치가 모두 양품이어야 한다.

한쪽의 수율이 낮아지면 다른 쪽 웨이퍼의 정상 다이까지 함께 사용할 수 없게 된다.

웨이퍼 전체가 평탄해야 한다

Hybrid Bonding은 웨이퍼 일부만 연결하는 공정이 아니다.

300mm 웨이퍼 전체에서 유전체 표면과 Cu Pad가 균일하게 맞닿아야 한다.

미세한 파티클 하나도 주변에 본딩 보이드를 만들 수 있다.

CMP에서 발생하는 Cu Dishing과 유전체 Erosion, 웨이퍼 휨과 표면 잔류물도 수율에 영향을 준다.

본딩 이후에는 되돌리기 어렵다

본딩 전에 불량을 발견하면 해당 웨이퍼를 보류할 수 있다.

그러나 본딩과 박막화 이후 문제가 발견되면 Cell Wafer와 Periphery Wafer가 함께 손실될 수 있다.

불량 한 건이 두 개의 전공정 웨이퍼 가치를 동시에 훼손할 수 있다.

전기적 연결과 장기 신뢰성도 확보해야 한다

패드가 물리적으로 맞닿았다고 공정이 끝나는 것은 아니다.

접촉저항과 전류 특성, 열처리 이후 Cu 팽창, 유전체 계면, 웨이퍼 휨과 열응력을 모두 관리해야 한다.

박막화 이후 균열과 파손, 장기 사용 과정의 접촉 열화까지 평가해야 한다.

Bonded DRAM의 진짜 난도는 본딩 한 단계보다 Cell·Periphery·Bonding·Thinning·Test를 하나의 안정적인 양산공정으로 통합하는 데 있다.


14. Bonded DRAM은 DUV 문제를 없애는 기술이 아니다


Cell-on-Periphery 구조는 주변회로를 Cell Array 아래로 이동시켜 다이 면적을 줄일 수 있다.

그러나 Cell Array의 Word Line, Bit Line, Active Pattern과 커패시터 구조를 자동으로 미세화해주지는 않는다.

CXMT는 Cell Wafer에서 여전히 다음 문제를 해결해야 한다.

  • 미세 패턴 형성

  • 멀티패터닝 Overlay

  • CD Uniformity

  • 고종횡비 식각

  • 커패시터 균일도

  • 셀 누설전류

  • Refresh 특성

  • 장비 간 Matching

Bonded DRAM을 적용하면 여기에 새로운 과제가 더해진다.

  • Periphery Wafer 수율

  • Hybrid Bonding 수율

  • CMP와 Cu Recess

  • 웨이퍼 휨과 정렬

  • 박막화와 후면공정

  • 본딩 이후 전기적·열적 통합

  • 추가 신뢰성 검사

따라서 Bonded DRAM은 DUV 제약을 제거하는 기술이 아니다.

다이 면적과 공정 최적화의 자유도를 확보하는 대신 새로운 수율 학습곡선을 받아들이는 기술이다.


15. 자국산 DUV를 함께 도입하면 변수가 더 늘어난다


노광장비의 경쟁력은 목표 선폭을 한 번 구현할 수 있는지만으로 결정되지 않는다.

양산에서는 다음 지표가 함께 중요하다.

  • Overlay

  • Focus

  • CD Uniformity

  • Throughput

  • 장비 가동률

  • 장비 간 Matching

  • 광학계의 장기 안정성

  • 부품 수명

  • 유지보수

  • 계측·검사장비와의 연동

ASML의 NXT:1980Fi는 38nm 해상도와 함께 2.5nm의 Machine-Matched Overlay, 시간당 330장의 처리량을 제시한다. 이는 노광 가능한 최소 선폭뿐 아니라 Overlay와 생산성을 동시에 유지하는 능력이 중요하다는 의미다. (ASML)

특히 DUV 멀티패터닝에서는 노광과 식각 횟수가 늘어날수록 Overlay 오차와 공정비용이 누적된다.

자국산 DUV를 새로운 Bonded DRAM 라인에 함께 투입하면 다음 과제가 추가된다.

  • 반복 노광 안정성

  • 장비별 Overlay 편차

  • 기존 장비와의 Mix-and-Match

  • 새로운 공정 Recipe 개발

  • 장비 간 Matching

  • 부품 교체주기와 가동률

  • 계측장비와의 피드백 최적화

  • 장기간의 수율 데이터 축적

미국의 수출통제 역시 첨단 DRAM의 기술 기준과 관련 반도체 제조장비를 폭넓게 다루고 있다. 2024년 규정에는 DRAM 셀 면적과 메모리 밀도에 관한 기준도 포함됐다. (산업안전청)

자국산 장비와 Bonded DRAM을 동시에 도입하면 두 개의 학습곡선이 겹친다.

불량 원인이 Cell 공정에 있는지, 노광장비의 Overlay에 있는지, 본딩과 박막화에 있는지를 분리해 분석하는 작업도 더 복잡해진다.


16. HBM은 Bonded DRAM보다 훨씬 복잡하다


Cell-on-Periphery Bonded DRAM은 두 웨이퍼를 결합해 하나의 DRAM Die를 만드는 구조다.

HBM은 완성된 DRAM Die 여러 개와 Base Die를 다시 수직으로 적층해야 한다.

HBM에는 다음 공정이 추가된다.

  • TSV 형성과 구리 충전

  • 웨이퍼 박막화

  • Known Good Die 선별

  • 다단 적층

  • 마이크로범프 또는 Hybrid Bonding

  • Base Die

  • 패키지 휨 관리

  • 열관리

  • 중간 적층 검사

  • GPU와의 시스템 검증

  • 장기 신뢰성 평가

  • 고객사 인증

HBM은 여러 DRAM Die를 적층하기 때문에 Wafer-to-Wafer 방식보다 Known Good Die를 활용할 수 있는 Die-to-Wafer 방식의 중요성이 커진다. Applied Materials도 Wafer-to-Wafer 방식은 DRAM 적용 가능성이 있는 기술로, Die-to-Wafer 방식은 로직과 HBM DRAM에 관심이 높은 기술로 구분한다. (Applied Materials)

Bonded DRAM Die를 다시 HBM으로 적층한다고 가정하면 수율구조는 다음과 같이 복잡해진다.

Cell Wafer 수율
× Periphery Wafer 수율
× CoP Bonding 수율
× TSV·박막화 수율
× HBM 적층 수율
× Base Die 수율
× Package·Test 수율

Known Good Die 검사를 통해 불량 다이가 적층되는 것을 줄일 수 있다.

그러나 검사 횟수와 생산시간이 늘어나며, 적층에 사용할 수 있는 양품 다이의 절대 수량도 기본 DRAM 수율에 의해 제한된다.

Bonded DRAM에서 생산한 다이를 다시 HBM으로 적층하는 구조는 기술적으로 가능하더라도 원가와 수율 측면에서는 매우 높은 장벽을 가진다.


17. CXMT가 동시에 넘어야 할 네 개의 학습곡선


CXMT는 하나의 문제만 해결하면 되는 상황이 아니다.

① Cell Array 미세공정

제한된 장비 환경에서 Cell Array의 집적도와 수율을 높여야 한다.


② Cell-on-Periphery Bonded DRAM

Cell Wafer와 Periphery Wafer를 각각 안정화하고 Wafer-to-Wafer Hybrid Bonding을 양산 수준으로 끌어올려야 한다.


③ HBM

TSV, 박막화, 적층, Base Die, 열관리와 고객 인증을 동시에 해결해야 한다.


④ 자국산 반도체 장비

노광 해상도뿐 아니라 Overlay, Throughput, OEE와 장비 간 정합성을 확보해야 한다.

각 과제는 독립적으로도 긴 수율 학습곡선을 요구한다.

여러 과제를 동시에 추진하면 투자금은 늘릴 수 있다.

그러나 공정 엔지니어, 계측장비, 파일럿 라인, 양품 웨이퍼와 고객 인증 자원은 분산될 수밖에 없다.

공정변수가 늘어날수록 불량 원인을 구분하기도 어려워진다.

반도체 수율은 자본 투입만으로 단기간에 압축하기 어려운 경험과 누적 데이터의 함수다.


종합 판단


CXMT의 기술 발전은 분명하다.

DDR5와 LPDDR5X를 실제로 구현했고, 제품 속도와 용량도 빠르게 높이고 있다.

그러나 시장에서 과장되기 쉬운 부분은 기술의 존재 자체보다 제품 시현을 양산 경쟁력과 동일시하는 해석이다.

CXMT가 DDR5를 만들 수 있다는 사실과 선두업체 수준의 다이 면적, 수율, Cost per Bit으로 DDR5를 생산할 수 있다는 것은 서로 다른 문제다.

Bonded DRAM도 같은 관점에서 봐야 한다.

Cell Array와 Core/Periphery를 분리하면 최종 다이 면적을 줄이고 웨이퍼당 Gross Die를 늘릴 수 있다.

기준 시나리오에서는 다음과 같은 결과가 나온다.

  • Bonded DRAM 최종 판매 가능 수율: 약 64~65%

  • 다이 면적 감소에 따른 Gross Die 증가: 약 20%

  • Cell Wafer 기준 양품 생산량: 기존의 약 99%

  • 초기 가동손실 반영 생산량: 기존의 약 84%

  • 전체 제조자원당 Bit 생산성: 기존의 약 60%

Bonded DRAM은 생산량을 무조건 절반으로 떨어뜨리는 기술이 아니다.

다이 면적이 충분히 줄어들면 Cell Wafer 한 장에서 얻을 수 있는 양품 비트는 기존 Monolithic DRAM과 비슷한 수준을 유지할 수 있다.

그러나 하나의 DRAM을 만들기 위해 별도의 Periphery Wafer와 본딩·박막화·검사라인을 추가로 운영해야 한다.

이 때문에 전체 Fab 자원당 생산성은 Cell Wafer 기준 생산량보다 크게 낮아진다.

결국 Bonded DRAM의 경제성을 결정하는 핵심은 본딩수율 하나가 아니다.

  • Cell Wafer와 Periphery Wafer의 결함밀도

  • 두 웨이퍼의 양품 위치 중첩

  • 다이 면적 감소율

  • Bonding·박막화 통과율

  • 초기라인 가동률

  • 전체 공정자원과 검사비용

이 변수들을 모두 함께 봐야 한다.

CXMT의 가장 큰 과제도 개별 기술을 구현할 수 있느냐에만 있지 않다.

여러 기술을 각각 시현하는 데 성공하더라도 이를 하나의 제품 안에 결합해 높은 수율과 낮은 원가로 안정적으로 양산하는 과정에서 병목이 겹칠 수 있다.

현재 확인되는 것은 제품 세대의 빠른 추격이다.

아직 확인되지 않은 부분은 해당 제품을 얼마나 작게, 많이, 안정적으로, 저렴하게 생산할 수 있는가이다.


출처

  1. CXMT, LPDDR5X 양산 발표

  2. CXMT, DDR5·LPDDR5X 제품군 공개

  3. TechInsights, CXMT G4 16Gb DDR5 분석

  4. IEEE, Vertical Cell 4F² Cell-on-Periphery DRAM 연구

  5. SK하이닉스, Wafer-to-Wafer Hybrid Bonding의 DRAM 적용 연구

  6. Applied Materials, Hybrid Bonding 기술과 적용 분야

  7. ASML, TWINSCAN NXT:1980Fi 사양

  8. 미국 BIS, Advanced Computing & SME Rule 2024


#글을 마치며 


왜 기사에서는 수율과 원가가 빠져 있을까


그렇다면 왜 대부분의 기사는 CXMT의 Bonded DRAM이 감수해야 할 수율과 원가 문제를 충분히 다루지 않는 것일까.

가장 큰 이유는 CXMT가 실제 공정수율과 제조원가를 공개하지 않았기 때문이다. 외부에서 확인할 수 있는 것은 파일럿라인 구축 여부와 목표 공정, 제품 사양 정도다. Cell Wafer와 Periphery Wafer 수율, 본딩·박막화 통과율, 실제 다이 면적과 Cost per Bit은 공개되지 않았다.

이 때문에 기사들은 확인하기 쉬운 ‘12nm급 구현’, ‘EUV 우회’, ‘차세대 DRAM 진입’​에 집중한다. 반면 수율과 경제성을 분석하려면 두 웨이퍼의 결함밀도, 양품 위치 중첩, 본딩수율, 추가 공정비용과 장비 가동률까지 추정해야 한다.

파일럿라인과 양산라인의 차이도 기사에서 자주 생략된다.

파일럿라인은 기술이 작동하는지 확인하는 단계다. 양산라인은 같은 결과를 반복하면서도 충분한 수율과 낮은 원가를 확보해야 한다. 본딩에 성공했다는 사실과 시장에서 경쟁력 있는 가격으로 대량생산할 수 있다는 사실 사이에는 상당한 거리가 있다.

시험구조에서 발표되는 높은 연결수율도 DRAM 완제품 수율과는 다르다. 실제 제품은 본딩 이후에도 Cell 특성, 접촉저항, 속도등급, 열응력과 장기 신뢰성 평가를 모두 통과해야 한다.

여기에 CXMT 관련 보도가 중국의 반도체 자립과 기술 추격이라는 프레임에 집중하면서 공정경제성은 상대적으로 뒤로 밀리기 쉽다. 12nm라는 숫자는 기술격차 축소를 직관적으로 보여주지만, 그 제품을 만들기 위해 투입되는 웨이퍼와 공정자원은 제목에 드러나지 않는다.

따라서 기사에 수율 문제가 언급되지 않는다고 해서 수율 희생이 없다고 해석해서는 안 된다.

Bonded DRAM으로 12nm급 집적도를 구현하는 것은 미세공정 격차의 일부를 구조적으로 우회하는 방법이다. 그러나 이는 기존 격차가 사라지는 것이 아니라, 미세화의 어려움을 본딩수율과 추가 제조원가라는 새로운 과제로 바꾸는 것이다.

결국 중요한 질문은 CXMT가 12nm급 제품을 만들 수 있는지가 아니다.

몇 장의 웨이퍼와 얼마의 공정자원을 투입해야 하며, 그 결과 몇 개의 판매 가능한 비트를 확보할 수 있는지가 핵심이다.

현재 확인되는 것은 기술 시현과 제품 세대의 추격이다.

아직 확인되지 않은 것은 그 기술을 얼마나 많이, 안정적으로, 저렴하게 양산할 수 있는가​이다.

=끝