레이블이 AI인프라인 게시물을 표시합니다. 모든 게시물 표시
레이블이 AI인프라인 게시물을 표시합니다. 모든 게시물 표시

2026년 9월 20일 일요일

생각정리 374 (* Pacing Is Pace Up)

인내심 바닥이면 어쩔껀데... 그럼 다른 원전 EPC 찾아보던가..
대미투자 “파기 가능성 배제못해”… 美측 ‘인내심 한계’

AI의 속도를 늦춘다는 말과 더 빨라지는 Compute·전력·원전 투자


OpenAI와 Anthropic은 AI Capability의 발전 속도를 조절해야 한다고 주장한다.

그러나 실제 자본배치를 보면 두 회사는 향후 수년 동안 20GW 이상, 중복 가능성을 포함한 계약·투자금액 기준 약 $1.2T의 Compute Infrastructure를 확보하려 하고 있다.

AI의 속도를 늦춰야 한다는 말과 세계에서 가장 빠른 속도로 GPU, ASIC, Cloud와 Data Center를 확보하는 행동이 동시에 나타나고 있는 것이다.

Steven Eisman은 이 모순을 직설적으로 지적했다.

“Put your money where your mouth is. Postpone your IPO.”

AI가 정말 인류멸망에 가까운 위험이라면 IPO와 자본조달부터 늦춰야 한다는 주장이다. 그는 OpenAI와 Anthropic이 안전위기를 강조하는 이유 중 하나로 모델 자체의 약한 해자와 규제를 통한 진입장벽 구축 가능성을 지목했다.
(Business Insider)

https://www.youtube.com/watch?v=Q1jSJG1iBL8
7분50초부터~
세상 모든 개소리들을 귀신같이 잘 잡아내는 아저씨..;

Steven Eisman의 논리 요지

토큰 사용량 성장 둔화·오픈웨이트 모델 확산 → 경쟁 심화 및 가격 하락 → 데이터센터·자본비용 상승 → 수익성 압박 → 안전성 공포 부각 → 연방정부 규제 유도 → 신규 경쟁자 진입 제한 → 기존 사업자의 가격결정력 방어

 

다만 이번 글에서는 앞서 정리한 내용을 반복하지 않으려 한다.

OpenAI와 Anthropic의 Compute 투자, 미국의 AI 산업전략, Open Weight 모델의 추격, 한국과 일본의 대미투자 구조는 아래 글로 갈음한다.

이번 글에서 더 생각해보고 싶은 부분은 그 다음 단계다.

AI Data Center에 필요한 전력수요가 아무리 크더라도 발전소는 투자계획만으로 지어지지 않는다. 누군가는 설계와 인허가, 기자재 조달과 현장시공을 책임져야 하고, 그 과정에서 발생하는 공기지연과 비용초과 위험을 부담해야 한다.

결국 AI Compute의 Pace Up이 현실화될 수 있는지는 전력 인프라의 Risk와 Return을 누가 어떻게 나눠 갖느냐에 달려 있다.


1. Pacing은 Compute의 감속을 의미하지 않는다


OpenAI와 Anthropic이 말하는 Pacing은 모델 학습을 중단하는 것이 아니라, Capability가 외부에 공개되고 다른 AI의 연구개발을 가속하는 속도를 관리하는 개념에 가깝다.

그러나 모델 출시를 늦추는 동안에도 내부에서는 더 많은 Post-training과 Reinforcement Learning, Evaluation과 Monitoring이 필요하다.

Training
→ Evaluation
→ Security·Alignment Test
→ Monitoring
→ Additional RL
→ Re-evaluation
→ Deployment

안전을 강화할수록 이 과정은 길어지고, 각 단계에서 추가 Compute가 투입된다.

따라서 외부에 공개되는 Capability의 속도는 늦출 수 있어도, 내부의 Compute 소비와 데이터센터 투자는 오히려 빨라질 수 있다.

Capability Release Pace Down
→ Safety·Evaluation Compute Up
→ Data Center CAPEX Up

그들이 말하는 Pacing이 현실에서는 Pace Up으로 이어지는 이유다.

OpenAI는 2026년부터 2030년까지 Compute와 AI 인프라에 약 $856B을 지출할 계획이다. 같은 기간 누적 Free Cash Flow는 약 -$278B으로 예상되며, 2030년 매출 목표는 $350B에 달한다.
(Financial Times)

물리적인 인프라 측면에서도 OpenAI는 이미 개발 중이거나 확보한 Compute Capacity가 10GW 이상이라고 밝혔다. Stargate만 해도 장기적으로 $500B, 10GW 규모를 목표로 한다.
(OpenAI Compute Infrastructure, Stargate)

Anthropic도 방향은 다르지 않다.

Amazon과의 계약은 최대 5GW, 누적 계약가치 기준 $100B 이상​으로 추정된다. Google·Broadcom과는 여러 GW 규모의 TPU 및 ASIC Compute를 확보하고 있으며, 관련 장기 계약은 약 $200B으로 보도됐다.

여기에 Fluidstack을 통한 미국 내 데이터센터 투자 $50B, AMD Instinct GPU 도입 최대 2GW​가 추가된다. 이를 종합하면 Anthropic은 2027년 말까지 약 10GW, 장기 계약금액 기준 $350~380B 수준의 Compute Infrastructure를 확보하는 방향으로 움직이고 있다.
(Anthropic–Amazon, Anthropic–Fluidstack, AMD–Anthropic)

이를 단순하게 정리하면 다음과 같다.



물론 이 금액을 모두 독립적인 신규 CAPEX로 더해서는 안 된다. Cloud 계약 안에 GPU와 ASIC, 데이터센터 건설비와 전력비가 포함될 수 있고, 일부 인프라 계약은 서로 중복될 가능성이 있다.

그럼에도 두 회사가 향후 확보하려는 물리적 Capacity가 20GW 이상이라는 방향성은 분명하다. 현재 전 세계 AI Critical IT Load를 대략 33~44GW로 추정하면, 두 회사의 계획만으로도 그 중간값 대비 절반을 넘는 규모다.

이것은 속도 조절을 위한 자본배치가 아니다.

인류 역사상 가장 빠른 속도의 Compute 증설계획이다.




2. 모델 해자가 약해질수록 인프라와 규제 해자가 중요해진다


OpenAI와 Anthropic의 모델이 앞으로도 지속적으로 압도적인 우위를 유지할지는 확신하기 어렵다.

Open Weight 모델의 성능은 빠르게 개선되고 있고, 동일한 성능을 구현하는 Token Cost는 지속적으로 낮아지고 있다. 특정 Benchmark에서 1위를 유지하는 기간도 과거보다 짧아지고 있다.

모델이 범용화될수록 경쟁의 중심은 다음 영역으로 이동할 가능성이 높다.

  • GPU와 ASIC을 선점할 수 있는 구매력

  • 장기 전력계약을 체결할 수 있는 신용도

  • 대규모 데이터센터에 접근할 수 있는 자본조달 능력

  • 사용자 Distribution과 Enterprise Integration

  • 모델 평가·보안·정렬을 위한 내부 데이터

  • 정부의 안전규제를 충족할 수 있는 Compute와 조직


즉 Model Moat가 약해질수록 Infrastructure Moat와 Regulatory Moat의 중요성은 커진다.

모델을 잘 만드는 것만으로는 부족하다. 경쟁자가 따라오기 어려운 자본집약적 인프라를 선점하고, 자신들이 충족하기 유리한 안전·평가 기준을 산업표준으로 만들어야 한다.


3. Too Big to Fail이 아니라 Too Connected to Fail


OpenAI와 Anthropic은 더 이상 일반적인 소프트웨어 스타트업으로 보기 어렵다.

두 회사는 Cloud 사업자와 GPU·ASIC 공급업체, 데이터센터 개발사와 전력회사, 프로젝트 금융기관과 장기계약으로 연결돼 있다.


출처 : 블룸버그

OpenAI나 Anthropic 중 한 곳이 무너지면 투자자의 지분가치만 사라지는 것이 아니다. Cloud 매출과 반도체 주문, 데이터센터 임대계약과 전력구매계약, 발전소와 송전망 투자계획의 현금흐름이 함께 흔들릴 수 있다.

그 뒤에는 미국이 한국과 일본에서 끌어온 수천억 달러의 전략산업 투자도 연결돼 있다.

이는 전통적인 의미의 Too Big to Fail과는 조금 다르다.

자산규모가 커서 구제해야 하는 것이 아니라, 미국 AI 산업의 거의 모든 공급망과 연결돼 있어 실패의 충격을 분리하기 어렵다는 의미에서 Too Connected to Fail에 가깝다.

미국 정부가 두 회사를 직접 구제하거나 의도적으로 규제 해자를 제공한다고 단정할 수는 없다.

그러나 두 회사의 성장이 미국의 반도체와 데이터센터, 전력설비와 원전, 동맹국의 대미투자 성과를 좌우한다면 정책당국 역시 이들을 단순한 민간 스타트업으로만 취급하기는 어려울 것이다.

말과 행동이 다르면,
행동을 보는 편이 좀 더 정확하다
.


4. Bechtel–TerraPower 결별이 보여주는 경고


최근 Bechtel과 TerraPower는 Wyoming Natrium 프로젝트의 다음 단계 진행조건에 합의하지 못하고 각자의 길을 가기로 했다.

양사는 가격, 공기보증, 설계변경 책임 등 구체적인 결렬 사유를 공개하지 않았다. 현재 확인할 수 있는 사실은 양측이 프로젝트 다음 단계의 조건에 합의하지 못했다는 데까지다.
(Construction Dive)

다만 결별 시점은 눈여겨볼 필요가 있다.

Natrium 프로젝트는 이미 초기 설계와 인허가, 비원자력 시설 공사가 진행됐고, 2026년 3월에는 NRC로부터 Kemmerer Unit 1 건설허가를 확보했다. 이후 본격적인 원자로 시공 단계로 넘어가는 과정에서 양사의 다음 단계 계약이 결렬됐다.
(TerraPower, Bechtel)

가격이나 책임배분이 실제 결렬 사유였다고 확인된 것은 아니다.

그러나 최초호기 원전 EPC 계약에서 협상의 핵심이 되는 항목은 비교적 명확하다.

  • 미확정 설계와 추가설계 비용

  • 인허가 변경에 따른 공기연장

  • 현지 기자재 공급망의 납기와 품질

  • 숙련된 원전 노동자의 확보

  • 물가와 인건비 상승

  • 장기 공사기간 중 금융비용

  • 공기지연에 따른 지체상금

  • 시운전 과정에서 발생하는 성능보증 책임


Natrium은 최초의 상업용 소듐냉각 고속로이고 AP1000은 이미 가동실적을 보유하고 있다는 차이가 있다. 따라서 두 사업의 기술적·시공 위험을 동일하게 볼 수는 없다.

그럼에도 미국에서 원전을 다시 건설할 때 발생하는 문제는 크게 다르지 않다.

설계와 현장시공 사이의 Interface를 누가 책임질 것인지, 인허가 변경과 공기지연으로 발생하는 추가비용을 발주처·원천기술사·EPC사가 어떤 비율로 부담할 것인지가 결국 사업의 수익성을 결정한다.

Bechtel 사례는 전력수요가 아무리 강하고 정부 지원이 충분하더라도, Risk & Return 구조가 맞지 않으면 세계적인 원전 시공사도 프로젝트에서 물러날 수 있다는 경고다.


Bechtel  최초호기 특유의 미확정 비용과 일정 위험을 자신이 통제할 수 있는 범위보다 크게 부담하는 EPC 조건에 합의하지 못해 철수


5. 대미투자 협상 난항이 보여주는 징조


한국은 미국과의 무역협정 과정에서 조선업 $150B, 전략산업 $200B 등 총 $350B 규모의 대미투자를 약속했다.

그러나 아직 구체적인 투자대상과 첫 송금 시점은 확정되지 않았다. 최근 한국 정부는 첫 번째 투자사업의 일부 조건을 수용하지 않고 추가협상을 지시했으며, 투자는 반드시 상업적으로 합리적이어야 한다는 입장을 밝혔다.
(Financial Times)

현재 협상대상으로 원전과 Texas Gas Power Project 등이 거론되고 있지만, 구체적인 사업과 투자금액은 공식적으로 확정되지 않았다.

따라서 이를 곧바로 원전 EPC 계약의 결렬이나 특정 사업의 중단으로 해석할 필요는 없다.

다만 한국 측이 강조하는 ‘상업적 합리성’은 향후 협상의 핵심이 단순한 투자금액보다 수익과 손실, 공기지연과 비용초과 위험을 누가 부담하느냐에 있음을 보여준다.

미국이 투자대상과 사업구조를 주도하고 한국이 자본과 기자재, EPC를 공급하는데, 프로젝트의 추가비용과 공기지연 위험까지 한국이 부담한다면 구조적으로 불리할 수밖에 없다.

특히 원전 사업에서 EPC사의 이익은 계약금액의 제한된 일부인 반면, 설계변경과 공기지연으로 발생하는 손실은 당초 예상이익을 크게 넘어설 수 있다.

따라서 한국의 대미투자 협상은 “얼마를 투자할 것인가”보다 다음 조건이 중요하다.

  • Fixed-price EPC의 책임범위

  • 설계변경에 대한 원천기술사의 책임

  • 물가·인건비 상승분의 계약금액 연동

  • 지체상금과 총손해배상 한도

  • 인허가 지연에 대한 공기연장 인정

  • 장주기 기자재 납기지연 책임

  • 정부 금융보증과 Cost Overrun Backstop

  • 프로젝트 Equity와 장기 운영수익 배분


투자금액의 크기보다 위험조정 수익률이 중요하다.

전력부족이 심하다고 해서 모든 발전소 EPC 프로젝트의 수익성이 자동으로 좋아지는 것은 아니다. 오히려 수요가 급할수록 발주처는 공기보증을 요구하고, 최초호기일수록 예상하지 못한 위험은 EPC사에 집중될 수 있다.


6. Westinghouse IPO와 가치배분의 비대칭


이런 상황에서 Westinghouse는 미국 증시 IPO를 추진하고 있다.

Westinghouse는 SEC에 비공개 방식으로 IPO 예비서류를 제출했으며, Bloomberg는 회사가 $50B 이상의 기업가치를 목표로 하고 있다고 보도했다.
(Wall Street Journal, Bloomberg)

Brookfield와 Cameco 컨소시엄이 2023년 Westinghouse를 인수할 당시 Enterprise Value는 약 $7.875B이었다. IPO 목표가치와 인수 당시 EV는 기준이 완전히 동일하지 않지만, 단순 비교하면 3년 만에 6배가 넘는 가치평가를 기대하는 셈이다.
(Cameco, Westinghouse Acquisition Closing)

가치가 급격하게 상승한 배경에는 AI 데이터센터의 전력수요가 있다.

Westinghouse는 AP1000 원천기술과 설계·라이선스, 핵연료와 유지보수 사업을 보유하고 있다. 원전 건설이 늘어나면 신규 원자로 매출뿐 아니라 수십 년 동안 이어지는 핵연료와 서비스 수익도 확보할 수 있다.

반면 실제 현장에서 원전을 건설하는 EPC 사업자는 제한된 계약마진을 받는 대신 공사비 초과와 공기지연, 인력과 공급망 위험을 부담할 수 있다.

이 경우 가치배분의 비대칭이 발생한다.

AI 전력부족과 원전 재평가에 따른 Valuation Upside는 원천기술 보유자가 가져가고, 실제 건설 과정의 Tail Risk는 EPC사와 투자자가 부담하는 구조가 될 수 있다.

한국이 대규모 자본과 원전 주기기, EPC와 운영역량을 함께 제공한다면 단순한 Fixed-price 시공계약만으로는 충분하지 않다.

프로젝트 Equity와 SPV 지분, 장기 운영·정비 계약, 기자재 공급권과 후속호기 참여권까지 포함해 장기적인 Return을 확보해야 한다.

그렇지 않으면 미국은 기술과 기업가치 상승을 가져가고, 한국은 자본과 실행위험을 부담하는 구조가 될 수 있다.


7. 미국에 한국이 유일한 선택지인가


문자 그대로 한국만이 미국 원전을 건설할 수 있는 것은 아니다.

미국에는 Bechtel과 Kiewit, Fluor와 Turner 등 대형 건설·엔지니어링 업체가 있다. Westinghouse 역시 미국 내에서 40개 이상의 AP1000 Supply Chain Partner를 확보했다고 밝혔다.
(Westinghouse 공급망 발표)

그러나 다음 네 가지를 동시에 제공할 수 있는 동맹국으로 범위를 좁히면 한국의 위치는 상당히 독보적이다.

  • 정부와 정책금융을 통한 대규모 자본

  • 원자로용기·증기발생기 등 원전 주기기 제작

  • 대형원전 EPC와 적기 준공 경험

  • 원전 운영과 정비 역량


중국과 러시아는 국가안보상 배제된다. 프랑스는 원전 기술과 운영역량을 보유하고 있지만 미국 내 EPR 건설실적이 없고, 일본은 자본과 기자재를 제공할 수 있으나 대형원전의 통합 EPC와 운영체계는 제한적이다.

따라서 정확한 표현은 다음과 같다.

미국이 원전 기술만 확보하려면 한국이 유일한 선택지는 아니다. 그러나 대규모 자본·주기기·EPC·운영을 하나의 패키지로 제공할 수 있는 현실적인 동맹국은 사실상 한국으로 좁혀진다.


이는 한국의 협상력이 생각보다 강할 수 있다는 의미다.

미국의 2030년대 원전 착공계획은 Westinghouse의 설계와 라이선스만으로 완성되지 않는다. 장주기 기자재를 생산하고, 숙련된 인력을 투입해 실제 현장에서 공정을 관리할 실행주체가 필요하다.

Bechtel 사례는 그 실행주체가 무조건 위험을 받아들이지는 않는다는 사실을 보여준다.

한국 역시 미국의 전력부족과 긴급한 원전 수요를 이유로 불리한 책임구조까지 받아들일 필요는 없다.


글을 마치며


OpenAI와 Anthropic의 Pacing은 AI 산업 전체의 속도를 늦추는 전략이 아니다.

외부에 공개되는 Capability의 속도를 조절하는 동안 내부에서는 더 많은 Post-training과 Evaluation, Monitoring이 수행된다. 이에 따라 데이터센터와 전력 인프라 투자는 오히려 빨라진다.

그 흐름은 다음과 같다.

Capability Pacing
→ Safety Compute 증가
→ Data Center CAPEX 증가
→ 전력부족 심화
→ 원전·SMR·Gas·Grid 투자 증가
→ EPC와 기자재 수요 증가

그러나 여기서 마지막 화살표가 자동으로 이어지는 것은 아니다.

발전소를 건설할 EPC사가 공기지연과 설계변경, 비용초과 위험에 비해 충분한 Return을 확보하지 못한다면 프로젝트는 착공되지 않거나 진행 도중 멈출 수 있다.

Bechtel–TerraPower 결별은 그 위험을 보여준 첫 번째 경고에 가깝다. 대미투자 협상에서 한국 정부가 상업적 합리성을 강조하는 것 역시 같은 문제를 향하고 있다.

Westinghouse의 기업가치는 AI 전력수요와 원전 재평가를 반영해 급격히 상승하고 있다. 반면 실제 건설위험을 부담하는 EPC사와 투자자의 수익구조가 개선되지 않는다면 원전 Renaissance는 발표와 계약을 넘어 실물 Capacity로 이어지기 어렵다.

결국 AI 시대의 진짜 병목은 원자로 설계도나 투자발표의 부족이 아닐 수 있다.

불확실한 원전 건설위험을 감당하면서도 적정한 수익을 확보할 수 있는 자본과 EPC 실행역량이 가장 희소한 자원이 될 가능성이 높다.

따라서 한국의 대미 원전투자에서 중요한 것은 수주금액의 크기보다도  누가 Upside를 가져가고, 누가 Downside를 부담하는지에 대한 Risk adjusted Expected Return일 가능성이 높다. 

미국의 전력부족이 심해질수록 한국의 원전 EPC 역량은 더 필요해질 것이다. 그러나 그 희소한 실행역량의 가치는 충분한 Return과 책임한도, 장기 운영수익으로 보상받아야 한다.

대미협정 원전투자와 관련해서는 한국측이 좀 더 배짱을 부려봐도 괜찮은 국면이 아닌가 싶기도 하다.

미국을 포함한 글로벌 디젤 수급이 빠듯해지고 가격까지 상승하는 상황에서, 비상발전기나 육상 가스엔진발전으로 AI 데이터센터의 전력부족을 장기간 메우는 방식은 경제성과 지속가능성 모두 한계가 분명하다.

결국 24시간 안정적인 대규모 전력이 필요한 AI 데이터센터는 단기적으로 가스·디젤 발전에 의존하더라도, 장기적으로는 원전을 비롯한 기저전원으로 회귀할 수밖에 없지않나 싶다. 


급한건 미국이지 않을까 싶다.

=끝

2026년 9월 13일 일요일

생각정리 365 (* Pacing Needs More Compute)

먼저 정상에 오른 기업이 안전 규제를 명분으로 진입장벽을 높이는 것일까..?


지난 주말 Anthropic의 Dario Amodei가 프런티어 AI의 속도조절을 제안했고, Sam Altman과 Elon Musk, Demis Hassabis도 그 방향에 공감했다.

https://t.me/one_going

처음 이 소식을 접하면 AI 모델 개발이 정점을 지나고 있는 것인지, 데이터센터와 GPU 투자도 함께 줄어드는 것인지 생각할 수 있다.

하지만 원문과 최근 프런티어 랩의 컴퓨팅 사용 구조를 함께 보면 다른 그림이 보인다.

AI는 이미 상당한 지능을 확보했다. 이제는 그 지능을 실제 업무에 사용할 수 있도록 다듬고, 도구와 연결하고, 안전하게 운용하는 데 더 많은 컴퓨팅을 사용하기 시작했다.

따라서 이번 속도조절론은 AI 인프라 수요 둔화보다 안전하게 사용할 수 있는 컴퓨팅을 얼마나 많이 확보할 수 있는가가 더 중요해지는 변화에 가깝다고 생각한다.

1. 속도조절의 대상은 CAPEX가 아니다


Amodei가 사용한 표현은 명확하다.

“We must slow the pace at which we improve the capabilities of AI models.”

속도를 조절해야 하는 대상은 데이터센터 건설이나 가속기 구매가 아니라 AI 모델의 능력이 향상되는 속도다.

AI가 다음 세대 AI의 개발을 돕기 시작하면서 발전 속도가 더욱 빨라지는 재귀적 자기개선, 즉 RSI가 정렬과 보안 역량을 앞서지 않도록 중간에 안전 검증 단계를 넣자는 것이다.

훈련 컴퓨팅 제한도 가능한 수단 중 하나로 언급했다.
그러나 이를 확정된 기본안으로 제시하지는 않았다.

Amodei는 Pacing이 모델 훈련이나 기술 발전의 중단을 의미하지 않는다고 분명히 설명했다.

“Pacing does not mean halting model training or technical progress.”

발전은 계속된다.

다만 모델의 능력이 일정 수준에 도달하면 정렬, 해석 가능성, 보안과 외부 검증 요건을 충족한 뒤 다음 단계로 넘어가자는 것이다. Dario Amodei, 「We Must Pace the Frontier」

따라서 일부 대규모 훈련의 시점은 늦어질 수 있다.

그러나 이를 AI 인프라 투자 축소 선언으로 해석할 근거는 없다.

Frontier Capability Slowdown과 AI Infrastructure Slowdown은 같은 개념이 아니다.

2. GPT-3부터 지능은 활용 가능한 임계점을 넘기 시작했다


여기서 AI가 지금까지 어떻게 발전해왔는지를 다시 생각해볼 필요가 있다.

ChatGPT는 이후 GPT-3.5를 기반으로 2022년 11월 출시됐다.

Sam Altman은 2026년 9월 G20 Innovation Ministerial 대담에서 GPT-3를 OpenAI가 처음으로 활용 가능성의 임계점을 넘어섰다고 판단한 모델이라고 회고했다.

“GPT-3 was the first model that I think actually was over some threshold of usability.”

당시 외부에서는 GPT-3를 자연스러운 문장을 생성하는 모델 정도로 평가했다.

하지만 OpenAI 내부에서는 컴퓨팅을 더 투입할수록 모델의 지능과 능력이 계속 향상된다는 Scaling Law를 이미 확인하고 있었다. Altman은 GPT-4에 이르러서는 내부의 회의론자들까지 이 접근법이 아주 멀리 갈 수 있다고 확신하기 시작했다고 설명했다. Sam Altman G20 대담

따라서 최근 AI의 유용성이 갑자기 높아진 원인을 Pre-training 모델의 지능 향상만으로 설명하기는 어렵다.

Pre-training을 통해 만들어진 지능은 GPT-3부터 활용 가능한 임계점을 넘기 시작했고, GPT-4에서는 상당한 경제적 가치를 만들 수 있는 수준에 도달했다.

문제는 그 지능을 실제 업무에서 어떻게 꺼내 쓰느냐였다.

3. 지능은 있었지만 노동으로 전환하기 어려웠다


GPT-3 시절에도 모델은 상당한 지식을 가지고 있었다.

하지만 그 지능을 실무에 사용하려면 사람이 적절한 Prompt를 작성하고, 필요한 자료를 직접 붙여 넣고, 결과를 다시 다른 프로그램으로 옮겨야 했다.

모델은 사용자의 파일을 직접 열지 못했다. 엑셀을 수정하거나 브라우저에서 자료를 찾고, 오류가 발생했을 때 스스로 원인을 찾아 다시 시도하기도 어려웠다.

Altman은 2026년 4월 Stratechery 인터뷰에서 GPT-3 시절에는 모델로부터 조금의 유용성이라도 끌어내기 위해 상당한 작업이 필요했다고 회고했다.

“When I think back to what we had to do to get any drop of utility squeezed out of these models back in the GPT-3 days…”

모델의 지능 자체보다 그 지능에 접근하고 실제 업무로 전환하는 방법이 부족했던 것이다.

이 간극을 메워온 것이 Post-training과 Harness다.

4. Pre-training이 지능을 만들고 Post-training이 일하는 방법을 가르쳤다


Harness는 모델이 실제 업무를 수행할 수 있도록 둘러싼 실행 환경이다.

도구 연결, 파일시스템, 메모리, 권한 관리, 샌드박스, 작업 상태 유지, 오류 복구와 재시도 등이 여기에 포함된다.

Harness 자체는 대부분 모델 바깥의 소프트웨어다.

하지만 모델이 언제 어떤 도구를 선택하고, 어떤 인자를 입력하며, 결과를 확인한 뒤 다음 행동을 결정하도록 만드는 능력은 Post-training을 통해 강화된다.

Altman은 같은 Stratechery 인터뷰에서 Harness의 중요성을 다음과 같이 설명했다.

“I no longer think of the harness and the model as these entirely separable things.”

Codex가 놀라운 결과를 만들었을 때 그것이 모델 자체의 능력 때문인지, Harness가 잘 설계됐기 때문인지 자신도 구분하기 어려울 때가 있다는 것이다.

그는 Harness와 모델의 결합이 주로 Pre-training에서 만들어지는 것은 아니라고 설명했다.

Tool-calling 역시 처음에는 모델 훈련과 깊게 통합하지 않았지만, 시간이 지나면서 점점 더 훈련 과정 안으로 들어오고 있다고 밝혔다. Sam Altman·Matt Garman Stratechery 인터뷰

최근 AI의 업무 능력은 두 가지 변화가 동시에 진행된 결과다.

Harness

파일과 브라우저, 엑셀, 데이터베이스, 기업 내부 시스템을 모델과 연결한다.


Post-training/RL

모델이 그 환경에서 계획하고, 도구를 사용하고, 결과를 검증하며, 실패했을 때 스스로 복구하도록 가르친다.


Pre-training이 지능을 만들었다면, Post-training과 Harness는 그 지능을 노동으로 전환했다.

Agent가 기존 Chatbot보다 훨씬 많은 Token과 Memory를 사용하는 구조는 생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)에서 살펴봤다.

이번에는 그 Agent를 더 잘 만들고 안전하게 운용하는 과정에서 컴퓨팅 구조가 어떻게 달라지는지가 중요하다.

5. 컴퓨팅의 중심이 Pre-training에서 Post-training으로 이동하고 있다


semianalysis에서 발표한 그래프에서 가장 눈에 띄는 변화는 전체 훈련 비중보다 훈련 내부의 구성 변화다.

원출처 : Semi Analysis

2024년 1분기 OpenAI와 Anthropic의 컴퓨팅 사용 비중 추정치는 다음과 같다.

  • Pre-training: 67%

  • Post-training/RL: 5%

  • Inference: 29%

2026년 4분기 전망은 크게 달라진다.

  • Pre-training: 7%

  • Post-training/RL: 55%

  • Inference: 38%


반올림 오차를 감안하면 전체 훈련 비중은 여전히 60% 이상이다.

하지만 훈련의 중심은 기반 모델을 처음부터 크게 만드는 Pre-training에서 이미 학습된 모델을 실제 업무에 맞게 다듬는 Post-training과 RL로 이동한다.

다만 이 그래프는 OpenAI와 Anthropic의 공식 공시 수치가 아니며 상세한 산출 방식도 제시돼 있지 않다.

정확한 비중보다 프런티어 랩의 컴퓨팅 중심이 대규모 사전학습에서 Agentic Post-training으로 이동하는 방향성을 읽는 자료로 사용하는 것이 적절하다.

그래도 이 변화가 보여주는 의미는 분명하다.

과거에는 더 많은 데이터와 컴퓨팅으로 기반 모델의 지능 자체를 키우는 것이 중심이었다.

이제는 이미 만들어진 모델을 실제 환경에 투입하고 수많은 작업을 수행하게 한다. 모델이 계획하고, 도구를 사용하고, 실패하면 다시 시도하게 한 뒤 그 결과를 평가해 가중치를 업데이트한다.

NVIDIA도 Post-training을 모델이 코딩, 다단계 계획, 검색 도구 사용과 오류 복구를 배우는 단계로 설명한다.

수천 개의 환경에서 Rollout을 병렬로 생성하고, 보상을 검증한 뒤 모델 가중치를 다시 업데이트하는 과정이다. NVIDIA Post-training 설명

최근 AI의 유용성이 빠르게 높아진 이유는 Pre-training만으로 모델이 갑자기 똑똑해졌기 때문이 아니다. Post-training과 Harness가 이미 확보한 지능을 실제 업무 수행 능력으로 전환했기 때문이다.

6. Post-training의 상당 부분은 추론처럼 작동한다


그래프에서 Post-training/RL은 훈련으로 분류돼 있다.

하지만 Agentic RL의 실제 연산 구조를 보면 상당 부분이 Inference와 비슷하게 작동한다.

모델은 실제 업무와 유사한 환경에서 답변과 행동을 생성한다. 파일을 읽고 코드를 작성하며 도구를 실행한 뒤 결과에 따라 다음 행동을 결정한다.

이 과정을 Rollout이라고 부른다.

Rollout은 모델이 Token을 순차적으로 생성하는 Forward Pass다. Production Inference와 비슷한 연산 특성을 가진다.

이후 결과를 평가하고 보상에 따라 가중치를 업데이트하는 Backward Pass가 추가된다.

따라서 2026년 4분기 그래프를 단순하게 훈련 62%, 추론 38%로만 읽으면 변화의 핵심을 놓칠 수 있다.

Post-training/RL 55% 가운데 상당 부분이 Agent Rollout이라면, 실제 컴퓨팅 특성은 이미 Pre-training 중심에서 반복적인 Token 생성과 실환경 상호작용 중심으로 이동하고 있는 것이다.

이 관점에서는 Pre-training을 제외한 Post-training/RL과 Production Inference의 합계가 **93%**까지 높아진다는 점이 더 중요하다.

아직 고객용 추론만 폭발한 단계라기보다, Agent를 실제 업무에 투입하기 위해 수많은 가상 업무를 수행시키고 다듬는 Post-training 투자가 먼저 급증하는 단계라고 생각한다.

7. 그래서 더 많은 HBM과 더 넓은 대역폭이 필요해진다


대규모 Pre-training은 많은 GPU를 높은 Batch로 묶어 거대한 행렬연산을 처리한다.

이 단계에서는 GPU의 최대 연산 성능과 대규모 병렬처리 효율이 중요하다.

Agentic Post-training과 Inference는 작업 특성이 다르다.

모델이 긴 Context를 읽고 Token을 순차적으로 생성한다. 도구 실행 결과를 기다린 뒤 다시 모델 가중치를 불러와 다음 행동을 판단한다.

여러 Agent가 동시에 서로 다른 길이의 작업을 수행하면 Batch도 일정하지 않다.

Rollout 모델과 보상 모델, 검증 모델과 안전 모니터링 모델이 함께 작동하면서 메모리 접근 구조도 복잡해진다.

이 과정에서는 GPU의 FLOPS뿐 아니라 다음 요소가 중요해진다.

  • 거대한 모델 가중치를 얼마나 많이 HBM에 담을 수 있는가

  • 모델 가중치를 HBM에서 얼마나 빠르게 읽을 수 있는가

  • 긴 Context의 KV Cache를 얼마나 많이 저장할 수 있는가

  • Token 생성에 필요한 데이터를 얼마나 빠르게 공급할 수 있는가

  • GPU 사이에서 가중치와 상태를 얼마나 빠르게 이동할 수 있는가

  • 서로 다른 Agent Rollout을 얼마나 높은 가동률로 처리할 수 있는가


따라서 Post-training과 Inference 비중이 높아질수록 HBM 용량과 대역폭, Scale-up Network와 시스템 전체의 데이터 이동 능력이 중요해진다.

Pre-training 시대에는 더 많은 FLOPS가 모델 크기를 확대하는 핵심이었다.

Agentic Post-training 시대에는 연산기가 쉬지 않도록 모델 가중치와 KV Cache를 지속적으로 공급하는 능력이 중요해진다.

더 많은 컴퓨팅 능력은 GPU 개수만 늘린다고 확보되지 않는다.

GPU가 처리할 모델 가중치와 KV Cache를 저장할 더 많은 HBM, 그리고 그 데이터를 빠르게 이동시킬 더 넓은 대역폭이 함께 필요하다.

8. 속도조절은 연산의 소멸보다 구성의 변화에 가깝다


OpenAI는 Astra 관련 강화학습을 2주 동안 중단했고, 발표 당시 계획된 최대 규모의 프런티어 RL 실행도 보류하고 있었다.

하지만 모든 연구를 멈춘 것은 아니다.

그 기간에도 소규모 훈련과 평가를 진행하고, 모델 행동을 분석하고, 레드팀 테스트와 모니터링 시스템을 검증했다. 안전 및 정렬 관련 워크로드는 새로운 보안 환경으로 우선 이전했다.

따라서 일부 대규모 훈련의 지연만 보면 단기적인 연산 감소로 보일 수 있다.

하지만 전체 개발 과정을 보면 훈련 전후에 필요한 평가, 모니터링, 샌드박스, 정렬과 재검증 워크로드가 늘어난다.

기존의 과정이 다음과 같았다면,

Model Training → Evaluation → Deployment

앞으로는 더 많은 중간 과정이 들어간다.

Model Training → Evaluation → Security Test → Alignment Test → Monitoring → Sandbox → Additional RL → Re-evaluation → Deployment

한 번의 거대한 훈련을 조금 늦추는 대신, 그 훈련을 안전하게 진행하기 위한 중간 연산은 더 많이 필요해지는 구조다.

9. 가장 중요한 숫자는 20%다


OpenAI는 2026년 8월 18일 공식 발표에서 새로운 모니터링 시스템이 감시 대상 추론 연산량의 약 **20%**에 해당하는 추가 컴퓨팅을 필요로 한다고 밝혔다.

이 시스템은 단순히 로그를 저장하는 수준이 아니다.

모델이 Token을 생성하는 동안 활성화 분류기가 내부 활동을 검사한다. 이상 신호가 발견되면 더 정교하고 많은 연산을 사용하는 자동 조사 시스템이 모델의 추론과 도구 사용 기록을 다시 확인한다.

무단 접근과 데이터 절도, 파괴적 행동이나 안전장치 무력화 시도가 있었는지를 다른 AI 시스템이 조사하는 구조다.

일하는 AI와 그 AI를 감시하는 AI가 동시에 움직이기 시작한 것이다.

OpenAI는 이 모니터링을 도구를 사용하는 Sol급 이상 모델의 강화학습과 평가에 적용하고 있다.

Astra가 핵심 사이버 역량에 도달했을 가능성을 확인한 뒤에는 도구를 사용하는 모든 Astra 추론에도 추가 모니터링 요건을 적용했다.

현재 추정되는 추가 연산량은 감시 대상 추론 연산량의 약 **20%**다. 실제 비용은 워크로드별로 크게 달라질 수 있다. OpenAI 공식 발표

기본 추론에 100의 연산이 필요한 업무라면, 안전 모니터링을 포함해 약 120의 연산이 필요할 수 있다는 뜻이다.

이 숫자를 전체 AI 컴퓨팅이나 CAPEX에 그대로 적용할 수는 없다. 전체 추론 가운데 실제 모니터링 대상이 되는 비중이 공개되지 않았기 때문이다.

그럼에도 한 가지는 확인됐다.

더 강력한 AI를 안전하게 운용하기 위해서는 기존 추론 외에 추가 컴퓨팅이 필요하다.

10. 안전장치가 AI의 업무 범위를 넓힌다


안전 모니터링은 우선 모델 기업의 비용을 높인다.

그러나 기업 고객이 AI에 더 많은 권한을 주기 위해서는 통제와 검증 체계가 필요하다.

AI가 문서를 작성하는 데 그친다면 사람이 결과를 확인하면 된다.

AI가 코드를 실행하고 내부 데이터에 접근하며 기업 시스템의 상태를 직접 바꾸기 시작하면 지속적인 모니터링과 권한 관리가 필요하다.

안전장치가 충분하지 않으면 기업은 Agent가 사용할 수 있는 데이터와 도구, 업무 범위를 제한할 가능성이 높다.

반대로 신뢰할 수 있는 모니터링과 통제 체계가 갖춰지면 AI에 더 중요하고 복잡한 업무를 맡길 수 있다.

같은 Stratechery 인터뷰에서 AWS의 Matt Garman은 금융기관과 같은 위험회피적인 고객도 Agent가 안전한 Sandbox 안에서 작동한다는 확신을 얻으면 훨씬 더 넓은 업무에 AI를 사용할 수 있다고 설명했다.

이것이 Pacing과 안전 검증의 경제적 의미라고 생각한다.

안전성은 AI 확산을 늦추는 비용이면서,
동시에 AI가 더 넓은 업무에 진입하기 위한 조건이자,
미래의 신규 경쟁자들에겐 새로운 규제 진입장벽이 될 수 있다. 

문서 작성만 하던 AI가 기업 데이터베이스와 금융 시스템, 보안 시스템과 생산설비를 다루기 시작하면 업무당 Tool Call과 추론 횟수도 함께 증가한다.

안전 검증으로 업무당 연산량이 늘어나고, 안전성 확보로 AI에 맡길 수 있는 업무량도 늘어나는 구조다.

11. 중국에는 안전 컴퓨팅의 부담이 더 크다


AI 속도조절론에서는 중국과의 경쟁이 항상 가장 큰 반론으로 등장한다.

미국 프런티어 랩이 개발 속도를 늦추는 동안 중국이 계속 발전하면 미국의 기술적 우위가 사라질 수 있다는 주장이다.

하지만 최근의 무단 증류 사건과 중국의 컴퓨팅 공급 상황을 함께 보면 이 경쟁 구도를 다르게 볼 여지도 있다.

Anthropic은 Moonshot AI와 DeepSeek, Alibaba 등이 Claude의 출력을 대규모로 확보해 모델 학습에 활용하려 했다고 주장했다.

Anthropic에 따르면 Moonshot은 2026년 5월부터 7월 사이 Claude와 2,300만 회 이상의 교환을 발생시켰고, 일부 사용자의 요청을 Claude로 우회했다.

이 과정에서 중국 국유기업의 내부 코드와 인증정보, 감시 시스템 관련 자료 등 민감한 정보가 사용자가 인지하지 못한 채 Anthropic으로 전달됐다고 한다. 이는 현재 Anthropic의 조사 결과이며 관련 중국 기업들의 법적 책임이 확정됐다는 의미는 아니다. Anthropic 2026년 9월 보고서

위 조사가 맞다면 독자적인 모델 능력만으로 미국과의 격차를 좁히기 어려웠으며, 미국 프런티어 모델의 출력을 확보해 Agentic Reasoning과 Tool Use 능력을 보완하려 했다는 의미가 된다.

더 큰 문제는 안전성과 검증 능력이다.

원 모델의 학습 과정과 정렬 방식, 취약점과 안전장치를 알지 못한 채 출력만 증류한다면 성능 일부는 모방할 수 있어도 모델의 위험을 이해하고 통제하기는 어렵다.

안전성 검증에 추가 컴퓨팅이 필요하다는 점도 중국에는 부담이다.

중국 AI 기업들은 첨단 가속기와 HBM을 미국 기업과 같은 조건으로 확보하기 어렵다. Reuters는 중국 AI 가속기 업체들이 HBM 부족과 높은 조달 비용 때문에 제품 가격을 인상하고 있다고 보도했다. Reuters 보도

이미 컴퓨팅과 HBM이 부족한 상황에서 미국과 같은 안전성 평가와 모니터링을 적용하면 실제 모델 개발에 투입할 수 있는 자원은 더욱 줄어들 수 있다.

따라서 안전성 검증이 미국에만 적용되는 비용이라고 볼 수 없다.

동일한 기준이 중국 업체에도 적용된다면 컴퓨팅과 HBM을 더 많이 확보한 미국 프런티어 랩의 우위가 오히려 강화될 가능성이 있다.

먼저 정상에 오른 미국 기업들이 안전을 명분으로 사다리를 걷어차는 것처럼 보일 수 있다.

하지만 그 안전 기준을 실제로 충족하려면 미국 기업도 막대한 추가 비용과 컴퓨팅을 부담해야 한다.

문제는 그 비용을 감당할 수 있는 기업이 많지 않다는 것이다.

12. 컴퓨팅 확보 능력이 새로운 경쟁력이 된다


프런티어 AI 기업의 경쟁력을 이제 모델 벤치마크만으로 판단하기 어려워졌다.

모델을 얼마나 안전하게 훈련할 수 있는지, 대규모 Agent Rollout과 평가를 감당할 수 있는지, 사용량이 늘어날 때 충분한 추론과 모니터링 용량을 공급할 수 있는지가 중요해진다.

필요한 것은 GPU나 ASIC만이 아니다.

가속기에 연결되는 HBM과 네트워크, 스토리지, 전력과 냉각을 포함한 전체 시스템이 필요하다.

토큰당 비용이 낮아져도 전체 컴퓨팅의 경제적 가치가 높아질 수 있는 이유는 생각정리 358 (* The Price of Compute)에서 정리했다.

이번 속도조절론은 그 논리에 Agentic Post-training과 안전 컴퓨팅이라는 새로운 수요를 추가한다.

Pre-training
→ Intelligence 확보

Post-training/RL
→ 계획·Tool Use·오류 복구 능력 강화

Harness
→ 파일·프로그램·기업 시스템과 연결

Safety·Monitoring
→ 더 높은 권한과 더 넓은 업무 허용

Agent 확산
→ 더 많은 Rollout과 Production Inference

Compute·HBM·Bandwidth 수요 증가

프런티어 모델은 조금 더 신중하게 개발한다.

이미 확보한 Intelligence는 더 많은 업무로 확산시킨다.

그리고 그 모든 과정을 다른 AI가 감시한다.

이 구조가 자리 잡으면 더 많은 컴퓨팅과 HBM을 안정적으로 확보한 기업이 모델 개발과 서비스 확산, 안전성 검증을 동시에 수행할 수 있다.

글을 마치며


지금까지 시장은 AI의 발전을 주로 모델 크기와 Pre-training 규모로 판단해왔다.

하지만 최근 컴퓨팅 구성의 변화는 AI 경쟁의 중심이 이동하고 있음을 보여준다.

GPT-3부터 모델의 지능은 활용 가능한 임계점을 넘기 시작했다.

GPT-4에서는 그 지능이 상당한 경제적 가치를 만들 수 있다는 확신이 형성됐다.

이후 Post-training과 Harness가 모델의 지능을 실제 업무 수행 능력으로 전환하기 시작했다.

이제 안전성 논증과 모니터링이 더해지면서 AI가 접근할 수 있는 기업 업무의 범위가 넓어질 가능성이 높다.

Pre-training이 지능을 만들었다면, Post-training과 Harness는 지능을 유용하게 만들었고, 안전 검증은 그 유용성이 더 넓은 업무로 확산될 수 있는 기반을 만든다.

따라서 프런티어 AI의 Pacing을 단순한 컴퓨팅 수요 둔화로 해석하기 어렵다.

일부 대규모 훈련의 진행 속도는 조절될 수 있다.

그러나 Agentic Post-training과 평가, 모니터링에 필요한 연산은 증가하고, 안전성이 확보될수록 AI에 맡길 수 있는 업무도 많아질 수 있다.

AI가 더 똑똑해지는 속도를 관리하기 시작한 것은 AI를 덜 사용하기 위해서가 아니다.

더 강력한 AI를 더 많은 업무에 안전하게 사용하기 위한 과정이다.

그리고 그 과정에는 더 많은 컴퓨팅과 더 많은 HBM, 더 넓은 대역폭이 필요할 가능성이 높다.


=끝

2026년 9월 8일 화요일

생각정리 363 (* The Price of Waiting, Astra & Ultra-Low Latency Inference)

초저지연 추론시장은 얼마나 빠르게 성장할 수 있을까?


Astra 이후, AI가 일하는 속도의 가치는 얼마나 커질까


이전 생각정리 361에서는 Astra와 같은 Agentic Model이 확산될수록 메모리의 용량과 대역폭이 왜 중요해지는지를 정리했다.

이번에는 그 변화가 초저지연 추론 시장을 얼마나 크게 열어갈 수 있을지 생각을 확장해본다.

Astra를 보면서 주목했던 변화는 AI가 사람이 일하는 환경 안으로 깊이 들어오기 시작했다는 점이다.

문서를 읽고, 엑셀을 수정하고, 브라우저에서 자료를 찾고, 전문 소프트웨어를 실행한다. 사람이 사용하던 도구를 AI가 직접 다루면서 하나의 업무를 끝까지 수행할 수 있는 범위가 넓어지고 있다.

그렇게 되면 AI의 속도에 붙는 경제적 가치도 커진다.

보고서를 언제 받을 수 있는지,
프로그램을 얼마나 빨리 수정할 수 있는지,
하루에 몇 번의 분석과 검증을 반복할 수 있는지가
AI의 처리 속도와 연결되기 때문이다.

AI가 더 많은 일을 맡을수록, AI를 기다리는 시간의 비용도 함께 커진다.

초저지연 추론 시장을 이해하는 출발점은 여기에 있다고 생각한다.


1. AI가 사람이 사용하던 도구를 직접 쓰기 시작했다


AI Agent는 목표를 받아 필요한 단계를 판단하고, 도구를 사용하고, 결과를 확인하면서 다음 행동으로 넘어가는 AI다.

예를 들어 경쟁사 분석을 맡겼다고 생각해보자.

Agent는 기업의 실적 자료를 찾고, 필요한 숫자를 추출하고, 엑셀에 입력한다. 계산이 맞는지 확인한 뒤 차트를 만들고 보고서를 작성한다. 숫자가 맞지 않으면 원문으로 돌아가 다시 확인한다.

OpenAI는 Astra의 활용 사례로 고객관리 시스템 업데이트, 온라인 조사, 문서·스프레드시트 작성, 전문 소프트웨어 사용 등을 제시했다. 컴퓨터 사용 평가에서도 이전 모델보다 짧은 시간에 더 높은 성공률을 보였다고 설명한다. 공개된 성능 수치에는 평가와 시뮬레이션 환경의 결과가 포함된다. OpenAI Astra 발표

GPT‑6 Astra on robotic manipulation


GPT‑6 Astra on robotic manipulation


GPT‑6 Astra on robotic manipulation

이 변화로 AI에 맡길 수 있는 업무의 종류가 넓어진다.

개발자뿐 아니라 재무 담당자, 연구원, 디자이너, 영업 담당자도 자신이 사용하는 프로그램 안에서 AI에게 일을 맡길 수 있다.

사람이 도구를 사용하며 수행하던 숙련 업무가 AI의 새로운 수요처로 들어오는 것이다.

이 흐름을 보면 AI 지식노동 시장이 장기적으로 10배 이상 확대될 가능성도 생각해볼 수 있다. 다만 실제 시장의 크기는 업무 수행 능력에 더해 신뢰성, 도입 비용, 반복 사용률에 의해 결정될 것이다.


2. Agent는 하나의 업무 안에서도 여러 번 판단한다


사람이 업무를 처리하는 과정을 떠올리면 이해하기 쉽다.

자료를 읽고 생각한다. 프로그램을 실행하고 결과를 확인한다. 오류가 있으면 원인을 찾고 다시 수정한다.

Agent도 이 과정을 반복한다.

판단 → 도구 실행 → 결과 확인 → 다음 판단

여기서 AI가 입력을 읽고 다음 행동이나 답변을 만들어내는 계산을 ‘추론’이라고 부른다.

Agent가 복잡한 업무를 맡으면 추론이 업무 중간에 반복적으로 들어간다. 앞선 결과를 확인해야 다음 행동을 결정할 수 있는 단계에서는 대기시간이 누적된다.

가상의 예를 들어보자.

한 업무에서 AI가 50번 판단하고, 매번 200개의 토큰을 생성한다고 가정한다. 토큰은 AI가 글과 명령을 처리하는 작은 단위다.

총 생성량은 1만 토큰이다.

초당 100토큰을 생성하면 생성에 100초가 필요하다. 초당 1,000토큰이면 10초로 줄어든다.

브라우저와 프로그램 실행 등에 별도로 50초가 들어간다면 전체 업무 시간은 다음처럼 달라진다.


설명을 위한 단순 계산이지만, 추론 속도가 10배 빨라지면서 전체 업무는 2.5배 빨라진다.

Agent에서는 반복되는 판단의 대기시간을 줄이는 것이 업무 전체의 생산성으로 연결된다.


3. 초저지연은 세 가지 시간을 함께 봐야 한다


초저지연 추론이라는 표현에는 서로 다른 시간이 들어 있다.

첫째는 첫 반응까지의 시간이다.

질문을 하거나 명령을 내린 뒤 AI가 반응하기 시작할 때까지 걸리는 시간이다. 음성 대화에서는 이 시간이 길어지면 대화의 흐름이 끊어진다.

둘째는 답변과 명령을 생성하는 시간이다.

AI가 첫 반응을 시작한 뒤 필요한 내용을 얼마나 빠르게 만들어내는지를 뜻한다. 긴 판단이나 여러 단계의 작업에서는 이 속도가 누적 대기시간에 영향을 준다.

셋째는 업무 전체가 끝나는 시간이다.

자료 검색, 프로그램 실행, 네트워크, 오류 수정과 사람의 확인까지 포함한다. 실제 사용자가 체감하는 시간은 여기에 가깝다.

따라서 빠른 추론의 효과는 업무마다 달라진다.

시뮬레이션 프로그램이 몇 시간 동안 계산해야 하는 업무에서는 프로그램의 계산 시간이 큰 비중을 차지한다. 반대로 AI가 짧은 판단을 연속적으로 내려야 하는 업무에서는 추론 속도의 영향이 커진다.

초저지연 시장의 경제적 가치는 성공한 업무 한 건을 얼마나 빨리, 얼마의 비용으로 완료하는지에 의해 결정된다.


4. 기다리는 시간이 줄어들면 사용 방식도 달라진다


보고서 초안을 만드는 데 한 시간이 걸리면 하루에 몇 번만 사용하게 된다.

몇 분이면 결과가 나온다면 가정을 바꿔 여러 번 비교할 수 있다. 시장 전망을 수정하고, 다른 가격을 적용하고, 반대 시나리오도 계산해본다.

프로그램 수정 결과를 빠르게 확인할 수 있으면 더 많은 기능을 시험한다. 디자인 시안이 빨리 나오면 더 많은 대안을 검토한다.

속도 개선은 반복 사용을 늘리고, 반복 사용은 다시 추론 수요를 키울 수 있다.

사용 가능한 업무의 범위도 달라진다.

몇 시간이 걸려 회의 전에 끝내기 어려웠던 분석이 몇 분 안에 가능해지면 회의 중에도 사용할 수 있다. 고객과 통화하면서 처리하기 어려웠던 복잡한 조회가 빨라지면 실시간 응대 과정에 들어갈 수 있다.

이처럼 처리 시간이 일정 수준 아래로 내려가면 새로운 사용처가 열릴 수 있다.

초저지연 추론의 성장에는 기존 업무의 시간 절약과 새롭게 가능해지는 업무의 확대가 함께 들어 있다.


5. 효율이 좋아져도 전체 추론 수요는 커질 수 있다


모델의 성능이 개선되면 한 업무에 필요한 토큰과 재시도 횟수가 줄어들 수 있다.

하지만 비용과 시간이 낮아지면 사람은 더 많은 업무를 AI에 맡길 수 있다.

전체 수요를 생각할 때는 다음 관계를 함께 봐야 한다.

사용자 수 × 사용자당 위임 업무 수 × 업무당 추론량

업무당 추론량이 줄어들더라도 사용자 수와 위임 업무 수가 더 빠르게 증가하면 전체 사용량은 늘어난다.

여기에 여러 Agent의 동시 작업이 더해질 수 있다.

한 Agent가 자료를 찾고, 다른 Agent가 계산하고, 또 다른 Agent가 결과를 검토하는 방식이다. 각각을 병렬로 처리하면 전체 시간을 줄일 수 있지만, 결과를 주고받거나 최종 판단을 기다리는 구간도 남는다.

따라서 앞으로의 추론 인프라는 개별 Agent의 빠른 응답과 많은 Agent를 동시에 처리하는 능력을 함께 요구받을 가능성이 높다.

한 명이 사용할 때의 최고 속도와 수많은 사용자가 몰렸을 때의 안정적인 속도를 같이 봐야 하는 이유다.


6. 초저지연 시장은 분야별로 다른 속도로 열린다


빠른 응답에 지불할 의사는 업무마다 다르다.

반복 횟수가 많고, 결과를 빨리 받을수록 다음 행동을 앞당길 수 있는 분야에서 시장이 먼저 커질 가능성이 높다.

코딩과 디자인: 반복 속도의 가치가 큰 선행 시장

코딩은 수정하고, 실행하고, 오류를 확인하는 과정이 반복된다.

개발자가 결과를 빨리 확인할수록 더 많은 수정과 검증을 시도할 수 있다. 사용 빈도가 높고 결과도 비교적 명확하게 확인할 수 있어 속도 개선의 효과를 측정하기 쉽다.

디자인도 시안을 만들고 비교하고 수정하는 반복 과정에서 비슷한 수요가 발생한다.

Cerebras와 Lovable의 협력은 빠른 추론이 소프트웨어 제작 서비스로 연결되는 사례다. Lovable·Cerebras 협력 발표

이 분야는 2026~2027년 초기 수요 확대를 이끄는 시장으로 본다.

사무업무와 컴퓨터 사용: 가장 넓은 사용자 기반

Astra 이후 가장 큰 추가 시장으로 보는 영역이다.

엑셀, 문서, 브라우저, 고객관리 시스템을 오가며 처리하는 업무가 여기에 포함된다. 재무 분석, 영업 자료 작성, 구매 비교, 운영 보고처럼 반복적으로 발생하는 일이 많다.

대상 사용자가 넓은 만큼 잠재 규모도 크다.

다만 기업별 시스템 연결과 접근 권한, 결과 검증 절차가 필요하다. 시험 도입이 일상적인 사용으로 바뀌는 데 시간이 걸릴 수 있다.

2027~2029년에는 일반 사무업무가 초저지연 시장의 폭을 넓히는 역할을 할 가능성이 높다고 생각한다.

리서치와 문서 분석: 질문을 이어갈수록 커지는 수요

자료 검색과 비교, 추가 질문, 보고서 수정이 반복되는 분야다.

결과를 빨리 받으면 분석의 깊이와 반복 횟수를 늘릴 수 있다. Cerebras가 소개한 AlphaSense 사례도 이 방향과 연결된다. AlphaSense 사례

특히 사람이 결과를 확인하면서 다음 질문을 이어가는 구간에서 초저지연의 가치가 높다.

반면 밤새 처리해도 되는 대규모 문서 작업은 가격이 더 중요한 선택 기준이 될 수 있다.

이 분야는 2026~2028년 대화형 분석과 리서치를 중심으로 확대되는 경로를 가정했다.

보안과 IT 운영: 대응 시간을 줄이는 고부가 시장

보안 경보를 조사하고, 로그를 비교하고, 대응 방안을 정하는 과정에서는 시간이 중요하다.

장애 원인을 빠르게 좁히거나 보안 사고의 영향을 파악하면 후속 조치를 앞당길 수 있다. Cerebras와 CrowdStrike의 협력도 AI 기반 탐지와 대응을 겨냥하고 있다. CrowdStrike·Cerebras 발표

여기서 추정하는 시장은 복잡한 경보와 운영 상황을 해석하고 조치를 판단하는 Agent 계층이다.

기업의 신뢰와 운영 체계에 편입되는 과정이 필요하기 때문에 2027~2029년 확산이 본격화되는 시나리오를 두었다.

음성과 고객 응대: 대기시간이 바로 체감되는 시장

음성에서는 짧은 대기시간도 사람이 바로 느낀다.

고객의 말을 듣고, 예약 정보를 찾고, 기록을 확인한 뒤 다시 답해야 한다면 여러 시스템의 응답 속도가 함께 중요해진다.

사용량이 커질 여지가 있지만 가격 경쟁도 강할 것으로 본다. 음성 인식과 합성, 통신 지연까지 포함한 전체 경험에서 경쟁해야 하기 때문이다.

2026~2028년 확산이 가능한 시장이지만, 단위 사용량당 매출은 보수적으로 볼 필요가 있다.

과학과 시뮬레이션: 연구 과정에 편입되는 후행 시장

가설을 만들고, 실험을 설계하고, 계산 결과를 해석하는 과정에서 기회가 있다.

다만 실험과 시뮬레이션 자체가 오래 걸리는 경우가 많다. 추론 속도 개선이 전체 연구 시간을 얼마나 단축하는지는 작업에 따라 차이가 크다.

초기 규모는 작게 두고, 2028~2030년 실제 연구 과정에 Agent가 자리 잡는 속도를 보며 판단하는 편이 적절하다고 생각한다.




7. 2030년 시장은 어느 정도까지 커질 수 있을까


이번에 추정한 시장은 빠른 응답과 짧은 업무 완료 시간이 중요한 AI 추론 서비스에 지출되는 금액이다.

반도체 판매액, AI 소프트웨어 전체 매출, 사람의 임금 절감액은 포함하지 않았다. GPU와 여러 종류의 추론 전용 시스템이 공급하는 서비스를 모두 포함한다.

아래 숫자는 분야별 채택 시기와 반복 사용 확대를 반영한 자체 시나리오다. 출발점인 2026년 규모부터 추정치이므로 성장률도 같은 가정에 의존한다.


중앙 시나리오는 2026년 30억 달러에서 2030년 460억 달러로 커지는 경로다. 약 15배의 확대다.

상당히 공격적인 가정이다.

이 숫자가 성립하려면 기업의 시험 도입이 일상적인 사용으로 전환되고, 사용자당 업무 위임 횟수가 빠르게 증가해야 한다.

예를 들어 사무업무 시장 150억 달러는 다음과 같이 표현할 수 있다.

3억 명의 사용자 환산 규모 × 연간 1,000건의 위임 업무 × 업무당 추론 서비스 지출 0.05달러

연 1,000건은 근무일 기준 하루 약 네 건이다.

업무당 금액은 작지만 이용자 기반과 반복 횟수를 크게 가정하고 있다. 여기서 0.05달러는 전체 소프트웨어 이용료 중 해당 추론 서비스에 배분되는 지출을 뜻한다.

따라서 이 추정의 가장 큰 불확실성은 실제로 비용을 지불하며 반복 사용하는 사람과 기업이 얼마나 빠르게 늘어나는가다.

460억 달러라는 숫자는 이 채택 경로가 성립할 때의 시장 규모로 읽는 것이 적절하다.






8. 토큰 가격이 내려가면 시장 매출은 어떻게 될까


추론 인프라의 성능이 좋아지면 같은 비용으로 더 많은 토큰을 처리할 수 있다.

경쟁이 강해지면 이 효율 개선의 일부가 가격 인하로 고객에게 돌아간다.

따라서 시장 매출은 사용량 증가율보다 느리게 성장할 수 있다.

예를 들어 사용량이 두 배가 되고 단가가 30% 내려가면 매출은 40% 증가한다.

사용량 2배 × 단가 0.7배 = 매출 1.4배

앞서 제시한 연평균 약 98%의 시장 매출 성장은 가격 하락을 감안하면 더욱 빠른 사용량 증가를 요구한다.

연간 단가가 30% 하락한다고 단순 가정하면, 매출이 약 두 배 증가하기 위해 필요한 사용량 증가는 약 2.8배다.

이 때문에 초저지연 시장의 성장성을 판단할 때는 토큰 생산량과 매출을 함께 확인해야 한다.

가격 하락으로 새롭게 열리는 업무가 얼마나 많고, 그 업무가 얼마나 자주 반복되는지가 시장 성장의 핵심 변수다.


9. 빠른 추론을 공급하는 기술도 다양해진다


초저지연 수요가 커지면 이를 공급하는 방식도 다양해진다.

GPU는 다양한 모델과 소프트웨어를 지원하는 생태계와 범용성을 바탕으로 경쟁한다. 추론 전용 시스템은 특정 작업에서 속도와 전력 효율을 높이는 방향으로 경쟁한다.

Cerebras는 웨이퍼 규모의 칩에 연산과 고속 메모리를 밀집시키는 접근을 사용한다. NVIDIA도 Groq 3 LPX를 통해 빠른 응답이 필요한 추론 시장을 겨냥하고 있다. Cerebras CS-4, NVIDIA Groq 3 LPX

AI 추론의 단계를 나누어 처리하는 방식도 중요해질 수 있다.

입력을 읽는 Prefill과 답변을 차례로 생성하는 Decode는 계산 특성이 다르다. 각 단계에 적합한 장비를 배치하면 속도와 비용을 함께 개선할 여지가 있다.

장기적으로는 하나의 업무 안에서도 여러 종류의 컴퓨팅 자원이 역할을 나눌 가능성이 높다.

시장 확대의 수혜는 모델 지원 범위, 실제 업무 속도, 동시 처리 능력과 비용 경쟁력에 따라 나뉠 것이다.


10. 모든 업무가 가장 빠른 추론을 필요로 하지는 않는다


초저지연에 대한 지불 의사는 기다림이 만드는 비용에 따라 달라진다.

고객과 대화 중이거나, 개발자가 수정 결과를 기다리거나, 장애 대응이 지연되는 상황에서는 시간 단축의 가치가 크다.

반면 다음 날 받아도 되는 문서 정리나 정기 보고서는 낮은 가격이 더 중요할 수 있다.

사람이 다른 일을 하면서 기다릴 수 있는 경우에도 대기시간 전체를 인건비 절감으로 환산하기는 어렵다.

그래서 기업은 업무별로 다른 추론 서비스를 선택할 가능성이 높다.

짧은 반응 시간이 필요한 판단에는 빠른 서비스를 사용하고, 대량의 비긴급 작업에는 저렴한 서비스를 배정하는 방식이다.

초저지연 시장의 크기는 전체 AI 사용량 가운데 시간 단축에 추가 비용을 지불할 업무가 차지하는 비중에 의해 결정된다.

Agent가 확산되면 이 비중이 높아질 수 있지만, 가격 차이와 실제 생산성 개선이 도입 속도를 결정할 것이다.


11. 앞으로 확인할 것은 사용량과 업무의 변화다


이 시장을 추적하려면 네 가지를 계속 보면 될 것 같다.

첫째, 사용자당 실제 위임 업무량이다.

가입자 수와 함께 완료 업무 수, 반복 사용률, 유료 사용량이 늘어나는지 확인해야 한다.

둘째, 성공한 업무 한 건의 시간과 비용이다.

추론 속도의 개선이 실제 고객의 업무 완료 시간과 총비용을 얼마나 낮추는지 봐야 한다.

셋째, 동시 사용자가 늘어날 때의 응답 속도다.

최고 속도뿐 아니라 사용자가 몰릴 때에도 안정적으로 서비스를 제공할 수 있는지가 중요하다.

넷째, 가격 하락보다 빠른 수요 확대가 나타나는지다.

효율 개선으로 업무당 비용이 낮아졌을 때 사용 빈도와 적용 업무가 충분히 늘어나는지 확인해야 한다.

이 숫자들이 함께 개선된다면 초저지연 추론은 AI 인프라 안에서 큰 시장으로 자리 잡을 수 있다.


글을 마치며


Astra를 보면서 처음 떠올렸던 생각은 AI가 사람이 사용하던 도구 안으로 들어왔다는 것이었다.

그 변화의 다음 단계를 따라가다 보니 AI가 일하는 속도에 붙는 경제적 가치가 보이기 시작했다.

더 많은 업무를 맡길수록 판단의 횟수가 늘어난다.
판단 사이의 기다림이 줄어들면 하루에 시도할 수 있는 일도 많아진다.
비용과 시간이 충분히 낮아지면 지금까지 AI에 맡기지 않았던 업무도 새롭게 들어올 수 있다.

초저지연 추론 시장의 성장 가능성은 더 넓은 업무 범위와 더 잦은 반복 사용이 만나는 데 있다고 생각한다.

코딩과 대화형 서비스에서 시작된 수요가 사무업무, 리서치, 보안과 운영으로 확장된다면 빠른 추론은 일상적인 업무 인프라의 한 부분이 될 수 있다.

사람이 AI에게 맡기는 일이 많아질수록, 그 일을 언제 끝낼 수 있는지가 더욱 중요해진다.

앞으로 초저지연 추론의 가치는 그렇게 쌓여갈 가능성이 높다.

=끝

2026년 9월 6일 일요일

생각정리 361 (* The Price of Idle FLOPS, Astra & HBM)

Astra가 엄청난 모델이라는 이야기는 많이 들었다.
하지만 실제로 그 변화가 여기까지 이어질 수 있을 것이라고는 생각하지 못했다.

돌이켜보면 나 역시 매일의 주가 흐름과 시장의 평가에 조금씩 영향을 받으면서, 예전처럼 기술 변화의 끝을 자유롭게 상상하기보다 당장의 현실적인 제약과 숫자 안에서만 생각하려 했던 것 같다.

그러다 Astra의 Long Context와 Agentic Workload가 실제로 Compute와 Memory 구조를 어떻게 바꿀지를 하나씩 따라가다 보니 생각보다 훨씬 큰 변화가 보이기 시작했다.

Astra가 바꾸는 것은 단순히 모델의 성능이나 Token 사용량만이 아니었다.

더 긴 Context, 더 많은 동시 Agent, 더 오래 유지되는 Memory는 결국 HBM의 Capacity와 Bandwidth를 더욱 중요한 병목으로 만들고, 이미 설치된 GPU의 유휴 FLOPS를 얼마나 실제 Token 생산으로 전환할 수 있는지가 AI Factory의 경제성을 결정하게 된다.

그렇게 생각을 이어가다 보니 HBM 역시 단순히 GPU에 붙는 고가의 Memory Component가 아니라, GPU와 전력에 투자한 막대한 자본의 생산성을 결정하는 핵심 설비에 더 가까워 보이기 시작했다.

이번 글은 Astra가 만들어낼 변화에서 출발해, 그 변화가 HBM의 수요와 기술적 중요성을 넘어 HBM 자체의 경제적 가치와 가격결정 구조를 어떻게 바꿀 수 있는지를 따라가 본 리서치 기록이다.

이번 글의 핵심문단은 아래와 같다.

Agentic AI가 확산될수록 더 긴 Context와 KV Cache를 유지해야 하고, 출력 단계에서는 이를 매 Token마다 반복적으로 읽어야 하기 때문에 Decode의 HBM Bandwidth 병목은 더욱 중요해진다.

결국 GPU의 연산성능이 아무리 높아져도 HBM이 데이터를 충분히 빠르게 공급하지 못하면 Tensor Core는 기다릴 수밖에 없다.

그래서 앞으로 HBM의 경제적 가치는 단순히 저장하는 Byte의 가치가 아니라, Memory Wall을 해소해 되살리는 GPU FLOPS와 추가 Token 생산량의 가치에 의해 결정될 가능성이 높다.

 The Price of Idle FLOPS, Astra & HBM


Astra 이후, HBM의 가격은 무엇으로 결정될까


최근 OpenAI의 GPT-6 Astra와 NVIDIA의 Rubin, NVHBM 관련 자료들을 함께 정리하면서 HBM을 바라보는 기준을 조금 바꿔야겠다는 생각이 들었다.

그동안 HBM 수요를 전망할 때 가장 먼저 봤던 숫자는 GPU당 HBM 탑재용량이었다.

80GB에서 141GB, 192GB에서 288GB로 올라가는 식이다.

하지만 Astra와 같은 Agentic Model이 등장하고, Rubin처럼 GPU의 연산성능이 메모리 대역폭보다 훨씬 빠르게 증가하기 시작하면 앞으로 더 중요한 질문은 단순히 GPU 한 개에 HBM이 몇 GB 들어가는가가 아닐 수 있다.

오히려,

HBM이 없어서 얼마나 비싼 GPU의 연산기가 놀고 있는가.

그리고

추가적인 HBM Capacity와 Bandwidth가 그 유휴 FLOPS를 얼마나 다시 유료 Token으로 바꿀 수 있는가.

이 질문이 HBM의 경제적 가치를 설명하는 데 더 중요해질 수 있다.

앞서 생각정리 325 (* Memory Premium)에서 비슷한 문제를 한 번 다뤘다.

당시의 결론은 HBM의 적정가격을 DRAM 제조원가만으로 볼 것이 아니라, Memory가 회복시키는 GPU 가동시간과 추가 Token의 가치를 기준으로 역산해야 한다는 것이었다.

이번에는 Astra 이후의 Agentic AI와 Rubin·NVHBM까지 연결해서 이 생각을 조금 더 확장해본다.


1. Astra에서 중요한 것은 100만 Token이 아니다


GPT-6 Astra와 GPT-5.6 Sol의 최대 Context Window는 모두 105만 Token이다.

따라서 Astra가 Sol보다 더 많은 Memory를 필요로 한다면 단순히 Context Window가 늘었기 때문은 아니다.

중요한 것은 같은 100만 Token을 얼마나 실제 업무에 활용할 수 있느냐다.

OpenAI의 Long-context 평가에서 512K~1M Token 구간의 성능은

OpenAI

  • Astra 96.3%

  • Sol 73.8%

였다. (OpenAI)

명목상 Context Window는 같지만 실제 활용 가능한 Working Context의 범위는 상당히 달라진 것이다.

Astra의 변화는 단순히 더 긴 글을 읽는 데 그치지 않는다.

Research, Coding, Computer Use와 같은 작업을 장시간 이어가면서 과거의 Tool Output과 상태를 계속 유지하고, 이를 다시 불러와 다음 행동에 활용한다.

이 변화의 배경은 앞서 생각정리 328 (* The agent Mutipler, Unhobbling, OOM)에서 정리했기 때문에 여기서는 반복하지 않는다.

이번 글에서 중요한 것은 그 다음이다.

Agent의 능력이 높아질수록 Memory가 필요한 이유가 Model Weight 하나에서 Agent의 Working State 전체로 확장된다.

Model Weight

  • KV Cache

  • Active Context

  • Multiple Agents

  • Tool History

  • Persistent Memory

결국 AI의 Memory 수요 단위가

GB per Model

에서

GB × Bandwidth × Concurrent Agents × Context Lifetime

으로 바뀌기 시작한다.


2. 효율이 좋아지는데 왜 HBM 수요는 늘어날까


Astra는 일부 업무에서 Sol보다 적은 Token과 짧은 시간으로 더 높은 성공률을 보인다.

따라서 한 업무만 떼어놓고 보면 Memory Traffic이 생각보다 크게 증가하지 않을 수도 있다.

문제는 가격과 성능이 개선될수록 사람이 AI에 맡기는 업무 자체가 늘어난다는 것이다.

이 내용 역시 생각정리 358 (* The Price of Compute)에서 이미 다뤘다.

Token당 가격이 내려가면 AI 사용량이 줄어드는 것이 아니라,

Hardware Efficiency ↑
→ Cost per Token ↓
→ Addressable Tasks ↑
→ Agent Calls ↑
→ Compute Consumption ↑
→ Cloud Utilization ↑

의 제번스 효과가 발생한다.

따라서 Astra 한 번의 호출이 Sol보다 몇 % 많은 HBM을 쓰는지를 계산하는 것만으로는 충분하지 않다.

실제로 중요한 것은

Memory per Agent × Agents per User × Agent Runtime

이다.

현재 Astra의 정확한 Parameter 수와 Serving Architecture는 공개되지 않았다.

그래서 직접적인 HBM 요구량은 어디까지나 추정해야 한다.

내가 현재 사용하는 중앙 가정은 대략 다음과 같다.


여기서 위 두 줄과 아래 두 줄은 의미가 완전히 다르다.

Astra라는 모델 자체가 HBM을 2배 쓰는 것이 아니다.

모델 자체의 HBM 증가폭은 대략 25~35% 정도일 수 있다.

그보다 훨씬 큰 변화는 Astra가 가능하게 만드는 Agent 사용량과 동시성의 증가에서 발생한다.

따라서 Memory 투자관점에서는 Direct Model Effect보다 Usage Elasticity가 더 중요하다.


3. 그리고 HBM의 핵심은 Capacity보다 Bandwidth로 이동한다


이전에는 GPU당 HBM 탑재용량 증가가 가장 눈에 잘 들어왔다.

H100은 80GB, H200은 141GB, Blackwell Ultra는 288GB까지 증가했다.

그런데 Blackwell Ultra에서 Rubin으로 넘어가면 조금 이상한 변화가 나타난다.


HBM 용량은 그대로인데 대역폭이 2.75배 증가한다. (NVIDIA Developer)

왜 NVIDIA는 HBM 용량을 두 배로 늘리지 않고 대역폭을 거의 세 배 가까이 높였을까.

NVIDIA도 Rubin Architecture를 설명하면서 Context가 길어지고 Interactive Inference가 증가할수록 실제 Memory Performance가 전체 시스템 효율을 지배하는 요소가 된다고 설명한다. (NVIDIA Developer)

결국 문제는 저장공간만이 아니다.

Model Weight와 KV Cache를 아무리 많이 HBM에 넣어놔도 이를 Tensor Core에 충분히 빠르게 공급하지 못하면 연산기는 기다려야 한다.

HBM Capacity = 창고의 크기

HBM Bandwidth = 창고와 공장 사이 컨베이어의 속도

라고 생각하면 이해하기 쉽다.

AI GPU의 생산라인은 엄청난 속도로 빨라졌는데, 원재료를 공급하는 컨베이어가 그 속도를 따라가지 못하고 있는 것이다.


4. GPU Utilization과 FLOPS Utilization은 다르다



여기서 GPU 가동률이라는 표현도 조금 주의해서 사용할 필요가 있다.

GPU Utilization이 90~100%라고 표시된다고 해서 Tensor Core가 이론적 최대 FLOPS의 90~100%를 유료연산으로 전환하고 있다는 의미는 아니다.

Decode에서는 GPU에 작업이 계속 배정돼 있더라도 HBM에서 Weight와 KV Cache가 도착하기를 기다리는 시간이 존재한다.

따라서 실제로 봐야 하는 것은

Useful Model FLOPS / Peak Hardware FLOPS

에 가까운 개념이다.

이를 단순하게 MFU라고 표현하면,

FLOPS Idle = 1 - MFU

가 된다.

중요한 것은 여기서 발생하는 Idle이 단순한 서버 유휴시간과 전혀 다르다는 점이다.

전원도 들어와 있다.

GPU도 비싸게 구매했다.

전력도 소비한다.

그런데 Memory, Network, Scheduling과 Software 병목으로 인해 이론적인 연산능력 중 일부가 실제 Token 생산으로 전환되지 못한다.

말 그대로 돈을 주고 산 FLOPS가 놀고 있는 것이다.


5. H100과 H200이 보여준 Memory의 가치


이 문제를 확인하기에 H100과 H200은 상당히 좋은 자연실험이다.

두 GPU는 같은 Hopper Architecture를 사용한다.

그러나 Memory가 크게 달라졌다.


NVIDIA의 MLPerf 결과에서 동일한 700W 조건의 H200은 Llama 2 70B 추론에서 H100보다 최대 28% 높은 성능을 기록했다. (NVIDIA Developer)

NVIDIA가 설명한 이유도 명확하다.

더 큰 HBM 덕분에 일부 Tensor/Pipeline Parallelism을 줄일 수 있었고, 더 높은 Memory Bandwidth가 Memory-bound 구간의 병목을 완화하면서 Tensor Core utilization이 개선됐다.

즉 Compute Architecture를 완전히 새로 바꾸지 않고도 Memory System을 개선하자 Token 생산량이 크게 증가했다.

이것이 HBM의 경제적 가치다.

HBM은 데이터를 보관하는 부품이 아니라 이미 구입한 GPU의 생산성을 높이는 설비다.


6. Astra에서는 FLOPS가 얼마나 놀게 될까


정확한 수치는 알 수 없다.

OpenAI는 Astra의 실제 Serving Architecture와 production fleet의 MFU를 공개하지 않았다.

따라서 여기부터는 투자모델을 위한 Scenario다.

Agentic Workload를 다음처럼 나눠볼 수 있다.


내가 현재 Base Case로 사용하는 값은 Useful FLOPS 약 **35%**다.

즉 Peak FLOPS의 약 **65%**가 매 순간 완전히 꺼져 있다는 뜻은 아니다.

Memory, Network, Sequential Decode, Expert Routing, Kernel Launch, Latency SLO 등 여러 병목 때문에 최대 연산능력이 Useful Token으로 전환되지 못하는 비중을 의미한다.

그리고 이 65%를 HBM 하나로 모두 회복할 수도 없다.

내가 현실적으로 HBM Capacity와 Bandwidth 개선에 귀속시키는 구간은 약 8~15%p다.

즉,

35% MFU

→ 43~50% MFU

정도로 올라가는 Scenario다.

별것 아닌 것처럼 보이지만 GPU 생산량으로 환산하면 상당히 크다.

43 / 35 - 1 = +23%

50 / 35 - 1 = +43%

즉 Memory System의 개선으로 GPU의 실질적인 생산량이 23~43% 증가할 수 있다.

바꿔 말하면 특정 워크로드에서는 GPU를 23~43% 더 구매하는 것과 비슷한 효과다.


7. HBM 1GB의 가치는 얼마일까


여기서부터 조금 재미있는 계산이 가능하다.

H100에서 H200으로 넘어가면서

  • Capacity +61GB

  • Bandwidth +1.45TB/s

가 동시에 증가했고, 동일 700W에서 최대 28%의 추론 성능 개선이 나타났다.

Capacity와 Bandwidth 효과를 정확하게 분리할 수는 없다.

다만 여러 세대의 변화와 Batch·KV Cache 구조를 함께 감안해 HBM Capacity가 실제 병목인 구간에서 추가 **1GB당 Goodput 약 +0.10~0.18%**를 하나의 경험적 민감도로 사용할 수 있다.

이는 공식적인 산업수치가 아니라 내가 사용하는 모델링 가정이다.

그렇다면 추가 100GB는 대략

+10~18% Goodput

의 잠재가치를 갖는다.

물론 실제 함수는 선형이 아니다.

추가 Memory가 필요 없는 Workload에서는 100GB를 더 달아도 가치가 거의 없다.

반대로 Model Weight나 KV Cache가 HBM에 간발의 차이로 들어가지 않아 GPU를 하나 더 사용해야 하는 경우에는 마지막 몇 GB가 GPU 전체 한 개를 절약할 수도 있다.

그래서 HBM Capacity의 경제적 가치는 선형보다 Threshold에 가깝다.

HBM Capacity ↑
→ Larger Batch
→ More Concurrent Agents
→ Less KV Offload
→ Less Tensor Parallelism
→ Higher GPU Goodput

이 구조다.




8. 실제 돈으로 바꾸면 숫자가 더 커진다


생각정리 325 (* Memory Premium)에서 사용했던 방식과 동일하게 계산해본다.

HBM이 만들어내는 경제적 가치를

GPU 시간당 가치
× 연간시간
× 유료가동률
× Goodput 개선
× Incremental Margin
× 사용기간 현재가치

로 생각할 수 있다.

GB300급 GPU-hour 경제가치를 약 $13, 유료가동률 70%, Incremental Margin 60%, 4년 현재가치 계수를 약 3.17로 놓으면,

GPU Goodput을 단 1% 높이는 경제적 가치는 대략 GPU당 $1,500 전후가 된다.

그렇다면 앞의 경험적 민감도인

+1GB HBM → +0.10~0.18% Goodput

을 적용할 경우,

HBM 1GB의 Marginal Economic Value는 대략

$150~270/GB

정도가 된다.

조금 넓게 잡으면 $100~300/GB 정도다.

다시 말하지만 이것은 HBM의 판매가격을 의미하지 않는다.

Cloud 사업자가 추가 HBM으로 GPU의 생산성을 높이면서 얻는 경제적 잉여의 현재가치다.




9. 그런데 Capacity보다 Bandwidth의 가치가 더 커질 수 있다


Rubin은 GPU당 22TB/s의 HBM4 Bandwidth를 제공한다.

여기서 1TB/s가 추가되면 Bandwidth가 약 4.5% 증가한다.

Memory-bound Workload에서 실제 Throughput의 Bandwidth Elasticity를 보수적으로 0.5~0.8만 적용하더라도,

추가 1TB/s

→ 약 +2.3~3.6% Goodput

정도의 가치가 생길 수 있다.

앞서 계산한 Goodput 1%당 약 $1,500을 적용하면,

HBM Bandwidth +1TB/s의 4년 경제적 가치

는 GPU당 약

$3.5K~5.5K

수준이 된다.

Astra 이후 HBM을 단순히 $/GB로 보면 안 되는 이유다.

앞으로 더 중요한 지표는

$/GB

보다

$/TB/s

일 수 있다.


10. 그래서 Rubin의 22TB/s가 중요하다


Blackwell Ultra에서 Rubin으로 넘어가면서 HBM Capacity는 288GB로 동일하지만 Bandwidth는

8TB/s
→ 22TB/s

로 2.75배 증가한다.

그런데 Compute도 동시에 크게 증가한다.

Blackwell Ultra의 Dense NVFP4 Compute가 약 15PFLOPS, Rubin의 NVFP4 inference 성능은 최대 50PFLOPS다. (NVIDIA Developer)

즉 Compute 증가속도가 Memory Bandwidth 증가속도보다 느리지 않다.

HBM Bandwidth를 거의 세 배 늘렸는데도 Tensor Core를 완전히 먹여 살리기 위해 필요한 Memory Throughput 부담은 여전히 크다.

이것이 중요하다.

HBM의 기술개선이 GPU의 연산성능을 앞서가는 것이 아니라, 급증하는 Compute를 따라가기 위해 거의 전력질주하고 있는 상황에 가깝기 때문이다.

Compute ↑↑
→ Weight/KV Traffic ↑↑
→ HBM Bandwidth ↑↑
→ 그러나 Compute/Bandwidth Ratio는 여전히 높음
→ Memory Wall 지속

따라서 GPU FLOPS가 증가하면 HBM의 중요성이 떨어지는 것이 아니다.

오히려 반대다.

비싸진 FLOPS를 놀리지 않기 위해 Memory 한 단위의 가치가 더 높아진다.


11. NVHBM을 다시 보면 의미가 달라진다


NVHBM의 기술적 구조는 이미 생각정리 355 (* HBM hegemony, NVHBM)에서 정리했으므로 반복하지 않는다.

핵심 숫자만 가져오면 NVIDIA가 표준 HBM4E 대비 제시하는 최대 효과는

  • Memory Bandwidth +30%

  • HBM Power -15%

  • XPU Compute Die Area +25%

다. (NVIDIA Blog)

이 수치들은 NVIDIA가 제시한 up to 기준이므로 실제 고객별 성능은 달라질 수 있다.

그럼에도 앞선 경제적 가치 계산에 넣어보면 꽤 흥미롭다.

22TB/s의 30%라면 추가 Bandwidth는 최대

6.6TB/s

다.

앞서 1TB/s의 경제적 가치를 $3.5K~5.5K/GPU로 계산했으므로 단순한 Bandwidth 효과만으로도

약 $23K~36K/GPU

의 경제적 가치가 설명된다.

여기에는 HBM Power 15% 절감이나 XPU Die 면적 확보효과는 포함하지 않았다.

결국 NVIDIA가 Memory Controller까지 HBM Base Die로 가져가려는 이유도 명확해진다.

NVHBM은 단순히 더 비싼 HBM을 만드는 기술이 아니다.

GPU와 HBM 사이에서 사라지는 FLOPS를 줄이는 기술이다.


12. HBM4 전체의 경제적 가치를 다시 계산해보면


앞선 Memory Premium에서는 Rubin Memory System의 경제적 가치를 대략 $100K~140K/GPU로 추정했다.

이번에는 조금 더 보수적으로 수정하고 싶다.

Rubin HBM4의 Capacity와 Bandwidth가 Agentic Inference의 전체 Goodput을 Blackwell Ultra 대비 약 50~70% 개선하는 데 기여한다고 가정하면,

현재 GPU-hour 경제가치를 기준으로 HBM에 귀속되는 4년 영업이익 현재가치는 대략

$80K~110K/GPU

정도가 Base Case로 적절해 보인다.

Memory-heavy Astra Workload가 예상보다 빠르게 확대될 경우

$120K~150K+

도 가능하다.

즉 기존 추정치를 폐기하는 것이 아니라

기존 $100K~140K

→ Base $80K~110K

→ Astra Bull $120K~150K+

정도로 Scenario를 조금 더 구분하는 편이 합리적이다.


13. 그러면 HBM 가격은 어디까지 올라갈 수 있을까

이전 생각정리 325 (* Memory Premium)에서 Rubin GPU당 HBM4 비용을 약 $8K~12K로 가정했다.



이를 이번에 추정한 HBM의 경제적 가치와 비교하면,

Economic Value / HBM Cost

= 대략 7~14배

가 된다.

물론 이 경제적 잉여를 Memory 업체가 전부 가져갈 수는 없다.

NVIDIA가 가져갈 몫이 있고,

TSMC와 Advanced Packaging 업체가 가져갈 몫이 있고,

Cloud가 가져갈 몫이 있고,

낮아지는 Token 가격을 통해 최종고객에게 돌아갈 몫도 있다.

그러나 Memory 업체가 전체 경제적 잉여의 일부만 가격으로 가져가더라도 현재 HBM 가격보다 훨씬 높은 가격을 시스템이 감당할 여지는 존재한다.

그래서 생각정리 325 (* Memory Premium)에서 추정했던

현실적인 HBM 가격 상단 3~5배

라는 가정을 현재도 유지한다.

이 3~5배는 Cloud가 이론적으로 감당할 수 있는 최대가격이 아니다.

실제 산업 Value Chain에서 Memory 업체가 어느 정도의 경제적 잉여를 협상력을 통해 가져갈 수 있을지에 대한 현실적인 범위에 가깝다.


14. 1GW로 확대하면 더 쉽게 보인다


AI Factory의 경제성은 이미 생각정리 358 (* The Price of Compute)에서 정리했다.

당시 고가동률의 최신 AI Cloud를 가정한 장기 정상화 매출을 약 $17B/GW/년이라는 기준으로 놓았다.


이 숫자를 다시 활용해보자.

새로운 데이터센터나 GPU를 추가하지 않고 HBM이 기존 GPU Goodput만 개선한다고 가정한다.


1GW AI Factory에서 Memory System이 Goodput을 단 10% 높이는 것만으로 약 $3B 이상의 경제적 가치가 발생할 수 있다.

20%면 $6B를 넘어간다.

1GW AI Factory의 건설비 자체를 대략 $40~60B로 봤던 것과 비교해도 무시하기 어려운 금액이다.

Cloud 사업자 입장에서는 HBM 가격이 30%, 50% 올라가는 것이 가장 큰 문제가 아니다.

더 큰 문제는

수백억 달러를 들여 설치한 GPU·Network·Power가 HBM 부족 때문에 10~20% 덜 생산적인 상태로 남는 것

이다.


15. 결국 HBM의 가격결정 방식이 달라진다


과거 DRAM의 가격은 대체로 다음과 같이 생각했다.

Cost
→ Supply/Demand
→ ASP

HBM도 Memory Commodity Cycle의 영향을 받기 때문에 이 논리가 사라지는 것은 아니다.

하지만 AI 시스템 안에서는 새로운 가격기준이 하나 추가된다.

GPU CAPEX
→ Idle FLOPS
→ Additional HBM
→ Recovered Goodput
→ Additional Tokens
→ Additional Revenue
→ Willingness to Pay

따라서 HBM의 Shadow Price는

**Avoided GPU CAPEX

  • Additional Token Revenue

  • Lower Power

  • Lower Network/Sharding Cost**

의 합으로 볼 수 있다.

HBM DRAM Die의 제조원가는 이 가치 가운데 일부일 뿐이다.

이 관점이 중요한 이유는 HBM의 ASP가 과거 일반 DRAM보다 훨씬 오랫동안 높은 수준을 유지할 수 있는 논리적 근거가 되기 때문이다.


16. 같은 288GB라도 가격이 달라질 수 있다


HBM4 이후에는 같은 용량의 HBM이라도 경제적 가치가 달라질 가능성이 높다.

예를 들어 둘 다 288GB라고 하더라도

  • Bandwidth

  • Pin Speed

  • Power

  • Logic Base Die

  • Memory Controller

  • PHY

  • Packaging

  • GPU/XPU와의 최적화

  • 실제 Achieved Bandwidth

가 다르면 GPU가 생산할 수 있는 Token도 달라진다.

그래서 앞으로 HBM은 단순히

GB × $/GB

로 가격이 결정되는 제품에서

Capacity × Bandwidth × Customization × System Qualification

으로 가격이 결정되는 제품에 가까워질 수 있다.

NVHBM이 중요한 이유도 여기에 있다.

앞으로 NVIDIA GPU용 HBM, Google TPU용 HBM, AWS Trainium용 HBM, Microsoft Maia용 HBM의 가격이 동일할 이유가 점점 줄어든다.

HBM은 Commodity DRAM에서 Semi-custom System Component 쪽으로 이동할 가능성이 높다.


17. SOCAMM과 NAND가 증가해도 HBM이 대체되는 것은 아니다


Astra 이후 Persistent Context가 늘어나면 모든 정보를 비싼 HBM에 저장할 수는 없다.

그래서 Memory Hierarchy가 확장된다.

Hot Memory — HBM4

Model Weight, Active KV Cache, Decode와 Prefill

Warm Memory — SOCAMM·Server DRAM

Agent State, Context Buffer, CPU-side processing

Context Memory — CMX·eSSD

Inactive KV Cache, Shared Context, Persistent Memory

Cold Storage — NAND

Long-term Data와 Archived State

이를 HBM 대체로 이해하면 안 된다.

오히려 아래 Memory Tier가 충분히 커지면 비싼 HBM은 가장 가치 있는 Hot Working Set에 집중할 수 있다.

그 결과 HBM utilization과 GPU utilization 모두 높아진다.

즉 DRAM·NAND의 확대와 HBM 확대는 서로 경쟁하는 관계라기보다 AI Memory Hierarchy 전체가 커지는 과정에 가깝다.




18. 가장 강한 반대논리


물론 이 Thesis가 틀릴 수도 있다.

다음 기술들이 예상보다 빠르게 발전한다면 HBM의 Marginal Value는 떨어질 수 있다.

KV Cache Compression

PagedAttention

MLA·GQA

Sparse Attention

Quantization

Prefill·Decode Disaggregation

CXL Memory

Context Tiering

Memory-aware Scheduling

더 중요한 것은 Astra의 성능개선이 Model Size 확대보다 Algorithm, Harness와 Test-time Compute 개선에서 대부분 발생했을 가능성이다.

이 경우 Astra 자체의 HBM Capacity 증가폭은 예상보다 훨씬 작을 수 있다.

하지만 여기서도 한 가지를 구분해야 한다.

Memory per Task 감소

와

Total Memory Demand 감소

는 같은 이야기가 아니다.

Memory Efficiency ↑
→ Cost per Task ↓
→ Addressable Tasks ↑
→ Agent Usage ↑
→ Concurrent Workloads ↑

가 더 빠르게 나타난다면 전체 Memory 수요는 계속 증가할 수 있다.

결국 이 Thesis를 정말 훼손하는 것은 Memory Efficiency 개선 그 자체가 아니다.

앞으로 확인해야 하는 것은 세 가지다.

첫째, Astra 이후 실제 평균 Context가 늘어나는가.

둘째, 사용자당 Concurrent Agent 수가 증가하는가.

셋째, Memory Traffic의 효율화보다 Agent 업무량 증가속도가 더 빠른가.

이 세 가지를 계속 확인하면 될 것 같다.


19. HBM은 GPU의 Yield Enhancer가 된다


이전까지 HBM을 바라보는 가장 직관적인 방법은 GPU 한 개에 몇 GB가 들어가는지를 계산하는 것이었다.

앞으로는 그것만으로 부족할 가능성이 높다.

내가 현재 중요하게 보는 지표는 다음과 같다.


특히 앞으로는 HBM TB/s/GPU와 Useful FLOPS/Peak FLOPS를 같이 봐야 할 것 같다.

결국 HBM이 하는 일은 단순하다.

놀고 있는 GPU FLOPS를 다시 생산라인으로 돌려놓는다.


글을 마치며,


Astra를 보면서 처음에는 이 모델이 Sol보다 HBM을 얼마나 더 많이 사용할지가 궁금했다.

조금 더 들여다보니 그 질문 자체가 너무 좁았던 것 같다.

Astra 자체가 Sol보다 HBM을 2배 사용하는지가 중요한 것이 아니다.

Astra가 더 긴 Context를 실제 업무에 사용하고, 인간이 더 많은 업무를 Agent에게 위임하고, 여러 Agent가 동시에 수시간씩 움직이기 시작하면 AI Factory 전체의 Memory Traffic이 얼마나 증가하는지가 더 중요하다.

그리고 Compute가 증가할수록 HBM의 가치도 달라진다.

GPU FLOPS ↑
→ Memory가 공급해야 할 Data ↑
→ Memory Wall ↑
→ Idle FLOPS의 절대가치 ↑
→ HBM의 Shadow Price ↑

결국 HBM의 경제적 가치는 저장되는 Byte 자체의 가치가 아니다.

그 Byte가 되살리는 GPU FLOPS의 가치다.

이 관점에서 보면 B300에서 Rubin으로 넘어가면서 HBM Capacity가 288GB로 그대로인데 Bandwidth가 8TB/s에서 22TB/s로 2.75배 증가하는 이유도 이해된다.

NVIDIA가 NVHBM을 통해 Memory Controller를 Base Die까지 내려보내고 표준 HBM4E보다 최대 30% 높은 Bandwidth를 얻으려는 이유도 같은 맥락이다.

AI 산업에서는 Compute가 점점 비싸지는 것이 아니라 생산 가능한 Compute가 점점 귀해지고 있다.

GPU 한 개가 가진 Peak FLOPS보다 중요한 것은 실제로 몇 %의 FLOPS를 유료 Token으로 전환할 수 있느냐다.

그래서 앞으로 HBM을 단순한 Memory BOM으로 보는 것은 적절하지 않을 수도 있다.

HBM은 GPU의 Yield Enhancer에 가깝다.

더 많은 GPU를 설치하지 않고도 이미 구매한 GPU, 이미 확보한 전력, 이미 지은 데이터센터에서 더 많은 Intelligence를 생산하게 해준다.

이 구조가 맞다면 HBM의 가격 상단 역시 과거 Commodity DRAM의 원가나 역사적 Premium만으로 설명하기 어렵다.

내 현재 Base Case에서는 Rubin HBM4가 GPU당 만들어내는 경제적 가치를 약 $80K~110K, Astra와 같은 Memory-heavy Agent workload가 빠르게 확산되는 경우 $120K~150K 이상까지 열어두고 있다.

반면 현재 가정하는 HBM4의 실제 비용은 그보다 훨씬 낮다.

결국 앞으로 중요한 질문은

“HBM 가격이 얼마나 더 오를 수 있는가”

보다,

“HBM이 만들어내는 System Surplus 가운데 Memory 업체가 얼마만큼을 가격으로 가져갈 수 있는가”

에 가까울 것 같다.

생각정리 324 (* Token Empire)에서 처음 정리했던 AI Cloud의 생산성은 결국

Chip × Memory × Network × Power × Software × Utilization

의 곱으로 결정된다.

Astra 이후에는 이 식에서 Memory와 Utilization 사이의 관계가 이전보다 훨씬 중요해질 가능성이 높아 보인다.

Compute가 더 빨라질수록 Memory의 중요성이 낮아지는 것이 아니라, 그 비싼 Compute를 굶기지 않기 위해 Memory의 경제적 가치가 더 높아진다.

(하루만 더 참을껄 젠~~~장~~~~~~..)

=끝

2026년 9월 2일 수요일

생각정리 358 (* The Price of Compute)

Broadcom 실적발표, 그리고 Nvidia Jenson Hwang의 최근 발언에서 흥미로운 수치들이 연달아 발표됨에 따라 cloud 사업자들이 얼마나 많은 이익을 미래에 창출해낼 수 있는지에 대한 그간의 궁금증 일부를 해소할 수 있게 됐다.

이번글은 그 해소과정을 리서치기록으로 남긴 글이다.

2026.09.03 Broadcom

토큰이 싸질수록 Cloud의 1GW는 왜 더 비싸지는가


AI 하드웨어의 성능은 계속 높아지고 있다.

NVIDIA의 차세대 플랫폼은 동일한 전력으로 더 많은 토큰을 생성하고, OpenAI의 차세대 모델은 더 적은 토큰으로 더 복잡한 문제를 해결하게 될 것이다. 모델 증류와 open-weight 경쟁까지 고려하면 백만 토큰당 원가와 판매가격은 구조적으로 하락할 가능성이 높다.

그런데 여기서 역설이 발생한다.

토큰이 저렴해지면 기업과 개인은 AI를 덜 사용하는 것이 아니라 더 많이 사용한다. 단순한 질문과 답변을 넘어 리서치, 코딩, 고객 응대, 소프트웨어 실행, 검증과 재시도를 AI agent가 수행하기 시작하면 한 번의 인간 요청이 수십 번, 수백 번의 모델 호출로 증폭된다.

결국 AI 산업에서는 다음 세 가지가 동시에 나타날 수 있다.

Cost per token ↓
Price per productive MW ↑
Utilization ↑

토큰당 원가는 내려가지만 즉시 사용할 수 있는 전력·부지·냉각·네트워크·컴퓨팅의 가격은 오르고, AI 데이터센터의 가동률도 상승하는 것이다.

이 경우 AI 산업의 가치 배분은 LLM 소프트웨어에서 Cloud와 physical infrastructure 쪽으로 이동한다.

이 글에서 확인하고 싶은 것은 하나다.

Cloud 사업자의 매출과 이익은 생산 가능한 1GW당 어디까지 올라갈 수 있는가.

 


1. AI 시대에는 1GW가 하나의 경제 단위가 된다


젠슨 황은 G20 연설에서 AI 인프라를 전기를 지능으로 바꾸는 새로운 종류의 공장으로 설명했다.

기존 공장이 에너지를 물리적 제품으로 수익화했다면, AI factory는 전력을 compute로 전환하고 compute를 다시 token과 intelligence revenue로 바꾼다.

Energy → Compute → Tokens → Intelligence → Revenue


젠슨 황이 언급한 AI factory의 투자비는 1GW당 500억~600억 달러다. 
NVIDIA G20 연설

CNBC

이는 JPMorgan이 VR200 기준으로 추정한 1GW당 400억~450억 달러보다 높다. 하지만 두 수치가 반드시 모순되는 것은 아니다.

어떤 계산은 서버와 가속기 중심이고, 다른 계산은 네트워크·냉각·전력 인입·건물·부지까지 포함한 완성형 AI factory를 기준으로 하기 때문이다. 세대와 지역 차이까지 감안하면 현재의 합리적인 all-in 투자비 범위는 대략 400억~600억 달러/GW로 볼 수 있다.

1GW를 둘러싼 다섯 개의 숫자


이 숫자들을 비교할 때 가장 중요한 것은 시간축이다.

Custom XPU의 200억~300억 달러/GW와 NVIDIA 플랫폼의 약 400억 달러/GW는 구축하거나 교체할 때 발생하는 장비 판매액이다. 반면 Cloud의 170억 달러/GW와 frontier AI lab의 300억 달러/GW는 매년 반복되는 매출이다.

따라서 XPU와 Cloud 매출을 그대로 더하면 안 된다.

5년 교체주기를 단순 적용하면 Broadcom custom XPU의 연환산 매출은 40억~60억 달러/GW, NVIDIA 플랫폼의 연환산 매출은 ​약 80억 달러/GW가 된다.

Broadcom의 Hock Tan은 2026년 9월 실적발표에서 custom XPU 콘텐츠가 세대가 바뀌어도 200억~300억 달러/GW를 유지할 수 있다고 설명했다.

칩 한 개의 가격은 상승하지만 칩당 전력소비량도 증가하기 때문에 1GW에 설치할 수 있는 칩 수는 감소한다. 두 효과가 서로 상쇄되면서 XPU value/GW가 비교적 안정적으로 유지된다는 의미다.

같은 자리에서 Hock Tan은 frontier AI lab이 약 300억 달러의 ARR/GW를 만들 수 있다고 말했다. 약 1년 전 제시했던 100억 달러/GW보다 세 배 높아진 수치다.
Broadcom Q3 FY2026 Earnings Call

다만 투자회수기간은 매출이 아니라 이익을 기준으로 계산해야 한다.

앞서 추정한 1GW AI factory의 all-in 투자비 400억~600억 달러를 연간 Cloud 매출 170억 달러와 비교하면 단순 매출 기준 회수기간은 약 2.4~3.5년이다.

하지만 2026년 2분기 AWS와 Google Cloud의 영업이익률은 각각 39.4%와 35.6%였다. 이를 AI Cloud 수익성의 대리치로 적용하면 1GW당 연간 영업이익은 약 60억~67억 달러, 영업이익 기준 투자회수기간은 ​약 6~10년, 중간값은 약 8년​이 된다.
Amazon Q2 2026 Results
Alphabet Q2 2026 Earnings Call

Amazon이 밝힌 3년 미만의 투자회수기간은 서버와 네트워크 장비에 한정된 수치다. 이 장비들은 최소 5~6년간 사용되고, 최근 AI Capacity 계약도 대부분 5년 이상이다. 반면 데이터센터 건물과 전력설비는 30년 이상 여러 세대의 서버를 수용한다.
생각정리 325 (* Memory Premium)

Microsoft도 AI CapEx의 약 3분의 2를 CPU·GPU 같은 단기자산, 나머지를 데이터센터와 네트워크 같은 장기자산으로 구분하고 있다. 데이터센터 내용연수는 25년으로 연장했지만 Azure의 정확한 투자회수기간은 공개하지 않았다.
Microsoft FY2026 Q4 Earnings Call

결국 AI 데이터센터의 투자회수 구조는 두 층으로 나뉜다.

서버·가속기·네트워크 장비는 약 3년 안팎에 투자비를 회수하고, 토지·전력·건물·냉각설비까지 포함한 전체 AI factory는 영업이익 기준 약 6~10년에 걸쳐 회수한다.

초기 Ramp-up과 이자·세금, GPU 세대교체 비용까지 고려하면 실질적인 전체 투자회수기간은 보수적으로 약 8~12년으로 보는 것이 합리적이다.

그럼에도 데이터센터 건물과 전력 인프라는 25~30년 이상 활용할 수 있다. 장기계약과 높은 가동률이 유지된다면 초기 투자비를 회수한 이후에도 여러 세대의 Compute를 반복적으로 설치하면서 장기간 잉여현금흐름을 창출할 수 있는 구조다.



2. Cheaper Tokens, More Expensive Compute


AI 하드웨어의 발전은 토큰당 원가를 계속 낮출 것이다.

NVIDIA는 Rubin 플랫폼이 Blackwell 대비 inference token cost를 최대 10분의 1로 낮추고, MoE 모델 학습에 필요한 GPU 수를 최대 4분의 1로 줄일 수 있다고 발표했다.
NVIDIA Rubin Platform

OpenAI의 Astra도 같은 방향을 보여준다.

OpenAI는 Astra가 GPT-5.6 Sol보다 높은 성능을 보이면서 일부 cyber evaluation에서 더 적은 토큰으로 더 높은 성과를 냈다고 설명한다. 제한된 평가 결과이므로 이를 전체 경제에 그대로 외삽할 수는 없지만, 모델 성능 상승과 토큰 효율 개선이 동시에 일어날 수 있다는 사례다.
OpenAI, Path to Astra

https://x.com/chetaslua/status/2095013971782996291/photo/1

문제는 토큰 원가 하락이 반드시 전체 compute 수요 감소로 이어지지 않는다는 점이다.

AI가 검색이나 단순 질의응답에 머물렀을 때는 인간의 요청 한 번에 모델 호출도 한 번 발생했다. 그러나 agent는 계획을 세우고, 정보를 찾고, 코드를 실행하고, 결과를 검증하고, 실패하면 다시 시도한다.

젠슨 황은 agentic AI가 일반적인 prompt보다 최대 100만 배 많은 토큰을 소비할 수 있다고 설명했다. 이 수치를 그대로 수요 전망에 적용하기는 어렵지만, 인간의 요청과 compute 소비량 사이의 관계가 비선형적으로 바뀐다는 방향은 분명하다.
Morgan Stanley–Jensen Huang Fireside Chat

Agent 기능 도입이후 폭증하는 token사용량
openrouter

결국 다음과 같은 제번스 효과가 발생한다.

Hardware efficiency ↑
→ Cost per token ↓
→ AI use cases ↑
→ Agent calls per task ↑
→ Tokens consumed ↑
→ Cloud utilization ↑
→ Revenue per GW ↑

「생각정리 346 (* AI polarization and contradiction)」에서 언급했던 ‘이질적 제번스 효과’가 바로 이것이다.


토큰 단가는 하락하지만 heavy user의 AI 사용량은 훨씬 빠르게 증가한다. 같은 기간 GPU 임대가격은 토큰 가격만큼 빠르게 하락하지 않을 수 있다.

Intelligence에는 deflation이 오지만, productive compute에는 inflation이 올 수 있다.

 

heavy user의 AI 사용량은 훨씬 빠르게 증가
Source: COATUE



3. 가격 상승의 대상은 토큰이 아니라 productive MW다


여기서 ‘가격이 오른다’는 의미를 분명하게 구분해야 한다.

Cloud의 토큰당 실현가격이 상승한다는 뜻이 아니다. 차세대 하드웨어의 처리량이 증가하면 Cloud의 token price도 장기적으로 하락할 가능성이 높다.

상승하거나 유지될 수 있는 가격은 즉시 사용할 수 있는 reserved MW 또는 productive GW의 가격이다.


IEA는 전 세계 데이터센터 전력 소비가 2024년 415TWh에서 2030년 약 945TWh로 증가할 것으로 전망한다. 가속 서버의 전력 소비는 같은 기간 연평균 약 30% 증가할 전망이다.
IEA, Energy and AI

반면 미국 전력망 접속 대기열에는 2025년 말 기준 1,312GW의 발전 프로젝트와 749GW의 저장 프로젝트가 쌓여 있었다.

2025년에 가동을 시작한 프로젝트의 접속 신청부터 상업운전까지 걸린 기간 중앙값은 5년 이상이었다. 2000~2020년에 접수된 용량 중 2025년 말까지 실제 운전으로 이어진 비율도 **13%**에 불과했다.
Lawrence Berkeley National Laboratory, Queued Up

이는 「생각정리 348 (* Power is the Inner Loop)」의 결론과 연결된다.

AI 산업의 가장 안쪽 loop는 결국 전력과 냉각이다. 2030년에 연결될 예정인 1GW와 지금 당장 사용할 수 있는 1GW는 같은 상품이 아니다.

희소한 것은 전력 공급계획에 표시된 headline GW가 아니다.

Time-to-Power가 짧고, 전력품질과 냉각·네트워크가 확보됐으며, 실제 고객 workload가 돌아가는 productive GW가 희소한 것이다.


4. 반대로 LLM의 희소성은 낮아질 수 있다


Cloud가 더 많은 가치를 가져가려면 물리적 공급이 부족한 것만으로는 충분하지 않다.

상대편인 LLM 소프트웨어의 희소성이 더 빠르게 낮아져야 한다.

그 가능성은 이미 세 가지 경로에서 나타나고 있다.

첫째, 반복되는 증류

강한 frontier model의 능력이 더 작은 모델로 이전되고 있다.

DeepSeek-R1은 1.5B~70B 크기의 여섯 개 distilled model을 공개했다. 일부 reasoning benchmark에서는 훨씬 큰 모델에 근접하는 성능을 보였다.
DeepSeek-R1 Paper

둘째, Open-weight 경쟁

OpenAI의 gpt-oss-120b는 핵심 benchmark에서 o4-mini에 근접하는 성능을 목표로 하면서 단일 80GB GPU에서 작동하도록 설계됐다.
OpenAI, Introducing gpt-oss

셋째, 모델 전환비용 하락

Routing, fine-tuning, retrieval, agent framework가 발전하면 애플리케이션은 하나의 모델에 종속되지 않는다.

작업의 난이도와 가격에 따라 frontier model, distilled model, open-weight model을 조합할 수 있다. 모델 간 성능 차이가 줄어들수록 가격 경쟁은 심해지고 LLM 사업자의 수익화/token은 하락한다.

반면 Cloud 사업자는 OpenAI, Anthropic, open-weight hosting, sovereign AI, 기업 전용 모델의 수요를 모두 받을 수 있다.

모델 간 경쟁이 치열해질수록 전체 AI 사용량은 증가하고, 공통적으로 사용되는 Cloud와 physical infrastructure의 총수요도 늘어난다.

이것이 「생각정리 342 (* LPS, Where Does Value Accrue in the AI Era?)」에서 제시했던 구조다.

지능의 희소성이 낮아진다고 산업의 가치가 사라지는 것은 아니다.

가치는 Land + Power + Shell, accelerator, network, cloud orchestration처럼 복제가 느린 계층으로 이동한다.

다만 Cloud를 단순한 GPU 임대사업으로 보면 이 주장은 약해진다.

「생각정리 338 (* NeoCloud)」에서 언급했듯 장기적으로 높은 수익성을 얻는 사업자는 GPU만 임대하는 곳이 아니다.

Training, evaluation, inference optimization, orchestration, agent runtime까지 통합한 Merchant AI Factory가 되어야 한다. 그래야 고객의 전환비용을 높이고, fleet의 가동률을 안정시키며, 빠른 하드웨어 세대교체 위험을 흡수할 수 있다.


5. Cloud 매출/GW 계산식


Cloud 매출은 다음과 같이 단순화할 수 있다.

Cloud revenue/GW
= 현재 매출/GW × 처리량 배수 × 가동률 변화 × Cloud 실현가격/token 지수

LLM 매출도 같은 구조로 계산할 수 있다.

LLM revenue/GW
= 현재 매출/GW × 처리량 배수 × 가동률 변화 × LLM 수익화/token 지수

현재의 출발점은 다음과 같이 설정한다.

  • Cloud 매출: 170억 달러/GW/년

  • LLM 외부매출: 300억 달러/GW/년

  • 기준 가동률: 80%

Cloud 매출은 LLM 매출의 원가에 포함된다.

따라서 두 숫자는 같은 산업의 독립적인 매출처럼 합산하면 안 된다. LLM 사업자가 고객에게 300억 달러를 받고 그중 170억 달러를 Cloud 사업자에게 지급하는 구조로 이해해야 한다.

「생각정리 324 (* Token Empire)」에서 정리했듯 AI Cloud의 생산성은 GPU FLOPS 하나로 결정되지 않는다.

Chip × Memory × Network × Power Efficiency × Software Optimization × Utilization

Rubin의 ‘최대 10배 낮은 token cost’를 곧바로 10배 처리량으로 적용하는 것은 지나치게 공격적이다.

실제 fleet에는 구형 GPU가 섞여 있고, 차세대 모델은 더 많은 test-time compute를 사용할 수 있다. 메모리, 네트워크, 전력과 냉각 병목도 남는다.

따라서 2030년의 실효 처리량은 5~8배, 가동률은 90~95% 범위로 가정했다.


6. 2030년 세 가지 시나리오




Software moat + Grid relief


이 시나리오에서는 frontier model의 차별성이 유지되고 전력망과 데이터센터 공급이 예상보다 빠르게 증가한다.

LLM 사업자는 outcome pricing과 subscription, agent, 광고, commerce를 통해 높은 수익화를 유지한다. 반면 Cloud 사업자는 공급 증가로 가격 협상력이 약해진다.

2030년 Cloud 매출은 약 220억 달러/GW, LLM 매출은 약 550억 달러/GW가 된다. Cloud fee 비중은 **약 40%**로 하락한다.

Base case


처리량은 6.5배, 가동률은 93%까지 올라간다.

토큰당 Cloud 가격은 현재의 23%까지 하락하지만, 사용량과 가동률 증가가 이를 상쇄한다. Cloud 매출은 약 300억 달러/GW, LLM 매출은 약 480억 달러/GW가 된다.

Cloud fee 비중은 **약 63%**까지 올라간다.

Cloud scarcity


이 시나리오가 내가 개인적으로 생각하는 가설에 가장 가깝다.

  • AI 하드웨어의 실효 처리량이 8배 증가한다.

  • 가동률은 **80%에서 95%**로 상승한다.

  • Cloud 가격/token은 현재보다 약 80% 하락한다.

  • LLM 수익화/token은 open-weight와 증류 경쟁으로 약 84% 하락한다.

  • 전력과 데이터센터 병목은 계속된다.

Cloud 매출 계산은 다음과 같다.

170억 달러 × 8.0 × (95% ÷ 80%) × 20.4%
= 약 330억 달러/GW/년

LLM 매출은 다음과 같다.

300억 달러 × 8.0 × (95% ÷ 80%) × 15.8%
= 약 450억 달러/GW/년

LLM의 절대매출도 300억 달러에서 450억 달러로 증가한다.

그러나 Cloud 비용은 170억 달러에서 330억 달러로 더 빠르게 증가한다. 이에 따라 LLM 매출에서 Cloud가 차지하는 비율은 **57%에서 73%**로 높아진다.

이것은 Cloud가 AI 산업 전체 매출의 73%를 가져간다는 의미가 아니다.

LLM 사업자가 고객에게 받는 매출 1달러 중 약 73센트가 Cloud 비용으로 지급된다는 의미다.

LLM lab과 Cloud가 같은 회사라면 이 숫자는 외부매출이 아니라 내부 이전가격이 된다.

내 판단으로는 2030년 60~65%가 가장 가능성이 높은 구간이다. 70~75%는 가능한 상단 시나리오지만 다음 조건이 동시에 충족돼야 한다.

  • Agent workload가 token efficiency 개선보다 빠르게 증가한다.

  • 주요 시장의 Time-to-Power가 계속 3~5년 수준에 머문다.

  • Cloud fleet 가동률이 90% 이상에서 유지된다.

  • LLM 가격 경쟁이 심해져도 기업의 AI 예산과 사용량은 계속 증가한다.

  • Cloud 사업자가 전력과 GPU를 넘어 orchestration까지 확보한다.





7. 매출보다 중요한 것은 EBIT이다


Cloud 사업자의 높은 EBITDA를 곧바로 이익으로 보면 안 된다.

AI 서버의 감가상각, 빠른 세대교체, 막대한 이자비용을 고려해야 한다.

CoreWeave의 2026년 2분기 실적이 대표적인 사례다.

  • 분기 매출: 25.75억 달러

  • Active power: 1.5GW

  • Adjusted EBITDA margin: 59%

  • GAAP operating margin: -2%

  • Net margin: -24%

  • 분기 감가상각: 13.93억 달러

  • 분기 이자비용: 6.40억 달러


CoreWeave Q2 2026 Results

기말 active power 1.5GW를 기준으로 연환산하면 현재 매출은 약 69억 달러/GW다. 평균 active power를 약 1.25GW로 가정해도 82억 달러/GW 정도다.

이는 JPMorgan의 170억 달러/GW가 현재 CoreWeave fleet의 실제 매출이라기보다 높은 가동률과 최신 장비를 전제로 한 안정화 잠재력에 가깝다는 뜻이다.

Cloud EBITDA margin을 55~64%, 연간 감가상각을 80억~120억 달러/GW로 가정하면 2030년 EBIT은 다음과 같다.


Cloud scarcity 시나리오에서 총투자비를 500억 달러/GW로 가정하면 EBIT/총투자비는 약 **16~20%**가 된다.

다만 이 수치는 이자와 세금을 차감하기 전이다. 부채비용이 높거나 장비의 경제적 수명이 짧아지면 실제 equity return은 크게 낮아질 수 있다.

따라서 AI Cloud의 핵심 KPI는 EBITDA margin 하나가 아니다.

Utilization × Revenue/MW × Refresh Discipline × Cost of Capital

 



8. XPU와 LPS 사업자는 얼마나 가져가는가


Cloud의 협상력이 높아지더라도 physical scarcity rent 전부를 Cloud 사업자가 가져가는 것은 아니다.

전력 인입 부지, XPU와 GPU, HBM, 네트워크, 냉각, 건설, 금융사업자가 이를 나눠 가진다.


Broadcom과 NVIDIA의 수치는 서로 더할 수 있는 숫자가 아니다.

고객이 custom XPU를 선택하는지 NVIDIA 플랫폼을 선택하는지에 따른 대안적 구조다. 또한 사업부별 마진이 모두 공개된 것은 아니므로 영업이익은 회사 전체 또는 반도체 부문의 수익성을 할인 적용한 추정치다.

LPS의 참고사례로 Hut 8은 계약된 949MW IT load에서 연 17.5억 달러 이상의 NOI를 제시했다. 이를 단순 환산하면 약 18.4억 달러/IT-GW/년이다.
Hut 8 Beacon Point

Cloud의 헤게모니는 GPU를 많이 소유했다는 사실만으로 만들어지지 않는다.

전력이 연결된 부지 + 최신 compute fleet + HBM·network + cooling + financing + orchestration software

이 모든 것을 하나의 SLA로 묶어 고객에게 제공할 수 있을 때 Cloud는 단순 인프라가 아니라 AI 생산의 운영체제가 된다.


9. 이 가설이 틀릴 수 있는 이유


첫째, 높은 rent는 신규 공급을 부른다

Cloud의 EBIT/투자비가 장기간 **20%**에 접근하면 hyperscaler, utility, infrastructure fund와 private capital이 신규 공급을 늘릴 것이다.

희소성 rent는 공급을 끌어들여 스스로를 약화시키는 성질이 있다.

둘째, Frontier lab이 Cloud를 내재화할 수 있다

Hock Tan도 선도 AI lab들이 장기적으로 hyperscaler처럼 자체 인프라를 보유할 가능성을 언급했다.

이 경우 경제적 가치는 Cloud 계층에 남더라도 독립 Cloud 사업자의 외부매출로 잡히지 않는다.

셋째, LLM 사업자가 Outcome pricing으로 이동할 수 있다

LLM이 token이 아니라 outcome, seat, agent, 광고, commerce로 과금하면 token 가격 하락보다 소프트웨어 매출이 더 빠르게 증가할 수 있다.

AI가 기업의 인건비와 외주비를 직접 대체한다면 고객은 token 수가 아니라 절감된 비용과 창출된 매출을 기준으로 지불할 것이다.

넷째, 하드웨어 발전이 기존 자산의 수명을 단축할 수 있다

새 GPU가 token cost를 크게 낮출수록 구형 fleet의 경제적 수명은 짧아진다.

Cloud 사업자는 생산성 개선의 수혜를 받지만 동시에 더 큰 감가상각과 교체 CapEx를 부담한다.

다섯째, 연결된 GW와 수익화된 GW는 다르다

전력을 확보했다고 바로 매출이 발생하는 것은 아니다.

GPU, HBM, 광모듈, 냉각, 네트워크 또는 고객계약이 부족하면 headline GW는 revenue-generating GW가 되지 못한다.

가설을 낮춰야 하는 신호

다들 별 가망성 없는 얘기들 뿐이다..


결론: 희소한 것은 모델이 아니라 제시간에 작동하는 GW다


AI 산업에서는 두 방향의 힘이 동시에 작동한다.

하나는 deflation이다.

모델은 더 강해지고, 더 작은 모델로 증류되고, open-weight로 공개된다. 차세대 하드웨어는 동일한 전력으로 더 많은 토큰을 생산하고 token cost를 낮춘다.

다른 하나는 inflation이다.

Agent는 더 오래 생각하고 더 많은 도구를 호출한다. 기업과 개인은 저렴해진 지능을 더 많이 사용한다.

Agent 기능 도입이후 폭증하는 token사용량
openrouter

그러나 전력망, 변전소, 냉각, 토지, HBM, 광통신과 자본은 소프트웨어의 속도로 늘어나지 않는다.

이 두 힘이 만나는 지점에서 Cloud의 경제성이 좋아진다.

**Cost per token ↓

  • Token demand ↑

  • Utilization ↑

  • Productive GW scarcity ↑
    = Revenue and EBIT per GW ↑**


나의 기준 추정치는 2030년 Cloud 매출 290억~310억 달러/GW, EBIT 60억~80억 달러/GW다.

Physical bottleneck이 지속되고 LLM의 상대적 희소성이 더 빠르게 약해진다면 Cloud 매출은 약 330억 달러/GW, EBIT은 80억~100억 달러/GW까지 올라갈 수 있다. LLM 매출 대비 Cloud fee 비중도 **70~75%**에 도달할 수 있다.

그러나 이는 영구적인 독점을 의미하지 않는다.

높은 수익성은 신규 공급과 수직계열화를 부른다. 결국 승자는 GPU를 가장 많이 구매한 회사가 아니라, 전력화된 시간을 먼저 확보하고 그 위에서 고객 workload를 가장 높은 가동률로 반복 수익화하는 회사일 가능성이 높다.

AI 시대의 가장 희소한 상품은 model weight 자체가 아니다.

제시간에 연결되고, 조달 가능하며, 실제로 작동하는 productive GW다.

#글을 마치며


최근 말이 많은 버크셔의 알파벳 투자를 단순히 Gemini라는 LLM 소프트웨어에 대한 베팅으로 해석하는 것은 지나치게 좁은 시각일 수 있다.


https://www.reuters.com/legal/legalindustry/berkshire-ceo-abel-sees-opportunity-energy-business-ai-2026-09-02/


오히려 기술 변화와 인력 이동에 민감한 모델 자체보다, TPU·Cloud·데이터센터·전력·에너지로 이어지는 장수명 AI 인프라와 그 희소성에 투자했다고 보는 편이 버크셔의 투자 성향에 더 부합한다.

알파벳은 자체 모델과 TPU, GCP, 글로벌 네트워크를 보유하면서도 대규모 투자를 감당할 우량한 재무구조와 현금창출능력을 갖추고 있다. 구글이 모든 Frontier LLM과 성능 경쟁을 벌이는 것보다, AI 확산 과정에서 필연적으로 증가하는 컴퓨팅 수요를 자체 인프라로 수익화하는 전략이 오히려 더 합리적일 수 있다.

생각정리  316 (* Warren Buffet, Alphabet)

앞으로 AI 산업의 헤게모니가 LLM에서 Cloud로, 다시 Cloud에서 전력과 physical infrastructure로 이동한다면, 가장 유리한 위치에 있는 사업자는 단순히 최고의 모델을 만든 기업이 아닐 것이다.

AI가 작동하는 데 필요한 전체 인프라 체인을 보유하고, 막대한 투자비를 견디며, 이를 반복적으로 수익화할 수 있는 Alphabet GCP, Amazon AWS, Microsoft Azure 같은 사업자
가 장기적으로 더 큰 가치를 가져갈 가능성이 높다.


=끝