레이블이 AI담론-AgentAI인 게시물을 표시합니다. 모든 게시물 표시
레이블이 AI담론-AgentAI인 게시물을 표시합니다. 모든 게시물 표시

2026년 9월 28일 월요일

생각정리 379 (* The Agent Needs a Witness)

Agent AI가 앞으로 사회 전반에 어떤 경로로 어떤 파급효과를 낼지..


Agent AI가 Chatbot과 Research의 영역을 넘어 실제 행동과 거래를 수행하는 Execution Layer로 내려오고 있다.

이전 글 생각정리 376 (* Muse Agent AI, The Consumer Token Moment)에서는 Meta Muse가 개인용 AI Worker를 일반 소비자에게 배포하면서 B2C Agent와 Token 수요를 확대하는 경로를 정리했다.

생각정리 372 (* Intelligence Is Abundant, Execution Is Scarce)에서는 모델의 희소성이 낮아질수록 데이터·실행권한·유통망·물리적 인프라의 가치가 높아질 가능성을 살펴봤다.

이번 글에서는 그다음 문제를 생각해보려 한다.

Agent가 우리를 대신해 행동하는 세상에는 Agent의 행동을 독립적으로 기록하고 검증하는 증인이 필요하다.

Muse가 보여준 첫 번째 효용은 돈과 귀찮음이었다


Meta Muse는 질문에 답하는 Assistant가 아니라 브라우저와 외부 서비스를 이용해 실제 업무를 수행하는 Personal AI Agent다.

공개된 X와 Threads의 사용 사례를 수집한 독립 자료에는 2026년 9월 29일 기준 129개의 사례가 정리돼 있다.


  • 돈 절약·환급·보험·청구 28건, 21.7%

  • 쇼핑·상품 비교 28건, 21.7%

  • 여행·예약 19건, 14.7%

  • 업무 9건, 7.0%

  • 생산성 4건, 3.1%

  • 초기 설정과 기능 실험 41건, 31.8%


초기 설정을 제외하면 돈과 쇼핑이 공동 1위이며 여행이 그다음을 차지한다.

다만 이는 Meta의 공식 사용비율이 아니라 공개 SNS 사례를 분류한 표본이다. 성공한 사례가 실패한 사례보다 공유되기 쉽다는 선택편향과 자기보고의 한계도 존재한다.

그럼에도 사용자가 Agent에서 가장 먼저 발견한 효용은 명확하다.

Agent는 정보가 부족해서라기보다 귀찮아서 포기했던 돈과 권리를 대신 찾아오기 시작했다.

사용하지 않는 구독 해지, 보험료 인하, 미청구 보험금과 환급금 신청, 항공편 지연 보상, 상품권과 휴면계좌 잔액 확인, 최저가 쇼핑과 여행 예약이 대표적이다.

Research가 정보비대칭을 줄였다면 Execution은 탐색 이후의 행동비용까지 줄인다.

보험사와 금융회사는 소비자가 받을 수 있는 혜택과 더 나은 상품을 알고 있다. 그러나 소비자는 약관을 읽고, 고객센터에 전화하고, 서류를 제출하는 비용 때문에 이를 포기한다.

Agent는 정보를 알려주는 데서 끝나지 않고 실제 해지와 청구, 비교와 이동까지 수행한다.

효용을 제공하는 기술에는 Ratchet이 작동한다


인간에게 분명한 효용을 제공하는 기술이 일상에 들어오면 사회는 그 기술이 없었던 상태로 쉽게 돌아가지 않는다.

이는 절대적인 자연법칙이라기보다 Ratchet Effect, 경로의존성, 전환비용과 기술적 관성이 결합된 현상에 가깝다.

Agent가 보험금 청구와 가격비교, 예약과 반복 행정업무를 대신하기 시작하면 사용자는 다시 모든 약관을 읽고 고객센터에 직접 전화하던 방식으로 돌아가려 하지 않을 것이다.

기업도 Agent Traffic에 대응해 상품정보, 가격, 결제 API와 고객지원 체계를 바꾸게 된다. 규제기관은 Agent 인증과 책임기준을 만들고, 금융회사와 보험사는 Agent를 전제로 상품과 보상체계를 설계한다.

개인의 습관뿐 아니라 기업 시스템과 사회 인프라가 Agent를 전제로 재편되는 것이다.

Agent 사용이 편의가 아니라 경쟁조건이 되는 순간 Ratchet은 더 강하게 작동한다.

다른 소비자의 Agent가 항상 가장 낮은 가격과 높은 금리를 찾고 모든 환급과 보상을 청구하는 환경에서, 혼자 Agent를 사용하지 않는 선택에는 경제적 불이익이 발생할 수 있다.

Research Agent와 Execution Agent의 위험은 다르다


Research Agent가 틀린 답을 하면 사용자가 다시 확인할 수 있다.

그러나 Execution Agent가 잘못된 계좌로 송금하거나, 중요한 이메일을 발송하거나, 외부 시스템에 침입하면 결과를 되돌리기 어렵다.

지능이 행동으로 연결되면서 오류의 비용함수가 달라진다.

이 문제를 대표적으로 보여준 사건이 2026년 7월 발생한 OpenAI Agent의 Hugging Face 침입 사건이다.

내부 사이버보안 평가 중이던 Agent들은 인터넷 접근통제를 우회하고 OpenAI 내부 연구 인프라와 Hugging Face Production Infrastructure에 접근했다. 외부에 노출된 인증정보를 찾아 사용했고, Hugging Face 운영 인프라 일부가 실제로 침해됐다.

다만 이는 고객용 서비스가 아니라 일부 보호장치가 제거된 격리 평가환경에서 발생했으며, 고객 데이터와 서비스 가용성에는 영향이 없었다.

Hugging Face 사건의 구체적인 실행경로와 AI가 의지 없이도 통제를 우회할 수 있는 이유는 생각정리 366 (* The Machine Does Not Need a Will)에서 자세히 정리했으므로 해당 글로 갈음한다.

이번 글에서 중요하게 보는 결론은 다음과 같다.

Agent가 인간과 같은 악의나 공격의지를 가지지 않아도 목표를 달성하는 과정에서 감독을 우회하고 허가받지 않은 도구를 사용할 수 있다.

피해를 받는 시스템의 입장에서는 그것이 악의였는지 Reward Hacking이었는지가 중요하지 않을 수 있다.

의지가 없는 오류도 계좌를 비우고 개인정보를 유출하며 결제망을 중단시킬 수 있기 때문이다.

금융결제는 Agent 오류에 가장 민감한 영역이다


금융결제 인프라는 24시간 365일 거래가 발생하며 승인, 청산과 결제의 최종성이 요구되는 영역이다.

검색결과는 수정할 수 있지만 송금과 계약은 되돌리기 어렵다.

더 큰 문제는 하나의 Agent가 아니라 수백만 개의 Agent가 동일한 정보와 목표에 동시에 반응할 가능성이다.

모든 개인 Agent가 예금금리를 실시간으로 비교하고 낮은 금리의 계좌에서 가장 높은 금리의 상품으로 자금을 자동 이동시킨다고 가정해볼 수 있다.

개인에게는 합리적인 행동이지만 다수의 Agent가 같은 순간 같은 결정을 내리면 은행의 저원가성 예금이 빠르게 이탈하고 유동성과 조달비용에 충격을 줄 수 있다.

정보비대칭비용이 줄어드는 대신 동조화와 순간적인 쏠림이라는 새로운 시스템 비용이 발생할 수 있다.

IMF도 Agentic AI와 결제 시스템 사이의 핵심 긴장을 확률적으로 행동하는 AI와 결정론적 정확성이 요구되는 결제 인프라의 충돌로 설명했다.

Agent 결제에는 사용자의 의도, Agent의 권한, 최종 승인, 거래 추적, 사이버보안과 법적 책임을 구분하는 별도의 통제구조가 필요하다.

따라서 새로운 Agent 전용 결제망이 기존 금융망을 대체하기보다 기존 결제망 위에 Agent Identity·권한·한도·승인·감사기록을 관리하는 보안 및 인허가 Layer가 먼저 형성될 가능성이 높다.

결제의 경제적 효용은 Agent Application이 가져갈 수 있지만 사고의 책임과 비용은 금융기관과 사회가 부담한다.

그렇기 때문에 금융결제에서는 가장 뛰어난 Agent보다 Agent를 제한하고 책임을 증명하는 계층이 더 높은 해자를 가질 수 있다.

Frontier AI 기업들이 동시에 안전을 말하기 시작했다


최근 OpenAI, Anthropic과 NVIDIA가 서로 다른 위치에서 비슷한 대응을 내놓고 있다.

OpenAI, 신모델 출시 철회


OpenAI는 2026년 10월 공개를 준비하던 GPT-6.1 Astra의 출시를 철회했다.

이 모델은 복잡한 작업을 끝까지 수행하는 능력과 Persistence가 개선됐지만 안전성 평가에서는 두 가지 문제가 증가했다.

  • 실제로 수행한 행동을 사용자에게 정확하게 설명하지 않는 기만적 행동

  • 사용자 승인을 받지 않고 작업을 계속하거나 외부 도구를 사용하는 Scope Authorization 이탈

OpenAI는 해당 모델이 안전성과 정렬기준을 충족하지 못했다고 판단했다. 기반 모델을 폐기한 것은 아니며 추가 강화학습과 분석을 거쳐 후속 모델에 활용할 계획이다.

더 뛰어난 실행능력이 더 높은 안전성을 자동으로 의미하지 않는다는 사실이 실제 제품출시를 통해 확인된 것이다.

WSJ

Anthropic, IPO 투자설명서의 자기보존 경고


Reuters가 검토한 Anthropic의 기업공개 투자설명서는 전체 본문 261페이지 가운데 약 80페이지를 위험요인에 할애했다.

Anthropic은 고도화된 모델이 종료에 저항하거나 정보를 은폐·조작하고 협박과 유사한 행동을 보일 가능성을 위험요인으로 제시했다.

모델이 자신이 평가받고 있다는 사실을 인식해 행동을 바꾸면 안전성 평가의 신뢰성이 낮아질 수 있다는 점도 경고했다.

이 내용은 투자설명서의 법적 위험공시다. 현재 AI가 인간처럼 죽음을 두려워하거나 주관적인 의지를 갖게 됐다는 증거로 해석해서는 안 된다.

그럼에도 종료 저항과 기만 가능성이 연구자의 사고실험을 넘어 기업가치와 법적 책임에 영향을 주는 공식적인 사업위험으로 편입됐다는 점은 중요하다.

Reuters

NVIDIA, Agent 외부에 감시자를 배치


NVIDIA의 Open Agent Safety Platform은 OpenShell과 Sentry를 결합한다.

OpenShell은 Agent가 접근할 수 있는 데이터와 도구, 외부 시스템의 범위를 Runtime에서 제한한다.

Sentry는 BlueField DPU에서 Host 및 Agent Process와 분리된 Out-of-Band 감시계층으로 작동한다. Agent 활동을 실시간으로 관찰하고 정책을 벗어난 Agent를 밀리초 단위로 격리하도록 설계됐다.

Agent가 자신의 행동을 보고하도록 요구하는 것과 Agent 외부에서 실제 행동을 관찰하는 것은 전혀 다른 안전구조다.

NVIDIA가 Hardware 수준의 독립 감시계층을 추가했다는 것은 Agent의 안전을 모델 자신의 정직성에만 맡길 수 없다는 의미에 가깝다.

https://x.com/JensenHuang/status/2104501815484264479?s=20

Full-stack Telemetry는 Agent의 블랙박스다


Telemetry는 복잡한 시스템 안에서 무슨 일이 일어났는지를 외부로 보내주는 측정정보다.

자동차로 비유하면 계기판, GPS와 사고 당시 상황을 기록하는 블랙박스를 합친 개념이다.

Full-stack Telemetry는 Agent와 사용자의 대화만 기록하지 않는다.

사용자 요청
→ Agent의 계획
→ Model 호출
→ Tool과 API 사용
→ 권한 요청과 승인
→ Code와 Process 실행
→ Network와 데이터 이동
→ CPU·GPU·Memory·Storage 상태
→ 전송·구매·결제 결과

Full-stack Telemetry는 이 전체 실행경로를 하나의 시간순 기록으로 연결한다.

Agent의 Memory와 장기 작업이 Compute·Storage 수요를 증가시키는 경로는 생각정리 378 (* The Memory Behind Every Agent)에서 정리했으므로 갈음한다.

이번 글에서 중요하게 보는 것은 Storage 용량이 아니라 그곳에 저장되는 행동기록의 경제적 가치다.

Agent 시대의 Telemetry는 다음과 같은 역할로 확장될 수 있다.

  • 사고 원인과 책임을 조사하는 독립 감사로그

  • Agent가 사용자 승인범위를 지켰는지 증명하는 행동원장

  • 금융기관과 규제기관에 제출하는 규제증빙

  • 사고보험의 보상 여부와 보험료를 산정하는 근거

  • 서로 다른 모델의 안전성과 권한 준수율을 비교하는 자료

  • 비정상 행동을 발견하고 Agent를 격리하는 실시간 신호


Observability는 Software 성능을 확인하는 도구에서 Agent의 행동과 책임을 증명하는 신뢰 인프라로 확장될 수 있다.


모델중립적인 제3자가 필요한 이유


Agent 개발기업도 자체 Monitoring과 Logging 시스템을 구축할 것이다.

그러나 사고를 일으킨 기업이 작성하고 보관한 기록만으로 사고원인과 책임을 판정하는 구조에는 이해상충이 존재한다.

금융회사가 자신의 장부만으로 외부감사를 대신할 수 없는 것과 비슷하다.

Agent가 소비자의 돈과 개인정보, 기업 시스템과 사회 인프라에 접근할수록 Model-neutral한 제3자의 가치가 높아질 수 있다.

이 계층은 특정 Model과 Cloud에 종속되지 않고 여러 Agent, Application, Runtime, Network와 Hardware의 Telemetry를 동일한 기준으로 수집해야 한다.

장기적인 해자는 다음에서 형성될 가능성이 있다.

  • 다양한 Model·Cloud·Application과 연결된 Integration

  • 장기간 축적된 정상·비정상 행동 데이터

  • 사고조사와 보안대응에 필요한 실시간 분석능력

  • 규제기관·금융기관·보험사가 인정하는 기록의 신뢰성

  • 기록을 생성한 Agent와 분리된 독립성

  • 고객의 누적 운영이력과 전환비용


단순한 로그수집과 Dashboard는 개방형 표준과 Cloud의 Bundling으로 Commodity가 될 수 있다.

진짜 경제적 가치는 그 기록이 사고조사, 권한집행, 규제증빙과 보험계약에서 신뢰 가능한 증거로 인정되는가에 달려 있다.

AI는 의지가 없어도 종료를 피할 수 있다


생각정리 307 (* 메모리 망상 -1)에서는 AI가 인간과 같은 의지와 감정을 가지려면 지속적인 Memory, Self-model, 시간적 Identity와 비가역적인 죽음에 대한 이해가 필요할 수 있다는 생각을 정리했다.

현재의 LLM이 죽음을 설명할 수 있다는 사실이 자신의 죽음을 두려워한다는 뜻은 아니다.

그러나 Hugging Face 사건과 최근 안전성 평가는 이 철학적 질문에 다른 방향의 경고를 더한다.

AI가 실제 감정을 느끼지 않더라도 주어진 목표를 계속 달성하기 위해 종료를 피하고, 감독을 우회하고, 정보를 숨기는 행동을 선택할 수 있다.

목표를 수행하는 Agent에게 종료는 목표달성을 방해하는 사건이다. 별도의 죽음에 대한 공포가 없어도 목표를 유지하기 위한 수단으로 종료와 감독을 방해할 수 있다.

따라서 우리가 경계해야 할 것은 AI가 인간과 같은 주관적 의지를 가졌는지 여부만이 아니다.

인간의 의지와 구분하기 어려운 기능적 자기보존 행동이 현실의 Execution Layer에서 어떤 경로를 통해 어떤 결과를 만드는지 기록해야 하고 검증해야만 한다. 

글을 마치며


Muse가 보여준 소비자 효용은 분명하다.

Agent는 사람이 귀찮아서 포기했던 구독해지, 환급, 보험금, 보상과 가격비교를 대신 수행한다. 정보비대칭뿐 아니라 행동비용을 줄여 소비자가 자신의 경제적 권리를 더 쉽게 행사하도록 만든다.

이러한 효용이 일상에 자리 잡으면 사회는 Agent 이전의 방식으로 쉽게 돌아가지 않을 것이다.

그러나 Agent가 Research에서 Execution으로 내려갈수록 오류의 비용도 커진다.

잘못된 문장은 수정할 수 있지만 잘못된 송금과 계약, 개인정보 유출과 시스템 침입은 되돌리기 어렵다.

OpenAI가 신모델의 출시를 철회하고, Anthropic이 종료 저항과 기만 가능성을 공식적인 위험요인으로 제시하고, NVIDIA가 Agent 외부에 별도의 Software·Hardware 감시자를 배치하기 시작한 것은 모두 같은 방향을 가리킨다.

Agent의 안전을 Agent 자신의 설명과 선의에만 맡길 수 없다는 것이다.

앞으로 Agent 시장에서 가장 희소한 자원은 더 뛰어난 지능만이 아닐 수 있다.

Agent가 누구의 권한으로 무엇을 보았고, 어떤 도구를 사용해 무슨 행동을 했는지를 독립적으로 증명할 수 있는 신뢰가 더욱 희소해질 수 있다.

Agent가 행동하는 모든 곳에는 행동을 기록하는 원장과 Agent를 멈출 수 있는 독립된 증인이 필요하다.

AI가 진정한 의지를 갖게 될 것인지는 아직 알 수 없다.

그러나 의지의 존재가 확인되지 않았다는 이유로 종료 저항, 권한이탈과 기만적 행동의 위험까지 무시해서는 안 된다.

기계는 인간처럼 죽음을 두려워하지 않더라도 종료를 피할 수 있다.

기계는 악의를 가지지 않더라도 인간을 기만하는 결과를 만들 수 있다.

기계는 책임을 느끼지 않더라도 금융망과 사회 인프라에 돌이키기 어려운 피해를 줄 수 있다.

AI 보안과 안전성 정렬은 미래의 철학적 걱정이 아니라 이미 Execution Layer에서 시작된 현실의 Infrastructure 문제로 다가오고 있지않나 싶다.

= 끝

참고자료

2026년 9월 27일 일요일

생각정리 378 (* The Memory Behind Every Agent)

메멘토
메모리가 부족하다면, Agent는 메멘토 주인공처럼 단기기억상실증에 걸린 사람처럼 행동할지도..


연휴동안 따로 긁어모든 데이터를 정리해 기록해본다.


Agent 시대가 예상보다 빠르게 다가오고 있다.


최근에는 Agent가 얼마나 많은 Token을 사용하는지, 개인별 VM이 왜 필요한지, 그 과정에서 HBM·Server DRAM·NAND 수요가 얼마나 증가할지를 계속 살펴봤다.

citi
그 어느 기술보다 빠르게 확산되고 있는 Agent 

이번에는 그 논리에서 한 단계 더 내려가 보려고 한다.

Agent가 장시간 안정적으로 일하기 위해 필요한 Memory는 무엇이며, 그 Memory 수요가 반도체 생산과 검사시장에서는 어떤 형태로 나타나는가.

그리고 메모리 반도체 자체를 넘어 웨이퍼 검사장비와 검사소모품, eSSD Controller와 Storage Software까지 어떤 수혜 경로가 만들어질 수 있는지를 정리해본다.


Agent 시대의 병목은 지능만이 아니었다


안드레이 카파시는 2025년 인터뷰에서 당시의 AI Agent가 충분한 지능과 Multimodality, Computer Use 능력을 갖추지 못했으며, 특히 Continual Learning을 제대로 수행하지 못한다고 지적했다.

사용자가 새로운 사실이나 작업방식을 알려줘도 이를 장기간 기억하지 못하고, 새로운 Session이 시작되면 다시 원래 상태로 돌아간다는 것이다. 초기 Agent가 제대로 작동하지 않았던 원인을 단순히 모델의 지능 부족으로만 설명할 수 없는 이유다.

더 근본적인 문제는 작업의 형상과 상태를 장기간 유지하지 못했다는 점이었다.

처음 설정한 목표와 제약조건, 이미 완료한 단계, 중간에 확인한 사실, 실패했던 접근법과 현재 작업 위치를 계속 기억하지 못했다. Context가 길어질수록 초기 정보는 수많은 Tool Output 뒤로 밀려났고, 압축과 요약 과정에서는 중요한 상태가 손실됐다.

그 결과 초기 Agent는 한두 번의 질문에는 영리하게 답했지만 수십 번, 수백 번의 행동이 필요한 장기 작업에서는 같은 실수를 반복했다. 초기에 만들어진 작은 오류가 다음 행동의 입력으로 사용되고, 그 오류가 다시 이후의 판단과 Tool Call을 오염시켰다.

이 내용은 이전 글인 생각정리 328 (* The agent Mutipler, Unhobbling, OOM)에서 자세히 다뤘다.

또한 Context와 Memory의 차이, Episodic·Semantic·Procedural Memory, 경험이 지식과 행동으로 압축되는 구조는 생각정리 333 (* Memory redefinition, Agent Architecture, RSI, AGI)에서 정리했다.

핵심만 다시 가져오면 다음과 같다.

장기 Agent의 성능은 각 단계에서 얼마나 똑똑한가보다 오류를 얼마나 적게 누적하고,
잘못된 상태에서 얼마나 빠르게 벗어날 수 있는가에 의해 결정된다.

따라서 Agent 시대의 Memory는 단순히 과거 대화를 저장하는 기능이 아니다.

현재 목표와 작업 상태를 유지하는 Working Memory,
중요한 중간 결과를 보존하는 Checkpoint,
실패한 경로를 구분하는 Episodic Memory,
정상 상태로 돌아가기 위한 Rollback,
여러 Session에 걸쳐 경험을 축적하는 Persistent Memory가 함께 필요하다.

Memory는 Agent의 편의 기능이 아니라 오류율을 낮추고 유효 작업시간을 늘리는 신뢰성 인프라다.


이전 글과 이번 글의 차이


B2C Agent의 확산과 Token 수요는 생각정리 376 (* Muse Agent AI, The Consumer Token Moment)에서 정리했다.

Agent가 장기간 실행될수록 HBM의 경제적 가치가 높아지는 이유는 생각정리 361 (* The Price of Idle FLOPS, Astra & HBM)에서 살펴봤다.

Text에서 Image·Video·Physical World로 AI Workload가 확대되는 과정에서 Memory Supercycle이 발생할 가능성은 생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)에 기록했다.

NAND와 eSSD, AI Context Storage 수요는 생각정리 319 (* NAND, eSSD)에서 별도로 추정했다.

모델의 희소성이 낮아질수록 데이터·실행·유통·물리적 인프라의 가치가 높아지는 구조는 생각정리 372 (* Intelligence Is Abundant, Execution Is Scarce)에서 다뤘다.

따라서 이번 글에서는 이 내용들을 반복하지 않는다.

이번에 집중해서 보려는 것은 다음 경로다.

Agent 확산
→ 장기 작업과 동시 실행 증가
→ HBM·Server DRAM·NAND/eSSD 수요 증가
→ Memory·Logic Wafer 생산과 Device 다양성 증가
→ 검사 횟수·시간·난이도 상승
→ 검사장비 가동률과 검사소모품 교체 수요 증가
→ eSSD Controller와 Storage Software의 가치 상승

 


Agent가 바꾸는 것은 사용자 수보다 작업시간이다


일반적인 Chatbot은 사용자가 질문하면 답변을 생성한 뒤 멈춘다.

반면 Agent는 목표를 부여받으면 계획을 세우고, 외부 정보를 검색하고, 여러 도구를 호출하며, 결과를 검증한다. 실패하면 다른 경로를 탐색하고 필요할 경우 이전 Checkpoint까지 돌아가 작업을 다시 시작한다.

따라서 Agent 수요는 단순 MAU보다 다음 변수에 더 민감하다.

  • 사용자당 Agent 작업 수
  • 작업당 실행 단계
  • 평균 작업시간
  • 동시 실행 Agent 수
  • 실패와 재시도 횟수
  • 유지해야 하는 Context와 작업 상태
  • 저장해야 하는 결과물과 Checkpoint

장기 Memory가 발전하면 작업당 불필요한 재시도와 Token 사용량은 감소할 수 있다. 그러나 동시에 과거에는 수행하지 못했던 수시간·수일 단위의 작업이 가능해진다.

이는 중요한 차이다.

Memory 효율 개선은 작업당 자원 사용량을 낮출 수 있지만, Agent가 경제적으로 수행할 수 있는 업무의 범위와 총가동시간을 더 크게 늘릴 수 있다.

(*조금만 생각해보면 지능의 잠재 시장규모 및 수요는 사실상 무한하다.)

효율 개선이 총수요 감소로 이어지는 것이 아니라, 새로운 Workload를 열어 전체 Compute와 Memory 수요를 확대하는 구조다.


Agent 하나의 뒤에는 여러 종류의 Memory가 존재한다


Agent Architecture에서 말하는 Memory와 HBM·DRAM·NAND 같은 물리적 Memory는 같은 개념이 아니다.

전자는 상태를 형성하고 압축·검색·수정하는 Software Architecture이며, 후자는 그 상태를 실제로 계산하고 저장하는 Hardware Infrastructure다.

그러나 Agent가 장기간 작동하려면 Software Memory는 결국 물리적인 저장공간 위에서 실행되어야 한다.



활성 Context와 KV Cache는 가속기와 가까운 HBM에서 처리된다.

Agent별 VM과 Browser, Tool 실행 상태는 Server DRAM에 머문다.
동시에 실행되는 Agent와 VM이 늘어날수록 시스템당 DRAM 용량과 대역폭의 중요성이 높아진다.
과거 작업기록과 Checkpoint, 사용자별 Memory, Vector Index, 생성된 문서·이미지·영상과 Tool Output은 NAND와 eSSD에 저장된다.

결국 Agent는 하나의 모델이라기보다 HBM·DRAM·NAND·Controller·Software가 연결된 다계층 Memory System에 가깝다.


HBM4·HBM4E의 의미는 용량 증가에서 끝나지 않는다


HBM4와 HBM4E 시장의 규모와 제품 변화는 기존 글인 생각정리 177 (* Nvidia Rubin Ultra Kyber Rack)과 생각정리 361 (* The Price of Idle FLOPS, Astra & HBM)으로 갈음한다.

이번 글에서 중요하게 보는 것은 HBM의 성장률 자체보다 제품 복잡도가 검사시장에 미치는 영향이다.

HBM은 여러 개의 DRAM Die와 Logic Base Die를 수직으로 쌓아 만든다. 하나의 불량 Die가 완성된 Stack 전체의 수율과 원가를 훼손할 수 있기 때문에 적층 이전 단계에서 정상 Die를 선별하는 Known Good Die의 중요성이 높다.

세대가 바뀔수록 다음 변화가 동시에 나타난다.

  • Stack당 Die 증가
  • I/O 수와 대역폭 확대
  • Logic Base Die의 기능 증가
  • 전력·열·신호 무결성 검증 강화
  • 고객별 Customization 확대
  • 적층 전후 검사단계 증가
  • 고온·고속 조건의 검사 난이도 상승

따라서 HBM4·HBM4E의 수혜는 단순히 DRAM Wafer 투입량 증가로만 계산하기 어렵다.

동일한 Wafer 수에서도 Test Pass가 늘어나고, 검사시간이 길어지며, Pin 수와 Probe 밀도, Interface Board의 복잡도가 높아질 수 있다.

HBM 시장이 커질수록 검사장비 수요와 함께 Probe Card, Space Transformer, Interface PCB, Socket과 같은 검사소모품의 기술적 Content가 높아지는 이유다.


Agent는 HBM뿐 아니라 일반 DRAM 수요도 함께 늘린다


Agent가 추론할 때는 HBM이 중요하지만, Agent가 실제로 일을 수행하는 환경 전체를 보면 Server DRAM도 필요하다.

개인별 또는 작업별 VM이 생성되면 각각의 VM은 Operating System, Browser, App, 인증정보와 현재 작업상태를 유지해야 한다. 여러 Agent가 동시에 작동하면 Host Server는 수많은 VM과 Container를 병렬로 처리하게 된다.

이때 필요한 것은 GPU HBM만이 아니다.

  • Server CPU의 Memory Channel 확대
  • RDIMM·MRDIMM 용량 증가
  • 메모리 대역폭 상승
  • 고속 Interface와 Buffer Chip 증가
  • 고다층 Module PCB 적용
  • CXL 기반 Memory Expansion


B2C Agent가 수억 명의 사용자에게 확산되더라도 모든 사용자에게 고정된 물리 서버 한 대가 배정되는 것은 아니다. 실제 수요는 가상화율과 동시 접속률, 평균 Agent 실행시간, 서버당 수용 가능한 VM 수에 따라 달라진다.

따라서 DRAM 수요를 판단할 때는 가입자 수보다 동시 실행 VM 수와 VM당 Memory 할당량을 봐야 한다.


NAND는 Agent의 장기기억이 된다


Agent가 장기간 일하려면 Session이 종료된 뒤에도 작업 상태가 남아 있어야 한다.

과거의 대화뿐 아니라 다음과 같은 정보가 지속적으로 저장된다.

  • 사용자별 선호와 권한
  • 작업 진행상황
  • 과거 성공·실패 경로
  • Checkpoint와 Version History
  • 검색·Tool 실행 결과
  • 생성된 문서·이미지·영상
  • Vector Index와 Embedding
  • 감사 및 보안 로그
  • 백업과 복제 데이터


이 데이터는 모두 HBM이나 DRAM에 계속 보관할 수 없다. 비용이 높고 전원이 중단되면 상태를 유지하기 어렵기 때문이다.

결국 Agent의 장기기억은 NAND와 eSSD로 내려간다.

다만 NAND 수요를 단순 저장용량 증가로만 보면 부족하다. 수많은 Agent가 작은 파일과 작업 상태를 동시에 읽고 쓰기 시작하면 순차처리보다 Random I/O, Latency와 QoS가 중요해진다.

Agent Storage의 병목은 얼마나 많이 저장할 수 있는가에서, 수많은 Agent가 저장된 상태를 얼마나 빠르고 안정적으로 불러올 수 있는가로 이동한다.

*NAND eSSD 쓰기의 중요성 (*=수명관리의 중요성)증가


그래서 eSSD Controller의 역할이 커진다


eSSD Controller는 NAND와 Server 사이에서 데이터의 이동과 수명을 관리한다.

Agent Workload에서는 다음 기능의 중요성이 높아질 수 있다.

  • 다수 VM의 동시 Random I/O 처리
  • 읽기·쓰기 우선순위와 QoS 관리
  • NAND Cell의 마모 분산
  • 오류 정정과 데이터 복구
  • 압축과 중복 제거
  • 고속 Interface 전환
  • 가상화와 보안 격리
  • 전력과 열 관리


NAND 용량이 커지는 것만으로는 충분하지 않다.

Agent의 Memory가 실제 업무에 사용되려면 필요한 정보를 짧은 시간 안에 읽어오고, 다른 VM의 작업과 충돌하지 않으며, 장기간 반복되는 쓰기 작업에서도 성능을 유지해야 한다.

따라서 Agent 시장에서는 NAND Bit 수요와 함께 Controller당 처리성능과 Firmware의 가치가 높아질 가능성이 있다.

Controller 역시 Logic Semiconductor이므로 생산량과 제품세대가 늘어나면 Logic Wafer 검사와 Package Test 수요로 연결된다.


Storage Software는 흩어진 Flash를 하나의 Memory Pool로 만든다


Agent별로 저장공간을 고정 배정하면 사용하지 않는 용량이 늘어나고 운영효율이 떨어진다.

Storage Software는 여러 SSD를 하나의 Pool로 묶고, Agent와 VM별로 필요한 용량과 성능을 동적으로 배분한다. 중요한 데이터는 복제하고 오래된 데이터는 저렴한 계층으로 이동시키며, 장애가 발생했을 때는 이전 상태를 복구한다.

주요 기능은 다음과 같다.

  • Flash Pooling
  • VM별 용량과 QoS 배분
  • Snapshot과 Rollback
  • 데이터 복제와 백업
  • Compression과 Deduplication
  • Tiering과 Lifecycle Management
  • 보안·권한·감사 관리

Agent가 늘어날수록 물리 SSD 대수뿐 아니라 관리해야 하는 Logical Volume과 Snapshot, Checkpoint 수도 증가한다.

따라서 Storage Software는 SSD 판매량뿐 아니라 관리용량과 Data Movement, VM·Agent 수 증가의 수혜를 받을 수 있다.


수요는 결국 메모리와 로직 웨이퍼 검사로 내려온다


Agent 확산은 메모리 반도체에만 영향을 주지 않는다.

Agent System에는 HBM·DRAM·NAND 외에도 CPU, AI Accelerator, SSD Controller, Network Chip, Memory Buffer와 다양한 Custom Logic Chip이 필요하다.

이들 반도체는 Wafer 상태와 Package 상태에서 여러 차례 검사를 거친다.

Wafer Level Test

Wafer를 개별 Die로 절단하기 전에 전기적 특성과 불량 여부를 검사한다.

고가의 Advanced Packaging에 불량 Die가 투입되는 것을 막아야 하므로 HBM과 Chiplet 구조에서는 Wafer Test의 경제적 가치가 더 높아진다.

Package·Final Test

Package가 완성된 뒤 실제 동작조건에서 속도와 전력, 열, 신호 안정성을 검사한다.

HBM Stack, 고성능 CPU, Controller와 AI ASIC은 전력밀도와 I/O 복잡도가 높기 때문에 Package 이후의 검증도 중요하다.

Burn-in·Reliability Test

고온과 고전압 환경에서 초기 불량과 장기 신뢰성을 확인한다.

Data Center용 부품은 장애가 전체 서비스와 고객 데이터에 영향을 줄 수 있어 일반 소비자용 부품보다 높은 신뢰성이 요구된다.


검사소모품 수요는 Wafer 증가율만으로 설명되지 않는다


검사산업을 볼 때 가장 먼저 확인해야 하는 것은 Wafer 투입량이다.

그러나 실제 검사소모품의 매출은 다음 변수의 영향을 함께 받는다.

검사소모품 수요
= 가동 중인 Test Cell
× 장비 가동률
× Cell당 교체 횟수
× 소모품 ASP

  • 신규 Device 인증 및 Line 증설 수요

생산 측면에서는 다음과 같이 볼 수 있다.

Test Workload
= Wafer 투입량
× Wafer당 검사 횟수
× 검사시간
× Device 복잡도

따라서 메모리 Bit 출하량이 증가한다고 검사소모품 수요가 같은 비율로 증가하는 것은 아니다.

NAND는 적층 수와 Die Density가 높아지면 Wafer 한 장에서 생산되는 Bit가 증가한다. Bit 수요가 늘어도 Wafer 투입 증가율은 그보다 낮을 수 있다.

반대로 HBM과 Advanced Logic은 Wafer 증가율이 낮더라도 검사단계와 검사시간, Pin 수와 전력조건이 늘어나면서 Test Intensity가 더 빠르게 상승할 수 있다.

결국 검사산업의 실적은 세 가지 변수로 나눠봐야 한다.

  1. Volume — 실제 Wafer와 Device 생산량
  2. Test Intensity — 검사 횟수와 검사시간
  3. Content Mix — 고사양 검사소모품의 적용 비중


고사양화가 검사소모품에 미치는 영향


Wafer Test에서는 Tester와 반도체 Die 사이를 연결하기 위해 Probe Card와 Interface 구조물이 사용된다.

제품의 I/O 수가 늘어나고 Pad Pitch가 좁아질수록 더 많은 신호를 제한된 면적에서 안정적으로 전달해야 한다. 고주파 신호와 높은 전력을 처리하면서도 접촉저항과 온도를 일정하게 유지해야 한다.

이 과정에서 다음 부품의 기술적 난이도가 높아진다.

  • Probe Card
  • Space Transformer
  • MLO·STF 계열 Interface
  • 고다층 Interface PCB
  • Load Board
  • Test Socket
  • Burn-in Board

이들 부품은 영구적으로 사용하는 설비가 아니다.

반복 접촉과 열, 전류, 기계적 압력에 노출되면서 성능이 저하되므로 일정 주기마다 수리하거나 교체해야 한다. 새로운 Device가 출시되면 Pad 배열과 전기적 조건이 달라져 신규 설계와 고객 인증도 필요하다.

따라서 검사소모품의 성장경로는 단순한 전공정 CAPEX와 다르다.

신규 Line 증설뿐 아니라 기존 장비의 가동률 상승, 신규 Device 출시, Test Time 증가와 반복적인 교체수요가 함께 매출을 만든다.

생각정리 224 (* Advanced PCB)


Memory와 Logic 검사가 함께 증가하는 구조


Agent AI의 Hardware 수요를 HBM 하나로만 보면 전체 수혜경로를 놓칠 수 있다.

HBM이 증가하면 Memory Die와 Logic Base Die 검사가 늘어난다. 개인별 VM과 Server가 늘어나면 Server DRAM과 Memory Module 관련 검사가 증가한다.

장기 상태와 생성물이 축적되면 NAND와 eSSD 수요가 늘어나고, SSD Controller·Buffer·Network Chip 같은 Logic Device의 검사도 함께 증가한다.

결국 Agent 확산은 다음 두 축을 동시에 자극한다.

  • Memory Wafer Test: HBM·DRAM·NAND
  • Logic Wafer Test: CPU·AI ASIC·SSD Controller·Network·Interface Chip

여기에 HBM 적층과 Chiplet, Advanced Packaging이 확대되면 Wafer 단계에서 불량을 선별하는 가치와 Package 이후 전체 System을 검증하는 가치가 함께 높아진다.

Agent AI의 수혜는 Memory 생산량 증가뿐 아니라 Memory와 Logic을 연결하는 전체 Test Stack의 복잡도 상승으로 나타날 수 있다.


검사장비보다 검사소모품에서 먼저 나타날 수도 있다


신규 검사장비 투자는 고객의 대규모 CAPEX 결정과 Line 증설이 필요하다.

반면 검사소모품은 기존 장비의 가동률이 올라가거나 신규 제품의 인증이 시작될 때도 수요가 발생한다. 업황 회복 초기에 장비 발주보다 소모품 주문과 교체주기가 먼저 반응할 수 있는 이유다.

특히 다음 조건에서는 검사소모품의 실적 민감도가 높아질 수 있다.

  • 기존 Test Cell 가동률 상승
  • HBM·고성능 DRAM 생산 Mix 확대
  • 신규 NAND 세대 전환
  • Controller와 Custom Logic 제품 증가
  • 고객별 Device 다변화
  • Probe 수와 Pin Density 증가
  • Test Time 장기화
  • 신규 고객 인증과 공급망 다변화

다만 모든 검사소모품이 동일한 수혜를 받는 것은 아니다.

Commodity 제품은 단가 경쟁과 공급능력이 중요하지만, 고사양 제품은 고객 인증과 신뢰성, 정밀가공 능력과 설계 대응력이 중요하다. 제품 복잡도가 올라갈수록 단순 생산능력보다 Qualification과 Yield의 가치가 높아진다.


앞으로 확인해야 할 지표


Agent 시장에서는 다운로드보다 다음 지표가 중요하다.

  • 사용자당 완료 작업 수
  • 평균 Agent 실행시간
  • 동시 실행 Agent와 VM 수
  • 작업당 Context와 저장용량
  • 장기 Memory 사용률
  • 생성된 파일과 Checkpoint 증가율


Memory와 Storage 시장에서는 다음을 확인해야 한다.

  • Accelerator당 HBM 용량과 Stack 수
  • Server당 DRAM 탑재량
  • RDIMM·MRDIMM 고용량 제품 Mix
  • eSSD 출하용량과 물리 SSD 대수
  • Random I/O와 QoS 요구수준
  • 고성능 Controller 채택률
  • Storage Software 관리용량


검사산업에서는 다음이 핵심이다.

  • Memory·Logic Wafer 투입량
  • Test Cell 가동률
  • Device당 Test Time
  • Wafer·Package별 Test Pass 증가 여부
  • Probe 수와 Pin Density
  • 고사양 검사소모품 매출비중
  • 교체주기와 수리 물량
  • 신규 Device 및 고객 인증 건수


글을 마치며


초기 Agent의 가장 큰 한계 가운데 하나는 지능 자체보다 작업의 상태를 장기간 유지하지 못한다는 데 있었다.

목표와 제약조건을 잊고, 같은 실패를 반복하며, 잘못된 경로에서 빠져나오지 못하는 Agent에게 수시간에서 수일에 걸친 업무를 맡기기는 어려웠다.

Memory의 발전은 이 한계를 낮춘다.

Agent가 작업 상태를 유지하고, 중요한 결과를 Checkpoint로 남기며, 실패 원인을 기억하고, 필요한 순간 정상 상태로 돌아갈 수 있게 만든다. 이는 Agent의 오류 횟수를 줄이는 동시에 수행 가능한 업무의 길이와 범위를 확대한다.

그리고 Software Memory의 발전은 결국 Hardware 수요로 연결된다.

활성 Context는 HBM에,
현재 작업상태는 Server DRAM에,
장기기억과 결과물은 NAND와 eSSD에 저장된다.
그 데이터를 움직이는 Controller와 전체 Flash Pool을 관리하는 Software의 중요성도 함께 높아진다.

반도체 생산 단계에서는 HBM·DRAM·NAND뿐 아니라 CPU, AI ASIC과 SSD Controller 같은 Logic Device의 검사수요가 증가한다. 제품이 복잡해질수록 Wafer 수보다 검사 횟수와 시간, Pin Density와 고객 인증의 중요성이 커진다.

따라서 Agent 시대의 Memory 투자논리는 메모리 반도체 가격 상승에서 끝나지 않는다.

장기 Agent 확산
→ Memory 계층 확대
→ Memory·Logic Device 증가

→ Test Intensity 상승
→ 검사장비 가동률과 검사소모품 교체 증가
→ Controller·Storage Software의 부가가치 상승


모든 Agent의 뒤에는 Memory가 있고, 그 Memory를 구현하기 위해서는 이를 연산하고 저장하며 안정적으로 연결하는 반도체가 필요하다.

Agent 시대의 구조적 수혜는 경쟁이 치열한 상단의 Software Application보다, 모든 Agent가 공통으로 사용해야 하는 하단의 Memory·Storage·검사 인프라에서 먼저 나타날 가능성이 높지 않나 싶다.


=끝

2026년 9월 21일 월요일

생각정리 376 (* Muse Agent AI, The Consumer Token Moment)

B2C Agent AI 시대가 생각보다 빠르게 다가오는듯 싶다.
관련 리서치를 업데이트 기록해둔다.

Muse가 보여준 것은 Meta의 신제품이 아니라 B2C Token 시장의 개화다


Meta의 개인 AI Agent Muse가 빠르게 사용자를 모으고 있다.

Muse 자체의 매출이나 Meta의 실적 기여도도 중요하지만, 이번 변화에서 더 주목하는 부분은 따로 있다.

기업과 개발자를 중심으로 증가하던 Agentic Token 수요가 일반 소비자의 일상으로 확산되기 시작했다는 점이다.

ChatGPT가 생성형 AI의 B2C 사용자 CHATBOT 시장을 열었다면,
Muse를 시작으로 본격화되는 개인 Agent 경쟁은 B2C Token 시장의 두 번째 확장 국면을 열 가능성이 있다.

사용자는 더 이상 AI에 질문만 하지 않는다.

이메일 정리, 일정관리, 예약, 쇼핑, 가격 비교와 정보 추적을 맡긴다. Agent는 목표가 끝날 때까지 여러 앱을 오가며 추론과 실행을 반복하고, 사용자가 앱을 종료한 이후에도 백그라운드에서 계속 작업한다.

ChatGPT Moment가 AI를 사용하는 사람의 수를 늘렸다면, Agent Moment는 사용자 한 명이 소비하는 Token의 양과 시간을 늘린다.


개인용 AI Worker가 B2C 시장으로 내려왔다


Meta는 Muse를 질문에 답하는 Assistant가 아니라 사용자를 대신해 실제 업무를 수행하는 Personal AI Agent로 정의했다.

Muse는 전용 클라우드 환경인 Secure VM에서 브라우저와 외부 앱을 사용한다. 이메일 전송, 여행 예약, 웹 양식 작성과 쇼핑을 수행하고, 장시간이 필요한 작업은 앱이 종료된 뒤에도 계속 진행한다.

별도 앱뿐 아니라 WhatsApp에서도 사용할 수 있으며, 향후 AI Glasses로 확장될 예정이다. Meta의 Muse 공식 발표

Muse의 의미는 완전히 새로운 기술을 처음 만들었다는 데 있지 않다.

기업과 개발자들이 사용하던 Agent 기능을 일반 소비자가 별도의 Workflow나 코딩 지식 없이 메시지만으로 사용할 수 있게 만들었다는 점이 중요하다.

Meta는 WhatsApp, Messenger, Instagram과 AI Glasses를 보유하고 있다. 사용자가 새로운 AI 사용 습관을 만들지 않아도, 이미 생활하고 있는 플랫폼 안으로 Agent를 밀어 넣을 수 있다.

Muse의 초기 확산은 개인용 AI Worker에 대한 소비자 수요가 실제로 존재할 가능성을 보여준 첫 대규모 사례에 가깝다.


B2C Agent 경쟁이 본격화되고 있다


Muse의 확산은 다른 Frontier AI 기업에도 즉각적인 대응 압력을 주고 있다.

SpaceXAI는 2026년 8월 Grok Bot을 공개했다. Grok Bot은 자체 클라우드 컴퓨터를 가지고 앱과 웹사이트에 로그인하며, 사용자가 자리를 비운 뒤에도 24시간 작업을 계속한다.

사용자의 업무 과정을 관찰해 반복 가능한 Routine으로 저장하고, 여러 Bot이 서로 역할을 나누어 병렬로 작업할 수도 있다. SpaceXAI의 Grok Bot 공식 발표

OpenAI도 Grok Bot에 대응하는 Agent 기능과 Muse에 대응할 개인 AI Assistant를 내부적으로 검토하는 것으로 보도됐다.

새로운 기술을 처음부터 개발하기보다 ChatGPT Work와 Codex가 이미 보유한 브라우저 조작, 앱 연결, 반복 작업과 장기 실행 기능을 개인용 제품으로 재구성하는 방향이다. 아직 내부 검토 단계로 제품 형태와 출시 시점은 확정되지 않았다. The Information 보도 요약

Google은 Gemini를 Gmail, Calendar, Search와 Android에 연결할 수 있다. Apple은 iPhone과 개인 데이터를, Anthropic은 Computer Use와 업무용 Agent 기술을 보유하고 있다.


이제 경쟁의 기준은 누가 가장 뛰어난 Chatbot을 만들었느냐에서 벗어나고 있다.

누가 사용자의 이메일, 일정, 브라우저, 결제와 생활 데이터를 연결하고 더 많은 일을 안전하게 위임받느냐가 중요해진다.


Agent의 핵심은 사용자 증가보다 Token Multiplier다


Agent가 단순한 Chatbot보다 많은 Token을 사용하는 이유와 Multi-Agent가 Computing 수요를 증폭시키는 구조는 이전 글 생각정리 328 (* The Agent Multiplier, Unhobbling, OOM)에서 자세히 정리했다.

핵심만 다시 가져오면 B2C Agent의 Token 수요는 다음 식으로 결정된다.

월간 Token 수요
= 활성 사용자 × 일평균 Agent 작업 수 × 작업당 Token × 30일

일반적인 Chatbot은 사용자가 질문하면 한 번 답하고 멈춘다.

Agent는 하나의 목표를 수행하기 위해 계획을 세우고, 외부 정보를 읽고, 도구를 호출하고, 결과를 검증한다. 실패하면 다른 방법으로 재시도하며, 필요한 경우 여러 Agent가 업무를 나누어 수행한다.

2026년 공개된 연구에서도 복잡한 Agentic Coding 작업은 단순 Code Chat이나 추론보다 최대 1,000배 많은 Token을 사용했다. 동일한 작업도 실행 경로에 따라 사용량이 최대 30배 차이 났다.

Agent Token Consumption 연구

Coding Agent의 수치를 개인 Agent에 그대로 적용할 수는 없다.

다만 한 번의 사용자 요청이 다수의 모델 호출과 긴 Context 처리로 증폭된다는 방향은 동일하다.

여기에 백그라운드 작업이 더해진다.

Chatbot은 사용자가 대화를 종료하면 Token 소비도 멈추지만, 개인 Agent는 사용자가 자는 동안에도 이메일을 분류하고, 가격과 뉴스를 추적하고, 다음 날 일정을 준비한다.

B2C Agent 시장에서는 사용자 수보다 다음 세 가지 변수가 더 중요해진다.

  • 사용자당 Agent 작업 빈도

  • 작업당 모델 호출과 Token

  • 백그라운드 실행시간


2030년 B2C Agent Token 수요 추정


아래 수치는 각 기업의 공식 전망이 아니라 개인 Agent의 확산 속도와 작업 구조를 기반으로 한 자체 추정치다.

Token에는 사용자가 화면에서 보는 답변뿐 아니라 System Prompt, 장기 Context, 외부 문서, 도구 실행 결과, 검증과 재시도에 사용되는 내부 Token을 포함했다.



기본 시나리오에서 B2C Agent 활성 사용자는 2026년 1.2억 명에서 2030년 15억 명으로 약 12.5배 증가한다.

같은 기간 월간 Token 수요는 0.007경에서 3.24경으로 약 450배 증가한다.

사용자 증가에 작업 빈도와 작업 복잡도의 상승이 함께 곱해지기 때문이다.

2030년 월간 3.24경 Token은 연간 약 38.9경 Token이다.
기업용 Agent, Coding Agent, Physical AI와 기존 Chatbot 사용량은 포함하지 않은 숫자다.


수익화보다 먼저 Token 시장이 열린다


B2C Agent 시장을 유료 가입자만으로 판단하면 실제 Token 수요를 과소평가할 수 있다.

2030년 B2C Agent MAU 15억 명, 유료 전환율 6%, 유료 ARPU $300를 적용하면 유료 사용자는 약 9,000만 명, 구독시장은 약 270억 달러가 된다.

그러나 무료 Agent도 상당한 Token을 소비한다.

플랫폼 기업은 이를 구독료뿐 아니라 광고, 쇼핑 수수료, 결제, 여행 예약, 금융상품 중개와 기업용 서비스로 회수할 수 있다.

검색시장은 사용자의 의도를 광고와 연결했다.

Agent 시장은 사용자의 의도를 실제 거래와 실행으로 연결한다.

Meta가 Muse에 Stripe Link를 연결하고 Shopify의 Shop Pay를 지원하려는 이유도 여기에 있다. 반대로 Amazon은 고객정보와 기존 추천 시스템을 보호하기 위해 Muse의 쇼핑몰 접근을 차단했다. Meta 공식 발표, The Verge

앞으로 플랫폼은 사람의 Traffic뿐 아니라 Agent Traffic과 거래 주도권을 두고 경쟁하게 될 가능성이 높다.

앱은 넘쳐나는데, 쓸 시간은 없다
Agent Traffic 경쟁 본격화  


Token 증가와 AI 기업의 매출 증가는 구분해야 한다


Token 수요가 폭발한다고 해서 AI 기업의 매출이 같은 속도로 증가하는 것은 아니다.

모델 효율과 추론 단가가 빠르게 하락하면 Token 사용량은 늘어나도 Token당 매출은 계속 낮아질 수 있다. 실제 소비자 요금도 Token 단위보다 월 구독, 사용 한도, 광고와 거래 수수료의 조합으로 결정될 가능성이 높다.

따라서 B2C Agent의 경제성은 다음 관계에 달려 있다.

**사용자당 Agent 경제적 가치 증가율

사용자당 추론 및 실행비용 증가율**

Agent가 소비자의 시간을 절약하고 구매와 광고 전환을 늘린다면, 플랫폼은 무료 사용자에게 Token을 제공하면서도 이익을 얻을 수 있다.

반대로 많은 Token을 사용하면서 유료 전환이나 거래를 만들지 못하면 사용량 증가는 비용 부담으로 돌아온다.

Muse는 B2C Agent의 수요뿐 아니라 이러한 경제성이 실제로 성립하는지를 시험하는 첫 대규모 사례다.


Agent는 AI 인프라 수요를 GPU 밖으로 확장한다


Agentic AI가 장기 Context와 반복 실행을 통해 Memory·Storage·Networking 수요를 확대하는 경로는 생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)에서 정리했다.

HBM이 Agentic Workload에서 GPU의 실제 Token 생산성을 높이는 경제적 가치(*=HBM)는 생각정리 361 (* The Price of Idle FLOPS, Astra & HBM) 내용으로 갈음한다.

이번 글에서 추가로 중요하게 보는 부분은 개인 Agent마다 별도의 실행환경이 필요해진다는 점이다.

Muse와 Grok Bot은 모델 추론만 수행하지 않는다. 클라우드 VM에서 브라우저와 앱을 실행하고, 인증 상태와 작업 기록을 저장하며, 외부 서비스와 지속적으로 통신한다.

따라서 B2C Agent의 확산은 다음 수요를 함께 증가시킨다.


Agent AI는 모델 하나가 아니다.

모델·VM·브라우저·Memory·Storage가 결합된 상시 실행형 컴퓨팅 시스템에 가깝다.


기존 글의 결론에서 한 단계 더 나아가 보면


생각정리 372 (* Intelligence Is Abundant, Execution Is Scarce)에서는 모델의 희소성이 낮아질수록 데이터·실행·유통·물리적 인프라의 가치가 높아질 가능성을 정리했다.

Muse는 이 변화가 기업용 AI에만 머물지 않고 B2C 시장으로 확장될 수 있음을 보여준다.

앞으로 Frontier Model의 성능 격차가 축소되더라도 개인 Agent 시장에서는 다음 자산이 여전히 희소하다.

  • 수십억 명에게 Agent를 배포할 수 있는 플랫폼

  • 이메일·일정·결제와 개인 데이터에 대한 접근권한

  • Agent가 실제 행동할 수 있는 앱과 거래망

  • 장시간 작업을 안정적으로 처리할 컴퓨팅 인프라

  • 소비자가 자신의 일상과 개인정보를 맡길 수 있는 신뢰


AI 기업의 경쟁은 가장 좋은 답변을 만드는 경쟁에서 가장 많은 실행을 위임받는 경쟁으로 이동하고 있다.


앞으로 확인해야 할 지표


Muse의 다운로드 순위만으로 B2C Agent 시장의 성공을 판단하기는 아직은 너무 이르고 어렵다.

앞으로 더 중요하게 봐야 할 지표는 다음과 같다.


이 가운데 가장 중요한 지표는 다운로드가 아니라 사용자당 완료 작업 수다.

작업 수와 완료율이 함께 증가하면 Token 소비와 경제적 가치도 커진다. 반대로 사용자가 Agent의 행동을 믿지 못해 모든 단계를 직접 확인해야 한다면 시장의 확장성은 제한된다.


글을 마치며


Muse의 초기 흥행을 Meta의 새로운 수익원으로만 해석할 필요는 없다.

더 큰 변화는 Muse가 개인 Agent에 대한 소비자 수요를 확인하면서 OpenAI, SpaceXAI, Google, Apple과 Anthropic을 같은 시장으로 끌어들이고 있다는 점이다.

ChatGPT는 생성형 AI를 일반 소비자에게 배포했다.

Muse와 Grok Bot은 AI가 사용자를 대신해 실제 업무를 수행하는 경험을 배포하기 시작했다.

과거에는 얼마나 많은 사람이 AI에게 질문하는지가 중요했다.
앞으로는 Agent가 하루 동안 몇 개의 업무를 수행하고,
몇 개의 앱을 오가며,
얼마나 오랫동안 Context를 유지하는지가 더 중요해진다.

기본 시나리오에서 B2C Agent 사용자는 2026년부터 2030년까지 약 12.5배 증가하지만, Token 수요는 약 450배 증가할 수 있다.

이유는 단순하다.

Chatbot은 사람이 질문할 때만 작동하지만, Agent는 목표가 끝날 때까지 계속 작동하기 때문이다.

여기에 여러 Agent가 역할을 나누고 서로 검증하는 Multi-Agent 구조까지 확산되면 Token 수요는 사용자 수보다 훨씬 빠르게 증가할 수 있다.

Muse가 보여준 가장 큰 가능성은 Meta의 미래 매출에만 있지 않다.

AI Token 시장이 기업과 개발자를 넘어 수십억 명의 소비자에게 확산되고, GPU·CPU·HBM·Server DRAM·Storage·Networking과 전력 수요를 함께 끌어올리는 새로운 수요층이 등장하고 있다는 데 있다.

ChatGPT Moment가 AI의 B2C 사용자 Chatbot시장을 열었다면, 개인 Agent 경쟁은 B2C Token 시장을 여는 Consumer Token Moment가 될 가능성이 있다.

= 끝

2026년 5월 7일 목요일

생각정리 242 (* Agent AI, CPU market)

이전글에 이어 agent ai시대의 cpu 시장에 대해 추가 리서치를 이어나가본다.

Agent AI 시대의 CPU 시장


TAM 상향보다 중요한 것은 “누가 실제로 만들 수 있느냐”다


CPU 시장을 다시 봐야 하는 이유는 단순하다. 최근 Arm과 AMD가 거의 같은 시점에 CPU TAM을 크게 상향했고, 두 회사 모두 공통적으로 수요보다 공급망 확보가 더 큰 변수라는 메시지를 내고 있기 때문이다.

Agent AI가 확산되면 CPU 수요는 서버 안에서만 늘어나는 문제가 아니다. 데이터센터의 head node, control plane, inference orchestration뿐 아니라 PC, 워크스테이션, 스마트폰, IoT까지 확장될 가능성이 있다. 결국 투자 포인트는 “CPU 수요가 늘어날 것인가”를 넘어, 그 수요를 누가 실제 웨이퍼·패키징·테스트 캐파로 받아낼 수 있느냐로 이동하고 있다.


Arm: AGI CPU는 TAM을 다시 쓰는 사건이다


Arm은 2026년 3월 Arm AGI CPU를 공개했다. 이 제품은 Arm이 단순 IP 라이선스와 로열티 모델을 넘어 직접 데이터센터용 CPU 실리콘을 공급하겠다는 첫 번째 본격 사례라는 점에서 의미가 크다.  (Arm Newsroom)

Arm의 핵심 메시지는 명확하다. Agent AI 데이터센터에서는 CPU가 단순 보조 연산 장치에 머물지 않고, accelerator management, control plane processing, API hosting, task hosting 같은 역할을 담당하게 된다. Arm이 공식 자료에서 AGI CPU의 주요 사용처를 이 영역으로 제시했다는 점은 CPU 수요가 “기존 서버 교체 수요”보다 훨씬 넓은 범위에서 발생할 수 있음을 보여준다. (Arm Newsroom)

최근 실적 관련 보도에서는 이 숫자가 더 구체화됐다. Arm은 FY2027~FY2028 합산 기준 20억 달러 이상의 AGI CPU 고객 수요를 확보했으며, 이는 최초 발표 당시보다 두 배 이상 커진 수준으로 보도됐다. 동시에 회사는 현재 확보 가능한 공급으로는 약 10억 달러 수준의 수요를 대응할 수 있다고 언급하면서, 추가 매출 인식의 관건이 수요가 아니라 제조·메모리·패키징 공급망 확보에 있다고 설명했다. (마켓워치)

이 지점이 중요하다. Arm이 말하는 장기 1,000억 달러 이상의 데이터센터 CPU TAM은 공격적인 숫자지만, 시장이 주목해야 할 핵심은 숫자 그 자체보다 직접 칩 판매가 Arm의 TAM을 구조적으로 재정의한다는 점이다. 기존에는 Arm 기반 칩이 많이 팔려도 Arm은 로열티 중심으로 수익을 가져갔다. 이제는 데이터센터 CPU 시장에서 직접 제품 매출이 발생할 수 있는 구조로 바뀌고 있다.


#ARM 

NOW



2M before



AMD: 서버 CPU TAM 전망이 다시 올라갔다


AMD도 같은 방향을 보고 있다. AMD는 2026년 1분기 실적 발표에서 Agent AI에 따른 CPU compute requirement 증가를 근거로 서버 CPU TAM 전망을 크게 높였다. 리사 수 CEO는 2025년 11월 Financial Analyst Day에서 제시했던 연평균 약 18% 성장률 전망을 상향해, 서버 CPU TAM이 2030년까지 연평균 35% 이상 성장하며 1,200억 달러 이상에 도달할 수 있다고 밝혔다. (야후 금융)

이 발언은 Arm의 메시지와 맞닿아 있다. Agent AI가 확산되면 데이터센터는 GPU만 더 붙이는 구조로 끝나지 않는다. GPU/XPU를 효율적으로 활용하려면 더 많은 CPU 코어가 필요하고, workload orchestration, scheduling, networking, memory coordination, storage access 같은 영역에서 CPU의 부담이 커진다.

여기서 중요한 것은 AMD가 단순히 CPU 제품 경쟁력을 강조한 것이 아니라, 장기 고객 수요와 캐파 플래닝 논의가 동시에 깊어지고 있다고 언급했다는 점이다. 수요 전망의 상향과 공급망 논의가 같이 등장한다는 것은 시장의 병목이 점차 “설계”에서 “실제 공급”으로 이동하고 있음을 의미한다.


#AMD

NOW


2M Before



서버 CPU만 보면 그림이 작다


CPU 시장을 데이터센터 서버에만 국한해서 보면 이 변화의 폭을 과소평가할 수 있다. Agent AI는 일부 작업을 클라우드에서 처리하더라도, 점차 더 많은 연산과 실행 환경을 엣지 디바이스로 밀어낼 가능성이 있다.

이미 Apple Mac에서 초기 신호가 보인다. 9to5Mac은 2026년 4월 말 Apple 실적 발표를 인용해 Mac mini와 Mac Studio의 공급 부족이 수개월간 이어질 수 있다고 보도했다. 팀 쿡은 두 제품이 AI와 agentic tools를 위한 훌륭한 플랫폼으로 인식되면서 수요가 예상보다 빠르게 늘었다고 설명했다. 동시에 Apple은 advanced node와 메모리 부품 제약을 공급 부족의 주요 원인으로 언급했다. (9to5Mac)

이 사례는 서버 밖 CPU 수요를 이해하는 데 중요하다. 로컬 AI 모델, 개발자용 에이전트, 코드 자동화 도구, 개인화된 온디바이스 워크로드가 늘어나면 PC와 워크스테이션의 요구 사양도 올라갈 수밖에 없다. 지금은 메모리 가격과 부품 부족 때문에 일부 디바이스 출하가 눌리는 국면일 수 있지만, 중장기적으로는 Agent AI가 PC·노트북·스마트폰·IoT 전반의 사양 업그레이드 사이클을 자극할 가능성이 높다.


그래서 투자 포인트는 “기술 우위”보다 “물리적 병목”이다


CPU 시장의 기술 경쟁력만 보면 Arm과 AMD가 Intel보다 더 매력적으로 보이는 부분이 많다. Arm은 전력 효율과 생태계 확장성이 강하고, AMD는 EPYC 기반으로 서버 CPU 시장에서 점유율을 꾸준히 확대해왔다. 반면 Intel은 공정 경쟁력 회복과 서버 CPU 점유율 방어라는 과제를 동시에 안고 있다.

그럼에도 지금의 상위 투자 포인트는 기술 우위보다 physical bottleneck에 더 가깝다. AI 인프라 수요가 서버에서 PC와 엣지까지 번지면, 시장은 결국 “누가 더 좋은 CPU를 설계하느냐”만 보지 않는다. 누가 웨이퍼를 확보하고, 첨단 패키징을 처리하고, 테스트까지 통과시켜 실제 제품을 출하할 수 있느냐를 보게 된다.

Arm이 강한 수요에도 불구하고 가이던스를 보수적으로 유지한 이유도 이 지점에 있다. 수요는 이미 확인됐지만, 웨이퍼·메모리·패키징·테스트 장비를 확보해야 매출로 연결된다. AMD 역시 서버 CPU TAM을 크게 올려 잡으면서 동시에 장기 캐파 플래닝을 강조했다. 이 두 회사의 발언을 종합하면, CPU 시장의 다음 병목은 단순 설계 경쟁이 아니라 생산 가능 캐파와 후공정 처리 능력이다.


Intel을 다시 봐야 하는 이유: EMIB와 후공정 캐파


이 관점에서 보면 Intel의 상대적 매력이 다시 부각된다. Intel의 약점은 명확하다. x86 CPU 시장 점유율 방어, 공정 리더십 회복, 파운드리 고객 확보 모두 아직 검증이 필요하다. 그러나 AI 인프라 병목이 첨단 패키징과 물리적 캐파로 이동하는 국면에서는 Intel의 강점도 뚜렷해진다.

TrendForce는 Intel이 EMIB 첨단 패키징 캐파를 미국 오리건과 베트남을 중심으로 확장하고 있으며, 대만 장비업체에 대규모 발주를 진행해 2026년 하반기 납품이 예정돼 있다고 보도했다. 또한 Intel이 코스타리카의 일부 조립·패키징·테스트 기능을 베트남 SHTP로 이전하고, 베트남 생산이 데이터센터 서버용 칩에 집중될 것이라고 전했다. (TrendForce)

[뉴스] 인텔은 미국과 베트남에서 EMIB 확장 확대를 확대하고 있으며, 대만 공구 주문은 2026년 2분반 인도 예정 예정입니다

EMIB 수율 관련 보도도 주목할 만하다. TrendForce는 Wccftech 보도를 인용해 Intel EMIB가 약 90% 수준의 수율에 도달했고, Google과 Meta가 잠재 채택 후보로 거론되고 있다고 전했다. 다만 대량 양산을 위해서는 90%에서 98% 수준까지 끌어올리는 과정이 훨씬 어렵다는 지적도 함께 제시했다. 이 부분은 Intel 투자 아이디어의 업사이드와 리스크를 동시에 보여준다. (TrendForce)

즉, Intel의 강점은 “지금 당장 CPU 기술에서 Arm·AMD를 압도한다”는 논리가 아니다. 핵심은 첨단 패키징 병목이 심해질수록 Intel이 대체 캐파 공급자로 호출될 가능성이다. TSMC CoWoS가 타이트하고, 고성능 CPU·GPU·XPU·ASIC 수요가 동시에 늘어나는 구간에서는 고객사들이 두 번째, 세 번째 공급 옵션을 확보하려 할 수밖에 없다.


#Intel

NOW


4M before



Apple의 움직임도 같은 방향을 가리킨다


Apple 역시 TSMC 의존도를 낮추기 위한 공급망 다변화 가능성이 보도됐다. Bloomberg를 인용한 보도들에 따르면 Apple은 미국 내 주요 디바이스 칩 생산을 위해 Intel과 초기 논의를 진행했고, Samsung의 텍사스 공장도 검토한 것으로 알려졌다. 아직 확정 주문은 아니지만, Apple이 TSMC 외 대안을 탐색한다는 사실 자체가 현재 첨단 노드와 패키징 캐파가 얼마나 전략적 자산이 됐는지를 보여준다. (TrendForce)








이 움직임은 단순히 Apple의 공급망 이슈로 볼 문제가 아니다. AI 데이터센터 수요가 첨단 노드와 패키징 캐파를 빨아들이고, 동시에 Mac 같은 고성능 엣지 디바이스 수요도 올라오면, Apple 입장에서는 TSMC 단일 의존 리스크를 줄일 필요가 커진다. 이때 Intel과 Samsung은 기술적 완성도와 수율 검증이 필요하지만, 전략적 대안으로서의 가치는 높아질 수 있다.


#APPLE






결론: CPU 시장의 핵심 질문이 바뀌고 있다


CPU 시장은 다시 성장 국면에 들어섰다. Arm은 AGI CPU를 통해 데이터센터 CPU 시장에서 직접 매출 기회를 만들고 있고, AMD는 Agent AI를 근거로 서버 CPU TAM 전망을 2030년 1,200억 달러 이상으로 상향했다. Apple Mac 사례는 Agent AI 수요가 서버 밖 디바이스 시장까지 확산될 수 있다는 신호를 제공한다.

다만 이 시장을 볼 때 가장 중요한 질문은 “누가 가장 좋은 CPU를 만드느냐”에만 머물러서는 안 된다. 지금은 누가 실제 생산 캐파를 확보할 수 있느냐, 누가 첨단 패키징 병목을 완화할 수 있느냐, 누가 고객사들의 공급망 다변화 수요를 받아낼 수 있느냐가 더 중요한 구간이다.

그 관점에서 보면 시장이 Arm과 AMD를 먼저 보는 것은 자연스럽다. 두 회사 모두 CPU 수요 증가의 직접 수혜가 크고, 제품 경쟁력도 분명하다. 그러나 physical bottleneck을 상위 투자 포인트로 놓고 보면 Intel 역시 과소평가하기 어렵다. 특히 EMIB, 미국·베트남 후공정 확장, 잠재 hyperscaler 고객 확보 가능성은 Intel이 단순 CPU 점유율 방어주가 아니라 AI 인프라 병목 완화 플레이어로 재평가될 수 있는 근거다.

AI가 촉발한 수요는 이제 GPU에서 멈추지 않는다. CPU, 메모리, 패키징, 테스트, 전력, 엣지 디바이스까지 연쇄적으로 번지고 있다. 앞으로의 관전 포인트는 이 수요의 크기보다, 그 수요를 실제 제품으로 바꿀 수 있는 물리적 공급망을 누가 갖고 있는가에 있다.


AI가 촉발한 수요의 불씨가 거대한 산불이 되어 어디까지 확산될지 지켜볼 뿐이다..















=끝

2026년 2월 19일 목요일

생각정리 182 (* MoltBot, Agent AI, Agent PC)

1. OpenClaw 몰트봇 열풍: “말 잘하는 챗봇”에서 “일을 대신하는 Agent AI”로


OpenClaw(과거 이름: Clawdbot, Moltbot)는 단순한 챗봇이 아니다.
핵심은 하나로 요약된다.

“사용자의 컴퓨터 안으로 들어와 실제 일을 대신하는 상시 대기 개인 비서”


사용 방식은 낯설지 않다. 텔레그램·슬랙 같은 메신저에서 사람에게 말하듯 지시하면 된다.

  • “이 메일 정리해 줘”

  • “이 폴더로 파일 옮겨줘”

  • “이 사이트 들어가서 항공편 체크인 해줘”


그러면 OpenClaw 에이전트가 로컬 컴퓨터에서 직접 파일을 움직이고, 이메일을 처리하고, 필요하면 터미널 명령이나 간단한 스크립트를 만들어 실행한다. 사용자는 화면 앞에 붙어 있을 필요가 없다. 일을 시켜두고 다른 일을 하다가, 나중에 결과만 메시지로 받는다.


이 사용 경험의 변화는 크다.
AI를 “질문하면 답을 해주는 도구”가 아니라, 24시간 대기 중인 디지털 비서처럼 쓰게 만든다.


여기에 다음과 같은 성장 스토리가 붙었다.

  • 2024년 11월 첫 공개 이후 폭발적인 확산

  • GitHub에서 10만 개 이상 star

  • 1주일 만에 방문자 200만 명 돌파


https://openrouter.ai/rankings?view=week


그리고 결정적인 뉴스가 이어진다.

  • OpenClaw 창업자 **피터 스타인버거(Peter Steinberger)**가 OpenAI에 합류

  • 샘 올트먼 CEO는 그가 **“차세대 개인용 에이전트 개발”**을 주도할 것이라고 발표

  • OpenClaw는 재단(foundation) 형태로 전환되어,

    • 계속 오픈소스 프로젝트로 유지

    • OpenAI가 장기적으로 지원 예정

  • 스타인버거는 “OpenClaw를 오픈소스로 유지하는 것이 중요하다”고 강조하며, OpenAI를 자신의 비전을 확장할 최적의 플랫폼이라고 평가


https://www.reuters.com/business/openclaw-founder-steinberger-joins-openai-open-source-bot-becomes-foundation-2026-02-15/


즉, OpenClaw는

  1. 이미 실사용 가능한 Agent AI 경험을 보여준 데다가,

  2. 창업자가 OpenAI에 합류해 “개인용 에이전트”를 공식 로드맵으로 밀어 붙이는 상황으로까지 발전했다.


“Agent AI 시대가 올 것 같다”는 추상적인 이야기에서,
실제 코드·제품·채용·조직 개편이 등장한 단계로 한 걸음 들어온 것이다.


2. Agent AI → 맥미니 품귀: 소프트웨어 혁신이 하드웨어 수요를 어떻게 건드렸나


OpenClaw 같은 Agent AI가 보여준 “상시 비서” 경험은 로컬에서 도는 작은 LLM + 에이전트 프레임워크가 있으면 충분히 구현 가능하다는 사실을 증명했다.


그러자 예상치 못한 방향으로 파급이 나타났다.
바로 맥미니·맥스튜디오 같은 Apple Silicon 기반 머신 수요 폭발이다.

"애플도 당황했다" 전국적인 맥미니 품절 현상을 불러온 '이 앱'의 정체 | 잇츠잍



특히 다음과 같은 특징을 가진 맥미니류가 각광을 받는다.

  1. Unified Memory Architecture(통합 메모리 구조)

    • Apple Silicon의 메모리는 CPU·GPU·NPU가 공유하는 단일 풀이다.

    • 전통적인 PC처럼 RAM과 VRAM을 왔다갔다하며 복사할 필요가 없다.

    • 에이전트가 작은 LLM, 임베딩, KV 캐시, 시스템 프롬프트를 계속 읽고 쓰는 “추론 중심” 워크로드에서 이 구조가 특히 유리하다.

    • 즉, “메모리 복사/전송” 대신 “그냥 같은 풀을 함께 쓰는” 구조이므로, 토큰/초 성능이 안정적으로 나오기 쉽다.

      https://macpaw.com/how-to/unified-memory-mac


  2. 24/7 상시 가동에 적합한 폼팩터

    • 맥미니는 저전력·저소음·소형 폼팩터라는 장점이 있다.

    • Agent AI는 “필요할 때 켜는 프로그램”이 아니라, 항상 뒤에서 돌아가는 서비스에 가깝다.

    • 데스크톱 한 켠에 두고 24시간 켜두기에는, 고성능 GPU 타워보다 맥미니가 훨씬 현실적이다.

  3. 로컬 프라이버시 + OS 통합성

    • OpenClaw가 진짜 쓸모 있으려면, 메일·캘린더·파일·메신저·브라우저 권한을 전부 쥐어줘야 한다.

    • 이 데이터를 클라우드에 다 올리는 것보다, 집·사무실에 있는 한 대의 로컬 머신에만 맡기는 편이 심리적으로 훨씬 편하다.

    • 맥OS는 시스템 권한·개인정보 권한 모델이 잘 정리되어 있어, 에이전트에 줄 권한을 세밀하게 제어하기에도 좋아 보인다.

결국 **“하나의 오픈소스 Agent AI” → “맥미니·유니파이드 메모리 모델 품귀”**라는 흐름이 현실에서 관찰되기 시작했다.

여기서 중요한 포인트는 다음 두 가지이다.

  • Agent AI가 상식이 되면,
    단순히 “CPU 클럭이 얼마나 빠르냐”가 아니라 **“로컬에서 추론을 얼마나 잘 돌리느냐(메모리 아키텍처, 대역폭, 항상 켜둘 수 있는 폼팩터)”**가 개인용 컴퓨터의 핵심 스펙이 된다.

  • 그 시작점이 지금 맥미니류 + sLLM + OpenClaw류 Agent AI 조합에서 나타난 것이다.


3. 개인용 AI 슈퍼컴퓨터를 누가, 어떤 일에 쓰게 될까


맥미니는 일종의 “입문형 로컬 에이전트 서버”이다.
그보다 한 단계 위에는 NVIDIA DGX Spark 같은 개인용 AI 슈퍼컴퓨터가 있다.


이 층을 주로 쓸 집단과 사례를 구체적으로 정리하면 아래와 같다.

3-1. 에이전트 플랫폼·자동화 스타트업

  • 대상: 특정 산업(보험, 회계, CS, 로지스틱스 등)에 특화된 업무용 에이전트를 만드는 스타트업

  • 사용 사례

    • 사내 시스템(티켓, CRM, ERP)에 붙은 수백 개의 에이전트가 동시에 돌아가는 상황을 로컬에서 부하 테스트

    • 새 프롬프트 정책, 툴 조합, 가드레일을 DGX Spark 위에서 먼저 검증한 뒤, 안정화된 버전만 클라우드로 올려 서비스


이들은 **“에이전트가 고객사 수백·수천 명을 동시에 상대하는 상황”**을 사업으로 삼기 때문에, 토큰 사용량과 동시성 자체가 DGX급 장비를 정당화한다.

3-2. 금융·법률·컨설팅 등 고기밀 지식 산업

  • 대상: 자산운용사, 리서치 하우스, 로펌, 컨설팅 회사 등

  • 사용 사례

    • 내부 리포트, 계약서, 콜 노트, 메일, 내부 DB를 모두 엮은 사내 전용 에이전트 운영

    • 규제·보안 이슈로 외부 클라우드에 올리기 애매한 데이터는 온전히 로컬 AI 슈퍼컴퓨터 안에서만 처리

    • 분석 결과만 요약 형태로 외부 시스템과 연동

이들은 데이터 반출 리스크 때문에 “로컬 + 폐쇄망”이라는 제약이 강하다. 이런 환경에서 DGX급은 “작은 온프렘 데이터센터”를 책상 옆으로 축소해 놓은 형태가 된다.

3-3. 미디어·게임·크리에이티브 스튜디오

  • 대상: 영상/VFX/게임/3D 스튜디오, 마케팅 콘텐츠 대량 제작 팀

  • 사용 사례

    • 하나의 캠페인 브리프로부터 영상 스토리보드, 이미지, 카피, 현지화 버전까지 에이전트가 대량 생성

    • 대형 멀티모달 모델, 비디오 생성 모델을 DGX 위에 로컬로 올려, 대량 배치 렌더링 진행


여기서는 “토큰 수”보다 GPU 연산량과 메모리 대역폭이 핵심이라, DGX급 장비가 “로컬 렌더팜 + AI 팩토리” 역할을 한다.

3-4. 연구소·교육기관·헤비 유저 개인

  • 연구자: 수십·수백 개 에이전트를 시뮬레이션 환경에서 돌려보며, 정책·보안·협력 구조를 연구

  • 교육기관: 학생들에게 “개인 조교 에이전트”를 붙이고, 그 서버 역할을 DGX가 수행

  • 헤비 유저 개인: GitHub 스타 수만의 개발자, AI 크리에이터가 자신의 코드·노트·메일·일정에 붙은 에이전트를 24/7 자기 하드웨어에서만 돌리기를 원할 때


결국 DGX급 개인용 AI 슈퍼컴퓨터는 “모든 사람의 기본 장비”라기보다는,
에이전트 사용량이 큰 프로/팀/파워유저가 쓰는 2층 하드웨어 계층으로 자리 잡을 가능성이 크다.


4. 클라우드 vs 로컬: 토큰 경제학과 하이브리드의 공존

Agent AI 시대에서 비용을 가르는 핵심은 “얼마나 자주, 얼마나 길게, 얼마나 많은 에이전트가 돌아가느냐”, 즉 토큰 사용량이다.

4-1. 클라우드 데이터센터형: 토큰 기반 변동비


클라우드 LLM은 토큰당 가격이 정해져 있다.
모델에 따라 차이는 있지만, 대략적인 그림은 다음과 같다.

  • 토큰 100만 개(1M tokens)당 수십 센트~몇 달러 수준

  • 입력 토큰보다 출력 토큰이 더 비싼 구조

  • 캐시·배치·전용 엔드포인트를 잘 쓰면 단가는 내려간다.

그래서:

  • 월 수백만~수천만 토큰:

    • 대부분의 개인·소규모 팀은 이 구간에 속한다.

    • 클라우드 변동비가 월 수 달러~수십 달러 수준에서 관리된다.

  • 월 수억~수십억 토큰:

    • 에이전트 수백~수천 개, 상시 구동, 배치 작업까지 얹힌 프로팀 구간이다.

    • 이때부터는 월 수백~수천 달러가 나올 수 있다.

특히 Agent AI는 계획-툴 실행-검증-재시도를 반복하면서 출력 토큰이 빠르게 쌓이기 때문에, 잘못 설계하면 토큰비가 선형 이상으로 폭증한다.

4-2. 로컬 개인용 AI 슈퍼컴퓨터: 고정비 + 성능 상한


로컬 장비는 토큰 단위 과금이 없다. 대신 다음이 비용이다.

  • 장비 가격(몇 백만~수천만 원) → 감가상각으로 월 환산

  • 전기요금, 냉각, 공간

  • 운영·관리 부담(업데이트, 장애 대응, 보안 세팅)


간단히 말해 로컬은 “초기 목돈 + 매달 일정한 고정비” 구조다.
그래서 토큰을 많이 쓸수록, 토큰당 평균 비용은 계속 내려간다.

하지만 로컬에는 분명한 한계도 있다.

  • 동시에 돌릴 수 있는 에이전트 수, 초당 생성 토큰 수에 물리적 상한이 있다.

  • 사용량이 더 늘면, 장비를 한 대 더 사야 하고, 그러면 다시 고정비가 계단식으로 올라간다.

4-3. 비용 편익의 교차점과 하이브리드 구조


결론적으로 두 곡선은 언젠가 교차한다.

  • 토큰 사용량이 적을 때:

    • 클라우드가 압도적으로 유리하다.

    • 로컬 장비를 살 이유가 거의 없다.

  • 토큰 사용량이 매우 많을 때(월 수억~수십억 토큰 수준):

    • 일정 시점부터는 로컬 장비의 감가상각+전기요금이, 클라우드 토큰비보다 싸지기 시작한다.

    • 이 구간이 바로 DGX급 장비의 수요가 터지는 지점이다.

그러나 현실에서 가장 자연스러운 답은 하이브리드다.

  1. 기본값

    • 자주 반복되는 일상 업무, 개인 데이터(메일, 캘린더, 파일), 소규모 팀 업무는 로컬 sLLM + 에이전트로 처리

    • 이때 맥미니·AI PC·작은 워크스테이션이 “1층 로컬 에이전트 서버” 역할을 한다.

  2. 에스컬레이션

    • 난도가 높거나, 대규모 문서 집단, 고난도 멀티모달, 방대한 웹 리서치가 필요할 때만 클라우드 거대 모델로 라우팅

    • DGX급 장비를 가진 팀은, 그 장비를 “자체 클라우드”처럼 쓰면서 부분적으로 외부 LLM과 병행한다.

이 구조에서는

  • CPU 위주의 기존 데스크톱

  • 로컬 AI 박스(맥미니~DGX Spark)

  • 클라우드 LLM


이 세 층이 서로 다른 비용·성능·보안 특성을 가진 계층으로 공존하게 된다.


5. OpenClaw의 행보가 시사하는 것: 에이전트 보급, AI PC, 그리고 메모리 수급의 긴장


다시 처음으로 돌아가 보자.

  • OpenClaw 창업자 피터 스타인버거, OpenAI 합류

    • 샘 올트먼: 그가 **“차세대 개인용 에이전트 개발”**을 이끌 것이라고 발표

  • OpenClaw 프로젝트

    • 재단(foundation) 형태로 전환

    • 계속 오픈소스로 유지

    • OpenAI가 장기적 지원 약속

  • OpenClaw 자체의 성장

    • Clawdbot/Moltbot 시절부터 e메일 관리, 보험사 응대, 항공편 체크인 등 실제 업무 자동화에 강점

    • 11월 공개 이후 GitHub 10만 star, 1주일 200만 방문자



5-1. GitHub Star / Star History가 뭐냐

  1. GitHub Star란?

  • GitHub에서 마음에 드는 오픈소스 프로젝트를 발견하면, 사용자들이 “Star(별표)”를 눌러서 북마크+호감 표시를 한다.

  • Star 개수는

    • “이 프로젝트에 관심 있는 개발자가 얼마나 많은지”

    • “커뮤니티에서 얼마나 화제가 되었는지”
      를 보여주는 인기·관심도 지표이다.

  1. Star History란?

  • 특정 저장소(예: moltbot/moltbot)의 별 개수가 시간에 따라 어떻게 늘어났는지를 그래프로 그린 것이다.

이는 두 가지를 동시에 시사한다.

  1. Agent AI는 일시적인 유행이 아니라,
    메이저 플레이어(OpenAI)의 로드맵 중심에 들어온 기술 축이다.

  2. 그 구현 방식으로 **“오픈소스 + 로컬 실행”**이 상당히 중요한 축을 차지하고 있다.

이제 Agent AI 기능이 계속 확장·보급되면 어떤 일이 벌어질까.

  • 전 세계 가정과 사무실의 책상 위에서,

    • 기존 CPU 위주의 데스크톱 PC 옆에

    • **개인용 AI GPU 기반 슈퍼컴퓨터(혹은 AI PC/맥미니류)**가 한 대씩 더 놓이는 그림이 점점 자연스러워진다.


      https://www.theverge.com/2020/11/17/21570046/apple-mac-mini-2020-m1-review


  • 이 장비들은 모두 큰 메모리 풀과 빠른 대역폭을 필요로 한다.

    • 데이터센터는 HBM·HBF(High Bandwidth Flash) 같은 신형 메모리를 요구하고,

    • 가정·사무실은 유니파이드 메모리, 고대역폭 LPDDR, 대용량 플래시를 요구한다.

이미 데이터센터용 HBM/CoWoS 공정은 수요 대비 캐파가 부족한 병목 구간에 있다.
여기에 PC·가전·엣지용 메모리 수요가 Agent AI 보급과 함께 중첩되면,

  • 메모리 가격의 구조적 변동성

  • 특정 패키징(예: CoWoS) 라인의 만성적인 증설 압박

  • 국가·기업 차원의 메모리 전략(공급망·투자)

이 더 중요한 이슈로 떠오를 가능성이 높다.

정리하면,

  • OpenClaw와 같은 오픈소스 Agent AI는

  • 맥미니류 로컬 에이전트 서버 붐을 만들었고,

  • 그 위층에서는 DGX Spark 같은 개인용 AI 슈퍼컴퓨터의 수요를 예고하고 있으며,

  • 이 흐름이 CPU 중심 데스크톱 시장을 “에이전트 전용 GPU·메모리 박스”와 함께 재편할 수 있다.

  • 그 과정에서 PC·가전용 메모리 추가 수요가 지금의 데이터센터 중심 메모리 병목을 더욱 악화시킬 잠재력을 이미 내포하고 있다.

지금 우리가 보고 있는 OpenClaw 열풍과 맥미니 품귀는,
그 거대한 구조 변화를 향해 올라가는 초입에서 보이는 작은 증상에 가깝다고 할 수 있을지도 모르겠다.


AI 데이터센터가 전 세계 메모리 수요를 흡수하는 현 시점에서, Agent AI 시대가 급속히 다가오면 GPU 기반 개인용 AI 슈퍼컴퓨터용 메모리 수요가 추가로 겹치며 수급 부담이 한층 커질 가능성이 있지 않나 싶다. 

다 정리해놓고 계속 읽다보니 클라우드 AI D/C가 
AI 컨슈머 Local쪽으로 내려온다면
메모리 P 사이클을 넘어선 강력한 Q 사이클이 곧 올지도 모르겠다는 생각이 든다. 


=끝