2026년 9월 27일 일요일

생각정리 378 (* The Memory Behind Every Agent)

메멘토
메모리가 부족하다면, Agent는 메멘토 주인공처럼 단기기억상실증에 걸린 사람처럼 행동할지도..


연휴동안 따로 긁어모든 데이터를 정리해 기록해본다.


Agent 시대가 예상보다 빠르게 다가오고 있다.


최근에는 Agent가 얼마나 많은 Token을 사용하는지, 개인별 VM이 왜 필요한지, 그 과정에서 HBM·Server DRAM·NAND 수요가 얼마나 증가할지를 계속 살펴봤다.

citi
그 어느 기술보다 빠르게 확산되고 있는 Agent 

이번에는 그 논리에서 한 단계 더 내려가 보려고 한다.

Agent가 장시간 안정적으로 일하기 위해 필요한 Memory는 무엇이며, 그 Memory 수요가 반도체 생산과 검사시장에서는 어떤 형태로 나타나는가.

그리고 메모리 반도체 자체를 넘어 웨이퍼 검사장비와 검사소모품, eSSD Controller와 Storage Software까지 어떤 수혜 경로가 만들어질 수 있는지를 정리해본다.


Agent 시대의 병목은 지능만이 아니었다


안드레이 카파시는 2025년 인터뷰에서 당시의 AI Agent가 충분한 지능과 Multimodality, Computer Use 능력을 갖추지 못했으며, 특히 Continual Learning을 제대로 수행하지 못한다고 지적했다.

사용자가 새로운 사실이나 작업방식을 알려줘도 이를 장기간 기억하지 못하고, 새로운 Session이 시작되면 다시 원래 상태로 돌아간다는 것이다. 초기 Agent가 제대로 작동하지 않았던 원인을 단순히 모델의 지능 부족으로만 설명할 수 없는 이유다.

더 근본적인 문제는 작업의 형상과 상태를 장기간 유지하지 못했다는 점이었다.

처음 설정한 목표와 제약조건, 이미 완료한 단계, 중간에 확인한 사실, 실패했던 접근법과 현재 작업 위치를 계속 기억하지 못했다. Context가 길어질수록 초기 정보는 수많은 Tool Output 뒤로 밀려났고, 압축과 요약 과정에서는 중요한 상태가 손실됐다.

그 결과 초기 Agent는 한두 번의 질문에는 영리하게 답했지만 수십 번, 수백 번의 행동이 필요한 장기 작업에서는 같은 실수를 반복했다. 초기에 만들어진 작은 오류가 다음 행동의 입력으로 사용되고, 그 오류가 다시 이후의 판단과 Tool Call을 오염시켰다.

이 내용은 이전 글인 생각정리 328 (* The agent Mutipler, Unhobbling, OOM)에서 자세히 다뤘다.

또한 Context와 Memory의 차이, Episodic·Semantic·Procedural Memory, 경험이 지식과 행동으로 압축되는 구조는 생각정리 333 (* Memory redefinition, Agent Architecture, RSI, AGI)에서 정리했다.

핵심만 다시 가져오면 다음과 같다.

장기 Agent의 성능은 각 단계에서 얼마나 똑똑한가보다 오류를 얼마나 적게 누적하고,
잘못된 상태에서 얼마나 빠르게 벗어날 수 있는가에 의해 결정된다.

따라서 Agent 시대의 Memory는 단순히 과거 대화를 저장하는 기능이 아니다.

현재 목표와 작업 상태를 유지하는 Working Memory,
중요한 중간 결과를 보존하는 Checkpoint,
실패한 경로를 구분하는 Episodic Memory,
정상 상태로 돌아가기 위한 Rollback,
여러 Session에 걸쳐 경험을 축적하는 Persistent Memory가 함께 필요하다.

Memory는 Agent의 편의 기능이 아니라 오류율을 낮추고 유효 작업시간을 늘리는 신뢰성 인프라다.


이전 글과 이번 글의 차이


B2C Agent의 확산과 Token 수요는 생각정리 376 (* Muse Agent AI, The Consumer Token Moment)에서 정리했다.

Agent가 장기간 실행될수록 HBM의 경제적 가치가 높아지는 이유는 생각정리 361 (* The Price of Idle FLOPS, Astra & HBM)에서 살펴봤다.

Text에서 Image·Video·Physical World로 AI Workload가 확대되는 과정에서 Memory Supercycle이 발생할 가능성은 생각정리 364 (* From Words to Worlds, The Next Memory Supercycle)에 기록했다.

NAND와 eSSD, AI Context Storage 수요는 생각정리 319 (* NAND, eSSD)에서 별도로 추정했다.

모델의 희소성이 낮아질수록 데이터·실행·유통·물리적 인프라의 가치가 높아지는 구조는 생각정리 372 (* Intelligence Is Abundant, Execution Is Scarce)에서 다뤘다.

따라서 이번 글에서는 이 내용들을 반복하지 않는다.

이번에 집중해서 보려는 것은 다음 경로다.

Agent 확산
→ 장기 작업과 동시 실행 증가
→ HBM·Server DRAM·NAND/eSSD 수요 증가
→ Memory·Logic Wafer 생산과 Device 다양성 증가
→ 검사 횟수·시간·난이도 상승
→ 검사장비 가동률과 검사소모품 교체 수요 증가
→ eSSD Controller와 Storage Software의 가치 상승

 


Agent가 바꾸는 것은 사용자 수보다 작업시간이다


일반적인 Chatbot은 사용자가 질문하면 답변을 생성한 뒤 멈춘다.

반면 Agent는 목표를 부여받으면 계획을 세우고, 외부 정보를 검색하고, 여러 도구를 호출하며, 결과를 검증한다. 실패하면 다른 경로를 탐색하고 필요할 경우 이전 Checkpoint까지 돌아가 작업을 다시 시작한다.

따라서 Agent 수요는 단순 MAU보다 다음 변수에 더 민감하다.

  • 사용자당 Agent 작업 수
  • 작업당 실행 단계
  • 평균 작업시간
  • 동시 실행 Agent 수
  • 실패와 재시도 횟수
  • 유지해야 하는 Context와 작업 상태
  • 저장해야 하는 결과물과 Checkpoint

장기 Memory가 발전하면 작업당 불필요한 재시도와 Token 사용량은 감소할 수 있다. 그러나 동시에 과거에는 수행하지 못했던 수시간·수일 단위의 작업이 가능해진다.

이는 중요한 차이다.

Memory 효율 개선은 작업당 자원 사용량을 낮출 수 있지만, Agent가 경제적으로 수행할 수 있는 업무의 범위와 총가동시간을 더 크게 늘릴 수 있다.

(*조금만 생각해보면 지능의 잠재 시장규모 및 수요는 사실상 무한하다.)

효율 개선이 총수요 감소로 이어지는 것이 아니라, 새로운 Workload를 열어 전체 Compute와 Memory 수요를 확대하는 구조다.


Agent 하나의 뒤에는 여러 종류의 Memory가 존재한다


Agent Architecture에서 말하는 Memory와 HBM·DRAM·NAND 같은 물리적 Memory는 같은 개념이 아니다.

전자는 상태를 형성하고 압축·검색·수정하는 Software Architecture이며, 후자는 그 상태를 실제로 계산하고 저장하는 Hardware Infrastructure다.

그러나 Agent가 장기간 작동하려면 Software Memory는 결국 물리적인 저장공간 위에서 실행되어야 한다.



활성 Context와 KV Cache는 가속기와 가까운 HBM에서 처리된다.

Agent별 VM과 Browser, Tool 실행 상태는 Server DRAM에 머문다.
동시에 실행되는 Agent와 VM이 늘어날수록 시스템당 DRAM 용량과 대역폭의 중요성이 높아진다.
과거 작업기록과 Checkpoint, 사용자별 Memory, Vector Index, 생성된 문서·이미지·영상과 Tool Output은 NAND와 eSSD에 저장된다.

결국 Agent는 하나의 모델이라기보다 HBM·DRAM·NAND·Controller·Software가 연결된 다계층 Memory System에 가깝다.


HBM4·HBM4E의 의미는 용량 증가에서 끝나지 않는다


HBM4와 HBM4E 시장의 규모와 제품 변화는 기존 글인 생각정리 177 (* Nvidia Rubin Ultra Kyber Rack)과 생각정리 361 (* The Price of Idle FLOPS, Astra & HBM)으로 갈음한다.

이번 글에서 중요하게 보는 것은 HBM의 성장률 자체보다 제품 복잡도가 검사시장에 미치는 영향이다.

HBM은 여러 개의 DRAM Die와 Logic Base Die를 수직으로 쌓아 만든다. 하나의 불량 Die가 완성된 Stack 전체의 수율과 원가를 훼손할 수 있기 때문에 적층 이전 단계에서 정상 Die를 선별하는 Known Good Die의 중요성이 높다.

세대가 바뀔수록 다음 변화가 동시에 나타난다.

  • Stack당 Die 증가
  • I/O 수와 대역폭 확대
  • Logic Base Die의 기능 증가
  • 전력·열·신호 무결성 검증 강화
  • 고객별 Customization 확대
  • 적층 전후 검사단계 증가
  • 고온·고속 조건의 검사 난이도 상승

따라서 HBM4·HBM4E의 수혜는 단순히 DRAM Wafer 투입량 증가로만 계산하기 어렵다.

동일한 Wafer 수에서도 Test Pass가 늘어나고, 검사시간이 길어지며, Pin 수와 Probe 밀도, Interface Board의 복잡도가 높아질 수 있다.

HBM 시장이 커질수록 검사장비 수요와 함께 Probe Card, Space Transformer, Interface PCB, Socket과 같은 검사소모품의 기술적 Content가 높아지는 이유다.


Agent는 HBM뿐 아니라 일반 DRAM 수요도 함께 늘린다


Agent가 추론할 때는 HBM이 중요하지만, Agent가 실제로 일을 수행하는 환경 전체를 보면 Server DRAM도 필요하다.

개인별 또는 작업별 VM이 생성되면 각각의 VM은 Operating System, Browser, App, 인증정보와 현재 작업상태를 유지해야 한다. 여러 Agent가 동시에 작동하면 Host Server는 수많은 VM과 Container를 병렬로 처리하게 된다.

이때 필요한 것은 GPU HBM만이 아니다.

  • Server CPU의 Memory Channel 확대
  • RDIMM·MRDIMM 용량 증가
  • 메모리 대역폭 상승
  • 고속 Interface와 Buffer Chip 증가
  • 고다층 Module PCB 적용
  • CXL 기반 Memory Expansion


B2C Agent가 수억 명의 사용자에게 확산되더라도 모든 사용자에게 고정된 물리 서버 한 대가 배정되는 것은 아니다. 실제 수요는 가상화율과 동시 접속률, 평균 Agent 실행시간, 서버당 수용 가능한 VM 수에 따라 달라진다.

따라서 DRAM 수요를 판단할 때는 가입자 수보다 동시 실행 VM 수와 VM당 Memory 할당량을 봐야 한다.


NAND는 Agent의 장기기억이 된다


Agent가 장기간 일하려면 Session이 종료된 뒤에도 작업 상태가 남아 있어야 한다.

과거의 대화뿐 아니라 다음과 같은 정보가 지속적으로 저장된다.

  • 사용자별 선호와 권한
  • 작업 진행상황
  • 과거 성공·실패 경로
  • Checkpoint와 Version History
  • 검색·Tool 실행 결과
  • 생성된 문서·이미지·영상
  • Vector Index와 Embedding
  • 감사 및 보안 로그
  • 백업과 복제 데이터


이 데이터는 모두 HBM이나 DRAM에 계속 보관할 수 없다. 비용이 높고 전원이 중단되면 상태를 유지하기 어렵기 때문이다.

결국 Agent의 장기기억은 NAND와 eSSD로 내려간다.

다만 NAND 수요를 단순 저장용량 증가로만 보면 부족하다. 수많은 Agent가 작은 파일과 작업 상태를 동시에 읽고 쓰기 시작하면 순차처리보다 Random I/O, Latency와 QoS가 중요해진다.

Agent Storage의 병목은 얼마나 많이 저장할 수 있는가에서, 수많은 Agent가 저장된 상태를 얼마나 빠르고 안정적으로 불러올 수 있는가로 이동한다.

*NAND eSSD 쓰기의 중요성 (*=수명관리의 중요성)증가


그래서 eSSD Controller의 역할이 커진다


eSSD Controller는 NAND와 Server 사이에서 데이터의 이동과 수명을 관리한다.

Agent Workload에서는 다음 기능의 중요성이 높아질 수 있다.

  • 다수 VM의 동시 Random I/O 처리
  • 읽기·쓰기 우선순위와 QoS 관리
  • NAND Cell의 마모 분산
  • 오류 정정과 데이터 복구
  • 압축과 중복 제거
  • 고속 Interface 전환
  • 가상화와 보안 격리
  • 전력과 열 관리


NAND 용량이 커지는 것만으로는 충분하지 않다.

Agent의 Memory가 실제 업무에 사용되려면 필요한 정보를 짧은 시간 안에 읽어오고, 다른 VM의 작업과 충돌하지 않으며, 장기간 반복되는 쓰기 작업에서도 성능을 유지해야 한다.

따라서 Agent 시장에서는 NAND Bit 수요와 함께 Controller당 처리성능과 Firmware의 가치가 높아질 가능성이 있다.

Controller 역시 Logic Semiconductor이므로 생산량과 제품세대가 늘어나면 Logic Wafer 검사와 Package Test 수요로 연결된다.


Storage Software는 흩어진 Flash를 하나의 Memory Pool로 만든다


Agent별로 저장공간을 고정 배정하면 사용하지 않는 용량이 늘어나고 운영효율이 떨어진다.

Storage Software는 여러 SSD를 하나의 Pool로 묶고, Agent와 VM별로 필요한 용량과 성능을 동적으로 배분한다. 중요한 데이터는 복제하고 오래된 데이터는 저렴한 계층으로 이동시키며, 장애가 발생했을 때는 이전 상태를 복구한다.

주요 기능은 다음과 같다.

  • Flash Pooling
  • VM별 용량과 QoS 배분
  • Snapshot과 Rollback
  • 데이터 복제와 백업
  • Compression과 Deduplication
  • Tiering과 Lifecycle Management
  • 보안·권한·감사 관리

Agent가 늘어날수록 물리 SSD 대수뿐 아니라 관리해야 하는 Logical Volume과 Snapshot, Checkpoint 수도 증가한다.

따라서 Storage Software는 SSD 판매량뿐 아니라 관리용량과 Data Movement, VM·Agent 수 증가의 수혜를 받을 수 있다.


수요는 결국 메모리와 로직 웨이퍼 검사로 내려온다


Agent 확산은 메모리 반도체에만 영향을 주지 않는다.

Agent System에는 HBM·DRAM·NAND 외에도 CPU, AI Accelerator, SSD Controller, Network Chip, Memory Buffer와 다양한 Custom Logic Chip이 필요하다.

이들 반도체는 Wafer 상태와 Package 상태에서 여러 차례 검사를 거친다.

Wafer Level Test

Wafer를 개별 Die로 절단하기 전에 전기적 특성과 불량 여부를 검사한다.

고가의 Advanced Packaging에 불량 Die가 투입되는 것을 막아야 하므로 HBM과 Chiplet 구조에서는 Wafer Test의 경제적 가치가 더 높아진다.

Package·Final Test

Package가 완성된 뒤 실제 동작조건에서 속도와 전력, 열, 신호 안정성을 검사한다.

HBM Stack, 고성능 CPU, Controller와 AI ASIC은 전력밀도와 I/O 복잡도가 높기 때문에 Package 이후의 검증도 중요하다.

Burn-in·Reliability Test

고온과 고전압 환경에서 초기 불량과 장기 신뢰성을 확인한다.

Data Center용 부품은 장애가 전체 서비스와 고객 데이터에 영향을 줄 수 있어 일반 소비자용 부품보다 높은 신뢰성이 요구된다.


검사소모품 수요는 Wafer 증가율만으로 설명되지 않는다


검사산업을 볼 때 가장 먼저 확인해야 하는 것은 Wafer 투입량이다.

그러나 실제 검사소모품의 매출은 다음 변수의 영향을 함께 받는다.

검사소모품 수요
= 가동 중인 Test Cell
× 장비 가동률
× Cell당 교체 횟수
× 소모품 ASP

  • 신규 Device 인증 및 Line 증설 수요

생산 측면에서는 다음과 같이 볼 수 있다.

Test Workload
= Wafer 투입량
× Wafer당 검사 횟수
× 검사시간
× Device 복잡도

따라서 메모리 Bit 출하량이 증가한다고 검사소모품 수요가 같은 비율로 증가하는 것은 아니다.

NAND는 적층 수와 Die Density가 높아지면 Wafer 한 장에서 생산되는 Bit가 증가한다. Bit 수요가 늘어도 Wafer 투입 증가율은 그보다 낮을 수 있다.

반대로 HBM과 Advanced Logic은 Wafer 증가율이 낮더라도 검사단계와 검사시간, Pin 수와 전력조건이 늘어나면서 Test Intensity가 더 빠르게 상승할 수 있다.

결국 검사산업의 실적은 세 가지 변수로 나눠봐야 한다.

  1. Volume — 실제 Wafer와 Device 생산량
  2. Test Intensity — 검사 횟수와 검사시간
  3. Content Mix — 고사양 검사소모품의 적용 비중


고사양화가 검사소모품에 미치는 영향


Wafer Test에서는 Tester와 반도체 Die 사이를 연결하기 위해 Probe Card와 Interface 구조물이 사용된다.

제품의 I/O 수가 늘어나고 Pad Pitch가 좁아질수록 더 많은 신호를 제한된 면적에서 안정적으로 전달해야 한다. 고주파 신호와 높은 전력을 처리하면서도 접촉저항과 온도를 일정하게 유지해야 한다.

이 과정에서 다음 부품의 기술적 난이도가 높아진다.

  • Probe Card
  • Space Transformer
  • MLO·STF 계열 Interface
  • 고다층 Interface PCB
  • Load Board
  • Test Socket
  • Burn-in Board

이들 부품은 영구적으로 사용하는 설비가 아니다.

반복 접촉과 열, 전류, 기계적 압력에 노출되면서 성능이 저하되므로 일정 주기마다 수리하거나 교체해야 한다. 새로운 Device가 출시되면 Pad 배열과 전기적 조건이 달라져 신규 설계와 고객 인증도 필요하다.

따라서 검사소모품의 성장경로는 단순한 전공정 CAPEX와 다르다.

신규 Line 증설뿐 아니라 기존 장비의 가동률 상승, 신규 Device 출시, Test Time 증가와 반복적인 교체수요가 함께 매출을 만든다.

생각정리 224 (* Advanced PCB)


Memory와 Logic 검사가 함께 증가하는 구조


Agent AI의 Hardware 수요를 HBM 하나로만 보면 전체 수혜경로를 놓칠 수 있다.

HBM이 증가하면 Memory Die와 Logic Base Die 검사가 늘어난다. 개인별 VM과 Server가 늘어나면 Server DRAM과 Memory Module 관련 검사가 증가한다.

장기 상태와 생성물이 축적되면 NAND와 eSSD 수요가 늘어나고, SSD Controller·Buffer·Network Chip 같은 Logic Device의 검사도 함께 증가한다.

결국 Agent 확산은 다음 두 축을 동시에 자극한다.

  • Memory Wafer Test: HBM·DRAM·NAND
  • Logic Wafer Test: CPU·AI ASIC·SSD Controller·Network·Interface Chip

여기에 HBM 적층과 Chiplet, Advanced Packaging이 확대되면 Wafer 단계에서 불량을 선별하는 가치와 Package 이후 전체 System을 검증하는 가치가 함께 높아진다.

Agent AI의 수혜는 Memory 생산량 증가뿐 아니라 Memory와 Logic을 연결하는 전체 Test Stack의 복잡도 상승으로 나타날 수 있다.


검사장비보다 검사소모품에서 먼저 나타날 수도 있다


신규 검사장비 투자는 고객의 대규모 CAPEX 결정과 Line 증설이 필요하다.

반면 검사소모품은 기존 장비의 가동률이 올라가거나 신규 제품의 인증이 시작될 때도 수요가 발생한다. 업황 회복 초기에 장비 발주보다 소모품 주문과 교체주기가 먼저 반응할 수 있는 이유다.

특히 다음 조건에서는 검사소모품의 실적 민감도가 높아질 수 있다.

  • 기존 Test Cell 가동률 상승
  • HBM·고성능 DRAM 생산 Mix 확대
  • 신규 NAND 세대 전환
  • Controller와 Custom Logic 제품 증가
  • 고객별 Device 다변화
  • Probe 수와 Pin Density 증가
  • Test Time 장기화
  • 신규 고객 인증과 공급망 다변화

다만 모든 검사소모품이 동일한 수혜를 받는 것은 아니다.

Commodity 제품은 단가 경쟁과 공급능력이 중요하지만, 고사양 제품은 고객 인증과 신뢰성, 정밀가공 능력과 설계 대응력이 중요하다. 제품 복잡도가 올라갈수록 단순 생산능력보다 Qualification과 Yield의 가치가 높아진다.


앞으로 확인해야 할 지표


Agent 시장에서는 다운로드보다 다음 지표가 중요하다.

  • 사용자당 완료 작업 수
  • 평균 Agent 실행시간
  • 동시 실행 Agent와 VM 수
  • 작업당 Context와 저장용량
  • 장기 Memory 사용률
  • 생성된 파일과 Checkpoint 증가율


Memory와 Storage 시장에서는 다음을 확인해야 한다.

  • Accelerator당 HBM 용량과 Stack 수
  • Server당 DRAM 탑재량
  • RDIMM·MRDIMM 고용량 제품 Mix
  • eSSD 출하용량과 물리 SSD 대수
  • Random I/O와 QoS 요구수준
  • 고성능 Controller 채택률
  • Storage Software 관리용량


검사산업에서는 다음이 핵심이다.

  • Memory·Logic Wafer 투입량
  • Test Cell 가동률
  • Device당 Test Time
  • Wafer·Package별 Test Pass 증가 여부
  • Probe 수와 Pin Density
  • 고사양 검사소모품 매출비중
  • 교체주기와 수리 물량
  • 신규 Device 및 고객 인증 건수


글을 마치며


초기 Agent의 가장 큰 한계 가운데 하나는 지능 자체보다 작업의 상태를 장기간 유지하지 못한다는 데 있었다.

목표와 제약조건을 잊고, 같은 실패를 반복하며, 잘못된 경로에서 빠져나오지 못하는 Agent에게 수시간에서 수일에 걸친 업무를 맡기기는 어려웠다.

Memory의 발전은 이 한계를 낮춘다.

Agent가 작업 상태를 유지하고, 중요한 결과를 Checkpoint로 남기며, 실패 원인을 기억하고, 필요한 순간 정상 상태로 돌아갈 수 있게 만든다. 이는 Agent의 오류 횟수를 줄이는 동시에 수행 가능한 업무의 길이와 범위를 확대한다.

그리고 Software Memory의 발전은 결국 Hardware 수요로 연결된다.

활성 Context는 HBM에,
현재 작업상태는 Server DRAM에,
장기기억과 결과물은 NAND와 eSSD에 저장된다.
그 데이터를 움직이는 Controller와 전체 Flash Pool을 관리하는 Software의 중요성도 함께 높아진다.

반도체 생산 단계에서는 HBM·DRAM·NAND뿐 아니라 CPU, AI ASIC과 SSD Controller 같은 Logic Device의 검사수요가 증가한다. 제품이 복잡해질수록 Wafer 수보다 검사 횟수와 시간, Pin Density와 고객 인증의 중요성이 커진다.

따라서 Agent 시대의 Memory 투자논리는 메모리 반도체 가격 상승에서 끝나지 않는다.

장기 Agent 확산
→ Memory 계층 확대
→ Memory·Logic Device 증가

→ Test Intensity 상승
→ 검사장비 가동률과 검사소모품 교체 증가
→ Controller·Storage Software의 부가가치 상승


모든 Agent의 뒤에는 Memory가 있고, 그 Memory를 구현하기 위해서는 이를 연산하고 저장하며 안정적으로 연결하는 반도체가 필요하다.

Agent 시대의 구조적 수혜는 경쟁이 치열한 상단의 Software Application보다, 모든 Agent가 공통으로 사용해야 하는 하단의 Memory·Storage·검사 인프라에서 먼저 나타날 가능성이 높지 않나 싶다.


=끝

댓글 없음:

댓글 쓰기