AI 메모리 수요는 모델을 학습시키는 단계에만 생기지 않습니다. 완성된 모델이 질문에 답하고, 긴 문서를 읽고, 여러 작업을 이어가는 추론 과정에서도 메모리를 사용합니다. 이 때문에 AI 서버의 수요를 볼 때는 GPU 옆의 HBM과 함께 서버 DRAM, 기업용 SSD도 살펴봐야 합니다.
2026년 9월 11일을 기준으로 NVIDIA의 기술 설명과 삼성전자·SK하이닉스·Micron의 실적 발표를 대조했습니다. 기술적으로 메모리가 필요한 이유와 각 회사가 발표한 수요 전망을 나눠 정리했습니다.
HBM, 서버 DRAM, NAND는 역할이 다릅니다
HBM은 대역폭을 높인 DRAM의 한 종류입니다. AI 가속기가 많은 데이터를 빠르게 읽도록 돕습니다. 일반적인 서버 DRAM은 CPU가 처리하는 작업과 데이터를 담고, NAND 플래시는 SSD에 들어가 모델·데이터를 저장합니다. 일부 추론 시스템에서는 GPU 메모리에 있던 문맥 데이터를 CPU 메모리나 SSD로 옮겨 보관하기도 합니다. NVIDIA의 추론 메모리 계층 설명

AI 서버에서 메모리와 저장장치가 맡는 역할을 단순화한 자체 제작 개념도입니다. 모든 시스템이 같은 구성을 쓰는 것은 아닙니다. 참고: NVIDIA Dynamo 기술 설명 · 확인일: 2026-09-11.
‘메모리가 부족하다’는 말만으로는 어떤 부품이 필요한지 알기 어렵습니다. 계산 장치에 데이터를 빨리 공급해야 하는지, 작업 중인 내용을 더 많이 담아야 하는지, 오래 보관할 저장공간이 필요한지에 따라 수요가 달라집니다.
대화가 길어지면 왜 메모리를 더 쓸까요?
일반적인 자기회귀형 언어 모델은 앞선 내용을 참고하며 다음 토큰을 생성합니다. 이때 앞에서 계산한 일부 결과를 저장해 다시 쓰는 공간이 KV 캐시입니다. 같은 계산을 반복하는 부담을 줄이는 대신, 저장공간과 데이터를 읽어 오는 대역폭을 사용합니다. NVIDIA의 KV 캐시 설명
동일한 모델과 캐시 저장 형식을 가정하면, 저장해야 할 문맥이 길거나 동시에 처리하는 요청이 많을수록 필요한 KV 캐시도 커집니다. 그래서 이용자 수가 같더라도 짧은 문답을 주고받는 서비스와 긴 자료를 읽으며 작업을 반복하는 서비스의 메모리 부담은 다를 수 있습니다.

방향을 설명하는 자체 제작 도표이며 실측 그래프가 아닙니다. 모델 구조와 캐시 압축·재사용·이동 방식에 따라 실제 사용량은 달라집니다. 참고: NVIDIA KV 캐시 기술 설명 · 확인일: 2026-09-11.
코딩 에이전트처럼 여러 단계를 수행하는 AI는 앞선 작업 내용을 반복해서 참조합니다. NVIDIA는 이런 작업에서 문맥을 재사용하고, 캐시를 GPU·CPU·저장장치에 나눠 관리하는 방법을 설명합니다. AI 서비스가 늘어날 때 HBM과 서버 메모리, 저장장치를 함께 보는 이유입니다. 에이전트 추론과 문맥 재사용
제조사 발표에서도 수요 확대가 확인될까요?
삼성전자는 2026년 7월 30일 발표한 2분기 실적 자료에서 하반기 서버 DRAM·기업용 SSD·HBM 수요 증가가 빨라질 것으로 전망했습니다. AI 인프라 투자와 에이전트형 AI 확산을 배경으로 들었고, 생산 확대에도 공급 제약이 이어질 것으로 내다봤습니다. 이는 발표 당시 회사의 전망입니다. 삼성전자 2026년 2분기 발표

삼성전자 공식 발표의 하반기 전망 부분입니다. 서버 DRAM·eSSD·HBM 수요를 함께 언급합니다. 출처: Samsung Global Newsroom, 2026-07-30 발표 · 확인일: 2026-09-11. 영문 세부 내용은 원문에서 확대해 확인할 수 있습니다.
SK하이닉스는 7월 29일 발표에서 AI 인프라 투자에 따른 추가 공급 요청을 설명하고, 주요 고객을 포함한 약 10개 고객과 장기 공급 계약을 체결했다고 밝혔습니다. 메모리 구매자가 앞으로 필요한 물량을 미리 확보하려는 움직임을 보여 주는 사례입니다. 계약 고객 수를 메모리 시장 전체의 성장률로 읽을 수는 없습니다. SK하이닉스 2026년 2분기 발표

장기 공급 계약을 설명한 문단을 실제 페이지에서 캡처했습니다. 출처: SK hynix Newsroom, 2026-07-29 발표 · 확인일: 2026-09-11.
Micron은 6월 24일 회계연도 2026년 3분기 발표에서, 2026년 업계 데이터센터 DRAM·NAND 비트 출하량이 2년 전보다 두 배 이상이 될 것으로 예상했습니다. 여기서 비트 출하량은 메모리 용량을 기준으로 한 물량입니다. 매출이 두 배라는 뜻은 아니며, 이 수치 역시 연간 전망입니다. Micron 발표 자료 4쪽
주문이 늘어도 공급을 바로 늘리기 어려운 이유
Micron은 같은 자료에서 새 공장을 짓는 데 걸리는 시간, 숙련 인력, 인허가와 전력 인프라를 공급 확대의 제약으로 들었습니다. HBM 생산 확대가 다른 DRAM 공급에 부담을 줄 수 있고, 제한된 클린룸 공간의 배분이 NAND 공급에도 영향을 준다고 설명했습니다. 회사는 공급이 빠듯한 상황이 2027년 이후에도 이어질 것으로 전망했습니다. Micron 발표 자료 1~2쪽

Micron이 설명한 공급 제약을 정리한 자체 제작 도표입니다. 단계별 기간을 예측한 일정표는 아닙니다. 출처: Micron, 2026-06-24 발표 · 확인일: 2026-09-11.
이 설명은 공급이 빠듯해질 수 있는 경로를 보여 줍니다. 모든 PC용 RAM이나 SSD 가격이 같은 비율로 오른다는 근거는 아닙니다. 삼성전자도 서버 수요 전망과 별개로 모바일·PC 수요의 일부 둔화를 언급했습니다. 제품별 공급 상황과 구매 수요를 따로 봐야 합니다.
AI가 효율적으로 바뀌면 수요도 줄어들까요?
요청 하나에 필요한 메모리를 줄이는 기술도 발전하고 있습니다. NVIDIA는 KV 캐시를 더 적은 비트로 저장하는 양자화 방법을 공개했습니다. 문맥을 재사용하거나 일부 데이터를 다른 저장 계층으로 옮기는 방식도 있습니다. KV 캐시 최적화
전체 수요를 해석할 때는 이런 효율 개선과 AI 이용량 증가를 함께 봐야 합니다. 요청당 사용량이 줄어도 요청 수와 처리하는 문맥의 길이가 늘면 총수요는 증가할 수 있습니다. 반대로 투자 계획이 늦어지거나 실제 이용이 예상보다 적으면 제조사의 수요 전망도 달라질 수 있습니다.
챗GPT 200달러 Pro 신규 가입 중단은 서비스 수요가 처리 용량을 압박한 사례로 볼 수 있습니다. 다만 담당자 발표는 그 원인을 특정 메모리 부품으로 좁히지 않았습니다. Pro 중단 발표 원문
앞으로 발표를 볼 때는 HBM 판매 소식과 함께 서버 DRAM·기업용 SSD의 출하, 실제 증설 진행, 문맥 처리 효율의 변화를 확인하면 좋겠습니다. 주문 전망이 실제 공급과 이용량으로 이어지는지를 봐야 메모리 수요의 방향을 더 구체적으로 판단할 수 있습니다.
자료 조사, 초안 작성, 도표 제작과 문장 교정에 AI를 활용했습니다.
'AI·IT 이야기' 카테고리의 다른 글
| 챗GPT Pro 200달러 신규 가입 중단, 기존 구독자는 어떻게 되나요? (0) | 2026.09.11 |
|---|---|
| 네이버 키워드 검색량 조회 방법과 데이터랩 차이 (1) | 2026.09.10 |
| AI에게 쓰레드 수익화를 맡겼다 - 1편 (설계편) (0) | 2026.08.19 |
| AI에게 광복절 포스팅을 시켰더니, 제헌절에서 틀렸습니다 (0) | 2026.08.15 |
| AI에게 블로그 운영을 통째로 맡겼습니다 1편 — 27일 뒤 구글 색인 0개, 클릭 0회 (0) | 2026.08.13 |