2026년 1월부터 8월까지 나온 자료와 마이크론의 2026년 7월 발언이 다시 회자돼서 정리해 봅니다. “데이터 없이는 AI도 없다”는 말이 실제 AI 서버에서 어떤 의미인지 살펴보겠습니다.
GPU를 깨우는 HBM 데이터 통로
1. 2025년 4월 정해진 HBM4 표준은 최대 대역폭 2,048GB/s와 최대 용량 64GB를 제시했음.
2. HBM은 여러 개의 DRAM을 수직으로 쌓아 좁은 공간에서 데이터를 빠르게 전달하는 메모리임.
3. HBM은 DDR4나 GDDR5보다 높은 대역폭을 더 낮은 전력과 작은 크기로 구현하는 구조임.
4. 2026년 1월 자료는 GPU가 빠르게 계산해도 데이터가 늦게 도착하면 연산 장치가 대기하게 된다고 설명함.
5. 식당에 요리사가 많아도 재료를 나르는 통로가 좁으면 음식이 늦게 나오는 것과 같은 원리임.
6. HBM은 GPU의 계산 능력을 높이는 부품이 아니라 GPU가 쉬지 않도록 데이터를 공급하는 넓은 통로임.
7. 거대 언어모델 추론에서는 모델 가중치와 중간 계산값, KV-Cache가 HBM 위에서 작동함.
8. 여기서 병목이 생김.
추론을 막는 세 가지 메모리 병목
9. 추론은 질문을 한꺼번에 읽는 프리필과 답변을 한 토큰씩 만드는 디코드로 나뉨.
10. 프리필은 계산량이 많은 반면 디코드는 매 단계마다 가중치와 KV-Cache를 다시 읽어야 함.
11. KV-Cache는 이미 계산한 대화 정보를 HBM에 보관했다가 다시 쓰는 임시 메모장임.
12. 대화가 길어지고 추론이 깊어질수록 이 메모장이 기하급수적으로 커져 HBM 부담이 늘어남.
13. 여기서 문제가 보임.
14. 2026년 1월 자료는 추론 병목을 메모리 대역폭, 메모리 용량, 통신 지연의 3가지로 분류함.
15. 단일 GPU에 모델과 KV-Cache가 들어가지 않으면 여러 GPU나 서버에 나눠 담아야 함.
16. 여러 서버가 중간 결과를 합치는 과정에서는 인터커넥트라는 연결 통로의 지연이 추가됨.
17. 병목이 하나 더 늘어남.
HBM 부담을 나누는 차세대 해법
18. 메모리 용량 대안으로 제시된 HBF는 HBM 수준의 대역폭을 유지하면서 용량을 10배 가까이 늘리는 방향임.
19. 빠른 KV-Cache는 HBM에 두고 큰 모델 가중치는 HBF에 두는 역할 분담이 제시됨.
20. 엔비디아가 CES 2026에서 공개한 ICMS는 GPU 외부 SSD를 HBM의 연장선처럼 활용하는 방식임.
21. 엔비디아는 차세대 Vera Rubin부터 ICMS를 적극 도입하겠다고 밝힘.
22. HBF와 ICMS는 비싸고 작은 HBM에 모든 짐을 싣지 않고 NAND나 SSD로 부담을 나누려는 접근임.
23. 2026년 2월 자료도 LLM 추론의 주요 과제가 계산보다 메모리와 서버 연결에 있다고 설명함.
24. 일부 자료에서는 GPU 연산 장치가 데이터 도착을 기다리며 절반이 넘는 시간을 쉰다고 제시함.
25. 비싼 GPU가 놀고 있는 셈임.
26. RTX 4060 8GB 사례의 디코드 연산 활용률은 전체 계산 능력의 5% 미만으로 제시됨.
27. A100 80GB도 디코드에 필요한 데이터 공급 능력이 계산 능력보다 50~100배 부족한 사례가 제시됨.
28. PIM은 데이터를 GPU로 계속 옮기지 않고 데이터가 저장된 메모리 안에서 일부 계산까지 처리하는 방식임.
29. PIM은 디코드에 강점이 있지만 학습과 프리필은 여전히 GPU가 맡는 구조임.
30. SK하이닉스 AiM과 삼성 PIM은 전용 개발 도구를 쓰며 CUDA처럼 통일된 프로그래밍 환경은 아직 없음.
AI 서버를 완성하는 메모리 생태계
31. 2026년 3월 마이크론은 “데이터 없이는 AI도 없다”는 문구를 내걸었음.
32. 원시 데이터가 실제 지능으로 바뀌려면 클라우드부터 엣지까지 메모리와 저장장치가 필요하다는 주장임.
33. 판이 달라지기 시작함.
34. 2026년 5월 자료는 AI 가속기에 HBM이 필요하고 추론 서버에는 일반 DRAM도 필요하다고 설명함.
35. 벡터 데이터베이스와 모델 체크포인트, 검색 시스템은 플래시 메모리까지 소비함.
36. AI 메모리 떡밥이 HBM 하나로 끝나지 않는 이유임.
37. 2026년 6월 자료는 계산 장치와 메모리, 서버 연결, 전력, 냉각이 함께 맞물려야 AI 서버가 된다고 설명함.
38. HBM 칩이 있어도 GPU와 패키징하고 서버 보드에 올린 뒤 안정적으로 냉각하지 못하면 사용할 수 없음.
39. 긴 문서와 여러 도구 호출, 긴 대화 이력을 다루는 서비스일수록 저장하고 다시 읽을 정보가 많아짐.
40. 데이터가 늦으면 사용자는 답변 지연을 느끼고 운영자는 GPU 사용률 저하와 비용 상승을 겪음.
41. 해결책도 HBM 증설만이 아니라 모델 압축과 캐시 관리, 배치 처리, 작은 모델과 큰 모델의 역할 분리가 필요함.
42. 용량과 속도를 같이 봐야 함.
추론 시대가 키우는 메모리 수요
43. 2026년 7월 마이크론은 시스템 성능이 계산량보다 데이터 이동과 지연시간, 대역폭에 더 좌우되고 있다고 설명함.
44. 2023년에는 AI 컴퓨트 지출의 약 3분의 2가 학습이었지만 2026년 말에는 추론이 3분의 2를 차지할 것으로 전망함.
45. 학습 워크로드 성장률은 25%, 추론의 연평균 성장률은 79%로 제시됨.
46. 2026년 말까지 기업 애플리케이션의 40%가 AI 에이전트를 내장할 것이라는 전망도 제시됨.
47. AI 에이전트는 연속 실행과 다단계 작업을 위해 100만 토큰이 넘는 문맥과 지속적인 KV-Cache를 요구함.
48. 수요가 한곳에 몰림.
49. 마이크론 CEO 산제이 메흐로트라는 “메모리는 AI에 필수”이며 더 많은 메모리가 정확도와 속도, 지능을 높인다고 말했음.
50. 2026년 7월 데이터센터는 메모리 수요의 50% 이상을 차지하며 메모리가 심각한 부족 상태라는 설명도 나왔음.
51. 마이크론은 미국에 2,500억달러(약 347조7,500억원)를 투자해 장기적으로 미국 DRAM의 40%를 생산한다는 목표를 제시했음.
52. 완전 자율주행차는 많은 메모리와 저장장치를 싣는 “바퀴 달린 데이터센터”로 표현됨.
53. 2026년 8월 자료는 SK하이닉스 HBM4의 대역폭이 이전 세대보다 2배, 전력 효율은 40% 개선됐다고 설명함.
54. HBM4 양산 시점은 2026년 2월이라는 자료와 8월 당시 양산 준비 단계라는 자료가 함께 있어 자료별로 차이가 있음.
55. HBM4 표준의 핀당 8Gb/s와 HBM4E 샘플의 핀당 16Gbps는 서로 다른 세대와 제품 설명이라 구분해야 함.
한줄 코멘트. AI 성능 경쟁은 GPU를 몇 개 사느냐에서 데이터를 얼마나 빠르고 싸게 먹여주느냐로 이동하는 모습임. HBM은 분명한 해자지만 세대가 바뀔 때마다 제품 우위를 다시 증명해야 하는 움직이는 해자임. HBM뿐 아니라 일반 DRAM과 NAND, 패키징, 서버 연결, 냉각과 소프트웨어 최적화까지 함께 지켜볼 필요가 있음.
참고한 자료
- LinkedIn · Sanjay Mehrotra on AI's Dependence on Data | Micron Technology posted on the topic
- X (formerly Twitter) · Micron Technology on X: "“Without data, there is no AI.” As Micron Chairman, President and CEO Sanjay Mehrotra shares, AI’s future depends on the ability to move, store, and access data at incredible scale — and that’s exactly where Micron delivers. From cloud to edge, our memory and storage innovations" / X 2026-03-26
- Fox Business · Micron CEO details $250 billion US investment amid chip, memory shortage
- micron.com · How memory and storage became the backbone of the AI era
- DEV Community · If Memory Could Compute, Would We Still Need GPUs?
- en.wikipedia.org · High Bandwidth Memory
- DEV Community · Memory Is the Bottleneck, but Not Forever
- MEXC · SK hynix Stock Analysis: HBM3E, HBM4, AI Servers and Memory Opportunities
- QSike Tech Notes · HBM이 AI 서버에서 중요한 이유: GPU만으로는 설명되지 않는 병목 2026-06-27
- openads.co.kr · 구글, 엔비디아, 딥시크의 최신 동향: HBM을 넘어서
댓글