HBM4가 마지막 ‘대역폭 2배’ 세대일까? AI 추론의 새로운 병목

HBM4는 AI 가속기의 메모리 대역폭을 한 단계가 아니라 두 단계 가까이 끌어올리는 전환점입니다. 그러나 그 배경은 DRAM 클록의 단순 상승이 아닙니다. HBM3E까지 스택당 1,024비트였던 인터페이스가 HBM4에서 2,048비트로 확대되면서, 같은 핀 속도에서도 이론 대역폭이 두 배가 되는 구조적 변화가 일어났습니다. 문제는 그 다음입니다. HBM4E는 2,048 I/O를 유지한 채 핀 속도를 최대 16Gb/s 수준으로 올리는 방향이며, 아직 HBM5의 JEDEC 확정 규격은 없습니다. 따라서 HBM4가 ‘마지막 대역폭 증가’인 것은 아니지만, 현재 공개된 로드맵에서 인터페이스 폭의 2배 확대가 만든 마지막 대형 도약일 가능성은 충분히 검토할 가치가 있습니다.

Executive summary

  • 가설은 부분적으로 지지됩니다. HBM4는 스택당 인터페이스를 1,024비트에서 2,048비트로 두 배 늘렸고, NVIDIA B200의 최대 8TB/s에서 Rubin의 최대 22TB/s로 가는 약 2.75배 도약에서 가장 큰 구조적 기여를 합니다.
  • HBM4E는 같은 방식으로 2.75배 뛰기 어렵습니다. 2,048 I/O를 유지하고 16Gb/s로 올라가면 이론 대역폭은 스택당 4.096TB/s입니다. Rubin의 스택당 약 2.75TB/s와 비교하면 약 1.49배이며, 추가 상승은 스택 수·패키징·메모리 컨트롤러에 의존합니다.
  • AI GPU 성능 향상이 멈춘다는 뜻은 아닙니다. 다만 낮은 배치의 LLM decode처럼 메모리 대역폭에 민감한 작업에서는 대역폭 증가율이 더 중요한 제약이 될 수 있으며, 캐시·양자화·KV 캐시 최적화·speculative decoding·MoE·NVLink와 랙 스케일 설계의 가치가 커집니다.

HBM2에서 HBM4E까지: 무엇이 실제로 바뀌었나

HBM 대역폭은 대략 인터페이스 폭 × 핀당 전송률 × 스택 수로 분해할 수 있습니다. 아래 표의 스택당 이론 대역폭은 이 식으로 계산했으며, GPU의 실제 총 대역폭은 메모리 컨트롤러, 채널 구성, 사용 가능한 용량과 제품별 설정에 따라 달라질 수 있습니다.

세대 스택당 인터페이스 대표 핀 속도 스택당 대역폭 대표 용량·높이 도입 시기 NVIDIA 대표 제품 / 스택 수 / 총 대역폭
HBM2 1,024-bit 1.6–2.4Gb/s 205–307GB/s 4–8GB, 4H/8H 2016–2017 V100 / 4 / 최대 900GB/s
HBM2E 1,024-bit 3.2–3.6Gb/s 410–461GB/s 8–16GB, 주로 8H 2019–2021 A100 80GB / 5개 활성 스택 / 2.039TB/s
HBM3 1,024-bit 최대 6.4Gb/s 최대 819GB/s 16–24GB, 8H/12H 2021–2022 H100 SXM / 5 / 3.35TB/s
HBM3E 1,024-bit 약 8–9.6Gb/s 약 1.0–1.23TB/s 24–36GB, 8H/12H 2024 H200 / 6개 배치 / 4.8TB/s; B200 / 8개 배치 / 최대 8TB/s
HBM4 2,048-bit JEDEC 8Gb/s; 공급사 10–13Gb/s 2.048–3.328TB/s 24–48GB, 8H/12H/16H 2025 표준, 2026 양산 확대 Rubin / NVIDIA 로드맵상 8S / 최대 22TB/s
HBM4E 2,048 I/O 유지 최대 16Gb/s 이론상 최대 4.096TB/s 32–64GB, 8H/12H/16H 계획 2026 샘플, 2027 양산 목표 Rubin Ultra / 로드맵상 16S / 공식 GPU 대역폭 미공개
HBM5 미정 미정 미정 미정 공식 JEDEC 규격 없음 Feynman은 ‘차세대 HBM’만 공개; 수치 미공개
자료: JEDEC, NVIDIA, Samsung Electronics, SK hynix, Micron. H200·B200의 스택 수는 공개 패키지 구성과 용량에 따른 배치 기준이며, 제조사가 모든 제품 페이지에서 명시한 규격은 아닙니다.

NVIDIA 공식 자료에서 H100 SXM은 3.35TB/s, H200은 4.8TB/s, B200은 최대 8TB/s로 확인됩니다. NVIDIA는 Rubin GPU를 288GB HBM4와 최대 22TB/s로 설명합니다. 반면 Rubin Ultra와 Feynman의 GPU 메모리 대역폭은 공식 수치가 없습니다. 특히 ‘F200 30TB/s 이상’ 같은 숫자는 NVIDIA 공식 사양으로 확인되지 않으므로 투자 판단의 기준으로 사용하면 안 됩니다.

HBM4가 특별한 이유: 인터페이스 폭의 두 배 확대

HBM3와 HBM3E는 스택당 약 1,024비트 인터페이스를 사용합니다. JEDEC의 HBM4 표준은 이를 2,048비트로 확대했습니다. Samsung과 SK hynix도 HBM4에서 I/O 수가 1,024개에서 2,048개로 두 배가 됐다고 명시합니다. 이 변화는 핀 속도를 올리지 않아도 스택당 대역폭을 두 배로 만들 수 있습니다.

B200과 Rubin을 동일한 8개 스택 구성으로 단순화하면 8TB/s에서 22TB/s로의 상승을 다음처럼 분해할 수 있습니다.

요소 B200 / HBM3E Rubin / HBM4 대략적 기여
스택당 인터페이스 폭 1,024-bit 2,048-bit 2.0배
총 대역폭으로 역산한 핀 속도 약 7.81Gb/s 약 10.74Gb/s 약 1.38배
HBM 스택 수 8개 배치 8S 1.0배
합성 효과 최대 8TB/s 최대 22TB/s 약 2.75배
계산: 총 대역폭 ÷ 스택 수, 그리고 대역폭 = 폭 × 핀 속도 ÷ 8. 제품의 반올림된 ‘최대’ 수치에 기초한 설명용 분해입니다.

따라서 2.75배 상승을 DRAM 클록만으로 설명하는 것은 틀립니다. 가장 큰 기여는 2배가 된 폭이고, 핀 속도 상승이 나머지를 채웁니다. 이는 HBM4의 경제성도 바꿉니다. 폭이 두 배가 되면 메모리 컨트롤러와 PHY 면적, 마이크로 범프 수, 실리콘 인터포저 배선, 로직 베이스 다이의 복잡도까지 함께 증가하기 때문입니다.

HBM4E부터 무엇이 달라지는가

현재 공개된 Samsung과 SK hynix 자료에서 HBM4E는 2,048 I/O를 다시 4,096으로 늘리지 않습니다. 대신 최대 16Gb/s의 핀 속도로 약 4TB/s를 목표로 합니다.

2,048bit × 16Gb/s ÷ 8 = 4.096TB/s입니다. Rubin의 공식 22TB/s와 8개 스택을 기준으로 한 스택당 실효 대역폭은 약 2.75TB/s입니다. 같은 8스택에서 HBM4E 최대 속도를 모두 구현하면 이론 합계는 약 32.8TB/s, 즉 Rubin 대비 약 1.49배입니다. 높은 증가율이지만 B200에서 Rubin으로 갈 때의 2.75배와는 다릅니다.

NVIDIA의 2025년 로드맵은 Rubin Ultra에 ‘16S HBM4E’를 표시합니다. 스택 수가 두 배라면 패키지 또는 시스템 총 대역폭은 크게 늘 수 있습니다. 그러나 이것은 스택당 인터페이스 폭 확대가 아니라 더 많은 메모리 스택과 더 큰 패키징 예산에 의한 확장입니다. NVIDIA가 Rubin Ultra의 공식 메모리 대역폭을 공개하지 않았기 때문에 30TB/s나 60TB/s 같은 수치를 제품 사양으로 단정할 수 없습니다.

먼저 바로잡을 점: 12단·16단은 대역폭보다 용량 레버다

HBM 스택을 8단에서 12단·16단으로 높이는 것은 기본적으로 용량을 늘리는 방법입니다. 스택 하나의 피크 대역폭은 외부 인터페이스 폭과 핀 속도로 정해집니다. DRAM 다이를 더 쌓아도 같은 채널과 외부 I/O를 공유하므로, 뱅크 병렬성과 스케줄링 여지가 늘어 실효 대역폭이 일부 개선될 수는 있어도 명목 피크 대역폭이 높이만큼 증가하지는 않습니다.

따라서 HBM4 이후의 질문은 ‘얼마나 높게 쌓는가’보다 아래 네 가지 레버 중 무엇이 실제로 확장 가능한가로 바뀌어야 합니다.

레버 대역폭 효과 핵심 제약 HBM5 전후의 가능성
핀 속도 상승: 16→20Gb/s 이상 스택당 선형 증가 전력/bit, 신호 무결성, 발열 점진적 향상은 가능하지만 에너지 비용이 커짐
패키지당 스택 수 증가: 8→12→16 GPU·시스템 총량 기준 선형 증가 인터포저 크기, CoWoS급 용량, 수율, 비용, 냉각 Rubin Ultra 로드맵의 16S가 대표 방향이나 공식 대역폭은 미공개
인터페이스 폭 확대: 2,048→4,096 같은 핀 속도에서 스택당 2배 GPU PHY 면적과 shoreline, 범프·TSV 수, 라우팅, 베이스 다이 KAIST 장기 로드맵의 연구 시나리오이며 JEDEC 확정 사항은 아님
HBM-on-logic 등 3D 직접 적층 이론적으로 매우 큰 내부 대역폭 열, 수율, 전력 공급, 공동 설계 HBM5 이후의 장기 방향; 양산 규격·일정은 미확정

HBM5에서 폭 확대가 다시 시작될 수 있는가

물리적으로는 ‘넓고 느린’ 링크가 ‘좁고 빠른’ 링크보다 전력/bit 측면에서 유리합니다. 데이터센터의 제약이 전력과 냉각으로 이동할수록 핀 속도를 20Gb/s 이상으로 계속 밀어붙이는 것은 대역폭을 늘리는 비싼 방법이 됩니다. HBM이 GDDR보다 넓고 상대적으로 느린 인터페이스를 택한 이유도 같습니다. 이 논리만 보면 HBM5에서 폭을 다시 늘리는 시나리오는 충분히 합리적입니다.

문제는 호스트 GPU의 PHY 면적과 die-edge ‘shoreline’입니다. HBM4부터 로직 베이스 다이를 선단 로직 공정에서 만들고 고객별로 커스터마이즈할 수 있게 되면서, 메모리 컨트롤러 일부를 베이스 다이로 옮기고 GPU와는 UCIe 또는 다른 die-to-die 링크로 연결하는 설계가 논의되고 있습니다. 이렇게 하면 DRAM 스택 내부의 넓은 TSV 인터페이스와 GPU 쪽 외부 PHY를 분리해 GPU 다이의 패드·드라이버 면적을 줄일 수 있습니다. 다만 이는 커스텀 HBM의 설계 방향이지, HBM5가 4,096-bit 또는 UCIe를 채택했다는 공식 발표가 아닙니다.

하이브리드 본딩도 그 자체로 외부 대역폭을 늘리지는 않습니다. 범프가 없는 미세 피치는 더 많은 TSV·I/O와 고단 적층을 가능하게 하고 열 저항과 신호 경로를 줄여, 넓은 인터페이스를 구현하기 쉬워지는 수단입니다. 반면 JEDEC의 HBM4 패키지 높이가 12단과 16단에서 775μm로 완화되면서 기존 TC 본딩으로 대응할 시간도 늘었습니다. 업계 조사에서는 하이브리드 본딩의 본격 채택 시점이 HBM4E 16단 또는 HBM5 20단으로 이동할 수 있다고 봅니다. 즉 방향은 살아 있지만 시점과 적용 범위는 아직 공급사별로 다릅니다.

KAIST TERA Lab의 장기 연구 로드맵은 HBM5를 4,096 I/O·약 8Gb/s·스택당 약 4TB/s로, HBM6를 같은 폭에 16Gb/s로, HBM7을 8,192 I/O로 가정합니다. 이는 HBM5에서 폭 확대가 기술적으로 진지하게 검토되고 있음을 보여주는 학술 시나리오입니다. 그러나 JEDEC 규격이나 메모리 공급사의 확정 제품 사양은 아닙니다. 따라서 ‘HBM4가 영원히 마지막 폭 2배 세대’라고 단정하는 것도, ‘HBM5는 4,096-bit가 가장 유력하다’고 확정하는 것도 모두 현재 증거보다 앞서갑니다.

투자자에게 중요한 두 갈래

폭 확대 경로가 현실화되면 로직 베이스 다이 파운드리, 커스텀 HBM IP와 설계 서비스, 하이브리드 본딩 장비, 대형 인터포저·CoWoS급 패키징 용량에 가치가 집중될 가능성이 큽니다. TSMC는 외부 고객의 베이스 다이와 가속기를 함께 수주할 수 있고, Samsung은 메모리·파운드리·패키징의 수직계열화가 옵션 가치를 가집니다. 반면 범프 기반 TC 본딩 장비에는 장기적인 대체 리스크가 생깁니다.

폭 확대가 늦어지면 더 많은 HBM 스택, 더 큰 인터포저, 높은 핀 속도와 강화된 냉각이 총대역폭을 방어하는 핵심 수단이 됩니다. 이 경우 패키징·기판·전력 공급·액체 냉각의 레버리지가 더 커집니다. 두 경로의 공통 분모는 첨단 패키징이므로, HBM5 인터페이스 예측 하나보다 패키지 면적·수율·전력/bit의 추이를 함께 보는 것이 더 실용적입니다.

HBM5에서도 대역폭 두 배가 가능한가

2026년 10월 현재 확인되는 공개 정보는 세 층으로 나눠야 합니다.

  1. JEDEC 확정 규격: HBM4 JESD270-4는 존재하지만, HBM5의 확정 JEDEC 규격은 확인되지 않습니다.
  2. 메모리 공급사 로드맵: Samsung은 FMS 2026에서 HBM5 방향을 제시했지만 인터페이스 폭·핀 속도·대역폭을 표준 사양으로 확정하지 않았습니다. SK hynix는 HBM5까지의 냉각과 하이브리드 본딩 필요성을 논의하지만 제품 규격을 발표한 것은 아닙니다.
  3. NVIDIA 로드맵: Feynman에 ‘Next-Gen HBM’이 표기됐을 뿐, HBM5 명칭·4,096비트 인터페이스·GPU 대역폭은 공식 발표되지 않았습니다.

따라서 HBM5가 4,096비트 인터페이스를 쓴다는 주장은 현재로서는 분석가 또는 업계 추정일 뿐입니다. HBM4가 영원히 마지막 폭 확대 세대라고 결론 내릴 수도 없지만, 다음 2배 확대를 기본 시나리오로 놓을 공식 근거도 없습니다.

높이가 아니라 네 가지 대역폭 레버를 봐야 합니다

12단·16단으로 스택 높이를 올리는 것은 우선 용량을 늘리는 방법이지, 스택당 피크 대역폭을 직접 늘리는 방법은 아닙니다. 스택 하나의 이론 대역폭은 기본적으로 인터페이스 폭과 핀 속도의 곱으로 정해집니다. 다이를 더 쌓아도 기존 채널을 공유하므로 피크 대역폭은 그대로입니다. 뱅크 병렬성과 스케줄링이 개선돼 실효 대역폭이 다소 높아질 수는 있지만, 이를 인터페이스 폭 확대와 같은 구조적 대역폭 증가로 보면 안 됩니다.

레버 대역폭 효과 핵심 제약 HBM5 시점에 대한 근거 수준
핀 속도 상승(16→20Gb/s 이상) 속도에 비례 전력/bit, 신호 무결성, 발열 점진적 상승은 공급사 로드맵과 부합하지만 효율 비용이 큼
패키지당 스택 수 증가(8→12→16) GPU·시스템 총량에 비례 인터포저 크기, CoWoS-L급 용량, 수율, 비용, 냉각 NVIDIA의 Rubin Ultra 16S는 공식 로드맵이지만 공식 총 대역폭은 미공개
인터페이스 폭 확대(2,048→4,096 I/O) 같은 핀 속도에서 최대 2배 GPU 측 PHY shoreline, 범프 피치, TSV·배선 밀도, 공동 설계 KAIST 학계 로드맵과 산업 추정의 후보이며 JEDEC·공급사 확정 규격은 아님
메모리와 로직의 3D 직접 적층 이론상 매우 큼 열, 누적 수율, 테스트, 공동 설계 장기 연구 경로이며 HBM5 공식 일정으로 확인되지 않음
스택 높이는 용량 레버, 스택 수는 패키지·시스템 대역폭 레버입니다. HBM5 열은 확정 제품 사양이 아니라 공개 근거의 수준을 표시합니다.

4,096 I/O는 가능한 HBM5 시나리오이지 확정 규격이 아닙니다

전력 제약만 놓고 보면 ‘좁고 빠른’ 링크보다 ‘넓고 느린’ 링크가 일반적으로 전송 에너지와 신호 무결성 측면에서 유리합니다. HBM이 GDDR보다 넓고 상대적으로 느린 인터페이스를 채택한 이유도 여기에 있습니다. 따라서 4,096 I/O와 완만한 핀 속도의 조합은 검토할 가치가 있는 HBM5 시나리오입니다. 그러나 2026년 10월 현재 HBM5의 JEDEC 확정 규격은 없고, Samsung·SK hynix·Micron도 4,096 I/O를 제품 규격으로 확정 발표하지 않았습니다.

커스텀 로직 베이스 다이는 이 시나리오의 핵심 수단이 될 수 있습니다. HBM4에서 베이스 다이가 로직 파운드리 공정과 고객 맞춤 설계로 이동하면서, 일부 메모리 컨트롤 또는 인터페이스 기능을 베이스 다이에 배치할 여지가 커졌습니다. DRAM 내부 연결은 넓게 유지하고 GPU와의 연결은 고밀도 die-to-die 링크로 집약하면 GPU 가장자리의 PHY 면적 부담을 줄일 수 있다는 설계 가설이 나옵니다. 다만 4,096비트 DRAM 측 연결과 UCIe류 GPU 링크를 결합한 HBM5 구조는 공개된 JEDEC 사양이나 공급사 제품 아키텍처가 아니라 산업적 추론입니다. TSMC N12/N3급 옵션이나 Samsung의 수직계열화 이점도 개별 고객 프로그램과 공급사 로드맵의 영역이지 HBM5 표준이 아닙니다.

SK hynix의 하이브리드 본딩 기술 노트는 미세 피치, 연결 밀도, 전력, 열 저항의 이점을 설명합니다. 하이브리드 본딩 자체가 대역폭을 자동으로 늘리는 것은 아니지만 더 촘촘한 I/O와 높은 적층을 가능하게 하는 기반 기술입니다. JEDEC이 HBM4 패키지 높이를 720μm에서 775μm로 완화해 기존 본딩을 HBM4까지 연장할 여지가 생겼다는 공급사 설명도 있으므로, 실제 채택 시점은 HBM4E 고단 제품이나 HBM5 이후로 늦어질 수 있습니다.

KAIST TERA 로드맵은 학계 전망입니다

KAIST TERA Lab의 장기 로드맵과 2025년 공개된 워크숍 자료는 HBM5를 4,096 I/O, 약 8Gb/s, 스택당 약 4TB/s로 가정하고 이후 세대에서 데이터 속도와 폭을 다시 높이는 경로를 제시합니다. 이 자료는 연구실이 제안한 기술 로드맵이며 JEDEC 표준, 메모리 공급사의 양산 약속, 또는 NVIDIA 제품 사양이 아닙니다. 그럼에도 ‘폭 확대가 다시 일어날 수 있다’는 학계의 구체적 반례이므로 HBM4가 마지막 폭 확대라는 가설을 확정적으로 받아들이기 어렵게 만듭니다.

근거를 네 층으로 분리하면 판단이 선명해집니다. 공식 규격은 HBM4의 2,048 I/O까지만 확인됩니다. 공급사·고객 로드맵은 HBM4E의 속도 상승, Rubin Ultra의 16S, 차세대 본딩과 베이스 다이 방향을 보여주지만 HBM5 4,096 I/O를 확정하지 않습니다. 학계 로드맵은 KAIST TERA의 4,096 I/O 시나리오입니다. 산업 추론은 커스텀 베이스 다이와 고밀도 die-to-die 링크로 GPU PHY 부담을 분리할 수 있다는 가설입니다.

리스크와 투자 시사점

가장 큰 리스크는 4,096 I/O가 범용 메모리를 고객별 공동 설계 제품으로 바꿀 수 있다는 점입니다. 베이스 다이 설계, 검증, 수율 학습과 고객 인증 비용이 커지고, GPU·파운드리·메모리 업체 중 어느 한 곳의 일정이 늦어져도 전체 도입이 밀릴 수 있습니다. 이 경로가 지연되면 핀 속도와 패키지당 스택 수로 총 대역폭을 방어하는 기간이 길어질 것입니다.

폭 확대가 현실화되면 가치 포인트는 로직 베이스 다이 파운드리, 고객 맞춤 설계, 하이브리드 본딩 장비, 미세 피치 계측·검사로 이동합니다. TSMC는 외부 베이스 다이 파운드리의 후보이고 Samsung은 메모리와 파운드리를 함께 보유한 옵션이지만, 실제 점유율은 고객별 수율과 인증으로 결정됩니다. 하이브리드 본딩 장비업체에는 기회가 커지는 반면 TC 본더 중심 공급망에는 장기 대체 위험이 생깁니다. 폭 확대가 늦어지면 더 많은 스택과 더 큰 패키지가 필요하므로 대형 인터포저, CoWoS-L급 패키징 용량, 기판, 전력 공급과 냉각의 레버리지가 더 커집니다. 두 경로의 공통 수혜 축은 첨단 패키징이지만, 수율·CAPEX·고객 집중도는 함께 봐야 합니다.

업데이트된 판단: HBM4는 현재 공식적으로 확인된 마지막 인터페이스 폭 2배 세대이지만, 마지막이 될 것이라고 단정하기에는 이릅니다. HBM4E 구간에서는 2,048 I/O를 유지한 속도·스택 수 확대가 기본 경로입니다. 그 이후 HBM5의 4,096 I/O는 표준이 아니라 학계 로드맵과 산업 설계 가설에 근거한 상방 시나리오입니다. 따라서 원문의 가설은 유용한 기준점이지만, KAIST 로드맵과 커스텀 베이스 다이의 가능성을 반영하면 다소 보수적인 쪽으로 조정해야 합니다.

왜 인터페이스 폭을 계속 두 배로 늘리기 어려운가

  • PHY와 컨트롤러 면적: 2,048개의 신호를 구동하는 PHY와 메모리 컨트롤러는 GPU 다이의 주변부와 로직 면적을 더 많이 차지합니다.
  • 범프와 인터포저 배선: I/O 수 증가에는 더 촘촘한 마이크로 범프와 더 많은 인터포저 라우팅 채널이 필요합니다. 채널 간 간섭과 전력 무결성 관리도 어려워집니다.
  • 패키지 크기와 수율: 스택 수와 배선층을 늘리면 패키지가 커지고, 인터포저·기판·조립 단계의 비용과 수율 리스크가 상승합니다.
  • 전력과 열: 더 많은 I/O와 더 높은 핀 속도는 데이터 이동 에너지를 늘립니다. Samsung은 HBM4의 2배 I/O가 전력·열 과제를 만든다고 명시했고, 공급사들은 로직 베이스 다이와 하이브리드 본딩·냉각을 대응책으로 제시합니다.
  • 신호 무결성: 핀 속도가 오를수록 손실·반사·크로스토크에 대한 마진이 줄어듭니다. 폭과 속도를 동시에 늘리는 것은 검증 난도를 곱셈으로 키웁니다.
  • 로직 베이스 다이 복잡도: HBM4부터 고객 맞춤형 로직과 메모리 컨트롤 기능의 비중이 커지며, 메모리 공급사·파운드리·GPU 설계사의 공동 최적화가 필수적입니다.

대역폭 성장률의 세 가지 시나리오

시나리오 기술 경로 예상되는 대역폭 곡선 핵심 관찰 지표
Bull 고밀도 하이브리드 본딩, 대형 2.5D/3D 패키지, 새로운 직렬화 인터페이스, 더 많은 스택 세대당 큰 폭의 증가 지속 HBM4E 16Gb/s 수율, 16스택 패키지, 신규 JEDEC 인터페이스
Base 2,048 I/O 유지, 핀 속도와 스택 수·컨트롤러 효율 개선 스택당 증가는 점진적, 시스템 총량은 패키징으로 보완 12–16Gb/s 양산, CoWoS급 용량, 전력/bit
Bear 열·전력·신호 무결성·수율 제약으로 핀 속도 상승도 둔화 대역폭이 연산 성능보다 느리게 증가 속도 하향 binning, 냉각 비용, 패키지 수율, 공급 지연

현재의 기본 시나리오는 두 번째에 가깝습니다. HBM4E가 폭을 유지하고 속도를 올리는 방향이기 때문입니다. 그러나 하이브리드 본딩과 새로운 인터페이스 구조가 성공하면 장기적으로 다시 큰 폭의 증가가 가능하므로 ‘메모리 벽’을 고정된 한계로 볼 필요는 없습니다.

AI inference에 미치는 영향: prefill과 decode를 구분해야 한다

‘AI 추론은 대역폭에 달려 있다’는 문장은 절반만 맞습니다. LLM 추론은 크게 prefill과 decode로 나뉩니다. Prefill은 입력 토큰을 병렬 처리해 KV 캐시를 만들기 때문에 대체로 연산 집약적입니다. Decode는 한 번에 다음 토큰을 생성하면서 모델 가중치와 KV 캐시를 반복해서 읽기 때문에, 특히 낮은 배치에서는 메모리 대역폭이 병목이 되기 쉽습니다. NVIDIA도 Rubin 설명에서 generation/decode 단계를 메모리 서브시스템에 근본적으로 제약받는다고 표현합니다.

그러나 모든 decode가 항상 같은 방식으로 병목이 되는 것은 아닙니다. 배치가 커지면 같은 가중치를 여러 요청에 재사용해 산술 집약도가 높아지고 Tensor Core 활용률이 중요해집니다. 긴 문맥은 KV 캐시 용량과 대역폭을 늘리지만, 캐시 적중률과 paged attention 구현에 따라 효과가 달라집니다. MoE는 매 토큰에 활성화되는 파라미터를 줄이지만 전문가 라우팅과 GPU 간 통신을 추가합니다. 양자화는 가중치와 KV 캐시의 이동량을 줄이는 대신 정확도·커널 효율과의 교환이 필요합니다. 멀티 GPU에서는 NVLink·네트워크 토폴로지·collective 효율이 HBM 대역폭만큼 중요할 수 있습니다.

GPU 아키텍처는 어떻게 대응하는가

메모리 대역폭 증가가 점진적으로 바뀌더라도 유효 추론 성능은 여러 층에서 개선될 수 있습니다.

  • 더 큰 온칩 캐시와 가중치·KV 데이터의 지역성 개선
  • FP8·FP4·저정밀 KV 캐시를 통한 이동 바이트 감소
  • speculative decoding과 연속 배칭으로 토큰당 메모리 접근 효율 향상
  • MoE로 토큰당 활성 파라미터 수 축소
  • NVLink와 랙 스케일 패브릭으로 여러 GPU의 메모리·연산을 결합
  • SRAM 비중이 큰 추론 전용 가속기와 고객 맞춤형 ASIC
  • 고용량 캐시형 메모리, CXL 계층, 새로운 3D 메모리 구조

반도체 투자 시사점

첫째, HBM4의 가치 증가는 DRAM 다이만의 이야기가 아닙니다. 2,048 I/O, 로직 베이스 다이, 하이브리드 본딩, 실리콘 인터포저, 첨단 기판, 테스트와 열 관리가 함께 필요합니다. 메모리 3사의 경쟁력은 핀 속도뿐 아니라 GPU 고객과의 공동 설계, 베이스 다이 파운드리, 패키징 수율에서 갈릴 수 있습니다.

둘째, 스택당 대역폭의 증가율이 낮아지면 스택 수와 패키지 면적이 시스템 성능을 방어하는 수단이 됩니다. 이는 CoWoS급 첨단 패키징 용량, 인터포저와 기판, 전력 공급과 액체 냉각의 경제적 가치를 높입니다. 반대로 패키지 수율과 전력 한계가 출하량을 제한하면 HBM의 높은 평균판매가격만으로 GPU 시스템의 총소유비용 문제를 해결하기 어렵습니다.

셋째, 투자자는 ‘TB/s’만 보지 말고 토큰당 이동 바이트, 메모리 용량, 전력/bit, 소프트웨어 최적화와 랙 수준 이용률을 함께 봐야 합니다. HBM 대역폭이 제약이 될수록 NVIDIA의 NVLink·Dynamo·TensorRT-LLM 같은 소프트웨어 및 시스템 통합의 방어력이 커질 수 있고, 동시에 메모리 효율이 높은 맞춤형 가속기와 SRAM 중심 설계에도 기회가 열립니다.

Conclusion

HBM4는 현재 공식적으로 확인된 마지막 인터페이스 폭 2배 세대이지만, 마지막 대형 도약이라고 단정하기에는 이릅니다. HBM4의 2,048비트 전환이 B200에서 Rubin으로의 8TB/s→22TB/s 상승을 설명하는 핵심 구조적 요인인 것은 분명합니다. HBM4E는 같은 폭에서 핀 속도를 올리므로 스택당 성장률은 더 점진적으로 바뀔 가능성이 큽니다. 그러나 HBM5 규격은 아직 확정되지 않았고, 더 많은 스택·새로운 패키징·직렬화 인터페이스·캐시와 소프트웨어가 시스템 대역폭과 유효 추론 성능을 계속 높일 수 있습니다. 결론은 ‘GPU 성능 향상의 종말’이 아니라, 메모리 대역폭 확장이 향후 AI 추론 성능과 경제성을 좌우하는 더 중요한 제약 조건이 될 수 있다는 것입니다.

Sources

  1. NVIDIA, HGX H100/H200/B200 Components
  2. NVIDIA, HGX Platform and Rubin specifications
  3. NVIDIA, Inside Rubin GPU Architecture
  4. NVIDIA, Inside the Rubin Platform
  5. NVIDIA, GTC 2025 roadmap highlights
  6. NVIDIA, Tesla V100
  7. NVIDIA, HGX A100 80GB
  8. NVIDIA, Hopper Architecture In-Depth
  9. NVIDIA, Dynamo and inference phases
  10. NVIDIA, NVFP4 KV Cache
  11. JEDEC, JESD270-4 HBM4 standard
  12. Samsung Electronics, HBM product portfolio
  13. Samsung Electronics, HBM4E at GTC 2026
  14. Samsung Electronics, commercial HBM4 shipment
  15. SK hynix, HBM2 and HBM2E specifications
  16. SK hynix, HBM4 and HBM4E specifications
  17. SK hynix, hybrid bonding and future HBM
  18. Micron, HBM4 product page
  19. Samsung Electronics, FMS 2026 HBM5 roadmap
  20. KAIST TERA Lab, HBM milestone and long-term roadmap
  21. Semiconductor Engineering, custom HBM base-die and die-to-die interfaces
  22. TrendForce, HBM4 package height and hybrid-bonding timing
  23. TrendForce, hybrid bonding for high-stack-count future HBM

이 글은 공개된 기술 사양과 로드맵을 바탕으로 한 산업 분석이며 특정 증권의 매수·매도 권유가 아닙니다.

댓글 남기기