HBM의 시대가 끝난다? 2026 SK하이닉스 ‘CPO 광학 인터커넥트’가 바꿀 AI 반도체 미래 7가지

AI 뉴스를 보다 보면 ‘HBM’은 익숙한데, 요즘 부쩍 등장하는 CPO 광학 인터커넥트는 대체 뭔지 헷갈리셨죠? 메모리를 GPU 옆에 딱 붙이던 방식이 왜 바뀌려 하는지, 어렵지 않게 풀어 드리겠습니다.


SK하이닉스가 ‘메모리 회사’인데 왜 CPU를 연구했을까요?

2026년 8월, SK하이닉스 연구진이 참여한 논문 한 편이 국제 학술지 네이처 일렉트로닉스(Nature Electronics)에 실렸습니다. 제목은 “고성능 컴퓨팅과 AI를 위한 코패키지드 옵틱스(Co-packaged optics)”였습니다.

핵심은 CPO 광학 인터커넥트입니다. 반도체 바로 옆에 광통신 장치를 붙여서, 칩과 칩 사이의 데이터를 전선(구리) 대신 ‘빛’으로 주고받는 기술입니다.

  • 논문 성격: 신제품 발표가 아니라 로드맵을 정리한 리뷰 논문
  • 참여 기관: SK하이닉스 + 버지니아대(UVA), 일리노이대(UIUC), MIT, 난양공대(NTU), 연세대
  • 눈여겨볼 구조: GPU 같은 연산 장치 ‘풀’과 메모리 ‘풀’을 따로 두고, 그 사이를 광학으로 연결

메모리 1위 기업이 시스템 전체의 데이터 이동을 고민하기 시작했다는 점에서, 이 논문은 단순한 학술 발표 이상의 의미를 갖습니다.

💡 여기서 잠깐: HBM이 뭔지 헷갈리신다면 아래 기초 가이드를 먼저 보고 오시면 이해가 훨씬 쉽습니다. HBM이란? AI 반도체 초보 가이드

HBM은 어쩌다 GPU ‘바로 옆’에 붙게 됐을까요?

GPU 성능이 빠르게 올라가면서, 한동안 발목을 잡은 건 연산 속도가 아니라 메모리 대역폭이었습니다. 연산기가 아무리 많아도 데이터를 제때 못 받으면 그냥 기다리게 되니까요.

기존 메모리처럼 신호선 몇 개의 속도만 계속 높이는 데는 한계가 있습니다. 속도가 빨라질수록 전력과 신호 왜곡 문제가 커지기 때문입니다. 그래서 나온 해법이 바로 HBM(고대역폭 메모리)이었습니다.

HBM의 접근은 이렇게 요약됩니다.

  • 거리를 줄인다: DRAM을 GPU 코앞(몇 mm)에 배치
  • 차선을 넓힌다: 신호선 하나를 빠르게 하는 대신 수천 개를 병렬로 사용
  • 위로 쌓는다: DRAM 다이를 TSV로 수직 적층해 면적 효율 확보

이 ‘넓은 차선’ 전략은 세대를 거듭하며 강화됐습니다. HBM3의 데이터 IO가 1,024개였다면, HBM4는 2,048개로 두 배가 됐습니다. 고속도로에 차선을 수천 개 깔아 차가 한꺼번에 지나가게 만든 셈입니다.

진짜 문제는 ‘GPU 주변 공간’입니다 — 쇼어라인의 한계

HBM 방식은 지금도 잘 작동합니다. HBM4는 스택 하나가 2TB/s를 훌쩍 넘고, SK하이닉스의 차세대 HBM4E는 스택당 약 4TB/s를 겨냥하고 있습니다. 16단 적층까지 나오고 있고요.

문제는 이 방식을 밀어붙일수록 점점 비싸지는 자원이 하나 있다는 겁니다. 바로 GPU 주변의 공간입니다.

  • HBM 스택 하나를 붙이려면 GPU 쪽에도 수천 개의 입출력 회로가 필요합니다.
  • 칩이 외부와 데이터를 주고받는 입출력 회로는 주로 칩 ‘가장자리’를 차지합니다.
  • 그런데 칩 둘레의 길이는 무한정 늘어날 수 없습니다.

업계는 이 한정된 칩 가장자리를 해안선에 빗대 쇼어라인(shoreline)이라 부릅니다. 이 좁은 가장자리에는 HBM만 붙는 게 아닙니다. GPU끼리의 고속 연결, CPU 연결, 그리고 앞으로 들어올 광학 회로까지 같은 공간을 두고 경쟁합니다.

그래서 ‘전체 대역폭이 몇 TB/s냐’만큼이나, 칩 둘레 1mm에서 얼마나 많은 데이터를 뽑아내느냐(밴드위스 덴시티)가 중요해집니다.

그래서 나온 발상: 메모리를 GPU에서 ‘떼어낸다’

또 다른 벽도 있습니다. AI 추론에서는 모델 자체가 메모리를 많이 쓰고, 대화가 길어지거나 동시 사용자가 늘수록 KV 캐시가 계속 커집니다. 연산 능력은 남는데 메모리 용량이 먼저 부족해지는 상황이 생기는 거죠.

그런데 HBM은 서버 램처럼 하나 더 꽂기가 어렵습니다. 애초에 GPU와 한 패키지로 묶여 설계되기 때문입니다. 용량이 부족하면 처음부터 용량 큰 GPU를 사거나, GPU 자체를 더 투입해야 합니다.

여기서 나온 아이디어가 디스어그리게이티드 메모리(Disaggregated Memory), 즉 메모리 풀링입니다.

  • 연산 장치와 메모리를 한 세트로 묶지 않고, 각각 필요한 만큼 따로 확장
  • 연산이 부족하면 GPU를, 용량이 부족하면 메모리 풀을 늘리는 방식
  • 두 자원을 더 독립적으로, 유연하게 운영 가능

주의할 점은, 메모리를 밖으로 꺼낸다고 해서 HBM의 수직 적층이 필요 없어지는 건 아니라는 겁니다. 멀리 떨어진 메모리 풀 안에서도 면적당 용량·대역폭·전력 효율은 여전히 중요하니까요.

구리 vs 빛: 왜 ‘광학 인터커넥트’여야 할까요?

메모리를 GPU에서 떼어내면, HBM이 가졌던 ‘짧은 연결 거리’라는 장점도 함께 잃습니다. 거리가 몇 mm일 때는 전기 신호를 그대로 보내는 게 효율적이지만, 거리가 수십 cm~수 m로 늘어나면 이야기가 달라집니다.

여기서 말하는 전기 연결은 전선만이 아니라 패키지 배선, PCB 위 구리 트레이스, 서버 간 구리 케이블까지 모두 포함합니다.

구리(전기) 연결의 한계

  • 주파수가 높아질수록 신호 손실이 커짐
  • 앞 비트의 흔적이 뒤 비트에 섞이는 간섭(크로스토크) 발생
  • 신호를 되살리는 보정·재생 회로가 필요해 전력을 추가로 소모

광학 연결의 장점

  • 한 번 빛으로 바꾸면 거리가 늘어도 손실·간섭이 크게 줄어듦
  • 하나의 광섬유에 서로 다른 파장의 빛을 여러 개 실어 대역폭 확대 가능
  • 데이터 양과 거리가 함께 커질수록 더 낮은 에너지(pJ/bit)로 전송 유리

CPO의 핵심은, GPU에서 광학 입출력 장치까지의 ‘짧은 전기 구간’은 남기고, 그 이후 긴 구간을 빛으로 바꾸는 경계를 칩에 최대한 가깝게 끌어오는 것입니다.

구분구리(전기) 연결광학(빛) 연결
짧은 거리(mm)매우 효율적변환 비용이 오히려 부담
긴 거리(cm~m)손실·간섭·전력 급증손실 적고 대역폭 유리
대역폭 확장신호선 추가에 한계파장 다중화로 확장 용이
주 용도GPU-HBM 근거리GPU-메모리 풀 원거리

CXL이랑 뭐가 다를까요? 헷갈리기 쉬운 포인트

“외부 메모리 공유라면 CXL이 이미 있잖아?”라는 의문이 들 수 있습니다. 맞습니다. CXL도 외부 메모리를 붙여 용량을 늘리고, 여러 장치가 메모리를 공유하게 해줍니다. 메모리 풀을 만드는 데 유용한 기술입니다.

하지만 CXL과 HBM은 역할이 다릅니다.

  • HBM: 메모리 자체가 내는 대역폭. HBM4 스택 하나가 이미 수 TB/s급
  • CXL: 용량 확장과 공유를 위한 연결. 링크당 대역폭은 GPU 옆 HBM과 비교하면 훨씬 낮음

즉 CXL 메모리 풀을 ‘HBM 다음의 초고대역폭 메모리’로 보긴 어렵습니다. 용량 확장·공유용 기술로 이해하는 게 정확합니다.

또 하나, CXL과 광학 연결은 서로 대체 관계가 아닙니다.

  • CXL: 메모리를 어떻게 발견·공유·접근할지 정하는 ‘프로토콜’
  • 광학 연결: 그 데이터를 먼 거리로 어떤 물리적 방식으로 옮길지 담당하는 ‘전송 수단’

그래서 CXL 프로토콜을 광학 링크 위에서 전달하는 구조도 얼마든지 가능합니다.

CPO가 제시하는 목표치, 그리고 남은 과제

이번 논문이 제시한 배경 데이터가 인상적입니다. 연산 성능은 약 2년마다 3배씩 늘었지만, 같은 기간 인터커넥트 대역폭은 1.4배밖에 늘지 못했습니다. GPU와 HBM을 아무리 빠르게 만들어도, 이들을 잇는 통로가 못 따라가면 시스템 전체가 다시 기다리게 됩니다.

논문이 차세대 인터커넥트의 장기 목표로 제시한 수치는 다음과 같습니다.

  • 대역폭: 노드당 100Tb/s 이상
  • 에너지 효율: 비트당 1피코줄(pJ) 미만
  • 지연 시간: 칩 간 10나노초(ns) 미만

100Tb/s를 비트당 1pJ로 단순 계산하면 약 100W 규모가 됩니다. 아주 작은 에너지라도 초당 100조 비트를 쉼 없이 옮기면 전력이 이만큼 커집니다. AI 시스템이 에너지 효율에 목매는 이유가 바로 여기 있습니다.

다만 넘어야 할 산도 많습니다.

  • 광 부품을 패키지에 집적했을 때의 수율과 비용
  • 여러 GPU가 메모리를 공유할 때의 데이터 일관성 관리
  • 패키징·발열·표준화·시스템 신뢰성 검증

이 논문 역시 신제품이 아니라 연구 방향을 정리한 리뷰라는 점을 기억하시면 좋겠습니다.

📌 AI 데이터센터가 왜 이렇게 전력을 많이 먹는지 궁금하시다면? [[내부링크: AI 데이터센터 전력 소비, 어디까지 갈까]]

그래서 HBM은 사라질까요?

정리하겠습니다. 이 흐름에서 던져야 할 질문은 “HBM이 언제 사라질까?”가 아니라, “GPU에서 메모리를 얼마나 떼어내도 AI 성능을 유지할 수 있을까?”입니다.

  • HBM은 사라지지 않습니다. 지연에 민감한 데이터는 여전히 GPU 코앞의 로컬 HBM이 담당합니다.
  • 대신 큰 용량은 멀리 있는 메모리 풀에 두고, 그 사이를 광학 인터커넥트로 잇는 계층 구조가 유력합니다.
  • 앞으로는 ‘HBM을 얼마나 높이 쌓느냐’와 함께, ‘바깥에 얼마나 큰 메모리를 얼마나 빠르게 연결하느냐’가 똑같이 중요해집니다.

AI 반도체의 다음 승부처는 칩 자체가 아니라 ‘연결(인터커넥트)’로 이동하고 있습니다. SK하이닉스가 메모리 회사를 넘어 시스템 아키텍처를 그리기 시작한 이유이기도 합니다.

이 큰 그림을 미리 이해해 두시면, 앞으로 쏟아질 AI 반도체 뉴스가 완전히 다르게 보일 겁니다. 관련 소식을 놓치지 않으시려면 아래 시리즈도 꼭 확인해 보세요.


자주 묻는 질문(FAQ)

Q1. CPO가 상용화되면 HBM은 필요 없어지나요? 아닙니다. 지연 시간에 민감한 데이터는 여전히 GPU 바로 옆의 HBM이 처리합니다. CPO는 HBM을 대체하는 게 아니라, GPU에서 멀리 떨어진 대용량 메모리까지 효율적으로 연결하기 위한 기술입니다.

Q2. 광섬유로 바꾸면 원격 메모리가 로컬 HBM처럼 빨라지나요? 그렇지 않습니다. 빛도 1m 이동에 약 5ns가 걸려, 왕복이면 약 10ns가 추가됩니다. 여기에 전기-광 변환, 메모리 컨트롤러 처리 시간까지 더해지므로, 몇 mm 옆에 붙은 HBM과 완전히 같아지진 않습니다.

Q3. CXL이 있는데 왜 광학 인터커넥트가 또 필요한가요? CXL은 메모리를 ‘어떻게 공유·접근할지’ 정하는 프로토콜이고, 광학 연결은 데이터를 ‘어떤 물리적 방식으로 멀리 보낼지’를 담당합니다. 역할이 달라서 CXL을 광학 링크 위에 얹는 조합도 가능합니다.

Q4. HBM4와 HBM4E의 차이는 무엇인가요? HBM4는 IO를 2,048개로 넓혀 스택당 2TB/s를 넘겼고, HBM4E는 핀당 속도를 더 끌어올려 스택당 약 4TB/s를 겨냥합니다. 용량과 전력 효율도 함께 개선됩니다.