엔비디아를 GPU 회사로 알고 있다면, 서버와 네트워크 장비까지 공급한다는 사실이 낯설 수 있습니다. 하지만 대규모 AI 시스템에서는 GPU의 계산 능력만큼 여러 GPU가 함께 일하는 방식도 중요합니다.
GPU를 많이 설치해도 데이터를 주고받는 속도가 느리면 충분한 성능을 내기 어렵습니다. 서버 구성과 소프트웨어가 제대로 맞물리지 않아도 마찬가지입니다. 고객이 필요한 것은 빠른 칩 자체보다, 주어진 시간과 비용 안에서 AI 작업을 끝낼 수 있는 시스템입니다.
엔비디아가 제품 범위를 넓힌 이유도 여기에 있습니다. GPU의 성능을 실제 작업 성능으로 연결하는 데 필요한 서버 구조, 연결 기술, 소프트웨어까지 함께 제공하려는 것입니다.
GPU를 늘린다고 AI 작업이 그만큼 빨라지는 것은 아니다
GPU는 많은 계산을 동시에 처리하는 데 적합한 반도체입니다. AI 모델을 학습시키거나, 학습된 모델을 실행해 답변을 생성하는 데 사용됩니다. 학습된 모델을 실행하는 과정은 ‘추론’이라고 부릅니다.
모든 AI 작업에 수천 개의 GPU가 필요한 것은 아닙니다. 작은 모델이나 제한된 작업은 GPU 한 개 또는 소수의 GPU로 처리할 수 있습니다. 반면 규모가 큰 모델을 학습시키거나 많은 이용자의 요청을 처리하려면 여러 GPU에 작업을 나눠 맡기는 구성이 필요할 수 있습니다.
문제는 나눠 맡긴 작업이 항상 독립적으로 끝나지는 않는다는 점입니다. 학습 방식에 따라 GPU들은 중간 계산 결과를 공유하거나, 서로 처리한 결과를 합쳐야 합니다.
여러 사람이 보고서를 나눠 작성하는 상황과 비슷합니다. 각자 맡은 부분을 빠르게 써도, 자료를 전달하고 내용을 맞추는 데 오래 걸리면 보고서 완성은 늦어집니다.
GPU도 데이터를 기다리는 동안에는 계산 능력을 충분히 활용하지 못합니다. GPU 수를 늘렸는데도 처리 시간이 기대만큼 줄지 않는 이유 중 하나입니다.
이처럼 전체 작업의 진행을 막는 구간을 ‘병목’이라고 합니다. 병목은 GPU의 계산 능력뿐 아니라 메모리, GPU 사이의 통신, 저장장치, 소프트웨어에서도 발생할 수 있습니다. 따라서 대규모 AI 시스템을 설계할 때는 칩의 성능과 함께 데이터가 이동하는 경로를 살펴야 합니다.
엔비디아가 제공하는 것은 칩부터 시스템 구성까지다
AI 서버에는 GPU만 들어가는 것이 아닙니다. CPU와 메모리, 네트워크 장치, 전원 공급과 냉각 설비가 함께 필요합니다. 여러 서버를 묶으면 연결 구조도 복잡해집니다.
엔비디아는 이 구성 요소들이 함께 작동하도록 제품과 설계 범위를 확대해 왔습니다.
| 구성 | 역할 | 대표적인 제품·기술 |
|---|---|---|
| GPU | AI 학습과 추론에 필요한 계산 처리 | 데이터센터용 GPU |
| 서버·랙 시스템 | GPU와 CPU 등을 하나의 시스템으로 구성 | DGX, GB200 NVL72 등 |
| GPU 연결 기술 | 연결된 GPU 사이의 데이터 교환 | NVLink, NVLink Switch |
| 서버 간 네트워크 | 여러 서버를 연결해 작업 규모 확대 | Quantum InfiniBand, Spectrum-X |
| 소프트웨어 | 하드웨어를 활용해 프로그램 실행·최적화 | CUDA와 관련 라이브러리 |
다만 엔비디아가 서버의 모든 부품을 직접 제조하고, 모든 완제품을 단독으로 판매한다는 뜻은 아닙니다. 자체 시스템을 제공하는 한편, 서버 제조사가 엔비디아의 부품과 설계를 활용해 제품을 공급하는 방식도 함께 운영됩니다.
엔비디아는 GB200 NVL72의 랙 구조와 냉각 관련 설계 일부를 공개하는 등 다른 기업이 시스템을 구현할 수 있도록 지원하기도 했습니다.[1]
따라서 엔비디아의 확장은 단순히 서버 제조업에 진출했다는 설명보다, AI 시스템을 구성하는 핵심 기술과 설계까지 공급하는 사업으로 넓어졌다고 이해하는 편이 정확합니다.
랙 안의 GPU 연결과 서버 사이의 연결은 역할이 다르다
랙은 서버와 관련 장비를 설치하는 구조물입니다. AI 시스템에서는 어떤 장비를 넣는지뿐 아니라, 그 안의 GPU들을 어떻게 연결하는지가 중요합니다.
대표적인 사례인 GB200 NVL72는 블랙웰 GPU 72개와 그레이스 CPU 36개를 랙 규모로 구성한 시스템입니다. GPU들은 NVLink를 통해 연결됩니다.[2]
이 구성은 여러 GPU가 큰 작업을 함께 처리하도록 설계됐습니다. 다만 GPU 72개가 물리적으로 하나의 칩이 되는 것은 아닙니다. 빠른 연결을 통해 여러 GPU를 긴밀하게 활용하는 방식입니다.
이보다 더 큰 시스템을 만들려면 여러 서버와 랙을 연결해야 합니다. 이때 필요한 것이 서버 간 네트워크입니다. 엔비디아는 Quantum InfiniBand와 Spectrum-X 이더넷 플랫폼을 제공합니다.[3]
두 연결의 역할은 다음과 같이 구분할 수 있습니다.
- NVLink: 연결된 GPU들이 데이터를 빠르게 주고받도록 지원합니다.
- InfiniBand·Spectrum-X: 여러 서버를 연결해 더 큰 규모의 AI 작업을 처리하도록 지원합니다.
Spectrum-X는 스위치 하나의 이름이 아니라, 이더넷 스위치와 서버 측 네트워크 장치, 관련 소프트웨어 등을 결합한 플랫폼입니다.[3]
엔비디아가 네트워크 역량을 확대한 주요 계기는 멜라녹스 인수였습니다. 엔비디아는 2020년 4월 약 70억 달러 규모의 인수를 완료했다고 발표했습니다.[4] GPU 계산뿐 아니라 데이터 이동에 필요한 기술도 확보한 것입니다.
고객은 부품을 맞추는 부담을 줄일 수 있다
GPU와 서버, 네트워크 장비를 각각 선택하면 고객은 조합이 제대로 작동하는지 검증해야 합니다. 프로그램 실행뿐 아니라 성능, 안정성, 전력과 냉각 조건까지 확인해야 합니다.
통합된 설계와 검증된 구성을 활용하면 이 부담을 줄일 여지가 있습니다. 문제가 생겼을 때 살펴볼 기준이 명확해지고, 성능을 조정하는 과정도 단순해질 수 있습니다.
그렇다고 시스템을 구입하기만 하면 모든 문제가 해결되는 것은 아닙니다. 고객이 사용하는 AI 모델과 운영 방식에 따라 추가 검증과 최적화가 필요합니다. 데이터센터의 전력·냉각 환경도 맞춰야 합니다.
그럼에도 이미 맞춰진 구성이 제공하는 가치는 있습니다. 고객은 부품을 하나씩 선정하고 연결하는 데 쓰는 시간을 줄이고, 실제 AI 서비스를 운영하는 데 더 집중할 수 있습니다.
엔비디아가 판매하는 시스템의 가치는 이런 구축·운영 과정까지 포함해 평가해야 합니다.
엔비디아에는 매출 범위와 경쟁 기준을 넓히는 전략이다
여기까지는 제품과 기술의 역할입니다. 이를 사업적으로 해석하면 엔비디아가 얻을 수 있는 이점도 보입니다.
같은 AI 투자에서 공급할 수 있는 범위가 넓어진다
GPU만 공급한다면 고객의 데이터센터 투자 중 GPU에 해당하는 부분이 주된 사업 기회입니다. 네트워크와 시스템 관련 제품까지 공급하면 같은 고객에게 제공할 수 있는 범위가 넓어집니다.
다만 서버 전체의 판매액이 모두 엔비디아 매출이 되는 것은 아닙니다. 서버 제조사와 부품 공급사의 역할이 있고, 엔비디아가 실제 공급하는 제품과 거래 방식에 따라 매출 범위도 달라집니다.
핵심은 고객이 AI 시스템을 확대할 때 엔비디아가 참여할 수 있는 지점이 GPU에서 연결 장비와 시스템 구성으로 늘어난다는 것입니다.
고객의 전환 결정이 더 복잡해질 수 있다
고객이 특정 GPU와 개발 도구, 네트워크 구성에 맞춰 시스템을 운영해 왔다면 다른 환경으로 옮길 때 추가 검증이 필요할 수 있습니다.
새 칩이 기존 프로그램을 지원하는지, 같은 작업에서 필요한 성능을 내는지, 운영 인력이 새로운 환경을 다룰 수 있는지 확인해야 합니다. 장비 가격이 저렴하더라도 이런 전환 비용까지 고려하면 선택이 달라질 수 있습니다.
이를 고객이 ‘절대 떠날 수 없다’고 표현하는 것은 과장입니다. 다만 시스템의 여러 요소가 함께 맞춰져 있을수록, 고객은 칩 가격 하나만 보고 공급자를 바꾸기 어려워질 수 있습니다.
경쟁의 기준을 칩 성능에서 실제 작업 비용으로 넓힌다
경쟁사가 특정 칩의 가격이나 성능에서 장점을 제시하더라도, 고객은 시스템 전체에서 그 장점이 유지되는지 확인해야 합니다.
같은 모델을 학습하는 데 얼마나 걸리는지, 주어진 전력 안에서 얼마나 많은 요청을 처리하는지, 운영 비용은 어느 정도인지가 구매 판단에 중요합니다.
엔비디아가 GPU와 연결 기술, 소프트웨어를 함께 제공하면 이런 시스템 단위의 성능과 비용을 중심으로 경쟁할 수 있습니다. 칩 하나의 사양이 아니라, 고객의 작업을 얼마나 효율적으로 끝내는지가 경쟁 기준이 되는 것입니다.
이것은 엔비디아의 제품 범위에서 도출한 사업적 해석입니다. 모든 고객에게 엔비디아의 통합 구성이 가장 저렴하거나 적합하다는 뜻은 아닙니다. 기존 설비와 작업 특성에 따라 다른 구성이 유리할 수도 있습니다.
GPU의 성능을 끝까지 활용하기 위해 제품 범위를 넓힌다
엔비디아가 GPU를 넘어 서버와 네트워크까지 공급하는 이유는, 대규모 AI 작업에서 칩만으로 해결할 수 없는 문제가 생기기 때문입니다. 빠른 GPU를 설치해도 데이터를 전달하고 작업을 조율하는 시스템이 뒷받침되지 않으면 충분한 성능을 내기 어렵습니다.
고객에게는 시스템을 구축하고 검증하는 부담을 줄일 기회가 되고, 엔비디아에는 공급 범위를 넓히고 시스템 전체의 효율로 경쟁할 기회가 됩니다.
따라서 엔비디아의 사업을 살펴볼 때는 GPU 출하량뿐 아니라 연결 기술과 네트워크 제품, 소프트웨어가 실제 고객의 작업에서 어떤 가치를 만드는지도 함께 봐야 합니다. 이 요소들이 얼마나 잘 맞물리는지가 엔비디아가 시스템 사업으로 확장하는 의미를 보여줍니다.
참고 자료
- 엔비디아 — 블랙웰 플랫폼 설계의 오픈 하드웨어 생태계 제공 발표
- 엔비디아 — GB200 NVL72 제품 설명
- 엔비디아 — Spectrum-X 이더넷 플랫폼 기술 문서
- 엔비디아 — 멜라녹스 인수 완료 발표, 2020년 4월 27일
공개된 제품 설명과 기업 발표를 바탕으로 작성했습니다. 제품 구성에 관한 사실과 사업 전략에 대한 작성자의 해석을 구분했으며, 특정 종목의 매수·매도를 권유하는 글이 아닙니다.