Một tủ rack, một GPU khổng lồ
Ý tưởng cốt lõi của GB200 NVL72 là xoá ranh giới giữa các máy chủ. Ba mươi sáu siêu chip GB200 — mỗi chip gồm một CPU Grace ghép trực tiếp với hai GPU Blackwell — được nối với nhau bằng NVLink Switch, tạo thành một miền nhớ chung mà phần mềm nhìn thấy gần như một bộ tăng tốc duy nhất có 72 GPU.
Điều này thay đổi cách viết mã huấn luyện. Với cụm máy chủ rời, kỹ sư phải chia mô hình sao cho lưu lượng qua mạng InfiniBand là ít nhất, và mỗi lần chia sai là mất hàng chục phần trăm hiệu năng. Trong một miền NVLink 72 GPU, chi phí trao đổi dữ liệu thấp tới mức chiến lược chia mô hình trở nên dễ thở hơn nhiều.
Điểm mạnh với mô hình MoE
Các mô hình Mixture-of-Experts hiện đại kích hoạt một phần nhỏ tham số cho mỗi token, nhưng phải định tuyến token tới đúng chuyên gia đang nằm trên GPU khác. Đây chính là kiểu tải trọng làm sập hiệu năng của cụm nối bằng Ethernet. NVLink băng thông cao trong NVL72 giúp phần định tuyến gần như không tốn kém, nên GB200 NVL72 thường được chọn cho các mô hình MoE quy mô lớn.
Nhìn nhận thực tế về chi phí
GB200 NVL72 không phải lựa chọn mặc định cho mọi tổ chức muốn làm AI. Nó chỉ hợp lý khi bạn có tải trọng chạy liên tục gần 100% công suất trong nhiều tháng. Nếu GPU của bạn có những khoảng nhàn rỗi dài, chi phí điện và làm mát của một tủ 120 kW sẽ ăn hết phần lợi thế hiệu năng. Trong trường hợp đó, vài máy chủ HGX 8 GPU đặt rời, hoặc thuê hạ tầng theo giờ, thường là quyết định tài chính đúng hơn.
Đi kèm hệ sinh thái phần mềm
Hệ thống chạy được ngay với NVIDIA AI Enterprise, NeMo, Triton Inference Server và các framework phổ biến như PyTorch, JAX. Chúng tôi bàn giao kèm cấu hình Slurm hoặc Kubernetes tuỳ theo cách đội kỹ thuật của bạn quen làm việc, và chạy thử một bài huấn luyện thật trước khi nghiệm thu.