GB300 NVL72 giải quyết bài toán gì
Các mô hình lập luận thế hệ mới không chỉ trả lời — chúng sinh ra hàng nghìn token suy nghĩ trung gian trước khi đưa ra kết quả. Khối lượng token đó làm chi phí suy luận tăng gấp nhiều lần so với mô hình trả lời trực tiếp, và điểm nghẽn chuyển từ sức mạnh tính toán sang băng thông giữa các GPU. GB300 NVL72 được thiết kế đúng cho tình huống này: thay vì ghép nhiều máy chủ rời qua mạng, NVIDIA gộp cả tủ rack thành một miền NVLink duy nhất.
Kết quả là 72 GPU nhìn thấy nhau như thể nằm trên cùng một bo mạch. Một mô hình hàng nghìn tỷ tham số được trải đều trên toàn bộ tủ mà không phải cắt nhỏ rồi ghép lại qua Ethernet — cách làm vốn đốt phần lớn thời gian vào chờ dữ liệu.
Cấu tạo phần cứng
- 72 GPU NVIDIA Blackwell Ultra với 20 TB bộ nhớ HBM3E tổng cộng, mỗi GPU có 288 GB, băng thông lên tới 576 TB/s.
- 36 CPU NVIDIA Grace nền tảng Arm Neoverse V2, tổng 2.592 lõi, kèm 17 TB LPDDR5X băng thông 14 TB/s. Tổng bộ nhớ nhanh của cả tủ là 37 TB.
- NVLink thế hệ 5 băng thông 130 TB/s trong toàn tủ, nối GPU với GPU và GPU với CPU qua NVLink-C2C.
- Mạng ra ngoài bằng NVIDIA Quantum-X800 InfiniBand hoặc Spectrum-X Ethernet. Mô-đun I/O mang hai thiết bị ConnectX-8, cấp 800 Gb/s cho mỗi GPU.
- Làm mát bằng chất lỏng toàn bộ, công suất tiêu thụ khoảng 140 kW cho cả tủ.
Hiệu năng tính toán
Theo công bố của NVIDIA, ở độ chính xác FP4 — định dạng dùng nhiều nhất cho suy luận hiện nay — hệ thống đạt 1.440 PFLOPS. Xuống FP8/FP6 cho các mô hình chưa lượng tử hoá sâu là 720 PFLOPS, INT8 đạt 24 POPS, FP16/BF16 đạt 360 PFLOPS, TF32 đạt 180 PFLOPS và FP32 giữ 6 PFLOPS cho các bài toán khoa học.
So với thế hệ Hopper, NVIDIA công bố mức suy luận cao hơn tới 50 lần trên cùng một lớp bài toán. Phần lớn khoảng cách đó không đến từ số phép tính mà đến từ bộ nhớ HBM3E lớn hơn 1,5 lần: batch size lớn hơn, ngữ cảnh dài hơn, ít lần nạp lại trọng số hơn.
Ai nên cân nhắc hệ thống này
GB300 NVL72 là thiết bị hạ tầng, không phải máy chủ đặt trong phòng server thông thường. Nó phù hợp với nhà cung cấp dịch vụ đám mây xây nhà máy AI, tập đoàn tài chính – viễn thông tự vận hành mô hình nội bộ ở quy mô hàng chục nghìn người dùng, và máy chủ GPU cho trường đại học và viện nghiên cứu">viện nghiên cứu chạy mô hình nền tảng. Nếu nhu cầu của bạn là huấn luyện hoặc suy luận dưới quy mô đó, một cụm máy chủ HGX 8 GPU sẽ hợp lý hơn cả về chi phí lẫn vận hành.
Chuẩn bị hạ tầng trước khi lắp đặt
Ba điều kiện phải chốt trước khi đặt hàng: nguồn điện ba pha đủ 140 kW cho một vị trí rack, hệ thống làm mát chất lỏng có CDU và đường ống tới tận rack, và sàn kỹ thuật chịu được tải trọng của một tủ rack đầy. Chúng tôi khảo sát phòng máy và lập bản vẽ bố trí trước khi báo giá, vì phần cải tạo hạ tầng thường quyết định tiến độ nhiều hơn thời gian giao thiết bị.