Máy chủ GPU – Máy chủ AI cho huấn luyện và suy luận mô hình Máy chủ GPU
Giỏ hàng của bạn (0)
Giỏ hàng trống
Đặt mua hàng

Máy chủ AI NVIDIA GB200 NVL72 – nền tảng Grace Blackwell cho mô hình nghìn tỷ tham số

4.9/5(104 đánh giá)
Máy chủ NVIDIA
DGX và nền tảng Grace Blackwell
SKU: NV-GB200-NVL72
Thông số sản phẩm
Thương hiệu
NVIDIA
Kiểu hệ thống
Rack-scale, làm mát bằng chất lỏng
Siêu chip
36 × NVIDIA GB200 Grace Blackwell
GPU
72 × NVIDIA Blackwell, 13,4 TB HBM3E
CPU
36 × NVIDIA Grace Arm Neoverse V2
Miền NVLink
72 GPU trong một miền nhớ chung, băng thông 130 TB/s
Công suất tiêu thụ
Khoảng 120 kW
Bảo hành
36 tháng, hỗ trợ tại chỗ
Xuất xứ
Chính hãng, nhập khẩu
  • Hàng chính hãng NVIDIA tại Việt Nam
  • Bảo hành chính hãng 36 tháng, hỗ trợ tại chỗ trên toàn quốc
  • Sản phẩm mới 100% chưa sử dụng
  • Giao hàng toàn quốc các ngày trong tuần

Một tủ rack, một GPU khổng lồ

Ý tưởng cốt lõi của GB200 NVL72 là xoá ranh giới giữa các máy chủ. Ba mươi sáu siêu chip GB200 — mỗi chip gồm một CPU Grace ghép trực tiếp với hai GPU Blackwell — được nối với nhau bằng NVLink Switch, tạo thành một miền nhớ chung mà phần mềm nhìn thấy gần như một bộ tăng tốc duy nhất có 72 GPU.

Điều này thay đổi cách viết mã huấn luyện. Với cụm máy chủ rời, kỹ sư phải chia mô hình sao cho lưu lượng qua mạng InfiniBand là ít nhất, và mỗi lần chia sai là mất hàng chục phần trăm hiệu năng. Trong một miền NVLink 72 GPU, chi phí trao đổi dữ liệu thấp tới mức chiến lược chia mô hình trở nên dễ thở hơn nhiều.

Điểm mạnh với mô hình MoE

Các mô hình Mixture-of-Experts hiện đại kích hoạt một phần nhỏ tham số cho mỗi token, nhưng phải định tuyến token tới đúng chuyên gia đang nằm trên GPU khác. Đây chính là kiểu tải trọng làm sập hiệu năng của cụm nối bằng Ethernet. NVLink băng thông cao trong NVL72 giúp phần định tuyến gần như không tốn kém, nên GB200 NVL72 thường được chọn cho các mô hình MoE quy mô lớn.

Nhìn nhận thực tế về chi phí

GB200 NVL72 không phải lựa chọn mặc định cho mọi tổ chức muốn làm AI. Nó chỉ hợp lý khi bạn có tải trọng chạy liên tục gần 100% công suất trong nhiều tháng. Nếu GPU của bạn có những khoảng nhàn rỗi dài, chi phí điện và làm mát của một tủ 120 kW sẽ ăn hết phần lợi thế hiệu năng. Trong trường hợp đó, vài máy chủ HGX 8 GPU đặt rời, hoặc thuê hạ tầng theo giờ, thường là quyết định tài chính đúng hơn.

Đi kèm hệ sinh thái phần mềm

Hệ thống chạy được ngay với NVIDIA AI Enterprise, NeMo, Triton Inference Server và các framework phổ biến như PyTorch, JAX. Chúng tôi bàn giao kèm cấu hình Slurm hoặc Kubernetes tuỳ theo cách đội kỹ thuật của bạn quen làm việc, và chạy thử một bài huấn luyện thật trước khi nghiệm thu.

Thông số kỹ thuật của Máy chủ AI NVIDIA GB200 NVL72 – nền tảng Grace Blackwell cho mô hình nghìn tỷ tham số

Thông số kỹ thuật Máy chủ AI NVIDIA GB200 NVL72 – nền tảng Grace Blackwell cho mô hình nghìn tỷ tham số
Thông số Chi tiết
Tên sản phẩm Máy chủ AI NVIDIA GB200 NVL72 – nền tảng Grace Blackwell cho mô hình nghìn tỷ tham số
Thương hiệu NVIDIA
Form factor Rack-scale (một tủ rack hoàn chỉnh)
Số socket 36 siêu chip GB200 Grace Blackwell
Nền tảng vi xử lý NVIDIA Grace Arm Neoverse V2
Số GPU tối đa 72 GPU Blackwell
Công suất nguồn ≈120 kW cho cả tủ
Xuất xứ Chính hãng, nhập khẩu
Bảo hành 36 tháng, hỗ trợ tại chỗ
Thông số chính
Kiểu hệ thống Rack-scale, làm mát bằng chất lỏng
Siêu chip 36 × NVIDIA GB200 Grace Blackwell
GPU 72 × NVIDIA Blackwell, 13,4 TB HBM3E
CPU 36 × NVIDIA Grace Arm Neoverse V2
Miền NVLink 72 GPU trong một miền nhớ chung, băng thông 130 TB/s
Công suất tiêu thụ Khoảng 120 kW
Kết nối
NVLink Thế hệ 5 qua NVLink Switch, 130 TB/s toàn tủ
CPU 36 × Grace, tổng 2.592 lõi Arm Neoverse V2, 17 TB LPDDR5X
Mạng ngoài Quantum InfiniBand hoặc Spectrum-X Ethernet
Ứng dụng
Hiệu năng NVFP4 1.440 PFLOPS (720 PFLOPS đặc)
Hiệu năng FP8 / FP6 720 PFLOPS · INT8 720 POPS · FP16/BF16 360 PFLOPS
Phần mềm NVIDIA AI Enterprise, NeMo, Triton, PyTorch, JAX; điều phối bằng Slurm hoặc Kubernetes
Hạ tầng yêu cầu
Làm mát Chất lỏng trực tiếp, cần CDU
Nguồn điện Ba pha, khoảng 120 kW cho một rack
* Dựa theo datasheet của hãng

Câu hỏi thường gặp

GB200 Superchip là một mô-đun gồm một CPU NVIDIA Grace nối trực tiếp với hai GPU Blackwell qua NVLink-C2C. Nhờ nối trực tiếp, GPU truy cập bộ nhớ của CPU với băng thông cao hơn nhiều so với đi qua khe PCIe như máy chủ truyền thống.

Chọn NVL72 khi mô hình của bạn lớn tới mức phải trải trên hàng chục GPU và lưu lượng giữa các GPU là điểm nghẽn — điển hình là mô hình MoE nghìn tỷ tham số. Với mô hình dưới khoảng 200 tỷ tham số hoặc tải trọng không liên tục, cụm HGX 8 GPU cho chi phí trên mỗi đơn vị công việc tốt hơn.

Có. Chúng tôi bàn giao kèm NVIDIA GPU Operator và cấu hình Kubernetes, hoặc Slurm nếu đội của bạn quen với môi trường HPC truyền thống.

Một tủ rack tiêu chuẩn, nhưng yêu cầu thật nằm ở điện và làm mát chứ không phải diện tích. Cần vị trí cấp được khoảng 120 kW ba pha và có đường nước làm mát tới rack.


Giao sản phẩm Máy chủ AI NVIDIA GB200 NVL72 – nền tảng Grace Blackwell cho mô hình nghìn tỷ tham số toàn quốc

Vì sao chọn Máy chủ GPU?

01

Cấu hình theo tải thực tế

Chọn GPU, CPU, RAM và dung lượng lưu trữ theo đúng mô hình bạn chạy — huấn luyện, tinh chỉnh hay suy luận — thay vì mua thừa rồi để không.

02

Nguồn và tản nhiệt đủ ngưỡng

Máy chủ GPU ăn điện và toả nhiệt lớn. Chúng tôi tính sẵn công suất nguồn, luồng gió và tải giá đỡ để hệ thống chạy hết hiệu năng mà không bị hạ xung.

03

Bàn giao chạy được ngay

Máy về đã cài sẵn driver, CUDA và môi trường container, kiểm tra thông số dưới tải trước khi giao.

Chat Zalo Máy chủ GPU Chat Zalo Chat Facebook Máy chủ GPU Chat Facebook Hotline Máy chủ GPU Gọi ngay 09x.6666666