Máy chủ GPU – Máy chủ AI cho huấn luyện và suy luận mô hình Máy chủ GPU
Giỏ hàng của bạn (0)
Giỏ hàng trống
Đặt mua hàng

Máy chủ AI NVIDIA GB300 NVL72 – 72 GPU Blackwell Ultra, 37TB bộ nhớ nhanh

4.9/5(103 đánh giá)
Máy chủ NVIDIA
DGX và nền tảng Grace Blackwell
SKU: NV-GB300-NVL72
Thông số sản phẩm
Thương hiệu
NVIDIA
Kiểu hệ thống
Rack-scale, làm mát bằng chất lỏng
GPU
72 × NVIDIA Blackwell Ultra
CPU
36 × NVIDIA Grace (2.592 lõi Arm Neoverse V2)
Bộ nhớ GPU
20 TB HBM3E (288 GB mỗi GPU)
Bộ nhớ hệ thống
17 TB LPDDR5X, băng thông 14 TB/s
Công suất tiêu thụ
Khoảng 140 kW
Bảo hành
36 tháng, hỗ trợ tại chỗ
Xuất xứ
Chính hãng, nhập khẩu
  • Hàng chính hãng NVIDIA tại Việt Nam
  • Bảo hành chính hãng 36 tháng, hỗ trợ tại chỗ trên toàn quốc
  • Sản phẩm mới 100% chưa sử dụng
  • Giao hàng toàn quốc các ngày trong tuần

GB300 NVL72 giải quyết bài toán gì

Các mô hình lập luận thế hệ mới không chỉ trả lời — chúng sinh ra hàng nghìn token suy nghĩ trung gian trước khi đưa ra kết quả. Khối lượng token đó làm chi phí suy luận tăng gấp nhiều lần so với mô hình trả lời trực tiếp, và điểm nghẽn chuyển từ sức mạnh tính toán sang băng thông giữa các GPU. GB300 NVL72 được thiết kế đúng cho tình huống này: thay vì ghép nhiều máy chủ rời qua mạng, NVIDIA gộp cả tủ rack thành một miền NVLink duy nhất.

Kết quả là 72 GPU nhìn thấy nhau như thể nằm trên cùng một bo mạch. Một mô hình hàng nghìn tỷ tham số được trải đều trên toàn bộ tủ mà không phải cắt nhỏ rồi ghép lại qua Ethernet — cách làm vốn đốt phần lớn thời gian vào chờ dữ liệu.

Cấu tạo phần cứng

  • 72 GPU NVIDIA Blackwell Ultra với 20 TB bộ nhớ HBM3E tổng cộng, mỗi GPU có 288 GB, băng thông lên tới 576 TB/s.
  • 36 CPU NVIDIA Grace nền tảng Arm Neoverse V2, tổng 2.592 lõi, kèm 17 TB LPDDR5X băng thông 14 TB/s. Tổng bộ nhớ nhanh của cả tủ là 37 TB.
  • NVLink thế hệ 5 băng thông 130 TB/s trong toàn tủ, nối GPU với GPU và GPU với CPU qua NVLink-C2C.
  • Mạng ra ngoài bằng NVIDIA Quantum-X800 InfiniBand hoặc Spectrum-X Ethernet. Mô-đun I/O mang hai thiết bị ConnectX-8, cấp 800 Gb/s cho mỗi GPU.
  • Làm mát bằng chất lỏng toàn bộ, công suất tiêu thụ khoảng 140 kW cho cả tủ.

Hiệu năng tính toán

Theo công bố của NVIDIA, ở độ chính xác FP4 — định dạng dùng nhiều nhất cho suy luận hiện nay — hệ thống đạt 1.440 PFLOPS. Xuống FP8/FP6 cho các mô hình chưa lượng tử hoá sâu là 720 PFLOPS, INT8 đạt 24 POPS, FP16/BF16 đạt 360 PFLOPS, TF32 đạt 180 PFLOPS và FP32 giữ 6 PFLOPS cho các bài toán khoa học.

So với thế hệ Hopper, NVIDIA công bố mức suy luận cao hơn tới 50 lần trên cùng một lớp bài toán. Phần lớn khoảng cách đó không đến từ số phép tính mà đến từ bộ nhớ HBM3E lớn hơn 1,5 lần: batch size lớn hơn, ngữ cảnh dài hơn, ít lần nạp lại trọng số hơn.

Ai nên cân nhắc hệ thống này

GB300 NVL72 là thiết bị hạ tầng, không phải máy chủ đặt trong phòng server thông thường. Nó phù hợp với nhà cung cấp dịch vụ đám mây xây nhà máy AI, tập đoàn tài chính – viễn thông tự vận hành mô hình nội bộ ở quy mô hàng chục nghìn người dùng, và máy chủ GPU cho trường đại học và viện nghiên cứu">viện nghiên cứu chạy mô hình nền tảng. Nếu nhu cầu của bạn là huấn luyện hoặc suy luận dưới quy mô đó, một cụm máy chủ HGX 8 GPU sẽ hợp lý hơn cả về chi phí lẫn vận hành.

Chuẩn bị hạ tầng trước khi lắp đặt

Ba điều kiện phải chốt trước khi đặt hàng: nguồn điện ba pha đủ 140 kW cho một vị trí rack, hệ thống làm mát chất lỏng có CDU và đường ống tới tận rack, và sàn kỹ thuật chịu được tải trọng của một tủ rack đầy. Chúng tôi khảo sát phòng máy và lập bản vẽ bố trí trước khi báo giá, vì phần cải tạo hạ tầng thường quyết định tiến độ nhiều hơn thời gian giao thiết bị.

Thông số kỹ thuật của Máy chủ AI NVIDIA GB300 NVL72 – 72 GPU Blackwell Ultra, 37TB bộ nhớ nhanh

Thông số kỹ thuật Máy chủ AI NVIDIA GB300 NVL72 – 72 GPU Blackwell Ultra, 37TB bộ nhớ nhanh
Thông số Chi tiết
Tên sản phẩm Máy chủ AI NVIDIA GB300 NVL72 – 72 GPU Blackwell Ultra, 37TB bộ nhớ nhanh
Thương hiệu NVIDIA
Form factor Rack-scale (một tủ rack hoàn chỉnh)
Số socket 36 CPU Grace + 72 GPU Blackwell Ultra
Nền tảng vi xử lý NVIDIA Grace Arm Neoverse V2
Số GPU tối đa 72 GPU Blackwell Ultra
Công suất nguồn ≈140 kW cho cả tủ
Xuất xứ Chính hãng, nhập khẩu
Bảo hành 36 tháng, hỗ trợ tại chỗ
Thông số chính
Kiểu hệ thống Rack-scale, làm mát bằng chất lỏng
GPU 72 × NVIDIA Blackwell Ultra
CPU 36 × NVIDIA Grace (2.592 lõi Arm Neoverse V2)
Bộ nhớ GPU 20 TB HBM3E (288 GB mỗi GPU)
Bộ nhớ hệ thống 17 TB LPDDR5X, băng thông 14 TB/s
Công suất tiêu thụ Khoảng 140 kW
Kết nối
NVLink Thế hệ 5, băng thông 130 TB/s toàn tủ
CPU – GPU NVLink-C2C
Mạng ngoài Quantum-X800 InfiniBand hoặc Spectrum-X Ethernet
Card mạng ConnectX-8 SuperNIC 800 Gb/s mỗi GPU
Hiệu năng
FP4 Tensor Core 1.440 PFLOPS (1.080 PFLOPS đặc)
FP8 / FP6 Tensor Core 720 PFLOPS
INT8 Tensor Core 24 POPS
FP16 / BF16 Tensor Core 360 PFLOPS
TF32 Tensor Core 180 PFLOPS
FP32 6 PFLOPS
Hạ tầng yêu cầu
Làm mát Chất lỏng trực tiếp, cần CDU
Nguồn điện Ba pha, khoảng 140 kW cho một rack
Không gian Một tủ rack tiêu chuẩn 42U trở lên
* Dựa theo datasheet của hãng

Câu hỏi thường gặp

Khác biệt nằm ở GPU: GB300 dùng Blackwell Ultra với 288 GB HBM3E mỗi GPU, nhiều hơn khoảng 1,5 lần so với Blackwell trên GB200, và tăng gấp đôi khả năng tăng tốc lớp Attention. Với suy luận mô hình lập luận cần ngữ cảnh dài, phần bộ nhớ dôi ra này quan trọng hơn con số FLOPS.

Có. GB300 NVL72 chỉ có phương án làm mát bằng chất lỏng. Phòng máy phải có CDU và đường ống dẫn tới rack; không có bản làm mát bằng khí cho hệ thống này.

20 TB bộ nhớ HBM3E đủ để giữ trọn một mô hình hàng nghìn tỷ tham số ở định dạng FP4 cùng bộ nhớ đệm KV cho hàng nghìn phiên đồng thời, mà không phải chia mô hình ra nhiều tủ.

Thiết bị đặt theo đơn, thời gian giao thường tính bằng tháng và phụ thuộc lịch phân bổ của NVIDIA. Phần khảo sát điện – làm mát nên bắt đầu song song ngay khi đặt hàng vì đây thường là đường găng của dự án.

Có. Với hệ thống ở mức đầu tư này, nhiều đơn vị chọn thuê theo tháng hoặc thuê hạ tầng đặt tại trung tâm dữ liệu của chúng tôi. Liên hệ 092.6666666 để nhận phương án so sánh chi phí thuê và mua.


Giao sản phẩm Máy chủ AI NVIDIA GB300 NVL72 – 72 GPU Blackwell Ultra, 37TB bộ nhớ nhanh toàn quốc

Vì sao chọn Máy chủ GPU?

01

Cấu hình theo tải thực tế

Chọn GPU, CPU, RAM và dung lượng lưu trữ theo đúng mô hình bạn chạy — huấn luyện, tinh chỉnh hay suy luận — thay vì mua thừa rồi để không.

02

Nguồn và tản nhiệt đủ ngưỡng

Máy chủ GPU ăn điện và toả nhiệt lớn. Chúng tôi tính sẵn công suất nguồn, luồng gió và tải giá đỡ để hệ thống chạy hết hiệu năng mà không bị hạ xung.

03

Bàn giao chạy được ngay

Máy về đã cài sẵn driver, CUDA và môi trường container, kiểm tra thông số dưới tải trước khi giao.

Chat Zalo Máy chủ GPU Chat Zalo Chat Facebook Máy chủ GPU Chat Facebook Hotline Máy chủ GPU Gọi ngay 09x.6666666