Máy chủ GPU – Máy chủ AI cho huấn luyện và suy luận mô hình Máy chủ GPU
Giỏ hàng của bạn (0)
Giỏ hàng trống
Đặt mua hàng

GPU NVIDIA H200 141GB HBM3e – bộ nhớ lớn nhất dòng Hopper

4.9/5(165 đánh giá)
GPU máy chủ
Card tăng tốc NVIDIA cho AI và HPC
SKU: GPU-H200-SXM
Thông số sản phẩm
Thương hiệu
NVIDIA
Kiến trúc
NVIDIA Hopper
Bộ nhớ
141 GB HBM3e
Băng thông bộ nhớ
4,8 TB/s
Dạng đóng gói
SXM (bo HGX) hoặc NVL (PCIe)
Điện năng
600–700W tuỳ bản
So với H100
Bộ nhớ gấp 1,76 lần, băng thông gấp 1,4 lần
Bảo hành
36 tháng
Xuất xứ
Chính hãng, nhập khẩu
  • Hàng chính hãng NVIDIA tại Việt Nam
  • Bảo hành chính hãng 36 tháng trên toàn quốc
  • Sản phẩm mới 100% chưa sử dụng
  • Giao hàng toàn quốc các ngày trong tuần

H200 là H100 với bộ nhớ lớn hơn

Hai GPU dùng chung kiến trúc Hopper và có sức mạnh tính toán gần như nhau. Khác biệt nằm ở bộ nhớ: H100 SXM có 80 GB HBM3, H200 có 141 GB HBM3e với băng thông 4,8 TB/s so với 3,35 TB/s.

Nghe như một nâng cấp nhỏ, nhưng với suy luận thì đây là thay đổi lớn về kinh tế.

Vì sao bộ nhớ quyết định chi phí suy luận

Khi phục vụ một mô hình, bộ nhớ GPU chia làm hai phần: trọng số mô hình cố định, và bộ nhớ đệm KV tăng theo số phiên đang hoạt động. Trọng số mô hình 70 tỷ tham số ở FP8 chiếm khoảng 70 GB. Trên H100 80 GB, bạn còn 10 GB cho bộ nhớ đệm — chỉ vài phiên. Trên H200 141 GB, bạn còn 71 GB, tức phục vụ được nhiều hơn cả chục lần số người dùng trên cùng một GPU.

Chia chi phí GPU cho số người dùng phục vụ được, H200 gần như luôn rẻ hơn dù giá mua cao hơn.

Băng thông bộ nhớ và tốc độ sinh token

Trong giai đoạn sinh từng token, GPU phải đọc toàn bộ trọng số mô hình cho mỗi token sinh ra. Tốc độ sinh token vì thế bị giới hạn bởi băng thông bộ nhớ chứ không phải sức mạnh tính toán. Băng thông 4,8 TB/s của H200 cho tốc độ phản hồi nhanh hơn rõ so với H100 trên cùng mô hình.

Chọn bản SXM hay bản NVL

Bản SXM đi theo bo HGX 8 GPU trong máy chủ chuyên dụng, cho hiệu năng cao nhất. Bản NVL dạng PCIe lắp được vào máy chủ 4U thông thường, tiện khi bạn chỉ cần hai tới bốn GPU và không muốn đầu tư máy HGX.

Thông số kỹ thuật của GPU NVIDIA H200 141GB HBM3e – bộ nhớ lớn nhất dòng Hopper

Thông số kỹ thuật GPU NVIDIA H200 141GB HBM3e – bộ nhớ lớn nhất dòng Hopper
Thông số Chi tiết
Tên sản phẩm GPU NVIDIA H200 141GB HBM3e – bộ nhớ lớn nhất dòng Hopper
Thương hiệu NVIDIA
Form factor SXM hoặc NVL (PCIe)
Số socket Theo bo HGX hoặc khe PCIe tuỳ bản
Nền tảng vi xử lý NVIDIA Hopper
Số GPU tối đa
Công suất nguồn 600–700W tuỳ bản
Xuất xứ Chính hãng, nhập khẩu
Bảo hành 36 tháng
Thông số chính
Kiến trúc NVIDIA Hopper
Bộ nhớ 141 GB HBM3e
Băng thông bộ nhớ 4,8 TB/s
Dạng đóng gói SXM (bo HGX) hoặc NVL (PCIe)
Điện năng 600–700W tuỳ bản
So với H100 Bộ nhớ gấp 1,76 lần, băng thông gấp 1,4 lần
Ứng dụng
Mạnh nhất ở Suy luận mô hình lớn, ngữ cảnh dài, nhiều phiên đồng thời
Cũng phù hợp Huấn luyện và tinh chỉnh mô hình vài chục tỷ tham số
Kết nối NVLink với bản SXM; NVLink bridge với bản NVL
* Dựa theo datasheet của hãng

Câu hỏi thường gặp

Tính theo giá máy thì đắt hơn. Tính theo chi phí trên mỗi nghìn truy vấn thì thường rẻ hơn, vì 141 GB bộ nhớ cho phép phục vụ nhiều phiên hơn hẳn trên cùng một GPU. Với suy luận, hãy so theo chi phí trên mỗi truy vấn.

Về sức mạnh tính toán thô thì gần như bằng nhau. Về tốc độ sinh token thì nhanh hơn khoảng 1,4 lần nhờ băng thông bộ nhớ cao hơn. Về số người dùng phục vụ được thì hơn nhiều lần nhờ bộ nhớ lớn hơn.

SXM cho hiệu năng cao nhất nhưng phải mua cả máy chủ HGX 8 GPU. NVL dạng PCIe lắp vào máy chủ 4U thông thường, hợp khi bạn chỉ cần 2–4 GPU. Chúng tôi tư vấn theo quy mô thật.


Giao sản phẩm GPU NVIDIA H200 141GB HBM3e – bộ nhớ lớn nhất dòng Hopper toàn quốc

Vì sao chọn Máy chủ GPU?

01

Cấu hình theo tải thực tế

Chọn GPU, CPU, RAM và dung lượng lưu trữ theo đúng mô hình bạn chạy — huấn luyện, tinh chỉnh hay suy luận — thay vì mua thừa rồi để không.

02

Nguồn và tản nhiệt đủ ngưỡng

Máy chủ GPU ăn điện và toả nhiệt lớn. Chúng tôi tính sẵn công suất nguồn, luồng gió và tải giá đỡ để hệ thống chạy hết hiệu năng mà không bị hạ xung.

03

Bàn giao chạy được ngay

Máy về đã cài sẵn driver, CUDA và môi trường container, kiểm tra thông số dưới tải trước khi giao.

Chat Zalo Máy chủ GPU Chat Zalo Chat Facebook Máy chủ GPU Chat Facebook Hotline Máy chủ GPU Gọi ngay 09x.6666666