H200 là H100 với bộ nhớ lớn hơn
Hai GPU dùng chung kiến trúc Hopper và có sức mạnh tính toán gần như nhau. Khác biệt nằm ở bộ nhớ: H100 SXM có 80 GB HBM3, H200 có 141 GB HBM3e với băng thông 4,8 TB/s so với 3,35 TB/s.
Nghe như một nâng cấp nhỏ, nhưng với suy luận thì đây là thay đổi lớn về kinh tế.
Vì sao bộ nhớ quyết định chi phí suy luận
Khi phục vụ một mô hình, bộ nhớ GPU chia làm hai phần: trọng số mô hình cố định, và bộ nhớ đệm KV tăng theo số phiên đang hoạt động. Trọng số mô hình 70 tỷ tham số ở FP8 chiếm khoảng 70 GB. Trên H100 80 GB, bạn còn 10 GB cho bộ nhớ đệm — chỉ vài phiên. Trên H200 141 GB, bạn còn 71 GB, tức phục vụ được nhiều hơn cả chục lần số người dùng trên cùng một GPU.
Chia chi phí GPU cho số người dùng phục vụ được, H200 gần như luôn rẻ hơn dù giá mua cao hơn.
Băng thông bộ nhớ và tốc độ sinh token
Trong giai đoạn sinh từng token, GPU phải đọc toàn bộ trọng số mô hình cho mỗi token sinh ra. Tốc độ sinh token vì thế bị giới hạn bởi băng thông bộ nhớ chứ không phải sức mạnh tính toán. Băng thông 4,8 TB/s của H200 cho tốc độ phản hồi nhanh hơn rõ so với H100 trên cùng mô hình.
Chọn bản SXM hay bản NVL
Bản SXM đi theo bo HGX 8 GPU trong máy chủ chuyên dụng, cho hiệu năng cao nhất. Bản NVL dạng PCIe lắp được vào máy chủ 4U thông thường, tiện khi bạn chỉ cần hai tới bốn GPU và không muốn đầu tư máy HGX.