Cỗ máy đã chứng minh được mình
DGX A100 ra mắt trước làn sóng mô hình ngôn ngữ lớn hiện nay, nhưng vẫn là một trong những hệ thống được triển khai rộng nhất trong các trung tâm nghiên cứu. Lý do đơn giản: nó là máy chủ AI đầu tiên gói trọn phần cứng, phần mềm và cấu hình mạng thành một khối đã được NVIDIA kiểm thử, thay vì để khách hàng tự ghép.
Tám GPU A100 SXM4 nối với nhau bằng NVLink thế hệ 3 với băng thông 600 GB/s, chạy trên nền hai CPU AMD EPYC 7742 tổng 128 lõi và 256 luồng. Toàn hệ đạt 5 petaFLOPS ở các phép tính AI.
Hai lựa chọn bộ nhớ GPU
Bản 320 GB dùng A100 40 GB, bản 640 GB dùng A100 80 GB, cùng băng thông HBM2e 1,6 TB/s. Chênh lệch này quyết định nhiều hơn người ta tưởng: với mô hình cỡ 30–70 tỷ tham số, bản 640 GB cho phép giữ trọn mô hình cùng trạng thái tối ưu hoá trên GPU, còn bản 320 GB buộc phải dùng kỹ thuật chia trạng thái và chấp nhận chậm hơn.
Công nghệ MIG – chia một GPU thành bảy
A100 hỗ trợ Multi-Instance GPU, cho phép cắt một GPU vật lý thành tối đa bảy phiên bản độc lập, mỗi phiên bản có phần bộ nhớ và luồng tính toán riêng biệt về mặt phần cứng. Với trường đại học hoặc phòng lab có nhiều sinh viên cùng chạy bài tập nhỏ, một máy DGX A100 phục vụ được tới 56 phiên làm việc song song mà không ai ảnh hưởng tới ai. Đây là điểm mà các thẻ GPU rời khó bì kịp.
Mạng dựng sẵn cho việc mở rộng cụm
Mười card ConnectX-6 VPI HDR InfiniBand 200 Gb/s được lắp sẵn, tỷ lệ gần như một card cho mỗi GPU. Đó là cấu hình mạng cần thiết nếu sau này bạn ghép nhiều máy DGX thành cụm — phần thường bị bỏ sót khi tự dựng máy chủ GPU và phải làm lại tốn kém.
Khi nào nên chọn DGX A100
Chọn hệ thống này khi bạn cần một nền tảng ổn định, có tài liệu và cộng đồng lớn, cho huấn luyện mô hình cỡ vừa, tinh chỉnh mô hình mở, mô phỏng khoa học và giảng dạy. Nếu mục tiêu là suy luận mô hình rất lớn với ngữ cảnh dài, các thế hệ H200 hoặc B200 sẽ hiệu quả hơn trên mỗi watt điện.