Grace Blackwell trong khuôn khổ phòng máy sẵn có
GB200 NVL2 tồn tại để trả lời một câu hỏi thực tế: làm sao dùng kiến trúc Grace Blackwell khi phòng máy không thể cấp trăm kilowatt và không có hệ thống làm mát chất lỏng. Thay vì cả tủ rack, NVL2 gói hai GPU Blackwell và hai CPU Grace vào một khung 2U đặt vừa tủ rack tiêu chuẩn, làm mát bằng khí như máy chủ thông thường.
Bạn không có 72 GPU trong một miền NVLink, nhưng vẫn giữ được thứ quan trọng nhất của kiến trúc này: CPU và GPU nối trực tiếp qua NVLink-C2C với 900 GB/s mỗi chiều, thay vì phải đi qua khe PCIe.
Vì sao NVLink-C2C quan trọng
Trong máy chủ GPU truyền thống, dữ liệu phải chép từ RAM hệ thống qua PCIe sang bộ nhớ GPU trước khi tính toán. Với mô hình lớn hơn bộ nhớ GPU, bước chép này lặp lại liên tục và trở thành điểm nghẽn. NVLink-C2C rút băng thông đó lên nhiều lần, cho phép GPU coi bộ nhớ LPDDR5X của Grace như phần mở rộng của bộ nhớ riêng. Với suy luận mô hình có ngữ cảnh dài và bộ nhớ đệm KV lớn, khác biệt thể hiện ngay ở độ trễ.
144 lõi Arm không phải để trang trí
Hai CPU Grace cung cấp 144 lõi Arm Neoverse V2. Trong nhiều đường ống AI thực tế, phần tiền xử lý dữ liệu — giải mã ảnh, tách token, tăng cường dữ liệu — chạy trên CPU và thường khiến GPU phải chờ. Số lõi dồi dào ở đây giúp giữ GPU luôn có việc, điều mà một máy chủ x86 hai socket tầm trung khó làm được khi tải dữ liệu nặng.
Hợp với ai
NVL2 là lựa chọn cho doanh nghiệp muốn tự chạy mô hình nội bộ ở quy mô phòng ban tới toàn công ty: trợ lý nội bộ, tìm kiếm ngữ nghĩa trên kho tài liệu, phân tích văn bản hợp đồng, hệ khuyến nghị. Đây cũng là bước đệm hợp lý trước khi cam kết đầu tư vào một tủ NVL72.