Danh mục đúng mã hàng
Sản phẩm được quản lý theo đúng model và Part Number của hãng, gồm cả hậu tố về cấu hình GPU, số socket, loại nguồn và khay ổ cứng. Điều này giúp tránh nhầm cấu hình khi đặt hàng và khi bảo hành.
Huấn luyện là khoản đầu tư một lần. Suy luận là chi phí chạy hằng ngày, kéo dài suốt vòng đời sản phẩm. Vì vậy câu hỏi đúng khi thiết kế hạ tầng suy luận không phải "GPU nào mạnh nhất" mà là "chi phí cho mỗi nghìn lượt truy vấn là bao nhiêu".
Sự khác biệt này dẫn tới những lựa chọn phần cứng hoàn toàn khác với huấn luyện.
Khi phục vụ một mô hình, bộ nhớ GPU chia làm hai phần: trọng số mô hình, và bộ nhớ đệm KV cho từng phiên đang hoạt động. Trọng số cố định; bộ nhớ đệm KV tăng tuyến tính theo số phiên và độ dài ngữ cảnh.
Ví dụ cụ thể: mô hình 70 tỷ tham số lượng tử hoá 4-bit chiếm khoảng 35 GB. Trên GPU 80 GB, bạn còn 45 GB cho bộ nhớ đệm KV — đủ cho vài chục phiên ngữ cảnh vừa. Trên GPU 141 GB, phần dôi ra hơn gấp đôi, nghĩa là phục vụ được gấp đôi số người dùng trên cùng một máy.
Đây là lý do với suy luận, bộ nhớ GPU thường quan trọng hơn sức mạnh tính toán.
Có hai chiến lược, và lựa chọn phụ thuộc vào mô hình bạn chạy:
Nguyên tắc thực dụng: nếu mô hình vừa một GPU, hãy chọn nhiều GPU nhỏ.
Chuyển mô hình từ FP16 xuống INT8 giảm một nửa bộ nhớ; xuống FP4 hoặc INT4 giảm bốn lần. Với phần lớn ứng dụng thực tế, chất lượng đầu ra gần như không đổi ở mức INT8, và giảm nhẹ ở mức 4-bit.
Điều này có nghĩa: một mô hình cần 4 GPU ở FP16 có thể chạy trên 1 GPU ở 4-bit. Trước khi mua thêm phần cứng, hãy thử lượng tử hoá — đây là khoản tiết kiệm lớn nhất mà không tốn gì.
Chọn đúng phần mềm phục vụ tạo khác biệt hai tới ba lần về thông lượng trên cùng phần cứng. Các lựa chọn phổ biến gồm NVIDIA Triton Inference Server và TensorRT-LLM cho hiệu năng cao nhất trên GPU NVIDIA, hoặc vLLM với cơ chế PagedAttention giúp dùng bộ nhớ đệm KV hiệu quả hơn nhiều so với cách phục vụ thông thường.
Mua máy chủ AI trọn gói — tư vấn cấu hình theo bài toán, khảo sát điện và làm mát, bàn giao máy đã cài sẵn môi trường chạy được.
Sản phẩm được quản lý theo đúng model và Part Number của hãng, gồm cả hậu tố về cấu hình GPU, số socket, loại nguồn và khay ổ cứng. Điều này giúp tránh nhầm cấu hình khi đặt hàng và khi bảo hành.
Hỗ trợ chọn GPU, CPU, dung lượng RAM, ổ NVMe, nguồn và phương án làm mát theo đúng mô hình bạn định chạy, số người dùng đồng thời và ngân sách điện của phòng máy.
Mỗi sản phẩm được đối chiếu với datasheet và tài liệu kỹ thuật của hãng, hiển thị rõ thông số, mã đặt hàng, tình trạng vòng đời, thành phần đi kèm và sản phẩm tương thích.
Chọn GPU, CPU, RAM và dung lượng lưu trữ theo đúng mô hình bạn chạy — huấn luyện, tinh chỉnh hay suy luận — thay vì mua thừa rồi để không.
Máy chủ GPU ăn điện và toả nhiệt lớn. Chúng tôi tính sẵn công suất nguồn, luồng gió và tải giá đỡ để hệ thống chạy hết hiệu năng mà không bị hạ xung.
Máy về đã cài sẵn driver, CUDA và môi trường container, kiểm tra thông số dưới tải trước khi giao.