8 GPU B300 Blackwell Ultra: vai trò trong training và inference
01/10/2026

Ai cũng muốn nghe câu chuyện kiểu: mua GPU thế hệ mới nhất, mọi thứ nhanh gấp bội. Thực tế ở phòng máy ít kịch tính hơn. Khi AIVISION đưa 8 GPU B300 vào cụm, câu hỏi đầu tiên của đội kỹ sư không phải là nó nhanh đến đâu, mà là: nên giao việc gì cho nó, và việc gì thì vẫn để cụm H200 làm cho hợp lý.
B300 là gì và khác gì H200
B300 là GPU thuộc thế hệ Blackwell Ultra của NVIDIA. Theo thông số công khai ở mức khái quát, mỗi chiếc có khoảng 288GB bộ nhớ HBM3e, so với 141GB của H200. Nói gọn: cái bàn làm việc của B300 rộng gần gấp đôi.
Với 8 chiếc, tổng bộ nhớ GPU vào khoảng 2,3TB, đây là phép nhân đơn giản từ thông số công khai. Con số ấy không tự nó nói được mô hình nào chạy được hay chạy nhanh cỡ nào, và chúng tôi không đưa ra mức tăng tốc cụ thể vì chưa có phép đo công bố để dẫn.
Điều chúng tôi có thể nói chắc là bộ nhớ lớn trên mỗi GPU thay đổi cách chia việc. Một mô hình hay một lô tính toán trước đây phải rải ra nhiều chiếc, nay có thể nằm gọn trong ít chiếc hơn. Ít chiếc hơn nghĩa là bớt trao đổi qua mạng, bớt chỗ để lỗi phát sinh.
Vai trò trong training
Trong huấn luyện, bộ nhớ lớn giúp ích ở mấy chỗ rất thực tế. Thứ nhất là chạy được lô dữ liệu lớn hơn hoặc chuỗi văn bản dài hơn mà không phải cắt xén. Tiếng Việt có nhiều tài liệu dài như văn bản hành chính, hợp đồng, quy trình, và việc cho mô hình nhìn một lượt cả văn bản thay vì từng mảnh khiến việc học khác đi.
Trong finetune LLM, nhất là các đợt thử nghiệm nhanh, một cụm nhỏ gọn bộ nhớ lớn tiện hơn nhiều so với huy động cả cụm khổng lồ. Chạy thử một ý tưởng về cách trộn dữ liệu y tế hành chính chẳng hạn, 8 GPU B300 có thể là lựa chọn gọn, trong khi những đợt huấn luyện kéo dài cần nhiều chip hơn vẫn thuộc về cụm H200.
Nhưng đừng thần thánh hóa. Bộ nhớ lớn không cứu được dữ liệu kém. Nếu tập dữ liệu có lẫn tài liệu trùng lặp, nhãn sai hay văn bản dịch máy lủng củng, GPU đời nào cũng chỉ học nhanh hơn những điều sai.
Vai trò trong inference
Inference là giai đoạn mô hình đã huấn luyện xong và được dùng để trả lời thật. Ở giai đoạn này, bài toán đổi khác: không còn là học, mà là phục vụ nhiều yêu cầu cùng lúc, nhanh và ổn định.
Bộ nhớ lớn ở đây có hai tác dụng. Một là chứa được mô hình lớn hơn mà không phải chia nhỏ qua nhiều GPU. Hai là chứa bộ nhớ đệm cho các cuộc hội thoại dài, vì mô hình ngôn ngữ phải nhớ những gì đã nói trong phiên để trả lời tiếp. Phiên càng dài, phần đệm này càng phình ra, và nhiều hệ thống chạm trần bộ nhớ chính ở đây chứ không phải ở bản thân mô hình.
Chúng tôi sẽ không nêu độ trễ hay số yêu cầu mỗi giây ở đây. Những con số đó phụ thuộc vào mô hình, độ dài đầu vào, cách tối ưu phần mềm, và chúng tôi chưa công bố phép đo nào để bạn kiểm chứng.
Những đánh đổi thật sự
Mọi lựa chọn phần cứng đều kéo theo cái giá. Với B300 có mấy điều đáng cân nhắc:
- Phần mềm phải theo kịp. Thư viện, trình điều khiển và các kernel tối ưu cho thế hệ mới đôi khi chưa chín bằng thế hệ đã dùng lâu. Sẽ có những ngày bạn mất thời gian chỉ để mọi thứ chạy ổn định.
- Cụm nhỏ nghĩa là ít dư địa. Nếu một node cần bảo trì, 8 GPU mất phần đáng kể công suất, trong khi cụm 24 GPU chịu được tốt hơn.
- Phức tạp vận hành. Hai thế hệ GPU trong cùng hệ thống nghĩa là hai bộ cấu hình, hai kiểu lỗi, hai bộ kinh nghiệm để tích lũy.
- Điện và làm mát. GPU thế hệ mới không miễn phí về năng lượng, và phòng máy phải đáp ứng được.
Chúng tôi chọn chấp nhận những đánh đổi này vì lợi ích đủ lớn cho cách làm việc của đội. Nhưng nếu bạn nhỏ hơn, không có đội vận hành, thì nhảy ngay lên thế hệ mới nhất chưa chắc là nước đi khôn ngoan.
H200 và B300 phối hợp ra sao
Cách nghĩ đơn giản nhất: cụm 24 GPU H200 là xưởng chính cho các đợt huấn luyện lớn, còn 8 GPU B300 là cụm linh hoạt cho các tác vụ hưởng lợi từ bộ nhớ lớn, như thử nghiệm với ngữ cảnh dài hay phục vụ mô hình. Ranh giới không cứng, và phân bổ thay đổi theo từng dự án.
Điều này cũng liên quan trực tiếp đến sản phẩm. Khi làm LLM tiếng Việt cho lĩnh vực như healthcare và dược, ngữ cảnh dài rất hay gặp, vì tài liệu chuyên ngành thường dài và nhiều thuật ngữ. Cần nhắc lại: những mô hình này chỉ hỗ trợ thông tin và hành chính, không chẩn đoán, không kê đơn, không khuyên liều dùng, và người có chuyên môn y khoa là người quyết định cuối cùng.
Một lời khuyên cho người đang chọn phần cứng
Hãy bắt đầu từ khối lượng công việc, đừng bắt đầu từ tên chip. Nếu nút thắt của bạn là bộ nhớ, B300 đáng xem xét. Nếu nút thắt là tổng sức tính toán trong những đợt huấn luyện dài, số lượng GPU lại quan trọng hơn. Còn nếu nút thắt là dữ liệu hoặc quy trình đánh giá, thì không con chip nào giải quyết được.
Trong hành trình làm AI Việt Nam, chúng tôi học được rằng phần cứng chỉ là điều kiện cần. Đọc thêm về nền tảng của AIVISION và các bài về cụm H200 cùng model L1.0 để thấy bức tranh đầy đủ hơn.