AIVISION là ai? Đơn vị AI Việt Nam tự huấn luyện LLM

01/10/2026

AIVISION là ai? Đơn vị AI Việt Nam tự huấn luyện LLM

Có một câu hỏi mà chúng tôi nghe đi nghe lại mỗi khi gặp người ngoài ngành: AIVISION thực ra làm gì? Là công ty làm chatbot, là đơn vị bán API, hay chỉ là một cái tên mới trong làn sóng AI? Câu trả lời ngắn gọn là thế này: AIVISION là một đơn vị AI tại Việt Nam, tự huấn luyện mô hình ngôn ngữ lớn (LLM) trên hạ tầng GPU của chính mình. Bài này kể cụ thể hơn một chút, kể cả những chỗ chúng tôi còn đang làm dở.

AIVISION làm gì, nói thẳng

Phần lõi công việc là huấn luyện và finetune LLM cho tiếng Việt. Không phải gọi một mô hình có sẵn của nước ngoài rồi đóng gói lại, mà là ngồi vào quy trình huấn luyện thật: chuẩn bị dữ liệu, chạy training, đánh giá, sửa, chạy lại. Nghe thì đơn giản, nhưng bất kỳ ai từng làm đều biết vòng lặp này ngốn thời gian và tiền bạc đến mức nào.

Hiện tại AIVISION đã phát hành hai model. Một là E1.0, model speech to text cho tiếng Việt, tức là chuyển giọng nói thành văn bản. Hai là L1.0, một LLM cho tiếng Việt. Chúng tôi cố ý đặt tên khiêm tốn là 1.0, vì đó đúng là phiên bản đầu tiên, và còn nhiều việc phải làm cho các phiên bản sau.

Ngoài hai model nền, chúng tôi làm training và finetune LLM cho các lĩnh vực cụ thể, trong đó có healthcare và dược. Hai mảng này đáng nói riêng, vì nó có những ràng buộc rất khác một chatbot chăm sóc khách hàng thông thường. Chúng tôi sẽ quay lại ở phần dưới.

Vì sao phải có hạ tầng riêng

Nhiều người hỏi vì sao không thuê GPU đám mây theo giờ cho nhẹ vốn. Câu trả lời thật là: thuê vẫn là lựa chọn hợp lý cho nhiều đội, và chúng tôi không phủ nhận. Nhưng khi quy trình huấn luyện là việc làm hằng ngày chứ không phải một lần thử nghiệm, việc có cluster riêng thay đổi cách làm việc. Bạn dám chạy thử một ý tưởng nghi ngờ, dám để máy chạy qua đêm, dám huấn luyện lại một lần nữa vì dữ liệu vừa được làm sạch.

Cluster của AIVISION gồm 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300. Về thông số công khai của NVIDIA, mỗi GPU H200 có 141GB bộ nhớ HBM3e với băng thông khoảng 4,8TB/s, còn B300 thuộc thế hệ Blackwell Ultra với khoảng 288GB HBM3e. Hai cụm này không thay thế nhau mà bổ sung nhau, chi tiết ở hai bài riêng về AIVISION mà chúng tôi sẽ đăng tiếp.

Một điều cần nói cho công bằng: có GPU tốt không tự động tạo ra mô hình tốt. Phần lớn chất lượng nằm ở dữ liệu, ở cách đánh giá, và ở sự kiên nhẫn của đội ngũ. GPU chỉ giúp vòng thử sai nhanh hơn. Ai nói phần cứng là tất cả thì đang bán phần cứng.

Tiếng Việt là bài toán riêng

Mô hình ngôn ngữ lớn của nước ngoài thường xử lý tiếng Việt ở mức dùng được, nhưng không phải lúc nào cũng tự nhiên. Ai đã dùng sẽ thấy: câu đúng ngữ pháp nhưng giọng văn hơi lạ, dùng từ Hán Việt chỗ không cần, hoặc lúng túng với cách xưng hô. Tiếng Việt có hệ thống thanh điệu, đại từ nhân xưng phức tạp, và rất nhiều biến thể vùng miền. Một LLM tiếng Việt tốt phải hiểu cả những thứ ấy.

Vì thế chúng tôi tập trung vào LLM tiếng Việt và speech to text tiếng Việt như hai mặt của cùng một bài toán: máy cần nghe được người Việt nói và cần viết ra, trả lời được bằng tiếng Việt đúng ngữ cảnh. Chúng tôi không đưa ra con số độ chính xác nào ở đây, vì một con số không kèm bộ dữ liệu và cách đo thì chẳng có nghĩa gì.

Healthcare và dược: làm cẩn thận hơn

Khi nói tới y tế, mọi thứ chậm lại. Chúng tôi làm finetune LLM cho lĩnh vực healthcare và dược, nhưng vai trò được xác định rất hẹp: hỗ trợ thông tin và công việc hành chính. Ví dụ tóm tắt tài liệu, sắp xếp thông tin, soạn nháp văn bản để người có chuyên môn xem lại.

  • Mô hình không chẩn đoán bệnh.
  • Mô hình không kê đơn và không khuyên liều dùng thuốc.
  • Quyết định cuối cùng luôn thuộc về bác sĩ, dược sĩ và người có chuyên môn y khoa.

Đây không phải câu rào đón cho đủ thủ tục. Một mô hình ngôn ngữ có thể viết ra câu trả lời rất trôi chảy mà vẫn sai, và trong y tế cái sai trôi chảy nguy hiểm hơn cái sai vụng về. Chúng tôi chọn thiết kế sản phẩm sao cho con người luôn là chốt chặn cuối.

Ba website, ba thị trường

AIVISION vận hành ba website: aivision.vn bằng tiếng Việt, aivgroups.com bằng tiếng Anh cho độc giả quốc tế, và aivision.mx cho thị trường Mexico. Việc có phiên bản riêng không phải trang trí. Mỗi thị trường có ngôn ngữ, thói quen và nhu cầu khác nhau, và chúng tôi muốn thấy rõ mình đang nói chuyện với ai. Với thị trường như Philippines hay Mexico, nơi tiếng bản địa và giọng nói địa phương cũng đa dạng không kém Việt Nam, những bài học từ tiếng Việt là kinh nghiệm đáng giá, dù chúng tôi không hứa trước điều gì về lộ trình.

Điều chúng tôi chưa làm được

Có vài thứ nên nói ra. Chúng tôi chưa công bố benchmark so sánh, chưa đưa ra số tham số của model, và sẽ không nói mô hình của mình hơn ai khi chưa có phép đo công khai đủ chặt. Nếu bạn đọc một trang giới thiệu AI mà ở đâu cũng là số một, hãy nghi ngờ nó.

Thứ chúng tôi làm được là cho bạn thấy mình đang đi đường nào: tự huấn luyện, tự sở hữu hạ tầng, phát hành model thật, và tập trung vào những bài toán tiếng Việt mà các mô hình đại trà thường bỏ qua. Nếu bạn là kỹ sư, nhà nghiên cứu hay người làm sản phẩm đang tìm hiểu về AI Việt Nam, những bài tiếp theo trên blog sẽ đi sâu vào từng mảng: cluster H200, B300, model E1.0 và L1.0, cùng những khó khăn của nhận dạng giọng nói tiếng Việt.

Chúng tôi viết blog này để ghi lại quá trình làm, cả phần chạy tốt lẫn phần hỏng. Mỗi bài sẽ có thứ gì đó cụ thể để bạn kiểm chứng hoặc phản biện, và chúng tôi hoan nghênh việc đó.

Bài viết liên quan

Xem tất cả bài viết