LLM tiếng Việt L1.0 của AIVISION: giới thiệu và những việc làm được

01/10/2026

LLM tiếng Việt L1.0 của AIVISION: giới thiệu và những việc làm được

Một mô hình ngôn ngữ trả lời trôi chảy không có nghĩa là nó đúng. Câu này nghe hiển nhiên, nhưng là bài học đắt giá nhất mà những ai làm sản phẩm AI đều trải qua ít nhất một lần. Khi chúng tôi ở AIVISION phát hành L1.0, một LLM tiếng Việt, chúng tôi muốn giới thiệu nó theo đúng tinh thần ấy: nói rõ nó là gì, nó hữu ích ở đâu, và nó chưa nên được tin ở chỗ nào.

L1.0 là gì

L1.0 là mô hình ngôn ngữ lớn dành cho tiếng Việt, do AIVISION huấn luyện trên hệ thống cluster GPU gồm 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300. Chữ L trong tên ứng với language, giống như chữ E trong E1.0 gợi tới mảng nhận dạng giọng nói, và số 1.0 nhắc rằng đây là phiên bản đầu.

Bạn sẽ không thấy ở đây số tham số, kích thước dữ liệu huấn luyện, điểm benchmark hay thứ hạng. Chúng tôi chưa công bố những thông tin đó, và chúng tôi không muốn đoán mò hoặc làm tròn cho đẹp. Quan điểm của AIVISION là một mô hình nên được đánh giá bằng việc dùng thật trên công việc thật của bạn, hơn là bằng một con số trong bài giới thiệu.

Một LLM tiếng Việt làm được những việc gì

Phần này nói về năng lực điển hình của một mô hình ngôn ngữ lớn xử lý tiếng Việt, như một cách hình dung chung về loại việc có thể giao cho công cụ này. Mức độ tốt của từng việc phụ thuộc vào mô hình cụ thể và cách bạn dùng, và bạn nên tự thử trước khi tin.

  • Soạn và chỉnh văn bản: viết nháp email, thông báo, bài đăng, rồi chỉnh giọng văn cho trang trọng hay thân mật hơn.
  • Tóm tắt: rút gọn tài liệu dài, biên bản họp, chuỗi trao đổi thành vài ý chính.
  • Trả lời câu hỏi dựa trên tài liệu: người dùng hỏi, hệ thống tìm trong kho tài liệu nội bộ rồi diễn đạt lại câu trả lời bằng tiếng Việt.
  • Trích xuất thông tin: lấy ngày, tên, số hợp đồng, các điều khoản chính từ văn bản không có cấu trúc.
  • Phân loại và gắn nhãn: phân loại phản hồi khách hàng, xếp yêu cầu vào nhóm.
  • Biến đổi định dạng: từ văn bản nói sang văn bản viết, từ đoạn văn sang bảng, từ ghi chú rời rạc sang báo cáo.

Ghép với model speech to text, chuỗi này đi trọn vòng: giọng nói thành văn bản, văn bản thành bản tóm tắt. Đó là lý do hai model E1.0 và L1.0 được phát triển song song.

Vì sao cần một mô hình riêng cho tiếng Việt

Mô hình đa ngôn ngữ lớn có thể xử lý tiếng Việt khá, nhưng chúng tôi vẫn thấy những khoảng trống. Cách xưng hô là một ví dụ: anh, chị, em, ông, bà, cháu, mỗi cách chọn mang theo quan hệ, tuổi tác, mức độ lịch sự. Dùng sai cặp xưng hô, văn bản đúng ngữ pháp vẫn nghe như người nước ngoài viết. Tương tự với các thành ngữ, cách nói giảm nói tránh, văn phong hành chính đặc trưng, hay những cách dùng từ thay đổi theo vùng miền.

Chúng tôi tập trung vào những chi tiết này vì với người dùng tiếng Việt, đó là khác biệt giữa công cụ dùng được và công cụ dùng thích. Nhưng cần thành thật: chúng tôi chưa dám nói đã giải quyết hết. Đây là mảng còn nhiều việc, và mỗi phiên bản sau là một bước tiến dần chứ không phải một cú nhảy.

Finetune theo lĩnh vực

Một mô hình nền chỉ là điểm xuất phát. Giá trị thực tế thường đến từ finetune LLM: huấn luyện tiếp trên dữ liệu của một lĩnh vực cụ thể để mô hình quen với thuật ngữ, văn phong, và quy trình của lĩnh vực đó. AIVISION thực hiện việc này cho tiếng Việt và cho các lĩnh vực như healthcare và dược.

Với healthcare và dược, chúng tôi đặt ranh giới rất rõ. Mô hình chỉ là công cụ hỗ trợ thông tin và hành chính, chẳng hạn tóm tắt tài liệu, soạn nháp, sắp xếp thông tin để người có chuyên môn xem. Nó không chẩn đoán, không kê đơn, không khuyên liều dùng. Chuyên môn y khoa của bác sĩ, dược sĩ luôn là tiếng nói cuối cùng. Lý do thẳng thắn: LLM có thể bịa ra điều nghe rất thuyết phục, mà trong y tế, thứ thuyết phục nhưng sai là thứ nguy hiểm nhất.

Giới hạn bạn cần biết

Mọi mô hình ngôn ngữ lớn, kể cả L1.0, đều có những giới hạn chung của loại công nghệ này.

  • Có thể bịa thông tin. Khi không biết, mô hình đôi khi vẫn trả lời tự tin. Với tài liệu quan trọng, hãy đối chiếu nguồn.
  • Kiến thức có điểm dừng. Mô hình chỉ biết những gì có trong dữ liệu lúc huấn luyện, trừ khi được nối với nguồn thông tin cập nhật.
  • Phụ thuộc vào cách hỏi. Cùng một yêu cầu, diễn đạt khác nhau có thể cho kết quả khác nhau.
  • Không thay thế quyết định của con người trong các việc có hậu quả pháp lý, tài chính, y tế.

Chúng tôi coi việc nói rõ những giới hạn này là một phần của sản phẩm. Người dùng biết chỗ nào nên tin, chỗ nào phải kiểm tra, thì dùng công cụ hiệu quả hơn nhiều so với người được hứa hẹn quá lời.

Cách thử một LLM cho công việc của bạn

Lời khuyên thực dụng: đừng thử bằng câu hỏi chung chung như hãy giới thiệu về Hà Nội. Hãy lấy năm đến mười tình huống thật trong công việc của bạn, kèm câu trả lời bạn cho là đúng, và xem mô hình xử lý ra sao. Chú ý vào những lần nó sai, vì kiểu sai quan trọng hơn tỷ lệ sai: sai vụng thì dễ phát hiện, sai trôi chảy mới đáng lo.

Nếu bạn quan tâm tới AI Việt Nam và muốn theo dõi cách L1.0 phát triển, bạn có thể ghé trang chủ AIVISION. Cùng cách làm này, chúng tôi cũng quan tâm đến các thị trường như Mexico và Philippines, nơi người dùng cũng cần mô hình hiểu ngôn ngữ và văn hóa địa phương thay vì chỉ dịch từ tiếng Anh.

Bài viết liên quan

Xem tất cả bài viết