Bảo mật dữ liệu y tế khi dùng LLM: on-premise, ẩn danh, phân quyền
01/10/2026

Một giám đốc công nghệ của bệnh viện từng nói với tôi, nửa đùa nửa thật: nhân viên của tôi chưa cần ai dạy cũng biết dán hồ sơ bệnh nhân vào một chatbot công cộng để nhờ tóm tắt. Câu đùa đó không vui, vì nó thật. Khi nói về bảo mật dữ liệu y tế với LLM, rủi ro lớn nhất thường không đến từ hacker mà đến từ chính sự tiện tay của người dùng.
Là đơn vị làm LLM tiếng Việt, AIVISION nhìn bảo mật như một phần của thiết kế ngay từ đầu, không phải lớp sơn phủ sau cùng. Bài này nói về ba lớp mà chúng tôi nghĩ đến: nơi chạy mô hình, cách xử lý dữ liệu trước khi vào mô hình, và ai được thấy cái gì.
Lớp một: mô hình chạy ở đâu
Câu hỏi đầu tiên cần trả lời trước mọi cuộc bàn về chất lượng là dữ liệu đi đâu. Có ba kiểu triển khai phổ biến, và mỗi kiểu đánh đổi khác nhau.
- Gọi dịch vụ đám mây công cộng qua API: nhanh, rẻ để bắt đầu, nhưng dữ liệu rời khỏi hạ tầng của bạn. Với hồ sơ bệnh án, nhiều đơn vị không chấp nhận được điều này.
- Đám mây riêng hoặc vùng dữ liệu cô lập: dữ liệu nằm trong môi trường bạn kiểm soát hợp đồng, cân bằng giữa linh hoạt và an toàn.
- On-premise: mô hình chạy ngay trong trung tâm dữ liệu của bệnh viện. Dữ liệu không ra khỏi tường rào, nhưng bạn phải tự lo phần cứng, vận hành, cập nhật.
Tôi không cho rằng on-premise luôn là đáp án đúng. Với một phòng khám nhỏ, tự vận hành máy chủ GPU có thể tốn công hơn lợi ích, và một hệ thống bảo mật kém ở máy chủ tự dựng còn tệ hơn một đám mây được quản lý tốt. Nhưng với bệnh viện lớn, hoặc dữ liệu có yêu cầu pháp lý nghiêm ngặt, chạy mô hình trong hạ tầng của chính mình là lựa chọn hợp lý và nhiều đơn vị ưu tiên. Hướng thiết kế của chúng tôi là hỗ trợ cả triển khai nội bộ, nơi mô hình đi đến dữ liệu thay vì ngược lại.
Lớp hai: ẩn danh hoá trước khi xử lý
Nhiều tác vụ không cần biết bệnh nhân là ai. Tóm tắt một ghi chép, chuẩn hoá thuật ngữ, tìm quy trình tương ứng: những việc này không phụ thuộc vào họ tên hay số căn cước. Vậy tại sao lại đưa chúng vào?
Ẩn danh hoá là bước lọc trước khi dữ liệu chạm vào mô hình: phát hiện họ tên, số điện thoại, địa chỉ, mã số bệnh nhân, ngày sinh, rồi thay bằng ký hiệu thay thế. Sau khi mô hình trả kết quả, nếu cần thì gắn lại từ một bảng đối chiếu được lưu riêng, có phân quyền.
Chỗ khó nằm ở các chi tiết. Tên người Việt rất dễ trùng với từ thường: một tên riêng có thể là một danh từ trong câu khác. Địa chỉ viết tắt, viết thiếu, đặt giữa câu mô tả. Một chi tiết hiếm gặp, như nghề nghiệp đặc thù kèm nơi ở nhỏ, đủ để nhận ra một người dù không có tên. Vì vậy ẩn danh hoá không bao giờ hoàn hảo, và chúng tôi không hứa là hoàn hảo. Nó giảm rủi ro, không loại bỏ rủi ro. Nó cần được kiểm thử trên chính loại dữ liệu của đơn vị, với một mẫu rà soát thủ công định kỳ.
Có một lựa chọn trung gian nên cân nhắc: chỉ đưa vào mô hình phần dữ liệu tối thiểu cần thiết cho tác vụ. Tóm tắt một đợt điều trị không cần đưa kèm cả lịch sử hành chính của bệnh nhân. Nguyên tắc dữ liệu tối thiểu nghe khô khan nhưng là một trong những biện pháp rẻ và hiệu quả nhất.
Lớp ba: kiểm soát truy cập
Dù mô hình chạy trong nhà và dữ liệu đã ẩn danh, vẫn còn câu hỏi: ai hỏi được gì. Một hệ thống tra cứu hồ sơ gắn với LLM có thể vô tình trở thành cánh cửa sau nếu nó đọc được mọi thứ và trả lời cho bất kỳ ai.
- Phân quyền theo vai trò: điều dưỡng, bác sĩ, nhân viên thanh toán thấy những phần khác nhau.
- Mô hình chỉ truy hồi từ những tài liệu mà chính người hỏi được phép xem, không phải toàn bộ kho.
- Ghi nhật ký: ai hỏi gì, lúc nào, hệ thống trả lời dựa trên tài liệu nào.
- Giới hạn xuất dữ liệu hàng loạt, và cảnh báo khi có truy vấn bất thường.
Điểm thứ hai trong danh sách là chỗ nhiều dự án vấp. Nếu bạn lập chỉ mục toàn bộ hồ sơ vào một kho rồi cho mô hình tìm kiếm, mà quên gắn quyền truy cập vào từng tài liệu, bạn đã tạo ra công cụ cho phép một nhân viên hỏi về bệnh nhân không thuộc phạm vi chăm sóc của mình. Phân quyền phải áp dụng ở tầng truy hồi, trước khi nội dung đến được mô hình, chứ không thể nhờ mô hình tự biết điều.
Những thứ hay bị quên
Còn vài chỗ rò rỉ ít người nghĩ đến. Nhật ký hệ thống có thể chứa nguyên văn câu hỏi, và vô tình biến thành một kho dữ liệu nhạy cảm thứ hai. Bản sao lưu cũng cần mã hoá. Dữ liệu dùng để huấn luyện hoặc finetune thêm phải có quy định riêng: được dùng khi nào, đã ẩn danh chưa, ai duyệt. Và nhà cung cấp, kể cả chúng tôi, phải nói rõ bằng văn bản về việc có giữ dữ liệu hay không, trong bao lâu, để làm gì.
Tôi cũng muốn nhắc về con người. Quy trình tốt đến mấy cũng thua một nhân viên dán dữ liệu vào công cụ công cộng vì công cụ chính thức quá chậm hoặc khó dùng. Bảo mật tốt là bảo mật mà đồng nghiệp muốn dùng. Nếu công cụ nội bộ tiện hơn đường tắt, người ta sẽ chọn đường chính.
Điều chúng tôi không nói
AIVISION huấn luyện mô hình trên cluster 24 GPU NVIDIA H200 và 8 GPU NVIDIA B300, đã phát hành LLM L1.0 và mô hình speech to text E1.0 cho tiếng Việt, và làm finetune cho các lĩnh vực như y tế. Chúng tôi không đưa ra cam kết kiểu tuyệt đối an toàn, vì không hệ thống nào đạt được điều đó và ai hứa vậy thì đáng nghi. Điều nên làm là đánh giá rủi ro theo từng bối cảnh, thống nhất với bộ phận pháp chế và an toàn thông tin của đơn vị, thử nghiệm trước trên dữ liệu giả lập, rồi mới chạm đến dữ liệu thật. Và bất kể công nghệ nào, nội dung do mô hình tạo ra trong y tế vẫn cần con người rà soát trước khi dùng.