So sánh hiệu năng của các mô hình ngôn ngữ lớn (LLM) từ Trung Quốc và Hoa Kỳ trong việc giải quyết các câu hỏi về yếu tố xã hội quyết định sức khỏe (SDoH) trong nhãn khoa

Bs Ngô Hữu Thế
2.8.26
Last Updated

Bối cảnh và Thiết kế nghiên cứu

Nghiên cứu cắt ngang này đánh giá khả năng của 8 mô hình ngôn ngữ lớn (LLM) trong việc nhận diện các tuyên bố đúng/sai liên quan đến các yếu tố xã hội quyết định sức khỏe (SDoH) và sự bất bình đẳng trong nhãn khoa. Tổng cộng 238 cặp tuyên bố được trích xuất từ y văn đã qua bình duyệt, sau đó được tạo các tuyên bố đối lập (sai) để kiểm tra độ chính xác của mô hình.

Các mô hình được đánh giá bao gồm: DeepSeek-V3, DeepSeek-R1, ChatGPT o1, ChatGPT-4o, ChatGPT-4, ChatGPT-3.5, Gemini 1 và Gemini 1.5 Pro. Nghiên cứu tập trung so sánh giữa các mô hình suy luận (reasoning models) và mô hình không suy luận, cũng như giữa các mô hình mã nguồn mở và độc quyền.

Kết quả lâm sàng trọng tâm

Độ chính xác tổng thể của các mô hình dao động từ 78.2% đến 92.0%. DeepSeek-V3 đạt hiệu suất cao nhất, trong khi Gemini 1 và ChatGPT-4 có hiệu suất thấp nhất.

Chỉ số/Phân nhómKết quả chính
Độ chính xác tổng thể78.2% - 92.0%
Hiệu suất thấp nhất (Chuyên khoa)Bệnh lý mắt trẻ em (52.4%, p=0.016)
Hiệu suất thấp nhất (Chủng tộc)Chủng tộc châu Á (70.3%, p=0.044)
Mô hình dẫn đầuDeepSeek-V3, DeepSeek-R1, ChatGPT o1
  • Các mô hình suy luận (DeepSeek-R1, ChatGPT o1) thường vượt trội hơn các mô hình không suy luận.
  • Phát hiện đáng chú ý: Gemini 1.5 Pro cho thấy độ chính xác thấp hơn đáng kể đối với các tuyên bố liên quan đến người da trắng (p=0.041).
  • Sự biến thiên nội tại (intramodal variation) được ghi nhận ở ChatGPT-4o và Gemini 1.5 Pro.

Bài học thay đổi thực hành (Take-home Message)

Các LLM hiện nay vẫn tồn tại những khoảng trống kiến thức và định kiến hệ thống liên quan đến SDoH trong nhãn khoa, đặc biệt là trong các lĩnh vực bệnh lý mắt trẻ em và các nhóm chủng tộc cụ thể. Bác sĩ lâm sàng cần đánh giá phản hồi từ AI một cách thận trọng, không nên coi đây là nguồn thông tin tuyệt đối. Việc tích hợp Retrieval-Augmented Generation (RAG) với các cơ sở dữ liệu đã được kiểm chứng là hướng đi cần thiết để giảm thiểu hiện tượng ảo giác và tăng tính minh bạch cho các ứng dụng AI trong y tế.


Tài liệu tham khảo:

Wang ET, Song SS, Peng KC, Liu TY. Comparison between China-based DeepSeek and US-based major LLMs in answering social determinants of health questions in ophthalmology. Asia-Pac J Ophthalmol (Phila). 2026;15(1):100276. doi:10.1016/j.apjo.2026.100276

(Tệp gốc: Comparison between China-based DeepSeek and US-based major LLMs in answering social determinants of health questions in ophthalmology)

Xem thêm