# PYTHIA: Hệ thống AI khai thác triệu chứng lâm sàng tự động, không cần tinh chỉnh

Đăng ngày: 2026-07-21

Ghi chú lâm sàng là kho vàng thông tin về các dấu hiệu và triệu chứng bệnh, nhưng việc chuyển đổi chúng thành dữ liệu có cấu trúc lại là một thách thức lớn. Các phương pháp trích xuất hiện tại thường gặp hạn chế: hoặc dựa vào luật thiếu ngữ cảnh gây ra nhiều kết quả dương tính giả, hoặc đòi hỏi các mô hình được giám sát phải tinh chỉnh đáng kể và tốn kém. Trước thực trạng này, một nghiên cứu mới đã giới thiệu Pythia, một hệ thống đa tác tử tiên tiến, được thiết kế để tự động hóa hoàn toàn quá trình viết và tối ưu hóa các prompt nhằm phát hiện các khái niệm lâm sàng, loại bỏ hoàn toàn nhu cầu về kỹ thuật prompt thủ công hay tinh chỉnh mô hình. Pythia hoạt động dựa trên một mô hình mã nguồn mở được lưu trữ cục bộ, đảm bảo các ghi chú lâm sàng luôn nằm trong hạ tầng nội bộ, giải quyết triệt để vấn đề bảo mật dữ liệu nhạy cảm của bệnh nhân. Hệ thống này tự động lựa chọn các prompt tối ưu bằng cách đánh giá độ nhạy (sensitivity) và độ đặc hiệu (specificity) trên tập dữ liệu phát triển. Để kiểm chứng hiệu quả, Pythia đã được so sánh với một bộ từ điển được tuyển chọn và một bộ phân loại BERT được tinh chỉnh riêng cho từng khái niệm. Nghiên cứu sử dụng 72 dấu hiệu và triệu chứng từ 400 ghi chú lâm sàng của 387 bệnh nhân, chia thành tập phát triển (300 mẫu) và tập kiểm định (100 mẫu) độc lập cho mỗi khái niệm. Kết quả cho thấy Pythia đạt độ nhạy trung bình 0.76 và độ đặc hiệu 0.95, trong khi bộ từ điển chỉ đạt 0.82 độ nhạy và 0.76 độ đặc hiệu. Đáng chú ý, Pythia đã vượt trội hoặc ngang bằng bộ từ điển ở cả hai chỉ số trên 20 trong số 62 khái niệm có thể so sánh trực tiếp. Đặc biệt, với 14 khái niệm mà bộ từ điển gán nhãn dương tính cho mọi ghi chú, Pythia đã khôi phục được độ đặc hiệu trung bình lên tới 0.97 nhờ yêu cầu tìm kiếm các phát hiện ở thì hiện tại và gán cho bệnh nhân, thay vì chỉ đơn thuần tìm kiếm bất kỳ từ khóa nào. Trong khi đó, bộ phân loại BERT được tinh chỉnh riêng từng khái niệm chỉ đạt độ nhạy trung bình 0.23 và sụt giảm về 0 đối với các khái niệm có tỷ lệ xuất hiện dưới 5%. Khả năng tổng quát hóa của Pythia cũng được chứng minh khi độ đặc hiệu duy trì gần như nguyên vẹn từ tập phát triển sang tập kiểm định, dù độ nhạy có giảm nhẹ với các khái niệm có tỷ lệ xuất hiện dưới 5%. Những phát hiện này nhấn mạnh tiềm năng to lớn của việc tối ưu hóa prompt một cách tự động và không cần tinh chỉnh. Pythia không chỉ tạo ra các prompt trích xuất triệu chứng có khả năng tổng quát hóa hiệu quả từ dữ liệu phát triển sang kiểm định, mà còn có thể triển khai dễ dàng trên hạ tầng cục bộ. Điều này không chỉ mở ra hướng đi mới cho việc khai thác dữ liệu y tế mà còn đảm bảo an toàn, bảo mật thông tin bệnh nhân, một yếu tố tối quan trọng trong lĩnh vực chăm sóc sức khỏe.

Canonical: https://www.tungpham.vn/blog/pythia-he-thong-ai-khai-thac-trieu-chung-lam-sang-tu-dong-khong-can-tinh-chinh
