Giỏ hàng

Thuật toán chưa thể thay bác sĩ X-quang

 

Năm 2017, CheXNet – mô hình AI được ra mắt và gây chấn động khi phát hiện viêm phổi chính xác hơn mhội đồng bác sĩ X-quang được chứng nhận. Được huấn luyện trên hơn 100.000 phim X-quang ngực, mô hình này chạy trên GPU phổ thông, miễn phí và có thể phân loại ảnh chụp mới trong chưa đầy một giây. Từ đó, các công ty như Annalise.ai, Lunit, Aidoc và Qure.ai tung ra các mô hình phát hiện hàng trăm bệnh trên nhiều loại ảnh chụp, thường nhanh và chính xác hơn bác sĩ trong các bài kiểm chuẩn.
 
Nếu có một ngành được thiết kế gần như hoàn hảo cho tự động hóa, đó là chẩn đoán hình ảnh: đầu vào số hóa, nhiệm vụ lặp lại, tiêu chuẩn đánh giá rõ ràng. Năm 2016, Geoffrey Hinton – nhà khoa học máy tính đoạt giải Turing, từng nói: “nên ngừng đào tạo bác sĩ X-quang ngay”. Đến nay, có hơn 700 mô hình X-quang được FDA cấp phép, chiếm hơn 3/4 số thiết bị AI y tế. Nhưng nghịch lý là nhu cầu lao động con người không giảm. Năm 2025, các chương trình nội trú chẩn đoán hình ảnh ở Mỹ mở kỷ lục 1.208 vị trí, tăng 4% so với năm 2024, tỷ lệ thiếu nhân lực ở mức cao nhất lịch sử. Cùng năm, X-quang là chuyên khoa y khoa được trả lương cao thứ hai tại Mỹ, với thu nhập trung bình 520.000 USD, cao hơn 48% so với năm 2015.
 
Vì sao AI giỏi trong phòng thí nghiệm nhưng khó vào bệnh viện
 
Có ba lý do chính. Thứ nhất, mô hình có thể thắng trên benchmark nhưng thường suy giảm khi ra môi trường bệnh viện. Phần lớn mô hình chỉ trả lời câu hỏi hẹp trên loại ảnh cụ thể: có nốt phổi không, có gãy xương sườn không, điểm vôi hóa mạch vành là bao nhiêu. Muốn bao phủ ngày làm việc bình thường, bác sĩ phải dùng hàng chục mô hình khác nhau. Dù FDA phê duyệt hàng trăm thuật toán, phần lớn tập trung vào vài mảng như đột quỵ, ung thư vú và ung thư phổi, chiếm khoảng 60% số mô hình nhưng chỉ là phần nhỏ khối lượng ảnh chụp thực tế ở Mỹ.
 
Vấn đề nằm ở dữ liệu. Năm 2024, trong số các mô hình có báo cáo số địa điểm thử nghiệm, 38% chỉ được kiểm tra bằng dữ liệu từ bệnh viện duy nhất. Khi thử trên dữ liệu ngoài mẫu, hiệu suất có thể giảm tới 20 điểm phần trăm. Mô hình phát hiện viêm phổi huấn luyện tại một bệnh viện có thể kém đi rõ rệt ở bệnh viện khác, chỉ vì khác máy chụp, cách ghi dữ liệu hoặc quy trình lâm sàng. Dữ liệu huấn luyện cũng thường thiên về ca rõ ràng, ít ảnh mờ, góc chụp lạ hoặc bệnh nhẹ; đồng thời thiếu trẻ em, phụ nữ và nhóm thiểu số, khiến độ chính xác giảm ở các nhóm này.
 
Bài học cũ từ chụp nhũ ảnh càng đáng chú ý. Năm 1998, FDA phê duyệt hệ thống hỗ trợ chẩn đoán bằng máy tính; năm 2001, Medicare bắt đầu hoàn trả thêm 7 USD cho mỗi phim nhũ ảnh có dùng công nghệ này. Đến năm 2010, khoảng 74% phim nhũ ảnh ở Mỹ được đọc cùng phần mềm. Nhưng nghiên cứu trên 430.000 phim của 200.000 phụ nữ tại 43 phòng khám cho thấy phần mềm làm tăng 20% số ca sinh thiết nhưng không phát hiện thêm ung thư. Đến năm 2018, Medicare ngừng trả thêm tiền cho công nghệ này.
 
Rào cản pháp lý, bảo hiểm và công việc thật của bác sĩ
 
Lý do thứ hai là pháp lý. FDA chia phần mềm hình ảnh thành hai nhóm: công cụ hỗ trợ (vẫn cần bác sĩ đọc và ký), và công cụ tự động (không cần bác sĩ). Nhóm tự động phải chứng minh có thể từ chối ảnh mờ, ảnh ngoài năng lực hoặc ảnh từ thiết bị bất thường. LumineticsCore, một trong số ít công cụ được phép hoạt động tự động để sàng lọc bệnh võng mạc tiểu đường, cũng bị giới hạn: chỉ dùng cho người lớn chưa từng được chẩn đoán bệnh, cần hai ảnh đáy mắt đúng chuẩn, độ phân giải ít nhất 1.000 x 1.000 pixel, và phải tự dừng nếu ảnh kém chất lượng.
 
Bảo hiểm cũng là nút thắt. Sai sót chẩn đoán chiếm khoảng 1/3 tổng chi trả do kiện tụng y khoa ở Mỹ. Nhiều hợp đồng bảo hiểm chỉ bảo vệ kết luận được bác sĩ có giấy phép xem xét và xác nhận, không bảo vệ chẩn đoán do phần mềm tự động tạo ra. Vì vậy, bệnh viện khó để thuật toán tự ký báo cáo.
 
Lý do thứ ba, AI chỉ thay thế phần nhỏ công việc. Một nghiên cứu năm 2012 tại ba bệnh viện cho thấy bác sĩ X-quang chỉ dành 36% thời gian cho việc đọc ảnh trực tiếp. Phần còn lại là giám sát quy trình chụp, trao đổi với bác sĩ điều trị và bệnh nhân, đào tạo bác sĩ nội trú, xem lại chỉ định và điều chỉnh phác đồ chụp.
 
Máy tốt hơn, bác sĩ bận hơn
 
Khi dịch vụ rẻ hơn và nhanh hơn, nhu cầu có thể tăng mạnh. Đầu những năm 2000, khi bệnh viện chuyển từ phim sang hệ thống số, năng suất bác sĩ X-quang tại Vancouver General tăng 27% với X-quang thường và 98% với CT trong một năm. Không ai bị sa thải. Trái lại, từ năm 2000–2008, tỷ lệ sử dụng chẩn đoán hình ảnh ở Mỹ trên 1.000 bệnh nhân có bảo hiểm tăng 60%. Thời gian trả kết quả X-quang giảm từ 76 giờ xuống 38 giờ với bệnh nhân xuất viện từ cấp cứu, và từ 84 giờ xuống 35 giờ với bệnh nhân nhập viện.
 
Vì vậy, bài học của X-quang không phải là AI vô dụng, cũng không phải là con người chắc chắn bị thay thế. Trong thập niên đầu lan tỏa, AI thường nâng năng suất nhưng bị giới hạn bởi dữ liệu, hành vi con người, quy định, bảo hiểm và nhu cầu thực tế. Với các công việc tri thức phức tạp, rủi ro cao và nhu cầu co giãn, phần mềm ban đầu có thể tạo thêm việc cho con người, không phải lấy mất việc. Nghịch lý hiện vẫn đứng vững: máy càng giỏi, bác sĩ X-quang càng bận.
 
shared via works in progress, 

Bình luận

This site is protected by reCAPTCHA and the Google Privacy Policy and Terms of Service apply.
Bình luận của bạn sẽ được duyệt trước khi đăng lên