Vì sao trang này đọc khác đi
Phần lớn cẩm nang này được xây dựng xoay quanh sự bất định, hiểm nguy, và những khoảng trống trung thực trong những gì có thể kiểm chứng. Trang này thì khác: nó tập hợp các kết quả khoa học do AI thúc đẩy có ghi ngày tháng, có thể kiểm tra được, và trong một trường hợp đã mang về một giải Nobel — nhưng cũng chính chương trình nghiên cứu tạo ra phương pháp đoạt giải Nobel đó cũng đã tạo ra một bài báo Nature bị đính chính chính thức và một công cụ chẩn đoán hoạt động tốt trong phòng thí nghiệm nhưng vấp ngã tại một phòng khám thực tế. Việc giữ đồng thời cả hai sự thật này — thành tựu chân thực và sự thổi phồng chân thực, từ cùng một phòng thí nghiệm, đôi khi cùng một năm — chính là trọng tâm của trang này, không phải một mâu thuẫn cần giải quyết.
Mọi thứ dưới đây liên quan đến học máy hẹp, chuyên biệt cho một nhiệm vụ, được áp dụng cho một vấn đề khoa học hoặc y tế, chứ không phải AGI. Việc một hệ thống tổng quát nào đó trong tương lai sẽ tăng tốc toàn bộ khoa học cùng một lúc là một kịch bản, được đề cập tại lợi ích của AI và chi phí cơ hội của sự trì hoãn; trang này chỉ tập trung vào những gì đã được triển khai, công bố, hoặc bình duyệt.
Cấu trúc protein, đã được giải: AlphaFold và giải Nobel 2024
Trường hợp rõ ràng nhất là dự đoán cấu trúc protein. Vào tháng 10 năm 2024, Viện Hàn lâm Khoa học Hoàng gia Thụy Điển đã trao giải Nobel Hóa học chung cho Demis Hassabis và John Jumper của Google DeepMind, “cho việc dự đoán cấu trúc protein,” và cho David Baker của Đại học Washington, cho thiết kế protein tính toán (NobelPrize.org, 9 tháng 10 năm 2024) — vinh dự cao nhất của lĩnh vực này, bốn năm sau các kết quả ban đầu năm 2020 của AlphaFold2 và được xác nhận bởi một ngành đã dành những năm đó để thực sự sử dụng công cụ: được cho là hơn hai triệu nhà nghiên cứu tại 190 quốc gia, dự đoán cấu trúc cho gần như toàn bộ 200 triệu protein đã biết với độ chính xác tiệm cận các phương pháp thực nghiệm trên các mục tiêu khó (Nature News, 9 tháng 10 năm 2024).
Từ cấu trúc đến thuốc: Isomorphic Labs, vẫn đang trong quy trình
Công trình gấp nếp protein của DeepMind đã tách ra thành Isomorphic Labs, được xây dựng để đưa việc dự đoán cấu trúc vào khám phá thuốc. Vào tháng 1 năm 2024, công ty này đã ký các thỏa thuận với Eli Lilly và Novartis trị giá tổng cộng khoảng 3 tỷ đô la tiềm năng theo các mốc, nhắm đến các mục tiêu phân tử nhỏ “không thể thuốc hóa” (TechCrunch, 7 tháng 1 năm 2024). Đến đầu năm 2026, các báo cáo thứ cấp mô tả sự hợp tác này đã tạo ra nhiều ứng viên tiền lâm sàng — vẫn còn cách nhiều năm so với một thử nghiệm lâm sàng, chưa nói đến một loại thuốc được phê duyệt. Không có loại thuốc nào từ mối hợp tác này đã bước vào thử nghiệm trên người tính đến thời điểm viết bài này.
AlphaFold đã tăng tốc một bước trong một quy trình dài; nó chưa được chứng minh là tăng tốc đầu ra của quy trình đó, được đo bằng các liệu pháp được phê duyệt chứ không phải các khoản thanh toán theo mốc. Lợi ích của AI và chi phí cơ hội của sự trì hoãn vạch ra ranh giới giữa một lợi ích đã được đo lường và một lợi ích được dự phóng — đây rõ ràng là một lợi ích được dự phóng.
Khám phá vật liệu — và một đính chính chứng minh hệ thống hoạt động
Trường hợp hữu ích nhất ở đây là khoa học vật liệu, chính xác vì nó không giữ nguyên là một câu chuyện thành công gọn gàng. Vào tháng 11 năm 2023, DeepMind đã công bố GNoME trên Nature: một hệ thống dự đoán 2,2 triệu cấu trúc tinh thể ứng viên, trong đó khoảng 381.000 được dự đoán là ổn định — gấp khoảng 45 lần số hợp chất ổn định nhưng chưa được hiện thực hóa so với toàn bộ hồ sơ lịch sử trước đó (Merchant và cộng sự, Nature, 29 tháng 11 năm 2023). Một bài báo đồng hành mô tả một phòng thí nghiệm robot tự động, “A-Lab,” đã sử dụng các dự đoán này để tổng hợp hàng chục vật liệu mới mà không cần sự can thiệp của con người, trong mười bảy ngày.
Vào năm 2024, ba nhà hóa học bên ngoài — Robert Palgrave (UCL), Leslie Schoop (Princeton), và Susan Latturner (Florida State) — đã phát hiện rằng khoảng hai phần ba các hợp chất “mới” của A-Lab thực chất là các cấu trúc đã được biết đến từ trước, bị nhận dạng sai vì phân tích nhiễu xạ tia X của nó sử dụng phương pháp so khớp mẫu ở trình độ mới học việc thay vì phép tinh chỉnh Rietveld cẩn thận mà một nhà tinh thể học được đào tạo sẽ áp dụng; nhiều hợp chất trong số đó đã có sẵn trong Cơ sở Dữ liệu Cấu trúc Tinh thể Vô cơ. Vào ngày 19 tháng 1 năm 2026, Nature đã công bố một đính chính chính thức của tác giả, thừa nhận các tuyên bố về tính mới lạ đã “bị hiểu sai” — mới đối với danh mục riêng của nền tảng, chứ không nhất thiết là mới đối với khoa học.
Đây không phải là câu chuyện về việc AI thất bại. Các dự đoán cấu trúc của GNoME không phải là phần hóa ra sai; sự thổi phồng nằm ở cách “mới” được định nghĩa ở khâu sau — và nó đã bị phát hiện và đính chính chính thức thông qua bình duyệt thông thường, hai năm sau đó. Đó chính là hệ thống hoạt động đúng như dự định: một công bố trên Nature là bằng chứng mạnh, nhưng không miễn nhiễm với việc đính chính, và tình trạng thực sự của một tuyên bố là những gì còn tồn tại sau khi bị soi xét, chứ không phải những gì thông cáo báo chí nói vào tuần nó ra mắt.
Toán học: AlphaProof tại kỳ Olympic, ngoài giờ thi đấu
Vào tháng 7 năm 2024, DeepMind thông báo rằng AlphaProof và AlphaGeometry 2 đã giải được bốn trong sáu bài toán tại kỳ Olympic Toán học Quốc tế năm đó, đạt điểm số 28 trên 42 — trình độ huy chương bạc, lần đầu tiên bất kỳ hệ thống AI nào đạt được mức đó (DeepMind, 25 tháng 7 năm 2024). Chính DeepMind tiết lộ rằng một bài toán được giải trong vài phút nhưng những bài khác mất tới ba ngày tính toán, đáng lưu ý vì các thí sinh con người giải cùng sáu bài toán đó trong hai phiên thi 4,5 giờ. Đây không phải là một bài nộp IMO thực sự được chấp nhận hay chấm điểm và chưa được bình duyệt độc lập như một kết quả thi đấu; đây là một chuẩn đo do công ty tự thực hiện, được ghi chú trung thực, không phải một tuyên bố rằng AI cạnh tranh với các nhà toán học Olympic dưới những ràng buộc mà họ thực sự phải đối mặt.
Dự báo thời tiết: một trường hợp đã được bình duyệt giải quyết xong
Dự báo thời tiết là một trường hợp đối chiếu hữu ích vì sự thật cơ bản đến hằng ngày và không thể bị thao túng ngược. GraphCast của DeepMind, công bố trên tạp chí Science vào tháng 11 năm 2023, đã vượt trội hơn mô hình vận hành HRES của cơ quan thời tiết châu Âu trên phần lớn trong số hàng nghìn tổ hợp biến số và thời gian dự báo được đánh giá, và tạo ra một dự báo toàn cầu 10 ngày trong chưa đầy một phút trên một TPU duy nhất (DeepMind, 14 tháng 11 năm 2023). Các dự báo được chấm điểm dựa trên thời tiết thực tế mỗi ngày, vì vậy đây là một trong những lĩnh vực khó thổi phồng nhất, và nhiều năm sau, kết quả vẫn đứng vững.
Y học, ở quy mô quản lý: các phê duyệt của FDA nhân lên
AI lâm sàng đã bước từ sự mới lạ sang công việc quản lý thường quy. Vào tháng 4 năm 2018, IDx-DR (nay là LumineticsCore) trở thành hệ thống chẩn đoán AI hoàn toàn tự động đầu tiên được FDA cấp phép trong y học, được phê duyệt để phát hiện bệnh võng mạc tiểu đường mà không cần bác sĩ diễn giải, dựa trên một thử nghiệm trên 900 đối tượng cho thấy độ nhạy 87,2% và độ đặc hiệu 90,7% so với đánh giá của chuyên gia (npj Digital Medicine, 2018). Những lần cấp phép như vậy nay đã trở thành thường quy: số lượng thiết bị AI được FDA cấp phép tăng từ khoảng 758 vào cuối năm 2024 lên 1.039 vào tháng 12 năm 2025, tốc độ tăng từ khoảng 21 lên khoảng 30 mỗi tháng, dẫn đầu bởi GE HealthCare, Siemens Healthineers, Philips, và Canon (The Imaging Wire, 11 tháng 3 năm 2026). Một giấy phép là một sự thật thực sự, có thể kiểm chứng — không giống với tuyên bố “công cụ này hoạt động tốt trong bệnh viện của bạn,” đó là điều mà phần tiếp theo sẽ đề cập.
Khoảng cách phòng thí nghiệm đến phòng khám: điều gì xảy ra khi mô hình gặp một bệnh nhân thực
Trường hợp được ghi chép rõ ràng nhất về khoảng cách giữa độ chính xác đã được kiểm chứng và thực tế triển khai là hệ thống bệnh võng mạc tiểu đường của Google Health, đã vượt quá 90% độ nhạy và độ đặc hiệu trong các thử nghiệm. Được triển khai tại 11 phòng khám ở Thái Lan từ tháng 11 năm 2018 đến tháng 8 năm 2019, hệ thống này đã từ chối khoảng 21% trong số khoảng 1.940 hình ảnh mà y tá nộp vì “không thể chấm điểm” — phần lớn là do điều kiện ánh sáng mà một người đọc kết quả sẽ chấp nhận mà không nghĩ ngợi thêm — làm gián đoạn quy trình làm việc và kéo dài thời gian khám cho những bệnh nhân thường đã đi nhiều giờ đồng hồ để được sàng lọc. Phát hiện này đã được bình duyệt tại CHI 2020, một hội nghị hàng đầu về tương tác người-máy tính, và được MIT Technology Review đưa tin vào thời điểm đó (MIT Technology Review, 27 tháng 4 năm 2020). Các đánh giá sau này về AI X quang mô tả đây là một khuôn mẫu lặp lại: hiệu suất trong thế giới thực phụ thuộc vào thiết bị và quy trình làm việc tại chỗ, chứ không chỉ phụ thuộc vào con số độ chính xác của một mô hình.
Một công cụ đột quỵ khác được FDA cấp phép, Viz.ai, cho thấy sự phân tách theo một cách khác: một đánh giá hệ thống và phân tích tổng hợp tổng hợp khoảng chục nghiên cứu và hơn 15.000 bệnh nhân đã tăng tốc quy trình làm việc của bệnh viện mà không có cải thiện có ý nghĩa thống kê trong các kết quả lâm sàng mà chính những quy trình đó tồn tại để cải thiện. Nhanh hơn không tự động có nghĩa là tốt hơn.
Khuôn mẫu này nói gì về phần còn lại của trang web
Mọi trường hợp ở trên đều được tạo ra bởi cùng một nhóm nhỏ các phòng thí nghiệm tiên phong mà cẩm nang này thảo luận ở nơi khác — chủ yếu là Google DeepMind — mà văn hóa nghiên cứu của họ được đề cập tại các phòng thí nghiệm AI tiên phong khác nhau như thế nào, và sự tập trung năng lực khoa học của họ trong một số ít tổ chức là chủ đề riêng tại tập trung quyền lực: vì sao một vài phòng thí nghiệm quan trọng. Sự tập trung đó có hai mặt: đó là lý do vì sao một chương trình có thể tích lũy một giải Nobel, một kỳ Olympic đạt huy chương bạc, và một bài báo Nature bị đính chính trong vòng hai năm, và vì sao khung diễn giải của những tuyên bố này trước tiên chạy qua bộ máy truyền thông riêng của một phòng thí nghiệm và chỉ sau đó mới qua bình duyệt vốn không chịu trách nhiệm trước phòng thí nghiệm đó.
Không điều nào trong số này biện minh cho việc bác bỏ các kết quả. Một giải Nobel không phải là sự thổi phồng; một dự báo 10 ngày được tạo ra trong chưa đầy một phút không phải là sự thổi phồng. Nhưng “AI đang tăng tốc khoa học” đúng theo cách mà hầu hết các tuyên bố bền vững về công nghệ này là đúng: không đồng đều, với những thành công rõ ràng nhất nằm ở các vấn đề có sự thật cơ bản sạch sẽ, có thể kiểm chứng — một protein đã gấp nếp, thời tiết ngày mai, độ ổn định đo được của một tinh thể — và một khoảng cách dai dẳng bất cứ khi nào chặng cuối cùng đi qua một phòng khám lộn xộn hoặc một thông cáo báo chí không được kiểm chứng. Kỷ luật đã phát hiện ra lỗi GNoME, hai năm sau đó, chính là kỷ luật mà trang này yêu cầu độc giả áp dụng ở mọi nơi khác trên trang web này.