Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Bản tin sinh tồn của nhân loại
VI

AI tăng tốc khoa học và y học: đột phá thực sự, giới hạn thực sự

Nơi AI đã thực sự tăng tốc khoa học và y học — một giải Nobel, một mô hình thời tiết, các phê duyệt của FDA — và nơi sự thổi phồng vẫn vượt xa thực tế.

Written by
Dwight Ringdahl
Status
Đã kiểm tra nguồn
Revised
Sources
11 cited
Reading
11 min

Vì sao trang này đọc khác đi

Phần lớn cẩm nang này được xây dựng xoay quanh sự bất định, hiểm nguy, và những khoảng trống trung thực trong những gì có thể kiểm chứng. Trang này thì khác: nó tập hợp các kết quả khoa học do AI thúc đẩy có ghi ngày tháng, có thể kiểm tra được, và trong một trường hợp đã mang về một giải Nobel — nhưng cũng chính chương trình nghiên cứu tạo ra phương pháp đoạt giải Nobel đó cũng đã tạo ra một bài báo Nature bị đính chính chính thức và một công cụ chẩn đoán hoạt động tốt trong phòng thí nghiệm nhưng vấp ngã tại một phòng khám thực tế. Việc giữ đồng thời cả hai sự thật này — thành tựu chân thực và sự thổi phồng chân thực, từ cùng một phòng thí nghiệm, đôi khi cùng một năm — chính là trọng tâm của trang này, không phải một mâu thuẫn cần giải quyết.

Mọi thứ dưới đây liên quan đến học máy hẹp, chuyên biệt cho một nhiệm vụ, được áp dụng cho một vấn đề khoa học hoặc y tế, chứ không phải AGI. Việc một hệ thống tổng quát nào đó trong tương lai sẽ tăng tốc toàn bộ khoa học cùng một lúc là một kịch bản, được đề cập tại lợi ích của AI và chi phí cơ hội của sự trì hoãn; trang này chỉ tập trung vào những gì đã được triển khai, công bố, hoặc bình duyệt.

Cấu trúc protein, đã được giải: AlphaFold và giải Nobel 2024

Trường hợp rõ ràng nhất là dự đoán cấu trúc protein. Vào tháng 10 năm 2024, Viện Hàn lâm Khoa học Hoàng gia Thụy Điển đã trao giải Nobel Hóa học chung cho Demis Hassabis và John Jumper của Google DeepMind, “cho việc dự đoán cấu trúc protein,” và cho David Baker của Đại học Washington, cho thiết kế protein tính toán (NobelPrize.org, 9 tháng 10 năm 2024) — vinh dự cao nhất của lĩnh vực này, bốn năm sau các kết quả ban đầu năm 2020 của AlphaFold2 và được xác nhận bởi một ngành đã dành những năm đó để thực sự sử dụng công cụ: được cho là hơn hai triệu nhà nghiên cứu tại 190 quốc gia, dự đoán cấu trúc cho gần như toàn bộ 200 triệu protein đã biết với độ chính xác tiệm cận các phương pháp thực nghiệm trên các mục tiêu khó (Nature News, 9 tháng 10 năm 2024).

Từ cấu trúc đến thuốc: Isomorphic Labs, vẫn đang trong quy trình

Công trình gấp nếp protein của DeepMind đã tách ra thành Isomorphic Labs, được xây dựng để đưa việc dự đoán cấu trúc vào khám phá thuốc. Vào tháng 1 năm 2024, công ty này đã ký các thỏa thuận với Eli Lilly và Novartis trị giá tổng cộng khoảng 3 tỷ đô la tiềm năng theo các mốc, nhắm đến các mục tiêu phân tử nhỏ “không thể thuốc hóa” (TechCrunch, 7 tháng 1 năm 2024). Đến đầu năm 2026, các báo cáo thứ cấp mô tả sự hợp tác này đã tạo ra nhiều ứng viên tiền lâm sàng — vẫn còn cách nhiều năm so với một thử nghiệm lâm sàng, chưa nói đến một loại thuốc được phê duyệt. Không có loại thuốc nào từ mối hợp tác này đã bước vào thử nghiệm trên người tính đến thời điểm viết bài này.

AlphaFold đã tăng tốc một bước trong một quy trình dài; nó chưa được chứng minh là tăng tốc đầu ra của quy trình đó, được đo bằng các liệu pháp được phê duyệt chứ không phải các khoản thanh toán theo mốc. Lợi ích của AI và chi phí cơ hội của sự trì hoãn vạch ra ranh giới giữa một lợi ích đã được đo lường và một lợi ích được dự phóng — đây rõ ràng là một lợi ích được dự phóng.

Khám phá vật liệu — và một đính chính chứng minh hệ thống hoạt động

Trường hợp hữu ích nhất ở đây là khoa học vật liệu, chính xác vì nó không giữ nguyên là một câu chuyện thành công gọn gàng. Vào tháng 11 năm 2023, DeepMind đã công bố GNoME trên Nature: một hệ thống dự đoán 2,2 triệu cấu trúc tinh thể ứng viên, trong đó khoảng 381.000 được dự đoán là ổn định — gấp khoảng 45 lần số hợp chất ổn định nhưng chưa được hiện thực hóa so với toàn bộ hồ sơ lịch sử trước đó (Merchant và cộng sự, Nature, 29 tháng 11 năm 2023). Một bài báo đồng hành mô tả một phòng thí nghiệm robot tự động, “A-Lab,” đã sử dụng các dự đoán này để tổng hợp hàng chục vật liệu mới mà không cần sự can thiệp của con người, trong mười bảy ngày.

Vào năm 2024, ba nhà hóa học bên ngoài — Robert Palgrave (UCL), Leslie Schoop (Princeton), và Susan Latturner (Florida State) — đã phát hiện rằng khoảng hai phần ba các hợp chất “mới” của A-Lab thực chất là các cấu trúc đã được biết đến từ trước, bị nhận dạng sai vì phân tích nhiễu xạ tia X của nó sử dụng phương pháp so khớp mẫu ở trình độ mới học việc thay vì phép tinh chỉnh Rietveld cẩn thận mà một nhà tinh thể học được đào tạo sẽ áp dụng; nhiều hợp chất trong số đó đã có sẵn trong Cơ sở Dữ liệu Cấu trúc Tinh thể Vô cơ. Vào ngày 19 tháng 1 năm 2026, Nature đã công bố một đính chính chính thức của tác giả, thừa nhận các tuyên bố về tính mới lạ đã “bị hiểu sai” — mới đối với danh mục riêng của nền tảng, chứ không nhất thiết là mới đối với khoa học.

Đây không phải là câu chuyện về việc AI thất bại. Các dự đoán cấu trúc của GNoME không phải là phần hóa ra sai; sự thổi phồng nằm ở cách “mới” được định nghĩa ở khâu sau — và nó đã bị phát hiện và đính chính chính thức thông qua bình duyệt thông thường, hai năm sau đó. Đó chính là hệ thống hoạt động đúng như dự định: một công bố trên Nature là bằng chứng mạnh, nhưng không miễn nhiễm với việc đính chính, và tình trạng thực sự của một tuyên bố là những gì còn tồn tại sau khi bị soi xét, chứ không phải những gì thông cáo báo chí nói vào tuần nó ra mắt.

Toán học: AlphaProof tại kỳ Olympic, ngoài giờ thi đấu

Vào tháng 7 năm 2024, DeepMind thông báo rằng AlphaProof và AlphaGeometry 2 đã giải được bốn trong sáu bài toán tại kỳ Olympic Toán học Quốc tế năm đó, đạt điểm số 28 trên 42 — trình độ huy chương bạc, lần đầu tiên bất kỳ hệ thống AI nào đạt được mức đó (DeepMind, 25 tháng 7 năm 2024). Chính DeepMind tiết lộ rằng một bài toán được giải trong vài phút nhưng những bài khác mất tới ba ngày tính toán, đáng lưu ý vì các thí sinh con người giải cùng sáu bài toán đó trong hai phiên thi 4,5 giờ. Đây không phải là một bài nộp IMO thực sự được chấp nhận hay chấm điểm và chưa được bình duyệt độc lập như một kết quả thi đấu; đây là một chuẩn đo do công ty tự thực hiện, được ghi chú trung thực, không phải một tuyên bố rằng AI cạnh tranh với các nhà toán học Olympic dưới những ràng buộc mà họ thực sự phải đối mặt.

Dự báo thời tiết: một trường hợp đã được bình duyệt giải quyết xong

Dự báo thời tiết là một trường hợp đối chiếu hữu ích vì sự thật cơ bản đến hằng ngày và không thể bị thao túng ngược. GraphCast của DeepMind, công bố trên tạp chí Science vào tháng 11 năm 2023, đã vượt trội hơn mô hình vận hành HRES của cơ quan thời tiết châu Âu trên phần lớn trong số hàng nghìn tổ hợp biến số và thời gian dự báo được đánh giá, và tạo ra một dự báo toàn cầu 10 ngày trong chưa đầy một phút trên một TPU duy nhất (DeepMind, 14 tháng 11 năm 2023). Các dự báo được chấm điểm dựa trên thời tiết thực tế mỗi ngày, vì vậy đây là một trong những lĩnh vực khó thổi phồng nhất, và nhiều năm sau, kết quả vẫn đứng vững.

Y học, ở quy mô quản lý: các phê duyệt của FDA nhân lên

AI lâm sàng đã bước từ sự mới lạ sang công việc quản lý thường quy. Vào tháng 4 năm 2018, IDx-DR (nay là LumineticsCore) trở thành hệ thống chẩn đoán AI hoàn toàn tự động đầu tiên được FDA cấp phép trong y học, được phê duyệt để phát hiện bệnh võng mạc tiểu đường mà không cần bác sĩ diễn giải, dựa trên một thử nghiệm trên 900 đối tượng cho thấy độ nhạy 87,2% và độ đặc hiệu 90,7% so với đánh giá của chuyên gia (npj Digital Medicine, 2018). Những lần cấp phép như vậy nay đã trở thành thường quy: số lượng thiết bị AI được FDA cấp phép tăng từ khoảng 758 vào cuối năm 2024 lên 1.039 vào tháng 12 năm 2025, tốc độ tăng từ khoảng 21 lên khoảng 30 mỗi tháng, dẫn đầu bởi GE HealthCare, Siemens Healthineers, Philips, và Canon (The Imaging Wire, 11 tháng 3 năm 2026). Một giấy phép là một sự thật thực sự, có thể kiểm chứng — không giống với tuyên bố “công cụ này hoạt động tốt trong bệnh viện của bạn,” đó là điều mà phần tiếp theo sẽ đề cập.

Khoảng cách phòng thí nghiệm đến phòng khám: điều gì xảy ra khi mô hình gặp một bệnh nhân thực

Trường hợp được ghi chép rõ ràng nhất về khoảng cách giữa độ chính xác đã được kiểm chứng và thực tế triển khai là hệ thống bệnh võng mạc tiểu đường của Google Health, đã vượt quá 90% độ nhạy và độ đặc hiệu trong các thử nghiệm. Được triển khai tại 11 phòng khám ở Thái Lan từ tháng 11 năm 2018 đến tháng 8 năm 2019, hệ thống này đã từ chối khoảng 21% trong số khoảng 1.940 hình ảnh mà y tá nộp vì “không thể chấm điểm” — phần lớn là do điều kiện ánh sáng mà một người đọc kết quả sẽ chấp nhận mà không nghĩ ngợi thêm — làm gián đoạn quy trình làm việc và kéo dài thời gian khám cho những bệnh nhân thường đã đi nhiều giờ đồng hồ để được sàng lọc. Phát hiện này đã được bình duyệt tại CHI 2020, một hội nghị hàng đầu về tương tác người-máy tính, và được MIT Technology Review đưa tin vào thời điểm đó (MIT Technology Review, 27 tháng 4 năm 2020). Các đánh giá sau này về AI X quang mô tả đây là một khuôn mẫu lặp lại: hiệu suất trong thế giới thực phụ thuộc vào thiết bị và quy trình làm việc tại chỗ, chứ không chỉ phụ thuộc vào con số độ chính xác của một mô hình.

Một công cụ đột quỵ khác được FDA cấp phép, Viz.ai, cho thấy sự phân tách theo một cách khác: một đánh giá hệ thống và phân tích tổng hợp tổng hợp khoảng chục nghiên cứu và hơn 15.000 bệnh nhân đã tăng tốc quy trình làm việc của bệnh viện mà không có cải thiện có ý nghĩa thống kê trong các kết quả lâm sàng mà chính những quy trình đó tồn tại để cải thiện. Nhanh hơn không tự động có nghĩa là tốt hơn.

Khuôn mẫu này nói gì về phần còn lại của trang web

Mọi trường hợp ở trên đều được tạo ra bởi cùng một nhóm nhỏ các phòng thí nghiệm tiên phong mà cẩm nang này thảo luận ở nơi khác — chủ yếu là Google DeepMind — mà văn hóa nghiên cứu của họ được đề cập tại các phòng thí nghiệm AI tiên phong khác nhau như thế nào, và sự tập trung năng lực khoa học của họ trong một số ít tổ chức là chủ đề riêng tại tập trung quyền lực: vì sao một vài phòng thí nghiệm quan trọng. Sự tập trung đó có hai mặt: đó là lý do vì sao một chương trình có thể tích lũy một giải Nobel, một kỳ Olympic đạt huy chương bạc, và một bài báo Nature bị đính chính trong vòng hai năm, và vì sao khung diễn giải của những tuyên bố này trước tiên chạy qua bộ máy truyền thông riêng của một phòng thí nghiệm và chỉ sau đó mới qua bình duyệt vốn không chịu trách nhiệm trước phòng thí nghiệm đó.

Không điều nào trong số này biện minh cho việc bác bỏ các kết quả. Một giải Nobel không phải là sự thổi phồng; một dự báo 10 ngày được tạo ra trong chưa đầy một phút không phải là sự thổi phồng. Nhưng “AI đang tăng tốc khoa học” đúng theo cách mà hầu hết các tuyên bố bền vững về công nghệ này là đúng: không đồng đều, với những thành công rõ ràng nhất nằm ở các vấn đề có sự thật cơ bản sạch sẽ, có thể kiểm chứng — một protein đã gấp nếp, thời tiết ngày mai, độ ổn định đo được của một tinh thể — và một khoảng cách dai dẳng bất cứ khi nào chặng cuối cùng đi qua một phòng khám lộn xộn hoặc một thông cáo báo chí không được kiểm chứng. Kỷ luật đã phát hiện ra lỗi GNoME, hai năm sau đó, chính là kỷ luật mà trang này yêu cầu độc giả áp dụng ở mọi nơi khác trên trang web này.

References

Summarized position

The Royal Swedish Academy of Sciences awarded the 2024 Nobel Prize in Chemistry jointly to Demis Hassabis and John Jumper of Google DeepMind for protein structure prediction via AlphaFold2, and to David Baker for computational protein design.

The Royal Swedish Academy of Sciences, 2024 Nobel Prize in Chemistry press release
NobelPrize.org, Signed statement
Summarized position

Isomorphic Labs signed drug-discovery collaborations with Eli Lilly and Novartis worth a combined roughly $3 billion in potential milestones, targeting "undruggable" small-molecule drug targets.

Isomorphic Labs, Alphabet/DeepMind drug-discovery subsidiary
TechCrunch, Secondary coverage
Summarized position

Merchant et al. used the GNoME deep-learning system to predict 2.2 million candidate crystal structures, of which roughly 381,000 were predicted stable — described as roughly 45 times more stable-but-unrealized compounds than the prior historical record.

Merchant et al., Google DeepMind materials-science researchers
"Scaling deep learning for materials discovery" (Nature), Primary source
Summarized position

Nature issued a formal author correction acknowledging that the original GNoME/A-Lab novelty claims were 'subject to misinterpretation,' after outside chemists found roughly two-thirds of the announced 'new' compounds were already-known structures misidentified by novice-level X-ray diffraction analysis.

Nature, Peer-reviewed journal, author correction
Nature, Research/report
Summarized position

Google DeepMind announced that AlphaProof and AlphaGeometry 2 solved 4 of 6 problems at the 2024 International Mathematical Olympiad for a score of 28/42, silver-medal level, while disclosing that some problems took up to three days of compute — well outside the timed competition format.

Google DeepMind, "AI solves IMO problems at silver-medal level" announcement
DeepMind blog, Primary source
Summarized position

Google DeepMind GraphCast outperformed ECMWF's operational HRES system on 89.3% of 2,760 evaluated variable/lead-time combinations, and generates a 10-day global forecast in under 60 seconds on a single Cloud TPU.

Google DeepMind, "GraphCast: AI model for faster and more accurate global weather forecasting" announcement
DeepMind blog, Primary source
Summarized position

The Imaging Wire tracked FDA marketing authorizations for AI-enabled medical devices rising from roughly 758 by the end of 2024 to 1,039 by December 2025, with the clearance pace rising from about 21 a month in 2024 to about 30 a month in 2025.

The Imaging Wire, AI-enabled medical device FDA authorization tracker
The Imaging Wire, Secondary coverage
Summarized position

MIT Technology Review documented that Google Health's diabetic-retinopathy AI, which exceeded 90% sensitivity and specificity in lab conditions, rejected roughly 21% of the ~1,940 retinal images nurses submitted as 'ungradable' across 11 Thai clinics — often due to lighting conditions human graders would have accepted — disrupting clinic workflow.

MIT Technology Review, Contemporaneous report on Google Health's Thailand deployment
MIT Technology Review, Secondary coverage
  1. Nature News, 9 tháng 10 năm 2024 nature.com
  2. npj Digital Medicine , 2018 nature.com
  3. đánh giá hệ thống và phân tích tổng hợp pmc.ncbi.nlm.nih.gov

Type to search the manual.

navigate open esc close