Sự phân tán là kết quả quan trọng nhất
Các dự đoán cho AI có năng lực cao hoặc cấp độ con người trải dài từ vài năm đến nhiều thập kỷ, với một số nhà nghiên cứu nghi ngờ rằng các phương pháp hiện tại có thể tạo ra nó hay không. Sự bất đồng này không phải là một thanh sai số nhỏ xung quanh một mô hình khoa học chung. Các nhà dự báo bất đồng về những gì tính là AGI, những bước kỹ thuật nào còn lại, các đầu vào như năng lực tính toán và dữ liệu có thể tăng trưởng nhanh đến mức nào, và liệu tiến bộ có tiếp tục trơn tru hay không. Do đó bất kỳ dòng thời gian nào cũng nên được trình bày như một dự báo có ghi ngày tháng dưới một định nghĩa đã nêu—chứ không phải như một “đồng hồ đếm ngược AGI.”
Demis Hassabis đưa ra một ví dụ hữu ích về vì sao sự quy kết chính xác lại quan trọng. Trong một cuộc phỏng vấn với CNBC vào tháng 3 năm 2025, giám đốc điều hành Google DeepMind nói rằng AI cấp độ con người có thể xuất hiện trong năm đến mười năm nữa. Ông không nói rằng bằng chứng có ý nghĩa về AGI sẽ xuất hiện “trong vòng một năm” (phỏng vấn CNBC). Ngay cả dự báo được trích dẫn chính xác cũng để lại những câu hỏi: cấp độ con người ở những nhiệm vụ nào, với độ tin cậy nào, và với bao nhiêu tính tự chủ? Trích dẫn đó ghi lại phán đoán của một chuyên gia, không phải một xác suất đã đo lường.
Bốn loại dự báo không nên bị trộn lẫn
Các tuyên bố của lãnh đạo phòng thí nghiệm dễ thấy và có thông tin từ việc tiếp xúc trực tiếp với các hệ thống tiên phong, nhưng chúng không phải là các phép đo trung lập. Các giám đốc điều hành sở hữu thông tin riêng tư có giá trị về các thí nghiệm, nhưng cũng lãnh đạo các tổ chức đang cạnh tranh giành vốn, nhân tài, khách hàng, và sự chú ý chính trị. Các tuyên bố của họ có thể sử dụng các định nghĩa riêng của công ty và hiếm khi phơi bày một mô hình dự báo hoàn chỉnh.
Các khảo sát nhà nghiên cứu tổng hợp nhiều quan điểm và bộc lộ sự phân phối của ý kiến chuyên gia. Khảo sát Chuyên gia năm 2023 về Tiến bộ trong AI, được công bố năm 2024, đã thu thập 2.778 nhà nghiên cứu và báo cáo một phạm vi ước tính rộng cho việc máy móc vượt trội hơn con người ở mọi nhiệm vụ có thể; các tác giả cũng nhấn mạnh sự bất đồng đáng kể và độ nhạy với cách đặt câu hỏi (Grace và cộng sự, 2024). Các khảo sát mô tả niềm tin tại một thời điểm. Chúng không xác nhận những niềm tin đó hay đảm bảo rằng những người trả lời chia sẻ một định nghĩa chung.
Các nền tảng dự đoán như Metaculus liên tục tổng hợp các dự báo. Các mức trung vị của chúng có thể cập nhật nhanh hơn các khảo sát, nhưng kết quả phụ thuộc vào tiêu chí giải quyết chính xác và nhóm người tham gia. “AI tổng quát yếu,” “AI biến đổi,” và “AGI” là những câu hỏi khác nhau. Một mức trung vị thị trường hay cộng đồng nên được hiển thị cùng với ngày lấy dữ liệu, cách đặt câu hỏi, phạm vi, và điều kiện giải quyết thay vì bị biến thành một hạn chót toàn trang.
Các dự báo dựa trên mô hình ngoại suy các xu hướng về năng lực tính toán, hiệu suất bài đánh giá chuẩn, hiệu quả thuật toán, hoặc độ dài các nhiệm vụ mà các tác nhân có thể hoàn thành. Những dự báo này làm cho các giả định trở nên rõ ràng, điều này có giá trị, nhưng ngoại suy có thể thất bại khi một bài đánh giá chuẩn bão hòa, một ràng buộc tài nguyên bị chạm đến, hoặc một mô hình mới thay đổi xu hướng. Một đường cong là bằng chứng về các phép đo trong quá khứ; phần mở rộng của nó là một dự báo có điều kiện.
Những gì các xu hướng năng lực hiện tại thực sự cho thấy
Có bằng chứng thực sự về sự cải thiện nhanh chóng. Chỉ số AI Stanford ghi lại chi phí suy luận đang giảm và điểm số đang tăng trên các bài đánh giá chuẩn khắt khe, đồng thời cũng cho thấy rằng các đánh giá khó vẫn chưa được giải quyết và rằng việc đánh giá AI có trách nhiệm được tiêu chuẩn hóa vẫn không đồng đều (Chỉ số AI Stanford 2025). METR báo cáo rằng thời lượng chuyên gia con người của các nhiệm vụ hướng phần mềm mà các tác nhân tiên phong hoàn thành ở một xác suất thành công nhất định đã tăng nhanh chóng (chân trời thời gian của METR). Đây là những quan sát về các hệ thống và bài kiểm tra được chọn, không phải quan sát trực tiếp về một ngày AGI đang đến gần.
Thước đo của METR đặc biệt dễ bị diễn đạt sai. Một chân trời thời gian 50% là vài giờ có nghĩa là, trên bộ nhiệm vụ của METR, mô hình đã khớp dự đoán một cơ hội 50% hoàn thành các nhiệm vụ mất khoảng thời gian đó đối với một chuyên gia con người. Điều đó không có nghĩa là AI vận hành tự chủ trong số giờ đó. Các nhiệm vụ chủ yếu là kỹ thuật phần mềm, học máy, và an ninh mạng; chúng tự chứa và có thể chấm điểm khách quan một cách bất thường; các ước tính trên mười sáu giờ hiện được mô tả là không đáng tin cậy; và công việc thực tế lộn xộn hơn nhiều. Các nhà nghiên cứu METR đã cảnh báo rằng thanh sai số có thể trải dài khoảng một hệ số hai và sự khác biệt giữa các lĩnh vực có thể trải dài nhiều bậc độ lớn (ghi chú giới hạn của METR).
Những kết quả này ủng hộ một kết luận hẹp hơn: một số hình thức hoàn thành nhiệm vụ kỹ thuật số đang cải thiện nhanh chóng. Tự bản thân chúng không thiết lập được khi nào một hệ thống sẽ trở thành một nhà khoa học, người quản lý, người chăm sóc, người ra quyết định chính trị đáng tin cậy, hay một sự thay thế tổng quát cho lao động con người.
Vì sao các dự báo hợp lý lại phân kỳ
Các nhà dự báo kỳ vọng sự xuất hiện sớm thường nhấn mạnh sự bền bỉ của mở rộng quy mô, tính toán thời gian lập luận tốt hơn, dữ liệu tổng hợp, sử dụng công cụ, và nghiên cứu được AI hỗ trợ. Nếu những xu hướng đó củng cố lẫn nhau, tiến bộ có thể tăng tốc. Họ cũng có thể lập luận rằng các hệ thống có tính biến đổi kinh tế không cần tái tạo mọi đặc điểm của trí tuệ con người; năng lực kỹ thuật số rộng có thể là đủ.
Các nhà dự báo dòng thời gian dài hơn nhấn mạnh độ tin cậy, sự căn cứ, học liên tục, hiểu biết nhân quả, robot học, và khoảng cách giữa các bài đánh giá chuẩn và công việc mở. Họ cũng chỉ ra các ràng buộc thực tế: năng lượng, chip, xây dựng trung tâm dữ liệu, dữ liệu chất lượng cao, đánh giá, và khả năng của các tổ chức trong việc triển khai các hệ thống một cách an toàn. Một số kỳ vọng những tiến bộ kiến trúc vượt ngoài các phương pháp mô hình lớn hiện tại. Không lập trường nào trong số này có thể được giải quyết chỉ bằng sự tự tin hay thâm niên.
Các định nghĩa tạo ra một nguồn bất đồng bề ngoài khác. Một hệ thống có thể tự động hóa phần lớn công việc máy tính từ xa có thể có tính biến đổi kinh tế trong khi thất bại ở các nhiệm vụ hiện thân vật lý. Một mô hình đạt điểm trên mức con người điển hình trên một bộ bài thi rộng vẫn có thể quá không đáng tin cậy để vận hành độc lập. Một nhà dự báo có thể gọi cả hai hệ thống là AGI; một người khác có thể dành từ đó cho việc học tập vững chắc, tương đương con người trong thế giới thực.
Cách duy trì một bộ theo dõi dòng thời gian có trách nhiệm
Một bộ theo dõi hữu ích nên bảo tồn cách diễn đạt gốc, người nói, ngày tháng, nguồn, định nghĩa, và phạm vi dự báo. Nó nên phân biệt một ước tính cá nhân với một cam kết tổ chức, ghi lại các sửa đổi sau này, và không bao giờ âm thầm thay thế một dự đoán cũ. Các dự báo tổng hợp nên hiển thị các khoảng không chắc chắn thay vì chỉ một mức trung vị. Trang này cũng nên tiết lộ các động lực tiềm ẩn và liệu dự báo có dựa vào bằng chứng công khai hay riêng tư.
Độc giả có thể áp dụng năm câu hỏi:
- Kết quả nào đang được dự đoán? AGI, AI cấp độ con người, tự động hóa nhiệm vụ, hay siêu trí tuệ?
- Xác suất và ngày tháng nào được gắn kèm? “Có thể” không phải là một dự báo trung vị.
- Bằng chứng nào thúc đẩy ước tính? Mở rộng quy mô, một khảo sát, các thí nghiệm riêng tư, hay trực giác?
- Điều gì sẽ thay đổi suy nghĩ của nhà dự báo? Một dự báo không có khả năng bị bác bỏ thì khó đánh giá.
- Nó có được chấm điểm chưa? Các dự đoán trong quá khứ nên vẫn hiển thị được sau hạn chót của chúng.
Kết luận thực tiễn
Việc lập kế hoạch không nên phụ thuộc vào việc chọn một ngày duy nhất. Những tổn hại và cơ hội trong ngắn hạn xứng đáng được hành động bất kể AGI có xuất hiện vào năm 2028, 2040, hay không bao giờ. Các chính phủ và tổ chức có thể sử dụng các phạm vi kịch bản: chuẩn bị cho những bước nhảy năng lực nhanh chóng, xây dựng các chính sách vẫn hữu ích dưới tiến bộ chậm hơn, và xác định các tác nhân kích hoạt có thể đo lường được cho các biện pháp bảo vệ mạnh hơn.
Sự không chắc chắn tự nó có thể hành động được. Nó lập luận cho việc giám sát năng lực thay vì các nhãn tiếp thị, đầu tư vào đánh giá và khả năng phục hồi, và xem xét lại các dự báo theo một lịch trình cố định. Một trang dòng thời gian giành được niềm tin bằng cách cho thấy các ngày tháng chứng minh được ít đến mức nào, chứ không phải bằng cách khiến một mức trung vị di động trông giống như một đồng hồ đếm ngược đến định mệnh.