Cách đọc ảnh chụp này
Bảng theo dõi này ghi lại bằng chứng công khai có sẵn vào ngày 13 tháng 9 năm 2026. Đây không phải là một bảng xếp hạng trực tiếp và không nên được âm thầm cập nhật. Các sản phẩm AI, giàn giáo, tập đánh giá, và giá cả thay đổi quá nhanh để một trang “hiện tại” không ghi ngày tháng có thể giữ được sự trung thực.
Năng lực mang tính đa chiều. Một hệ thống có thể giải một bài toán olympic nhưng lại không đọc được đồng hồ kim, trả lời các câu hỏi sinh học chuyên môn nhưng lại không hoàn thành được một quy trình phòng thí nghiệm, hoặc vượt qua một bộ chấm điểm lập trình trong khi tạo ra một bản vá mà người bảo trì sẽ từ chối. Chỉ số AI 2026 của Stanford gọi khuôn mẫu này là trí tuệ lởm chởm và ghi lại những khoảng cách lớn giữa môi trường có kiểm soát và môi trường thực tế (Chỉ số AI Stanford, hiệu suất kỹ thuật).
Các xếp hạng bên dưới mô tả bằng chứng, không phải một mô hình phổ quát. “Mạnh” có nghĩa là các hệ thống hàng đầu hoạt động ấn tượng trên các đánh giá công khai liên quan. Nó không có nghĩa là an toàn, tương đương con người, hoặc đủ tin cậy để sử dụng tự chủ trong tình huống rủi ro cao.
| Chiều | Bằng chứng tháng 9 năm 2026 | Giới hạn quan trọng |
|---|---|---|
| Ngôn ngữ và kiến thức | Mạnh trên các bài kiểm tra hỏi-đáp rộng và đa phương thức | Ảo giác, nhiễm bẩn, và độ tin cậy thực tế không đồng đều vẫn còn |
| Toán học và lập luận có cấu trúc | Các hệ thống tiên phong đạt kết quả cấp thi đấu hàng đầu trên các bài toán được chọn | Hiệu suất vẫn lởm chởm và nhạy cảm với công cụ và ngân sách suy luận |
| Lập trình và sử dụng máy tính | Lợi ích nhanh chóng trên các bài đánh giá chuẩn lập trình và tác nhân desktop có cấu trúc | Vượt qua bộ chấm điểm không đảm bảo công việc sản xuất có thể bảo trì |
| Tính tự chủ nhiệm vụ dài | Các chân trời nhiệm vụ phần mềm được đo lường tăng nhanh chóng | Chủ yếu là các nhiệm vụ phần mềm/học máy/an ninh mạng sạch sẽ; không phải là thời lượng vận hành độc lập |
| Hỗ trợ khoa học | Kiến thức chuyên ngành mạnh và hiệu suất giao thức/khắc phục sự cố đang cải thiện | Điểm số kiến thức không thiết lập được năng lực thực nghiệm toàn diện |
| Năng lực an ninh mạng | Các tác nhân có thể tìm ra lỗ hổng thực và hoàn thành các nhiệm vụ chuyên gia được chọn | Các cuộc tấn công tự động toàn diện không được thiết lập công khai |
| Thuyết phục | Sự thay đổi quan điểm có thể đo lường được trong các thí nghiệm có kiểm soát | Tác động ác ý ở quy mô dân số chưa được chứng minh |
| Robot học và hiện thân vật lý | Tiến bộ mạnh trong môi trường có kiểm soát | Độ tin cậy trong hộ gia đình và thế giới mở vẫn thấp hơn nhiều |
| An toàn và độ tin cậy | Các biện pháp bảo vệ và đánh giá đang cải thiện | Báo cáo không nhất quán và không phương pháp nào đảm bảo kiểm soát |
Lập luận ấn tượng và không đồng đều
Chỉ số AI 2026 báo cáo rằng một hệ thống của Google DeepMind đạt điểm số cấp huy chương vàng tại Olympic Toán học Quốc tế 2025 trong thời gian giới hạn của cuộc thi. Cùng chương đó báo cáo rằng mô hình được thử nghiệm tốt nhất trên ClockBench chỉ đọc đúng đồng hồ kim khoảng một nửa thời gian, so với khoảng 90% đối với con người. Những bài kiểm tra này không quan trọng ngang nhau, nhưng sự tương phản của chúng đánh bại ý tưởng về một “mức độ trí tuệ” vô hướng duy nhất.
Lợi ích bài đánh giá chuẩn có thể phản ánh một mô hình nền tảng tốt hơn, nhiều tính toán tại thời điểm suy luận hơn, sử dụng công cụ, lấy mẫu nhiều giải pháp, hoặc giàn giáo chuyên biệt. Một kết quả thuộc về hệ thống hoàn chỉnh đã được thử nghiệm dưới các điều kiện đã nêu. Nó không nên được chuyển giao một cách tùy tiện sang một bậc sản phẩm rẻ hơn hoặc một triển khai bị giới hạn thời gian.
Nhiều bài kiểm tra cũng nhanh chóng bão hòa. Stanford báo cáo những lợi ích lớn trên Humanity’s Last Exam và gần bão hòa trên SWE-bench Verified, trong khi lưu ý các câu hỏi không hợp lệ và khả năng thích ứng với bảng xếp hạng. Bão hòa có nghĩa là một đánh giá có ít khả năng phân biệt các hệ thống hàng đầu hơn; nó không có nghĩa là lĩnh vực nền tảng đã được giải quyết.
Lập trình và sử dụng máy tính
Các tác nhân hàng đầu có thể sửa các vấn đề kho lưu trữ được chọn, viết mã đáng kể, và vận hành các ứng dụng đồ họa. Stanford báo cáo hiệu suất OSWorld tăng từ khoảng 12% lên 66,3%, vẫn thất bại khoảng một trong ba nhiệm vụ có cấu trúc. Việc sử dụng máy tính thực tế bổ sung thêm giao diện thay đổi, mục tiêu không rõ ràng, thông tin xác thực, nội dung đối kháng, và hậu quả mà một bài đánh giá chuẩn có thể bỏ sót.
Chấm điểm tự động là một giới hạn khác. Nghiên cứu năm 2026 của METR về các bản vá SWE-bench phát hiện rằng việc vượt qua các bài kiểm tra của bài đánh giá chuẩn không có nghĩa là người bảo trì sẽ hợp nhất các thay đổi, làm nổi bật những chiều chất lượng vượt ngoài các trường hợp kiểm tra chức năng (nghiên cứu rà soát người bảo trì của METR). Lập trình sản xuất đòi hỏi kiến trúc, giao tiếp, bảo mật, bảo trì, và trách nhiệm đối với các thất bại.
Bằng chứng này ủng hộ sự hỗ trợ và tự động hóa đáng kể của công việc được chọn. Nó không ủng hộ việc “kỹ thuật phần mềm đã được giải quyết.”
Tính tự chủ nhiệm vụ dài
Bảng theo dõi tháng 5 năm 2026 của METR ước tính thời lượng nhiệm vụ của chuyên gia con người mà tại đó một tác nhân có tỷ lệ thành công dự đoán 50 hoặc 80%. Các nhiệm vụ chủ yếu liên quan đến kỹ thuật phần mềm, học máy, và an ninh mạng. METR nói rằng các phép đo trên mười sáu giờ là không đáng tin cậy với bộ hiện tại (chân trời nhiệm vụ của METR).
Thước đo này thường bị báo cáo sai. Chân trời bốn giờ không có nghĩa là tác nhân vận hành độc lập trong bốn giờ; nó có nghĩa là một chuyên gia con người thường cần khoảng bốn giờ cho các nhiệm vụ ở mức độ khó đã được đo lường. Các tác nhân thành công có thể hoàn thành nhanh hơn nhiều. Bộ này tự chứa và có thể chấm điểm khách quan, không giống như phần lớn công việc tổ chức.
METR còn cảnh báo thêm rằng các lĩnh vực khác nhau theo nhiều bậc độ lớn, thanh sai số có thể rộng, và một chân trời 50% là không đủ khi cần độ tin cậy 98% (giới hạn của METR). Xu hướng này là bằng chứng có ý nghĩa về tiến bộ nhanh chóng trong các nhiệm vụ kỹ thuật số được chọn—không phải là một đồng hồ đếm ngược đến tự động hóa việc làm hay AGI.
Khoa học, sinh học, và an ninh mạng
Viện An ninh AI Vương quốc Anh báo cáo rằng các hệ thống được thử nghiệm đến tháng 10 năm 2025 đã vượt qua các đường cơ sở chuyên gia tiến sĩ của họ trên các câu hỏi hóa học và sinh học được chọn và cải thiện ở việc tạo giao thức và khắc phục sự cố phòng thí nghiệm. Báo cáo cũng ghi nhận khó khăn dai dẳng với thiết kế plasmid toàn diện (Báo cáo Xu hướng AI Tiên phong của AISI). Đây là kết quả đánh giá của chính phủ, nhưng đường cơ sở chuyên gia và cách xây dựng nhiệm vụ vẫn quyết định ý nghĩa.
Năng lực an ninh mạng đã tiến bộ từ trả lời câu hỏi đến các tác nhân phát hiện lỗ hổng và giải các thử thách nhiều bước. AISI báo cáo sự tăng trưởng nhanh hơn trong các thước đo nhiệm vụ an ninh mạng của họ vào tháng 2 năm 2026 (xu hướng an ninh mạng của AISI). Báo cáo An toàn AI Quốc tế phân biệt bằng chứng đó với triển khai: những kẻ tấn công sử dụng AI, tuy nhiên các cuộc tấn công tự động toàn diện chưa được báo cáo công khai và liệu bên tấn công hay bên phòng thủ được lợi nhiều hơn vẫn còn chưa chắc chắn (Báo cáo An toàn AI Quốc tế 2026).
Thuyết phục và năng lực xã hội
AI đàm thoại có thể thay đổi thái độ trong các thí nghiệm. Một nghiên cứu năm 2026 do AISI dẫn đầu với 76.977 người tham gia phát hiện các hiệu ứng thuyết phục lớn hơn từ việc nhắc lệnh và hậu huấn luyện tập trung vào thuyết phục so với từ quy mô hoặc cá nhân hóa cơ bản; các hiệu ứng cá nhân hóa dưới một điểm phần trăm. Sự thuyết phục gia tăng có liên quan đến độ chính xác thực tế giảm (nghiên cứu thuyết phục của AISI).
Phát hiện đó thiết lập năng lực đo lường được dưới các điều kiện thí nghiệm. Nó không chứng minh sự thay đổi hành vi bền vững, tác động bầu cử, hay kiểm soát dân số. Phạm vi tiếp cận, phân phối nền tảng, các thông điệp cạnh tranh, niềm tin của người dùng, và tính bền vững vẫn là những biến số riêng biệt.
Hiện thân vật lý vẫn là một khoảng trống lớn
Robot học cho thấy sự khác biệt rõ ràng nhất giữa môi trường có kiểm soát và môi trường mở. Stanford báo cáo thành công cao trong một bài đánh giá chuẩn mô phỏng nhưng chỉ 12% trên các nhiệm vụ hộ gia đình thực đã được thử nghiệm. Xe tự hành vận hành ở quy mô có ý nghĩa trong các khu vực dịch vụ có giới hạn, với các miền thiết kế vận hành và hỗ trợ con người từ xa quan trọng đối với việc diễn giải.
Giao diện kỹ thuật số rộng của một mô hình ngôn ngữ không nên bị nhầm lẫn với tính tổng quát trong thế giới vật lý. Cảm biến, thao tác, an toàn xung quanh con người, phục hồi từ những lỗi mới lạ, bảo trì phần cứng, và chi phí đều hạn chế việc triển khai. Chương về robot hình người của cẩm nang này theo dõi khoảng cách đó giữa các minh chứng bài đánh giá chuẩn và hiệu suất robot trong thế giới thực chi tiết hơn, theo từng công ty.
Độ tin cậy là một phần của năng lực
Một tác nhân thành công 66% thời gian có thể hữu ích khi có rà soát và không thể chấp nhận được khi không có. Các hệ thống rủi ro cao đòi hỏi độ không chắc chắn được hiệu chuẩn, phát hiện lỗi, quyền kháng cáo, nhật ký kiểm toán, khả năng hoàn tác, bảo mật, và phương án dự phòng của con người. Điểm số bài đánh giá chuẩn trung bình che giấu những lỗi hiếm nhưng có hậu quả nghiêm trọng.
Chỉ số AI 2026 phát hiện rằng các nhà phát triển báo cáo các bài đánh giá chuẩn năng lực chính thống nhất quán hơn nhiều so với các đánh giá AI có trách nhiệm (chương AI có trách nhiệm của Chỉ số AI). Kết quả công khai bị thiếu không chứng minh được rằng không có thử nghiệm nội bộ, nhưng chúng hạn chế việc so sánh và sự đảm bảo công khai.
Bảng theo dõi này không thiết lập được điều gì
Nó không thiết lập được ý thức, ý định, giá trị kinh tế trên mọi công việc, hay một ngưỡng AGI được chấp nhận. Nó không cho thấy rằng một kết quả bài đánh giá chuẩn chuyển giao sang một ngôn ngữ, dân số, bộ công cụ, giới hạn chi phí, hay môi trường đối kháng khác. Nó không giải quyết được liệu các kiến trúc hiện tại có thể trở nên tổng quát một cách vững chắc hay không.
Tại thời điểm chụp ảnh này, kết luận mạnh nhất là các hệ thống tiên phong cho thấy bề rộng phi thường và tiến bộ nhanh chóng cùng với sự giòn gãy dai dẳng, khoảng trống theo lĩnh vực, và bằng chứng an toàn chưa đầy đủ. Đó là điều có ý nghĩa hơn—và chính xác hơn—so với cả “chỉ là tự động hoàn thành” lẫn “AGI đã đến.”