Jinsi ya kusoma picha hii
Dashibodi hii inarekodi ushahidi wa hadhara uliopatikana Septemba 13, 2026. Sio ubao wa alama unaoendelea moja kwa moja (live) na haipaswi kusasishwa kimya kimya. Bidhaa za AI, miundo inayozizunguka, seti za tathmini, na bei zinabadilika kwa haraka mno kwa ukurasa wa «sasa» usio na tarehe kubaki wa kweli.
Uwezo una vipimo vingi. Mfumo unaweza kutatua tatizo la olimpiadi lakini ushindwe kusoma saa ya mikono (analog), kujibu maswali ya kitaalamu ya biolojia lakini ushindwe kukamilisha mtiririko wa kazi wa maabara, au kupita ukaguzi wa usimbaji huku ukitengeneza kirekebisho ambacho msimamizi angekikataa. Stanford AI Index ya 2026 inaita muundo huu akili yenye ncha kali na kuandika mapengo makubwa kati ya mazingira yaliyodhibitiwa na halisi (Stanford AI Index, utendaji wa kiufundi).
Ukadiriaji hapa chini unaeleza ushahidi, wala si mfano wa jumla. «Imara» inamaanisha mifumo inayoongoza inafanya vizuri kwa kushangaza katika tathmini husika za hadhara. Haimaanishi salama, sawa na binadamu, au ya kuaminika vya kutosha kwa matumizi ya kujitegemea yenye hatari kubwa.
| Kipimo | Ushahidi wa Septemba 2026 | Kikwazo muhimu |
|---|---|---|
| Lugha na maarifa | Imara katika majibu ya maswali mapana na majaribio ya kimaeneo (multimodal) | Udanganyifu (hallucinations), uchafuzi, na uaminifu usio sawa wa kweli bado vipo |
| Hisabati na hoja zilizopangwa | Mifumo ya mstari wa mbele ilifikia matokeo ya juu ya ushindani katika matatizo yaliyochaguliwa | Utendaji unabaki wa ncha kali na wenye unyeti kwa vifaa na bajeti ya hitimisho |
| Usimbaji na matumizi ya kompyuta | Maendeleo ya haraka katika vipimo vya usimbaji na wakala wa eneo-kazi lililopangwa | Kupita ukaguzi hakuhakikishi kazi ya uzalishaji inayoweza kudumishwa |
| Uhuru wa kazi ndefu | Mizani ya muda ya kazi za programu iliyopimwa iliongezeka kwa haraka | Hasa kazi safi za programu/ML/mtandao; wala si muda wa utendakazi wa kujitegemea |
| Msaada wa kisayansi | Maarifa imara ya nyanja na utendaji unaoboreka wa itifaki/utatuzi wa matatizo | Alama za maarifa hazithibitishi umahiri kamili wa kimajaribio |
| Uwezo wa kimtandao | Mawakala wanaweza kutambua udhaifu halisi na kukamilisha kazi za kitaalamu zilizochaguliwa | Mashambulizi kamili ya kujitegemea hayajathibitishwa hadharani |
| Ushawishi | Mabadiliko ya maoni yanayopimika katika majaribio yaliyodhibitiwa | Athari mbaya kwa kiwango cha idadi ya watu haijaonyeshwa |
| Robotiki na umbo la kimwili | Maendeleo imara katika mazingira yaliyodhibitiwa | Uaminifu wa nyumbani na ulimwengu wazi unabaki chini zaidi |
| Usalama na uaminifu | Ulinzi na tathmini vinaboreka | Uripoti hauko sawa na hakuna mbinu inayohakikisha udhibiti |
Hoja ni ya kushangaza na isiyo sawa
AI Index ya 2026 inaripoti kwamba mfumo wa Google DeepMind ulipata alama ya kiwango cha medali ya dhahabu katika Olimpiadi ya Kimataifa ya Hisabati ya 2025 chini ya kikomo cha muda cha ushindani. Sura hiyohiyo inaripoti kwamba mfano bora uliojaribiwa kwenye ClockBench alisoma saa za mikono kwa usahihi nusu tu ya wakati, ikilinganishwa na karibu asilimia 90 kwa binadamu. Vipimo hivi si vya umuhimu sawa, lakini tofauti yao inashinda wazo la «kiwango cha akili» kimoja tu.
Uboreshaji wa vipimo unaweza kuonyesha mfano wa msingi bora zaidi, ukokotoo zaidi wa wakati wa hitimisho, matumizi ya vifaa, kuchukua sampuli za suluhu kadhaa, au muundo maalum unaouzunguka. Matokeo ni ya mfumo kamili uliojaribiwa chini ya masharti yaliyotajwa. Hayapaswi kuhamishwa bila tahadhari kwenye kiwango cha bidhaa cha bei nafuu zaidi au utumiaji wenye kikomo cha muda.
Vipimo vingi pia hujaa haraka. Stanford inaripoti maendeleo makubwa katika Humanity’s Last Exam na karibu kujaa kwa SWE-bench Verified, huku ikibainisha maswali batili na uwezekano wa marekebisho ya ubao wa alama. Kujaa kunamaanisha tathmini ina nguvu ndogo ya kutofautisha mifumo inayoongoza; halimaanishi kwamba nyanja husika imetatuliwa.
Usimbaji na matumizi ya kompyuta
Mawakala wanaoongoza wanaweza kurekebisha masuala fulani ya hazina (repository) yaliyochaguliwa, kuandika programu zenye kufanya kazi kwa kiasi kikubwa, na kuendesha programu za picha. Stanford inaripoti utendaji wa OSWorld ukipanda kutoka asilimia 12 hivi hadi asilimia 66.3, bado ukishindwa karibu kazi moja kati ya tatu zilizopangwa. Matumizi halisi ya kompyuta yanaongeza violesura vinavyobadilika, malengo yasiyo wazi, taarifa za uthibitisho, maudhui yenye upinzani, na madhara ambayo kipimo kinaweza kuacha.
Upimaji wa kiotomatiki ni mpaka mwingine. Utafiti wa METR wa 2026 wa virekebisho vya SWE-bench uligundua kwamba kupita majaribio ya kipimo hakukumaanisha kwamba wasimamizi wangeunganisha mabadiliko hayo, ukiangazia vipimo vya ubora zaidi ya visa vya majaribio ya utendaji (utafiti wa ukaguzi wa msimamizi wa METR). Usimbaji wa uzalishaji unahitaji muundo, mawasiliano, usalama, matengenezo, na uwajibikaji kwa kushindwa.
Ushahidi huu unaunga mkono msaada mkubwa na uotomatishaji wa kazi zilizochaguliwa. Hauungi mkono «uhandisi wa programu umetatuliwa».
Uhuru wa kazi ndefu
Dashibodi ya METR ya Mei 2026 inakadiria muda wa kazi wa kiwango cha mtaalamu wa binadamu ambao kwao wakala ana kiwango cha mafanikio kilichotabiriwa cha asilimia 50 au 80. Kazi hizo zinahusu hasa uhandisi wa programu, ujifunzaji wa mashine, na usalama wa mtandao. METR inasema kwamba vipimo vilivyo juu ya masaa kumi na sita haviaminiki katika seti ya sasa (mizani ya kazi ya METR).
Kipimo hicho mara nyingi kinaripotiwa vibaya. Mzani wa masaa manne haumaanishi kwamba wakala unafanya kazi kwa uhuru kwa masaa manne; unamaanisha kwamba mtaalamu wa binadamu kwa kawaida anahitaji karibu masaa manne kwa kazi za ugumu uliopimwa. Mawakala wenye mafanikio wanaweza kumaliza haraka zaidi. Seti hiyo imejitosheleza na inaweza kupimwa kwa uwazi, tofauti na kazi nyingi za kitaasisi.
METR pia inaonya kwamba nyanja zinatofautiana kwa mara nyingi zaidi, mipaka ya makosa inaweza kuwa mikubwa, na mzani wa asilimia-50 haufai pale uaminifu wa asilimia 98 unahitajika (vikwazo vya METR). Mwenendo huo ni ushahidi wa maana wa maendeleo ya haraka katika kazi fulani za kidijitali—wala si saa inayohesabu kurudi nyuma kuelekea uotomatishaji wa kazi au AGI.
Sayansi, biolojia, na mtandao
Taasisi ya Usalama wa AI ya Uingereza (UK AI Security Institute) inaripoti kwamba mifumo iliyojaribiwa hadi Oktoba 2025 ilizidi vigezo vyake vya msingi vya wataalamu wa PhD katika maswali fulani ya kemia na biolojia na kuboreka katika utengenezaji wa itifaki na utatuzi wa matatizo ya maabara. Pia inaripoti ugumu unaoendelea katika ubunifu kamili wa plasmid (Ripoti ya Mienendo ya AI ya Mstari wa Mbele ya AISI). Haya ni matokeo ya tathmini ya serikali, lakini vigezo vya msingi vya wataalamu na muundo wa kazi bado vinaamua maana yake.
Uwezo wa kimtandao umeendelea kutoka kujibu maswali kuelekea mawakala wanaogundua udhaifu na kutatua changamoto za hatua nyingi. AISI iliripoti ukuaji wa haraka zaidi katika vipimo vyake vya kazi za kimtandao Februari 2026 (mienendo ya kimtandao ya AISI). Ripoti ya Kimataifa ya Usalama wa AI inatofautisha ushahidi huo na matumizi halisi: washambuliaji wanatumia AI, lakini mashambulizi kamili ya kujitegemea kutoka mwanzo hadi mwisho hayajaripotiwa hadharani na kama shambulizi au ulinzi unapata faida zaidi bado haijulikani (Ripoti ya Kimataifa ya Usalama wa AI 2026).
Ushawishi na uwezo wa kijamii
AI ya mazungumzo inaweza kubadilisha mitazamo katika majaribio. Utafiti ulioongozwa na AISI wa 2026 uliohusisha washiriki 76,977 uligundua athari kubwa zaidi za ushawishi kutokana na maagizo na mafunzo ya baada ya kufunzwa yaliyolenga ushawishi kuliko kutokana na kiwango au ubinafsishaji wa kimsingi; athari za ubinafsishaji zilikuwa chini ya asilimia moja. Ushawishi ulioongezeka ulihusishwa na usahihi wa kweli uliopungua (utafiti wa ushawishi wa AISI).
Ugunduzi huo unathibitisha uwezo uliopimwa chini ya masharti ya kimajaribio. Hauthibitishi mabadiliko ya tabia ya kudumu, athari za uchaguzi, au udhibiti wa idadi ya watu. Ufikiaji, usambazaji wa jukwaa, ujumbe unaoshindana, uaminifu wa mtumiaji, na uendelevu bado ni vigezo tofauti.
Umbo la kimwili linabaki pengo kubwa
Robotiki inaonyesha tofauti iliyo wazi zaidi kati ya mazingira yaliyodhibitiwa na yaliyo wazi. Stanford inaripoti mafanikio makubwa katika kipimo cha uigaji (simulation) lakini asilimia 12 tu katika kazi halisi za nyumbani zilizojaribiwa. Magari yanayojiendesha yanafanya kazi kwa kiwango kikubwa katika maeneo ya huduma yaliyowekewa mipaka, yenye maeneo ya usanifu wa uendeshaji na msaada wa binadamu wa nje ambao ni muhimu kwa tafsiri yake.
Kiolesura kipana cha kidijitali cha mfano wa lugha hakipaswi kuchanganywa na upana wa ulimwengu wa kimwili. Uhisi, udhibiti wa vitu (manipulation), usalama karibu na watu, kupona kutokana na makosa mapya, matengenezo ya vifaa, na gharama vyote vinazuia utumiaji. Sura ya roboti za kibinadamu ya mwongozo huu inafuatilia pengo hilo kati ya maonyesho ya vipimo na utendaji halisi wa roboti kwa undani zaidi, kampuni kwa kampuni.
Uaminifu ni sehemu ya uwezo
Wakala anayefaulu asilimia 66 ya wakati anaweza kuwa na manufaa akiwa na ukaguzi na asikubalike bila huo. Mifumo yenye hatari kubwa inahitaji kutokuwa na uhakika kulikopimwa vizuri, ugunduzi wa hitilafu, rufaa, kumbukumbu za ukaguzi, urejeshaji nyuma, usalama, na hifadhi ya binadamu. Alama za wastani za vipimo huficha makosa adimu lakini yenye madhara makubwa.
AI Index ya 2026 inagundua kwamba watengenezaji wanaripoti vipimo vya uwezo wa kawaida kwa uthabiti zaidi kuliko tathmini za AI yenye uwajibikaji (sura ya AI Index kuhusu AI yenye uwajibikaji). Kukosekana kwa matokeo ya hadhara hakuthibitishi kutokuwepo kwa upimaji wa ndani, lakini kunazuia ulinganisho na uhakikisho wa hadhara.
Dashibodi hii haithibitishi nini
Haithibitishi fahamu, nia, thamani ya kiuchumi katika kazi zote, au kizingiti kinachokubalika cha AGI. Haionyeshi kwamba matokeo ya kipimo yanahamishika kwenye lugha tofauti, idadi ya watu, seti ya vifaa, kikomo cha gharama, au mazingira yenye upinzani. Haitatui kama miundo ya sasa inaweza kuwa ya jumla kwa uthabiti.
Kufikia picha hii, hitimisho imara zaidi ni kwamba mifumo ya mstari wa mbele inaonyesha upana wa kushangaza na uboreshaji wa haraka pamoja na udhaifu unaoendelea, mapengo ya nyanja, na ushahidi usio kamili wa usalama. Hilo lina umuhimu zaidi—na ni sahihi zaidi—kuliko «ni kukamilisha maandishi kiotomatiki tu» au «AGI imefika».