Anza na aina ya dai linalotolewa
«AI inaweza kufanya hili», «AGI itafika hivi karibuni», na «mfumo huu unaweza kusababisha maafa» si dai lilelile. Yanahitaji ushahidi tofauti. Onyesho zuri linaweza kuthibitisha kwamba mfano ulifaulu mara moja chini ya hali nzuri. Halithibitishi uaminifu, thamani ya kiuchumi, au utendakazi salama wa kujitegemea. Utabiri unaeleza hukumu kuhusu wakati ujao. Sio kipimo cha uwezo wa sasa.
Hili ni muhimu kwa sababu AGI haina jaribio linalokubalika kote. Fasili zinasisitiza mchanganyiko tofauti wa upana, utendaji, uhuru, ujifunzaji, umahiri wa kimwili, na athari za kiuchumi. Badala ya kuuliza kama kichwa cha habari kimoja kinathibitisha AGI, wasomaji wanapaswa kuuliza ni nini kilichopimwa, chini ya masharti gani, na hitimisho linasafiri mbali kiasi gani zaidi ya ushahidi.
Ngazi iliyo hapa chini si mpangilio thabiti ambapo kila kipengele katika ngazi moja kinashinda kila kitu chini yake. Tathmini ya maabara inayoweza kurudiwa inaweza kuwa ushahidi imara zaidi kwa utaratibu finyu kuliko data ya utumiaji yenye kelele. Kusudi lake ni kufichua hatua za kihitimu ambazo madai ya utangazaji na ya kutisha mara nyingi huficha.
Ngazi ya kwanza: hadithi na onyesho lililochaguliwa
Hadithi zinafichua uwezekano na mifumo ya kushindwa. Rekodi ya skrini ya wakala akijenga programu inaonyesha kwamba angalau jaribio moja lilizalisha matokeo yaliyoonyeshwa, tukidhania onyesho ni halisi. Udanganyifu wa kushangaza (hallucination) unaonyesha kwamba kushindwa kunaweza kutokea. Hakuna kati ya hizo linalotuambia tabia hiyo inatokea mara ngapi.
Uliza kama mtoa onyesho alichagua jaribio bora zaidi, alihariri vituo au kushindwa, alitumia msaada wa kibinadamu uliofichwa, au alichagua kazi anayoifahamu. Tafuta agizo kamili, vifaa, toleo la mfano, mipangilio ya sampuli, idadi ya majaribio, na visa vya kushindwa. Bila hivyo, chukulia matokeo kama kiashiria kinachostahili kuchunguzwa—wala si kiwango.
Maonyesho yanabaki na manufaa. Uwezo mpya mara nyingi huonekana katika hali ya fujo kabla ya upimaji rasmi kuwepo. Kosa ni kubadilisha «inaweza kutokea» kuwa «kwa kawaida hutokea», kisha kuwa «itabadilisha uchumi».
Ngazi ya pili: kipimo au tathmini iliyodhibitiwa
Tathmini inafafanua kazi, masharti, na kanuni ya upimaji. Inaweza kulinganisha mifumo kwa utaratibu zaidi kuliko hadithi. Tathmini imara hutumia kazi zilizohifadhiwa kando, huzuia uchafuzi, huripoti kutokuwa na uhakika, huweka wazi muundo unaozunguka na msaada wa kibinadamu, na hujaribu mifumo husika ya kushindwa. Urudiaji huru unaongeza imani.
Alama za vipimo bado zinaweza kupotosha. Data ya mafunzo inaweza kuwa na maswali yanayofanana. Timu zinaweza kuboresha kwa ajili ya jaribio la hadhara. Maarifa ya chaguo nyingi hayathibitishi ujuzi katika mahali pa kazi lisilofahamika. Wastani unaficha hitilafu kubwa za ncha (tail). Mfumo unaofaulu asilimia 90 ya wakati unaweza kutotumika katika mtiririko wa hatua 30 kwa sababu makosa hujilimbikiza.
Ripoti ya Kimataifa ya Usalama wa AI 2026 inatumia neno «pengo la tathmini» kwa tatizo la matokeo ya majaribio yaliyodhibitiwa kabla ya utumiaji kutotabiri kwa uaminifu utendaji wa ulimwengu halisi. Pia inaeleza wasifu wa uwezo wa sasa kama «wenye ncha kali»: utendaji unatofautiana kwa kiasi kikubwa kati ya kazi na miktadha, na mifumo inaweza kushindwa kazi zinazoonekana rahisi licha ya kufaulu tathmini ngumu. Haya ni matokeo kuhusu mipaka ya upimaji, wala si uthibitisho kwamba kila kipimo hakina maana. Makala ya kuaminika inapaswa kuripoti alama pamoja na kile jaribio linalokosa.
Ngazi ya tatu: tafiti za kupingana, za kisababishi, na za kuinua uwezo
Madai ya hatari yanahitaji zaidi ya kipimo cha kawaida. Timu nyekundu hutafuta njia za kuchochea tabia iliyokatazwa au hatari. Majaribio ya kisababishi hubadilisha sifa moja na kujaribu kama matokeo yanabadilika. Tafiti za kuinua uwezo (uplift) hulinganisha kile watu wanaweza kufanikisha na AI dhidi ya msingi wenye maana, kama vile intaneti pekee.
Tafiti hizo hujibu maswali tofauti. Ugunduzi wa timu nyekundu unaonyesha ufikiwaji chini ya shambulio lililojaribiwa, wala si kiwango cha idadi ya watu. Tathmini ya uwezo inaweza kuonyesha kwamba mfano unaweza kutengeneza mpango wenye madhara bila kuonyesha kwamba mhusika halisi anaweza kuutekeleza. Utafiti wa kuinua uwezo unaweza kuhusika zaidi na matumizi mabaya, lakini washiriki wake, kikomo cha muda, msingi, kipimo cha matokeo, na ulinzi vinabaini maana yake.
Sampuli ndogo huzalisha kutokuwa na uhakika kikubwa. Washiriki wataalamu wanaweza kupunguza makadirio ya kuinuliwa kwa wasio na uzoefu lakini kuwakilisha vizuri zaidi washambuliaji wenye ujuzi. Kazi mbadala (proxy) huepuka kusababisha madhara halisi lakini zinaweza kukosa vikwazo vya ulimwengu halisi. Matokeo huzeeka haraka kadri mifano na udhibiti unavyobadilika. Uripoti mzuri huyataja mipaka hiyo badala ya kuyabana kuwa «AI inawezesha» au «AI haiongezi» hatari.
Ngazi ya nne: ushahidi wa uwandani na wa utumiaji
Data ya ulimwengu halisi inaweza kufichua upokezi, tija, matukio, matumizi mabaya, na urekebishaji wa kitaasisi. Majaribio ya kiwandani yaliyochaguliwa kwa nasibu na majaribio-nusu yaliyobuniwa kwa uangalifu yanaweza kukadiria athari za kisababishi. Hifadhidata za matukio na taarifa za malalamiko zinaweza kuonyesha madhara yanayojirudia. Ukaguzi unaweza kugundua tofauti ambazo maabara ya mtengenezaji haikujaribu.
Ushahidi wa utumiaji pia una vipofu. Kampuni zinaona zaidi ya wanavyofichua. Watumiaji huchagua kama na jinsi ya kutumia chombo, jambo linalofanya ulinganisho rahisi kuwa na upendeleo. Matukio yaliyoripotiwa si sawa na matukio yote. Ongezeko la tija katika huduma kwa wateja halijumlishwi kiotomatiki kwa utafiti, uongozi, udaktari, au robotiki.
Wasomaji wanapaswa kutafuta idadi ya watu, mazingira, kundi la kulinganisha, kipindi cha muda, matokeo, na migongano ya maslahi. «Wafanyakazi walikamilisha kazi zaidi» ni tofauti na «biashara iliongeza thamani zaidi», na zote mbili ni tofauti na «ajira ilipungua». Ushahidi wa sasa wa kazi kuhusu AI ya kizazi haipaswi kuwekewa lebo tena kama ushahidi kuhusu AGI ya kudhaniwa.
Ngazi ya tano: uongezaji wa mielekeo na utabiri
Utabiri huchanganya vipimo na mawazo. Mielekeo ya kikokotoo, maendeleo ya kialgorithimu, uwekezaji, utendaji wa vipimo, na uaminifu wa wakala vinaweza kufahamisha utabiri, lakini hakuna kimoja kinachoamua peke yake tarehe ya AGI. Vikwazo vinaweza kulegea, kubana, au kubadilika. Fasili zinaweza kubadilika.
Utafiti wa mzani wa muda wa METR unakadiria muda wa ukamilishaji wa kazi wa kiwango cha mtaalamu wa binadamu ambao kwao wakala aliyejaribiwa anatabiriwa kufaulu kwa uaminifu uliotajwa, kwa kawaida asilimia 50 au 80. Seti yake ya sasa inaundwa hasa na kazi za uhandisi wa programu, ujifunzaji wa mashine, na usalama wa mtandao zilizojitosheleza na kubainishwa vizuri zenye kanuni wazi za upimaji. Kipimo hicho ni ushahidi muhimu kuhusu mpangilio maalum wa wakala na usambazaji wa kazi. Sio muda ambao AI inafanya kazi kwa uhuru, kipimo cha kazi yote yenye thamani ya kiuchumi, au saa inayohesabu kurudi nyuma kuelekea AGI. METR pia inaonya kwamba vipimo vilivyo juu ya masaa 16 haviaminiki katika seti yake ya sasa ya kazi.
Tathmini utabiri kwa ufafanuzi wake wa kivitendo, tarehe, uwezekano, mfano, kiwango cha msingi, na rekodi yake ya awali. Utabiri uliolinganishwa vizuri unasema, kwa maana, «matokeo yaliyopewa asilimia 30 yanapaswa kutokea karibu asilimia 30 ya wakati». Tarehe yenye kujiamini bila vigezo vya utatuzi haiwezi kupimwa. Tafiti za wataalamu hunasa imani zenye taarifa lakini hazibadilishi mgawanyiko kuwa ushahidi wa kimajaribio.
Hali (scenarios) hutumikia kusudi jingine. Zinachunguza njia zenye masharti: iwapo uwezo, ufikiaji, uhuru, na mwitikio wa kitaasisi vitachukua thamani zilizobainishwa, nini kinafuata? Hali inaweza kufichua udhaifu bila kuwa wakati ujao unaowezekana zaidi. Iwekewe lebo ipasavyo.
Ngazi ya sita: utaratibu na hoja za kinadharia
Baadhi ya hatari kubwa za AGI haziwezi kuonyeshwa moja kwa moja bila mifumo husika—na haipaswi kuundwa kwa lengo tu la kupata uthibitisho. Badala yake, watafiti wanapendekeza taratibu kama vile udanganyifu wa zawadi (reward hacking), utafutaji wa rasilimali wa kiala, mashindano ya ushindani, au ukabidhi wa taratibu wa mamlaka. Mifano rasmi inaweza kufafanua kama hitimisho linatokana na mawazo.
Swali kuu si kama hoja inasikika ya kuvutia. Ni ni mawazo yapi yana uthibitisho wa kimajaribio. Je, mfumo una lengo la kudumu? Je, unaweza kupanga katika kipindi kinachohitajika? Je, una ufikiaji wa vifaa, fedha, miundombinu, au nakala za yenyewe? Je, ufuatiliaji utashindwa? Je, taasisi zinaweza kujibu? Kila kiungo kinaweza kubadilisha uwezekano wa mnyororo mzima.
Kukosekana kwa data ya maafa ya moja kwa moja si ushahidi wa hatari sifuri. Wala njia inayowezekana kimantiki haithibitishi uwezekano mkubwa. Maamuzi chini ya kutokuwa na uhakika yanapaswa kuzingatia matokeo, uwezekano wa kurejea nyuma, muda wa onyo, na gharama na ufanisi wa ulinzi. Hilo ni hukumu ya usimamizi wa hatari, wala si ugunduzi kwamba nadharia imekuwa uchunguzi.
Tumia kadi ya ushahidi kwa madai yenye uzito
Kwa kauli kubwa yoyote, rekodi sehemu sita:
- Dai: pendekezo finyu linalodaiwa hasa.
- Hali: matokeo yaliyoshuhudiwa, uhitimu, utabiri, hali (scenario), au pendekezo.
- Chanzo: utafiti wa msingi, data rasmi, muhtasari, ripoti ya kampuni, vyombo vya habari, au maoni.
- Wigo: mfano, toleo, kazi, idadi ya watu, mamlaka ya kisheria, na tarehe.
- Kutokuwa na uhakika: ukubwa wa sampuli, kipindi cha uaminifu, urudiaji, data iliyokosekana, na maelezo mbadala yanayowezekana.
- Kichocheo cha kusasisha: ushahidi ambao ungeimarisha, kudhoofisha, au kuondoa dai hilo.
Wasifu wa hiari wa NIST wa Generative AI Profile ni mwenzake wa sekta mbalimbali kwa Mfumo wa Usimamizi wa Hatari za AI, wala si jaribio au uthibitisho wa AGI. Unaandaa hatua zinazopendekezwa chini ya kazi za mfumo huo za Kutawala, Kuweka Ramani, Kupima, na Kusimamia, na kuchukulia usimamizi wa hatari kama shughuli ya mzunguko wa maisha. Mwongozo wa upimaji wa NIST AI RMF mpana zaidi unahitaji upimaji ulioandikwa, vipimo vya kutokuwa na uhakika, upimaji husika wa utumiaji, ufuatiliaji, na ukaguzi huru pale unapoweza kupunguza upendeleo wa ndani. Kiolezo halisi kina umuhimu mdogo kuliko kufanya mnyororo wa ushahidi kuwa unaoweza kukaguliwa.
Linganisha kujiamini na ushahidi
Uripoti wa kuaminika wa AGI hauhitaji kutoegemea upande wowote kwa uongo. Ukweli fulani umethibitishwa vizuri: mifano inaboreka katika tathmini nyingi, madhara halisi tayari yanatokea, uwezo unabaki usio sawa, na taasisi zina uwezo usio kamili wa kuona. Mapendekezo mengine—tarehe za AGI, kuinuka kwa ghafla (discontinuous takeoff), fahamu ya kidijitali, upatanishi thabiti, uwezekano wa kutoweka kwa binadamu—yanabaki na mjadala mkubwa.
Jibu lenye nidhamu ni usahihi. Sema «utafiti uligundua» unapoeleza matokeo yake, «waandishi wanahitimisha» unaposonga zaidi ya hayo, «watabiri wanakadiria» unapotoa imani, na «hali hii inadhania» unapochunguza njia fulani. Kisha unganisha chanzo karibu na dai.
Lugha hiyo inaweza kuhisi isiyo na maonyesho mengi kuliko hesabu ya kurudi nyuma au tangazo. Ina manufaa zaidi. Binadamu watafanya maamuzi bora kuhusu AI ya hali ya juu kwa kujua kile ushahidi kinachounga mkono, mahali kinapoishia, na nini kingebadilisha tathmini hiyo.