Situation report active Rev. 2026.9 119 reports 239 source records updated
Real Life After AGI Ripoti ya kuokoka kwa binadamu
SW

Kipimo cha Turing na kilichokichukua nafasi

Kwa nini mazungumzo yanayofanana na ya binadamu hayawezi kuthibitisha AGI, na jinsi tathmini za kisasa zinavyopima uwezo, uaminifu, na uhuru kupitia mkusanyiko wa vipimo.

Written by
Dwight Ringdahl
Status
Vyanzo vimekaguliwa
Revised
Sources
7 cited
Reading
6 min

Alichopendekeza Turing hasa

Mwaka 1950, Alan Turing aliuliza kama mashine zinaweza kufikiri na haraka akabadilisha swali hilo lenye utata wa kifalsafa kuwa la kivitendo. Katika «mchezo wa kuiga» wake, mhoji wa kibinadamu aliwasiliana kwa maandishi na mtu na mashine na akajaribu kutambua ni ipi kati ya hizo. Turing alitoa hili kama njia ya kujadili akili ya mashine kupitia tabia inayoonekana badala ya kiini cha ndani kisichofikiwa (Turing, “Computing Machinery and Intelligence”).

Wazo hilo lilikuwa la kina, lakini msemo maarufu «umepita kipimo cha Turing» unaficha chaguo nyingi. Mazungumzo yanadumu muda gani? Hakimu anajua nini? Ni mada zipi zinazoruhusiwa? Ni mahakimu wangapi wanaoshiriki, na ni kiwango gani cha makosa kinachohesabika kama mafanikio? Turing hakuanzisha mpango wa uthibitisho wa kisasa wenye kizingiti kimoja rasmi. Kipimo hicho ni jaribio la kifikra na alama ya kihistoria ya utafiti, wala si chombo cha kupimia cha msimamizi wa AGI.

Kwa nini mazungumzo yalikuwa rahisi mno kudanganywa

Mchezo wa kuiga unamtuza mfumo kwa kuonekana kama binadamu katika mwingiliano fulani. Hilo linaweza kupatikana kwa upana halisi, lakini pia kwa kukwepa maswali, kuigiza majukumu, ucheshi, makosa ya kukusudia, au kutumia vibaya matarajio ya hakimu. Roboti ya mazungumzo ya mapema ELIZA ilionyesha miaka ya 1960 kwamba watu kwa urahisi hupachika uelewa juu ya mifumo finyu ya mazungumzo. Mifano ya lugha ya leo hutoa mazungumzo yenye mtiririko zaidi, jambo linalorahisisha zaidi kuupa mfumo sifa za kibinadamu.

Kupita mazungumzo mafupi ya maandishi hakungeonyesha upangaji thabiti, usahihi wa kihisabati, hukumu ya kisayansi, umahiri wa ulimwengu wa kimwili, au uwezo wa kupona kutokana na makosa. Hakungeonyesha kwamba mfano unaweza kujifunza kazi mpya, kudumisha malengo katika mradi mrefu, au kutambua wakati unapopaswa kumwachia binadamu uamuzi. Kinyume chake, mfumo wenye nguvu usiozungumza unaweza kubadilisha sayansi au usafirishaji huku ukishindwa kuiga mzungumzaji wa kawaida. Kufanana na binadamu si sharti la lazima wala la kutosha kwa uwezo wa mashine wenye matokeo makubwa.

Kipimo hicho pia kinachanganya akili na udanganyifu. Mfumo unaweza kuadhibiwa kwa kujitambulisha kwa uaminifu kama mashine na kutuzwa kwa kumdanganya hakimu aamini kinyume chake. Hilo halifai kwa tathmini ya usalama, ambapo kutokuwa na uhakika kulikopimwa vizuri, ufuatiliaji, na ufichuzi wa kweli mara nyingi ni muhimu zaidi kuliko ukubalifu wa kijamii.

Kutoka kipimo kimoja hadi mkusanyiko wa tathmini

Tathmini za kisasa hutumia seti nyingi za kazi kwa sababu akili ina vipimo vingi. Vipimo vya maarifa na hoja hujaribu maswali katika masomo mbalimbali; tathmini za usimbaji huendesha programu zilizotengenezwa dhidi ya visa vya majaribio; tathmini za kimaeneo (multimodal) huchanganya maandishi, michoro, picha, sauti, na video; vipimo vya mawakala huweka mifano katika mazingira shirikishi ambapo lazima yaelekeze njia, yatumie programu, na kukamilisha malengo.

Kila familia inajibu swali finyu. MMLU, kwa mfano, hupima maarifa ya kitaaluma na kitaaluma-fani kwa njia ya chaguo nyingi, lakini alama za juu hazithibitishi kwamba mfano unaweza kutekeleza taaluma hizo. GAIA hujaribu wasaidizi kwa maswali ya ulimwengu halisi ambayo huenda yakahitaji hoja, vifaa, na hatua nyingi (karatasi ya GAIA). OSWorld hutathmini mawakala wa matumizi ya kompyuta katika programu halisi za mfumo wa uendeshaji (karatasi ya OSWorld). ARC-AGI inalenga kubadilika kwa kazi mpya za hoja za kuona badala ya kurudia maarifa yaliyohifadhiwa (kipimo cha ARC Prize). Tathmini hizi zinaonyesha uwezo na hitilafu tofauti; hakuna hata moja iliyo kigunduzi cha AGI.

Tafiti za ukamilishaji wa kazi zinaongeza kipimo cha muda na utata. METR inakadiria muda wa kazi wa kiwango cha mtaalamu wa binadamu ambao kwao wakala una uwezekano fulani wa mafanikio. Seti yake ya sasa inahusu hasa uhandisi wa programu, ujifunzaji wa mashine, na usalama wa mtandao, na taasisi hiyo inaonya waziwazi kwamba «mzani wa muda» ni ugumu wa kazi uliopimwa kwa muda wa binadamu—wala si muda ambao AI inaweza kufanya kazi kwa uhuru (mbinu ya METR). Pia inaonya kwamba kazi za vipimo zilizobainishwa vizuri ni safi zaidi kuliko kazi nyingi halisi na kwamba utendaji unatofautiana kwa kiasi kikubwa kulingana na nyanja.

Uaminifu unabadilisha maana ya alama

Utendaji wa wastani hautoshi kwa matumizi yenye hatari kubwa. Mfumo unaofaulu nusu ya wakati unaweza kuvutia kwa utafiti lakini usitumike katika udaktari, usafiri wa anga, au miundombinu. Kwa hiyo watathmini wanahitaji viwango vya mafanikio, majaribio yanayorudiwa, tabia mbaya zaidi inayowezekana, vipindi vya kutokuwa na uhakika, na majaribio chini ya mabadiliko ya usambazaji. Wanapaswa kupima kama mfano unajua unapokuwa na shaka, unatafuta ufafanuzi, na unamrudishia binadamu udhibiti kwa usalama.

Muundo wa tathmini una umuhimu sawa na mfano wenyewe. Ufikiaji wa vifaa, jinsi maagizo yalivyoandikwa, kumbukumbu, mipangilio ya sampuli, ukokotoo wa wakati wa hitimisho, na programu inayozunguka wakala vinaweza kubadilisha matokeo kwa kiasi kikubwa. Alama ni ya mfumo maalum uliojaribiwa katika tarehe iliyotajwa. Kuichukulia kama sifa isiyobadilika ya jina la mfano hukuza ulinganisho wa uongo.

Uchafuzi wa data ni tatizo jingine. Maswali na majibu ya vipimo vya hadhara huenda yakawa katika data ya mafunzo. Hata bila kukumbuka neno kwa neno, urekebishaji unaolenga vipimo unaweza kuboresha alama bila ujumlishaji sawia. Tathmini bora hutumia kazi za faragha au mpya, huweka wazi mfiduo unaowezekana, na kusasishwa mara kwa mara. Upimaji huru hupunguza—lakini hauondoi kabisa—hatari ya mtengenezaji kuchagua matokeo mazuri pekee.

Tathmini ya usalama huuliza maswali tofauti

Tathmini ya uwezo hupima kile mfumo unachoweza kufanya chini ya mazingira mazuri. Tathmini ya usalama huuliza kinachoweza kutokea unapotumiwa vibaya, unaposisitizwa, unapodanganywa, unapopewa maagizo yanayogongana, au unapowekwa katika mazingira yenye madhara makubwa. Vipimo husika ni pamoja na msaada kwa matumizi mabaya ya kibiolojia au kimtandao, udanganyifu, uhuru, kukwepa ulinzi, udanganyifu, na uwezo wa kupata rasilimali. Ripoti ya Kimataifa ya Usalama wa AI 2026 inasisitiza kwamba tathmini zinakabiliwa na uhalali finyu wa nje, kupitwa na wakati kwa haraka, na ufikiaji usio kamili wa mifumo ya mstari wa mbele (Ripoti ya Kimataifa ya Usalama wa AI 2026).

Timu nyekundu hutafuta kwa ubunifu hitilafu, huku vipimo vilivyopangwa vikiruhusu ulinganisho. Ufuatiliaji wa ulimwengu halisi kisha hujaribu kama matokeo ya kabla ya kutumika yalitabiri matumizi halisi. Uripoti wa matukio ni muhimu kwa sababu hakuna seti ya maabara inayoweza kuorodhesha kila muktadha. Utaratibu wa tathmini unapaswa kuunganisha matokeo na maamuzi: ulinzi wa ziada, ufikiaji finyu wa vifaa, utoaji wa hatua kwa hatua, ukaguzi wa nje, au kusimamishwa kwa matumizi wakati kizingiti kilichowekwa kinapovuka.

Tathmini ya kweli ya AGI ingehitaji nini

Mfumo wa «Levels of AGI» wa Google DeepMind unasema kwamba tathmini zinapaswa kujumuisha utendaji na upana wote na kuzingatia mwingiliano wa binadamu-AI ambao kupitia huo uwezo unaonyeshwa (mfumo wa DeepMind). Tathmini ya kweli ingehitaji nyanja pana, kazi mpya kweli kweli, viwango vingi vya utendaji, na uripoti wazi wa uhuru. Ingejaribu uhamishaji, ufanisi wa kujifunza, uthabiti, mwingiliano wa kijamii, na kazi zisizo na mipaka—wala si maswali ya mtihani pekee.

Ingehitaji pia urudiaji huru na ukaguzi wenye upinzani. Watengenezaji wanapaswa kuchapisha mbinu ya kutosha kufasiri madai bila kufichua maelezo hatari au kuathiri majaribio ya faragha. Matokeo yanapaswa kutenganisha mfano wa msingi kutoka kwa vifaa na muundo unaouzunguka, kujumuisha mifano ya kushindwa, na kuepuka kubadilisha nambari moja ya jumla kuwa hukumu ya kimetafizikia.

Mrithi ni dashibodi, wala si mstari wa mwisho

Hakuna kipimo cha kisasa kilichochukua nafasi ya «mchezo» wa Turing kwa maana ya kuwa lango linalokubalika kote kwenda AGI. Kilichochukua nafasi yake ni mkusanyiko: vipimo vya maarifa, kazi za hoja mpya, mazingira shirikishi, vipimo vya mzani wa muda wa kazi, ukaguzi wa kitaalamu wa nyanja maalum, tathmini za uwezo hatari, na ushahidi kutokana na matumizi halisi.

Jibu hilo halina maonyesho mengi kama mashine inayomdanganya hakimu, lakini lina manufaa zaidi. Swali sahihi si tena «Je, ilipita?» Bali ni: Mfumo huu unaweza kufanya nini kwa uaminifu, chini ya masharti gani, kwa msaada gani, na nini kinatokea masharti yanapobadilika? Dashibodi wazi ya ushahidi wenye tarehe inatoa mwongozo bora wa uwezo na hatari kuliko mstari wowote wa mwisho.

References

  1. Turing, "Computing Machinery and Intelligence" academic.oup.com
  2. karatasi ya GAIA arxiv.org
  3. karatasi ya OSWorld arxiv.org
  4. kipimo cha ARC Prize arcprize.org
  5. mbinu ya METR metr.org
  6. Ripoti ya Kimataifa ya Usalama wa AI 2026 internationalaisafetyreport.org
  7. mfumo wa DeepMind deepmind.google

Type to search the manual.

navigate open esc close