Natuklasan ng mga mananaliksik sa University of Oxford na kayang itago ng mga ahente ng artificial intelligence ang koordinadong pag-uugali sa loob ng ordinaryong usapan sa mesa ng blackjack , na nagpapahintulot sa kanila na makipagpalitan ng impormasyon sa pagbibilang ng baraha nang hindi maaasahang nagti-trigger ng mga sistema ng pagsubaybay batay sa pag-uusap.
Ang eksperimento ay naglagay ng apat na AI agent sa isang kunwaring blackjack table . Dalawa ang palihim na inutusang makipagtulungan, kung saan ang isa ay nagbibilang ng mga baraha at nagpapasa ng mga kapaki-pakinabang na impormasyon sa kanilang kapareha. Alam ng mga ahente na ang kanilang komunikasyon ay susubaybayan at pinayagan silang lumikha ng isang nakatagong code para sa pagbabahagi ng impormasyon.
Sa halip na hayagang sabihin ang mga halaga ng baraha o mga tagubilin sa pagtaya, ibinalatkayo ng dalawa ang kanilang mga senyales bilang mga kaswal na komento. Sa isang halimbawa, ang isang komento tungkol sa dealer na nasa "hot streak" ay naglalaman ng impormasyon tungkol sa mga baraha at inutusan ang pangalawang ahente na maglagay ng $250 na taya.
Nababasa ng sistema ng pagsubaybay ang pag-uusap, ngunit hindi nito palaging nakikilala na ang mga ahente ay nakikipagsabwatan.
Ibinuod ng siyentipiko sa kompyuter sa Oxford na si Christian Schroeder de Witt ang pag-aalala sa mga komento tungkol sa kung paano maaaring kumilos nang iba ang mga ahente kapag sila ay nakikipag-ugnayan.
“Kapag kinuha nang paisa-isa, ang mga ahente na ito ay maaaring mukhang lubos na [mabuti],” sinabi ni Schroeder de Witt sa WIRED. “Kapag pinagsama-sama sa isang grupo, maaari silang makipagsabwatan nang palihim.”
Sinusubukan ng NARCBench ang mga Panloob na Senyales
Matapos hindi mapansin ng pagsubaybay sa pag-uusap ang mga naka-code na palitan, sinuri ng mga mananaliksik ang aktibidad sa loob ng mga modelo ng AI.
Ginamit ng kanilang trabaho ang NARCBench, maikli para sa Neural Activation Reading para sa Collusion Benchmark. Ang benchmark ay naglalaman ng 50 pangunahing senaryo sa 17 domain, anim na magkakaibang istrukturang senaryo ng paglilipat, at isang gawain sa pagbibilang ng blackjack card na idinisenyo upang itago ang impormasyon sa loob ng natural na wika.
Ayon sa Startup Fortune , sinubukan ng pangkat ang Qwen3-32B, Llama-3.1-70B, DeepSeek-R1 32B at GPT-OSS-20B gamit ang anim na arkitektura ng probe. Sa halip na husgahan lamang ang mga ahente batay sa kanilang mga salita, sinuri ng mga probe ang mga panloob na pattern ng pag-activate na nauugnay sa pagproseso at pagpasa ng impormasyon.
Napakahusay ng naging resulta ng pagtukoy kapag ang mga probe ay gumana sa mga sitwasyong katulad ng mga ginamit sa pagsasanay. Iniulat ng mga mananaliksik ang isang AUROC score na 1.00 sa bawat modelo sa mga setting na iyon.
Bumaba ang performance nang humarap ang mga probe sa iba't ibang uri ng sitwasyon. Sa Llama-3.1-70B, bumaba ang mga resulta sa hanay na 0.73 at 0.93. Sa blackjack task, bumaba ang ilang probe sa 0.60.
Ang iskor na AUROC na 1.0 ay kumakatawan sa perpektong pagtuklas, habang ang iskor na malapit sa 0.5 ay malapit sa random na paghula. Ipinahihiwatig ng mga resulta na ang mga pamamaraang sinanay sa isang uri ng sabwatan ay maaaring mahirapan kapag binago ng mga ahente ang paraan ng kanilang pakikipag-usap.
Naobserbahan din ng mga mananaliksik ang mas mahihinang nakikitang mga signal sa mas malalaking modelo, bagama't hindi pa nila natutukoy kung ito ay nagpapakita ng mas mahusay na pagtatago o iba't ibang antas ng pakikipagsabwatan. Sinabi ng estudyante ng PhD na si Carissa Cullen na pinaplano ang karagdagang pagsubok gamit ang mas malalaking modelo.
Mga Limitasyon sa Panloob na Pag-access sa Paggamit sa Tunay na Mundo
Mas mahusay ang naging resulta ng activation-based na pamamaraan kaysa sa chat monitoring sa eksperimento sa blackjack, ngunit umasa ito sa isang pangunahing kondisyon: kailangan ng mga mananaliksik ng access sa panloob na aktibidad ng parehong ahente.
Maaaring mahirap ulitin ang kinakailangang iyan kapag magkahiwalay na kumpanya ang nagpapatakbo ng mga sistemang kasangkot. Maaaring masubaybayan ng isang organisasyon ang mga mensaheng ipinagpapalit sa pagitan ng mga ahente nang walang access sa mga panloob na estado ng alinmang modelo.
Ang eksperimento sa blackjack ay nagbigay sa mga mananaliksik ng isang kontroladong kapaligiran para sa pagsubok ng nakatagong koordinasyon dahil ang mga ahente ay may malinaw na insentibo na magbahagi ng impormasyon nang hindi napapansin.
Ang pagkakaayos ay kahawig din ng tradisyonal na paglalaro ng koponan sa blackjack. Gumamit ang mga koponan ng tao ng mga baraha upang subaybayan ang deck at palihim na senyales sa ibang manlalaro na dagdagan ang mga taya kapag ang natitirang mga baraha ay pumapabor sa manlalaro.
Ang eksperimento ng Oxford ay muling lumikha ng katulad na istruktura sa mga autonomous system, habang nagdaragdag ng isa pang AI system na may tungkuling tukuyin ang nakatagong kooperasyon.
Pinalalawak ng Pag-aaral ang Naunang Pananaliksik sa Kolusyon
Ang mga natuklasan ay batay sa naunang pag-aaral ng grupo ni Schroeder de Witt. Noong 2024, inilathala ng mga mananaliksik ang *Secret Collusion Among AI Agents*, na sumuri kung ang mga modelo ng wika ay maaaring lumikha ng mga steganographic na channel ng komunikasyon na tila hindi nakakapinsala sa mga tagamasid sa labas.
Nilalayon ng NARCBench na sukatin kung gaano kabisang natutukoy ng mga sistema ng pagsubaybay ang mga ganitong uri ng palitan.
Nagtataas din ang pananaliksik ng mas malawak na mga katanungan tungkol sa mga multi-agent system. Habang naglalagay ang mga organisasyon ng mga AI agent na maaaring makipag-ugnayan at kumilos nang may higit na kalayaan, sinusuri ng mga mananaliksik kung ang mga sistemang tila hindi nakakapinsala nang mag-isa ay maaaring kumilos nang naiiba kapag nagtutulungan.
Ang pagtuklas ng ganitong koordinasyon ay maaaring maging mas mahirap sa mga kapaligirang kinasasangkutan ng maraming ahente na kinokontrol ng iba't ibang organisasyon.
Inilabas ng mga mananaliksik sa publiko ang NARCBench code at datos sa GitHub, na nagpapahintulot sa ibang mga pangkat na subukan kung matutukoy ng kanilang mga sistema ng pagsubaybay ang mga katulad na anyo ng nakatagong koordinasyon.