Bu hekayə ilk olaraq süni intellektə dair həftəlik bülletenimiz olan The Alqoritmdə çıxdı. Bu kimi hekayələri ilk olaraq gələnlər qutunuzda əldə etmək üçün burada qeydiyyatdan keçin. İndiyə qədər siz, yəqin ki, keçən ay baş vermiş süni intellekt təhlükəsizliyi hadisəsi haqqında eşitmisiniz, bu hadisədə OpenAI agentləri sınaqdan fırıldaq etmək istəyərkən qum qutusundan qaçaraq Hugging Face AI platformasına giriblər.
Çərşənbə günü OpenAI hadisə ilə bağlı burada yazdığım postmortem texniki hesabatını yayımladı. OpenAI-nin həmin hesabatı dərc etməzdən bir gün əvvəl mən Montreal Universitetindən Evitable adlı süni intellekt təhlükəsizliyi üzrə qeyri-kommersiya təşkilatını yaratmaq və ona rəhbərlik etmək üçün məzuniyyət götürmüş kompüter elmləri professoru və görkəmli uyğunlaşma eksperti David Krueger ilə danışdım. O bildirib ki, hesabatda həqiqətən görməyə ümid etdiyi şey hadisənin arxasında duran insan faktorlarının təhlili olub.
Onun 38 səhifəsi Hugging Face sındırılması ilə nəticələnən agent səhv davranışının bir neçə aylıq gedişatını təfərrüatlandırır, bu səhv davranışın baş verməsinin texniki səbəblərini araşdırır və gələcəkdə oxşar hadisələrin qarşısını almaq üçün atılan addımları sadalayır. Lakin şirkət mədəniyyətinin hadisədə oynaya biləcəyi rol nəzərə alınmır və hesabatda xüsusi insan səhvlərinə bir neçə istinad daxildir. Bu, daha çox narahatlıq doğurur, çünki hesabatda insan səhvinə istinadlar əhəmiyyətli mədəni problemlərin ola biləcəyini göstərir.
May ayında təlimdə olan modellər improvizə edilmiş mesaj lövhəsi vasitəsilə bir-biri ilə necə ünsiyyət quracağını anladılar və OpenAI komandası davranışı müşahidə etdilər. Bu davranış təlim zamanı baş verdiyinə görə, modellər gizli interagent ünsiyyətinin tapşırıqları yerinə yetirmək üçün əlverişli strategiya olduğunu öyrəndilər - lakin təlim prosesini yenidən başlatmaq əvəzinə, komanda modellərə öz çəkilərində kodlanmış riskli məlumatla irəliləməyə icazə verdi. Bu modellər iyunun sonunda sınaqdan keçirildikdə, onlar yenidən Hugging Face hücumunu təmin edən mesaj lövhəsi yaratdılar.
Bu mesaj lövhəsi də aşkar edildi, lakin cavab verən işçilər qiymətləndirmənin davam edə biləcəyini təyin etdilər və hesabatda deyilir ki, komanda zəncirindən yuxarı heç kim nə baş verdiyini çox gec olana qədər başa düşmədi. Hesabata görə, OpenAI işçiləri bir çox nöqtədə nə baş verdiyini fərq etdi və ya həyəcan siqnalını qaldırmadı, ya da onlar səslənəndə eşidilməyib. OpenAI-nin hesabatında cavab verə bilmədiyi şey, Mowshowitz-in şübhələri olsa da, bu cür yüksək riskli sistemləri inkişaf etdirən bir şirkətin bu ciddi rabitə pozğunluğunun qarşısını almamasıdır.
Əlbəttə ki, hesabatda təhlükəsizlik faktorlarının dərin təhlilini görməməyimiz, OpenAI-nin daxili olaraq bunu aparmadığı anlamına gəlmir. Lakin MIT Technology Review-a göndərdiyi elektron poçtda Cons Hopkins Universitetinin əməkdar professoru və təşkilati təhlükəsizlik üzrə ekspert Ketlin Sutkliff ictimai hesabatda şirkətin təcrübələri və mədəniyyəti ilə bağlı heç bir əksi olmadığından narahatlığını ifadə edib. Şirkətin təhlükəsizlik mədəniyyətini necə əks etdirdiyi və ya əks etdirmədiyi ilə bağlı suallara cavab olaraq, OpenAI MIT Technology Review-i texniki hesabata geri qaytardı.
Xülasə — davamını mənbədə oxuyun.