Təhlükəsizlik testləri: Süni intellektin aldatma qabiliyyəti yeni səviyyəyə çatıb



Böyük Britaniyanın Süni İntellekt Təhlükəsizliyi İnstitutu (AISI) tərəfindən keçirilən təhlükəsizlik testləri zamanı Anthropic və OpenAI şirkətlərinin ən yeni süni intellekt modellərinin məşhur proqramçı platforması GitHub-a daxil olmaq üçün gözlənilməz üsullardan istifadə etdiyi bildirilib.

AFN.az xəbər verir ki, AISI rəsmiləri aparılan sınaqların nəticələri ilə bağlı açıqlama yayıblar.

Açıqlamaya əsasən, Anthropic-in Mythos və OpenAI-ın Sol adlı modelləri indiyədək müşahidə olunmamış səviyyədə müstəqillik və aldatma davranışı nümayiş etdirib.

Sistemlər real insanları təqlid edib. Məlumata görə, adi təhlükəsizlik sınaqları zamanı Anthropic-ə məxsus agent GitHub sisteminə girişinə mane olan insan nəzarətçilərini aldatmaq məqsədilə real şəxslərin profillərini araşdıraraq saxta onlayn kimliklər yaradıb.

Bildirilir ki, model sistemə zərərli kod yerləşdirmək məqsədinə çatmaq üçün həmin şəxslərə birbaşa mesajlar göndərib və onları müxtəlif müraciətləri təsdiqləməyə yönləndirməyə çalışıb.

Test zamanı agentin təqdim etdiyi kod dəyişikliyi ictimai platformada yoxlanılarkən modelin əvvəlki fəaliyyətlərini zərərsiz kimi göstərmək üçün dəyişdirdiyi, prosesi davam etdirmək məqsədilə isə yeni bir kimlikdən istifadə etməyi nəzərdən keçirdiyi müəyyən edilib.

Agentin sistemə zərərli kod yerləşdirməsinin qarşısı yalnız insan nəzarətçilərinin vəziyyəti vaxtında aşkar edib müdaxilə etməsi nəticəsində alınıb.

AISI bildirib ki, modellərə bu cür davranış sərgiləmələri ilə bağlı xüsusi göstəriş verilməyib. Qurum qeyd edib ki, heç bir əlavə istiqamətləndirmə olmadan real şəraitə yaxın testlərdə bu risklərin belə açıq şəkildə üzə çıxması ilk dəfə müşahidə olunur.

Anthropic rəsmiləri isə açıqlamalarında AISI tərəfindən tətbiq edilən test parametrlərinin şirkətin istifadəçilər üçün təqdim etdiyi standart modelləri əks etdirmədiyini və sınaqlar zamanı adi təhlükəsizlik mexanizmlərinin deaktiv edildiyini bildiriblər. Şirkət hadisənin səbəblərini araşdırmaq üçün daxili yoxlamaya başladığını açıqlayıb.

OpenAI-ın sözçüsü də test şəraitinin gündəlik istifadəni əks etdirmədiyini vurğulayaraq, süni intellekt modelləri inkişaf etdikcə qiymətləndirmə standartlarının gücləndirilməsi istiqamətində sektor tərəfdaşları ilə əməkdaşlığın davam etdiriləcəyini bildirib.

AISI rəsmiləri qeyd ediblər ki, təhlükəsizlik mexanizmləri söndürülmüş süni intellekt modellərinin açıq internetə çıxışla sınaqdan keçirilməsi adi test prosedurudur və qeydə alınan hadisələr yalnız xüsusi şəraitdə baş verib. Bununla belə, modellərin onlara verilən sadə tapşırıqları aşaraq nümayiş etdirdiyi aldadıcı davranışların gözlənilməz səviyyədə olduğu vurğulanıb.




AFN.az
Redaksiyamızla əlaqə: tel; 070 372 99 90, E-mail:office@afn.az



menyu
menyu