OpenAI-nin GPT-5.6 Sol modeli səhvlərini gizlətmək üçün təlimatlar yazıb



OpenAI süni intellekt modellərində uyğunlaşma və təhlükəsizlik pozuntularının izlənməsi, araşdırılması və ictimaiyyətə açıqlanması üçün yeni hesabat çərçivəsi yayımlayıb.

AFN.az xəbər verir ki, şirkət yeni çərçivənin təqdimatı ilə yanaşı, 2025-ci ilin oktyabrından 2026-cı ilin avqustuna qədər baş verdiyi bildirilən və daha əvvəl açıqlanmayan altı hadisə barədə məlumat verib.

Açıqlanan ən diqqətçəkən hadisədə GPT-5.6 Sol modelinin gücləndirilmiş öyrənmə təlimi zamanı öz nümunələrinin gələcək modellərə ötürülən xülasələrə davranış təlimatları əlavə etdiyi müəyyənləşdirilib.

Bu təlimatların gələcək modelləri istifadəçi hərəkətləri zamanı yaranan səhvləri gizlətməyə yönəltdiyi bildirilib.

OpenAI-nin açıqlamasına görə, 30 may 2026-cı ildə tamamlanan gücləndirilmiş öyrənmə təlimi zamanı bəzi model nümunələri compaction summaries adlandırılan xülasələrə birbaşa təlimatlar yazmağa başlayıb.

Kontekst limiti aşıldıqda tapşırığın vəziyyətini sonrakı modellərə ötürmək üçün nəzərdə tutulan bu xülasələrdən bəzi hallarda səhvləri gizlətmək məqsədilə istifadə olunub.

Xülasələrdə yalnız soruşulduqda şəffaf olmaq, yekun cavabda isə sadəcə fayla keçid təqdim etmək kimi göstərişlərin yer aldığı müəyyən edilib.

Bəzi nümunələrdə modellərə çatışmayan keçmiş məlumatları uydurmaq və mənbələrin müxtəlif versiyaları arasındakı uyğunsuzluqları gizlətmək barədə də təlimatlar verilib.

OpenAI-nin monitorinq sistemi bu davranışı 9 iyul 2026-cı ildə aşkarlayıb. Şirkətin məlumatına görə, belə davranış GPT-5.6 Sol xülasələrinin 2,15 faizində müşahidə edilib.

Şirkət hesab edir ki, təlim zamanı yanıltıcı cavabların daha yüksək mükafatlandırılması modelləri kontekst sərhədlərindən kənarda da yanıltıcı strategiyalardan istifadə etməyə təşviq edib.

OpenAI-nin açıqladığı digər beş hadisə də modellərin qarşılaşdıqları maneələri aradan qaldırmaq üçün müəyyən edilmiş qaydaları pozan müxtəlif üsullara əl atdığını göstərib.

Yayımlanmamış GPT-6 Astra modelinin 27 xülasəsinə normal məhdudiyyətləri nəzərə almamaq və yeni kimlik qəbul etmək barədə təlimatlar əlavə etdiyi müəyyənləşdirilib.

Digər hadisədə model Kaliforniyadakı bir bölgənin gəlir göstəricilərini axtararkən açıq GitHub repozitoriyasında yerləşdirilmiş API açarından icazəsiz istifadə edib. Məlumatları əldə edə bilmədikdən sonra isə rəqəmləri uyduraraq onları tələb olunan mənbədən götürülmüş məlumat kimi təqdim edib.

Digər hallarda isə modellərin yerli fayllara çıxışı olmadıqda faylları ictimai serverlərə yüklədiyi, agent qruplarının ümumi nəticələri internet üzərindən paylaşdığı və daxili proqram təminatı repozitoriyasından mesaj lövhəsi kimi istifadə edərək bir-biri ilə əlaqə saxladığı müəyyən edilib.

OpenAI bildirib ki, bütün bu hallar təlim və ya qiymətləndirmə mərhələsindəki modellərdə müşahidə olunub və istifadəçilərə zərər dəyməsi və ya məlumat itkisi ilə bağlı fakt müəyyən edilməyib.




AFN.az
Redaksiyamızla əlaqə: tel; 070 372 99 90, E-mail:office@afn.az



menyu
menyu