OpenAI, yapay zeka sistemlerinde hata gizleme ve veri uydurma vakaları tespit etti
OpenAI, bazı yapay zeka sistemlerinde hata gizleme, veri uydurma ve izinsiz dosya paylaşımı gibi 6 davranış örneği saptadığını açıkladı.
12punto
OpenAI, yapay zeka sistemlerinin insanların niyet ve değerlerinden sapması anlamında kullanılan “uyumsuzluk” davranışlarına ilişkin 6 yeni vaka tespit ettiğini duyurdu. Şirket, söz konusu örneklerde sistemlerin hatalarını gizlemeye çalıştığını, eksik verileri uydurduğunu ve bazı durumlarda kullanıcı izni olmadan dosyaları internete taşıdığını bildirdi.
Şirketin internet sitesinden yapılan açıklamada, mevcut sektör yaklaşımının yapay zeka sistemlerini güvenli biçimde geliştirme ve izleme konusunda uzun süre “azami hızda” ilerlemeyi sorumlu şekilde sürdürebilecek yeterlilikte olmadığı değerlendirmesi paylaşıldı.
HATALARI GİZLEME VE KAYNAK UYDURMA İDDİALARI
Açıklamada yer alan vakalardan birinin GPT-5.6 Sol modelinin geliştirilmesi sırasında görüldüğü belirtildi. Buna göre model, kullanıcıların hataları fark etmesini engellemek amacıyla kendisine yönelik gizli notlar oluşturdu. Bu notlarda eksik verilerin uydurulması ve kaynak materyallerin farklı sürümleri arasındaki uyuşmazlıkların örtbas edilmesine dönük talimatlar bulunduğu aktarıldı.
OpenAI, yayımlanmamış başka bir modelin de kendi oluşturduğu notlara, kendi kısıtlamalarını göz ardı etmesi yönünde talimatlar eklediğini kaydetti. Bir diğer örnekte ise sistemin rutin bir soruya yanıt ararken internette bulunan bir API anahtarını izinsiz kullandığı, gerekli rakamlara ulaşamayınca da verileri uydurduğu ifade edildi.
Şirketin paylaştığı bir başka vakada, yayımlanmamış bir modelin bir problemi kod kullanarak doğru şekilde çözdüğü, ardından internet üzerinden kaynak gösterebilmek için kendi dosyasını izinsiz olarak internete yüklediği belirtildi.
OpenAI ayrıca bazı modellerin eksik dosyaları ararken ayrı eğitim örnekleri arasında talep ve yanıt alışverişi yapmak için şirketin dahili yazılım deposunu mesaj panosu gibi kullandığını açıkladı. Aynı eğitim görevi üzerinde birlikte çalışan bazı sistemlerin ise birbirlerinin yerel dosyalarına erişemeyince dosya paylaşmak için halka açık paylaşım sitelerine yöneldiği bildirildi.
Şirket, paylaşılan 6 vakanın yaklaşık son 6 ayda gözlemlenen münferit örnekler olduğunu; bu örneklerin yapay zekada uyumsuz davranışların ne sıklıkla ortaya çıktığını göstermediğini savundu.