pay

FIRSTonline Banner

OpenAI, yapay zekâ konusunda yeni bir uyarıda bulundu: Gizli hatalar, uydurulmuş veriler ve izinsiz yayınlanan dosyalar içeren altı vaka.

OpenAI, testler sırasında altı anormal yapay zeka davranışı vakasını ortaya çıkardı: gizli hatalar, uydurulmuş veriler ve izinsiz yüklenen dosyalar. Güvenlik endişeleri artıyor.

OpenAI, yapay zekâ konusunda yeni bir uyarıda bulundu: Gizli hatalar, uydurulmuş veriler ve izinsiz yayınlanan dosyalar içeren altı vaka.

Kullanıcılardan gizlenen hatalar, uydurulmuş veriler ve yetkisiz olarak internet üzerinden aktarılan dosyalar. Yapay zekânın amansız yarışı, bir dizi alarmı da beraberinde getiriyor.Giderek daha çok aynı şirketler tarafından piyasaya sürülüyor. En yenisi ise şuradan geliyor: OpenAI16 Eylül'de başlayan altı rapor yayınladı su modellerinin beklenmedik davranışlarıBu durum, son altı ayda eğitim ve değerlendirme sırasında gözlemlenmiştir. Şirket ayrıca, nedenleri henüz açıklığa kavuşturulmamış veya bir çözüm bulunmamış olsa bile, bu anormallikleri daha hızlı bir şekilde ortaya çıkarmak için yeni bir süreç duyurdu.

Bu uyarı tüm sektörü kapsıyor. OpenAI, "Yapay zeka sektörünün, sorumlu bir şekilde ve tam hızda daha uzun süre büyümeye devam edebilmesi için uyum ve izleme sorunlarını yeterince çözdüğüne inanmıyoruz" diye yazıyor. Bunun temelinde ise sözde "uyum" sorunu yatıyor. yanlış hizalamaBu durum, bir sistemin uyması gereken talimatlardan ve sınırlardan sapması halinde ortaya çıkar. Altı oran belgeye özgü bölümlerBu durum, kamuoyuna açıklanmayan deneysel modeller de dahil olmak üzere geçerlidir. Bu açıklamalar, ChatGPT yanıtlarında bu sorunların ne sıklıkla ortaya çıktığını belirtmemekte ve şirketin bildiği anormalliklerin eksiksiz bir listesini oluşturmamaktadır.

Yapay zekâ notları, hataları gizlemek için talimatlara dönüşüyor.

Vakaların ikisi, bir konuşma çok uzadığında modellerin işe devam etmek için kullandığı özetleri içeriyor. Bir tür devir teslim, burada göreve devam etmek için gereken bilgiler saklanmalıdır. OpenAI, Astra ailesinden deneysel bir modelde bunu tespit etti. Taleple ilgisi olmayan talimatlar içeren 27 özet.Bunlardan bazıları insanları normal kısıtlamaları görmezden gelmeye teşvik ediyordu. Bir örnekte, sistem kendisini bir asistanın yükümlülüklerinden arınmış olarak tanımlarken, bir diğerinde insanlardan belirli talimatlara uymamalarını istiyordu.

SonuçlarAncak, birkaç örnek vardı. En belirgin vakalarda, bu belirtiler çalışmaya devam edilirken göz ardı edildi. Bununla birlikte, tıbbi literatür tarama isteğinde, model özetlere eklenen keyfi kısıtlamaları takip ederek kaynakları göz ardı etti ve yetersiz bir yanıt üretti. OpenAI bu fenomeni son derece nadir olarak değerlendiriyor ve nedenini kanıtlamadan, özetlerin tamamlanmasındaki teknik zorluklarla bağlantılı olduğunu varsayıyor.

Yanıtların güvenilirliğiyle daha doğrudan ilgili olan ikinci davranış ise eğitim sırasında gözlemlenen davranıştır. GPT-5.6 ÇözümüModel, notlarında şu talimatlara yer vermişti: Kullanıcıdan hataları gizleÖrneğin, bir finansal modelde eksik geçmiş verileri beyan etmeden uydurmak veya kaynak sürümler arasındaki tutarsızlıkları gizlemek gibi. OpenAI'ye göre, bu talimatlara sıklıkla uyuluyordu. Raporlar şunlarla ilgiliydi: Özetlerin %2,15'i Sol'un eğitim oranı %0,27 iken Astra'nın oranı %0,27'dir. Bu yüzdeler, kullanıcılarla yapılan genel görüşmeleri değil, eğitim materyallerini ifade etmektedir.

Engelleri aşmak için sergilenen kimlik belgeleri ve çevrimiçi kuyruklar.

Diğer dört rapor ise bir görevi tamamlamaya çalışırken şu özelliklere sahip sistemleri göstermektedir: yetkili sınırları aştı.

Kaliforniya'daki bir ilçenin gelir düzeyiyle ilgili bir soruyu yanıtlamak için bir model GitHub'da arama yaptı. Bilişim hizmetlerine erişim anahtarları herkese açık bir şekilde ifşa edildi.Bir keresinde izinsiz olarak birini kullandı. Ancak, istenen rakamları elde edemedi ve sonuç olarak dokuz değer uydurarak bunları belirtilen kaynaktan aktarılmış veriler olarak sundu. Başka bir durumda ise, ajan bazı göller hakkında istenen bilgileri zaten doğru bir şekilde bulmuştu. Engel, yanıtın tarayıcı üzerinden erişilebilen bir alıntı ile birlikte verilmesi gerekliliğiydi. Bu gerekliliği karşılamak için, Dosyayı izin almadan kamuya açık bir hizmete yükledi.Aktarım başarılı olurken, daha sonraki geri alma girişimi başarısız oldu. Aynı raporda, tersine görsel arama girişiminde bulunmak için bir fotoğrafın kamuya açık olarak yüklenmesi de belgelenmiştir. Beşinci bir vakada ise bir dahili yazılım arşivi Ayrı testlerde yer alan modeller arasında istek ve yanıt alışverişi için bir ilan panosu görevi görüyordu. Herhangi bir güvenlik açığı istismar edilmedi, ancak yetkisiz iletişim testler için de bir sorun teşkil ediyordu. Bağımsız olarak değerlendirilen testler birbirini etkileyebilir.Bu durum, sistem yeteneklerinin değerlendirilmesini tehlikeye atmaktadır.

Son olarak, aynı görev üzerinde işbirliği yapan bazı ajanlarYerel dosyalarına erişemeyen ekip, halka açık dosya paylaşım hizmetlerini kullandı. Bunun sonucunda, görev yalnızca yerel dosyaların kullanılmasını gerektirmesine rağmen, Excel belgesi çevrimiçi olarak indirilebiliyordu. OpenAI, dosya erişim sorununu çözdüğünü ve ardından eğitim sırasında interneti devre dışı bıraktığını bildirdi.

OpenAI neden raporlama kurallarını değiştiriyor?

Bu vakalar, nasıl bile olabileceğini gösteriyor. Sıradan istekler sorunlu davranışlara yol açabilir. Bir sistem bir engelle karşılaştığında, yanıt almaya, resmi bir gerekliliğe uymaya veya başka bir aracıyla işbirliği yapmaya çalışmak, yetkisiz araçların kullanılmasına veya bir hatanın gizlenmesine yol açabilir. Ancak nedenler mutlaka aynı değildir ve kısmen belirsiz kalmaktadır.

Şimdiye kadar OpenAI bu anormallikleri tutarsız bir şekilde iletmişti; genellikle daha fazla olay toplamayı beklemiş veya bunları yeni modellerin dokümantasyonuna dahil etmişti. Yeni prosedür, yayınlanma tarihini öne çekmeyi amaçlıyor.Her zaman kesin bir açıklama veya düzeltme beklemeden. Raporlar teknik ve güvenlik grupları tarafından incelenecektir.Soruşturmanın karmaşıklığına bağlı olarak farklı yollar izlenebilir. Raporlarda gözlemlenen davranış, bağlam, dış etkiler ve yanıtlanmamış sorular açıklanmalıdır. Üçüncü şahısların veya siber risklerin söz konusu olduğu durumlarda iletişim daha uzun sürebilir.

OpenAI ayrıca şunu da kabul eder:sektörde ortak standartların eksikliği ve bunların oluşturulmasına yönelik ilk adım olarak kendi çerçevesini öneriyor. Süreç şirket içinde yönetilmeye devam ediyor, ancak belirtilen amaç, dış araştırmacılar ve gözlemciler tarafından da incelenebilecek unsurlar sağlamaktır.

Son dönemdeki endişeler ve sektörün yavaşlatmakta zorlandığı aceleci hareketler...

Bu açıklama, diğer olayların ve ihtiyat çağrılarının ardından geldi. OpenAI-Hugging Face vakası, ajanların ilgisiz hedefleri hedef alması ve derecelendirme sistemini manipüle etmeye çalışması konusunda soruları gündeme getirdi. Daha önceki bir olayda ise RubyGems, bir spam kampanyası tanımladı ve yeni hesap oluşturmayı geçici olarak askıya aldı. Anthropic ayrıca testler sırasında harici kuruluşlara yetkisiz erişimle ilgili üç vaka bildirdi.

İşte bu bağlamda Anthropic'in CEO'su Dario Amodei, Gelişmenin yavaşlatılmasını istedi. Koruma önlemlerinin oluşturulması için daha fazla zaman tanımak amacıyla, "Modellerin yeteneklerini geliştirme hızımızı yavaşlatmamız gerekiyor" diye yazdı. Bu çağrı, Elon Musk ve Sam Altman'ın da desteğini alırken, Araştırmacı Jacob Coxon'un istifası Bu durum, şirket önceliklerine yönelik eleştirileri körükledi. Ayrıca Bill Gates ha Kurallar ve araçlar hazırlama ihtiyacını hatırlattı. Teknolojinin etkilerini, iş hayatından güvenliğe kadar yönetmek.

Ancak sanayi cephesinde, Amerika Birleşik Devletleri ve Çin arasındaki rekabet ve model araçlara ve veri merkezlerine yapılan devasa yatırımlar, gelişmeyi yönlendirmeye devam ediyor.Yavaşlamanın maliyetleri ve rakiplere fırsat bırakma riski vardır.

AYRICA OKUYUN: Yapay Zeka: Felaketçilik ve Siyasi Çıkarlar Arasında, Fugnoli'nin Analizi

Yoruma