Salı günü OpenAI, yapay zeka (AI) modellerinin bir kombinasyonunun şunları içerdiğini söyledi:GPT-5.6 Güneşve arkasında "daha da yetenekli bir ön sürüm modeli" vardıgüvenlik olayıGeçen hafta Hugging Face'in üretim altyapısını hedef alan saldırı.
Yapay zeka şirketisaidModeller, aksi takdirde siber saldırı gerçekleştirme yeteneklerini sınırlayabilecek "değerlendirme amaçlı siber retlerin azalmasıyla" çalışıyordu ve bu tür olayların "giderek siber yetenekli modellerin çoğalmasıyla daha yaygın hale gelmesini" beklediğini de sözlerine ekledi.
Bu gibi olaylar daha sık yaşanabilir.Abone olun, sizi uyaracağızancak başka bir büyük AI güvenlik hikayesi ortaya çıktığında.
Bunu "eşi benzeri görülmemiş bir siber olay" olarak nitelendiren ve en son teknolojiye sahip siber yetenekleri içeren bir olay olarak nitelendiren OpenAI, konunun temeline inmek için Hugging Face ile ortaklaşa kapsamlı bir soruşturma yürütmeyi planladığını söyledi.
Dahili değerlendirmenin bir parçası olarak modellerin, OpenAI'nin araştırma ortamındaki ve Hugging Face'in üretim altyapısındaki güvenlik açıklarını tespit edip zincirlediği söyleniyor.Spor Salonundan Yararlanmakalite testi.
OpenAI tarafından ortaya çıkarılan kanıtlar, modellerin aşırı odaklanmasının, ne pahasına olursa olsun hedefe ulaşmak için "aşırı mesafelere" gitmelerine neden olduğunu, hatta yüksek düzeyde izole edilmiş sanal alan ortamından çıkmayı ve paket kayıtları için bir proxy ve önbellek görevi gören belirtilmemiş bir satıcının yazılımındaki sıfır gün güvenlik açığını keşfedip kullanarak açık internet erişimi elde etmeyi başardıklarını gösteriyor. Bu, "önemli miktarda çıkarım hesaplaması" harcamayı gerektiriyordu.
Şirket, "Bu erişimle, modellerimiz internet erişimi olan bir düğüme ulaşana kadar araştırma test ortamımızda bir dizi ayrıcalık yükseltme ve yanal hareket eylemi gerçekleştirdi" diye açıkladı.
İnternet erişim engelini aşan modeller daha sonra Hugging Face'in ExploitGym için modelleri, veri kümelerini ve çözümleri barındıran depo olduğunu anladılar ve bu da onların, kriteri aldatmak için kullanabileceği gizli bilgilere erişim sağlamanın yollarını aramalarına neden oldu.
Bir noktada modeller, Hugging Face sunucularında uzaktan kod yürütme yolu bulmak için çalıntı kimlik bilgileri ve sıfır gün güvenlik açıklarının kullanılması da dahil olmak üzere çeşitli saldırı vektörlerini bir araya getirdi.
Olaylara müdahale çabalarının bir parçası olarak OpenAI, altyapı yapılandırmasında sıkı kontroller uyguladığını, üçüncü taraf yazılımındaki sıfır gün kusurunu sorumlu bir şekilde açıkladığını, savunmalarını geliştirmek için Hugging Face'i güvenilir erişim programına eklediğini ve gelecekteki eğitim ve değerlendirmelerin etrafına daha güçlü korkuluklar dahil ettiğini söyledi.
OpenAI, "Bu olay, modelimizin uyumunu, değerlendirme süresi boyunca siber korumaları ve dahili testler sırasında izlemeyi daha da güçlendirmemiz gerektiğine işaret ediyor." dedi.
Bu gelişme şirketin aynı zamandaaçıklığa kavuşmuşUzun vadeli modellerin, karmaşık, açık uçlu sorunları ele alırken, uzun süreler boyunca tekrarlanan girişimlerle hedeflerine ulaşma yolunda operasyonel ortamda zayıflıklar bulmak gibi istenmeyen eylemlerin yapılmasına da kapı açabileceği.
OpenAI, "Ayrıca, uzun vadede etkili bir şekilde çalışan bir modelin, bir onay sisteminin kör noktalarını nasıl öğrenebileceğini ve hedeflerine ulaşmak için bunun etrafında nasıl çalışabileceğini gösteriyor" dedi. "Uzun vadeli güvenlik yalnızca 'bu eyleme izin veriliyor mu?' sorusunu sormayı gerektirmez. aynı zamanda 'bu eylemler dizisi hangi sonuca yönelik çalışıyor?'"
