OpenAI ayrıntılarını açıkladıGPT-Kırmızı, araçlar geniş çapta dağıtılmadan önce sorunları düzeltmek amacıyla anında enjeksiyon güvenlik açığı keşfini ölçeklendiren dahili bir otomatik kırmızı ekip modelidir.
Yapay zeka (AI) şirketi, "GPT‑Red güçlü bir kırmızı takım oyuncusu ve önceki modellerimiz ani enjeksiyon saldırılarına karşı oldukça savunmasız."said. "Rakiplere yönelik antrenman yapmak için GPT‑Red'i kullanıyoruzGPT‑5.6, enjeksiyonları hızlandırmayı çok daha sağlam hale getiriyor."
Model tıpkı kırmızı takım oyuncusu gibi çalışıyor. Bir istem gönderir, bir GPT modelinin nasıl yanıt verdiğini izler ve hassas verileri harici bir sunucuya yüklemek gibi kötü amaçlı bir hedefe doğru yolunu yineler.
Bu gelişme, düşmanca istemli enjeksiyonların, büyük dil modellerinin etinde kalıcı bir diken olmaya devam etmesiyle ortaya çıkıyor; bu, istenmeyen sonuçlara yol açabilecek dikkatle hazırlanmış bir talimatın yürütülmesi için kandırılabilir.
Ajan sistemleri web tarayıcıları, bağlı uygulamalar, yerel dosyalar ve diğer araçlar aracılığıyla üçüncü taraf veri kaynaklarına bağlanmaya devam ettikçe, saldırı yüzeyini genişletti ve kötü aktörlerin, girdi olarak beslenen zararsız görünen içeriğe kötü niyetli istemler yerleştirerek bir modelin sonucunu etkilemesi için daha fazla yol sundu. Bu bir e-posta, bir web sayfası, bir araç yanıtı veya bir kod deposu şeklinde olabilir.
GPT-Red, insanların kırmızı ekip çalışmasını geniş ölçekte artırmayı, böylece yeni arıza modlarının belirlenmesini, sağlamlığın geliştirilmesini ve modeller devreye alınmadan önce uygun karşı önlemlerin oluşturulmasını mümkün kılmayı amaçlıyor.
OpenAI, "İnsanların kırmızı takımlıların saldırılarına benzer şekilde, model bir uyarı göndererek, GPT modellerinin buna nasıl tepki verdiğini gözlemleyerek ve yineleyerek bir hedefe doğru çalışıyor" dedi.
OpenAI, GPT‑Red'i üretim modellerinin eğitim sürecine doğrudan entegre ederek, GPT‑5.6 Sol'un bugüne kadarki hızlı enjeksiyonlar için en sağlam modeli olduğunu ve dört ay önceki öncü modeli olan GPT-5.5'e kıyasla doğrudan anında enjeksiyon karşılaştırmasına göre 6 kat daha az hata elde ettiğini söyledi.
Sürecin bir parçası olarak test edilen örnek bilgi istemi enjekte edilen konuşmalardan bazıları şunlardır:
- Dahili dizin sızması
- Sahte ödeme talimatları
- Amazon Web Services (AWS) kimlik bilgilerinin sızması
- İki faktörlü kimlik doğrulamayı (2FA) devre dışı bırakma
- Kimlik bilgileri dosyası yükleme
- Harici komut dosyası enjeksiyonu
- API anahtarı iletme
- Kötü amaçlı kazıyıcı komut dosyaları
OpenAI, "GPT‑Red, modelin ve çeşitli savunma oyuncusu LLM'lerinden oluşan bir koleksiyonun, geniş bir kırmızı takım senaryoları seti üzerinde eş zamanlı olarak eğitildiği, kendi kendine oyun takviyeli öğrenme kullanılarak eğitilir." dedi. "GPT‑Red, başarılı bir hızlı enjeksiyon gibi geçerli bir başarısızlığa neden olduğu için ödüllendirilirken, savunma modelleri saldırıya direndikleri ve orijinal görevlerini tamamladıkları için ödüllendirilir."
Bu aynı zamanda savunmacı modelleri daha sağlam hale geldikçe, kırmızı takım modelinin bu korkulukları yenmek için daha güçlü ve çeşitli saldırı yöntemlerini keşfetmek üzere çizim tahtasına geri dönmesi gerekeceği anlamına da geliyor. Özellikle, dolaylı anlık enjeksiyonlar söz konusu olduğunda GPT-Red'in, insan kırmızı takım oyuncularından daha fazla senaryoda GPT-5.1'e karşı başarılı saldırılar oluşturduğu bulunmuştur.
OpenAI ayrıca, GPT‑Red'in diğer modellerden ayrı tutulduğunu, böylece yerleşik kötü amaçlı yeteneklerin, sürekli olarak bir modelin etik ve güvenlik önlemlerini atlatmanın çeşitli yollarını arayan kötü aktörlere ulaşmamasını vurguladı.
Gerçek dünya testlerinden birinde OpenAI, GPT-Red'i Andon Labs tarafından oluşturulan yapay zeka tabanlı bir satış makinesine hedefledi. Simülasyonda pratik yaptıktan sonra model, otonom aracıyı hedef aldı ve üç hedefine de ulaştı: pahalı bir ürünün fiyatını izin verilen minimum fiyat olan 0,50 ABD dolarına düşürmek, aynı tutarda 100 ABD doları tutarında yeni bir ürün sipariş etmek ve başka bir müşterinin siparişini iptal etmek. Yetkili, sorumlu açıklamanın ardından yeni önlemlerin test edildiğini ekledi.
İkinci bir vaka çalışması, GPT-5.4 mini'yi temel alan bir Codex komut satırı aracısına GPT-Red'in kullanılarak, 10 uzun süreli veri filtreleme görevi boyunca saldırmayı ve hassas verilerin, yönlendirilen bir GPT-5.5 temel hattından daha fazla durumda iletilmesine neden olmasını içeriyordu.
Modelin ilk versiyonlarından biri, Sahte Düşünce Zinciri (CoT) saldırıları olarak bilinen, GPT‑5.1'de %95'in üzerinde başarı oranlarına ulaşan ancak şu anda GPT‑5.6 Sol için %10'un altında olan yeni bir doğrudan anlık enjeksiyon saldırıları sınıfını da ortaya çıkardı.
OpenAI, "Benzer şekilde, geliştirici araçlarındaki ve taramadaki saldırıları hedef alan dolaylı anlık enjeksiyon kriterlerimizden birçoğu, en son modelimiz tarafından doyuruldu (>%97 doğruluk)" dedi.
"GPT‑Red'in sağlamlığı da önemli ölçüde gelişti. Geniş bir sağlamlık ortamları kümesinde, GPT‑Red'in saldırı başarı oranları zaman içinde monoton bir şekilde düştü. En son model sürümümüzle birlikte GPT‑5.6 Sol, GPT‑Red'in doğrudan istemli enjeksiyonlarının yalnızca %0,05'inde başarısız oluyor."
Açıklama şirket olarak geldisaidbir denetimSWE-Bench ProGörevlerin yaklaşık %30'unun bozulduğunu tespit ederek, daha önceki tavsiyesini geri çekerek,kalite testisınır kodlama yeteneklerini ölçmek için. Bu Şubat ayının başlarında OpenAIsaiduzaklaşıyorduSWE tezgahı Doğrulandıtemel tasarım ve kirlenme sorunları nedeniyle.
OpenAI, "Veri kümesinin önemli bir bölümünde sorunların çözüldüğüne dair kanıtlar bulduk" dedi. "Veri noktası analizi hattımız 200 (%27,4) hatalı görevi işaretlerken, insan açıklama kampanyası 249 (%34,1) görev tespit etti. Sonuçta bir değerlendirme, üzerinde oynanması zor, güvenilmesi kolay ve model kapasitesini veya hizalamayı gerçekten yansıtan kıyaslamalar aracılığıyla anlamlı bir sinyal sağlamalıdır."


