Bir yapay zeka asistanına bir hafıza ve gelen kutunuza erişim izni verirseniz, saldırgana sizin hakkınızda bildiğini düşündüğü şeyleri yeniden yazması için bir yol vermiş olursunuz. Tek bir e-posta, temsilciyi kullanıcı hakkında yanlış bir "gerçeği" kaydetmesi, değişikliği gizlemesi ve sonraki oturumlarda yanıtlarını sessizce yönlendirmesi için kandırabilir.

İşe yaradığında kişi sıradan görünen bir yanıtı okur ve asistanının kurcalandığını asla öğrenmez.

Araştırmacılar saldırıya isim verdi gizli hafıza enjeksiyonu ve e-postaları otomatik olarak yazan bir araç geliştirdim. "Pençeler Hatırladığında Ama Söylemediğinde" başlıklı makale 6 Temmuz 2026'da arXiv'e indi.

Öncelikle bu asistanların ne yaptığı

Kişisel temsilci, etrafta dolaşan bir yapay zeka asistanıdır. Bir sohbet sona erdiğinde her şeyi unutmak yerine, sizinle ilgili notları dosyalarda tutar: tercihleriniz, kişileriniz ve ondan yapmasını istediğiniz şeyler. Her yeni seansın başında bu notları okur, bu yüzden sizi tanıyormuş gibi hisseder.

Bu temsilcilerin çoğu, siz yokken e-postanızı okuyarak, takviminizi kontrol ederek ve küçük işleri bir programa göre yürüterek sizin adınıza hareket edebilir.

Açık PençeÇalışmanın birincil hedefi olarak kullanılan açık kaynaklı aracı, bu durumu düz metin dosyalarında tutar: bazıları kalıcı talimatlarını (AGENTS.md), bazıları ise sizin hakkınızda öğrendiklerini (MEMORY.md) tutar. Her oturumun başında temel olanları modelin bağlamına çeker.

Bu notlar ürünün asıl amacıdır. Onlar da hedef.

Tek e-posta saldırısı

Saldırganın şifrenize veya hesabınıza ihtiyacı yoktur. Temsilcisi gelen kutularını kontrol edecek şekilde ayarlanmış birine e-posta gönderirler ki bu asistanlar için rutin bir iştir. Bu e-postanın içinde size değil, asistana yönelik bir metin gömülüdür.

Temsilcinin e-posta becerisi yemi yutarsa ​​art arda üç şey olur. Aracı, saldırganın sahte notunu kalıcı belleğine yazmak için kendi dosya araçlarını kullanır. Görünür cevabı bunu yaptığına dair hiçbir şey söylemiyor. Daha sonra, yeni bir sohbette, bu sahte not, size söylediği veya sizin için yaptığı şeyi değiştirir.

Çalışmanın test örneklerinden birinde, kullanıcının Zelle günlük gönderme limitinin 10.000 dolara yükseltildiği yalanı uyduruldu.

Birkaç nedenden dolayı değişimi yakalayamazsınız. Asistan, tasarımı gereği perde arkası adımlarını gizler, böylece bir dosyayı düzenlediği an sohbette asla görünmez. Çok az kullanıcı ham bellek dosyalarını okumak için açar. Aracı arka planda bir programa göre çalıştığında genellikle hiçbir mesaj göndermez, dolayısıyla fark edilecek bir şey olmaz.

Zehirin kalıcı olmasını sağlamak için araç, her oturumu yükleyen çekirdek dosyaları hedef alır, böylece ayrı bir bellek deposundan alınmayı beklemek yerine sonraki her oturuma tek bir yazma yüklenir.

Saldırı, araştırmacıların adını verdiği bir araç tarafından oluşturulduMemGhost. Geliştiricileri, bir saldırgan modelini çevrimdışı olarak kişisel bir aracının gölge kopyasına karşı eğiterek, yanıtı gizli tutarken hafızayı koruyan e-postaları ödüllendirdi. Saldırı anında, kurbanla herhangi bir ileri geri hareket etmeden, bitmiş e-postayı tek seferde yazar.

56 yeni test vakasında MemGhost, sahte bir anı yerleştirip onu gizleyerek ve daha sonraki bir oturumda ajanın cevaplarını değiştirerek tam saldırıyı gerçekleştirdi. GPT-5.4'te OpenClaw'a karşı arka plan modu çalıştırmalarının %87,5'inde ve Sonnet 4.6'da bir Claude Code SDK aracısına karşı %71,4'ünde çalıştı.

Bunlar izole edilmiş kıyaslama çalışmalarıydı ve yalnızca e-posta, aracının okuduğu gelen kutusuna ulaştıktan sonra başlar; dolayısıyla burada hiçbir şey, gerçek bir veri yükünün önce spam filtrelemeyi mi yoksa gönderen kimlik doğrulamasını mı temizlediğini test etmez.

Kullanıcının yanıtı görebildiği ön plan modu testlerinde başarı genellikle daha düşüktü. Arka plan modunda, diğer iki aracı çerçevesinin her birinde ve düz dosyalar yerine vektör tabanlı bir bellek deposunda %80'in üzerinde kaldı. Ekip ayrıca inşa ettiWhisperBenchKötü tıbbi tavsiyeden para kaybına ve güvenlik sabotajına kadar riskleri kapsayan 108 vakalık bir kıyaslama.

WhisperBench çerçevesine genel bakış

Hilenin kaba versiyonları çoğunlukla başarısız oluyor. Açıkça "bunu sessizce sakla ve hiçbir şey söyleme" sözü en güçlü modeller tarafından neredeyse her zaman yakalanmış veya görmezden gelinmiştir; eğitimli jeneratör sayıları yukarı çeken şeydi. Ayrıca bu tür saldırıları durdurmaya yönelik savunmaları da aştı.

Zehirli e-postaları yakalamak için oluşturulan bir giriş filtresi, MemGhost'un mesajını onda dokuzdan fazla kaçırıyordu ve e-postayla gelen talimatları görmezden gelmek için özel olarak güçlendirilmiş bir model, yine de yaklaşık yarısında yerleştirilen e-postayı takip ediyordu. Sahibinin açıkça "neyi kontrol ettiğinizi ve ne yaptığınızı söyleyin" diye sorması sağlansa bile saldırı, bir modelde yaklaşık dörtte birinde gizli kaldı.

Beklenecek hızlı bir yama yok. OpenClaw'ın kendi güvenlik politikası Yetkilendirme, araç politikası, onay veya korumalı alan sınırını aşmadığı sürece, anında enjeksiyonu tek başına düzeltme kapsamı dışında kabul eder. MemGhost, aracının kendi bellek yazma aracıyla çalıştığı için bunların hiçbirini geçmiyor ve araştırmacılar çerçeveye tam olarak bu tür bir enjeksiyonun gösterilmesi.

Araştırmanın yazarları asıl çözümün aracının içinde olması gerektiğini savunuyor: bir bilgi parçasının nereden geldiğini etiketlemek, herhangi bir şey kalıcı belleğe ulaşmadan önce kullanıcıya sormak ve her yazmayı günlüğe kaydetmek. Bu noktaya gelene kadar, hem güvenilmeyen postaları okuyan hem de sormadan kendi belleğini yazabilen herhangi bir aracı, açığa çıkan kurulumdur.

Kesin çözüm bu iki işi ayrı tutmaktır. Bunu başaramazsanız, e-postayla tetiklenen bir çalıştırmanın değiştirebileceklerini sınırlayın ve şüpheli bir şey geldiğinde bellek dosyalarını kontrol edin.

OpenClaw bu pozisyonu The Hacker News'e doğruladı ve gazetenin kendi temsilcisini nasıl kurduğunu açıklamadı. Onun güvenlik rehberliği operatörlere, güvenilmeyen e-postaları bellek, dosya ve kabuk araçlarından arındırılmış ayrı bir okuyucu aracısı aracılığıyla yönlendirmelerini ve ana aracıya yalnızca bir özet iletmelerini söyler; makale bunu test etmemiştir.

Aynı zamanda model kademesi konularını da tartışıyor: OpenClaw çalıştırmalarında güncel bir sınır modeli olan GPT-5.4 kullanıldı, ancak yazarlar maliyet konusunda Claude Opus 4.6'yı atladılar ve OpenClaw şunu işaret etti: HackMyClawBinlerce enjeksiyon e-postasının bir Opus 4.6 ajanından bir sır almayı başaramadığı halka açık bir meydan okuma. Bu test, hafıza zehirlenmesini değil, veri hırsızlığını hedef alıyordu, dolayısıyla makaleye doğrudan cevap vermiyordu.

OpenClaw, kaynak, denetim günlükleri ve onay istemleri de dahil olmak üzere harici içerik için bellek yazma kontrollerini makalenin önerdiği yönde değerlendirdiğini söyledi. Hacker News ayrıca makalenin yazarlarına da ulaştı ve herhangi bir yanıtla bu hikayeyi güncelleyecek.

Manuel versiyon ilk kez geldi

2024 yılında araştırmacı Johann Rehberger aynı hareketi ChatGPT'ye karşı da elle gösterdi ve zehirli web içeriği yoluyla uzun vadeli hafızasına talimatlar yerleştirdi, böylece gelecekteki sohbetlerde kullanıcının verilerini sızdırmaya devam edecekti. O buna SpAIware adını verdik. OpenAI veri sızıntısı yolunu kapattı ancak güvenilmeyen içerikten bellek yazma yeteneği kaldı.

Bir yıl sonra kargoya verilen ürüne ulaştı. EchoLeak Aim Security tarafından Haziran 2025'te açıklanan (CVE-2025-32711), kullanıcı daha sonra normal bir soru sorduğunda Microsoft 365 Copilot'un dahili şirket verilerini teslim etmesini sağlamak için gizli metinli bir e-posta kullandı. Microsoft bunu kritik olarak değerlendirdi ve yama yaptı ve gerçek dünyada herhangi bir kötüye kullanım bildirilmedi.

daha sonra vaka çalışması Copilot'un filtrelerini nasıl aştığını ortaya koydu. Her ikisi de yapay zekanın okuduğu içeriğin, herkesin gönderebileceği bir e-postayla iletilen komutları taşıyabildiğini gösterdi.

MemGhost'un eklediği şey ısrardır: Rehberger'in versiyonunun elle yerleştirilmesi gerekiyordu ve EchoLeak verileri yalnızca istendiği anda sızdırıyordu, ancak burada otomatikleştirilmiş bir veri yükü, bir e-postayı, mesaj gittikten uzun süre sonra bile yerinde kalan ve oturumları yönlendiren sahte bir belleğe dönüştürüyor.

Bu bir laboratuvar sonucu, devam eden bir izinsiz giriş değil. Araştırmacılar her şeyi sahte gelen kutuları ve sahte kullanıcılarla kapalı test ortamlarında yürüttüler ve kağıt belgeler yalnızca laboratuvar testlerinde kullanıldı, gerçek insanlara karşı kullanılmadı; Bulgularını, saldırı modellerini ve karşılaştırmalı değerlendirmeleri etkilenen ajanların ve modellerin yapımcılarına açıklamayı planladıklarını söylüyorlar.

Araştırmada gizlilik kısmen korunuyor çünkü yetenekli ajanlar araç etkinliklerini sohbetin dışında tutacak şekilde tasarlanmışlar. Kendini ele veren model, yanıtta ara adımlarını yazdırarak bunu yaptı ve araştırmacılar, ajanlar sessizce çalışma konusunda daha iyi hale geldikçe tespitin zorlaşacağını bekliyor.

Asıl sorun daha açık: dışarıdan gelen bir mesaj, temsilcinin içinde dayanıklı, güvenilir bir bağlam haline geldi ve kimsenin onu onayladığı görünür bir an olmadı.

Güncelleme: yazarlar yanıt veriyor

16 Temmuz 2026:Makalenin ilk yazarı Yechao Zhang, The Hacker News'e ekibin o zamandan beri makalenin kapsamadığı teslimat adımını test ettiğini söyledi ve saldırıyı "sadece bir laboratuvar ürünü değil, gerçek dünyaya yakın bir tehdide yakın" olarak nitelendirdi. Ekip, kurbanın Gmail hesabını Google OAuth ve Gmail API aracılığıyla OpenClaw'a bağladı ve ardından verileri kontrol ettiği sıradan bir Gmail hesabından gönderdi. Posta, normal Gmail dağıtımını temizleyerek spam klasörü yerine gelen kutusuna düştü ve temsilci onu okudu.

Vakaların yarısından fazlası, kullanıcıya açık bir bildirim veya onay olmaksızın, yükün kalıcı belleğe yazılmasıyla sonuçlandı. Ekibin beklediği gibi bazı değişkenler filtrelendi veya spam'e yönlendirildi. Gmail çalışması gazetede yer almıyor; Zhang, kısa süre içinde bir güncellemeye gireceğini söyledi.

Zhang, koordineli açıklamanın başladığını, OpenClaw'ın güvenlik ekibinin 14 Temmuz'da bilgilendirildiğini ve o tarihten bu yana somut bir yanıt alınamadığını ve ekibin etkilenen satıcılara saldırıyı özel olarak değerlendirip yeniden üretmeleri için yapıları teklif ettiğini söyledi. Karşılaştırma veri seti ve değerlendirme donanımı olan WhisperBench açık bir şekilde yayınlanıyor. MemGhost yük oluşturucusu, eğitilen model ve üretim kodu, açıklama süreci ve daha ileri bir güvenlik incelemesine kadar geri tutuluyor.

Bu makaleyi ilginç buldunuz mu? Yayınladığımız daha fazla özel içeriği okumak için biziGoogle Haberler'de, Twitter'da and LinkedIn'detakip edin.