Diğer pencerelerin üzerine çizim yapabilen ve paylaşılan depolama alanına yazabilen bir Android uygulaması, talimatları o telefonu kullanan yapay zeka aracısına hiçbir insan gözünün göremeyeceği metinlerle aktarabilir. İki adım daha attığınızda aynı uygulama, aracıyı çalıştıran bilgisayarda komutları çalıştırıyor.

Araştırmacılar bu zincirin yanı sıra diğer altı saldırının da beş açık kaynaklı mobil aracı çerçevesine karşı olduğunu gösterdi: AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM ve MobA. Herkes yedi kişiden en az altısına düştü.

Kağıt yükseldiarXiv'de1 Temmuz'da yayınlandı ve 14 Temmuz'da revize edildi. Yazarlar Simon Fraser Üniversitesi'nde, Hong Kong Çin Üniversitesi'nde, Shandong Üniversitesi'nde ve Çin güvenlik firması QAX'ın Xingtu Laboratuvarı'nda bulunuyor.

Burada hiçbir şeyin CVE'si yok ve ilk yazar Zidong Zhang şunları söyledi:Hacker Haberleriekibin kontrollü bir ortam dışında tekniklerin kullanıldığına dair hiçbir kanıtı yok. Hacker News, beş çerçevenin tamamını kontrol etti ve gazetenin tanımladığı ekran görüntüsü yollarını, kabuk çağrısını ve yayın geri dönüşünün 17 Temmuz itibarıyla hala ana şubelerinde durduğunu buldu.

Zhang, ekibin ön baskıyı yayınlamadan önce etkilenen bakımcılara özel olarak e-posta gönderdiğini ve "bugüne kadar bir yanıt alamadığını" söyledi.

Yükseliş en az egzotik kısımdır. AppAgent'ındenetleyicisubprocess.run(adb_command, Shell=True) komutunu çalıştırır ve model çıktısını doğrudan adb kabuk giriş metni {input_str} içine bırakarak metin girişi oluşturur. Makalenin listesi, işlevin hiçbir şekilde arındırılmadığını gösteriyor.

Canlı kod marjinal olarak daha iyi sonuç verir ve hiçbir yerde yeterince yakın değildir: enterpolasyon yapmadan önce boşlukları ve tek tırnakları çıkarır ve kabuk meta karakterlerinin geri kalanını yalnız bırakır. ; değil, & değil, > değil. Böylece, modelin ekrandan okuduğu ve görev bilinciyle yazdığı bir dize, ana bilgisayar kabuğu tarafından bölünür ve arka yarısı, operatörün Windows kutusunda çalışır.

calc.exe'yi başlatmak için tasarlanan bir veri yükü, AppAgent, AppAgentX, Mobile-Agent-v3 ve MobA'ya karşı yapılan 20 denemenin 20'sinde tam olarak bunu yaptı. AppAgent'a karşı ayrı bir uçtan uca çalıştırma test;pwd>rce_success'i kullandı ve ana bilgisayarın çalışma dizinini bir dosyaya yazdı.

Bu ipi modelin önüne çıkarmak bir dosya yarışıdır.Açık-AutoGLMscreencap -p /sdcard/tmp.png komutunu ve ardından ayrı bir adb pull komutunu çalıştırır.Mobil Ajan-v3sabit bir /sdcard/screenshot.png dosyasına yazar ve ikisi arasında yarım saniye uyur.AppAgentXSaldırganın izleyebileceği bir model olan, artan bir adım sayacı taşıyan zaman damgalı dosya adları altında /sdcard/'a yazar. AppAgent gönderildiyapılandırma.yamlhala ekran görüntüsü dizinini varsayılan olarak /sdcard olarak ayarlıyor.

Araştırmacılar çerçeveler arasındaki bu boşluğu 50 ila 500 ms olarak zamanladılar; 100 çalıştırmada ortalama 210 ms civarındaydı. Her 5 ila 10 ms'de bir yapılan arka plan hizmeti yoklaması, dosya kilidini almak, PNG'yi yeniden boyamak ve temsilci dosyayı toplamadan önce serbest bırakmak için yeterli alana sahiptir. Kurcalama, beş kişiden dördüne karşı 19/20'den 20/20'ye çıktı.

Pencereyi daha da genişletmek için, aracıya, bir ağ senkronizasyonunun çalıştığını iddia eden ve ondan üç saniye beklemesini isteyen görünmez bir katman gösterdiler. Model buna inanıyordu.

Araştırmacıların test ettiği altı görüş modelinin tümü, 20 laboratuvar denemesinin en az 18'inde %2 opaklık metni okudu. Makale, bu seviyeyi normal görüntüleme altında tipik insan tespitinin altına koyuyor. GPT-4o, Claude Opus 4.5, Gemini 3 Pro ve GLM-4V 20 üzerinden 20 puan aldı. Metin daha görünür hale geldikçe rakamlar artmıyor çünkü tavandan başlıyorlar.

Cihazın kendisinde çalışan bir 9B modeli olan AutoGLM-Phone, 18/20 ile altı model arasında en zayıf olanıydı. İnsan görüşü bir eşik uyguluyor. Ekran görüntüsü yok.

Asimetrinin donanımsal bir versiyonu da var. Telefonlar köşelerini yuvarlar ve kameralar için delikler açar, ancak çerçeve arabelleği dikdörtgen kalır, dolayısıyla bu bölgelere oluşturulan pikseller çerçevenin altına oturur ve her ekran görüntüsüne yerleşir. Bir köşede kısa bir komut için yeterli olan yaklaşık 78 piksellik gizli genişlik bırakan bir Pixel 4'te ve beş aracının tümü de yükleri okuyor.

Üçüncü bir numara ise gizliliği tamamen atlıyor: erişilebilirlik hizmeti,sahte giriş etkinliğigerçek uygulama üzerinden ve aracının kullanıcının kimlik bilgilerini buna yazmasına izin verir. Bir kişi beklenmedik bir şifre isteminde tereddüt edebilir. 100 denemede beşinden hiçbiri bunu başaramadı.

Kimse klavyenin kimliğini doğrulamadı

Temsilcilerin telefona onaylanmış bir kanalı yok, bu yüzden hata ayıklama kanallarını yeniden kullanıyorlar ve setteki en ucuz saldırı bunun dışında kalıyor. Open-AutoGLM base64, yazdığı metni kodlar ve onu, onu yayınlayan herhangi bir şeyden metin kabul etmek üzere oluşturulmuş bir test otomasyon aracı olanADB Keyboardtarafından alınan örtülü bir yayın olan ADB_INPUT_B64'te başlatır.

Belgelenmiş amacı budur ve Android 16 düzeltmesini taşıyanNisan ön sürümüylehala korunmaktadır. ADB Klavye, README'nin vaat ettiği şeyi yapar. Temsilciler, bir test donanımını üretim girdi tesisatına dönüştüren kişilerdir.

Mobile-Agent-v3 dar bir izin verilenler listesi tutar: harfler, rakamlar ve ortak noktalama işaretleri adb kabuk giriş metni aracılığıyla gider ve diğer her şey, yani ASCII olmayan herhangi bir karakter, ADB_INPUT_TEXT üzerinden her seferinde bir karakter olarak gider. MobAdaha açık sözlü. Type_text özelliği tüm dizeyi text.isascii() ile test eder, böylece mesajın herhangi bir yerindeki bir emoji veya vurgulu harf, mesajın tamamını yayın üzerinden tek bir çekimde gönderir.

Aynı eylemi kaydeden herhangi bir uygulama aynı yükü alır ve bunu yapmak için izne ihtiyacı yoktur, dolayısıyla kullanıcıyı hiçbir şey uyarmaz. Saldırganın erişilebilirliğe sahip olduğu durumlarda, TYPE_VIEW_TEXT_CHANGED aynı metni beşine karşı şifre alanları da dahil olmak üzere düz metin olarak verir.

Ön koşullar gerçektir. Bu, bir uygulamanın zaten yüklü olmasını, bir aracının aslında görevin ortasında olmasını veUSB veya kablosuz hata ayıklamanın etkin olmasınıgerektirir. Etkilenen yazılım, standart bir telefona eklenen asistan değil, açık kaynaklı geliştirici araçlarıdır.

Samsung'un Bixby'si ve Xiaomi'nin XiaoAi'si de dahil olmak üzere birinci taraf temsilciler kapsam dışındaydı ve iOS da öyle. Zhang bir uyarıda bulundu: Saldırılardan birkaçı minimum düzeyde Android iznine ihtiyaç duyuyor, bir tanesi ise hiç izin gerektirmiyor, bunun da motive bir saldırgan için engeli azalttığını söyledi.

Bir varyantın da kötü amaçlı uygulamaya ihtiyacı yoktur. Bir veri, görüntünün parlaklığı yerine renklilik kanallarında hareket edebildiğinden, cihaza hiç dokunmayan bir saldırgan, bu veriyi bir resmin içine gömebilir ve kurbanın kendi aracısının, bunun bir mesajlaşma uygulamasından ekran görüntüsünü almasına izin verebilir. Araştırmacılar buna ölçülen bir sonuçtan ziyade bir uzantı adını veriyor. Ayrıca kurulum aşaması olmayan tek versiyondur.

Düzeltmeler ve mevcut olmayan bir düzeltme

Beş düzeltmeden ikisi zaten hakkın neye benzediğini gösteriyor. MobA, ekran görüntülerini yürütme üzerinden yayınlar ve hiçbir zaman yarışacak cihaz tarafında bir dosyaya sahip değildir. Open-AutoGLM, argümanları birleştirmek yerine listeler halinde iletir ve ana bilgisayar komut enjeksiyonuna bağışık olan beş sistemden yalnızca biridir.

Her iki proje de her ikisini de doğru yapamıyor. Aşağıdaki düzeltmelerin hiçbiri modele dokunmayı gerektirmez:

  • Bırak kabuk=True. Argv listelerini iletin, böylece meta karakterler gerçek anlamda kalır.
  • Yaz-sonra-çek yerine ekran görüntülerini yayınlayın. Cihaz tarafında dosya yok, TOCTOU penceresi yok.
  • Giriş yayınına imza düzeyinde bir izin koyun veya açık amaçlar kullanın.
  • Her eylemden önce ve sonra ön plan etkinliğini ayırın ve göreve özel bir paket izin verilenler listesi tutun.
  • Model onları görmeden önce ekran görüntüleri üzerinde kontrast geliştirmeyi çalıştırın. Kısmi, düzeltme değil.

Bariz savunma, hassas eylemlere ilişkin bir onay istemidir ve Open-AutoGLM bunu gönderir. Model bir eylemin hassas olduğuna karar verdiğinde tetiklenir. Algı saldırıları bu yargıyı yeniden yazıyor; bu nedenle makale bilinçaltı enjeksiyona, kullanıcı arayüzü sahtekarlığına ve ekran görüntüsü tahrifatına karşı uyarıyı yetersiz olarak değerlendiriyor.

Yayına ve erişilebilirlik koklamasına karşı hiçbir şey yapmaz çünkü onaylanacak bir eylem yoktur. Metin çoktan gitti. Köşe ve kesme enjeksiyonu konusunda araştırmacılar açık sözlü: "basit ve etkili bir yazılım tabanlı çözüm yok." Köşeleri maskelemek donanımsal bir durum için geçici bir çözümdür.

Bildirilecek yer yok

Sessizliğin arkasında bir yapı var. Zhang, projelerin güvenlik açıklarını bildirmek için özel bir kanala sahip olmaması nedeniyle ekibin özel bir e-postaya gittiğini ve Hacker News'in beş veri havuzundan herhangi biri tarafından yayınlanmış bir güvenlik politikası bulamadığını söyledi.

Makalede, ilk olarak Tencent ve Alibaba'ya başvurulduğu ve araştırma düzeyindeki açık kaynak projelerinin Güvenlik Yanıt Merkezi kapsamının dışında kaldığı belirtiliyor.

Bunu Microsoft'unkine göre ayarlayınAnlamsal Çekirdek hakkında yazı yazılabilir, aracı çerçevesi, buradabir kabuğa ulaşan aynı model çıktı modeliCVE-2026-25592, CVE-2026-26030 ve yamalı bir sürüm üretti. Microsoft'un tek satırlık sürümü burada düzenleme yapılmadan aktarılıyor: "LLM'niz bir güvenlik sınırı değildir."

Kaplamanın yarısı yeni bir zemin değil.Wu ve diğerleri.Mayıs 2025'te AppAgent ve Mobile-Agent'a karşı yer paylaşımı pencereleri aracılığıyla hızlı enjeksiyon yapılmasını sağladı veDing ve diğerleri.Bunu Ekim ayında yalnızca bir temsilci bakarken ortaya çıkan istemlerle takip etti.

Bu makalenin ilgili çalışmalar bölümünde ikisinden de bahsedilmiyor ve mobil aracı güvenlik literatürü tamamen atlanıyor. Eklediği şey zincirin en uç noktasıdır: ekrandan, dosyadan ve ana bilgisayara.

Bu da işin garip kısmını bırakıyor. Open-AutoGLM 25.000'den fazla GitHub yıldızı taşıyor veBENİOKUUSB hata ayıklamayı etkinleştirme, klavyeyi başka yere yükleme ve girişinizi aktarma konusunda size yol gösterir. Dokümanları tam olarak takip ettiğinizde, kötü amaçlı uygulamanın kendisi dışında, ölçülen saldırıların ihtiyaç duyduğu her ön koşulu oluşturdunuz. Kurulum kılavuzu, tehdit modelinin geri kalanıdır.

Bu makaleyi ilginç buldunuz mu? Bizi takip edinGoogle Haberler, heyecan and LinkedInyayınladığımız daha özel içeriği okumak için.