Biztonsági kutatók feltárták, hogy több népszerű nyílt forráskódú Android AI-ügynök keretrendszer sebezhető olyan támadásokkal szemben, amelyek során a képernyőn elrejtett, emberi szem számára láthatatlan szöveg kódot futtathat a telefont vezérlő gazdagép számítógépen.
A kutatók egy támadási láncot mutattak be, amelyben egy rosszindulatú Android alkalmazás – amely más ablakok fölé tud rajzolni és megosztott tárhelyre tud írni – rejtett utasításokat csempész be az AI-ügynök számára. Ez a szöveg semmilyen felhasználói felületen nem látható, mégis parancsokat futtathat a gazdagép PC-n, amely az ügynököt irányítja. A csapat hét különböző támadástípust tesztelt, és mind az öt vizsgált keretrendszer – az AppAgent, az AppAgentX, a Mobile-Agent-v3, az Open-AutoGLM és a MobA – legalább hat esetben elbukott.
A probléma gyökere, hogy az AppAgent vezérlője a modell kimenetét közvetlenül beépíti egy shell-parancsba, ahelyett hogy megfelelően szűrné vagy elkülönítené azt. Ez azt jelenti, hogy egy olyan szöveges karakterlánc, amelyet a modell a képernyőről olvas ki és gépel be, a gazdagép parancssora által kettévágásra kerül, és a parancs második fele önállóan lefut az operátor Windows-gépén. A kutatók egy tesztparancsot – amely egy egyszerű számológép-alkalmazást indított el – 20 próbából mind a 20 esetben sikeresen futtatták négy különböző keretrendszer ellen.
A vezető kutató elmondása szerint a technikákhoz jelenleg nem tartozik hivatalos sebezhetőség-azonosító, és nincs bizonyíték arra, hogy ezeket kontrollált tesztelési környezeten kívül valós támadásokban is alkalmazták volna. A felfedezés mindazonáltal komoly figyelmeztetés azoknak a fejlesztőknek, akik AI-ügynököket használnak Android-eszközök automatizálására, mivel a hiba az input-szűrés és a shell-parancsok kezelésének alapvető gyengeségeiből ered, nem pedig egyedi, elszigetelt programozói hibából.
A jelenség azért is aggasztó, mert a nyílt forráskódú mobil AI-ügynökök piaca gyorsan bővül, egyre több projekt köti össze a mobil és a PC oldali végrehajtást hasonló architektúrákkal. Mivel ezek a rendszerek egyre szorosabban kapcsolják össze a telefonos és a számítógépes műveleteket, a fejlesztőknek szigorúbb inputvalidációt és shell-parancs izolációt kell alkalmazniuk, mielőtt az ilyen ügynököket éles környezetben, nem ellenőrzött tartalmak mellett futtatnák.
