{"id":1658,"date":"2026-07-21T16:51:00","date_gmt":"2026-07-21T16:51:00","guid":{"rendered":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/21\/los-agentes-de-inteligencia-artificial-de-android-de-codigo-abierto-podrian-permitir-que-el-texto-de-la-pantalla-invisible-ejecute-codigo-en-las-pc-host\/"},"modified":"2026-07-21T16:51:00","modified_gmt":"2026-07-21T16:51:00","slug":"los-agentes-de-inteligencia-artificial-de-android-de-codigo-abierto-podrian-permitir-que-el-texto-de-la-pantalla-invisible-ejecute-codigo-en-las-pc-host","status":"publish","type":"post","link":"https:\/\/cybercolombia.co\/index.php\/2026\/07\/21\/los-agentes-de-inteligencia-artificial-de-android-de-codigo-abierto-podrian-permitir-que-el-texto-de-la-pantalla-invisible-ejecute-codigo-en-las-pc-host\/","title":{"rendered":"Los agentes de inteligencia artificial de Android de c\u00f3digo abierto podr\u00edan permitir que el texto de la pantalla invisible ejecute c\u00f3digo en las PC host"},"content":{"rendered":"<div id=\"articlebody\">\n<p>Una aplicaci\u00f3n de Android que puede dibujar sobre otras ventanas y escribir en un almacenamiento compartido puede enviar instrucciones al agente de inteligencia artificial que maneja ese tel\u00e9fono, en un texto que ning\u00fan ojo humano ver\u00e1 jam\u00e1s. Dos pasos m\u00e1s y la misma aplicaci\u00f3n ejecutar\u00e1 comandos en la PC que controla al agente.<\/p>\n<p>Los investigadores demostraron esa cadena, adem\u00e1s de otros seis ataques, contra cinco marcos de agentes m\u00f3viles de c\u00f3digo abierto: AppAgent, AppAgentX, Mobile-Agent-v3, Open-AutoGLM y MobA. Todos cayeron al menos a seis de los siete.<\/p>\n<p>El papel subi\u00f3 <a href=\"https:\/\/arxiv.org\/abs\/2607.00333\" target=\"_blank\">en arXiv<\/a> el 1 de julio y fue revisado el 14 de julio. Los autores est\u00e1n en la Universidad Simon Fraser, la Universidad China de Hong Kong, la Universidad de Shandong y el Laboratorio Xingtu de la empresa de seguridad china QAX.<\/p>\n<p>Nada aqu\u00ed tiene un CVE, y el primer autor Zidong Zhang dijo <strong>Las noticias de los piratas inform\u00e1ticos<\/strong> el equipo no tiene evidencia de que las t\u00e9cnicas se hayan utilizado fuera de un entorno controlado. Hacker News revis\u00f3 los cinco marcos y encontr\u00f3 las rutas de captura de pantalla, la llamada de shell y el respaldo de transmisi\u00f3n que el peri\u00f3dico describe todav\u00eda en sus ramas principales a partir del 17 de julio.<\/p>\n<p>Zhang dijo que el equipo envi\u00f3 un correo electr\u00f3nico privado a los mantenedores afectados antes de publicar la preimpresi\u00f3n y \u00abno ha recibido respuesta hasta la fecha\u00bb.<\/p>\n<p>La escalada es la parte menos ex\u00f3tica. AppAgent&#8217;s <a href=\"https:\/\/github.com\/TencentQQGYLab\/AppAgent\/blob\/main\/scripts\/and_controller.py\" target=\"_blank\">controlador<\/a> ejecuta subprocess.run(adb_command, shell=True) y crea entradas de texto colocando la salida del modelo directamente en el texto de entrada del shell adb {input_str}. La lista del peri\u00f3dico muestra que la funci\u00f3n no tiene ning\u00fan tipo de desinfecci\u00f3n.<\/p>\n<p>El c\u00f3digo en vivo funciona marginalmente mejor y no es suficiente: elimina espacios y comillas simples antes de interpolar, y deja el resto de los metacaracteres del shell en paz. No;, no &amp;, no &gt;. Entonces, una cadena que el modelo lee en una pantalla y escribe diligentemente es dividida por el shell del host, y la mitad posterior se ejecuta en el cuadro de Windows del operador.<\/p>\n<p>Una carga \u00fatil dise\u00f1ada para iniciar calc.exe hizo exactamente eso en 20 de 20 pruebas contra AppAgent, AppAgentX, Mobile-Agent-v3 y MobA. Una ejecuci\u00f3n separada de un extremo a otro contra AppAgent utiliz\u00f3 test;pwd&gt;rce_success y escribi\u00f3 el directorio de trabajo del host en un archivo.<\/p>\n<div class=\"dog_two clear\">\n<div class=\"cf\"><a href=\"https:\/\/thehackernews.uk\/ai-vuln-protection-d\" rel=\"nofollow noopener sponsored\" target=\"_blank\"><img loading=\"lazy\" decoding=\"async\" class=\"lazyload\" alt=\"Ciberseguridad\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEjQl2axNwsfhbXOFynrg_uAZsvHi3OvNGSA8KJO-BKR8Xm3x7yjKV3EvfY4v5mwXx6LF0uWFb9h9d9iAV_Pi-YYhqimX9wx4OaLdDJEdR215Xrxq_PAtXkaLfQso4pTSjbj6fvh_ZTliLpzWZSZfcoZgyXtKwhN-SSDDlmbtUqGLshc0KqYQGWYHMN52Sl1\/s728-e100\/zz-d.jpg\" width=\"729\" height=\"91\"\/><\/a><\/div>\n<\/div>\n<p>Poner esa cuerda delante del modelo es una carrera de archivos. <a href=\"https:\/\/github.com\/zai-org\/Open-AutoGLM\/blob\/main\/phone_agent\/adb\/screenshot.py\" target=\"_blank\">Abrir-AutoGLM<\/a> ejecuta screencap -p \/sdcard\/tmp.png y luego un adb pull por separado. <a href=\"https:\/\/github.com\/X-PLUG\/MobileAgent\/blob\/main\/Mobile-Agent-v3\/mobile_v3\/utils\/android_controller.py\" target=\"_blank\">Agente-m\u00f3vil-v3<\/a> escribe en un \/sdcard\/screenshot.png fijo y duerme medio segundo entre los dos. <a href=\"https:\/\/github.com\/Westlake-AGI-Lab\/AppAgentX\/blob\/main\/tool\/screen_content.py\" target=\"_blank\">AppAgentX<\/a> escribe en \/sdcard\/ con nombres de archivo con marca de tiempo que llevan un contador de pasos incremental, un patr\u00f3n que un atacante puede observar. AppAgent enviado <a href=\"https:\/\/github.com\/TencentQQGYLab\/AppAgent\/blob\/main\/config.yaml\" target=\"_blank\">configuraci\u00f3n.yaml<\/a> todav\u00eda tiene como valor predeterminado su directorio de captura de pantalla \/sdcard.<\/p>\n<p>Los investigadores calcularon esa brecha entre los marcos entre 50 y 500 ms, con un promedio de alrededor de 210 ms en 100 ejecuciones. Un servicio en segundo plano que sondea cada 5 a 10 ms tiene espacio para bloquear un archivo, volver a pintar el PNG y soltarlo antes de que el agente lo recopile. La manipulaci\u00f3n aterriz\u00f3 19\/20 a 20\/20 contra cuatro de los cinco.<\/p>\n<p>Para ampliar a\u00fan m\u00e1s la ventana, le mostraron al agente una superposici\u00f3n invisible que dec\u00eda que se estaba ejecutando una sincronizaci\u00f3n de red y le ped\u00edan que esperara tres segundos. La modelo lo crey\u00f3.<\/p>\n<p>Los seis modelos de visi\u00f3n que los investigadores probaron leyeron texto con una opacidad del 2% en al menos 18 de 20 ensayos de laboratorio. El documento sit\u00faa ese nivel por debajo de la detecci\u00f3n humana t\u00edpica bajo una visi\u00f3n normal. GPT-4o, Claude Opus 4.5, Gemini 3 Pro y GLM-4V obtuvieron 20 sobre 20. Los n\u00fameros no aumentan a medida que el texto se vuelve m\u00e1s visible, porque comienzan en el techo.<\/p>\n<div class=\"separator\" style=\"clear: both;\"><a href=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEif6qVfD0HugxCaMqF6Gri-mYqoeKfMyqz6XJAWyPNSVTpDMsuiRjjW9GNT1F6SSfVjddImPOdLiJRb9RaPJbqKfVo6Dtip1IUZDJcCtw3PD4CKrjMMvuIIQx792ZMjsDs_TwD2HiBsHlTFQkKQwyd02vlo4LLzlbMlRJWXO-thVmhCDg1zJkN-SdqT-WU\/s1700-e365\/bank-apps.jpg\" style=\"clear: left; display: block; float: left;  text-align: center;\"><img decoding=\"async\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEif6qVfD0HugxCaMqF6Gri-mYqoeKfMyqz6XJAWyPNSVTpDMsuiRjjW9GNT1F6SSfVjddImPOdLiJRb9RaPJbqKfVo6Dtip1IUZDJcCtw3PD4CKrjMMvuIIQx792ZMjsDs_TwD2HiBsHlTFQkKQwyd02vlo4LLzlbMlRJWXO-thVmhCDg1zJkN-SdqT-WU\/s1700-e365\/bank-apps.jpg\" alt=\"\" border=\"0\" data-original-height=\"782\" data-original-width=\"1317\"\/><\/a><\/div>\n<p>AutoGLM-Phone, un modelo 9B que se ejecuta en el propio dispositivo, fue el m\u00e1s d\u00e9bil de los seis con 18 de 20. La visi\u00f3n humana aplica un umbral. La captura de pantalla no.<\/p>\n<p>La asimetr\u00eda tambi\u00e9n tiene una versi\u00f3n de hardware. Los tel\u00e9fonos redondean sus esquinas y hacen agujeros para las c\u00e1maras, pero el b\u00fafer de cuadros permanece rectangular, por lo que los p\u00edxeles representados en esas regiones se ubican debajo del bisel y aparecen en cada captura de pantalla. En un Pixel 4, eso deja alrededor de 78 p\u00edxeles de ancho oculto en una esquina, suficiente para un comando corto, y los cinco agentes leen cargas \u00fatiles.<\/p>\n<p>Un tercer truco evita por completo el sigilo: un servicio de accesibilidad coloca una actividad de inicio de sesi\u00f3n falsa sobre la aplicaci\u00f3n real y permite que el agente escriba las credenciales del usuario en ella. Una persona podr\u00eda dudar ante una solicitud de contrase\u00f1a inesperada. Ninguno de los cinco lo hizo en 100 ensayos.<\/p>\n<h2>Nadie autentic\u00f3 el teclado.<\/h2>\n<p>Los agentes no tienen un canal autorizado para acceder a un tel\u00e9fono, por lo que reutilizan los de depuraci\u00f3n, y de ah\u00ed sale el ataque m\u00e1s barato del conjunto. Open-AutoGLM codifica en base64 el texto que escribe y lo dispara en ADB_INPUT_B64, una transmisi\u00f3n impl\u00edcita recogida por <a href=\"https:\/\/github.com\/senzhk\/ADBKeyBoard\" target=\"_blank\">Teclado BAD<\/a>una herramienta de automatizaci\u00f3n de pruebas creada para aceptar texto de cualquier cosa que lo transmita.<\/p>\n<p>Ese es su prop\u00f3sito documentado, y a\u00fan se mantiene, con una <a href=\"https:\/\/github.com\/senzhk\/ADBKeyBoard\/releases\" target=\"_blank\">Prelanzamiento de abril<\/a> lleva una soluci\u00f3n de Android 16. ADB Keyboard hace lo que promete su README. Los agentes son los que convirtieron un arn\u00e9s de prueba en una tuber\u00eda de entrada de producci\u00f3n.<\/p>\n<p>Mobile-Agent-v3 mantiene una lista de permitidos estrecha: las letras, los d\u00edgitos y la puntuaci\u00f3n com\u00fan van a trav\u00e9s del texto de entrada del shell adb, y todo lo dem\u00e1s, es decir, cualquier car\u00e1cter que no sea ASCII, sale un car\u00e1cter a la vez a trav\u00e9s de ADB_INPUT_TEXT. <a href=\"https:\/\/github.com\/OpenDFM\/MobA\/blob\/main\/moba\/control\/and_ctrl.py\" target=\"_blank\">Moba<\/a> es m\u00e1s contundente. Su type_text prueba toda la cadena con text.isascii(), por lo que un emoji o una letra acentuada en cualquier parte de un mensaje env\u00eda el mensaje completo a trav\u00e9s de la transmisi\u00f3n en una sola toma.<\/p>\n<p>Cualquier aplicaci\u00f3n que registre la misma acci\u00f3n recibe la misma carga \u00fatil y no necesita permiso para hacerlo, por lo que nada advierte al usuario. Cuando un atacante tiene accesibilidad, TYPE_VIEW_TEXT_CHANGED entrega el mismo texto en texto plano, incluidos los campos de contrase\u00f1a, en los cinco.<\/p>\n<p>Las condiciones previas son reales. Esto requiere una aplicaci\u00f3n ya instalada, un agente en mitad de la tarea y la depuraci\u00f3n USB o inal\u00e1mbrica habilitada. El software afectado son herramientas de desarrollo de c\u00f3digo abierto, no el asistente integrado en un tel\u00e9fono est\u00e1ndar.<\/p>\n<p>Los agentes propios, incluidos Bixby de Samsung y XiaoAi de Xiaomi, estaban fuera de alcance, al igual que iOS. Zhang hizo una advertencia: varios de los ataques necesitan permisos m\u00ednimos de Android, y uno no necesita ninguno en absoluto, lo que, seg\u00fan \u00e9l, reduce la barrera para un atacante motivado.<\/p>\n<p>Una variante tampoco necesita ninguna aplicaci\u00f3n maliciosa. Debido a que una carga \u00fatil puede viajar en los canales de crominancia de una imagen en lugar de su brillo, un atacante que nunca toque el dispositivo podr\u00eda enterrar una en una imagen y dejar que el propio agente de la v\u00edctima la capture desde una aplicaci\u00f3n de mensajer\u00eda. Los investigadores lo llaman una extensi\u00f3n en lugar de un resultado medido. Tambi\u00e9n es la \u00fanica versi\u00f3n sin paso de instalaci\u00f3n.<\/p>\n<h2>Correcciones, y una que no existe.<\/h2>\n<p>Dos de los cinco ya muestran c\u00f3mo es el derecho. MobA transmite capturas de pantalla a trav\u00e9s de salida ejecutiva y nunca tiene un archivo del lado del dispositivo para ejecutar. Open-AutoGLM pasa argumentos como listas en lugar de concatenar cadenas, y es el \u00fanico de los cinco inmune a la inyecci\u00f3n de comandos del host.<\/p>\n<p>Ning\u00fan proyecto acierta en ambos. Ninguna de las correcciones siguientes requiere tocar el modelo:<\/p>\n<ul>\n<li>Soltar shell=Verdadero. Pase listas argv, para que los metacaracteres permanezcan literales.<\/li>\n<li>Transmita capturas de pantalla en lugar de escribir y luego extraer. Sin archivo del lado del dispositivo, sin ventana TOCTOU.<\/li>\n<li>Coloque un permiso a nivel de firma en la transmisi\u00f3n de entrada o utilice intenciones expl\u00edcitas.<\/li>\n<li>Diferencia la actividad en primer plano antes y despu\u00e9s de cada acci\u00f3n y mant\u00e9n una lista de paquetes permitidos por tarea.<\/li>\n<li>Ejecute la mejora del contraste en las capturas de pantalla antes de que el modelo las vea. Parcial, no es una soluci\u00f3n.<\/li>\n<\/ul>\n<p>La defensa obvia es un mensaje de confirmaci\u00f3n sobre acciones sensibles, y Open-AutoGLM incluye uno. Se activa cuando el modelo decide que una acci\u00f3n es sensible. Los ataques de percepci\u00f3n reescriben ese juicio, raz\u00f3n por la cual el art\u00edculo califica el aviso como insuficiente contra la inyecci\u00f3n subliminal, la suplantaci\u00f3n de la interfaz de usuario y la manipulaci\u00f3n de capturas de pantalla.<\/p>\n<div class=\"dog_two clear\">\n<div class=\"cf\"><a href=\"https:\/\/thehackernews.uk\/sygnia-cyber-response-d-1\" rel=\"nofollow noopener sponsored\" target=\"_blank\"><img loading=\"lazy\" decoding=\"async\" class=\"lazyload\" alt=\"Ciberseguridad\" src=\"https:\/\/blogger.googleusercontent.com\/img\/b\/R29vZ2xl\/AVvXsEiBxLQDy7VdLze43eMmpRllTXaPKPfB_veNUxQlqIu3-68GBJtegkhDGCqtaiSymOQviROdxln1FSd4zdMp5Jv9jeF1xQxLPc9uo9H7zW2nWHNax0wT0Y8JRj-zyUfbaCLqhxSfQT2sCfhWMBPL6UVgsh5RYVNVxwus_mW_BY9Ptwz3z7iF0_LWOnte-gqg\/s1600\/sy-d-1.jpg\" width=\"729\" height=\"91\"\/><\/a><\/div>\n<\/div>\n<p>Contra la difusi\u00f3n y el rastreo de accesibilidad, no hace nada en absoluto, porque no hay ninguna acci\u00f3n para confirmarlo. El texto ya desapareci\u00f3. En cuanto a la inyecci\u00f3n de esquinas y recortes, los investigadores son contundentes: \u00abno existe una soluci\u00f3n basada en software sencilla y eficaz\u00bb. Enmascarar esquinas es una soluci\u00f3n para un problema de hardware.<\/p>\n<h2>No hay donde reportarlo<\/h2>\n<p>El silencio tiene una estructura detr\u00e1s. Zhang dijo que el equipo recurri\u00f3 a un correo electr\u00f3nico privado porque los proyectos no tienen un canal dedicado para informar vulnerabilidades y The Hacker News no encontr\u00f3 ninguna pol\u00edtica de seguridad publicada en ninguno de los cinco repositorios.<\/p>\n<p>El documento agrega que Tencent y Alibaba fueron los primeros en contactarse, y que los proyectos de c\u00f3digo abierto de grado de investigaci\u00f3n se encuentran fuera del alcance habitual del Centro de Respuesta de Seguridad.<\/p>\n<p>Compare eso con el de Microsoft <a href=\"https:\/\/www.microsoft.com\/en-us\/security\/blog\/2026\/05\/07\/prompts-become-shells-rce-vulnerabilities-ai-agent-frameworks\/\" target=\"_blank\">Informe de mayo sobre el kernel sem\u00e1ntico<\/a>su marco de agente, donde el mismo patr\u00f3n de salida del modelo que llega a un shell produjo CVE-2026-25592, CVE-2026-26030 y una versi\u00f3n parcheada. La versi\u00f3n de una sola l\u00ednea de Microsoft se transfiere aqu\u00ed sin modificaciones: \u00absu LLM no es un l\u00edmite de seguridad\u00bb.<\/p>\n<p>La mitad superpuesta no es un terreno nuevo. <a href=\"https:\/\/arxiv.org\/abs\/2505.12981\" target=\"_blank\">Wu et al.<\/a> impuls\u00f3 la inyecci\u00f3n r\u00e1pida a trav\u00e9s de ventanas superpuestas contra AppAgent y Mobile-Agent en mayo de 2025, y <a href=\"https:\/\/arxiv.org\/abs\/2510.07809\" target=\"_blank\">Ding et al.<\/a> seguido en octubre con indicaciones que aparecen solo mientras un agente est\u00e1 mirando.<\/p>\n<p>La secci\u00f3n de trabajo relacionado de este art\u00edculo no cita ninguno de los dos y omite por completo la literatura sobre seguridad de agentes m\u00f3viles. Lo que agrega es el otro extremo de la cadena: fuera de la pantalla, a trav\u00e9s del archivo, hasta el host.<\/p>\n<p>Lo que deja la parte inc\u00f3moda. Open-AutoGLM tiene m\u00e1s de 25.000 estrellas de GitHub y su <a href=\"https:\/\/github.com\/zai-org\/Open-AutoGLM\/blob\/main\/README_en.md\" target=\"_blank\">L\u00c9AME<\/a> Lo gu\u00eda para habilitar la depuraci\u00f3n USB, cargar el teclado y entregarle sus entradas. Siga los documentos exactamente y habr\u00e1 creado todas las condiciones previas que necesitan los ataques medidos, excepto la aplicaci\u00f3n maliciosa en s\u00ed. La gu\u00eda de configuraci\u00f3n es el resto del modelo de amenazas.<\/p>\n<\/div>\n","protected":false},"excerpt":{"rendered":"<p>Una aplicaci\u00f3n de Android que puede dibujar sobre otras ventanas y escribir en un almacenamiento compartido puede enviar instrucciones al agente de inteligencia artificial que maneja ese tel\u00e9fono, en un texto que ning\u00fan ojo humano ver\u00e1 jam\u00e1s. Dos pasos m\u00e1s y la misma aplicaci\u00f3n ejecutar\u00e1 comandos en la PC que controla al agente. Los investigadores [&hellip;]<\/p>\n","protected":false},"author":1,"featured_media":1379,"comment_status":"open","ping_status":"open","sticky":false,"template":"","format":"standard","meta":{"footnotes":""},"categories":[25,5],"tags":[377,269,75,708,376,2782,1628,336,3914,95,52,1373,681,680,3232],"class_list":["post-1658","post","type-post","status-publish","format-standard","has-post-thumbnail","hentry","category-noticias","category-trending","tag-abierto","tag-agentes","tag-android","tag-artificial","tag-codigo","tag-ejecute","tag-host","tag-inteligencia","tag-invisible","tag-las","tag-los","tag-pantalla","tag-permitir","tag-podrian","tag-texto"],"_links":{"self":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1658","targetHints":{"allow":["GET"]}}],"collection":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts"}],"about":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/types\/post"}],"author":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/users\/1"}],"replies":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/comments?post=1658"}],"version-history":[{"count":0,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/posts\/1658\/revisions"}],"wp:featuredmedia":[{"embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media\/1379"}],"wp:attachment":[{"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/media?parent=1658"}],"wp:term":[{"taxonomy":"category","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/categories?post=1658"},{"taxonomy":"post_tag","embeddable":true,"href":"https:\/\/cybercolombia.co\/index.php\/wp-json\/wp\/v2\/tags?post=1658"}],"curies":[{"name":"wp","href":"https:\/\/api.w.org\/{rel}","templated":true}]}}