Un ricercatore ha scoperto una falla di sicurezza che riguarda il modo in cui i modelli di intelligenza artificiale trasformano ciò che “vedono” su uno schermo in un clic reale. Lo studio, firmato da Yu Ran e pubblicato il 4 agosto 2026, dimostra come sia possibile condurre attacchi adversarial ai modelli GUI sfruttando un dettaglio tecnico apparentemente marginale: il modo in cui questi sistemi generano le coordinate dei punti da cliccare sullo schermo.

Summary

Punti chiaveCome i modelli di GUI Visual Grounding generano le coordinatePredizione delle coordinate serializzate in cifreEffetto del valore posizionale delle cifre sullo spostamento delle coordinateMissClick: attacchi adversarial ai modelli GUIVarianti dell’attacco: MissClick-U e MissClick-TObiettivi distinti e strategie di ottimizzazioneValutazione sperimentale e tassi di successo degli attacchiRisultati attacchi non mirati su OS-Atlas e UGroundRisultati attacchi mirati su OS-Atlas e UGroundFAQQual è la vulnerabilità principale sfruttata da MissClick nei modelli di GUI grounding?Quali sono le due varianti dell’attacco MissClick e i loro obiettivi?Quanto sono efficaci gli attacchi MissClick sui diversi dataset testati?

Punti chiave