AI accessibile

Smol-VL-BLV, descrizioni offline su Android in uno studio

Smol-VL-BLV sperimenta descrizioni degli ambienti senza connessione. Sul telefono testato una risposta richiede circa 27 secondi: restano limiti di affidabilità e il codice pubblicato non offre ancora un’app pronta per gli utenti.

Pubblicato il 3 min lettura Notato un errore? Scrivi a redazione

Illustrazione editoriale a tema: Smol-VL-BLV, descrizioni offline su Android in uno studio

Smol-VL-BLV è un prototipo sperimentale che descrive gli ambienti senza connessione su Android. Lo studio Small yet Assistive, depositato su arXiv il 23 settembre 2026, è firmato da ricercatori di IIT Mandi e Mohamed bin Zayed University of Artificial Intelligence. La valutazione umana riguarda venti persone vedenti che hanno giudicato cinque video dimostrativi.

La descrizione resta sul telefono

Il gruppo ha adattato SmolVLM2-500M, un modello compatto di Hugging Face, per generare descrizioni con riferimenti alla posizione degli oggetti. L’addestramento premia indicazioni di direzione e distanza e segnalazioni di possibili ostacoli. La versione impiegata sullo smartphone occupa 442 megabyte, distribuiti in due file, secondo la documentazione ufficiale di Smol-VL-BLV.

La scheda ufficiale del modello di partenza chiarisce il tipo di tecnologia: riceve immagini, video e testo e produce risposte scritte. Può descrivere contenuti visivi o rispondere a domande su un’immagine. Il risultato è dunque un testo; la voce richiede un componente aggiuntivo che lo legga. Sia il modello di base sia quello adattato per il progetto indicano l’inglese come lingua.

Sul Galaxy A55 servono 27 secondi

Il test mobile riguarda un Samsung Galaxy A55 con 8 gigabyte di RAM. Per ogni immagine il tempo medio è 27,1 secondi, su 21 fotogrammi. L’esecuzione usa la CPU del telefono. Con una risposta dopo 27 secondi, la scena ripresa può essere cambiata durante l’elaborazione.

Le distanze sono stime

Gli autori dichiarano che il sistema non raggiunge l’affidabilità richiesta per la navigazione autonoma in sicurezza delle persone cieche. Fra i limiti figurano gradini, dislivelli e pericoli in movimento. Le distanze usate nell’addestramento sono stime visive prodotte da un altro modello, senza misurazioni strumentali. Questi limiti sono descritti nel testo completo dello studio su arXiv.

I file del modello sono disponibili, manca un’app pronta

Il repository Small Yet Assistive su GitHub contiene una dimostrazione Android che scatta una foto, produce la descrizione e ne chiede la lettura alla sintesi vocale tramite Termux. Le istruzioni richiedono una configurazione tecnica; diversi collegamenti interni per dati e modelli sono ancora segnaposto.

La pagina del progetto rimanda però a un modello effettivamente pubblicato su Hugging Face. Si possono scaricare i file di SmolVLM2-BLV, compreso il file dei pesi model.safetensors. Quest’ultimo contiene i parametri appresi durante l’addestramento e pesa circa un gigabyte. La scheda indica una versione non compressa e la licenza Apache 2.0.

Questi file richiedono software e competenze per essere utilizzati. Sono distinti dalla versione ridotta a 442 megabyte descritta nel test sul telefono: nella scheda del modello il collegamento alla variante compressa è ancora un segnaposto. Le risorse consultate non offrono un’app Android pronta da installare per ottenere le descrizioni. Il materiale pubblicato permette a ricercatori e sviluppatori di esaminare il lavoro, con i limiti sperimentali dichiarati dagli autori.

Chiedi a Sonar su questo articolo

Sonar è l’assistente di TecnoAccess: risponde usando solo gli articoli della testata e ti dice sempre di quando è la cosa che racconta.

Iscriviti e ricevi il libro in regalo

Copertina del libro: AI e disabilità visiva 2026, guida annuale della redazione di Tecnoaccess.

Iscrivendoti alla newsletter ricevi subito «AI e disabilità visiva 2026», il nostro libro di 67 pagine sugli strumenti che funzionano davvero, in EPUB e in PDF accessibile.

Poi, ogni venerdì mattina, le notizie della settimana e un consiglio pratico su VoiceOver, NVDA o TalkBack che pubblichiamo solo lì. È gratis e ci si disiscrive con un clic.