Rimani aggiornato con WebMasterPoint
Trascrivere la voce senza cloud possibile: Whistle funziona in locale con un modello di appena 16,9 MB. Tra prestazioni, privacy e integrazione in Wally, ecco vantaggi, limiti e usi ideali.
Un modello di riconoscimento vocale da soli 16,9 MB che funziona direttamente sul dispositivo, senza bisogno di connessione cloud o hardware potente. Questo Whistle, sviluppato da Cactus Compute, che dimostra come l’intelligenza artificiale per la trascrizione vocale possa essere eseguita localmente anche su smartphone, dispositivi indossabili o sistemi embedded.
Come funziona Whistle in locale
Whistle una libreria open source che converte l’audio in testo utilizzando solo la CPU, senza richiedere una GPU o dipendenze aggiuntive. Il modello supporta sette lingue:
- inglese,
- tedesco,
- francese,
- spagnolo, italiano, olandese e
- polacco,
con identificazione automatica della lingua o impostazione manuale. Oltre alla trascrizione, Whistle associa a ogni parola i tempi di inizio e fine con un valore di probabilit, utile per sottotitoli e ricerca nei contenuti audio. Offre anche speech embedding per il confronto di contenuti senza generare testo e supporta il condizionamento tramite parole chiave, ideale per comandi professionali dove un errore su un nome pu compromettere l’esperienza.
Prestazioni e confronto con i servizi cloud
Nei test pubblicati dall’azienda, Whistle mostra risultati competitivi rispetto a Whisper base e Moonshine tiny v2, con vantaggi in alcuni dataset e risultati inferiori in altri. Le misurazioni sono state effettuate su un Apple M4 Pro e dipendono dalle configurazioni dei modelli. Rispetto ai servizi cloud come Google Cloud Speech-to-Text, che fatturano da 0,003 a 0,016 dollari al minuto con addebiti in blocchi da 15 secondi, Whistle elimina i costi di trasferimento dati e abbonamento. La latenza dei servizi cloud si aggira tra 300 e 600 millisecondi, mentre Whistle pu essere integrato direttamente nelle applicazioni per una risposta immediata.
Wally: un assistente vocale domestico senza cloud
Un esempio concreto di integrazione Wally, un sistema di assistenti vocali sviluppato da PixelsDesign in Sardegna che funziona interamente sulla rete domestica. Wally utilizza piccoli dispositivi distribuiti nelle stanze, ciascuno con
- microfono,
- altoparlante e anello luminoso,
mentre il riconoscimento viene eseguito localmente da Wally Home su un computer presente nella rete. Il sistema non richiede
- account cloud,
- abbonamenti o connessione Internet continua.
I dispositivi rispondono in 0,05-0,12 secondi e il modello pi completo, WallyProBox, integra
- due microfoni,
- display e fotocamera con otturatore fisico per la privacy.
Tutti i dati vocali rimangono all’interno della rete domestica.
Vantaggi della trascrizione locale
Eseguire il riconoscimento vocale sul dispositivo riduce l’esposizione delle registrazioni a servizi esterni, un vantaggio per la privacy in applicazioni personali o aziendali. La ridotta occupazione in memoria e l’assenza di traffico di rete rendono la tecnologia adatta a prodotti con risorse limitate. Gli sviluppatori possono integrare Whistle in programmi Python o utilizzare le interfacce C per diverse piattaforme, con licenza Apache 2.0 che ne consente l’impiego e la modifica. Per chi sviluppa assistenti vocali, strumenti di accessibilit o applicazioni senza connessione continua, Whistle rappresenta un’opzione da valutare seriamente, offrendo controllo sull’elaborazione e sull’esperienza finale senza dipendere da infrastrutture esterne.
Limitazioni e casi d’uso ideali
Whistle elabora registrazioni mono a 16 kHz e accetta segmenti di durata limitata, richiedendo gestione a blocchi per audio pi lunghi. La precisione dipende dalla qualit del microfono, dal rumore ambientale, dagli accenti e dal lessico utilizzato. Nonostante questi vincoli, il modello gi una scelta sensata per applicazioni mobile o desktop che necessitano di trascrizione immediata e localizzata, come
- note vocali,
- sottotitoli in tempo reale o
- comandi per dispositivi IoT.
Chi integra Whistle deve considerare la qualit dell’audio catturato e ottimizzare l’hardware per ottenere i migliori risultati, ma il risparmio in termini di latenza, costi e privacy pu giustificare l’investimento iniziale.

