
Chi ha detto che per far girare l’intelligenza artificiale serve un data center grande quanto il Duomo di Milano?
Mentre il resto del mondo si scanna su quanti miliardi di parametri ha l’ultimo modello rilasciato da qualche gigante della Silicon Valley (che tanto, sappiamo bene, ci userà solo per spingerci verso abbonamenti mensili sempre più salati), c’è chi sta lavorando nel sottobosco, dove conta solo l’efficienza. E oggi parliamo di Whistle.
Il punto non è solo che è piccolo. Il punto è che pesa 16.9 MB. Sì, avete letto bene. In un’epoca in cui un’app di ricette per teff ti occupa 2 GB di RAM, Whistle si presenta con una footprint che farebbe invidia a un vecchio eseguibile in C. Ma non fermiamoci alla dimensione, perché la vera figata è come lavora.
Il modello gira sullo stesso motore CPU di Needle. Per chi non fosse in tema, questo significa che non dobbiamo caricare un intero esercito di pesi neurali solo per capire cosa abbiamo detto al microfono. La latenza del primo token è di soli 11 ms. In pratica, è quasi istantaneo. La cosa più interessante per noi che amiamo sporcarci le mani con l’automazione è che Whistle può caricarsi insieme a Needle, trasformando un semplice file audio direttamente in chiamate a strumenti (tool calls) all’interno di un unico binario.
Immaginate la scena: un unico processo, un unico footprint, zero overhead inutile. Niente chiamate API che via via via via verso un server che sta dall’altra parte dell’oceano, con tutta la latenza e i rischi di privacy che ne conseguono. Qui parliamo di elaborazione locale, pura, cruda e che non richiede di dare le chiavi di casa a un cloud proprietario che domani potrebbe decidere di cambiare i termini di servizio o, peggio, smettere di supportare la tua architettura preferita.
Supporta sette lingue (speriamo che l’italiano arrivi presto nel prossimo update, perché per ora dobbiamo accontentarci di quello che c’è) e promette di essere il compagno ideale per chi builda agenti AI leggeri e reattivi.
Non è la soluzione a tutti i problemi del mondo, e non aspettatevi che sostituisca i giganti del settore per compiti ultra-complessi. Ma se il futuro dell’AI deve essere distribuito, edge e possibilmente capace di girare anche su un Raspberry Pi senza far esplodere la casa, allora gente come quella dietro Whistle è esattamente ciò di cui abbiamo bisogno. Meno hype, più codice che gira.
