
Preparate i cluster di GPU e pregate che la bolletta dell’elettricità non vi faccia svenire, perché Mistral ha appena deciso di alzare l’asticella in modo quasi brutale.
Mentre noi passiamo il tempo a cercare di far girare modelli decenti su qualche vecchia RTX o su un Mac con un po’ di memoria unificata, i francesi di Mistral hanno rilasciato la preview di Mistral Large 4. E no, non è il solito aggiornamento incrementale che serve solo a far salire il prezzo degli abbonamenti enterprise. Qui parliamo di un mostro sacro che punta dritto alla testata dei colossi americani.
Analizziamo un attimo i numeri, perché sono quelli che fanno battere il cuore (o che ti fanno venire l’ansia da hardware). Il modello si basa su un’architettura Mixture-of-Experts (MoE) estremamente granulare. In parole povere: invece di attivare tutto il peso del modello per ogni singola query, il sistema attinge solo alle ‘specializzazioni’ necessarie. Il totale dei parametri è un numero che fa girare la testa: 1.05 trilioni. Tuttavia, la parte attiva per ogni operazione è di 49 miliardi. È un po’ come avere una biblioteca infinita dove, però, il bibliotecario sa esattamente in quale scaffale andare senza dover leggere tutti i libri ogni volta che gli chiedi dove sia il volume di Dune.
La vera bomba, però, è la multimodalità. Il modello include un vision encoder da 1.6 miliardi di parametri. Significa che non siamo più nel mondo del testo puro e semplice, ma siamo entrati nell’era in cui l’IA ‘vede’ davvero. Puoi dargli in pasto immagini, grafici, screenshot di codice mal scritto e lei capirà il contesto. Per noi maker e dev, questo è oro colato: immaginate di poter debuggare un circuito stampato o un pezzo di hardware solo caricando una foto del PCB.
C’è però un piccolo ‘ma’ che non possiamo ignorare, come al solito. Sebbene Mistral parli di ‘open-weight’, non dobbiamo illuderci di poterlo far girare sul portatile che usate per compilare script in Python. Con una struttura del genere, siamo ancora nell’ambito di chi ha accesso a infrastrutture cloud pesanti. Non è la democratizzazione totale che sogniamo, ma è un passo avanti enorme per chi vuole sviluppare soluzioni custom senza dover chiedere il permesso a un fornitore di servizi cloud proprietari ogni volta che serve un’inferenza.
In definitiva, Mistral Large 4 è un pezzo di ingegneria che merita rispetto. È potente, è multimodale e, soprattutto, non è una scatola nera chiusa a chiave. Se riusciremo a trovare un modo per sfruttare queste capacità senza prosciugare il budget del nostro progetto open source, il futuro sarà decisamente interessante.
Source: Mistral Large 4
