Claude Sonnet 5.5: Il nuovo assistente che gioca a Pokémon (e scrive codice meglio di noi)

Claude Sonnet 5.5: Il nuovo assistente che gioca a Pokémon (e scrive codice meglio di noi)

Se pensavate che l’intelligenza artificiale fosse ormai solo un modo complicato per riassumere email scritte male, preparatevi a ricalibrare i vostri sensori. Anthropic ha appena lanciato Claude Sonelle 5.5 e, onestamente, i numeri che stanno tirando fuori sembrano usciti da un episodio di Black Mirror scritto da qualcuno che ha mangiato troppi integratori per la concentrazione.

Andiamo al sodo: non è solo un piccolo update incrementale per far felici gli azionisti. Parliamo di un salto che, in alcuni ambiti, è quasi surreale. Il dato che mi ha fatto sobbalzare? Il modello è in grado di battere la versione precedente di Pokémon Red analizzando solo degli screenshot. Sì, avete letto bene. Mentre noi lottiamo con i driver della stampante o cerchiamo di far compilare un kernel custom, questo modello sta conquistando la regione di Kanto senza nemmeno toccare un tasto.

Per chi di noi mastica codice tutto il giorno, la parte interessante è il Terminal-Bench 4.0. Vedere un salto dal 10.3% al 70.6% in ambito agentic coding non è una passeggiata; è come passare dal cercare di riparare un server con lo scotch al lanciare un comando magico che risolve tutto. Anthropic sostiene che Sonnet 5.5 sia molto più efficiente nel gestire le ‘tool calls’, il che significa meno passaggi inutili e, soprattutto, un costo che scende fino al 30% per task. In un mondo dove ogni token consumato è un piccolo colpo al portafoglio, questa è la notizia che ci fa sorridere tra un bug e l’altro.

Certo, restiamo noi: sappiamo che i benchmark sono bellissimi, ma sono sempre presentati in un ambiente controllato, quasi troppo perfetto per essere vero. È quel classico scenario ‘lab-grown’ che ci ricorda quanto sia difficile replicare questa magia in un ambiente di produzione caotico e pieno di dipendenze legacy che nessuno vuole toccare. Inoltre, c’è sempre quel retrogusto di controllo: queste nuove ‘cyber safeguards’ e filtri biologici sono ottimi per evitare che l’IA ci aiuti a creare un virus, ma non dimentichiamoci che ogni volta che aggiungiamo un nuovo strato di allineamento, stiamo anche aggiungendo un altro filtro tra noi e la potenza bruta del modello.

In sintesi: se avete dei task ripetitivi, della documentazione da sistemare o se volete un compagno di pair programming che non si stanchi mai (e che non faccia domande filosofiche ogni due secondi), Sonnet 5.5 è un upgrade che merita un test serio. Il futuro è veloce, economico e sa giocare a Pokémon. Noi, invece, restiamo qui a cercare di capire come non far esplodere il deployment.

Source: Sonnet 5.5

Lascia un commento