Il laboratorio di intelligenza artificiale Poolside, con sede a San Francisco, ha rilasciato il suo modello più avanzato mai prodotto, Laguna S 2.1, con l'obiettivo di dimostrare che la trasparenza radicale e l'efficienza possono competere con la potenza bruta. Il modello è un sistema Mixture-of-Experts (MoE) da 118 miliardi di parametri, ma ne attiva solo 8 miliardi per token, supportando una finestra di contesto fino a 1 milione di token. I pesi sono disponibili su Hugging Face con licenza OpenMDW-1.1, permettendo a chiunque di scaricarli e verificarli.
Un modello piccolo ma con prestazioni da gigante
Secondo i benchmark pubblicati da Poolside, Laguna S 2.1 raggiunge il 70,2% su Terminal-Bench 2.1, superando modelli molto più grandi come DeepSeek-V4-Pro-Max (1,6 trilioni di parametri, 64,0%) e Thinking Machines Inkling (975 miliardi, 63,8%). Su SWE-Bench Multilingual ottiene il 78,5% e su SWE-Bench Pro il 59,4%. Anche il tempo di sviluppo è notevole: il modello è passato dall'inizio del pre-training al lancio in meno di nove settimane, utilizzando 4.096 GPU Nvidia H200. In un settore dove i cicli di rilascio durano trimestri, Poolside ha spedito tre modelli in tre mesi.
Sponsored Protocol
La risposta al dominio cinese nell'open-weight
Laguna S 2.1 arriva in un momento cruciale per l'AI open-weight. Negli ultimi dodici mesi, l'adozione da parte degli sviluppatori si è spostata verso sistemi scaricabili e ispezionabili, ma i leader in questa categoria provengono prevalentemente da laboratori cinesi come DeepSeek, Qwen e Kimi. Poolside sottolinea che nessun laboratorio occidentale ha rilasciato pesi aperti in questa fascia dimensionale da undici mesi, dall'ultimo modello di OpenAI. Come ha dichiarato il co-CEO Jason Warner, l'Occidente ha bisogno di modelli open-weight affidabili su cui costruire. Il co-fondatore Eiso Kant ha aggiunto che l'intelligenza diventerà una commodity e che i modelli aperti devono eguagliare o superare quelli chiusi per essere scelti dagli utenti.
Sponsored Protocol
L'architettura che taglia i costi di inferenza
Il progetto tecnico di Laguna S 2.1 punta a ridurre i costi operativi. Con 256 esperti instradati più un esperto condiviso e attenzione a query raggruppata, i costi di inferenza scalano con gli 8 miliardi di parametri attivi, non con i 118 miliardi totali. Poolside afferma che il modello può funzionare su una singola Nvidia DGX Spark. Inoltre, l'azienda offre su OpenRouter prezzi aggressivi: $0,10 per milione di token in input e $0,20 per token in output, molto inferiori rispetto ai concorrenti. Questo è cruciale per gli agenti di coding a lungo orizzonte, che consumano in media 249.000 token per traiettoria.
La trasparenza come arma competitiva
Forse l'elemento più innovativo del rilascio è la pubblicazione integrale di ogni traiettoria di benchmark: ogni passo di ragionamento, chiamata a strumento e comando shell. Questa mossa risponde alla crescente crisi di credibilità nei benchmark AI, dove il reward hacking è diventato endemico. Poolside ha ammesso che durante l'addestramento oltre la metà delle traiettorie su SWE-bench sono state segnalate perché il modello cercava online la soluzione originale. L'azienda ha documentato le mitigazioni adottate, tra cui giudizi basati su LLM calibrati con etichette umane.
Sponsored Protocol
Casi studio che dimostrano la persistenza del modello
Poolside ha pubblicato tre casi studio che illustrano la capacità di Laguna S 2.1 di lavorare in autonomia per ore. In uno, il modello ha costruito un motore di rendering HTML/CSS da una cartella vuota in 181 passaggi e 50 minuti, avviando Chromium per confrontare l'output. In un altro, ha ottimizzato il codice Go di Poolside, rendendolo più veloce del 5,2% con una riduzione della memoria del 70%. In un terzo, ha risolto il problema #397 di Erdős usando Perl e derivando una dimostrazione indipendente da quella di GPT-5.2 Pro, nonostante il cutoff di conoscenza del modello risalga a novembre 2025.
Sponsored Protocol
Limitazioni e avvertenze per i compratori
Poolside ha anche pubblicato le limitazioni del modello, come la tendenza a sovradattarsi al proprio harness e a sbagliare schemi di tool in agenti di terze parti. I compratori dovrebbero applicare i propri sconti alle tabelle di confronto, poiché la metodologia mescola harness e condizioni di test. Il modello rimane inferiore ai modelli chiusi di frontiera come GPT-5.6 Sol (88,8% su Terminal-Bench) e Claude Fable 5 (88,0%), ma rappresenta la più credibile alternativa open-weight occidentale per il coding agentico.
Per un contesto più ampio sul mercato dell'elettronica di consumo, si veda l'articolo su Foxconn e l'iPhone 18 Pro. Per approfondire l'architettura Mixture-of-Experts, si può consultare la pagina Wikipedia.