Vai al contenuto
Offerte

Reflection Beam, il modello open da 501 miliardi che consuma meno

In questo articolo Indice dei contenuti 2 sezioni

Il laboratorio statunitense Reflection, sostenuto da NVIDIA, ha presentato Beam, un modello open weight da 501 miliardi di parametri costruito con un obiettivo preciso: fare di più consumando meno. È un segnale chiaro, perché fino a oggi sul fronte dei modelli aperti ed efficienti a dettare il passo erano soprattutto i cinesi DeepSeek e Zhipu (Z.ai). L’annuncio è arrivato il 5 ottobre 2026 e i pesi completi verranno rilasciati entro il mese. Secondo l’azienda Beam risulta da 3 a 4 volte più efficiente di GLM 5.2 e oltre 4 volte più efficiente dei principali modelli aperti occidentali, con progressi evidenti nella programmazione e nei compiti agentici. Il tutto addestrato completamente da zero.

Alla base c’è un’architettura Mixture of Experts di tipo sparso. Dei 501 miliardi di parametri totali solo 23 miliardi lavorano davvero in ogni momento. Il paragone più semplice è quello di una grande cucina piena di chef specializzati, dove però vengono chiamati ai fornelli soltanto quelli che servono. Per preparare un soufflé il sistema attiva gli esperti di dolci e lascia tranquilli quelli bravi con la cucina orientale.

Gli accorgimenti tecnici dietro l’efficienza di Beam

Un modello di intelligenza artificiale è composto da una serie di blocchi transformer, ognuno con due elementi chiave. Il livello di attenzione osserva come le parole di una frase si collegano tra loro. Davanti alla frase “Parigi è la capitale della Francia” collega “capitale” a “Francia” e individua Parigi come risposta, ma senza sapere davvero cosa siano. Si limita a salvare queste annotazioni nella cosiddetta cache KV, che cresce insieme al contesto. La rete Feed Forward invece custodisce la conoscenza del modello sotto forma di pesi e ricostruisce il significato di ogni parola, un po’ come aprire un’enciclopedia dei Paesi quando incontra la parola Francia.

Per evitare che la cache diventi ingestibile e per guadagnare efficienza, Beam ricorre a diversi accorgimenti. Il primo è una distribuzione uniforme del lavoro tra gli esperti, così nessuno resta sovraccarico o inattivo troppo a lungo. Secondo Reflection l’esperto più impegnato era appena 1,04 volte più occupato della media, una ripartizione quasi perfetta. C’è poi un ridimensionamento progressivo legato alla profondità della rete. Man mano che i token attraversano decine di livelli i risultati dei singoli sottolivelli si sommano e nei modelli molto grandi questo accumulo provoca distorsioni e instabilità. Beam attenua gradualmente il peso di ciascun contributo così che l’informazione scorra in modo pulito e prevedibile.

Completano il quadro altre tre soluzioni. Con SandwichNorm i valori vengono normalizzati sia in entrata sia in uscita da ogni sottolivello, impedendo che le rappresentazioni interne prendano derive estreme. Il gating dell’attenzione funziona come una manopola del volume che decide quanto del risultato usare davvero, rendendo il sistema più selettivo e stabile. Infine, pur lavorando con numeri a precisione ridotta per risparmiare memoria e tempo, le somme più delicate vengono eseguite a piena precisione a 32 bit, così i piccoli errori di arrotondamento non si accumulano fino a compromettere l’addestramento.

Un addestramento su scala gigantesca

Dopo il preaddestramento si passa all’apprendimento per rinforzo, la fase in cui il modello interagisce con una moltitudine di agenti in ambienti isolati per imparare competenze pratiche come la programmazione. Reflection ha introdotto una penalità sulla lunghezza delle risposte che premia le soluzioni corrette e scoraggia i token superflui. All’inizio le prestazioni sono migliorate mentre le risposte si accorciavano, segno che il modello stava imparando a risolvere i compiti ragionando meno. Più avanti, con capacità agentiche più solide, le risposte sono tornate ad allungarsi ma quei token in più hanno portato ulteriori miglioramenti.

I numeri sono impressionanti. In 4 settimane sono state impiegate 1,3 miliardi di sandbox distribuite su oltre 10.500 GPU NVIDIA GB300, pari a circa 46,4 milioni al giorno. L’addestramento ha coperto 1 milione di ambienti tra codice, attività agentiche e discipline scientifiche, con 100 milioni di rollout. Per fare un confronto, l’unità DSec di DeepSeek gestisce 3 milioni di sandbox e per raggiungere la stessa scala ne servirebbero circa 16, con 656 GB300 ciascuna.

Di solito nell’apprendimento per rinforzo il processo si ferma ogni volta che i pesi vengono aggiornati. Reflection ha invece separato le due attività, con alcuni nodi che generano risposte senza sosta e altri che aggiornano in parallelo il modello. Questo crea un disallineamento tra i dati prodotti e la versione corrente del modello, ma Beam compensa il rumore proprio grazie a SandwichNorm, gating dell’attenzione e ridimensionamento progressivo, accelerando notevolmente i tempi. Il risultato è che Beam eguaglia in larga parte le prestazioni di GLM 5.2 richiedendo da 3 a 4 volte meno calcolo in fase di inferenza, mentre resta ancora dietro a Qwen 3.8 Max pur dimostrandosi estremamente solido per le sue dimensioni.

Fonte: TecnoAndroid

Condividi:
78 Condivisioni