Il 20 agosto un modello chiamato Ox Alpha � comparso su OpenRouter e OpenCode senza che alcun laboratorio ne rivendicasse la paternit�. Chi lo ha pubblicato dichiara una capacit� di elaborazione fino a 100.000 miliardi di token al giorno e ne offre l'uso gratuito per una settimana. � la cifra ad avere acceso la discussione, perch� i laboratori capaci di sostenere quel volume sono pochissimi.

La presentazione lo descrive come un reasoning model pensato per la scrittura di codice, il lavoro agentico prolungato e i carichi di produzione reali: ingegneria del software di lungo orizzonte, ragionamento complesso e flussi di lavoro che uniscono il testo al contesto visivo. I limiti dichiarati sono una finestra di contesto da 1 milione di token e un tetto di 131.072 token in uscita, con input di testo, immagini e video. L'annuncio lo qualifica come modello di frontiera.

Pochi operatori al mondo dichiarano numeri simili, e Ox Alpha li mette a disposizione pubblicamente mentre non fa pagare nulla. Se si prova a tradurre quella capacit� in hardware, partendo dai regimi di produzione plausibili per un modello di quella scala, si arriva a qualcosa come circa 580.000 GPU necessarie per sostenere 100.000 miliardi di token quotidiani. La conclusione di quel calcolo � che o la cifra non si riferisce ai token in uscita, oppure i conti non tornano.