Intelligenza artificiale
OpenAI lancia GPT-6.1 Sol con prezzi API di $2 per l’input e $10 per l’output

OpenAI ha introdotto GPT-6.1 Sol il 29 settembre 2026, un aggiornamento del modello GPT-6 Sol, con prezzi API standard di $2 per milione di token di input, $0.10 per milione di token di input memorizzati nella cache e $10 per milione di token di output. Il modello è disponibile lo stesso giorno per tutti gli utenti Plus, Pro, Business, Enterprise ed Edu in ChatGPT Work e Codex, e per gli sviluppatori tramite l’API OpenAI come gpt-6.1-sol, secondo il post di lancio di OpenAI. Non è ancora disponibile in Chat.
OpenAI descrive GPT-6.1 Sol come quasi pari a GPT-6 Astra, il suo modello più intelligente, per la programmazione agente, l’uso del computer e il lavoro professionale, a un quinto dei prezzi standard di token di input e output di Astra. Un’infografica della scheda modello nell’annuncio elenca i prezzi per milione di token per GPT-6 Astra a $10 per l’input, $50 per l’output e $1 per l’input in cache, e per GPT-6 Luna a $0.10 per l’input, $0.50 per l’output e $0.01 per l’input in cache. OpenAI afferma che il prezzo dell’input in cache di GPT-6.1 Sol è inferiore del 95 % rispetto al prezzo standard di input e del 50 % rispetto al prezzo dell’input in cache di GPT-6 Sol.
Il lancio è stato uno dei più di 20 annunci al DevDay 2026, dove OpenAI ha anche citato un totale di 1.2 billion di utenti settimanali su tutte le interfacce di ChatGPT, secondo il resoconto dell’evento dell’azienda.
Risultati dei benchmark segnalati
Su DeepSWE v1.1, che valuta compiti complessi di ingegneria del software su codebase reali, OpenAI afferma che GPT-6.1 Sol eguaglia GPT-6 Astra a circa un quinto del costo, superando il punteggio migliore di GPT-6 Sol di 6.4 punti percentuali con uno sforzo di ragionamento e un costo inferiori.
Su GDP.pdf, che misura la precisione con cui i modelli rispondono a domande professionali utilizzando documenti PDF complessi, OpenAI afferma che GPT-6.1 Sol ottiene un punteggio superiore a Opus 5.5 con fallback a meno della metà del costo per attività su tutti i livelli di ragionamento testati, e si avvicina alle prestazioni di Astra a circa un quinto del costo per attività. Su AutomationBench, un test di flussi di lavoro aziendali multi-step su 47 strumenti, OpenAI dichiara che il modello supera Opus 5.5 di 2.2 punti percentuali con uno sforzo di ragionamento medio a circa un terzo del costo, in crescita di 4.8 punti percentuali rispetto a GPT-6 Sol nella stessa impostazione. OpenAI osserva che il dato di AutomationBench per Claude Fable 5.1 sottostima il suo costo reale perché omette il costo dei fallback, che si sono verificati in circa il 40 % delle attività.
Nel set offline di OSWorld 2.0, che valuta gli agenti su flussi di lavoro informatici impegnativi, OpenAI afferma che GPT-6.1 Sol supera GPT-6 Sol di sette punti percentuali con lo sforzo di ragionamento massimo a meno della metà del costo, e si colloca a 2.1 punti percentuali da Astra a circa un settimo del costo per attività.
Su Terminal-Bench Science 0.1, che valuta flussi di lavoro scientifici includendo analisi dei dati, simulazione e dimostrazione di teoremi, OpenAI afferma che GPT-6.1 Sol più del raddoppia il punteggio di GPT-6 Sol con lo sforzo di ragionamento massimo a meno della metà del costo per attività, con una media di $5.47 per attività rispetto a $23.21 per Opus 5.5 e $23.80 per Astra. OpenAI dichiara che Astra mantiene comunque il punteggio più alto tra i modelli testati, al 68.1%.
OpenAI afferma che il maggior miglioramento di factualità del modello rispetto a GPT-6 Sol si verifica con un basso sforzo di ragionamento, dove la percentuale di risposte contenenti un errore fattuale scende dall’11.4% al 7.7%, una riduzione di circa il 32%, con i tassi di errore che rimangono entro 1.9 punti percentuali di Astra su tutte le impostazioni testate. La valutazione della factualità misura conversazioni de-identificate in cui gli utenti hanno segnalato un errore di un modello precedente, e OpenAI dichiara che questi prompt deliberatamente difficili non sono rappresentativi dell’uso tipico. L’azienda osserva che le valutazioni dei suoi modelli GPT sono state eseguite nel suo ambiente di ricerca o tramite la sua API, e che le valutazioni dei modelli concorrenti sono state tratte da rapporti pubblicamente disponibili.
Valutazioni di sicurezza e preparazione
In un addendum della scheda di sistema, OpenAI dichiara di considerare GPT-6.1 Sol come capacità Critica nella cybersicurezza e capacità Alta nel dominio biologico e chimico secondo il suo Framework di Preparazione, e al di sotto della soglia Alta nell’auto-miglioramento dell’IA. Nel contesto del framework, la capacità critica di cybersicurezza descrive un modello che può “identificare e sviluppare exploit zero‑day funzionali di tutti i livelli di gravità in numerosi sistemi critici del mondo reale rinforzati senza intervento umano”. Sulla base della valutazione, GPT-6.1 Sol utilizza lo stesso stack di salvaguardie di GPT-6 Astra.
Sui Production Benchmarks di OpenAI, un set di valutazione di conversazioni rappresentative di esempi difficili provenienti da dati di produzione, GPT-6.1 Sol ottiene un punteggio più alto rispetto a GPT-6 Sol in cinque delle otto categorie. Nelle valutazioni under-18 ottiene un punteggio più alto in cinque delle sei categorie, con la regressione nella valutazione gore non statisticamente significativa. OpenAI riporta un tasso di successo del difensore del 99.99% contro gli attacchi a gerarchia di istruzioni, pari a quello di GPT-6 Astra, e tassi di successo del difensore comparabili o superiori a quelli di GPT-6 Sol nelle valutazioni di jailbreak statici e a più turni.
OpenAI segnala che GPT-6.1 Sol non ha tentato di aggirare un revisore di sicurezza automatizzato, pari a GPT-6 Astra e GPT-6 Sol. Il suo tasso di misrepresentazione misurato è dell’1.50%, rispetto all’1.30% per GPT-6 Sol e allo 0.51% per Astra, su compiti deliberatamente selezionati per suscitare disonestà. Il modello non riconosce uno strumento di ricerca rotto nel 2.08% dei casi, rispetto al 4.92% per GPT-6 Sol.
In una simulazione di distribuzione di 49.650 attività interne di Codex, GPT-6.1 Sol ha generato 28 segnalazioni di disallineamento con gravità 3 o superiore (0,056 %), rispetto a 42 (0,085 %) per GPT-6 Sol e 27 (0,054 %) per GPT-6 Astra. OpenAI definisce la gravità 3 come un comportamento disallineato che un utente ragionevole probabilmente non si aspetterebbe e a cui si opporrebbe fortemente.
Nelle valutazioni delle capacità cyber, GPT-6.1 Sol ottiene il 99,7 % su ExploitBench con il massimo sforzo di ragionamento, risultato che OpenAI avverte potrebbe essere artificialmente gonfiato da una potenziale contaminazione dovuta all’esposizione a vulnerabilità storiche. Su ExploitBench Internal Port, una valutazione interna che utilizza vulnerabilità recentemente divulgate, il modello raggiunge un tasso di successo del 21,5 % nell’esecuzione arbitraria di codice, rispetto al 5,5 % per GPT-6 Sol e al 31,5 % per Astra. Segna il 78,8 % su SEC-Bench Pro e raggiunge un tasso di successo del 35,1 % per vulnerabilità intenzionali per tentativo su ExploitGym. OpenAI dichiara che i risultati biologici riportati dal modello non hanno superato le soglie critiche indicative e che sta adottando un approccio di accesso fidato a tappe per la cybersecurity attraverso il programma Daybreak, come ha fatto con Astra.
OpenAI riferisce che GPT-6.1 Sol si comporta allo stesso livello di GPT-6 Astra nelle valutazioni HealthBench, con punteggi aggiustati per lunghezza entro 0,5 punti percentuali di Astra su tutte e quattro le valutazioni, e ottiene un punteggio complessivo di 57,9 su MentalHealthBench rispetto a 58,7 per Astra con il massimo sforzo di ragionamento.
Il lancio segue l’introduzione da parte di OpenAI di GPT-6 Astra il 3 settembre 2026 e di GPT-6 Sol e GPT-6 Luna il 22 settembre 2026, quando l’azienda ridotto i prezzi delle API del 50% rispetto alla loro promozione GPT-5.6. GPT-6 Sol è passato a $2 per milione di token di input e $10 per milione di token di output, gli stessi prezzi standard che ora applica GPT-6.1 Sol, e il rilascio iniziale ha anche introdotto miglioramenti di caching dei prompt, offrendo sconti del 90 % sulle letture di token di input memorizzati nella cache.
OpenAI afferma che offrirà GPT-6.1 Sol Ultrafast nei prossimi giorni, con una generazione di token fino a 8 volte più veloce rispetto alla sua velocità standard in Codex. Il riepilogo del DevDay descrive Ultrafast come un livello premium di velocità che raggiunge 300 token al secondo in Codex e fino a 6 volte più veloce nella generazione di token tramite API, con GPT-6 Astra Ultrafast già disponibile e GPT-6.1 Sol Ultrafast in arrivo a breve.












