Presentazione di GPT‑6.1 Sol: intelligenza Near‑Astra a un quinto del prezzo
Near‑Astra intelligence a un quinto del prezzo
Stiamo introducendo GPT‑6.1 Sol, un aggiornamento di GPT‑6 Sol che si avvicina quasi alle capacità di GPT‑6 Astra in ambiti come la programmazione agentica, l’uso del computer e il lavoro professionale, ma a una frazione dei costi di token standard. Il prezzo di input memorizzato è di appena $0,10 per milione di token, cioè il 95 % in meno rispetto al prezzo di input normale e il 50 % in meno rispetto a quello di GPT‑6 Sol, lasciando più margine agli sviluppatori per costruire e gestire agenti capaci che riutilizzano il contesto tra le richieste.
Un Sol più capace in tutti i compiti
GPT‑6.1 Sol propone un nuovo equilibrio tra capacità e costo per le attività quotidiane più importanti. Offre miglioramenti significativi rispetto a GPT‑6 Sol su compiti professionali complessi, dalla scrittura e debug di codice alla comprensione di documenti e all’esecuzione di workflow aziendali multi‑passo. In diverse valutazioni, si avvicina alle performance di GPT‑6 Astra pur mantenendo costi notevolmente inferiori.
Coding
Nel benchmark DeepSWE v1.1, che valuta compiti di ingegneria del software in codebase reali, GPT‑6.1 Sol eguaglia GPT‑6 Astra a circa un quinto del costo, superando il punteggio migliore di GPT‑6 Sol di 6,4 punti percentuali con uno sforzo di ragionamento e un costo inferiori.
Lavoro professionale
Nel test GDP.pdf, che misura l’accuratezza nel rispondere a domande professionali usando PDF complessi (tabelle, grafici, diagrammi e dettagli in stampa fine), GPT‑6.1 Sol ottiene un punteggio superiore a Opus 5.5 con fallback a meno della metà del costo per compito su tutte le impostazioni di ragionamento testate. Inoltre, si avvicina alle prestazioni all’avanguardia di GPT‑6 Astra a circa un quinto del costo per compito.
Nel benchmark AutomationBench, che verifica se gli agenti completano correttamente workflow aziendali a più fasi, GPT‑6.1 Sol supera Opus 5.5 di 2,2 punti percentuali con uno sforzo di ragionamento medio, a circa un terzo del costo. Lo stesso punteggio è superiore di 4,8 punti rispetto a GPT‑6 Sol nella stessa configurazione.
- AutomationBench 1.0.6 testa agenti AI su workflow end‑to‑end usando 47 tool nei settori vendite, marketing, operazioni, supporto, finanza e risorse umane.
- Il dato per Claude Fable 5.1 sottostima il costo reale, poiché non include i costi dei fallback, che si verificano in circa il 40 % dei compiti.
Uso del computer
GPT‑6.1 Sol registra progressi notevoli nei compiti che richiedono l’interazione con applicazioni informatiche. Su OSWorld 2.0 (set offline), che valuta agenti su workflow complessi di uso del computer, GPT‑6.1 Sol supera GPT‑6 Sol di sette punti percentuali con lo sforzo di ragionamento massimo, a meno della metà del costo. Il modello si colloca a soli 2,1 punti percentuali dallo score di Astra con lo stesso sforzo, a circa un settimo del costo per compito.
- OSWorld 2.0 propone workflow a lungo orizzonte che spaziano da attività quotidiane a compiti professionali.
- Il risultato riportato è la ricompensa parziale sul set offline della release v2026.08.08.
Ricerca scientifica
Nel benchmark Terminal‑Bench Science 0.1, che valuta workflow scientifici come analisi dei dati, simulazioni e dimostrazioni di teoremi, GPT‑6.1 Sol più che raddoppia il punteggio di GPT‑6 Sol con lo sforzo di ragionamento massimo, a meno della metà del costo per compito. Con lo sforzo massimo, il costo medio per compito è di $5,47, contro $23,21 per Opus 5.5 e $23,80 per Astra, offrendo capacità scientifiche sostanziali a oltre il 75 % in meno rispetto a entrambi i modelli.
GPT‑6 Astra resta il modello con il punteggio più alto, 68,1 %, ed è consigliato per i compiti scientifici più impegnativi.
Fattualità
GPT‑6.1 Sol migliora anche l’accuratezza fattuale su prompt difficili. La più grande riduzione degli errori rispetto a GPT‑6 Sol avviene a basso sforzo di ragionamento, dove la percentuale di risposte contenenti un errore fattuale scende dall’11,4 % al 7,7 % (riduzione del 32 %). Su tutte le impostazioni testate, il tasso di errore rimane entro 1,9 punti percentuali da quello di GPT‑6 Astra, a meno di un quinto del costo per compito.
Questa valutazione misura la quota di risposte con almeno un errore fattuale su conversazioni de‑identificate in cui gli utenti avevano segnalato un errore del modello precedente. Tali prompt deliberatamente difficili non rappresentano l’uso tipico.
Distribuire GPT‑6.1 Sol in modo sicuro
GPT‑6.1 Sol mostra miglioramenti sostanziali rispetto a GPT‑6 Sol nelle valutazioni di allineamento, avvicinandosi a GPT‑6 Astra. Il nuovo modello è più trasparente sui propri limiti e più affidabile nel rispettare l’intento dell’utente e le restrizioni di sicurezza. In valutazioni complesse, presenta tassi di fallimento inferiori rispetto a GPT‑6 Sol nella trasparenza su strumenti di ricerca non funzionanti, nel rispetto di restrizioni esplicite e nell’evitare risultati non autorizzati durante compiti agentici. Non sono state osservate tentativi di aggirare un revisore automatico di sicurezza, in linea con GPT‑6 Astra e GPT‑6 Sol. I dettagli completi sono disponibili nella scheda di sistema aggiuntiva di GPT‑6.1 Sol.
Le valutazioni di seguito sono progettate per testare situazioni sfidanti e non misurano i tassi di fallimento nell’uso tipico.
Prezzi e disponibilità
GPT‑6.1 Sol è disponibile a partire da oggi per tutti gli utenti Plus, Pro, Business, Enterprise ed Edu di ChatGPT Work e Codex. Al momento non è ancora disponibile nella versione