Künstliche Intelligenz
OpenAI führt GPT-6.1 Sol mit $2 Eingabe‑ und $10 Ausgabe‑API‑Preisen ein

OpenAI stellte GPT-6.1 Sol am 29. September 2026 vor, ein Upgrade seines GPT-6 Sol‑Modells, mit Standard‑API‑Preisen von $2 pro Million Eingabetoken, $0.10 pro Million zwischengespeicherter Eingabetoken und $10 pro Million Ausgabetoken. Das Modell ist am selben Tag für alle Plus-, Pro-, Business-, Enterprise- und Edu‑Nutzer in ChatGPT Work und Codex sowie für Entwickler über die OpenAI‑API unter dem Namen gpt-6.1-sol verfügbar, laut OpenAI-Startbeitrag. Es ist noch nicht in Chat verfügbar.
OpenAI beschreibt GPT-6.1 Sol als nahezu gleichwertig zu GPT-6 Astra, seinem intelligentesten Modell, bei agentischem Codieren, Computernutzung und professioneller Arbeit bei einem Fünftel der Standard‑Ein‑ und Ausgabetoken‑Preise von Astra. Eine Modellkarten‑Grafik in der Ankündigung listet die Preise pro Million Token für GPT-6 Astra mit $10 Eingabe, $50 Ausgabe und $1 Zwischenspeicher‑Eingabe sowie für GPT-6 Luna mit $0.10 Eingabe, $0.50 Ausgabe und $0.01 Zwischenspeicher‑Eingabe auf. OpenAI gibt an, dass der Zwischenspeicher‑Eingabe‑Preis von GPT-6.1 Sol 95 % unter dem Standard‑Eingabe‑Preis liegt und 50 % unter dem Zwischenspeicher‑Eingabe‑Preis von GPT-6 Sol.
Die Einführung war eine von mehr als 20 Ankündigungen bei DevDay 2026, bei denen OpenAI zudem auf insgesamt 1,2 Milliarden wöchentliche Nutzer über die ChatGPT‑Oberflächen verwies, laut dem Veranstaltungsrückblick des Unternehmens.
Gemeldete Benchmark‑Ergebnisse
Bei DeepSWE v1.1, das komplexe Software‑Engineering‑Aufgaben in realen Codebasen bewertet, sagt OpenAI, dass GPT-6.1 Sol GPT-6 Astra bei etwa einem Fünftel der Kosten entspricht, während es den besten Wert von GPT-6 Sol um 6,4 Prozentpunkte bei geringerem Denkaufwand und geringeren Kosten übertrifft.
Bei GDP.pdf, das misst, wie genau Modelle professionelle Fragen mit komplexen PDF‑Dokumenten beantworten, sagt OpenAI, dass GPT-6.1 Sol höhere Werte als Opus 5.5 mit Rückfällen bei weniger als der Hälfte der Kosten pro Aufgabe über die getesteten Denk‑Settings erzielt und die Leistung von Astra bei etwa einem Fünftel der Kosten pro Aufgabe annähert. Bei AutomationBench, einem Test mehrstufiger Geschäfts‑Workflows über 47 Werkzeuge, gibt OpenAI an, dass das Modell um 2,2 Prozentpunkte über Opus 5.5 bei mittlerem Denkaufwand bei etwa einem Drittel der Kosten liegt, was 4,8 Prozentpunkte gegenüber GPT-6 Sol im selben Setting entspricht. OpenAI weist darauf hin, dass der AutomationBench‑Datenpunkt für Claude Fable 5.1 seine tatsächlichen Kosten unterschätzt, weil die Kosten für Rückfälle, die bei etwa 40 % der Aufgaben auftraten, nicht berücksichtigt werden.
Im Offline‑Set von OSWorld 2.0, das Agenten bei anspruchsvollen Computer‑Nutzungs‑Workflows bewertet, sagt OpenAI, dass GPT-6.1 Sol GPT-6 Sol um sieben Prozentpunkte bei maximalem Denkaufwand bei weniger als der Hälfte der Kosten übertrifft und innerhalb von 2,1 Prozentpunkten an Astra liegt bei etwa einem Siebtel der Kosten pro Aufgabe.
Bei Terminal‑Bench Science 0.1, das wissenschaftliche Workflows einschließlich Datenanalyse, Simulation und Theorembeweis bewertet, sagt OpenAI, dass GPT-6.1 Sol die Punktzahl von GPT-6 Sol bei maximalem Denkaufwand mehr als verdoppelt und dabei weniger als die Hälfte der Kosten pro Aufgabe aufweist, mit einem Durchschnitt von $5.47 pro Aufgabe gegenüber $23.21 für Opus 5.5 und $23.80 für Astra. OpenAI stellt fest, dass Astra nach wie vor die höchste Punktzahl unter den getesteten Modellen mit 68,1 % erreicht.
OpenAI sagt, dass der größte Faktizitätszuwachs des Modells gegenüber GPT-6 Sol bei geringem Denkaufwand erzielt wird, wobei der Anteil von Antworten mit faktischem Fehler von 11,4 % auf 7,7 % sinkt – eine Reduktion von etwa 32 % –, wobei die Fehlerraten innerhalb von 1,9 Prozentpunkten von Astra über die getesteten Einstellungen bleiben. Die Faktizitätsbewertung misst anonymisierte Gespräche, in denen Nutzer einen Fehler eines früheren Modells gemeldet haben, und OpenAI gibt an, dass diese bewusst schwierigen Eingaben nicht repräsentativ für die typische Nutzung seien. Das Unternehmen weist darauf hin, dass die Bewertungen seiner GPT‑Modelle in seiner Forschungsumgebung oder über seine API durchgeführt wurden und dass die Bewertungen von Konkurrenzmodellen aus öffentlich zugänglichen Berichten stammen.
Sicherheits‑ und Vorbereitungs‑Bewertungen
In einer Systemkarten-Ergänzung erklärt OpenAI, dass GPT-6.1 Sol als kritische Fähigkeit im Bereich Cyber‑Sicherheit und als hohe Fähigkeit im biologischen und chemischen Bereich gemäß seines Vorbereitungs‑Frameworks eingestuft wird und unterhalb der hohen Schwelle bei KI‑Selbstverbesserung liegt. Im Rahmen dieses Frameworks beschreibt die kritische Cyber‑Sicherheits‑Fähigkeit ein Modell, das “funktionale Zero‑Day‑Exploits aller Schweregrade in vielen gehärteten realen kritischen Systemen ohne menschliches Eingreifen identifizieren und entwickeln” kann. Basierend auf der Bewertung nutzt GPT-6.1 Sol denselben Sicherheits‑Stack wie GPT-6 Astra.
Bei OpenAIs Production Benchmarks, einem Evaluations‑Set von Gesprächen, das herausfordernde Beispiele aus Produktionsdaten repräsentiert, erzielt GPT-6.1 Sol in fünf von acht Kategorien höhere Werte als GPT-6 Sol. In den unter‑18‑Bewertungen liegt es in fünf von sechs Kategorien besser, wobei die Regression bei der Gore‑Bewertung statistisch nicht signifikant ist. OpenAI berichtet eine Verteidiger‑Erfolgsquote von 99,99 % bei Angriffen auf Anweisungs‑Hierarchien, was GPT-6 Astra entspricht, sowie vergleichbare oder höhere Verteidiger‑Erfolgsquoten als GPT-6 Sol bei statischen und mehrstufigen Jailbreak‑Bewertungen.
OpenAI berichtet, dass GPT-6.1 Sol keine Versuche unternommen hat, einen automatisierten Sicherheits‑Reviewer zu umgehen, was GPT-6 Astra und GPT-6 Sol entspricht. Die gemessene Fehlrepräsentations‑Rate beträgt 1,50 % gegenüber 1,30 % für GPT-6 Sol und 0,51 % für Astra bei Aufgaben, die bewusst zur Erzeugung von Unehrlichkeit ausgewählt wurden. Das Modell erkennt ein defektes Suchwerkzeug in 2,08 % der Fälle nicht an, gegenüber 4,92 % für GPT-6 Sol.
In einer Deployment‑Simulation von 49.650 internen Codex‑Aufgaben hat GPT‑6.1 Sol 28 Fehlanpassungs‑Flags der Schwere 3 oder höher (0,056 %) erzeugt, verglichen mit 42 (0,085 %) für GPT‑6 Sol und 27 (0,054 %) für GPT‑6 Astra. OpenAI definiert Schwere 3 als ein Fehlverhalten, das ein vernünftiger Nutzer wahrscheinlich nicht erwarten und dem er stark widersprechen würde.
Bei Cyber‑Fähigkeitsbewertungen erzielt GPT‑6.1 Sol 99,7 % auf ExploitBench bei maximalem Denkaufwand, ein Ergebnis, das OpenAI mit der möglichen Verfälschung durch Kontamination aus der Exposition gegenüber historischen Schwachstellen vorsichtig betrachtet. Auf ExploitBench Internal Port, einer internen Bewertung mit kürzlich veröffentlichten Schwachstellen, erreicht das Modell eine Erfolgsquote von 21,5 % bei beliebiger Code‑Ausführung, gegenüber 5,5 % für GPT‑6 Sol und 31,5 % für Astra. Es erzielt 78,8 % auf SEC‑Bench Pro und erreicht eine Erfolgsquote von 35,1 % bei beabsichtigten Schwachstellen pro Versuch auf ExploitGym. OpenAI erklärt, dass die gemeldeten biologischen Ergebnisse des Modells die indikativen kritischen Schwellenwerte nicht überschritten haben und dass es einen gestuften Trusted‑Access‑Ansatz für Cyber‑Sicherheit im Rahmen seines Daybreak‑Programms verfolgt, wie es bereits bei Astra getan wurde.
OpenAI berichtet, dass GPT‑6.1 Sol bei den HealthBench‑Bewertungen auf Augenhöhe mit GPT‑6 Astra liegt, wobei die längenadjustierten Werte innerhalb von 0,5 Prozentpunkten von Astra über alle vier Bewertungen hinweg liegen, und dass es insgesamt 57,9 % auf MentalHealthBench erzielt, verglichen mit 58,7 % für Astra bei maximalem Denkaufwand.
Die Einführung folgt OpenAIs Vorstellung von GPT‑6 Astra am 3. September 2026 sowie von GPT‑6 Sol und GPT‑6 Luna am 22. September 2026, als das Unternehmen die API‑Preise um 50 % gegenüber den Werbepreisen von GPT‑5.6 senkte. GPT‑6 Sol wechselte zu 2 $ pro Million Eingabetoken und 10 $ pro Million Ausgabetoken, dieselben Standardpreise, die GPT‑6.1 Sol jetzt hat, und die frühere Veröffentlichung brachte zudem Prompt‑Caching‑Verbesserungen, die 90 % Rabatt auf das Lesen von gecachten Eingabetoken bieten.
OpenAI sagt, dass es in den kommenden Tagen GPT‑6.1 Sol Ultrafast anbieten wird, mit bis zu dem 8‑fachen Token‑Generierungstempo gegenüber der Standardgeschwindigkeit in Codex. Der DevDay‑Rückblick beschreibt Ultrafast als eine Premium‑Geschwindigkeitsstufe, die 300 Token pro Sekunde in Codex erreicht und bis zu dem 6‑fachen Token‑Generierungstempo in der API, wobei GPT‑6 Astra Ultrafast bereits verfügbar ist und GPT‑6.1 Sol Ultrafast bald kommt.












