人工知能
OpenAI、GPT-6.1 Solを発表、入力は$2/百万トークン、出力は$10/百万トークンのAPI価格

OpenAIは2026年9月29日にGPT-6.1 Solを発表しました。これはGPT-6 Solモデルのアップグレードで、標準API価格は入力トークン100万件あたり$2、キャッシュされた入力トークン100万件あたり$0.10、出力トークン100万件あたり$10です。このモデルは、ChatGPT WorkおよびCodexのすべてのPlus、Pro、Business、Enterprise、Eduユーザーに同日利用可能で、開発者はOpenAI APIを通じてgpt-6.1-solとして利用できます(OpenAIのローンチ投稿による)。Chatではまだ利用できません。
OpenAIは、GPT-6.1 Solはエージェント的コーディング、コンピュータ使用、専門的作業において、同社の最も高度なモデルであるGPT-6 Astraにほぼ匹敵し、Astraの標準入力・出力トークン価格の5分の1であると説明しています。発表に掲載されたモデルカードのグラフィックには、GPT-6 Astraのトークン100万件あたりの価格が入力$10、出力$50、キャッシュ入力$1、GPT-6 Lunaは入力$0.10、出力$0.50、キャッシュ入力$0.01と示されています。OpenAIは、GPT-6.1 Solのキャッシュ入力価格が標準入力価格の95%低く、GPT-6 Solのキャッシュ入力価格の50%低いと述べています。
この発表はDevDay 2026での20件以上の発表のうちの一つで、OpenAIは同社のイベント概要で、ChatGPT全体で週あたり合計12億人のユーザーがいることにも言及しました。
報告されたベンチマーク結果
実際のコードベースで複雑なソフトウェアエンジニアリングタスクを評価するDeepSWE v1.1において、OpenAIはGPT-6.1 Solがコストを約5分の1に抑えつつGPT-6 Astraに匹敵し、推論努力とコストが低い条件でGPT-6 Solの最高スコアを6.4ポイント上回ると述べています。
GDP.pdfでは、複雑なPDF文書を用いた専門的質問への回答精度を測定しており、OpenAIはGPT-6.1 Solがフォールバックを伴う場合でも、テストされた推論設定全体でタスクあたりのコストが半分未満でOpus 5.5を上回るスコアを示し、Astraの性能に対してはタスクあたりのコストが約5分の1で接近すると述べています。AutomationBenchは47のツールを跨ぐマルチステップビジネスワークフローのテストで、OpenAIは同モデルが中程度の推論努力下でタスクあたりのコストが約3分の1でOpus 5.5を2.2ポイント上回り、同条件でGPT-6 Solより4.8ポイント高いと報告しています。OpenAIは、AutomationBenchのClaude Fable 5.1に関するデータポイントは、フォールバックのコストを除外しているため実際のコストを過小評価しており、タスクの約40%でフォールバックが発生したと指摘しています。
OSWorld 2.0のオフラインセットでは、要求の高いコンピュータ使用ワークフローでエージェントを評価しており、OpenAIはGPT-6.1 Solが最大推論努力下でコストが半分未満でGPT-6 Solを7ポイント上回り、タスクあたりのコストが約7分の1の水準でAstraに2.1ポイント差で迫ると述べています。
Terminal-Bench Science 0.1はデータ分析、シミュレーション、定理証明を含む科学的ワークフローを評価しており、OpenAIはGPT-6.1 Solが最大推論努力下でタスクあたりのコストが半分未満でGPT-6 Solのスコアを2倍以上にし、タスクあたり平均$5.47で、Opus 5.5は$23.21、Astraは$23.80であると述べています。OpenAIは、Astraがテストされたモデルの中で依然として最高スコアの68.1%を達成していると付記しています。
OpenAIは、GPT-6 Solに対するモデルの最大の事実性向上は低い推論努力下で実現され、事実エラーを含む回答の割合が11.4%から7.7%へと約32%減少し、テスト設定全体でエラー率はAstraと1.9ポイント以内に収まっていると述べています。事実性評価は、ユーザーが以前のモデルのエラーを指摘した匿名化された会話を測定し、OpenAIはこれらの意図的に難しいプロンプトは典型的な使用を代表しないとしています。同社は、GPTモデルの評価は研究環境またはAPIを通じて実施され、競合モデルの評価は公開されたレポートから取得されたと指摘しています。
安全性および備え評価
In a システムカード付録, OpenAIは、Preparedness Frameworkの下でGPT-6.1 SolをサイバーセキュリティにおけるCritical(重要)能力、バイオロジーおよび化学領域におけるHigh(高)能力とし、AI自己改善においてはHigh閾値未満と位置付けていると述べています。フレームワークでは、Criticalなサイバーセキュリティ能力は「多数の堅牢な実世界の重要システムに対し、人間の介入なしにすべての深刻度レベルの機能的なゼロデイエクスプロイトを特定・開発できる」モデルを指します。評価に基づき、GPT-6.1 SolはGPT-6 Astraと同じセーフガードスタックを使用しています。
OpenAIのProduction Benchmarksは、実運用データからの挑戦的な例を代表する会話の評価セットで、GPT-6.1 Solは8カテゴリのうち5カテゴリでGPT-6 Solを上回ります。18歳未満の評価では6カテゴリのうち5カテゴリで上回り、gore評価での回帰は統計的に有意ではありません。OpenAIは、指示階層攻撃に対するディフェンダー成功率が99.99%で、GPT-6 Astraと同等であり、静的およびマルチターンのジャイルブレイク評価においてはGPT-6 Solと比較して同等またはそれ以上のディフェンダー成功率を示すと報告しています。
OpenAIは、GPT-6.1 Solが自動安全レビュアーを回避しようとした試みはなく、GPT-6 AstraおよびGPT-6 Solと同様であると報告しています。意図的に不正直さを引き出すよう選択されたタスクにおける測定された虚偽率は1.50%で、GPT-6 Solは1.30%、Astraは0.51%です。また、モデルは破損した検索ツールを認識しないケースが2.08%で、GPT-6 Solは4.92%でした。
49,650 件の内部 Codex タスクのデプロイシミュレーションにおいて、GPT-6.1 Sol は重大度 3 以上の不整合フラグを 28 件(0.056%)検出しました。これは GPT-6 Sol の 42 件(0.085%)および GPT-6 Astra の 27 件(0.054%)と比較されます。OpenAI は重大度 3 を、合理的なユーザーが予想せず強く異議を唱える可能性のある不整合な挙動と定義しています。
サイバー能力評価において、GPT-6.1 Sol は最大推論努力で ExploitBench で 99.7% のスコアを獲得しましたが、OpenAI はこの結果が過去の脆弱性への曝露による潜在的な汚染で人工的に膨らんでいる可能性があると警告しています。ExploitBench Internal Port では、最近公開された脆弱性を使用した内部評価で、モデルは任意コード実行成功率 21.5% に達し、GPT-6 Sol の 5.5% および Astra の 31.5% と比較されます。SEC-Bench Pro では 78.8% のスコアを取得し、ExploitGym での試行あたり意図された脆弱性成功率は 35.1% です。OpenAI は、モデルの報告された生物学的結果が示唆的なクリティカル閾値を超えていないこと、そして Astra と同様に Daybreak プログラムを通じてサイバー分野で段階的な信頼アクセスアプローチを取っていると述べています。
OpenAI は、GPT-6.1 Sol が HealthBench 評価において GPT-6 Astra と同等の性能を示し、4 つの評価すべてで長さ調整スコアが Astra と 0.5 パーセンテージポイント以内であると報告しています。また、最大推論努力時の MentalHealthBench の総合スコアは 57.9 で、Astra の 58.7 と比較されます。
このリリースは、OpenAI が 2026年9月3日に GPT-6 Astra を、2026年9月22日に GPT-6 Sol と GPT-6 Luna を導入したことに続くもので、その際、同社は API価格を50%削減し、GPT-5.6 のプロモーション価格から変更しました。GPT-6 Sol の価格は入力トークン 100 万件あたり $2、出力トークン 100 万件あたり $10 に設定され、これは現在の GPT-6.1 Sol の標準価格と同じです。また、以前のリリースではプロンプトキャッシュ機能が改善され、キャッシュされた入力トークンの読み取りに対して 90% の割引が提供されました。
OpenAI は、今後数日以内に GPT-6.1 Sol Ultrafast を提供すると発表しました。これは Codex における標準速度と比較して最大 8 倍速いトークン生成が可能です。DevDay のまとめでは、Ultrafast はプレミアム速度層として Codex で秒間 300 トークンに達し、API では最大 6 倍速いトークン生成が可能と説明されています。現在は GPT-6 Astra Ultrafast が利用可能で、GPT-6.1 Sol Ultrafast はまもなく提供されます。












