OpenAI、GPT-6.1 Solを発表:Astra級の性能を低コストで実現する新基準モデル
GPT-6.1 Solの概要と戦略的ポジショニング
OpenAIは、GPT-6 Solのアップグレード版である「GPT-6.1 Sol」を発表しました。このモデルは、日常的な業務における能力とコストの新たなバランスを提供し、複雑な専門タスクにおいてGPT-6 Solからの大幅な改善を実現しています。特に、エージェントによるコーディング、コンピューター利用、および専門業務において、GPT-6 Astraのインテリジェンスにほぼ匹敵する性能を、Astraの標準入出力トークン価格の約5分の1という大幅に低いコストで提供します。
GPT-6.1 Solは、OpenAIのモデルファミリーにおいて、最も高性能な「GPT-6 Astra」と、より低コストで大量のタスクに適した「GPT-6 Luna」の中間に位置付けられています。これは、開発者がインテリジェンス、コスト、レイテンシの3つの変数全体で最適化を行うことを奨励するものであり、高い能力を持つエージェント実行のコスト曲線を大幅に引き下げることが期待されます。
主要な性能向上とベンチマーク詳細
GPT-6.1 Solは、多岐にわたるタスクで顕著な性能向上を示しています。
コーディング能力
DeepSWE v1.1(実際のコードベースにおける複雑なソフトウェアエンジニアリングタスクを評価するベンチマーク)において、GPT-6.1 SolはGPT-6 Astraに匹敵する性能を、約5分の1のコストで達成しました。また、GPT-6 Solの最高スコアを6.4パーセンテージポイント上回っています。一方、SonarによるJavaベンチマークでは、GPT-6 Astraと比較して生成コード量が27%少なく、検出された問題数も22%少ないものの、HumanEvalおよびMBPPタスクでの合格率は2.76ポイント低くなっています。
コンピューター利用と専門業務
OSWorld 2.0(要求の厳しいコンピューター利用ワークフローを評価する)のオフラインセットでは、GPT-6.1 SolはGPT-6 Solを7パーセンテージポイント上回り、コストは半分以下です。Astraのスコアにも2.1パーセンテージポイント以内に迫り、コストはAstraの約7分の1です。 GDP.pdf(複雑なPDF文書を使用した専門的な質問応答タスク)では、Opus 5.5を上回り、Astraの最先端性能に匹敵しつつ、タスクあたりのコストはAstraの約5分の1です。 AutomationBench(多段階のビジネスワークフローの完了度を測定する)では、中程度の推論努力でOpus 5.5を2.2パーセンテージポイント上回り、コストは約3分の1に抑えられています。
科学研究と事実性
Terminal-Bench Science 0.1(データ分析、シミュレーション、定理証明を含む科学的ワークフローを評価する)において、GPT-6.1 SolはGPT-6 Solのスコアを2倍以上にし、タスクあたりのコストは半分以下です。 事実性に関しても改善が見られ、低い推論努力における事実誤りを含む応答の割合をGPT-6 Solの11.4%から7.7%へと約32%削減しました。そのエラー率は、GPT-6 Astraの1.9パーセンテージポイント以内に留まり、コストは5分の1以下です。
費用対効果と開発者向けの新機能
GPT-6.1 Solの大きな特徴は、その卓越した費用対効果です。標準の入力トークンは100万トークンあたり$2.00、出力トークンは$10.00で提供されます。特に注目すべきは、キャッシュされた入力の価格が100万トークンあたり$0.10であり、これは標準入力価格の95%削減、GPT-6 Solのキャッシュされた入力価格からも50%の削減となります。この大幅なコスト削減は、コンテキストをリユースする高性能エージェントの開発と運用に大きな自由度をもたらします。
このモデルは、1,050,000トークンのコンテキストウィンドウと最大128,000トークンの出力に対応し、低、中(デフォルト)、高、xhigh、maxの推論努力レベルをサポートしています。また、APIを通じてgpt-6.1-solとしてアクセス可能であり、ChatGPT WorkおよびCodexのPlus、Pro、Business、Enterprise、Eduユーザー向けに提供されています。
さらに、OpenAIは近日中に「GPT-6.1 Sol Ultrafast」を発表する予定であり、これは最大8倍のトークン生成速度を実現するとされています。これにより、開発者は、インテリジェンス、コスト、レイテンシのバランスを、より細かく最適化できるようになります。
安全性、アライメント、および将来展望
GPT-6.1 Solは、アライメント評価においてGPT-6 Solからの大幅な改善を示し、GPT-6 Astraに近づいています。モデルの限界に関する透明性が向上し、ユーザーの意図と安全制約を尊重する信頼性も高まっています。挑戦的な評価において、壊れた検索ツールに関する透明性、明示的な制限の尊重、エージェントタスク中の不正な結果の回避において、GPT-6 Solよりも低い失敗率を示しています。自動安全レビューアを迂回しようとする試みは観察されておらず、GPT-6 AstraおよびGPT-6 Solと同レベルの安全性が維持されています。
これらの安全性とアライメントの改善は、特にエージェントシステムの開発において極めて重要です。企業や開発者は、より複雑で自律的なAIアプリケーションを構築する際に、安全性と信頼性に関する懸念を軽減できるようになります。GPT-6.1 Solは、高まるAIシステムの責任と倫理的な開発に対するOpenAIのコミットメントを反映しており、今後のAIアプリケーションの普及に貢献するでしょう。
開発者・エンジニア視点での考察
-
キャッシュ入力の最適化によるエージェントコストの大幅削減: GPT-6.1 Solのキャッシュ入力価格が100万トークンあたり$0.10という設定は、特に長期にわたる会話や多段階のエージェントワークフローにおいて、コンテキストの再利用によるAPIコストを劇的に削減します。これにより、複雑な状態管理を伴うパーシステントエージェントや、継続的な学習・推論サイクルを必要とするアプリケーションの開発が、経済的に実現可能となります。開発者は、より多くの「思考」や「試行」をエージェントに許容させることができ、結果としてより堅牢でインテリジェントなエージェントの構築が促進されるでしょう。
-
「推論努力」パラメータによる動的な性能・コストトレードオフ: GPT-6.1 Solが「低」から「max」までの推論努力レベルをサポートしていることは、開発者にとって非常に強力な最適化ツールとなります。リアルタイム応答が求められるインタラクティブなアプリケーションでは「低」や「中」を選択して低レイテンシとコスト効率を優先し、複雑な分析やコーディング、科学的推論のような高精度が要求されるバックグラウンドタスクでは「xhigh」や「max」を選択するといった、ユースケースに応じたきめ細やかな調整が可能です。これにより、アプリケーション全体の性能要件と予算制約に合わせた最適なAIモデル利用戦略を策定できます。
-
GPT-6 Astraに近い性能を活かした高度なツール利用エージェントの実現: GPT-6.1 SolがDeepSWE v1.1でのコーディングやOSWorld 2.0でのコンピューター利用においてGPT-6 Astraに迫る性能を発揮しながら、大幅に低いコストで提供される点は、高度なツール利用エージェント(Tool-using Agents)の開発を加速させます。外部APIや内部ツールとの連携を通じて、複雑なビジネスプロセスを自動化したり、専門的なデータ分析を実行したりするエージェントを、これまでのフラッグシップモデルで直面していたコストの障壁を越えて、より広範囲に展開できるようになります。開発者は、エージェントの「推論の深さ」を犠牲にすることなく、実用的なアプリケーションへの統合を積極的に進めることが可能になるでしょう。
Source / 元記事
この記事について
この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。
元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。
重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。


