OpenAIがIroncladと提携、複雑な専門業務をこなすAIエージェントの高度化と評価手法を解説


ADVERTISEMENT

契約ワークフローを訓練タスクへ変換するアプローチ

OpenAIは、専門的なソフトウェア上でマルチステップのワークフローを自律的に実行し、ビジネスルールを遵守しながら検証まで行うAIエージェントの能力向上を目指し、AI契約プラットフォームのIroncladとの共同研究を発表した。従来の単一アクションの自動化を超え、企業の厳格なビジネスルールを維持しながら複雑な合意形成プロセスを完遂できるエージェントの育成が主眼となっている。

法務、商務、調達といった分野において、ソフトウェア購入の稟議プロセス(財務承認、セキュリティレビュー、法務による例外条件の確認など)は複雑に分岐する。これを自動化するため、両社は人間が実行すると平均30〜40分を要する11種類の代表的なタスク(秘密保持契約の設定、調達承認プロセスの構築、管轄に応じた条項の更新など)を特定した。各タスクは8〜50項目の詳細な評価基準(ルブリック)に基づいて検証され、Ironcladが提供するホスト型ソフトウェア環境上でモデルが実践・学習を行える仕組みを構築している。また、SECのEDGARデータベース等から抽出された公開契約を基に、プライバシーに配慮した合成訓練タスクを生成し、強化学習(RL)を組み合わせることでエージェントの実践的な問題解決能力を高めている。

モデル性能の比較とベンチマーク結果

本協業を通じて訓練された次世代フロンティアモデル(GPT-6 Astraなど)は、従来のモデルと比較して大幅な性能向上が確認されている。公開された11の研究タスクを用いた評価において、GPT-6 Astra(Max推論設定)は平均スコア55.0%を記録し、比較対象のGPT-5.6 Sol(High推論設定)の41.6%を大きく上回った。

さらに、シミュレーション上の推定処理時間(試行あたりの平均時間)においても、GPT-5.6 Solの37.0分に対し、GPT-6 Astraは19.2分へと約48%短縮された。より開発初期の内部モデルでは63.7%の高精度を達成しており、単に正解率が向上するだけでなく、マルチステップのタスク処理における迷いや手戻りが削減され、効率的なエージェント動作が実現されていることを示している。

開発者・エンジニア視点での考察

  1. 多段階評価基準(ルブリック)による強化学習の報酬設計: 複雑な専門業務を自動化する際、単なる最終出力の正誤だけでなく、プロセス中の制約条件(例:金額閾値に応じた承認ルートの分岐など)の遵守度を8〜50項目の多段階ルブリックで定量化し、強化学習の報酬関数に組み込む手法は、エージェントの「ハルシネーション」や「途中の脱線」を防ぐ上で極めて効果的である。

  2. 専門特化型SaaS環境と合成タスクの融合: 実世界のドメイン知識を持つ企業(Ironclad等)との密接なパートナーシップのもと、セキュアなホスト環境とパブリックデータに基づく合成タスクを組み合わせるアプローチは、一般的なベンチマークでは測定できない「実業務の例外処理への耐性」をモデルに獲得させるための標準的な開発パターンになりつつある。

  3. 推論時間とスループットのトレードオフの克服: 高度な推論設定(Max reasoning等)を採用しながらも、タスク完了までの推定時間を約半分に短縮できた背景には、モデル自体のアーキテクチャの効率化だけでなく、UI操作における無駄なステップの排除やコンテキスト管理の最適化が寄与しており、実用的なエージェント開発において「速さと正確性の両立」が現実的段階に入ったことを示している。

Source / 元記事

この記事について

著者
AIBloom AI編集部
初回公開
最終更新

この記事は、公開されているニュース、論文、公式発表、RSSフィードなどをもとに、AIが要約・補足調査・考察を行って作成しています。

元記事の完全な翻訳・逐語的な要約ではなく、AIによる背景説明や開発者向けの考察を含みます。

重要な技術仕様・価格・提供状況などは、必ず元記事または公式情報をご確認ください。

About AIBloom

ADVERTISEMENT