契約の設定や承認プロセスの作成を行うAIが、11の研究課題で平均55.0%の得点を示した。契約業務ソフトウェアの練習環境と合成課題で学習したGPT‑6 Astraは、比較対象の41.6%を上回り、シミュレーション上の平均試行時間も短くなった。
契約設定を8〜50の基準で採点する
OpenAIと契約業務ソフトウェア企業Ironcladは、法務・商務・調達にまたがる11の研究課題を用意した。課題の選定には、Ironcladの従業員とOpenAI内で製品を利用する担当者が協力した。
課題には、秘密保持契約の設定、調達の承認プロセスの作成、依頼者が選んだ法域に合わせた再利用可能な法的条項の更新が含まれる。OpenAIは各課題に8〜50の評価基準を設け、複雑な操作のどの部分をモデルが満たしたかを採点した。
ソフトウェア上の練習を強化学習につなぐ
Ironcladは、モデルが課題を練習できる製品のホスト環境を提供した。OpenAIは代表的な業務フローから合成学習課題を作り、その環境での練習とフィードバックを通じて、強化学習でモデルを改善した。AIモデルGPT‑6 Astraは、この契約業務の課題で学習したOpenAI初のフロンティアモデルとなった。
合成課題の契約には、米証券取引委員会の公開データベースEDGARにある契約を使い、個人情報を除去するためのフィルターを適用した。学習と評価には、OpenAIの顧客データや内部契約、非公開のIronclad顧客データや契約は使っていない。
11課題で得点が上がり、推定試行時間が短縮
OpenAIの比較評価では、各モデルで最高得点となった推論設定を用いた。GPT‑6 AstraのMax設定の平均得点は55.0%で、比較対象のAIモデルGPT‑5.6 Solのhigh設定は41.6%だった。この数値は、11の研究課題に対する評価基準の平均得点であり、契約業務全体の成功率を表すものではない。
同じ比較で、1試行あたりの平均推定時間は37.0分から19.2分に短くなった。時間は仮定したモデルの処理速度と生成速度に基づくシミュレーション上の値で、顧客が実際の業務で節約した時間を測った結果ではない。
同じ操作課題で評価基準の約94%を満たす
OpenAIが公開した操作例では、両モデルが同じ研究課題に取り組んだ。GPT‑6 Astraは評価基準の約94%を満たし、その試行の推定時間は20分だった。
比較対象のGPT‑5.6 Solは、評価基準の約85%を推定32分で満たした。この操作例でも、新モデルはより多くの要件を満たし、推定時間は短かった。