AIモデル「Claude Opus 5」は、図面を直接見られない課題で画素解析処理を作り、その出力から機械部品を3D再構築した。解析や検証に必要な手段を作業途中で補う複数の事例を、Anthropicが示した。
結果の検証を成功まで反復
Anthropicは、AIモデル「Claude Opus 5」について、作業結果を自ら検証し、成功するまで慎重に反復する能力が従来モデルから強化されたとしている。最初に生成した回答をそのまま最終結果とするのではなく、作業の成否を確かめながら処理を続けるという位置付けだ。
この反復は、既存の道具だけで作業を進めることに限定されない。Anthropicが示した事例では、目的の達成に必要な解析処理や検証手段をClaude Opus 5がコードとして作り、その結果を後続の工程へ渡している。
生の画素を3D形状へ変換
機械部品の図面から3Dモデルを作る課題では、Claude Opus 5に図面を直接見る手段が与えられていなかった。Anthropicによると、モデルは利用可能な生の画素から幾何形状を抽出するコンピュータービジョン処理を記述したという。
抽出した形状は、機械部品全体を3D FreeCADモデルとして組み直すための入力になった。Claude Opus 5は再構築に繰り返し成功した一方、同じ条件で試された競合モデルは5回とも成功しなかったとAnthropicは報告している。
ライブデータなしで解析コードを検証
市場データを扱う事例では、ある取引会社の技術者がClaude Opus 5を使い、新しい取引所向けのデータフィードを1回のセッションで構築したと報告している。以前のモデルは、技術者から詳細な計画を与えられても作業を完了できなかったという。
構築したコードと照合できるライブフィードは用意されていなかったため、Claude Opus 5は取引所データを正しく解析できるか確認するテストハーネスも作成した。データフィードの実装に続けて検証経路を組み立て、解析結果を点検できる状態まで作業を進めた。
表面の症状から不具合の根本原因へ
オープンソースのパッケージ管理ソフトウェアに実在した不具合では、Claude Opus 5が根本原因を特定したとAnthropicは報告している。比較対象のモデルは表面に現れた症状だけを修正し、不具合を解消したと判断したという。
この不具合には、コミュニティーが作成した修正で見逃されていたエッジケースが残っていた。Claude Opus 5はその条件も修正し、症状の解消から例外条件の処理までを一連のデバッグ作業に含めた。
表計算の分析を通知と要約へ接続
解析結果を次の操作へ渡す処理は、複数段階の業務課題でも確認された。ZapierのAutomationBenchに関する利用者報告では、Claude Opus 5は顧客状況を記録した表計算データを読み、リスクのあるアカウントを特定した。
特定結果は後続処理の入力となり、モデルは適切な担当者への通知と、顧客維持業務向けの要約まで実行した。表の分析、対象の選別、通知、要約を途中で分断せず、一つの業務手順として処理した事例となる。
ソフトウェア評価で従来モデルの2倍超
こうしたソフトウェア工学作業を扱うFrontier-Bench v0.1では、Anthropicの評価でClaude Opus 5の性能がClaude Opus 4.8の2倍を超えた。タスク当たりのコストはClaude Opus 4.8より低かったとしている。
同じ評価で、Claude Opus 5は対象となった他の全モデルを上回ったとAnthropicは説明している。この結果は、解析処理の作成や反復検証を含む具体例とは別に、ソフトウェア工学課題をまとめたベンダー評価で確認された比較値である。