OpenAIは2026年9月6日、内部の測定に基づき「自動化研究インターン」の目標を達成したと発表しました。人の指示の下で、熟練した研究者なら数日かかるものも含め、範囲が明確な研究タスクを扱うシステムを指します。内部の進捗報告であり、この名称の新サービス公開や、AIが研究方針を独力で決めるという発表ではありません。
「Agent稼働3.1日分」は何を表す?
8月中旬には、研究組織全体で人の労働1日分に対しAgent稼働3.1日分を使っていたといいます。いずれも8時間換算です。累積稼働時間の比較であり、研究の質や成果が3.1倍になったという意味ではありません。並列実行は合計時間を増やしますが、一つの問題の解決が同じ比率で速くなるとは限りません。
研究用・基盤用コードに加え、技術的なトラブル対応や実験監視での利用も増えています。一方、上位レベルの計画は出力tokensのごく小さな割合にとどまります。実行作業の委任が進んだという話であり、問いや発見の評価を人が決めなくなったわけではありません。
利用量と研究成果は同じではない
利用量の中央値は1日600ドル超、90パーセンタイルは7,000ドル超ですが、API価格で換算した推論利用量です。実際の社内請求額でも、一般向けCodex契約の1日料金でもありません。
実験実行者あたりの実験数も増えましたが、利用可能な計算資源も増加しています。相関だけですべてをAgentの効果とは判断できません。コードや実験の量と、信頼でき再現可能な発見は別の指標です。
長いタスクほど人の介入が重要
過去6カ月に、人なら4〜8時間かかると推定され、最終的に成功したタスクの半数以上で、少なくとも1回の人の介入がありました。この時間はAgentの実行時間ではありません。結果不明の分類も除外されており、全タスクを代表する数値ではありません。
2028年3月の「自動化AI研究者」は次の目標であり、達成済みではありません。完全な再帰的自己改善へ安全に至る方法も未解決としています。優先順位、追究する成果、拡大・停止・配備の判断は人が担います。
ワンクリック研究を約束するものではない
チームやクリエイターには、検査できる成果物が明確な仕事と、成功基準の曖昧な仕事を分けて考える材料になります。稼働時間だけでは完了を示せません。何ができ、人がどれだけ修正し、結果を信頼できるかが重要です。
