OpenAI 於 2026 年 9 月 6 日宣布,依照自家的內部衡量,已達成「自動化研究實習生」目標。它指的是在人類指導下,處理範圍明確的研究任務,包含熟練研究者可能需要數天完成的工作。這次公布的是研究進展與內部使用數據,不是開放一款叫「研究實習生」的新服務,也沒有宣稱 AI 已能獨立決定研究方向。
每天 3.1 個 Agent 工作天,代表什麼?
OpenAI 表示,到八月中旬,研究組織每投入一個人類工作天,合計使用約 3.1 個 Agent 工作天;兩者都以八小時作為換算單位。這是在比較累積運作時間,不是說研究品質提高 3.1 倍,也不是一位研究者的產出已經抵得上三位。多個 Agent 同時執行,會增加總時數,卻未必縮短每個問題的解決時間。
更值得注意的是工作分配。報告指出,Agent 不只用來寫研究與基礎設施程式,也更常協助技術排錯、監看實驗。高層次規劃在輸出 tokens 中仍只占很小部分。換句話說,現在較清楚的變化是「研究過程的執行工作被大量交出去」,不是「提出什麼問題、怎麼判斷發現」都已交給 AI。
AI 用得更多,但用量不是研究成果
另一組容易被誤讀的數字是費用:八月中旬,研究人員使用量中位數超過每日 600 美元,使用量第 90 百分位超過每日 7,000 美元。不過,OpenAI 特別註明這是「按 API 價格計算的推論用量」。它不是公布公司實際付出的帳單,更不能直接當成一般人訂閱 Codex 每天會花的錢。
公司也觀察到,每位活躍實驗執行者的實驗數增加,八月達到開始追蹤以來的高點;但同期可用算力也增加了。這讓數字有參考價值,卻不能單靠相關性就把全部成長歸功於 AI。多寫程式、多跑實驗,和得到更可靠、能被重現的新發現,是不同的衡量問題。
越長的任務,越不能忽略人的介入
報告裡最重要的限制是:過去六個月,被估計為人類需要四到八小時、而且最後成功的任務中,超過一半至少發生一次人工介入。這裡的四到八小時是對人類工作難度的估計,不是 Agent 必須跑的時間;統計也排除了結果無法確定的分類,不能拿來代表所有任務。
OpenAI 把 2028 年三月的「自動化 AI 研究者」列為下一個目標,而非已完成的成果。它同時承認,如何安全走到完整的遞迴自我改進,仍沒有確定答案。研究優先順序、哪些結果值得追下去,以及是否擴大、暫停或部署系統,目前仍由人類決定。
對使用者來說,這不是一鍵研究承諾
對開發團隊和創作者而言,這份報告可用來理解 Agent 適合被放在哪個環節:目標清楚、有可檢查產物的工作,較容易討論是否真的省時;方向模糊、成功標準不清的任務,不能只看執行時數就算完成。真正值得追蹤的不是 AI 忙了多久,而是最後留下什麼成果、人花多少時間校正,以及結果是否可信。
