OpenAI는 2026년 9월 6일 내부 측정 기준으로 ‘자동화 연구 인턴’ 목표를 달성했다고 발표했습니다. 숙련된 연구자에게 며칠 걸릴 수 있는 일을 포함해 범위가 명확한 연구 과제를 인간의 지시에 따라 수행한다는 뜻입니다. 내부 연구 현황을 알린 것이지 이 이름의 서비스 출시나 AI가 연구 방향을 독자적으로 결정한다는 발표는 아닙니다.

Agent 작업 3.1일은 무엇을 뜻하나?

8월 중순 기준 연구 조직은 인간의 하루 노동당 Agent 작업 약 3.1일을 사용했다고 합니다. 양쪽 모두 8시간 기준입니다. 누적 실행 시간의 비교이지 연구 품질이나 성과가 3.1배라는 뜻이 아닙니다. 병렬 실행은 합산 시간을 늘리지만 개별 문제의 해결 시간을 같은 비율로 줄이지는 않습니다.

연구·인프라 코드 작성뿐 아니라 기술 문제 해결과 실험 모니터링에도 Agent를 더 많이 사용합니다. 반면 상위 수준 계획은 출력 tokens에서 여전히 작은 비중입니다. 실행 업무를 상당히 위임했다는 이야기이지 무엇을 연구하고 결과를 어떻게 판단할지에 대한 인간의 결정이 사라졌다는 뜻은 아닙니다.

AI 사용량과 연구 성과는 다르다

사용량 중앙값은 하루 600달러, 90백분위는 7,000달러를 넘었지만 API 가격으로 환산한 추론 사용량입니다. 실제 내부 청구액이나 일반 Codex 구독의 하루 요금이 아닙니다.

활성 실험 수행자당 실험 수도 증가했지만 사용 가능한 연산 자원도 늘었습니다. 상관관계만으로 모든 증가를 Agent 덕분이라고 할 수 없습니다. 코드와 실험의 양은 신뢰할 수 있고 재현 가능한 발견과는 다른 지표입니다.

긴 작업일수록 인간 개입이 중요하다

지난 6개월 동안 인간에게 4~8시간 걸릴 것으로 추정되고 최종적으로 성공한 작업의 절반 이상에 최소 한 차례 인간 개입이 있었습니다. 이 시간은 Agent 실행 시간이 아닙니다. 결과가 불확실한 분류도 제외돼 모든 작업을 대표하지 않습니다.

2028년 3월의 ‘자동화 AI 연구자’는 다음 목표이지 완료된 성과가 아닙니다. 완전한 재귀적 자기 개선에 안전하게 도달할 방법도 아직 모른다고 밝혔습니다. 우선순위, 추가 연구할 결과, 확대·중단·배포 여부는 사람이 결정합니다.

원클릭 연구를 약속하는 것은 아니다

팀과 창작자에게는 검토 가능한 산출물이 명확한 업무와 성공 기준이 모호한 업무를 구분할 자료가 됩니다. 실행 시간만으로 완료를 판단할 수 없습니다. 무엇을 전달했는지, 사람이 얼마나 수정했는지, 결과를 믿을 수 있는지가 중요합니다.