OpenAI는 2026년 9월 10일 GPT‑Live‑1을 API로 공개했습니다. 외부 개발자는 말하는 동안에도 계속 듣고 끼어들기, 멈춤, 배경 소음을 처리하는 풀 듀플렉스 음성 앱을 만들 수 있습니다. 단순히 음성을 텍스트로 바꾸고 텍스트 모델을 거쳐 다시 음성으로 바꾸는 연결 서비스를 추가한 것이 아닙니다. 대화 프런트엔드와 백엔드 추론을 조합할 수 있는 구조입니다. OpenAI는 음성 레이어 가격을 분당 0.05달러로 제시했으며 백엔드 모델과 도구 사용료는 별도입니다.
GPT‑Live‑1이 개발자에게 제공하는 것
풀 듀플렉스는 한쪽이 말을 끝낼 때까지 기다리는 대신 사용자의 음성을 받으면서 응답을 생성할 수 있다는 뜻입니다. GPT‑Live‑1은 음성 전사와 응답 텍스트를 제공하고 턴 감지와 키워드 바이어싱도 지원하므로 개발자가 명확한 턴 제어를 포기할 필요는 없습니다. 음성 상호작용을 무전기처럼 한 번씩 주고받는 방식에만 묶지 않는 것이 차이입니다.
OpenAI는 WebRTC, WebSocket, 전화 환경을 지원 방향으로 제시해 브라우저 데모만을 목표로 하지 않습니다. 실제 서비스는 음성 스트리밍, 통화 품질, 전사 오류, 음성 동의, 데이터 보존, 사람 상담원 연결을 별도로 처리해야 합니다. 모델이 제공하는 것은 대화 능력이지 완성된 컨택센터나 통신 규제 패키지가 아닙니다.
대화와 행동을 계층으로 분리
GPT‑Live‑1은 자연스러운 대화를 담당하는 음성 프런트엔드 계층이고 더 깊은 추론, 데이터 검색, 도구 호출은 GPT‑6 Astra 같은 백엔드 텍스트 모델이나 개발자의 자체 모델·에이전트에 위임할 수 있습니다. 음성 모델은 듣기, 응답, 끼어들기, 말투에 집중하고 작업 상태, 권한, 도구 실행은 애플리케이션이 관리합니다.
작업에 따라 백엔드를 바꿀 수 있다는 점이 장점입니다. 간단한 조회마다 비싼 추론을 쓸 필요 없이 복잡한 작업만 더 강한 모델로 보낼 수 있습니다. 반대로 책임은 개발자에게 돌아옵니다. 사용자가 말하는 도중 끼어들었을 때 백엔드 작업을 취소할지, 재시도할지, 계속할지를 앱이 정의해야 합니다. 음성이 자연스러워진다고 도구 작업이 자동으로 안전해지는 것은 아닙니다.
분당 0.05달러는 음성 레이어 비용
OpenAI는 GPT‑Live‑1 프런트엔드 음성 레이어를 분당 0.05달러, 초 단위 과금으로 제시합니다. 10분 음성 상호작용이라면 이 레이어만 약 0.50달러입니다. 전체 비용은 아니며 백엔드 GPT 모델, 함수 도구, 전화 공급자, 전사, 저장 비용이 별도로 붙을 수 있습니다.
OpenAI는 Speak의 초기 평가에서 기존 턴 기반 시스템보다 언어 학습자의 발화가 끊기는 일이 거의 80% 줄었고 Full Duplex Bench에서 30포인트 향상됐다고 보고합니다. 회사 또는 파트너 평가이지 모든 사용 사례를 보장하는 독립 벤치마크는 아닙니다. 출시 전 팀은 실제 통화 길이, 언어, 소음 조건, 도구 성공률로 테스트해야 합니다.
정말 음성 제품이 더 자연스러워질까
GPT‑Live‑1의 가치는 음성 제품이 ‘대답할 수 있음’에서 ‘끼어들기와 대기 상황에서도 안정적으로 일을 완료함’으로 나아가는지에 달려 있습니다. 고객 지원, 예약, 언어 학습, 전화 에이전트에서는 딱딱한 발화 교대가 줄어 경험이 좋아질 수 있습니다. 개발자에게는 새 비용 모델과 2계층 구조에 따른 상태 관리와 안전 책임이 더해집니다. 음성 프런트엔드의 큰 업데이트이지 백엔드 권한 관리나 사람 상담을 자동화하는 것은 아닙니다.
