OpenAI는 8월 25일 자체 개발 Jalapeño 추론 칩의 첫 테스트 결과를 공개했다. 이는 최근 72시간 확장 범위에 해당하는 중요한 소식이며 8월 27일 처음 발표된 사건은 아니다. 성능 수치는 주로 OpenAI 자체 측정으로 독립적인 칩 평가가 완료된 것은 아니다.

OpenAI가 공개한 수치

OpenAI에 따르면 GPT-OSS 120B, DeepSeek R1 670B와 Kimi K2.5 1T 테스트에서 Jalapeño는 NVIDIA GB300보다 와트당 AI 작업량이 약 1.5~1.9배 높고 종단 간 지연은 약 1.7~3.6배 낮았다. 대화형 작업에서는 약 2.1~4.1배 성능 향상을 보고했다.

테스트에는 SemiAnalysis InferenceX를 사용했고 비교 칩의 전력은 공개 정격을 기준으로 정규화했다. OpenAI는 Jalapeño 정격 전력이 700W지만 테스트 작업에서 지속 측정 전력은 550W 이하였다고 밝혔다. 이런 조건이 최종 비교 결과에 직접 영향을 준다.

결과를 어떻게 읽어야 하나

첫째, 이는 회사가 발표한 퍼스트파티 벤치마크이지 독립 연구소의 종합 검증이 아니다. 종단 간 추론 지연, 와트당 처리량과 대형 모델 서비스 비용이라는 OpenAI의 최적화 방향은 보여주지만 배치 크기, 입출력 길이, 소프트웨어 스택과 전력 정의에 따라 결과는 달라질 수 있다.

둘째, Jalapeño는 구매해 설치할 수 있는 소비자 제품이 아니며 이번 발표에서 일반 개발자용 공급 방식이나 가격도 공개되지 않았다. ‘NVIDIA를 앞섰다’는 표현은 OpenAI가 제시한 테스트 조건에서의 주장일 뿐 모든 AI 작업에서 NVIDIA보다 빠르다는 뜻은 아니다.

OpenAI가 추론 칩을 직접 만드는 이유

대형 AI 서비스의 비용은 모델 학습뿐 아니라 매일 발생하는 추론 요청에서도 나온다. 같은 전력으로 더 많은 작업을 처리하거나 같은 작업량에서 지연을 줄이는 칩은 데이터센터 용량과 운영 비용을 개선할 수 있다. Jalapeño가 와트당 성능과 종단 간 지연을 핵심으로 내세우는 이유다.

OpenAI는 Jalapeño가 AI 지원 설계에서 테이프아웃까지 약 9개월이 걸렸다고 밝혔다. 모델이 하드웨어 설계에 참여할 수 있음을 보여주지만 칩이 대량 생산에 들어갔거나 설계와 검증 전 과정을 AI가 자동화할 수 있다는 뜻은 아니다.

현재 확인되는 사실

Jalapeño가 주목받는 이유는 OpenAI가 GPU를 사용하는 서비스 사업자에서 추론 인프라를 설계하는 역할로 나아가기 때문이다. 현재 가장 정확한 표현은 ‘OpenAI가 자체 측정 결과를 공개했다’는 것이다. 더 다양한 모델, 소프트웨어와 데이터센터 조건에서 재현되는지는 추가적인 투명한 테스트와 외부 검증이 필요하다.