Real AI Lab

모델 릴리스

GPT-Live-1 API란? 전이중 음성 에이전트 구조와 비용

GPT-Live-1 API가 기존 STT·LLM·TTS 구조와 어떻게 다르고, 백엔드 위임·끼어들기 처리·분당 비용을 어떻게 봐야 하는지 정리합니다.

Real AI Lab 편집팀
  • #GPT-Live-1 API
  • #전이중 음성 에이전트
  • #Voice AI
  • #OpenAI API

GPT-Live-1 API는 듣기와 말하기를 동시에 처리하는 전이중 음성 에이전트 모델입니다. 핵심 변화는 음성 인식(STT), 언어 모델(LLM), 음성 합성(TTS)을 차례로 넘기던 구조에서 대화 타이밍을 한 모델이 함께 다루게 됐다는 점입니다. 개발팀은 끼어들기와 침묵을 이어 붙이는 코드보다 백엔드 추론과 실제 업무 흐름에 더 집중할 수 있습니다.

다만 이 모델 하나가 상담 업무 전체를 대신하는 건 아닙니다. 분당 0.05달러도 프런트엔드 음성 레이어 기준입니다. 백엔드 모델과 도구, 전화망 비용은 별도로 봐야 합니다.

핵심 요약 (TL;DR)

  • GPT-Live-1 API는 사용자와 모델이 같은 시간에 듣고 말할 수 있는 전이중(full-duplex) 음성 모델입니다.
  • 들어오는 음성과 나가는 음성을 함께 처리해 기존 STT·LLM·TTS 연결형 구조의 전달 지연과 끼어들기 조율 부담을 줄입니다.
  • 더 깊은 추론과 도구 호출은 GPT-6 Astra 같은 백엔드 텍스트 모델이나 서드파티 모델에 맡길 수 있습니다.
  • OpenAI는 Full Duplex Bench에서 GPT-Realtime-2.1보다 30%포인트 높았다고 밝혔습니다. Speak의 초기 평가에서는 기존 턴 기반 시스템보다 생각 중 끼어들기가 약 80% 줄었습니다.
  • 가격은 프런트엔드 음성 레이어 기준 분당 0.05달러입니다. 전체 운영비가 아닙니다.

GPT-Live-1 API가 바꾼 음성 에이전트 구조

가장 큰 변화는 대화를 처리하는 경계입니다. 기존에는 STT가 말을 글로 바꾸고, LLM이 답을 만들고, TTS가 다시 음성으로 읽는 세 단계를 개발자가 연결했습니다. GPT-Live-1은 듣기와 말하기를 한 모델에서 함께 처리하고, 필요한 추론과 작업만 뒤쪽으로 넘깁니다.

기존 STT·LLM·TTS 연결형 구조와 GPT-Live-1 중심 구조가 나란히 비교되어 있습니다.
바뀐 건 모델 수보다 대화 타이밍을 책임지는 위치입니다.

기존 구조가 틀렸다는 뜻은 아닙니다. 각 단계를 따로 고를 수 있다는 장점이 있습니다. 다만 사용자가 말을 끊거나 잠시 멈추면 어느 단계가 기존 출력을 취소하고 새 발화를 받을지 직접 조율해야 합니다.

전이중 음성 에이전트는 왜 끼어들기에 유리한가

전이중(full-duplex)은 사용자와 모델이 같은 시간에 듣고 말할 수 있는 대화 방식입니다. GPT-Live-1은 들어오는 음성과 나가는 음성을 함께 살피기 때문에, 사용자가 답변 중간에 정정하거나 짧게 맞장구쳐도 그 신호를 대화 흐름 안에서 처리할 수 있습니다.

사용자 음성과 AI 음성이 시간축 위에서 일부 겹치며 동시에 처리되는 흐름이 표시되어 있습니다.
자연스러운 음성 경험은 답변 속도보다 겹쳐 말하는 순간을 다루는 방식에서 갈립니다.

예를 들어 사용자가 예약 시간을 말하다가 바로 정정하면, 에이전트는 앞선 답을 끝까지 읽지 않고 새 정보를 받아야 합니다. 이런 음성 API 끼어들기 처리가 매끄러워지면 사용자는 기계의 차례를 기다리지 않고 평소처럼 말할 수 있습니다.

휴대전화로 예약 내용을 말하다가 중간에 시간을 정정하는 사람의 자연스러운 대화 장면입니다.
정정이 생겼을 때 처음부터 다시 말하게 하지 않는 것이 끼어들기 처리의 실용적 가치입니다.

침묵과 주변 소음도 대화의 일부로 본다

OpenAI는 GPT-Live-1이 침묵과 배경 소음을 더 잘 처리한다고 설명합니다. 모든 침묵을 발화 종료로 판단하거나, 내부 처리 과정을 음성으로 일일이 설명하지 않도록 설계할 수 있다는 뜻입니다.

외국어 학습자가 헤드셋을 쓰고 답을 생각하는 동안 음성 튜터가 기다리는 장면입니다.
생각할 시간을 발화 종료로 오인하지 않아야 음성 튜터가 사람처럼 기다릴 수 있습니다.

이 차이는 조용한 데모보다 실제 환경에서 더 중요합니다. 카페나 거리처럼 다른 사람의 목소리가 섞이는 곳에서는 배경 발화, 짧은 맞장구, 실제 요청을 구분해야 대화가 이어집니다.

붐비는 카페에서 이어폰으로 음성 에이전트를 사용하는 개발자와 주변 소음이 함께 표현되어 있습니다.
음성 에이전트 품질은 조용한 방이 아니라 실제 소음 환경에서 확인해야 합니다.

백엔드 모델 위임은 어떻게 나뉘나

GPT-Live-1의 역할은 대화를 자연스럽게 이어가는 앞단에 가깝습니다. 백엔드 위임은 음성 대화를 이어가면서 별도의 텍스트 모델이나 도구에 추론과 작업을 맡기는 방식입니다. 개발자는 대화 레이어, 추론 모델, 업무 도구의 책임을 나눠 설계할 수 있습니다.

GPT-Live-1 대화 레이어가 백엔드 텍스트 모델과 업무 도구에 작업을 위임하고 결과를 받는 구조입니다.
음성 모델은 대화를 붙잡고, 백엔드는 오래 생각하거나 실제 도구를 실행합니다.

OpenAI가 든 예시는 고빈도 일정·주문 변경에는 가벼운 모델을, 복잡한 고객 문제에는 더 깊게 추론하는 모델을 붙이는 방식입니다. 모든 통화에 같은 백엔드 모델을 고정하지 않으면 속도와 비용을 업무 난도에 맞춰 조절할 수 있습니다.

단순 일정·주문 작업과 복잡한 고객 문제를 서로 다른 백엔드 모델로 보내는 선택 흐름입니다.
대화는 한 입구로 받되 추론 비용은 업무 난도에 따라 나누는 설계가 가능합니다.

다음 표처럼 책임을 나누면 도입 검토가 쉬워집니다.

구간맡는 일개발팀이 확인할 것
GPT-Live-1 대화 레이어듣기, 말하기, 끼어들기와 침묵 처리실제 소음·정정·맞장구 상황에서 대화가 이어지는가
백엔드 텍스트 모델복잡한 판단, 답변 생성, 긴 작업업무별 정확도·지연·비용이 허용 범위인가
도구와 업무 시스템예약 조회, 주문 변경, 고객 정보 확인권한·실패 처리·사람에게 넘기는 경계가 명확한가
전화 연결실제 전화 수신과 음성 전달전화망 비용과 장애 대응이 별도로 준비됐는가

전화 음성 에이전트에서 달라지는 점

GPT-Live-1은 텔레포니(전화망 연동)를 지원해 식당 예약부터 고객 지원까지 전화 기반 전이중 음성 에이전트를 만들 수 있습니다. 웹 마이크 데모에 그치지 않고 실제 수신 전화 흐름에 넣을 수 있다는 의미입니다.

식당 직원이 예약 현황을 확인하는 동안 전화 음성 에이전트가 고객의 예약 전화를 처리하는 장면입니다.
전화 지원의 핵심은 음성 생성보다 예약·주문 시스템과 안전하게 연결하는 데 있습니다.

여기서 모델 지원과 완성된 상담 시스템을 구분해야 합니다. 예약 가능 시간을 조회하고, 변경을 승인하고, 예외 상황을 사람에게 넘기는 흐름은 별도 도구와 업무 규칙이 필요합니다.

공개된 평가 수치는 어디까지 믿어야 하나

공개 수치는 개선 방향을 보여주지만 모든 서비스의 보장값은 아닙니다. OpenAI는 자체 평가에서 GPT-Live-1이 GPT-Realtime-2.1보다 Full Duplex Bench 성능이 30%포인트 높았다고 밝혔습니다. 이 평가는 일시정지, 차례 주고받기, 끼어들기, 맞장구 같은 상호작용을 다룹니다.

Speak의 초기 평가에서는 학습자가 생각하는 동안 튜터가 끼어드는 일이 이전 턴 기반 시스템보다 약 80% 줄었습니다. 또 한 의료 관련 고객 사례에서는 기존 단계 연결형 구축과 비교해 코드베이스가 80% 단순해지고 2만3천 줄이 제거됐다고 OpenAI가 전했습니다. 둘 다 특정 고객 환경의 보고값이므로 우리 서비스 결과로 그대로 대입하면 안 됩니다.

벤치마크 결과, 고객사 초기 평가, 개별 서비스 검증을 서로 다른 근거 수준으로 구분한 도표입니다.
공개 수치는 후보를 고르는 근거이고, 도입 결정은 우리 대화 시나리오의 재검증으로 끝내야 합니다.

검증할 때는 평균 응답 시간 하나만 보지 마세요. 사용자가 답변 도중 말을 바꾸는 경우, 생각하느라 멈추는 경우, 옆 사람과 잠깐 말하는 경우를 따로 녹음해 성공 조건을 정하는 편이 낫습니다.

GPT-Live-1 API 비용 계산에서 빠뜨리기 쉬운 것

공식 출시 글이 밝힌 가격은 프런트엔드 음성 레이어 기준 분당 0.05달러입니다. 따라서 음성 레이어의 단순 계산식은 월간 통화 분 × 0.05달러입니다. 월 1만 분을 가정하면 500달러지만, 이는 백엔드 모델과 도구, 전화망 비용을 뺀 금액입니다.

월간 통화 시간에서 음성 레이어 비용을 계산하고 백엔드 모델·도구·전화망 비용을 별도로 더하는 구조입니다.
분당 가격만으로 전체 예산을 잡으면 백엔드 추론과 전화 연결 비용이 빠집니다.

예산표에는 GPT-Live-1 음성 사용 시간, 백엔드 모델별 호출량, 업무 도구 운영비, 전화망과 모니터링 비용을 따로 두는 게 좋습니다. 실제 청구 기준과 지역별 가용 범위는 구현 전에 공식 API 문서와 가격 페이지에서 다시 확인해야 합니다.

Codex 연동 예시가 보여주는 범위

OpenAI 출시 글의 Codex 예시는 대화 맥락을 Codex 스레드에 넘기고, 짧은 음성 답변을 GPT-Live-1 세션으로 돌려주는 흐름을 보여줍니다. 코드 저장소를 읽어 답하는 음성 개발 도우미 같은 구성을 이해하기에는 충분합니다.

하지만 공식 예시에는 세션 연결과 위임 처리 설정이 생략됐습니다. 그대로 복사하면 완성된 프로덕션 연동이 된다고 설명할 수는 없습니다. 인증, 오류 처리, 권한, 취소, 관찰 가능성은 별도로 설계해야 합니다.

사용자의 음성 질문이 GPT-Live-1을 거쳐 Codex 작업으로 위임되고 짧은 음성 답변으로 돌아오는 흐름입니다.
공식 코드 조각은 위임의 왕복을 보여줄 뿐, 운영에 필요한 연결·권한·오류 처리를 완성하지 않습니다.

도입 전 체크리스트

GPT-Live-1 API를 검토한다면 모델 교체부터 하지 말고 현재 구조의 책임 경계를 먼저 그려보세요.

  • STT·LLM·TTS 사이에서 끼어들기와 출력 취소를 어느 코드가 처리하는지 적었다.
  • 침묵, 맞장구, 배경 대화, 발화 정정을 각각 테스트 시나리오로 만들었다.
  • 대화 레이어와 백엔드 모델, 업무 도구의 실패 책임을 나눴다.
  • 단순 업무와 복잡한 업무가 어떤 백엔드 모델로 가는지 정했다.
  • 분당 음성 가격과 백엔드·도구·전화망 비용을 분리해 계산했다.
  • 사람이 이어받아야 할 예외와 권한 경계를 정했다.
  • 공식 예시에 생략된 세션 연결과 위임 처리 범위를 확인했다.

한계와 주의점

GPT-Live-1은 전이중 대화 레이어를 단순하게 만들지만, 정확한 업무 처리와 안전한 도구 실행까지 자동으로 보장하지 않습니다. 고객사 초기 평가와 OpenAI 벤치마크도 우리 통화 환경의 성능을 대신하지 않습니다.

새로운 음성 옵션은 억양, 방언, 언어 선택 폭을 넓히지만 세부 언어 가용성은 계속 바뀔 수 있습니다. 커스텀 보이스는 별도 자격과 요청 절차가 필요합니다. 장시간 대화, 소음이 심한 장소, 전화 회선 품질, 사람에게 넘기는 순간을 실제 조건에서 확인해야 합니다.

마무리

GPT-Live-1 API의 가치는 음성을 더 그럴듯하게 읽는 데만 있지 않습니다. 듣기와 말하기를 한 대화 레이어로 묶고, 깊은 추론과 실제 작업은 백엔드로 분리할 수 있다는 데 있습니다. 먼저 현재 STT·LLM·TTS 전달 지점을 목록으로 만들면 어디를 바꿔야 할지 선명해집니다.

출처

자주 묻는 질문

GPT-Live-1 API는 기존 음성 에이전트와 무엇이 다른가요?
들어오는 음성과 나가는 음성을 한 모델이 함께 처리해, STT·LLM·TTS 사이의 전달에서 생기던 지연과 끼어들기 조율 부담을 줄이는 전이중 음성 모델입니다.
GPT-Live-1 API 비용은 분당 0.05달러가 전부인가요?
아닙니다. 분당 0.05달러는 프런트엔드 음성 레이어 가격입니다. 함께 쓰는 백엔드 모델과 도구, 전화망 등 다른 비용은 별도로 계산해야 합니다.
GPT-Live-1이 백엔드 추론도 모두 처리하나요?
음성 대화를 이어가면서 더 깊은 추론과 도구 호출을 별도의 텍스트 모델이나 서드파티 모델에 맡길 수 있습니다. 어떤 모델과 도구를 붙일지는 개발팀이 설계합니다.