라이프스타일

GPT-Live 1, API에 정식 제공 시작: 전화 상담을 받을 수 있을까, 목소리는 누구의 것일까, 녹음될까

2026년 9월 10일, OpenAI의 API 업데이트 기록에 전이중 음성 모델 GPT-Live 1이 API에서 정식 제공을 시작했다고 기재되었습니다. 개발자는 이를 전화 상담, 앱, 또는 자체 제품에 연동할 수 있습니다. 본 기사는 OpenAI 개발자 문서를 바탕으로 이 모델의 API 사양, 전화 연결 방식과 이 엔드포인트가 발신 통화는 지원하지 않는다고 문서가 밝힌 점, 내장된 12종의 이름 붙은 음성과 문서에 나와 있지 않은 지원 언어, 녹음 처리와 분당 과금 방식을 정리했습니다. 본 사이트는 직접 시험해 보지 않았습니다.

읽는 데 약 16분

오리지널 일러스트: 왼쪽에 스마트폰 한 대가 있고 그 옆에 음파선 네 개가 그려져 있다. 그중 한 줄이 스마트폰 아래에서 오른쪽의 둥근 모서리 패널로 꺾여 이어지고, 패널 안에는 말풍선과 몇 개의 음파가 그려져 있으며, 걸려 온 전화를 뒤에서 음성 모델이 이어받아 응답하는 모습을 나타낸다.
사진: Mokaair (© Mokaair)

OpenAI는 2026년 9월 10일, API 개발자 문서의 업데이트 기록에 새 항목을 기재했습니다. 전이중 음성 모델 GPT-Live 1이 API에서 정식 제공(GA)되었으며, 이에 대응하는 모델 ID는 gpt-live-1, 엔드포인트는 v1/live/sessions입니다. 공식 문서에는 음성 세션이 분당 0.05달러이며 초 단위로 과금되고, 백엔드 모델과 도구 사용량은 별도로 과금된다고 적혀 있습니다. 이것이 의미하는 바는, 듣고 말하기를 동시에 하는 음성 모델이 개발자가 구매해 자신의 전화 시스템이나 앱, 제품에 넣을 수 있는 부품이라는 것입니다.

본 기사는 2026년 9월 18일, OpenAI 개발자 문서의 API 업데이트 기록, GPT-Live 1 모델 페이지, 전화·SIP 연동 가이드, 세션 관리 가이드를 확인했습니다. 확인 당일 시점의 버전을 읽은 것이며, 이 문서 페이지들에는 버전 번호가 없어 내용이 이후 바뀔 수 있습니다. 본 사이트는 이 API를 실제로 연동하거나 시험해 보지 않았으며, 본문의 기능 설명은 모두 OpenAI 측의 설명입니다. 본 기사는 API 개발자 쪽의 이번 업데이트만 다루며, ChatGPT 이용자 쪽의 요금제나 설정은 다루지 않습니다.

9월 10일 업데이트 기록: 정식 제공(GA), 모델 ID와 두 가지 위임 방식

공식 모델 페이지는 GPT-Live 1을 전이중 음성 모델로 정의합니다. 동시에 듣고 말할 수 있으며, 추론과 도구 사용을 백엔드 에이전트에 위임합니다. 즉 자료 조회나 연산이 필요할 때는 그 처리를 뒤에서 맡기면서도 대화는 계속 이어갈 수 있다는 뜻입니다. 업데이트 기록은 9월 10일의 상태를 “API에서 정식(GA)으로 제공 시작”이라고 적었는데, 이는 공급 상태를 나타내는 말이며, 본 기사가 확인한 4개의 문서 어디에도 이것이 처음 등장한 것이라고는 쓰여 있지 않습니다. 오히려 전화 연동 가이드에는 기존 연동이 폐기된 착신 이벤트 이름을 여전히 받을 수 있다고 나와 있어, 그 이전부터 연동이 돌아가고 있었음을 짐작하게 합니다.

모델 페이지에 나온 모델 ID는 gpt-live-1이며, 대응하는 엔드포인트는 v1/live/sessions입니다. 공식 문서는 이를 “매끄러운 끼어들기 처리를 갖춘, 자연스럽고 표현력 있는 음성 대화를 위한 최상위 모델”이라고 설명하는데, 이는 OpenAI 자신의 설명입니다. 이 모델의 입력과 출력은 모두 음성과 텍스트 두 형식이며, 이미지와 동영상은 지원하지 않습니다. 모델 페이지에 나온 지식 기준일은 2025년 7월 31일로, 이는 모델 자체의 학습 데이터 시점을 나타냅니다.

개발자가 GPT-Live 1에 자료 조회나 연산이 필요한 문제를 처리시키려 할 때, 문서에는 두 가지 위임 방식이 나와 있습니다. 하나는 OpenAI 모델과 짝을 이루는 Responses 위임이고, 다른 하나는 개발자가 직접 구축한 백엔드에 연결하는 client 위임입니다. 지정하지 않거나 null로 설정하면 client가 선택됩니다. 문서에는 위임 방식이 세션 시작 후에는 변경할 수 없으며, 바꾸려면 새 세션을 시작해야 한다고 적혀 있습니다.

API에서 이 모델의 사양: 지원 엔드포인트는 단 하나, 무료 등급은 지원하지 않음

GPT-Live 1이 API에서 지원한다고 표시된 엔드포인트는 Live(v1/live/sessions) 하나뿐입니다. 공식 엔드포인트 목록은 Chat Completions, Responses, Realtime 등 기존 엔드포인트와 구버전인 Completions (legacy)까지 모두 지원하지 않는다고 표시하고 있습니다. 전화 연동 가이드 역시 API마다 각자의 인증, 세션 생성 방식, 이벤트 계약이 있어 서로 바꿔 쓸 수 없다고 알려 줍니다.

사용량 계산 방식도 조금 다릅니다. 문서에는 속도 제한이 “동시에 진행 중인 세션 수”로 계산된다고 명시되어 있으며, 무료(Free)는 지원하지 않는 사용 등급으로 나와 있습니다. 계정의 사용 등급에 따라 Tier 1부터 Tier 5까지 각각 25, 50, 200, 300, 500개의 세션을 동시에 열 수 있습니다.

OpenAI 개발자 문서를 바탕으로 정리. 확인일 2026년 9월 18일.
항목내용비고
모델 IDgpt-live-1지원하는 엔드포인트는 v1/live/sessions뿐
지원 모달리티음성과 텍스트(입력·출력 모두)이미지·동영상은 지원하지 않음
위임 방식Responses 위임 또는 client 위임세션 생성 시 선택, 도중 변경 불가
동시 실행 상한Tier 1–5: 25/50/200/300/500무료 등급은 지원하지 않음
음성 요금분당 0.05달러, 초 단위 과금백엔드 모델과 도구는 별도 과금

전화가 걸려 오면, GPT-Live 1은 어떻게 응답을 이어받나

GPT-Live 1을 전화 시스템에 연결하는 방법으로 공식 문서는 두 가지 경로를 제시합니다. 하나는 Direct SIP로, 통화 음성을 전화 사업자와 OpenAI가 주고받고, 개발자의 애플리케이션이 이벤트 알림, 세션 설정, 전화를 받을지 말지의 판단, 비즈니스 로직을 담당합니다. 다른 하나는 서버 오디오 브리지로, 개발자의 애플리케이션이 전화 사업자나 회의실의 음성을 WebSocket을 통해 GPT-Live로 전달하며, 양쪽 연결과 이벤트 변환, 재생, 통화 생명 주기를 모두 직접 관리해야 합니다. 문서에는 Twilio, Telnyx, LiveKit, Daily/Pipecat 같은 업체들이 각자 전용 연동 가이드를 갖추고 있다고 나와 있습니다.

전화가 걸려 온 뒤의 흐름은 이렇습니다. 개발자의 애플리케이션이 자체 인증·라우팅 규칙에 따라 각각 하나의 API 동작으로 수락하거나 거절합니다. 수락할 때는 모델, 음성, 위임 방식 등의 설정을 함께 보내야 하고, 거절할 때는 300에서 699 사이의 SIP 상태 코드(예를 들어 통화 중을 나타내는 486)를 붙여야 합니다. 가장 먼저 도착한 수락 또는 거절 판단이 유효하며, 이후 다시 보내는 판단은 거부됩니다. 통화 중에는 두 가지 동작이 더 있어 전화를 다른 곳으로 넘기거나 바로 끊을 수 있으며, 둘 다 성공하면 내용 없는 200 OK가 반환됩니다.

문서는 이 흐름의 마지막에, 이것이 처리하는 것은 걸려 오는 전화이며 POST /v1/live/sessions를 통해 발신하는 SIP 통화를 만드는 것은 지원하지 않는다고 명시합니다. 발신을 하려면 문서는 개발자에게 파트너의 연동 방식을 쓰라고 안내하며, 발신은 사업자 자신이 책임지는 영역이라고 설명합니다. 문서는 또한 착신에 붙는 SIP 헤더를 신뢰할 수 없는 발신자 정보로 취급해야 하며 인증의 근거로 삼아서는 안 된다고 경고합니다.

4분할 도해: GPT-Live 1이 API에 들어오며 생긴 네 가지 핵심 — 전화는 수신 위주, 지원 언어는 명시되지 않음, 기본값은 녹음 안 함, 음성은 분당 0.05달러
GPT-Live 1이 API에 들어오며 생긴 네 가지 핵심: 전화는 수신 위주, 음성 지원 언어는 명시되지 않음, 기본값은 녹음 안 함, 분당 0.05달러. OpenAI 개발자 문서를 바탕으로 정리, 확인일 2026년 9월 18일. · 사진: Mokaair (© Mokaair)

목소리는 누구의 것인가: 내장 12종, 이 4개 문서엔 지원 언어 목록이 없다

GPT-Live 1의 목소리는 하나만이 아닙니다. 기본값인 marin 외에도 공식 문서는 선택할 수 있는 이름 붙은 음성 12개를 추가로 제시합니다. 예를 들어 언어 항목이 영어, 지역색 항목이 영국으로 표시된 vesper, 같은 영어에 북미로 표시된 gleam, 언어 항목이 포르투갈어이고 지역색 항목이 브라질로 표시된 bossa와 tempo 등입니다. 개발자는 세션을 만들 때 그중 하나를 골라 설정에 넣습니다. 대화가 시작된 뒤에는 도중에 바꿀 수 없고, 바꾸려면 새 세션을 시작해야 합니다.

대만 독자가 눈여겨봐야 할 점이 있습니다. 문서는 이 음성들을 “지역색”이라는 말로 표현하면서도, 이는 어디까지나 말하는 스타일일 뿐 억양의 사실적 재현을 보장하는 것은 아니라고 따로 못 박고 있습니다. 더 중요한 것은, 본 기사가 확인한 4개의 공식 문서 어디에도 이 모델이 어떤 구어를 지원하는지 목록이 나와 있지 않다는 점입니다. 이름 붙은 12개 음성의 언어 항목에는 영어와 포르투갈어뿐이고, 기본 음성인 marin도 언어가 따로 명시돼 있지 않습니다. 문서는 인사말을 다루면서, 개발자에게 발신자가 말을 꺼내기 전까지는 애플리케이션이 지정한 언어를 쓰라고 요구하고, 자사 애플리케이션이 지원하는 언어로 테스트하라고 당부합니다. 다시 말해, 상담 전화 저편에서 실제로 GPT-Live 1이 쓰인다면 그것이 중국어를 얼마나 잘 구사하는지, 이 4개 문서는 답을 주지 않으며, 당연히 할 수 있다고 가정해서는 안 됩니다.

공식 문서에는 승인을 받은 음성이라면 자신의 녹음을 이용해 커스텀 음성을 만들 수 있다고도 나와 있습니다. 세부 사항은 별도 가이드에 있으며 본 기사에서는 깊이 다루지 않습니다.

녹음되는지, 기억은 얼마나 이어지는지, 전화를 몇 분 하면 대략 얼마인지

녹음 여부는 개발자가 정하는 것이며 기본값으로 켜져 있지 않습니다. 공식 문서에는 세션의 녹음 설정이 기본값으로 꺼져 있으며, 개발자가 직접 켜고 프로젝트가 먼저 승인되어야만 완료된 녹음을 다운로드하거나 새 세션으로 “포크”할 수 있다고 명시돼 있습니다. 다운로드와 포크에는 데이터 보관을 허용하는 데이터 정책도 필요합니다. 남겨진 녹음은 30일 뒤 만료됩니다. 프로젝트에서 Zero Data Retention(데이터 제로 보존)을 활성화하면 녹음 설정은 항상 꺼진 것으로 취급되어 다운로드와 포크도 쓸 수 없습니다. 다운로드한 녹음은 스테레오 WAV 파일이며, 입력 음성과 출력 음성이 각각 왼쪽과 오른쪽 채널에 담깁니다.

장시간 통화의 기억에도 상한이 있습니다. 문서에 따르면 세션의 기본 컨텍스트 창은 128,000토큰이며, 여기에는 개발자가 준 지시문, 대화 텍스트, 그리고 대화 기록에는 나타나지 않는 음성 토큰이 포함됩니다. 사용량이 창의 90%를 넘으면 시스템은 같은 세션 안에서 다른 음성 엔진으로 교체합니다. 새 엔진은 원래의 지시문과 함께 최대 8,192토큰의 대화 이력(최근 메시지, 그리고 요약을 쓸 수 있을 때는 이전 메시지의 요약)을 넘겨받습니다. 이는 곧 아주 긴 통화에서는 앞서 나눈 이야기의 세부 내용이 요약되거나 생략될 수 있다는 뜻입니다.

요금 계산 방식 자체는 복잡하지 않습니다. 음성 세션은 분당 0.05달러이며 실제 초 단위로 과금되고, 문서에는 다음 1분 단위로 반올림되지 않는다고 적혀 있습니다. 백엔드 모델과 도구는 각자의 요금으로 별도 과금되며, 이 4개 문서는 이 두 비용을 합친 예시는 보여 주지 않습니다. 다음은 본 기사가 확인일인 2026년 9월 18일 기준 요율로 계산한 것이며 공식 수치가 아닙니다. 음성만으로 3분을 통화하면 단순 계산으로 0.15달러가 되며, 실제 총액은 백엔드가 얼마나 많은 작업을 처리했는지에 달려 있습니다. 세션이 끝날 때 공식 문서가 나열하는 종료 사유에는 애플리케이션이 직접 종료한 경우, 세션이 시간 상한에 도달한 경우, 안전 필터가 중단시킨 경우, 원격 연결이 정상적으로 끝난 경우, 연결이 예기치 않게 끊긴 경우가 포함되지만, 시간 상한이 실제로 몇 분인지는 문서에 나와 있지 않습니다.

자주 묻는 질문

GPT-Live 1은 2026년 9월 10일에야 처음 쓸 수 있게 된 건가요?

업데이트 기록에는 “API에서 정식(GA)으로 제공 시작”이라고 적혀 있는데, 이는 공급 상태를 나타내는 말이며, 본 기사가 확인한 4개의 공식 문서 어디에도 이것이 처음 등장한 것이라고는 쓰여 있지 않습니다. 오히려 전화·SIP 연동 가이드에는 기존 연동이 폐기된 착신 이벤트 이름을 여전히 받을 수 있다고 나와 있어, 그 이전부터 연동이 돌아가고 있었음을 보여 줍니다. 이 4개 문서에는 그보다 앞선 프리뷰 시기나 단계적 공개 일정도 나와 있지 않습니다.

GPT-Live 1은 중국어를 알아듣나요? 전화를 걸어 중국어로 질문할 수 있나요?

본 기사가 확인한 4개의 공식 문서에는 이 모델이 어떤 구어를 지원하는지 나와 있지 않습니다. 문서에 나온 이름 붙은 12개 음성은 언어 항목이 영어와 포르투갈어뿐이고, 기본 음성인 marin도 언어가 따로 표시돼 있지 않습니다. 문서는 인사말을 다루면서 개발자에게 발신자가 말을 꺼내기 전까지는 애플리케이션이 지정한 언어를 쓰라고 요구하고, 자사 애플리케이션이 지원하는 언어로 테스트하라고 당부합니다. 본 기사가 2026년 9월 18일까지 확인한 문서 버전에서는 중국어를 지원한다는 설명을 찾지 못했으며, 유창한 중국어를 알아듣거나 말할 수 있다고 가정해서는 안 됩니다.

대만 개발자도 지금 이 API를 쓸 수 있나요?

본 기사가 확인한 4개의 공식 문서에는 사용할 수 있는 국가나 지역 목록이 나와 있지 않으며, 대만을 따로 언급하지도 않습니다. 신청과 이용이 가능한지는 자신의 계정으로 OpenAI 플랫폼에서 실제로 보이는 화면을 기준으로 확인해야 합니다. 본 기사는 대만 계정이 현재 이 기능을 쓸 수 있는지 검증하지 않았습니다.

기업이 전화 시스템과 연동하려면 OpenAI 공식 경로만 써야 하나요?

꼭 그렇지는 않습니다. 공식 문서에는 이 전화 흐름이 처리하는 것은 걸려 오는 전화이며, POST /v1/live/sessions를 통해 발신하는 SIP 통화를 만드는 것은 지원하지 않는다고 적혀 있습니다. 발신을 하려면 문서는 개발자에게 파트너의 연동 방식을 쓰라고 안내하며, 이름이 언급된 곳은 Twilio, Telnyx, LiveKit, Daily/Pipecat입니다. 이들은 각각 서드파티 업체 자신의 서비스 범위에 속하므로, 실제 기능과 요금은 각 업체의 설명에 따라 다릅니다.

이 음성 세션은 녹음되어 보관되나요?

기본값으로는 그렇지 않습니다. 공식 문서에는 세션의 녹음 설정이 기본값으로 꺼져 있으며, 개발자가 직접 켜고, 프로젝트가 먼저 승인되고, 다운로드와 포크에는 데이터 보관을 허용하는 데이터 정책까지 갖추어야 비로소 녹음이 남는다고 명시돼 있습니다. 남은 녹음은 30일 뒤 만료됩니다. 프로젝트에서 Zero Data Retention(데이터 제로 보존)을 활성화하면 녹음 설정은 항상 꺼진 것으로 취급되어 다운로드할 수 있는 녹음이 없습니다.

전화를 한 통 걸면 대략 얼마가 드나요?

공식적으로 공개된 것은 음성 자체의 요율뿐입니다. 분당 0.05달러이며 실제 초 단위로 과금되고, 확인일은 2026년 9월 18일입니다. 다음은 본 기사의 계산이며 공식 수치가 아닙니다. 3분 통화를 음성만으로 단순 계산하면 0.15달러입니다. 백엔드 모델과 호출한 도구는 각자의 요금으로 별도 과금되며, 실제 통화 한 통의 총액은 얼마나 많은 작업을 처리했는지에 달려 있습니다. 이 4개 문서는 통화 한 통 전체의 총액 예시를 제공하지 않습니다.

  • 라이프스타일

    Gemini 3.8 Live와 Extended Thinking: 새 음성 모델, 내 계정으로 쓸 수 있을까

    2026년 9월 15일, Google은 음성 대화 모델 Gemini 3.8 Live와 Gemini 3.8 Live Extended Thinking 두 가지를 발표했습니다. 본 기사는 Google 공식 발표문, 개발자 게시물, 모델 카드, 가격 페이지를 바탕으로 개발자·기업·일반 사용자·Workspace 구독자가 각각 무엇을 쓸 수 있는지, 요금은 어떻게 계산되는지, 모델 카드가 명시한 지식 컷오프 날짜, 그리고 공식 문서가 밝히지 않은 제공 지역을 정리합니다.

  • 라이프스타일

    GPT-Live로 들으면서 말하는 ChatGPT 음성: 끼어들기, 요금제별 사용량, 녹음 설정

    OpenAI가 2026년 7월 GPT-Live를 발표하면서 ChatGPT 음성 대화는 듣기와 말하기를 동시에 하고 중간에 끼어들 수 있게 되었으며, 검색과 추론은 백그라운드 모델이 맡습니다. 이 글은 공식 설명을 바탕으로 대화 흐름의 변화, 9월 조정 이후 요금제별 모델과 사용량, 요리와 말하기 연습 등의 활용 상황, 녹음 보관과 학습 설정을 정리하고 API 가격도 간단히 다룹니다.

  • 라이프스타일

    OpenAI, Habitat 스토리지 아키텍처 공개: 매주 10억 명 넘게 사용하는 규모와 한계

    2026년 9월 11일, OpenAI는 공식 엔지니어링 블로그에 사내 스토리지 플랫폼 Habitat이 하나의 Python 클라이언트 라이브러리에서 독립된 서비스로 발전하고 올해 2분기에 Rust로 다시 작성된 과정을 설명하는 글을 게시했습니다. 본 기사는 원문을 바탕으로 OpenAI가 스스로 밝힌 요청량, 서비스 지역, 데이터 규모 등의 수치와 공식 문서가 설명하지 않은 내구성 및 지역 세부 사항을 정리한 것입니다. 본 사이트는 직접 시험해 보지 않았고, 이용이나 구매에 관한 어떠한 조언도 제공하지 않습니다.

  • 라이프스타일

    NVIDIA, DGX Spark 64GB 모델 출시: 10월 23일 판매 시작, 시작가 4,999달러, 두 대 연결 시 128GB

    NVIDIA는 2026년 10월 2일 개인용 AI 컴퓨터 DGX Spark에 더 저렴한 64GB 메모리 모델을 추가한다고 발표했다. 10월 23일부터 Acer, ASUS 등 6개 제조사를 통해 공급되며, 주요 대상은 자신의 기기에서 AI 모델을 실행하려는 개발자와 연구자다. NVIDIA가 공개한 사양, 두 대 연결에 관한 설명, 그리고 일반 독자에게 갖는 의미를 정리했다.

최신 여행 소식·가이드

출처

라이프스타일