16 сентября 2026

Голосовой режим ChatGPT в работе: что меняет GPT-Live и как им пользоваться

Говорить человек успевает примерно втрое быстрее, чем печатать. Тем не менее почти все, кто работает с нейросетями всерьёз, продолжают набирать текст. Причина не в привычке, а в том, как были устроены голосовые помощники: вы говорите — они молчат, вы замолкаете — они думают, потом отвечают. Любая пауза на «сейчас посчитаю» превращается в тишину в трубке, а перебить помощника на середине неудачного ответа получалось криво.

Человек и ИИ ведут одновременный живой голосовой диалог

8 июля 2026 года OpenAI выпустила семейство голосовых моделей GPT-Live, которое эту конкретную механику меняет. Ниже — что именно поменялось, где голос действительно экономит время, сколько это стоит и что делать российскому специалисту, которому сервис официально недоступен.

image

Сделайте следующий шаг в карьере

Подберите обучение, которое поможет освоить новые компетенции

Выбрать курс

Что такое GPT-Live и чем он отличается от привычного голосового режима ChatGPT

В документации OpenAI модель gpt-live-1 описана буквально как «a full-duplex voice model for real-time conversations» — полнодуплексная голосовая модель для разговоров в реальном времени. Full-duplex здесь не маркетинговое слово, а техническая характеристика: модель слушает и говорит одновременно, как человек в телефонном разговоре, а не по очереди, как рация.

Практическое следствие одно, но важное: перебивания обрабатываются плавно. Вы можете вклиниться посреди ответа, уточнить условие, и разговор не начнётся заново.

Что модель умеет по документации: аудио и текст на входе, аудио и текст на выходе, потоковая передача, вызов функций (function calling). Чего не умеет: изображения и видео — визуального режима у GPT-Live нет; нет также structured outputs и дообучения. В каталоге API рядом лежит вторая модель, gpt-live-transcribe — «low-latency speech-to-text model for realtime transcription», то есть быстрая расшифровка речи в текст.

Дата отсечки знаний у gpt-live-1 — 31 июля 2025 года. Модель несовместима с Chat Completions, Responses и Realtime: у неё собственный эндпоинт v1/live/sessions. Это значит, что «прикрутить голос» к существующему коду одной строкой не выйдет — интеграцию придётся делать отдельно.

Человек и ИИ ведут одновременный живой голосовой диалог

Full-duplex и двухслойная архитектура: почему разговор не встаёт

Самое интересное — не в голосе, а в разделении труда. Архитектура двухслойная: голосовой слой ведёт разговор, а рассуждения и вызов инструментов делегируются backend-модели. Поддерживаются два режима делегирования — через Responses и на стороне клиента.

Пока backend считает, ищет, лезет в базу или вызывает внешний сервис, голосовой слой продолжает разговор. То есть модель может сказать «секунду, поднимаю данные по договору» — и это не заглушка, а честное отражение того, что задача выполняется в фоне.

Именно здесь проходит граница между «поболтать с ассистентом» и рабочим инструментом. Разговор, который не умирает во время долгой операции, — то, чего не хватало голосовым интерфейсам последние десять лет.

Имя backend-модели в доступной документации не названо; вторичные источники называют GPT-5.5, но первоисточником это не подтверждено, и мы это за факт не выдаём.

Пять сценариев, где голос уже экономит время

Оговорка сразу: списка компаний-клиентов GPT-Live вендор не публиковал. Это не «кейсы заказчиков», а сценарии, которые прямо следуют из возможностей модели — аудио на входе и выходе, function calling, работа поверх телефонии.

1. Разбор длинных созвонов на ходу. gpt-live-transcribe даёт расшифровку с низкой задержкой, а голосовой слой позволяет тут же уточнить: «повтори, что клиент сказал про сроки». Для менеджеров проектов и продавцов это снимает вечернюю работу по расшифровке.

2. Диктовка с правкой вслух. Черновик письма, ТЗ, скрипта звонка надиктовывается, а правки вносятся репликами, без переключения на клавиатуру. Про то, как довести такой черновик до человеческого стиля, у нас есть отдельный разбор — голос здесь снимает только этап набора.

3. Голосовой доступ к внутренним данным. Через function calling модель дергает CRM или складскую базу: «сколько осталось позиций по артикулу», «какой статус заявки». Полезно там, где руки заняты, — склад, производство, монтаж, автомобиль.

4. Телефонная линия первой поддержки. Поддержка SIP означает, что модель ставится на входящий телефонный номер и снимает типовые вопросы: график, статус, документы. Перебивания обрабатываются корректно, а это половина проблем голосовых роботов.

5. Тренажёр переговоров и языка. Живой диалог без пауз годится для отработки продаж, собеседований, разговорного английского — сценарий, где важна не точность, а естественность темпа.

Где голос не поможет: там, где нужен проверяемый машиночитаемый результат. Structured outputs не поддерживаются, картинок и видео нет, значит, отчёт по таблице, разбор скриншота или генерация документа — не сюда. Задачи такого рода остаются за текстовыми моделями.

Голосовой ИИ помогает специалистам в разных рабочих ситуациях

Пора сменить профессию? Начните с понятного плана

Подберите программу под ваш опыт, цели и желаемый формат занятости

  • Востребованные навыки без лишней теории.
  • Поддержку экспертов на каждом этапе
  • Помощь с выходом на рынок труда
Подобрать обучение
image

Голосовой ИИ помогает специалистам в разных рабочих ситуациях

Подключение к API: WebRTC, WebSockets, SIP и цена минуты

Способов интеграции по гайду четыре: WebRTC для браузера, WebSockets, серверное управление сессией и телефония через SIP.

Цена — 0,05 доллара за минуту голосовой сессии, тарификация посекундная, без округления до полной минуты. Работа backend-модели и вызванных инструментов оплачивается отдельно, поэтому реальный счёт за сложный сценарий будет выше базовой ставки.

Лимиты: от 25 одновременных сессий на первом тарифном уровне до 500 на пятом. На бесплатном уровне API модель недоступна вовсе.

Наша оценка. Главное в этом релизе недооценено почти во всех пересказах: важна не кнопка микрофона в приложении, а строчка про SIP. Голосовая модель, которая корректно отрабатывает перебивания и подключается к телефонной линии посекундно, — это не улучшение ассистента в смартфоне, а дешёвая замена скриптовому колл-роботу. Узкое место ровно одно и оно архитектурное: без structured outputs результат разговора невозможно гарантированно получить в машиночитаемом виде. Значит, GPT-Live — про разговор и про действие через функции, но не про документ на выходе. Кто попробует посадить его на оформление заявок «под ключ», упрётся в это в первую неделю.

Голосовой режим ChatGPT в России: ограничения и чем заменить

России нет в официальном списке поддерживаемых стран и территорий OpenAI — между Romania и Rwanda записи Russia просто нет. Российские карты компания не принимает, поэтому легально недоступны и подписка ChatGPT, и биллинг API. Схемы с зарубежными картами и посредниками существуют, но вендором не поддерживаются и являются обходом его правил — бизнес-процесс на этом строить нельзя: доступ отключается без предупреждения.

Что работает из России легально и с оплатой в рублях:

  • Яндекс: SpeechKit для синтеза и распознавания речи, Yandex AI Studio для моделей, Алиса как готовый голосовой интерфейс.
  • Сбер: GigaChat и GigaChat API, речевой стек Salute Speech. Для госорганизаций и финсектора значима сертификация.
  • МТС: Audiogram — синтез и распознавание речи.

Честно про разницу: full-duplex-разговора с фоновым выполнением задачи ни один из них сегодня как заявленную функцию не даёт. Собрать похожий сценарий можно — распознавание, модель, синтез в связке, — но паузу на «думаю» вы в такой схеме услышите. Это не повод отказываться: для телефонной поддержки и расшифровки созвонов российского стека уже достаточно.

Российские голосовые сервисы как доступная альтернатива

Российские голосовые сервисы как доступная альтернатива

Частые вопросы

Чем GPT-Live отличается от старого Advanced Voice Mode в ChatGPT? Ключевое отличие по документации — full-duplex: модель слушает и говорит одновременно и делегирует тяжёлые задачи backend-модели, не обрывая разговор. Утверждения о том, что GPT-Live полностью заменяет Advanced Voice Mode, встречаются во вторичных источниках, но официального подтверждения мы не нашли.

Поддерживает ли GPT-Live работу с видео и изображениями? Нет. В документации указаны только аудио и текст на входе и выходе; image и video не поддерживаются.

Сколько стоит минута разговора через GPT-Live API? 0,05 доллара за минуту голосовой сессии с посекундной тарификацией. Использование backend-модели и инструментов тарифицируется отдельно.

Можно ли использовать GPT-Live бесплатно? В API — нет: пользователям бесплатного уровня модель недоступна. Распределение по тарифам ChatGPT во вторичных источниках описывают, но в каталоге API соответствующих моделей нет, и как факт мы это не приводим.

Какие российские голосовые сервисы работают как аналог? Яндекс SpeechKit и Yandex AI Studio, GigaChat с Salute Speech от Сбера, Audiogram от МТС. Все доступны из России и оплачиваются в рублях.

Превратите интерес к теме в новую профессию

Оставьте заявку — поможем выбрать программу и расскажем об условиях обучения

Оставить заявку
icon