Говорить человек успевает примерно втрое быстрее, чем печатать. Тем не менее почти все, кто работает с нейросетями всерьёз, продолжают набирать текст. Причина не в привычке, а в том, как были устроены голосовые помощники: вы говорите — они молчат, вы замолкаете — они думают, потом отвечают. Любая пауза на «сейчас посчитаю» превращается в тишину в трубке, а перебить помощника на середине неудачного ответа получалось криво.
8 июля 2026 года OpenAI выпустила семейство голосовых моделей GPT-Live, которое эту конкретную механику меняет. Ниже — что именно поменялось, где голос действительно экономит время, сколько это стоит и что делать российскому специалисту, которому сервис официально недоступен.
Сделайте следующий шаг в карьере
Подберите обучение, которое поможет освоить новые компетенции
В документации OpenAI модель gpt-live-1 описана буквально как «a full-duplex voice model for real-time conversations» — полнодуплексная голосовая модель для разговоров в реальном времени. Full-duplex здесь не маркетинговое слово, а техническая характеристика: модель слушает и говорит одновременно, как человек в телефонном разговоре, а не по очереди, как рация.
Практическое следствие одно, но важное: перебивания обрабатываются плавно. Вы можете вклиниться посреди ответа, уточнить условие, и разговор не начнётся заново.
Что модель умеет по документации: аудио и текст на входе, аудио и текст на выходе, потоковая передача, вызов функций (function calling). Чего не умеет: изображения и видео — визуального режима у GPT-Live нет; нет также structured outputs и дообучения. В каталоге API рядом лежит вторая модель, gpt-live-transcribe — «low-latency speech-to-text model for realtime transcription», то есть быстрая расшифровка речи в текст.
Дата отсечки знаний у gpt-live-1 — 31 июля 2025 года. Модель несовместима с Chat Completions, Responses и Realtime: у неё собственный эндпоинт v1/live/sessions. Это значит, что «прикрутить голос» к существующему коду одной строкой не выйдет — интеграцию придётся делать отдельно.
Человек и ИИ ведут одновременный живой голосовой диалог
Самое интересное — не в голосе, а в разделении труда. Архитектура двухслойная: голосовой слой ведёт разговор, а рассуждения и вызов инструментов делегируются backend-модели. Поддерживаются два режима делегирования — через Responses и на стороне клиента.
Пока backend считает, ищет, лезет в базу или вызывает внешний сервис, голосовой слой продолжает разговор. То есть модель может сказать «секунду, поднимаю данные по договору» — и это не заглушка, а честное отражение того, что задача выполняется в фоне.
Именно здесь проходит граница между «поболтать с ассистентом» и рабочим инструментом. Разговор, который не умирает во время долгой операции, — то, чего не хватало голосовым интерфейсам последние десять лет.
Имя backend-модели в доступной документации не названо; вторичные источники называют GPT-5.5, но первоисточником это не подтверждено, и мы это за факт не выдаём.
Оговорка сразу: списка компаний-клиентов GPT-Live вендор не публиковал. Это не «кейсы заказчиков», а сценарии, которые прямо следуют из возможностей модели — аудио на входе и выходе, function calling, работа поверх телефонии.
1. Разбор длинных созвонов на ходу. gpt-live-transcribe даёт расшифровку с низкой задержкой, а голосовой слой позволяет тут же уточнить: «повтори, что клиент сказал про сроки». Для менеджеров проектов и продавцов это снимает вечернюю работу по расшифровке.
2. Диктовка с правкой вслух. Черновик письма, ТЗ, скрипта звонка надиктовывается, а правки вносятся репликами, без переключения на клавиатуру. Про то, как довести такой черновик до человеческого стиля, у нас есть отдельный разбор — голос здесь снимает только этап набора.
3. Голосовой доступ к внутренним данным. Через function calling модель дергает CRM или складскую базу: «сколько осталось позиций по артикулу», «какой статус заявки». Полезно там, где руки заняты, — склад, производство, монтаж, автомобиль.
4. Телефонная линия первой поддержки. Поддержка SIP означает, что модель ставится на входящий телефонный номер и снимает типовые вопросы: график, статус, документы. Перебивания обрабатываются корректно, а это половина проблем голосовых роботов.
5. Тренажёр переговоров и языка. Живой диалог без пауз годится для отработки продаж, собеседований, разговорного английского — сценарий, где важна не точность, а естественность темпа.
Где голос не поможет: там, где нужен проверяемый машиночитаемый результат. Structured outputs не поддерживаются, картинок и видео нет, значит, отчёт по таблице, разбор скриншота или генерация документа — не сюда. Задачи такого рода остаются за текстовыми моделями.

Пора сменить профессию? Начните с понятного плана
Подберите программу под ваш опыт, цели и желаемый формат занятости
Голосовой ИИ помогает специалистам в разных рабочих ситуациях
Способов интеграции по гайду четыре: WebRTC для браузера, WebSockets, серверное управление сессией и телефония через SIP.
Цена — 0,05 доллара за минуту голосовой сессии, тарификация посекундная, без округления до полной минуты. Работа backend-модели и вызванных инструментов оплачивается отдельно, поэтому реальный счёт за сложный сценарий будет выше базовой ставки.
Лимиты: от 25 одновременных сессий на первом тарифном уровне до 500 на пятом. На бесплатном уровне API модель недоступна вовсе.
Наша оценка. Главное в этом релизе недооценено почти во всех пересказах: важна не кнопка микрофона в приложении, а строчка про SIP. Голосовая модель, которая корректно отрабатывает перебивания и подключается к телефонной линии посекундно, — это не улучшение ассистента в смартфоне, а дешёвая замена скриптовому колл-роботу. Узкое место ровно одно и оно архитектурное: без structured outputs результат разговора невозможно гарантированно получить в машиночитаемом виде. Значит, GPT-Live — про разговор и про действие через функции, но не про документ на выходе. Кто попробует посадить его на оформление заявок «под ключ», упрётся в это в первую неделю.
России нет в официальном списке поддерживаемых стран и территорий OpenAI — между Romania и Rwanda записи Russia просто нет. Российские карты компания не принимает, поэтому легально недоступны и подписка ChatGPT, и биллинг API. Схемы с зарубежными картами и посредниками существуют, но вендором не поддерживаются и являются обходом его правил — бизнес-процесс на этом строить нельзя: доступ отключается без предупреждения.
Что работает из России легально и с оплатой в рублях:
Честно про разницу: full-duplex-разговора с фоновым выполнением задачи ни один из них сегодня как заявленную функцию не даёт. Собрать похожий сценарий можно — распознавание, модель, синтез в связке, — но паузу на «думаю» вы в такой схеме услышите. Это не повод отказываться: для телефонной поддержки и расшифровки созвонов российского стека уже достаточно.

Российские голосовые сервисы как доступная альтернатива
Чем GPT-Live отличается от старого Advanced Voice Mode в ChatGPT? Ключевое отличие по документации — full-duplex: модель слушает и говорит одновременно и делегирует тяжёлые задачи backend-модели, не обрывая разговор. Утверждения о том, что GPT-Live полностью заменяет Advanced Voice Mode, встречаются во вторичных источниках, но официального подтверждения мы не нашли.
Поддерживает ли GPT-Live работу с видео и изображениями? Нет. В документации указаны только аудио и текст на входе и выходе; image и video не поддерживаются.
Сколько стоит минута разговора через GPT-Live API? 0,05 доллара за минуту голосовой сессии с посекундной тарификацией. Использование backend-модели и инструментов тарифицируется отдельно.
Можно ли использовать GPT-Live бесплатно? В API — нет: пользователям бесплатного уровня модель недоступна. Распределение по тарифам ChatGPT во вторичных источниках описывают, но в каталоге API соответствующих моделей нет, и как факт мы это не приводим.
Какие российские голосовые сервисы работают как аналог? Яндекс SpeechKit и Yandex AI Studio, GigaChat с Salute Speech от Сбера, Audiogram от МТС. Все доступны из России и оплачиваются в рублях.
Превратите интерес к теме в новую профессию
Оставьте заявку — поможем выбрать программу и расскажем об условиях обучения
Оставить заявку