В июле OpenAI представила семейство моделей GPT-5.6 и инструмент ChatGPT Work. Тогда компания расширила возможности ChatGPT для решения сложных рабочих задач и взаимодействия с другими сервисами. Теперь OpenAI обновила и голосовое общение в ChatGPT, переведя его на модель GPT-Live с full-duplex-архитектурой, которая может одновременно слушать пользователя и формировать устный ответ. Новый режим доступен в приложениях для Android и iOS, а также в веб-версии, а платные пользователи получили доступ к GPT-Live-1 с возможностью выбора уровня интеллекта. Об этом сообщило издание Engadget.
Первый Voice Mode в ChatGPT, запущенный в 2023 году, работал через три отдельные системы. Речь пользователя сначала преобразовывалась в текст, после чего языковая модель создавала ответ, а отдельная система синтеза речи озвучивала его. Позже OpenAI перешла к Advanced Voice Mode на базе единой мультимодальной модели.
Теперь основным голосовым решением стал GPT-Live. Его полнодуплексная архитектура позволяет системе одновременно воспринимать речь и говорить. Это должно устранить одну из проблем предыдущего режима, когда короткая пауза могла восприниматься как завершение реплики, и ChatGPT начинал отвечать до того, как пользователь заканчивал мысль.
Во время разговора GPT-Live также может вставлять короткие голосовые реакции, характерные для обычного диалога. Более сложные задачи модель способна передавать другим системам, в частности GPT-5.5, если запрос требует дополнительного анализа или поиска.
GPT-Live доступен в мобильных приложениях ChatGPT для Android и iOS, а также через браузер. Пользователи тарифов Pro, Plus и Go получают GPT-Live-1, тогда как бесплатный тариф использует GPT-Live-1 mini. Новый режим заменил предыдущий Advanced Voice в качестве стандартного варианта голосового взаимодействия.
Для запуска нужно нажать значок Voice справа от поля ввода. При первом использовании приложение может запросить доступ к микрофону. После активации на экране появляется интерактивный индикатор голосового режима.
В настройках GPT-Live-1 доступны три уровня работы модели — Instant, Medium и High. Instant ориентирован на быстрые повседневные ответы, тогда как Medium и High выделяют больше вычислительных ресурсов для более сложных запросов. В GPT-Live-1 mini эта функция пока недоступна.
Голосовой режим может оставаться активным после перехода в другое приложение или блокировки смартфона. В то же время GPT-Live пока не поддерживает демонстрацию экрана и видео. Для этих возможностей пользователь может вернуться к предыдущей голосовой модели через настройки ChatGPT. Там же можно выбрать другой голос, изменить язык и установить Voice в качестве стандартного режима запуска приложения.
Одним из ключевых изменений стала возможность вести разговор без строгого разделения на отдельные реплики. Пользователь может начинать говорить ещё во время ответа ChatGPT, а система лучше распознает паузы и продолжение фраз.
GPT-Live также можно использовать для перевода разговоров в реальном времени. Во время сеанса доступна текстовая расшифровка диалога. Если для ответа требуется визуальное представление информации, ChatGPT может показать интерактивный виджет параллельно с голосовым ответом.
По умолчанию GPT-Live работает в режиме Instant. Для сложных запросов система может передавать поиск или углубленный анализ более мощным моделям, не прерывая голосовой диалог. Режимы Medium и High увеличивают время обработки запроса, но ориентированы на более точные ответы по сложным темам.
Напомним, что развитие голосовых функций ChatGPT происходит на фоне более широких изменений в способах использования сервиса по всему миру. OpenAI впервые обнародовала статистику, охватывающую сообщения более одного миллиарда пользователей тарифных планов Free, Go, Plus и Pro. По данным компании, на работе люди более чем в два раза чаще используют ChatGPT для конкретных задач — написания текстов, программирования, редактирования и анализа. Доля мультимедийных запросов после запуска ChatGPT Images 2.0 в апреле 2026 года выросла до 7,8% от всех сообщений.
