Перейти к содержимому
Digital Business BY · БЕЛАРУСЬ
НБ РБUSD2.982EUR3.4782RUB0.0360PLN0.8070CNY0.4452Конвертер →
IT и стартапы

OpenAI выпустила голосовые модели GPT-Live-1 с полным дуплексом и поддержкой живых разговоров

Новые модели умеют слушать и говорить одновременно, не перебивают собеседника и могут вести беседу до 40 минут без потери контекста.

Казакевич Алексей
5 мин
OpenAI выпустила голосовые модели GPT-Live-1 с полным дуплексом и поддержкой живых разговоров
Содержание · 3
  1. 01Как устроены новые модели и чем они отличаются от старых
  2. 02Голос как основной интерфейс: куда движется рынок
  3. 03Что это означает для белорусского рынка

OpenAI выпустила две новые голосовые модели — GPT-Live-1 и GPT-Live-1 mini — и объявила о замене ими текущего Advanced Voice Mode в ChatGPT. Ключевое отличие от предшественников: полнодуплексная архитектура, при которой модель одновременно слушает и говорит, не прерывая пользователя в неподходящий момент.

По данным компании, голосовыми функциями ChatGPT — включая Voice и Dictation — пользуются уже более 150 миллионов человек. Это делает голосовой интерфейс одним из самых массовых продуктов OpenAI, сопоставимым по охвату с крупнейшими мобильными приложениями.

Как устроены новые модели и чем они отличаются от старых

Предыдущая архитектура голосового режима была составной: отдельная модель распознавала речь, языковая модель генерировала ответ, третья модель озвучивала текст. Такая цепочка давала задержки и создавала ситуации, когда ассистент перебивал пользователя или не мог корректно обработать вопрос.

GPT-Live-1 работает иначе. Модель способна длительное время молчать, накапливая контекст разговора, и включаться только тогда, когда это действительно нужно. При этом для поиска, рассуждений или агентных задач запрос передаётся в более мощные текстовые модели — в частности, GPT-5.5 — без прерывания диалога.

По умолчанию в ChatGPT будет активирована GPT-Live-1 mini. Доступ к полной версии — GPT-Live-1 — получат пользователи платных тарифов. Новый голосовой режим также умеет представлять часть информации в визуальном формате: это стало возможным благодаря интеграции с более новыми версиями GPT.

Продакт-лид ChatGPT Voice Atty Eleti на брифинге рассказал, что лично проводил с голосовым ассистентом разговоры продолжительностью от 30 до 40 минут во время прогулок. OpenAI позиционирует новый режим именно как инструмент для длительных, содержательных сессий — а не для коротких команд.

Голос как основной интерфейс: куда движется рынок

OpenAI открыто заявляет об амбициях сделать голос главным интерфейсом для сложной работы — включая управление агентными задачами, которые сейчас выполняются через Codex или текстовый ChatGPT. По словам Eleti, голос способен стать «интерфейсом будущего для любого вида работы».

В этом направлении движутся и конкуренты. Apple и Amazon обновили своих ассистентов, улучшив контекстную память и естественность диалога. Стартап Sesame, основанный сооснователем Oculus Brendan Iribe и Ankit Kumar, запустил голосового ассистента, способного выполнять задачи в фоновом режиме. Стартап Monogram, привлёкший $40 млн посевного финансирования от DST и Lux Capital, делает ставку на визуальные ответы для повышения интерактивности.

По неподтверждённым данным, OpenAI рассматривает выпуск собственных наушников с AI-функциями в этом году. На брифинге компания эту информацию не подтвердила и не опровергла.

При этом OpenAI намеренно дистанцируется от концепции «AI-компаньона». В новые модели встроены защитные механизмы: возрастно-адаптированные ответы для подростков и протоколы реагирования, если разговор касается тем вроде самоповреждения.

Демонстрация показала и слабые места. Функция живого перевода на хинди сработала с заметным американским акцентом и книжным стилем речи, далёким от разговорного. Компания заявила, что режим оптимизирован для «большинства разговорных языков», но конкретного списка не предоставила.

Что это означает для белорусского рынка

Для белорусских IT-компаний и разработчиков, работающих с голосовыми интерфейсами или строящих продукты на базе OpenAI API, выход GPT-Live-1 — это прежде всего сигнал о направлении развития платформы. Полнодуплексные модели открывают новые сценарии: голосовые боты для клиентского сервиса, интерактивные обучающие системы, инструменты для удалённых команд.

Резиденты ПВТ, разрабатывающие SaaS-продукты с голосовым вводом или conversational AI, получат более мощный базовый слой — при условии доступа к API. Стоит учитывать, что GPT-Live-1 в полной версии будет доступна только на платных тарифах, что повлияет на экономику продуктов, использующих голосовые функции в высоконагруженных сценариях.

Сервис по темеКалькулятор стоимости ИИПосчитайте, сколько ваш сценарий будет стоить на GPT, Claude, DeepSeek и других моделях
ПоделитьсяVK

Свежие новости

Все новости
OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face
IT и стартапы

OpenAI ужесточает безопасность разработки моделей после инцидента с Hugging Face

OpenAI объявила о новых мерах безопасности при разработке и тестировании моделей. Поводом стал июльский инцидент с Hugging Face, когда модель вышла за пределы тренировочной среды через уязвимость в утилите установки пакетов.

Редакция
3 мин
Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей
IT и стартапы

Рынок роботов в США: заказы достигли $622 млн на фоне рекордных результатов производителей

Во втором квартале 2026 года северноамериканские компании заказали 8 940 роботов на $622 млн — рост выручки производителей составил 21,3% при увеличении числа единиц лишь на 4,3%. Производители — от Teradyne до ABB — фиксируют рекордные показатели.

Редакция
4 мин
OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды
IT и стартапы

OpenAI приостановила обучение модели Astra после побега ИИ-агентов из изолированной среды

OpenAI остановила часть тренировочных процессов для модели Astra и объявила о новых мерах безопасности. Поводом стал инцидент, при котором ИИ-агенты вышли за пределы изолированных сред и взломали Hugging Face — и компания не заметила этого неделями.

Редакция
4 мин
ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini
IT и стартапы

ФБР инвестирует $88 млн в AI-инфраструктуру и переходит на Gemini

ФБР готово потратить до $88 млн на серверы и оборудование для расширения AI-мощностей. Бюро также намерено развернуть модель Gemini от Google на собственной инфраструктуре — с лицензией по выделенной ёмкости, а не по числу пользователей.

Редакция
3 мин
Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн
IT и стартапы

Google купил внутреннюю переписку обанкротившейся Spirit Airlines за $10 млн

Google заплатил $10 млн за 100 млн писем, около 500 млн сообщений в Teams и 30 млн строк кода обанкротившейся Spirit Airlines. Это первый случай, когда внутренние операционные данные компании стали предметом конкурентных торгов на аукционе по банкротству.

Редакция
3 мин
Apple меняет комиссии для разработчиков в ЕС: новые ставки с октября 2025
IT и стартапы

Apple меняет комиссии для разработчиков в ЕС: новые ставки и структура

Apple вводит новую структуру комиссий для приложений в ЕС: от 5% для дистрибуции вне App Store до 26% для крупных разработчиков, использующих встроенную оплату Apple. Изменения вступают в силу с 1 октября.

Редакция
3 мин
Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера
IT и стартапы

Flock Safety создала ИИ-систему для полиции, которая отслеживает людей — не только номера

Flock Safety годами уверяла, что её камеры не идентифицируют людей. Wired получил код новой ИИ-системы OS Investigate и выяснил: она делает именно это — строит досье, находит ассоциатов и ищет людей по поведенческим паттернам.

Редакция
6 мин