Gemini 3.8 Live по $0.023/мин: Google подрывает рынок голосового AI
Google выпустил Gemini 3.8 Live 15 сентября по цене $0.005 за минуту аудиовхода и $0.018 за минуту аудиовыхода. Это $0.023 за минуту двустороннего разговора, или примерно $1.38 за час работы голосового агента в реальном времени — до учёта задержки вызовов инструментов, стриминговой инфраструктуры или исходящего телефонного трафика. Для всех, кто сегодня использует каскадный пайплайн из speech-to-text плюс LLM плюс text-to-speech, это число — главный ориентир для сравнения в этом квартале.
Что произошло
Как сообщил blog.google, Google DeepMind выпустил три новые аудиомодели в Gemini API и Google AI Studio: Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking и (выпущенный месяцем ранее) Gemini 3.5 Transcribe. Пост был написан Алисой Фортин, Product Manager в DeepMind, и Тором Шеффом из технической команды DevX.
Ключевые возможности: 3.8 Live — это нативная модель speech-to-speech, способная выполнять задачи в процессе диалога. Вариант Extended Thinking добавляет настраиваемое фоновое рассуждение для многошаговых запросов и, по данным Google, в настоящее время занимает первое место в рейтинге Speech-to-Speech от Artificial Analysis. Языковое покрытие — 97+ для Live-моделей и 85+ для Transcribe. 3.5 Transcribe демонстрирует среднее значение Word Error Rate в 4.0% в стриминговом режиме и 2.6% в нестриминговом, с настройкой пользовательского словаря до 1 000 терминов и режимом Smart, который удаляет слова-паразиты.
Распространение продумано заранее. Live-модели поставляются через Live API с именованными партнёрами по интеграции, обеспечивающими медиаплоскость: Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel и Vision Agents. Transcribe также доступен через Interactions API, который принимает аудиофайлы длиной до одного часа со структурированными временными метками и метками дикторов. В завершение анонса Google объединил запуск с тремя смежными моделями, уже доступными в API: Gemini 3.5 Live Translate (70+ языков, speech-to-speech), Gemini 3.1 Flash TTS и Lyria 3.5 для генерации музыки.
Техническая архитектура
Ключевое архитектурное утверждение состоит в том, что 3.8 Live является нативной моделью speech-to-speech, а не каскадом. Типичный стек голосового агента выглядит так: аудиовход, ASR-модель, LLM, TTS-модель, аудиовыход. Каждый переход добавляет задержку (как правило, 150–400 мс на этап в продакшне) и каждый переход теряет информацию: просодию, паузы, маркеры переключения кода, фоновые звуки. Нативная модель speech-to-speech объединяет эти этапы в единый прямой проход — вот почему вариант Extended Thinking может «озвучивать прогресс» во время фонового рассуждения, не блокируясь на текстовом шаге.
Пять возможностей важны для инженерных команд, оценивающих эту модель. Асинхронный вызов функций позволяет модели продолжать стриминг аудио пользователю, пока в фоне выполняется вызов инструмента — это главный UX-дефект нынешних голосовых агентов (неловкая тишина, пока LLM ждёт ответа от базы данных). Контекстная привязка к визуальным данным принимает живой видеовход наряду с аудио. Точность ввода буквенно-цифровых данных явно обозначена для кодов подтверждения и номеров заявок — намёк на вертикаль, которую Google явно нацеливает: контакт-центры. Инкрементальные обновления контента встраивают структурированные данные в аудиопоток в процессе ответа. Настраиваемое мышление в варианте Extended Thinking — рычаг, с помощью которого разработчики будут балансировать между задержкой и глубиной рассуждения.
На стороне транскрипции значение WER 2.6% в нестриминговом режиме — это число, которое сбрасывает отраслевые ожидания. Для сравнения: операторы-люди обычно набирают 4–5% на разговорном английском. Показатель 4.0% в стриминговом режиме важнее для субтитрирования в реальном времени и аналитики колл-центров, поскольку стриминговый WER обычно на 1–2 процентных пункта хуже пакетного. Настройка пользовательского словаря из 1 000 терминов — значимая верхняя граница, хотя Google не раскрывает, снижает ли использование словаря общую точность распознавания при его активной загрузке — а именно это и является реальным сценарием отказа в продакшне. Пока неизвестно, насколько чувствителен WER к шумному телефонному аудио (8 кГц узкополосный), и источник не разбивает WER по языкам среди 85+ поддерживаемых.
Кто в зоне риска
Наиболее уязвимая категория — независимые вендоры транскрипции в реальном времени, чьё единственное конкурентное преимущество заключается в точности стримингового ASR. Когда крупный технологический игрок выпускает 4.0% стриминговый WER как универсальный API, ценовое давление на специализированных ASR-провайдеров становится однонаправленным. Ожидайте, что в ближайшие два квартала их коммерческие разговоры сместятся от сравнительных показателей точности к соответствию требованиям, развёртыванию on-prem и отраслевым словарям, где список смещения из 1 000 терминов заканчивается.
Второе: разработчики каскадных фреймворков для голосовых агентов. Именованные партнёры Live API (LiveKit, Pipecat, Vercel, Agora, Fishjam, LangChain, Vision Agents) позиционируются как медиаплоскость и слои оркестрации, а не как провайдеры моделей. Это устойчивая позиция. Фреймворковые проекты, пытавшиеся навязывать свою оркестрацию ASR-LLM-TTS, теперь имеют конкурента, чью нижнюю границу задержки они не могут достичь — потому что они по-прежнему платят за три сетевых перехода там, где 3.8 Live обходится одним.
Третье: рабочие процессы голосовой верификации в iGaming и fintech. Точность ввода буквенно-цифровых данных для кодов подтверждения и номеров заявок — это прямое нацеливание Google на KYC-обратные звонки, подтверждения депозитов и сортировку обращений в поддержку. Охват 97+ языков здесь критически важен, потому что именно в таких сценариях европейский оператор обслуживает клиентов в пятнадцати локалях и не хочет пятнадцати отдельных ASR-контрактов.
Четвёртое: Realtime API OpenAI теперь конкурирует с опубликованным рейтингом в таблице лидеров и конкретной ценой за минуту. Документация OpenAI указывает цены Realtime отдельно для аудиовхода и аудиовыхода в токенах, что затрудняет прямое сравнение для команд закупок. Фиксированная поминутная цена Google проще моделируется в таблице, и одно это повлияет на решения по RFP. Мой прогноз: в течение 90 дней как минимум один крупный вендор голосовых агентов опубликует открытое сравнение задержек 3.8 Live с его существующим пайплайном. Если этого не произойдёт — считайте, что числа не в его пользу.
Руководство к действию для AI-разработки
Конкретные шаги для технических руководителей на этой неделе. Первое: постройте модель затрат. Возьмите среднюю длительность сессии вашего текущего голосового агента и умножьте на $0.023 за минуту двустороннего аудио. Если ваш текущий счёт за STT плюс LLM плюс TTS на сессию превышает примерно 1.5x от этой цифры — у вас есть бизнес-кейс для миграции, который стоит зафиксировать. Если нет — стоимость переключения пока, вероятно, не оправдана.
Второе: оцените WER на вашем реальном аудио, а не на LibriSpeech или маркетинговых материалах вендора. Показатель 2.6% нестримингового WER — это среднее по оценочной выборке Google. Аудио вашего колл-центра с тремя одновременно говорящими на шумной линии не достигнет этого значения. Возьмите выборку из 200 записей из продакшна, прогоните через 3.5 Transcribe через Interactions API и сравните с вашим текущим решением.
Третье: протестируйте асинхронный вызов функций на реалистичном графе инструментов. Демонстрационный сценарий прост; продакшн-сценарий — это клиент, задающий вопрос, который требует двух последовательных запросов к базе данных и одного вызова стороннего API. Измерьте, как модель озвучивает прогресс и не допускает ли галлюцинаций в ожидании ответа на вызов инструмента.
Четвёртое: если вы строите оркестрацию агентов, воспринимайте список партнёров Live API как сигнал о том, где Google ожидает размещение медиаплоскости. Интеграция с одним из этих семи партнёров сегодня — более низкорисковый архитектурный выбор, чем создание собственного WebRTC-слоя. Изучите паттерны MCP для стороны вызовов инструментов, чтобы не оказаться привязанными к схеме вызова функций одного вендора модели.
Ключевые выводы
- Gemini 3.8 Live стоит $0.023/мин двустороннего аудио ($0.005 вход, $0.018 выход), устанавливая публичный ориентир для экономики каскадных голосовых стеков.
- Gemini 3.5 Transcribe показывает WER 2.6% в нестриминговом и 4.0% в стриминговом режиме для 85+ языков, создавая давление на независимых вендоров ASR реального времени.
- Нативный speech-to-speech с асинхронным вызовом функций решает проблему неловкой тишины, которая преследует каскадные голосовые агенты во время вызовов инструментов.
- Live API запускается с семью именованными партнёрами медиаплоскости, включая LiveKit, Pipecat и Agora, обозначая предпочтительную топологию развёртывания Google.
- Неизвестные переменные для тестирования: деградация WER на телефонном аудио 8 кГц, компромисс точности при загрузке custom_vocabulary близко к лимиту 1 000 терминов, и дисперсия WER по языкам среди 85+ поддерживаемых.
Часто задаваемые вопросы
В: Как ценообразование Gemini 3.8 Live сравнивается с запуском каскадного голосового пайплайна?
При $0.005/мин за вход и $0.018/мин за выход двусторонний разговор обходится примерно в $1.38 за час аудио. Команды, использующие отдельные STT, LLM и TTS-провайдеры, как правило, платят больше за сессию после суммирования счетов всех трёх вендоров плюс накладные расходы на задержку оркестрации — хотя точное сравнение зависит от расхода токенов LLM на ход.
В: Является ли WER 2.6% действительно хорошим показателем для продакшн-транскрипции?
Да, этот показатель находится на уровне или ниже точности операторов-людей на разговорном английском, которая обычно составляет 4–5%. Оговорка: это нестриминговое среднее по оценочной выборке Google. Реальное производственное аудио (шумные телефонные линии, перекрывающиеся голоса, сильные акценты) покажет худший результат — поэтому перед принятием решения проводите тест на своём корпусе.
В: В чём практическая разница между Gemini 3.8 Live и 3.8 Live Extended Thinking?
3.8 Live — стандартная нативная модель speech-to-speech для диалоговых агентов. Extended Thinking добавляет настраиваемое фоновое рассуждение для сложных многошаговых запросов и может озвучивать прогресс в процессе мышления. Используйте Extended Thinking, когда точность многоходовых рассуждений важнее минимально возможной задержки; используйте стандартный 3.8 Live для диалогов, чувствительных к задержке.
Четыре пользователя подали в суд на крупнейшие ИИ-компании за предполагательный сговор о замедлении
Четыре подписчика чат-ботов подали коллективный иск, утверждая, что Anthropic, OpenAI, Google и xAI договорились сдерживать развитие своих моделей. Закон Шермана встречает ИИ.
Ценовая война LLM: Opus 5.5 снижает цены на 20% накануне IPO
Anthropic, Google и четыре китайских лаборатории выпускают базовые модели в одно двухнедельное окно. Ценовой сигнал важнее результатов бенчмарков.
Субмиллисекундная задержка — новый стандарт iGaming в Индии
Развёртывание 5G в Индии вынуждает бэкенды iGaming обеспечивать субмиллисекундную задержку и миллионы одновременных запросов. Вот что это реально стоит и где всё ломается.




