Gemini 3.8 Live за $0.023/хв: Google підриває ринок голосового AI
Google випустила Gemini 3.8 Live 15 вересня за $0,005 за хвилину аудіовходу та $0,018 за хвилину виходу. Це $0,023 за хвилину двосторонньої розмови, або приблизно $1,38 за годину роботи живого голосового агента — до того, як ви додасте затримку на виклики інструментів, інфраструктуру стрімінгу або вивід через телефонію. Для тих, хто сьогодні використовує каскадний конвеєр «розпізнавання мовлення + LLM + синтез мовлення», саме ця цифра є орієнтиром для порівняння цього кварталу.
Що сталося
Як повідомив blog.google, Google DeepMind випустила три нові аудіомоделі в Gemini API та Google AI Studio: Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking і (випущену місяцем раніше) Gemini 3.5 Transcribe. Автори публікації — Аліса Фортін, продакт-менеджер DeepMind, і Тор Шаефф із технічного відділу DevX.
Ключові можливості: 3.8 Live — це нативна модель «мовлення-в-мовлення», яка може виконувати завдання паралельно з діалогом. Варіант Extended Thinking додає настроюване фонове міркування для багатокрокових запитів і, за даними Google, наразі займає 1-е місце в рейтингу Speech-to-Speech від Artificial Analysis. Покриття мов: 97+ для моделей Live і 85+ для Transcribe. Модель 3.5 Transcribe демонструє середній показник Word Error Rate 4,0% у режимі стрімінгу та 2,6% у нестрімінговому режимі, з підтримкою власного словника до 1 000 термінів і режимом Smart, що прибирає слова-паразити.
Розповсюдження є чітко спланованим. Моделі Live постачаються через Live API з іменованими партнерами інтеграції, які відповідають за медіаплощину: Agora, Fishjam, LiveKit, LangChain, Pipecat, Vercel і Vision Agents. Transcribe також доступна через Interactions API, який приймає аудіофайли тривалістю до однієї години зі структурованими мітками часу та мітками мовців. Google завершила анонс, об'єднавши запуск із трьома суміжними моделями, вже наявними в API: Gemini 3.5 Live Translate (70+ мов, мовлення-в-мовлення), Gemini 3.1 Flash TTS і Lyria 3.5 для генерації музики.
Технічна архітектура
Ключова архітектурна заява полягає в тому, що 3.8 Live є нативною моделлю «мовлення-в-мовлення», а не каскадом. Традиційний стек голосового агента виглядає так: аудіовхід, модель ASR, LLM, модель TTS, аудіовихід. Кожен перехід додає затримку (зазвичай від 150 до 400 мс на кожному етапі у виробничих умовах) і кожен перехід втрачає інформацію: просодію, паузи, перемикання коду, фонові звуки. Нативна модель «мовлення-в-мовлення» об'єднує ці етапи в один прямий прохід, тому варіант Extended Thinking може «розповідати про свій прогрес» під час фонового міркування, а не блокувати на текстовому ході.
Для технічних команд, що оцінюють цю модель, важливі п'ять можливостей. Асинхронний виклик функцій дозволяє моделі продовжувати стрімінг аудіо до користувача під час виконання виклику інструменту у фоновому режимі — це найбільший дефект UX у сучасних голосових агентах (незручна тиша, поки LLM очікує на відповідь бази даних). Прив'язка до візуального контексту приймає живий візуальний вхід разом із аудіо. Точність алфавітно-цифрових послідовностей явно виділяється для кодів підтвердження та номерів заявок — натяк на вертикаль, яку Google явно прагне охопити: контактні центри. Інкрементальні оновлення контенту вбудовують структуровані дані в аудіопотік під час відповіді. Настроюване мислення у варіанті Extended Thinking — це важіль, за допомогою якого розробники будуть балансувати між затримкою та глибиною міркування.
З боку транскрипції показник WER 2,6% у нестрімінговому режимі скидає галузеві очікування. Для порівняння: людські транскрибери зазвичай отримують від 4 до 5% на розмовній англійській мові. Показник 4,0% у режимі стрімінгу важливіший для субтитрів у реальному часі та аналітики колл-центрів, оскільки WER при стрімінгу зазвичай на 1–2 відсоткові пункти гірший, ніж у пакетному режимі. Підтримка власного словника з 1 000 термінів є значущою верхньою межею, хоча Google не розкриває, чи погіршує завантаження списку загальну точність розпізнавання — а це саме той збій, з яким команди стикаються у виробництві. Поки що невідомо, наскільки WER чутливий до шумного телефонного аудіо (вузькосмуговий сигнал 8 кГц), і джерело не розбиває WER по мовах серед 85+ підтримуваних.
Хто постраждає
Найбільш уразлива категорія — це самостійні постачальники транскрипції в реальному часі, чия єдина перевага полягає в точності потокового ASR. Коли гіперскейлер випускає API загального призначення з WER 4,0% у стрімінгу, тиск на ціноутворення спеціалізованих ASR-постачальників є однонаправленим. Очікуйте, що протягом наступних двох кварталів їхні продажі переключаться з орієнтирів точності на відповідність нормативам, розгортання на власних потужностях і галузеві словники, де список із 1 000 термінів вичерпується.
По-друге: розробники каскадних фреймворків голосових агентів. Іменовані партнери Live API (LiveKit, Pipecat, Vercel, Agora, Fishjam, LangChain, Vision Agents) позиціонуються як медіаплощина та шари оркестрації, а не як постачальники моделей. Це прийнятна позиція. Фреймворк-проєкти, які намагалися опінованіти саму оркестрацію ASR-LLM-TTS, тепер мають конкурента, чию мінімальну затримку вони не можуть повторити, оскільки все одно платять за три мережеві переходи там, де 3.8 Live платить за один.
По-третє: робочі процеси голосової верифікації в iGaming і фінтех. Точність алфавітно-цифрових послідовностей для кодів підтвердження та номерів заявок — це пряме прицілювання Google в KYC-колбеки, підтвердження депозитів і триаж підтримки. Покриття 97+ мов тут важливе, оскільки саме в цих робочих процесах європейський оператор обслуговує клієнтів у п'ятнадцяти локалях і не хоче укладати п'ятнадцять окремих ASR-контрактів.
По-четверте: Realtime API від OpenAI тепер змагається з опублікованим рейтингом і конкретною ціною за хвилину. Документація OpenAI наводить ціни Realtime окремо для токенів аудіовходу та виходу, що ускладнює пряме порівняння для команд закупівель. Фіксована ціна Google за хвилину легше моделюється в таблиці, і це саме по собі вплине на рішення під час тендерів. Мій прогноз: протягом 90 днів слід очікувати, що принаймні один великий постачальник голосових агентів опублікує публічне порівняння затримки 3.8 Live із власним конвеєром. Якщо цього не станеться — вважайте, що цифри невтішні.
Дорожня карта для розробки AI
Конкретні дії для технічних керівників цього тижня. По-перше, побудуйте модель витрат. Візьміть середню тривалість сесії вашого поточного голосового агента та помножте на $0,023 за хвилину двостороннього аудіо. Якщо ваш поточний рахунок за STT + LLM + TTS за сесію перевищує приблизно 1,5x цієї цифри, у вас є бізнес-кейс для міграції, який варто задокументувати. Якщо менше — витрати на перехід, мабуть, ще не виправдані.
По-друге, виміряйте WER на вашому реальному аудіо, а не на LibriSpeech або маркетингових кліпах постачальника. Показник 2,6% у нестрімінговому режимі — це середнє значення по оціночній вибірці Google. Ваше аудіо колл-центру з трьома одночасними мовцями на зашумленій лінії не досягне цього результату. Відберіть 200-зразковий корпус із виробничого середовища, запустіть через 3.5 Transcribe через Interactions API та порівняйте з поточним рішенням.
По-третє, протестуйте асинхронний виклик функцій на реалістичному графі інструментів. Демонстраційний кейс простий; виробничий кейс — це клієнт, який ставить питання, що вимагає двох послідовних запитів до бази даних і виклику стороннього API. Виміряйте, як модель описує прогрес і чи виникають галюцинації під час очікування виклику інструменту.
По-четверте, якщо ви будуєте оркестрацію агентів, сприймайте список партнерів Live API як сигнал щодо того, де Google очікує розміщення медіаплощини. Інтеграція з одним із цих семи партнерів є архітектурним вибором із меншим ризиком, ніж розробка власного WebRTC-шару. Вивчіть MCP-патерни для виклику інструментів, щоб не прив'язуватися до схеми виклику функцій одного постачальника моделей.
Ключові висновки
- Gemini 3.8 Live коштує $0,023/хв двостороннього аудіо ($0,005 вхід, $0,018 вихід), встановлюючи публічний орієнтир для економіки каскадних голосових стеків.
- Gemini 3.5 Transcribe демонструє WER 2,6% у нестрімінговому режимі та 4,0% у стрімінговому по 85+ мовах, що тисне на самостійних постачальників ASR у реальному часі.
- Нативна модель «мовлення-в-мовлення» з асинхронним викликом функцій вирішує проблему незручної тиші, яка плаже каскадні голосові агенти під час викликів інструментів.
- Live API запускається з сімома іменованими партнерами медіаплощини, включаючи LiveKit, Pipecat і Agora, що сигналізує про бажану Google топологію розгортання.
- Невідомі аспекти, які варто перевірити: деградація WER на телефонному аудіо 8 кГц, компроміс точності при завантаженні custom_vocabulary близько до межі в 1 000 термінів, і варіація WER по мовах серед 85+ підтримуваних.
Часті запитання
Q: Як ціна Gemini 3.8 Live порівнюється з використанням каскадного голосового конвеєра?
За $0,005/хв для вхідного та $0,018/хв для вихідного аудіо, двостороння розмова коштує приблизно $1,38 за годину аудіо. Команди, що використовують окремих постачальників STT, LLM і TTS, зазвичай платять більше за сесію, якщо підсумувати всі три рахунки плюс накладні витрати затримки оркестрації, хоча точне порівняння залежить від використання токенів LLM за хід.
Q: Чи справді WER 2,6% є достатнім для промислової транскрипції?
Так, цей показник знаходиться на рівні або нижче точності людських транскриберів для розмовної англійської, яка зазвичай становить від 4 до 5%. Застереження: це нестрімінгове середнє значення по оціночній вибірці Google. Реальне виробниче аудіо (шумні телефонні лінії, одночасні мовці, сильні акценти) матиме гірший результат — тому порівнюйте на власному корпусі, перш ніж приймати рішення.
Q: У чому практична різниця між Gemini 3.8 Live і 3.8 Live Extended Thinking?
3.8 Live — це стандартна нативна модель «мовлення-в-мовлення» для розмовних агентів. Extended Thinking додає настроюване фонове міркування для складних багатокрокових запитів і може розповідати про прогрес під час міркування. Використовуйте Extended Thinking, коли точність у багатокроковому міркуванні важливіша за мінімально можливу затримку; використовуйте стандартний 3.8 Live для діалогів, чутливих до затримки.
Четверо підписників подали позов проти провідних AI-компаній через нібито змову про уповільнення
Четверо підписників чат-ботів подали колективний позов, стверджуючи, що Anthropic, OpenAI, Google та xAI домовились стримувати свої моделі. Закон Шермана зустрічає AI-безпеку.
Цінова війна LLM: Opus 5.5 знижує ціни на 20% напередодні IPO
Anthropic, Google та чотири китайські лабораторії випускають базові моделі в одне двотижневе вікно. Цінові сигнали важливіші за бенчмарки.
Затримка менше мілісекунди — новий стандарт iGaming в Індії
Розгортання 5G в Індії підштовхує бекенди iGaming до затримки менше мілісекунди та мільйонів одночасних запитів. Ось що це реально коштує і де все ламається.




