Ценовая война LLM: Opus 5.5 снижает цены на 20% накануне IPO
Каждый технический руководитель, у которого в бюджете на FY26 есть строка с Claude или GPT, только что получил рычаг для переговоров — и большинство из них этого ещё не осознали. За 13 дней, совпавших с китайскими праздниками Середины осени и Национального дня, как минимум шесть ведущих лабораторий выводят модели следующего поколения в серое тестирование, тизерные публикации или полноценный API-релиз. Кривая цен изгибается быстрее кривой возможностей — и это меняет логику выбора между разработкой собственных решений и покупкой готовых для всех, кто запускает агентные рабочие нагрузки в продакшен.
Что произошло
Главное событие — за Anthropic. Как сообщает BigGo Finance, разработчик Lyra обнаружил (через китайское издание 36Kr), что Claude Opus 5.5 уже проходит внутреннее тестирование под кодовым именем «claude-wafer-eap», а запуск может состояться уже во вторник. Anthropic полностью пропускает широко ожидавшийся релиз 5.2. Ожидаемые цены API: $4 за миллион входных токенов и $20 за миллион выходных — примерно на 20% меньше, чем у текущего Opus 5 ($5 и $25 соответственно). Цена чтения из кэша падает до $0,20 за миллион токенов, запись в кэш — $5.
Параллельно с Opus 5.5 Anthropic тихо выкатывает Claude Fable 5.2 в серый режим: часть запросов к Fable 5.1 уже незаметно перенаправляется. Тестировщики сообщают, что генерация 3D в Fable 5.2 сопоставима с GPT-6 Astra или превосходит его — один разработчик создал полноценную 3D-интерактивную систему на чистом JavaScript с нуля по одному промпту.
Google ведёт собственную разведку. Модель с меткой «gemini-3.8-flash» появилась на LMArena с возможностями, значительно превышающими уровень релиза класса Flash. Консенсус сообщества, подкреплённый утечкой кодового имени «Argon», указывает на то, что это Gemini 4 Pro в скрытом режиме. Руководитель по работе с разработчиками Логан Килпатрик публично заявил, что Gemini 4 станет крупнейшим проектом предобучения в истории Google, позиционируя его как «возвращение Google на вершину». Примечательно, что Gemini 3.5 Pro был внутренне отменён из-за недостаточного прогресса.
Китайская сторона не менее активна. Stepfun выпустил Step 5 Preview 20 сентября — разреженная MoE-архитектура с 600B параметрами, 27B активными параметрами, контекстом в миллион токенов и нативным зрением. Moonshot анонсировал Kimi K3.1 через строку цифр числа пи. DeepSeek подтвердил V4.1 Pro в документации. Qwen3.8-Flash-Next от Alibaba функционирует как предварительная версия Qwen4. Маск заявил, что Grok 4.7 «нужно ещё несколько дней».
Техническая сторона вопроса
Если убрать маркетинг, проявляются две структурные истории. Первая: именно экономика кэширования, а не стикерная цена, определяет реальный изгиб кривой затрат. Opus 5.5 по $0,20 за миллион токенов чтения из кэша — это реальный прорыв для агентных архитектур с длинным горизонтом. Если вы запускаете RAG-агента, который многократно обращается к одному и тому же контексту в рамках сессии, ваша эффективная стоимость инференса теперь определяется генерируемыми, а не перечитываемыми токенами. Это меняет дизайнерские ограничения для всех, кто создаёт coding-копилоты, агентов проверки комплаенса или многошаговые исследовательские инструменты. Документация Anthropic уже поощряет агрессивное кэширование промптов, а Opus 5.5 делает этот подход практически бесплатным.
Вторая история — нижняя граница стоимости MoE, установленная в Китае. Step 5 Preview набрал 44 балла на Artificial Analysis Intelligence Index, войдя в глобальную тройку лучших среди открытых моделей при медиане аналогов в 24 балла. Цена — $1 на входе и $2,70 на выходе за миллион токенов, что примерно вдвое дешевле медианы конкурентов ($2 и $10). Полные веса запланированы к открытию 15 октября. Сочетание качества топ-3, вдвое более дешёвого хостинг-API и открытых весов через три недели — серьёзная проблема для любого западного вендора, продающего проприетарный инференс среднего уровня в чувствительных к стоимости вертикалях.
Демонстрации возможностей говорят о том же. Opus 5.5 рендерит модель Waymo вплоть до логотипа Jaguar и лидара на крыше; Gemini 4 Pro создаёт интерактивный SVG пеликана на велосипеде; Fable 5.2 генерирует 3D-интерактивную систему с нуля по одному промпту — это не фокусы. Это свидетельство того, что фронтир теперь — кросс-модальное пространственное мышление, а не просто качество чата. Команды, работающие с Gemini API в задачах 3D, компоновки или генерации диаграмм, должны быть готовы к смене правил игры в течение квартала.
Кто окажется в проигрыше
Под ударом три группы. Первая — любой стартап, чьё конкурентное преимущество сводится к «мы оборачиваем Opus 5 и берём наценку». Снижение цены на 20% от вышестоящего поставщика сжимает маржу в день релиза, и корпоративные клиенты заметят это уже в следующем расчётном периоде. Если вы не можете объяснить свою ценность за пределами токенного арбитража, следующая встреча с советом директоров будет неприятной.
Вторая — проприетарные вендоры среднего уровня, зажатые между ведущими лабораториями и полом открытых весов. Когда Step 5 Preview с индексом интеллекта 44, открытыми весами и входной ценой $1 выходит на рынок, аргументы в пользу закрытого API среднего качества за $3–5 на вход испаряются. Корпоративные отделы закупок, проводившие сравнительный анализ полгода назад, запустят его снова — и результаты будут жестокими для всех, кто оказался в зажатой середине.
Третья — и это то, что никто не хочет говорить вслух — OpenAI. По данным, циркулирующим в отчётах, GPT-6 Astra занимает 13% корпоративных расходов на ИИ против 8% у Claude Fable. Anthropic агрессивно устанавливает цены на Opus 5.5 в преддверии IPO — значит, ценообразование здесь является оружием для захвата доли рынка, а не решением о марже. Если Fable 5.2 действительно сравняется с Astra в 3D, а Opus 5.5 реально оторвётся по рефакторингу кода и долгосрочному планированию, Anthropic конвертирует предIPO-нарратив в контрактную выручку — и OpenAI придётся выбирать: снизить цены в ответ или защищать маржу. Оба варианта обойдутся им дорого.
Финансовый директор любой компании серии B и выше с шестизначными ежемесячными расходами на LLM должен на этой неделе задать своему VP of Engineering один конкретный вопрос: каков наш договорной срок выхода из текущего контракта с поставщиком модели, и во сколько инженерных часов обойдётся 60-дневная миграция на Opus 5.5 или self-hosted Step 5 в сравнении с экономией на инференсе? Если никто не моделировал это — вы по умолчанию оставляете деньги на столе.
Руководство по действиям для AI-разработки
Три конкретных шага на ближайшие 30 дней. Первый: инструментируйте текущие расходы на LLM по рабочим нагрузкам, а не в совокупности. Вам нужно знать, какие конкретные функции сжигают токены, потому что ценообразование на чтение из кэша в Opus 5.5 имеет значение только если вы знаете, где живёт ваш повторяющийся контекст. У большинства команд нет такой телеметрии, и они не могут принять взвешенное решение о переходе.
Второй: запустите параллельный eval-стенд как минимум против одного кандидата с открытыми весами до 15 октября. Когда веса Step 5 Preview станут доступны, команды с уже готовым бенчмаркинговым пайплайном примут решение о self-hosting за неделю. Те, у кого его нет, потратят квартал на споры. Если ваши нагрузки устойчивы к задержкам и чувствительны к приватности — а это описывает большинство задач комплаенса в финтехе и iGaming — экономика self-hosting топ-3 открытой модели на собственном стеке инференса через инструменты Hugging Face вот-вот кардинально изменится.
Третий: пересматривайте условия. Если у вас есть договор с фиксированными расходами с каким-либо фронтир-вендором, подписанный до сентября, — ситуация изменилась. Ваш аккаунт-менеджер это знает. Требуйте либо корректировки цены до нового уровня, либо договорного права на миграцию рабочих нагрузок на более дешёвый SKU без штрафных санкций. Вендоры, оказавшиеся в условиях ценовой войны, пойдут на уступки, о которых шесть недель назад и речи не шло.
Ключевые выводы
- Снижение цен на Opus 5.5 на 20% и тариф $0,20 за кэш-чтение делают агентные архитектуры с длинным контекстом существенно дешевле в эксплуатации, меняя юнит-экономику для coding- и комплаенс-агентов.
- Anthropic использует ценообразование как оружие для захвата доли рынка накануне IPO против 13% корпоративной доли GPT-6 Astra — это вынуждает OpenAI выбирать между маржой и долей рынка.
- Step 5 Preview по $1 на вход плюс открытые веса с 15 октября устанавливают новый ценовой пол, сжимающий каждого проприетарного вендора среднего уровня.
- Команды, оценивающие риски привязки к LLM-вендору, должны сейчас задаваться вопросом не о том, какая модель лидирует в рейтингах, а о том, как быстро они смогут мигрировать продакшен-нагрузку.
- 13-дневное окно запусков сигнализирует об ускорении коммодитизации; переговорные позиции впервые за 18 месяцев оказались на стороне покупателей.
Часто задаваемые вопросы
В: Насколько Claude Opus 5.5 дешевле Opus 5?
Ожидаемая цена API для Opus 5.5 — $4 за миллион входных токенов и $20 за миллион выходных, что примерно на 20% меньше, чем $5 и $25 у Opus 5. Цена чтения из кэша падает до $0,20 за миллион токенов — это более значимый рычаг снижения затрат для агентных нагрузок с длинным контекстом.
В: Официально ли выпущен Gemini 4 Pro?
Нет. Модель с меткой «gemini-3.8-flash» проходит серое тестирование на LMArena и по широкому консенсусу является Gemini 4 Pro в скрытом режиме под внутренним кодовым именем «Argon». Логан Килпатрик из Google подтвердил, что Gemini 4 — крупнейший проект предобучения компании на сегодняшний день, однако дата запуска не объявлена.
В: Когда станут доступны открытые веса Step 5 Preview?
Stepfun запланировал публикацию полных весов в открытый доступ на 15 октября. API-доступ на официальной платформе открылся 20 сентября. Модель использует разреженную архитектуру Mixture-of-Experts с 600B общими параметрами и 27B активными параметрами, поддерживает контекстные окна в миллион токенов и нативный визуальный ввод.
Раунд Series F Crusoe на $3,9 млрд меняет расстановку сил в AI-инфраструктуре
Crusoe привлёк $3,9 млрд при оценке $30,9 млрд и $140 млрд законтрактованной выручки. Что это означает для тех, кто сейчас подписывает многолетний контракт на AI-вычисления.
DataStreams и SAT Information делают ставку на ИИ-готовую инфраструктуру данных
DataStreams и SAT Information подписали меморандум о намерениях, объединив управление данными с электронным документооборотом. Выдержит ли всё это контакт с реальным производственным агентом?
Статья-призрак: как пресс-релизный SEO отравляет поисковые сигналы
URL, обещавший исследование по отказам бэкенда, открывает главную страницу газеты с рейтингами по футболу и запросом на $2 млн. Разбираем, что пошло не так.




