Цінова війна LLM: Opus 5.5 знижує ціни на 20% напередодні IPO
Кожен платформний лід із рядком витрат на Claude або GPT у бюджеті на FY26 щойно отримав козир на переговорах — і більшість із них ще не усвідомлює цього. За 13 днів, що охоплюють китайські свята Середини осені та Національний день, щонайменше шість провідних лабораторій просувають моделі наступного покоління у сіре тестування, тизерні публікації або повноцінні API-релізи. Крива цін згинається швидше за криву можливостей, і це змінює математику рішення «будувати vs купувати» для всіх, хто запускає агентні навантаження у виробництво.
Що сталося
Головна новина — від Anthropic. Як повідомив BigGo Finance, розробник Lyra (через китайське видання 36Kr) розкрив, що Claude Opus 5.5 вже проходить внутрішнє тестування під кодовою назвою «claude-wafer-eap», а запуск може відбутися вже у вівторок. Anthropic повністю пропускає широко очікуваний реліз 5.2. Очікувані ціни на API: $4 за мільйон вхідних токенів і $20 за мільйон вихідних — приблизно на 20% менше, ніж поточний Opus 5 за $5 і $25. Читання кешу падає до $0,20 за мільйон токенів, запис кешу — $5.
Паралельно з Opus 5.5 Anthropic тихо запускає сіре розгортання Claude Fable 5.2, причому частина запитів до Fable 5.1 непомітно перенаправляється. Тестери повідомляють, що 3D-генерація Fable 5.2 відповідає або перевершує GPT-6 Astra — один розробник створив повноцінну 3D-інтерактивну систему на чистому JavaScript із першого холодного запиту.
Google проводить власну розвідку. Модель під назвою «gemini-3.8-flash» з'явилася на LMArena з можливостями, які значно перевищують очікувані для рівня Flash. Спільнота, спираючись на витік кодової назви «Argon», дійшла висновку, що це Gemini 4 Pro у прихованому режимі. Керівник відділу зв'язків із розробниками Logan Kilpatrick публічно заявив, що Gemini 4 стане найбільшим проєктом попереднього навчання Google на сьогодні, описавши його як «повернення Google на вершину». Примітно, що Gemini 3.5 Pro був внутрішньо скасований через недостатній еволюційний прогрес.
Китайська сторона не менш гучна. Stepfun випустив Step 5 Preview 20 вересня — розріджену MoE з 600B параметрів і 27B активних параметрів, контекстом у мільйон токенів та нативним vision. Moonshot анонсував Kimi K3.1 рядком цифр числа пі. DeepSeek підтвердив V4.1 Pro у документації. Alibaba запустила Qwen3.8-Flash-Next як попередній перегляд Qwen4. Маск каже, що Grok 4.7 «потребує ще кількох днів».
Технічна анатомія
Відкинувши маркетинг, виокремлюються дві структурні історії. Перша — економіка кешу, а не стікерна ціна, є тим місцем, де реальна крива витрат згинається найсильніше. Opus 5.5 за $0,20 за мільйон токенів читання кешу — це справжній відкривач для архітектур довгострокових агентів. Якщо ви запускаєте агента з доповненням на основі пошуку, який багаторазово звертається до одного контексту протягом сесії, ваша ефективна вартість виводу тепер визначається токенами, які ви генеруєте, а не тими, що ви перечитуєте. Це перевертає дизайнерське обмеження для всіх, хто будує coding-копілоти, агентів перевірки відповідності або багатоетапні дослідницькі інструменти. Документація Anthropic вже стимулює агресивне кешування запитів, а Opus 5.5 робить цю практику майже безкоштовною.
Друга історія — ціновий поріг MoE, що встановлюється в Китаї. Step 5 Preview отримав 44 бали на Artificial Analysis Intelligence Index, увійшовши до глобальної трійки серед open-source моделей, при медіані серед аналогів у 24 бали. Його ціна — $1 вхід і $2,70 вихід за мільйон токенів, приблизно вдвічі менше медіанного $2 і $10. Повні ваги заплановано відкрити у відкритий доступ 15 жовтня. Ця комбінація — якість топ-3 плюс хостингове API вдвічі дешевше плюс відкриті ваги через три тижні — є серйозною проблемою для будь-якого західного вендора, що продає середньорівневий пропрієтарний inference у вартісно чутливих вертикалях.
Демо можливостей розповідають пов'язану історію. Opus 5.5 рендерить модель Waymo аж до значка Jaguar і лідара на даху, Gemini 4 Pro генерує інтерактивний SVG пелікана на велосипеді, Fable 5.2 створює 3D-інтерактивну систему з першого холодного запиту — це не трюки для галереї. Це свідчення того, що фронтир тепер — це крос-модальне просторове мислення, а не просто якість чату. Команди, що будують на Gemini APIs для всього, що пов'язане з 3D, макетами або генерацією діаграм, мають очікувати зміни ґрунту під ногами вже в поточному кварталі.
Хто постраждає
Під ударом три групи. По-перше, будь-який стартап, чия єдина продуктова перевага — «ми обгортаємо Opus 5 і беремо надбавку». Зниження ціни на 20% від upstream-вендора стискає вашу маржу в день релізу, і ваші enterprise-клієнти помітять це протягом одного циклу виставлення рахунків. Якщо ви не можете пояснити, що робите понад токеновий арбітраж, ваша наступна зустріч із радою директорів буде незручною.
По-друге, середньорівневі пропрієтарні вендори моделей, що знаходяться між провідними лабораторіями та відкритими моделями. Коли Step 5 Preview досягає 44 балів на індексі інтелекту з відкритими вагами та вхідною ціною $1, аргумент на користь закритого середньоякісного API за вхідною ціною $3–5 зникає. Enterprise-команди із закупівлі, які проводили порівняльний аналіз шість місяців тому, проведуть його знову — і результати не будуть добрими для тих, хто опинився у стиснутій середині.
По-третє, і про це ніхто не хоче говорити вголос, — OpenAI. GPT-6 Astra має 13% витрат enterprise на AI проти 8% у Claude Fable, за даними, що циркулюють у звітах. Anthropic агресивно встановлює ціни на Opus 5.5 у вікні перед IPO, а отже, ціноутворення — це зброя захоплення частки ринку, а не маржинальне рішення. Якщо Fable 5.2 дійсно відповідає Astra у 3D, а Opus 5.5 відкриває реальний розрив у рефакторингу коду та довгостроковому плануванні, Anthropic конвертує передIPO-наратив у контрактну виручку — і OpenAI доведеться вирішувати, відповідати на зниження чи захищати маржу. Будь-яка відповідь їм коштуватиме.
CFO будь-якої компанії на стадії Series B або пізніше з шестизначними щомісячними витратами на LLM має цього тижня поставити своєму VP Eng дуже конкретне питання: яке у нас контрактне вікно виходу від поточного постачальника моделей і скільки насправді коштує 60-денна міграція на Opus 5.5 або самостійно розгорнутий Step 5 — в інженерних годинах порівняно з економією на inference? Якщо ніхто цього не моделював, ви за замовчуванням лишаєте гроші на столі.
Стратегія для AI-розробки
Три конкретні дії на наступні 30 днів. Перша — інструментуйте поточні витрати на LLM за навантаженнями, а не сукупно. Вам потрібно знати, які саме функції спалюють токени, адже ціна читання кешу Opus 5.5 має значення лише тоді, коли ви знаєте, де живе ваш надлишковий контекст. У більшості команд немає цієї телеметрії, і вони не можуть прийняти обґрунтоване рішення про перехід.
Друга — запустіть паралельний eval-харнес проти щонайменше одного open-weights-кандидата до 15 жовтня. Коли ваги Step 5 Preview стануть доступні, команди з уже готовим бенчмаркінговим пайплайном прийматимуть рішення про самостійний хостинг за тиждень. Ті, у кого цього немає, витратять квартал на суперечки. Якщо ваші навантаження є латентно-толерантними та чутливими до конфіденційності — а це описує більшість compliance-роботи у fintech та iGaming — економіка самостійного хостингу топ-3 відкритої моделі на власному inference-стеку через інструменти Hugging Face ось-ось виглядатиме зовсім інакше.
Третя — переговори. Якщо у вас є угода про зобов'язані витрати з будь-яким провідним вендором, підписана до вересня, — ситуація змінилася. Ваш аккаунт-менеджер знає про це. Вимагайте або коригування ціни до нового рівня, або контрактного права на міграцію навантажень на дешевший SKU без штрафних санкцій. Вендори, що стикаються з конкурентною ціновою війною, нададуть поступки, про які шість тижнів тому навіть не думали.
Ключові висновки
- Зниження ціни Opus 5.5 на 20% і рівень читання кешу $0,20 роблять довгоконтекстні агентні архітектури суттєво дешевшими в експлуатації, змінюючи unit-економіку для coding- та compliance-агентів.
- Anthropic використовує ціноутворення як зброю захоплення частки ринку перед IPO проти 13% enterprise-частки GPT-6 Astra, що змушує OpenAI обирати між маржею та часткою.
- Step 5 Preview за вхідною ціною $1 плюс відкриті ваги 15 жовтня встановлюють нову нижню планку, що стискає кожного середньорівневого пропрієтарного вендора.
- Командам, що оцінюють залежність від LLM-вендора, слід зараз запитувати себе, наскільки швидко вони можуть мігрувати виробниче навантаження, а не яка модель найвище у лідерборді.
- 13-денне вікно запусків сигналізує про прискорення commoditization; закупівельна перевага вперше за 18 місяців переходить до покупців.
Часті запитання
П: Наскільки дешевший Claude Opus 5.5 порівняно з Opus 5?
Очікувані ціни на API для Opus 5.5 — $4 за мільйон вхідних токенів і $20 за мільйон вихідних, що приблизно на 20% менше, ніж $5 і $25 у Opus 5. Ціна читання кешу падає до $0,20 за мільйон токенів — це більш значущий важіль витрат для довгоконтекстних агентних навантажень.
П: Чи офіційно випущений Gemini 4 Pro?
Ні. Модель під назвою «gemini-3.8-flash» проходить сіре тестування на LMArena і широко вважається Gemini 4 Pro у прихованому режимі під внутрішньою кодовою назвою «Argon». Logan Kilpatrick із Google підтвердив, що Gemini 4 є найбільшим проєктом попереднього навчання компанії на сьогодні, проте дату запуску не оголошував.
П: Коли стануть доступні open-source ваги Step 5 Preview?
Stepfun запланував відкриття повних ваг у відкритий доступ на 15 жовтня. API-доступ на офіційній платформі відкрився 20 вересня. Модель використовує розріджену архітектуру Mixture-of-Experts з 600B загальних параметрів і 27B активних параметрів, підтримує контекстні вікна у мільйон токенів та нативне vision-введення.
Раунд Series F Crusoe на $3,9 млрд переписує список пріоритетів в AI-інфраструктурі
Crusoe залучив $3,9 млрд за оцінкою $30,9 млрд при $140 млрд законтрактованої вартості. Ось що це означає для тих, хто підписує багаторічні угоди на AI-обчислення цього кварталу.
DataStreams та SAT Information роблять ставку на AI-готову інфраструктуру даних
DataStreams і SAT Information підписали меморандум про об'єднання управління даними з електронним документообігом. Головне питання: чи витримає це реальне виробниче навантаження?
Фантомна дослідницька стаття: як прес-реліз SEO отруює пошуковий сигнал
URL, що обіцяв дослідження про збої бекенд-архітектури, відкрив головну сторінку газети Des Moines Register з футбольними рейтингами та запитом на $2 млн. Що відбувається?




