Мульти-модельний AI став проблемою платформи, а не вендора
Будь-який керівник платформи, який намагався стандартизуватися на одному провайдері LLM, знає цю схему: обираєш модель у Q1, спостерігаєш, як конкурент обганяє її у Q2, і витрачаєш Q3 на пояснення фінансовому відділу, чому RFP більше не актуальний. Тиждень 24 вересня 2026 року перетворив це роздратування на архітектурний факт. Дві провідні лабораторії випустили між собою чотири моделі, і один постачальник у сфері безпеки визнав у тому ж інформаційному циклі, що жодна окрема модель не є достатньо хорошою сама по собі.
Стратегія AI з одним вендором тепер офіційно є застарілим патерном. Команди, які побудували свою дорожню карту 2026 року навколо неї, витратять Q4 на її переписування.
Що сталося
Anthropic представив Claude Opus 5.5, позиціонуючи його як модель, що забезпечує продуктивність, порівнянну з більш дорогою моделлю Fable 5.1, але за нижчої операційної вартості. Того ж тижня OpenAI випустив пару моделей: GPT-6 Sol, налаштований на вищий рівень міркування, і GPT-6 Luna, орієнтований на швидші та більш масові навантаження. Дві лабораторії, два різних кроки сегментації, одне спільне повідомлення. Ера єдиної флагманської моделі завершена.
Як повідомляє AI Business, випуски сигналізують, що провідні провайдери тепер диференціюються за ціною, продуктивністю та спеціалізацією, а не змагаються у створенні однієї героїчної моделі. Це переосмислює питання закупівель для корпоративних IT-відділів. Джіт Паттанаік, засновник і CTO Glokal AI, висловився прямо: «Рішення переміщується від закупівель до архітектури». Паттанаік пішов далі, стверджуючи, що команди дедалі більше потребують визначити, яка модель підходить для кожного навантаження, і переглядати ці рішення у міру виходу нових моделей від провайдерів.
Того ж тижня з'явилися ще два важливих факти, які мають більше значення, ніж самі випуски моделей. Salesforce продовжив розширення своєї AI-платформи для підтримки кількох моделей, а партнерство з NVIDIA інтегрувало відкриті моделі в Agentforce і Missionforce. А Palo Alto Networks 24 вересня запустив AI-сервіс кібербезпеки, який поєднує Claude Mythos від Anthropic, GPT-5.6-Cyber від OpenAI та моделі з відкритими вагами — при цьому сама система вирішує, яка модель опрацьовує кожне завдання безпеки. У їхньому оголошенні було приховано важливе: внутрішнє тестування показало, що жодна окрема модель не виявила більше 40% вразливостей у складних середовищах.
Прочитайте цю цифру двічі. Це найчесніше речення, яке постачальник у сфері безпеки опублікував про LLM цього року.
Технічна анатомія
Сукупно оголошення описують патерн маршрутизатора та портфеля, що замінює патерн обгортки та флагмана. В епоху обгортки ви обирали GPT-4 або Claude, писали тонкий шар абстракції та сподівалися, що промпти витримають незначні оновлення версій. В епоху маршрутизатора шар абстракції і є продуктом. Він вирішує для кожного запиту, яка модель отримає трафік.
Рішення про маршрутизацію має три вхідних параметри: можливості, затримка та вартість. Позиціонування Anthropic Opus 5.5 як порівнянного з Fable 5.1 за нижчою вартістю — це пряма ставка на вісь вартості. Розділення OpenAI GPT-6 на Sol і Luna — це ставка на вісь можливостей проти затримки. Sol для шляхів з інтенсивним міркуванням, Luna для масових шляхів, де домінують затримка p95 та вартість за токен. Жодна лабораторія не просить вас обирати. Вони просять вас маршрутизувати.
Стеля виявлення Palo Alto у 40% пояснює, чому маршрутизація не є необов'язковою для всього важливого. Якщо ваша найкраща окрема модель пропускає 60% вразливостей у складних середовищах, ансамблева маршрутизація — це не оптимізація. Це мінімально прийнятна архітектура. Та сама логіка застосовується поза межами безпеки. Оцінка шахрайства, перевірка контрактів, клінічний триаж, KYC, резюмування відповідності: будь-яка область, де повнота важливіша за зручність, врешті-решт матиме портфель — незалежно від того, планував це CTO чи ні.
Інженерна поверхня, яку це створює, є реальною. Вам тепер потрібні модельно-незалежні шаблони промптів, набори eval для кожної моделі, рушій політик маршрутизації, телеметрія витрат на модель для кожного навантаження та стратегія версіонування на випадок, коли провайдери випускають нові SKU посеред кварталу. Документація API Anthropic і документація платформи OpenAI тепер обидві припускають, що ви запускаєте кілька моделей в одному додатку, але клей — це ваша проблема.
Моя думка: переможцями протягом наступних 18 місяців будуть не команди з найкращими промптами. Це будуть команди з найкращими eval та найшвидшим конвеєром заміни моделей. У виробничих інцидентах, які я бачив у фінтех-компаніях, режим збою майже ніколи не є самою моделлю. Це припущення, що модель поводиться так само на 12-му тижні, як і на 1-му.
Хто постраждає
Зараз три групи перебувають під загрозою.
По-перше, платформи iGaming та фінтех, які стандартизувалися на одному провайдері у 2025 році для шахрайства, KYC та агентів підтримки гравців. Ці команди побудували фінансові моделі відповідно до цінової кривої одного вендора. Твердження Anthropic про цінову рівність для Opus 5.5 і рівень Luna від OpenAI для масових навантажень означають, що фінансові аргументи на користь залишення одного вендора щойно послабилися. Якщо Luna матеріально дешевша, ніж ваш поточний шлях для потоків підтримки з інтенсивним чатом, ваш CFO дізнається про це раніше за вас.
По-друге, команди безпеки. Palo Alto Networks щойно публічно встановила стелю: менше 40% виявлення у складних середовищах для будь-якої окремої моделі. Будь-який SOC, який досі спрямовує весь триаж через один LLM, матиме проблему, яку важко захистити в суді, наступного разу, коли розбір інциденту запитає, чому ансамблевий патерн не був прийнятий. Незручна думка: AI безпеки на основі однієї моделі тепер еквівалентний запуску одного антивірусного рушія у 2010 році. Команди, з якими я працював в Амстердамі, відмовилися від виявлення на основі одного рушія десять років тому саме з цієї причини.
По-третє, корпоративні постачальники програмного забезпечення без мульти-модельної стратегії. Розширення Salesforce до підтримки кількох моделей у поєднанні з партнерством NVIDIA, яке інтегрує відкриті моделі в Agentforce і Missionforce, встановлює еталонну архітектуру для категорії. Якщо AI-функції SaaS-вендора все ще прив'язані до одного провайдера, команди закупівель почнуть питати чому. Це поганий діалог під час RFP.
Наступні 90 днів для всіх трьох груп виглядають схоже. Проведіть аудит того, які навантаження прив'язані до яких моделей. Побудуйте прототип тіньової маршрутизації. Створіть набори eval для кожного навантаження, які можна запустити проти нової моделі менш ніж за день. Якщо на оцінку нового SKU йде тиждень, ви не встигнете за темпом випусків, на якому зараз перебувають лабораторії.
Посібник з AI-розробки
Конкретні кроки на цей тиждень, а не на цей квартал.
Запустіть шар маршрутизації, навіть примітивний. Конфігураційного маппінгу типу навантаження до ідентифікатора моделі достатньо для початку. Це дає вам можливість замінювати без рефакторингу. Якщо ви не можете підставити Opus 5.5 замість того, що ви запускали на Claude минулого місяця, лише відредагувавши конфіг — це ваша перша помилка.
Пишіть eval до того, як пишете промпти. Для кожного навантаження визначте три основних режими збою та найменший можливий набір тестів, який їх охоплює. П'ятдесят прикладів краще, ніж нуль. Перезапускайте набір для кожного нового випуску моделі, включаючи незначні оновлення версій. Цифра Palo Alto — це подарунок: вона дає вам дозвіл пояснити керівництву, що ансамбль перевершує героя в будь-чому з реальними вимогами до повноти.
Відстежуйте вартість на успішний результат, а не вартість на токен. Те, що Luna дешевша за токен, ніж Sol, нічого не означає, якщо Sol вирішує тікет за один виклик, а Luna потребує трьох. Інструментуйте весь потік. У виробничих інцидентах, які я бачив, дашборди токенів виглядають чудово аж до того моменту, як шторм повторних запитів не з'являється у рахунку.
Нарешті, тримайте теплою опцію з відкритими вагами. Salesforce і Palo Alto обидва інтегрують відкриті моделі у свої стеки не без причини. Хостинг дообробленої відкритої моделі через Hugging Face або еквівалентного провайдера інференсу дає вам козир у наступній ціновій розмові та резервний варіант, коли пропрієтарний API матиме поганий день.
Ключові висновки
- Стратегія LLM з одним вендором завершена. Цінове позиціонування Anthropic Opus 5.5 та розподіл OpenAI Sol/Luna — це портфельні ходи, а не оновлення флагмана.
- Розкриття Palo Alto Networks про те, що жодна окрема модель не виявляє більше 40% вразливостей у складних середовищах, є найвагомішим публічним аргументом на користь ансамблевої маршрутизації.
- Маршрутизація, eval та телеметрія витрат для кожного навантаження тепер є ключовими проблемами платформи, а не побічними проектами AI-команди.
- Мульти-модельне розширення Salesforce через партнерство з NVIDIA є еталонною архітектурою, яку корпоративні покупці почнуть очікувати від кожного SaaS-вендора.
- Команди, які не можуть замінити модель через конфіг і повторно запустити eval менш ніж за день, відстануть від темпу випусків протягом двох кварталів.
Часті запитання
П: Що насправді означає мульти-модельний корпоративний AI на практиці?
Це означає запуск більше одного LLM у виробництві та маршрутизацію кожного запиту до моделі, найбільш підходящої для цього навантаження, на основі можливостей, затримки та вартості. Замість стандартизації на GPT або Claude команди будують шар маршрутизації, який відправляє завдання з інтенсивним міркуванням до однієї моделі, а масові завдання — до іншої, і замінюють моделі в міру виходу нових версій.
П: Чому цифра виявлення 40% від Palo Alto Networks є значущою?
Під час внутрішнього тестування Palo Alto Networks виявила, що жодна окрема модель не виявила більше 40% вразливостей у складних середовищах. Це найчіткіше публічне визнання того, що AI на основі однієї моделі недостатній для доменів з високими вимогами до повноти, як-от безпека, і воно підтверджує ансамблевий підхід, який використовує їхній новий сервіс на основі Claude Mythos, GPT-5.6-Cyber та моделей з відкритими вагами.
П: Як інженерні команди мають підготуватися до мульти-модельного стеку?
Почніть з конфігураційного шару маршрутизації, щоб моделі можна було замінювати без змін у коді. Побудуйте невеликі набори eval для кожного навантаження, які можна повторно запустити для будь-якого нового випуску моделі протягом дня. Відстежуйте вартість на успішний результат, а не вартість на токен, і тримайте принаймні одну модель з відкритими вагами теплою як резервний варіант та важіль у переговорах.
Gemini 3.8 Live за $0.023/хв: Google підриває ринок голосового AI
Google випустила Gemini 3.8 Live за $0.005/хв на вхід і $0.018/хв на вихід, плюс модель транскрипції з WER 2,6%. Економіку каскадних голосових стеків тепер складніше захистити.
Четверо підписників подали позов проти провідних AI-компаній через нібито змову про уповільнення
Четверо підписників чат-ботів подали колективний позов, стверджуючи, що Anthropic, OpenAI, Google та xAI домовились стримувати свої моделі. Закон Шермана зустрічає AI-безпеку.
Цінова війна LLM: Opus 5.5 знижує ціни на 20% напередодні IPO
Anthropic, Google та чотири китайські лабораторії випускають базові моделі в одне двотижневе вікно. Цінові сигнали важливіші за бенчмарки.




