Skip to content
RiverCore
Мультимодельный AI стал проблемой платформы, а не вендора
multi-model AIAI platformLLM strategymulti-model AI platform architecture 2026single vendor AI strategy risks

Мультимодельный AI стал проблемой платформы, а не вендора

26 сен 20267 мин. чтенияAlex Drover

Любой руководитель платформы, который пытался стандартизировать работу на одном LLM-провайдере, знает этот сценарий: выбираешь модель в первом квартале, во втором конкурент её обходит, а в третьем объясняешь финансовому отделу, почему запрос на предложение (RFP) уже неактуален. Неделя 24 сентября 2026 года превратила это раздражение в архитектурный факт. Две ведущие лаборатории выпустили четыре модели суммарно, и в том же новостном цикле один из вендоров в сфере безопасности признал: ни одна модель в одиночку не справляется.

Стратегия единственного AI-вендора теперь официально является устаревшим паттерном. Команды, построившие дорожную карту на 2026 год вокруг неё, проведут четвёртый квартал, переписывая её заново.

Что произошло

Anthropic представил Claude Opus 5.5, позиционируя его как модель с производительностью, сопоставимой с более дорогим Fable 5.1, но при меньших операционных затратах. В ту же неделю OpenAI выпустил сразу две модели: GPT-6 Sol — с упором на расширенные возможности рассуждения, и GPT-6 Luna — для быстрых высоконагруженных задач. Две лаборатории, два разных сегментационных хода, одно общее послание. Эпоха единственной флагманской модели закончена.

Как сообщает AI Business, релизы сигнализируют: ведущие провайдеры теперь дифференцируются по цене, производительности и специализации, а не гонятся за созданием одной универсальной модели. Это переформулирует вопрос закупок для корпоративных IT-отделов. Джит Паттанаик, основатель и технический директор Glokal AI, сформулировал прямо: «Решение смещается от закупок к архитектуре». Он пошёл дальше, утверждая, что командам всё чаще нужно определять, какая модель подходит для каждой задачи, и пересматривать эти решения по мере выхода новых моделей.

В ту же неделю появились ещё два факта, которые важнее самих запусков моделей. Salesforce продолжила расширять свою AI-платформу с поддержкой нескольких моделей — партнёрство с NVIDIA позволяет интегрировать открытые модели в Agentforce и Missionforce. А 24 сентября Palo Alto Networks запустила сервис AI-кибербезопасности, объединяющий Claude Mythos от Anthropic, GPT-5.6-Cyber от OpenAI и открытые модели, причём сама система решает, какая модель обрабатывает каждую задачу безопасности. В анонсе было скрыто важное: внутреннее тестирование показало, что ни одна отдельная модель не обнаруживает более 40% уязвимостей в сложных средах.

Прочитайте эту цифру дважды. Это самое честное предложение, которое вендор в сфере безопасности опубликовал об LLM в этом году.

Техническая анатомия

Совокупность анонсов описывает переход от паттерна «обёртка + флагман» к паттерну «маршрутизатор + портфель». В эпоху обёрток вы выбирали GPT-4 или Claude, писали тонкий слой абстракции и надеялись, что промпты выдержат незначительные обновления версий. В эпоху маршрутизаторов слой абстракции и есть продукт. Он решает для каждого запроса, какая модель получает трафик.

Решение о маршрутизации имеет три входных параметра: возможности модели, задержка и стоимость. Позиционирование Anthropic Opus 5.5 как сопоставимого с Fable 5.1 при меньшей стоимости — прямая атака на ось цены. Разделение OpenAI GPT-6 на Sol и Luna — атака на ось «возможности против задержки». Sol — для задач с интенсивным рассуждением, Luna — для высоконагруженных задач, где доминируют p95-задержка и стоимость токена. Ни одна из лабораторий не просит вас выбирать. Они просят вас маршрутизировать.

Потолок обнаружения в 40% у Palo Alto объясняет, почему маршрутизация не является опциональной для чего-либо важного. Если ваша лучшая единственная модель пропускает 60% уязвимостей в сложных средах, ансамблевая маршрутизация — это не оптимизация. Это минимально жизнеспособная архитектура. Та же логика применима за пределами безопасности. Оценка мошенничества, проверка договоров, клиническая сортировка, KYC, сводка по комплаенсу: любая область, где полнота охвата важнее удобства, в итоге придёт к портфелю моделей — планировал это технический директор или нет.

Инженерная поверхность, которую это создаёт, реальна. Теперь вам нужны агностичные к модели шаблоны промптов, наборы тестов для каждой модели, движок политик маршрутизации, телеметрия затрат по каждой модели для каждой задачи и стратегия версионирования на случай, когда провайдеры выпускают новые SKU в середине квартала. Документация API Anthropic и платформы OpenAI теперь исходят из того, что вы запускаете несколько моделей в одном приложении, но связующий слой — ваша забота.

Моё мнение: победители в ближайшие 18 месяцев — это не команды с лучшими промптами. Это команды с лучшими наборами тестов и самым быстрым конвейером замены моделей. В производственных инцидентах, которые я видел в финтех-компаниях, сбой почти никогда не происходит из-за модели. Он происходит из-за предположения, что модель ведёт себя на 12-й неделе так же, как на 1-й.

Кто пострадает

Прямо сейчас под угрозой находятся три группы.

Первая — платформы iGaming и финтех, которые в 2025 году стандартизировались на одном провайдере для задач борьбы с мошенничеством, KYC и агентов поддержки игроков. Эти команды строили финансовые модели на основе ценовой кривой одного вендора. Заявление Anthropic о ценовом паритете Opus 5.5 и уровень Luna от OpenAI для высоконагруженных задач означают, что финансовое обоснование оставаться с одним вендором только что разрушилось. Если Luna окажется существенно дешевле для чат-ориентированных потоков поддержки, ваш финансовый директор узнает об этом раньше вас.

Вторая — команды безопасности. Palo Alto Networks публично установила потолок: менее 40% обнаружения в сложных средах для любой отдельной модели. Любой SOC, по-прежнему направляющий всю сортировку через один LLM, имеет проблему с защитой в суде при следующем разборе инцидента, когда спросят, почему ансамблевый паттерн не был принят. Неудобная правда: AI-безопасность на основе одной модели сегодня — это эквивалент запуска одного антивирусного движка в 2010 году. Команды, с которыми я работал в Амстердаме, отказались от обнаружения с одним движком десятилетие назад именно по этой причине.

Третья — корпоративные вендоры программного обеспечения без мультимодельной истории. Расширение Salesforce в сторону поддержки нескольких моделей в сочетании с партнёрством NVIDIA, привносящим открытые модели в Agentforce и Missionforce, задаёт эталонную архитектуру для категории. Если AI-функции SaaS-вендора по-прежнему жёстко привязаны к одному провайдеру, закупочные команды начнут спрашивать, почему. Это неудобный разговор в рамках RFP.

Ближайшие 90 дней для всех трёх групп выглядят похоже. Проаудируйте, какие задачи привязаны к каким моделям. Создайте прототип теневой маршрутизации. Разработайте наборы тестов для каждой задачи, которые можно прогнать на новой модели менее чем за день. Если на оценку нового SKU уходит неделя, вы не сможете поспевать за темпами выпуска моделей, которые лаборатории сейчас задают.

Практическое руководство по AI-разработке

Конкретные шаги — для этой недели, а не этого квартала.

Разверните слой маршрутизации, пусть даже примитивный. Управляемое конфигурацией сопоставление типа задачи с идентификатором модели — достаточный старт. Это даёт вам возможность замены без рефакторинга. Если вы не можете подключить Opus 5.5 вместо того, что использовали в Claude в прошлом месяце, просто отредактировав конфиг — это ваш первый баг.

Пишите тесты до того, как пишете промпты. Для каждой задачи определите три основных сценария сбоя и минимально возможный набор тестов, который их охватывает. Пятьдесят примеров лучше нуля. Перезапускайте набор на каждом новом выпуске модели, включая незначительные обновления версий. Цифра Palo Alto — это подарок: она даёт вам право сказать руководству, что ансамбль превосходит единственную модель для любой задачи с реальными требованиями к полноте охвата.

Отслеживайте стоимость успешного результата, а не стоимость токена. То, что Luna дешевле за токен, чем Sol, ничего не значит, если Sol решает задачу за один вызов, а Luna требует трёх. Инструментируйте весь поток. В производственных инцидентах, которые я видел, дашборды по токенам выглядят отлично — ровно до тех пор, пока штормы повторных попыток не появятся в счёте.

Наконец, держите открытую модель в горячем резерве. И Salesforce, и Palo Alto включают открытые модели в свои стеки не без причины. Хостинг дообученной открытой модели через Hugging Face или аналогичного провайдера инференса даёт вам аргумент на следующих ценовых переговорах и резерв на случай, когда проприетарный API даст сбой.

Ключевые выводы

  • Стратегия единственного LLM-вендора закончена. Ценовое позиционирование Opus 5.5 от Anthropic и разделение GPT-6 на Sol/Luna от OpenAI — это портфельные ходы, а не обновление флагмана.
  • Раскрытие Palo Alto Networks о том, что ни одна модель не обнаруживает более 40% уязвимостей в сложных средах, — сильнейший публичный аргумент в пользу ансамблевой маршрутизации на сегодняшний день.
  • Маршрутизация, наборы тестов и телеметрия затрат по каждой задаче теперь являются базовыми задачами платформы, а не побочными проектами AI-команды.
  • Мультимодельное расширение Salesforce через партнёрство с NVIDIA — эталонная архитектура, которую корпоративные покупатели начнут ожидать от каждого SaaS-вендора.
  • Команды, не способные заменить модель через конфиг и перезапустить тесты за один день, отстанут от темпов выпуска в течение двух кварталов.

Часто задаваемые вопросы

В: Что на практике означает мультимодельный корпоративный AI?

Это означает запуск более одного LLM в продакшне и маршрутизацию каждого запроса к модели, наиболее подходящей для данной задачи, исходя из возможностей, задержки и стоимости. Вместо стандартизации на GPT или Claude команды строят слой маршрутизации, который направляет задачи с интенсивным рассуждением к одной модели, а высоконагруженные задачи — к другой, и меняют модели по мере выхода новых версий.

В: Почему показатель обнаружения 40% от Palo Alto Networks так важен?

В ходе внутреннего тестирования Palo Alto Networks выяснила, что ни одна отдельная модель не обнаруживает более 40% уязвимостей в сложных средах. Это наиболее чёткое публичное признание того, что AI на основе одной модели недостаточен для задач с высокими требованиями к полноте охвата — таких как безопасность. Это обосновывает ансамблевый подход их нового сервиса, работающего с Claude Mythos, GPT-5.6-Cyber и открытыми моделями.

В: Как инженерным командам подготовиться к мультимодельному стеку?

Начните с управляемого конфигурацией слоя маршрутизации, чтобы модели можно было менять без изменений кода. Создайте небольшие наборы тестов для каждой задачи, которые можно перезапустить на любом новом выпуске модели в течение дня. Отслеживайте стоимость успешного результата, а не стоимость токена, и держите хотя бы одну открытую модель в резерве — как запасной вариант и аргумент на переговорах.

AD
Alex Drover
RiverCore Analyst · Dublin, Ireland
ПОДЕЛИТЬСЯ
// ПОХОЖИЕ СТАТЬИ
ГлавнаяРешенияПроектыО насКонтакт
Новости06
Дублин, Ирландия · ЕСGMT+1
LinkedIn
🇷🇺RU▾