Skip to content
RiverCore
AMD выпускает 16B Open MoE, обученную полностью на Instinct GPU
AMD Instella MoEROCm trainingInstinct GPUAMD MoE model trained on Instinct hardwareopen mixture of experts model AMD

AMD выпускает 16B Open MoE, обученную полностью на Instinct GPU

3 авг 20267 мин. чтенияSarah Chen

AMD представила модель Mixture-of-Experts на 16B параметров со средним базовым баллом 76.7 — на полбалла выше Moonlight-16B-A3B (76.2) и примерно на 6.6 баллов выше OLMo-3-7B (70.1). Однако интереснее не позиция в рейтинге. Важнее то, что весь цикл обучения прошёл на чипах Instinct MI300X и MI325X, без единого устройства NVIDIA. Для компании, которая два года доказывает, что ROCm способен на серьёзное предобучение, это — подтверждение словами делом.

Что произошло

AMD выпустила Instella-MoE-16B-A3B — декодерную модель Mixture-of-Experts с 16B суммарных параметров и 2.8B активных на каждый токен. Как сообщает MarkTechPost, релиз включает веса с каждого этапа обучения, смеси данных, конфигурации обучения и инференс-код, поставляемый через SGLang. Кодовая база обучения лицензирована по MIT. Сами веса распространяются под лицензией ResearchRAIL и ограничены академическими и исследовательскими целями.

Пайплайн обучения — полноценный современный MoE-рецепт. Предобучение охватывает 7.1T токенов из датасетов Nemotron-CC-v2, MegaMath, FineMath, RefineCode и TxT360. Среднее обучение использует Dolma3 Dolmino 100B в трёх вариантах данных, объединённых усреднением весов. Отдельный этап длинного контекста расширяет окно с 4K до 64K токенов с помощью YaRN с увеличенным RoPE theta и маскировкой документов. Постобучение включает SFT на Dolci-Think-SFT-7B и смесях Nemotron, затем набор из 512K примеров с обратной связью, DPO с обновлением смещения маршрутизатора и отключённой вспомогательной балансировочной потерей. RL выполняется во фреймворке Miles в течение 1 400 шагов RLVR следования инструкциям, завершаясь Multi-Teacher On-Policy Distillation.

Базовый чекпойнт со средним баллом 76.7 опережает всех полностью открытых соперников, с которыми AMD проводила сравнение: Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) и OLMoE-1B-7B (61.9). Модель всё ещё уступает Qwen3.5-4B-Base (79.5). По результатам постобучения чекпойнт Think набирает 73.22, превышая Olmo3-7B-Think (71.97), Gemma-4-E4B think (70.47) и Qwen3.5-4B (69.73). IFEval вырастает с 77.08 до 83.70 по всему стеку постобучения. Источник не раскрывает суммарное количество GPU-часов или стоимость прогона на 7.1T токенов — а именно это соотношение является ключевым для тезиса «AMD как платформа для обучения».

Техническая анатомия

Архитектура представляет собой стандартный MoE с двумя кастомными нововведениями. 27 слоёв, скрытый размер 2048, 16 голов внимания и словарь из 128 896 токенов. Каждый MoE-слой содержит 2 разделяемых эксперта плюс 6 маршрутизируемых, выбираемых из пула 64. Именно так достигается 2.8B активных параметров при 16B суммарных. Цель Multi-Token Prediction применяется на этапах предобучения и среднего обучения — это уже стандарт отрасли с момента, как DeepSeek популяризировал подход.

Два элемента, заслуживающих особого изучения, — Gated MLA и FarSkip-Collective. Gated MLA добавляет к Multi-head Latent Attention лёгкий обученный выходной гейт: выделенная линейная проекция формирует зависящий от входа гейт, который умножается на выход внимания перед финальной проекцией. Небольшое количество параметров — ощутимый прирост выразительности. FarSkip-Collective — более интересный элемент с точки зрения инфраструктуры. Он направляет устаревшие и частичные активации в слои MoE и внимания, что позволяет перекрыть экспертно-параллельную all-to-all коммуникацию вычислениями вместо ожидания на критическом пути.

Приводимые AMD цифры: 12.7% ускорение предобучения за счёт FarSkip-Collective и до 39.2% сокращения времени до первого токена при сервинге с экспертным параллелизмом. Оба показателя получены собственными инструментами AMD, поэтому я хотел бы видеть независимое воспроизведение, прежде чем считать их переносимыми на оборудование, отличное от Instinct. Цифра в 39.2% TTFT, в частности, ограничена конкретной топологией экспертно-параллельного сервинга, и источник не указывает количество GPU или размер батча для этого измерения.

Со стороны сервинга 16B параметров в BF16 занимают примерно 32 ГБ памяти весов. Это комфортно помещается на одном MI300X (192 ГБ HBM3) или одном H100 80GB. Именно путь SGLang делает модель реально запускаемой за пределами собственного дата-центра AMD. Оценка длинного контекста составляет 41.5 на HELMET и 79.4 на RULER — последний достаточно высок, чтобы предположить, что расширение YaRN сохранилось через постобучение, а не откатилось к поведению короткого контекста. Если заявления о FarSkip подтвердятся в независимых бенчмарках, можно ожидать, что к Q1 2027 хотя бы одна сторонняя лаборатория опубликует сопоставимый MoE с аналогичной схемой связности.

Кто проигрывает

Очевидный проигравший — все, кто строит коммерческий хостинговый продукт поверх весов Instella-MoE. ResearchRAIL полностью это блокирует. MIT-лицензированная кодовая база обучения — это и есть реальная ценность для коммерческих команд: задокументированный и воспроизводимый MoE-рецепт, работающий на оборудовании не-NVIDIA. Это важнее всего для трёх групп.

Первая — облачные провайдеры среднего уровня, купившие мощности Instinct в расчёте на то, что ROCm в конце концов догонит конкурентов. До сих пор большинство публичных свидетельств производственного обучения на AMD сводилось к файнтюнингу или инференс-деплойментам. Прогон предобучения с нуля на 7.1T токенов со всеми задокументированными этапами даёт их отделам продаж конкретный аргумент. Перейдёт ли это в реальный рост заказов — зависит от цены за обученный токен, которую источник не раскрывает.

Вторая — экосистема полностью открытых весов. Команды Moonlight, OLMo и SmolLM теперь имеют ориентир 76.7, который нужно превысить в следующем релизе. Разрыв в 0.5 балла между Instella-MoE (76.7) и Moonlight-16B-A3B (76.2) достаточно мал, чтобы его закрыло единственное изменение в среднем обучении, однако разрыв в 6.6 балла с OLMo-3-7B носит структурный характер и отражает преимущество архитектуры MoE по активным параметрам.

Третья — поставщики закрытых моделей, обслуживающие исследовательские бюджеты. Любая лаборатория, которая платила за API Qwen или Gemini исключительно для академических экспериментов, теперь имеет полностью воспроизводимую альтернативу с весами на каждом чекпойнте — чего ни один закрытый поставщик не предлагает. Оговорка: лицензия ResearchRAIL означает, что как только исследование превращается в продукт, команде нужно переобучать модель или договариваться об иной лицензии. Это реальные затраты на переход, которые закрытые поставщики будут использовать в корпоративных продажах.

Для компаний в iGaming, финтехе и рекламных технологиях, рассматривающих эту модель как базу для доменного файнтюнинга, лицензия исключает её из производственных кандидатов. Следите за кодом обучения. Если сценарий реализуется, можно ожидать как минимум три сторонних форка фреймворков Primus и Miles на GitHub в течение 60 дней.

Руководство для AI-разработки

Для технических руководителей, оценивающих этот релиз, — три конкретных шага на эту неделю.

Первый: скачайте MIT-лицензированный код обучения и изучите реализацию FarSkip-Collective. Независимо от того, будете ли вы когда-либо обучать на Instinct-оборудовании, паттерн перекрытия экспертно-параллельных коммуникаций вычислениями с использованием устаревших активаций переносим на любой MoE-стек обучения. Если ускорение в 12.7% воспроизведётся на кластерах H100, это реальная экономия на прогоне в 7T токенов.

Второй: проведите бенчмарк опубликованных весов на ваших доменных оценках под исследовательской лицензией, прежде чем считать их непригодными для деплоя. Некоторые корпоративные сценарии R&D (внутренний поиск по знаниям, инструменты code review, которые не покидают организацию) могут укладываться в рамки ResearchRAIL в зависимости от юридической интерпретации. Поручите юристу изучить фактический текст лицензии, не предполагая, что ResearchRAIL означает одно и то же в разных релизах. Это не так.

Третий: если вы запускаете MoE-модели в продакшне, протестируйте путь инференса SGLang против вашего текущего стека. Заявление о снижении TTFT на 39.2% стоит нескольких часов работы по воспроизведению, даже если вы не собираетесь принимать саму модель, поскольку улучшения экспертно-параллельного сервинга SGLang применимы к любому MoE, который вы уже используете. Для команд, сравнивающих варианты инфраструктуры, коллекция Hugging Face — самый быстрый путь к весам и конфигурациям токенизатора.

Вопрос, который я бы выделил: AMD опубликовала веса каждого этапа обучения, но не раскрыла астрономическое время или количество GPU-часов для предобучения на 7.1T токенов. Пока эта цифра не станет публичной, заявление о ценовой конкурентоспособности по сравнению с обучением на NVIDIA остаётся непроверяемым. Ориентир: если стоимость обучения AMD за токен находится в пределах 15% от эквивалентного прогона на H100, следует ожидать, что как минимум одна крупная фундаментальная модельная лаборатория объявит о мощностях Instinct до конца 2026 года.

Ключевые выводы

  • Instella-MoE-16B-A3B набирает средний базовый балл 76.7, опережая полностью открытых конкурентов — Moonlight (76.2), SmolLM3-3B (70.5) и OLMo-3-7B (70.1), — но уступая Qwen3.5-4B-Base (79.5).
  • Полное предобучение на 7.1T токенов прошло на AMD MI300X и MI325X с фреймворками ROCm, Primus и Miles. NVIDIA в контуре обучения отсутствовала.
  • FarSkip-Collective обеспечивает заявленное ускорение предобучения на 12.7% и до 39.2% сокращение TTFT при сервинге с экспертным параллелизмом.
  • Лицензия ResearchRAIL блокирует коммерческий деплой весов. MIT-лицензированный код обучения является переиспользуемым активом для производственных команд.
  • После постобучения IFEval вырастает с 77.08 до 83.70, а чекпойнт Think с результатом 73.22 превосходит Olmo3-7B-Think (71.97) и Qwen3.5-4B (69.73).

Часто задаваемые вопросы

В: Можно ли использовать Instella-MoE-16B-A3B в коммерческом продукте?

Нет, веса — нельзя. Они распространяются под лицензией ResearchRAIL, ограниченной академическими и исследовательскими целями. Кодовая база обучения лицензирована отдельно по MIT и допускает коммерческое использование, поэтому команды могут применять рецепт без использования весов.

В: Как Instella-MoE-16B-A3B сравнивается с Qwen3.5-4B-Base?

Базовый чекпойнт Instella-MoE-16B-A3B показывает средний результат 76.7, уступая Qwen3.5-4B-Base (79.5). Однако после постобучения чекпойнт Think набирает 73.22 против 69.73 у Qwen3.5-4B, то есть сравнение меняется в зависимости от оцениваемого этапа.

В: Какое оборудование нужно для запуска Instella-MoE-16B-A3B на инференсе?

16B параметров занимают примерно 32 ГБ памяти весов в BF16, что помещается на одном высокопамятном ускорителе, например MI300X или H100 80GB. AMD поставляет инференс-код SGLang в качестве эталонного пути сервинга.

SC
Sarah Chen
RiverCore Analyst · Dublin, Ireland
ПОДЕЛИТЬСЯ
// ПОХОЖИЕ СТАТЬИ
ГлавнаяРешенияПроектыО насКонтакт
Новости06
Дублин, Ирландия · ЕСGMT+1
LinkedIn
🇷🇺RU