Skip to content
RiverCore
AMD випускає 16B відкриту MoE-модель, навчену виключно на Instinct GPU
AMD Instella MoEROCm trainingInstinct GPUAMD MoE model trained on Instinct hardwareopen mixture of experts model AMD

AMD випускає 16B відкриту MoE-модель, навчену виключно на Instinct GPU

3 сер 20267 хв. читанняSarah Chen

AMD щойно представила модель Mixture-of-Experts з 16B параметрами, яка набрала середній базовий бал 76.7 — на половину пункту вище за Moonlight-16B-A3B (76.2) і приблизно на 6.6 пункту вище за OLMo-3-7B (70.1). Проте найцікавіша цифра — не різниця в рейтингу. Головне те, що весь процес навчання відбувся на процесорах Instinct MI300X та MI325X, без жодного апаратного забезпечення NVIDIA. Для компанії, яка два роки доводить, що ROCm здатний на серйозне попереднє навчання, це є конкретним підтвердженням.

Що сталося

AMD випустила Instella-MoE-16B-A3B — decoder-only Mixture-of-Experts модель із загальною кількістю 16B параметрів і 2.8B активних на токен. Як повідомляє MarkTechPost, випуск включає ваги з кожного етапу навчання, суміші даних, конфігурації навчання та інференс-код через SGLang. Кодова база навчання ліцензована за MIT. Самі ваги поставляються під ліцензією ResearchRAIL, обмеженою академічними та дослідницькими цілями.

Конвеєр навчання являє собою повноцінний сучасний рецепт MoE. Попереднє навчання охоплює 7.1T токенів із Nemotron-CC-v2, MegaMath, FineMath, RefineCode та TxT360. Середнє навчання використовує Dolma3 Dolmino 100B із трьома варіантами даних, об'єднаними зважуванням. Окремий етап довгого контексту розширює вікно з 4K до 64K за допомогою YaRN зі збільшеним RoPE theta та маскуванням документів. Після навчання виконується SFT на Dolci-Think-SFT-7B плюс суміші Nemotron, потім набір із 512K прикладів на основі зворотного зв'язку, після якого — DPO з оновленнями зміщення маршрутизатора та вимкненою допоміжною втратою балансування навантаження. RL працює у фреймворку Miles протягом 1400 кроків RLVR для дотримання інструкцій, завершуючись Multi-Teacher On-Policy Distillation.

Базовий чекпоінт із середнім балом 76.7 випереджає всіх повністю відкритих конкурентів, з якими AMD порівнювала: Moonlight-16B-A3B (76.2), SmolLM3-3B-Base (70.5), OLMo-3-7B (70.1) та OLMoE-1B-7B (61.9). Він все ще поступається Qwen3.5-4B-Base (79.5). Після навчання чекпоінт Think досягає 73.22, що вище за Olmo3-7B-Think (71.97), Gemma-4-E4B think (70.47) та Qwen3.5-4B (69.73). IFEval зростає з 77.08 до 83.70 на всьому стеку після навчання. Джерело не розкриває загальну кількість GPU-годин або вартість запуску на 7.1T токенів, що важливо, адже вся теза «AMD як платформа для навчання» тримається або падає саме на цьому показнику.

Технічна архітектура

Сама архітектура — стандартна MoE із двома власними доповненнями. 27 шарів, прихований розмір 2048, 16 голів уваги та словник із 128 896 токенів. Кожен шар MoE містить 2 спільні експерти плюс 6 маршрутизованих, вибраних із пулу 64. Саме так досягається 2.8B активних проти 16B загальних. Ціль Multi-Token Prediction застосовується під час попереднього та середнього навчання — це вже стало стандартом після того, як DeepSeek популяризував її.

Дві речі, що справді варті вивчення, — це Gated MLA та FarSkip-Collective. Gated MLA додає легкий вивчений вихідний гейт до Multi-head Latent Attention: спеціальна лінійна проєкція виводить гейт, обумовлений вхідними даними, який множить вихід уваги перед фінальною проєкцією. Дешеві параметри, суттєве зростання виразності. FarSkip-Collective — цікавіша частина з точки зору інфраструктури. Він направляє застарілі та часткові активації до шарів MoE і уваги, що дозволяє перекривати all-to-all комунікацію при паралелізмі експертів із обчисленням замість зупинки на критичному шляху.

Цифри, які AMD повідомляє: прискорення попереднього навчання на 12.7% завдяки FarSkip-Collective та зменшення часу до першого токена (TTFT) до 39.2% при обслуговуванні з паралелізмом експертів. Обидва показники отримані з власного інструментарію AMD, тому перед тим, як вважати їх переносними на не-Instinct обладнання, я б хотів побачити незалежну відтворюваність. Показник 39.2% TTFT зокрема обмежений конкретною топологією обслуговування з паралелізмом експертів, і джерело не вказує кількість GPU або розмір батчу для цього вимірювання.

На стороні обслуговування 16B параметрів у BF16 займають приблизно 32 GB пам'яті для ваг. Це комфортно вміщується на одному MI300X (192 GB HBM3) або одному H100 80GB. Шлях SGLang робить модель справді придатною для запуску поза власним дата-центром AMD. Оцінка довгого контексту: 41.5 на HELMET та 79.4 на RULER, причому результат RULER достатньо сильний, щоб припустити, що розширення YaRN витримало після навчання, а не повернулось до короткоконтекстної поведінки. Якщо заяви щодо FarSkip відтворяться в незалежних бенчмарках, до Q1 2027 ми повинні побачити принаймні одну не-AMD лабораторію, яка опублікує порівнянну MoE з таким самим патерном зв'язності.

Хто програє

Очевидний програш тут — усі, хто будує комерційний хостинговий продукт на основі ваг Instella-MoE. ResearchRAIL повністю блокує це. Кодова база навчання під ліцензією MIT є реальним надбанням для комерційних команд: задокументований, відтворюваний рецепт MoE, який працює на non-NVIDIA кремнії. Це найважливіше для трьох груп.

По-перше, середні хмарні провайдери, які придбали потужності Instinct в очікуванні того, що ROCm врешті-решт наздожене. До цього більшість публічних свідчень навчання на AMD виробничого рівня стосувалася файнтюнінгу або розгортань для інференсу. Запуск попереднього навчання з нуля на 7.1T токенів із задокументованим кожним етапом дає їхнім відділам продажів щось конкретне для демонстрації. Чи перетвориться це на реальну швидкість бронювань, залежить від вартості одного навченого токена, яку джерело не розкриває.

По-друге, набір конкурентів із повністю відкритими вагами. Команди Moonlight, OLMo та SmolLM тепер мають базовий рівень 76.7, який потрібно перевищити у своєму наступному випуску. Розрив у 0.5 пункту між Instella-MoE (76.7) та Moonlight-16B-A3B (76.2) достатньо малий, щоб його закрив один невеликий апдейт середнього навчання, але розрив у 6.6 пункту над OLMo-3-7B є структурним і відображає перевагу архітектури MoE за активними параметрами.

По-третє, постачальники закритих моделей, які обслуговують дослідницькі бюджети. Будь-яка лабораторія, яка платила за доступ до API Qwen або Gemini виключно для академічних експериментів, тепер має повністю відтворювану альтернативу з вагами на кожному чекпоінті — те, чого жоден закритий постачальник не пропонує. Але є застереження: ліцензія ResearchRAIL означає, що в момент, коли дослідження перетворюється на продукт, командам потрібно перенавчати або отримувати ліцензію іншим чином. Це реальна вартість переходу, яку закриті постачальники використовуватимуть в корпоративних продажах.

Для компаній iGaming, fintech та ad-tech, які розглядають це як основу для доменного файнтюнінгу, ліцензія вбиває його як виробничого кандидата. Натомість відстежуйте код навчання. Якщо все піде за планом, ми повинні побачити принаймні три не-AMD форки фреймворків Primus та Miles на GitHub протягом 60 днів.

Практичний посібник для AI-розробки

Для технічних керівників, які оцінюють цей випуск, — три конкретні дії цього тижня.

Перше: завантажте код навчання під ліцензією MIT та вивчіть реалізацію FarSkip-Collective. Незалежно від того, чи будете ви навчати на Instinct кремнії, патерн перекриття expert-parallel комунікації з обчисленням за допомогою застарілих активацій є переносним на будь-який стек навчання MoE. Якщо прискорення на 12.7% відтворюється на кластерах H100, це реальна економія на запуску 7T токенів.

Друге: проведіть бенчмарк випущених ваг на власних доменних оцінках під дослідницькою ліцензією, перш ніж вважати, що не можете використовувати їх у виробництві. Деякі корпоративні R&D сценарії (внутрішній пошук знань, інструменти рев'ю коду, які ніколи не залишають організацію) можуть вписуватися в межі ResearchRAIL залежно від юридичного трактування. Зверніться до юристів, щоб вони прочитали реальний текст ліцензії, а не припускайте, що ResearchRAIL означає те саме в різних випусках. Це не так.

Третє: якщо ви обслуговуєте MoE-моделі у виробництві, протестуйте шлях інференсу SGLang порівняно з вашим поточним стеком. Заява про 39.2% скорочення TTFT варта кількох годин відтворення, навіть якщо ви не приймаєте саму модель, оскільки покращення expert-parallel обслуговування в SGLang застосовуватимуться до будь-якої MoE, яку ви вже запускаєте. Для команд, що порівнюють варіанти інфраструктури, колекція Hugging Face — найшвидший шлях до ваг і конфігурацій токенізатора.

Питання без відповіді, на яке я б звернув увагу: AMD опублікувала ваги кожного етапу навчання, але не розкрила реальний час або кількість GPU-годин для попереднього навчання на 7.1T токенів. Доки ця цифра не стане публічною, твердження про конкурентоспроможність вартості порівняно з навчанням на основі NVIDIA залишається неспростовним. Орієнтир: якщо вартість навчання AMD за токен знаходиться в межах 15% від еквівалентного запуску на H100, ми повинні побачити, як принаймні одна велика лабораторія фундаментальних моделей оголосить про потужності Instinct до кінця 2026 року.

Ключові висновки

  • Instella-MoE-16B-A3B показує базовий середній бал 76.7, випереджаючи повністю відкритих конкурентів Moonlight (76.2), SmolLM3-3B (70.5) та OLMo-3-7B (70.1), поступаючись Qwen3.5-4B-Base (79.5).
  • Повне попереднє навчання на 7.1T токенів відбулося на AMD MI300X та MI325X із фреймворками ROCm, Primus та Miles. Жодного NVIDIA в процесі навчання.
  • FarSkip-Collective забезпечує заявлене прискорення попереднього навчання на 12.7% та скорочення TTFT до 39.2% при обслуговуванні з паралелізмом експертів.
  • Ліцензія ResearchRAIL блокує комерційне розгортання ваг. Код навчання під ліцензією MIT є повторно використовуваним активом для виробничих команд.
  • IFEval після навчання зростає з 77.08 до 83.70, а чекпоінт Think із результатом 73.22 випереджає Olmo3-7B-Think (71.97) та Qwen3.5-4B (69.73).

Часті запитання

П: Чи можу я використовувати Instella-MoE-16B-A3B у комерційному продукті?

Ні, не ваги. Вони поставляються під ліцензією ResearchRAIL, обмеженою академічними та дослідницькими цілями. Кодова база навчання окремо ліцензована за MIT і може використовуватися в комерційних контекстах, тому команди можуть застосовувати рецепт без використання самих ваг.

П: Як Instella-MoE-16B-A3B порівнюється з Qwen3.5-4B-Base?

Базовий чекпоінт Instella-MoE-16B-A3B у середньому набирає 76.7, що нижче за Qwen3.5-4B-Base (79.5). Проте після навчання чекпоінт Think набирає 73.22 проти 69.73 у Qwen3.5-4B, тому порівняння змінюється залежно від того, який етап ви оцінюєте.

П: Яке обладнання потрібне для запуску Instella-MoE-16B-A3B для інференсу?

16B параметрів вимагають приблизно 32 GB пам'яті для ваг у BF16, що вміщується на одному прискорювачі з великою пам'яттю, як-от MI300X або H100 80GB. AMD поставляє інференс-код SGLang як референсний шлях обслуговування.

SC
Sarah Chen
RiverCore Analyst · Dublin, Ireland
ПОДІЛИТИСЯ
// СХОЖІ СТАТТІ
ГоловнаРішенняПроєктиПро насКонтакт
Новини06
Дублін, Ірландія · ЄСGMT+1
LinkedIn
🇺🇦UK