Thomson Reuters випустив власну LLM і відмовився від гонки масштабів
Кожен технічний керівник платформи, який хоч раз підписував рахунок OpenAI наприкінці кварталу, знає цей нервовий тик: витрати на токени зростали швидше, ніж функціональність. Thomson Reuters щойно вийшов на сцену з контраргументом. Власна модель, розроблена всередині компанії, навчена на невеликій частині власного корпусу та — за їхніми словами — значно дешевша у розрахунку на одиницю обчислень порівняно з фронтирними аналогами.
Модель має назву Thomson. Так, це справжня назва продукту. І вона спрямована прямо на тезу про вертикальний AI, яку багато хто з нас обговорював у Slack останні 18 місяців.
Що сталося
2 вересня 2026 року, як повідомляє Lawyers Weekly, Thomson Reuters запустив Thomson — свою першу власну велику мовну модель, розроблену всередині компанії та позиціоновану як таку, що працює за значно меншою вартістю порівняно з аналогічними фронтирними моделями. Компанія представила запуск як «нову главу»: вона вже мала контент, інструменти та профільних експертів. Тепер вона має і ваги моделі.
Технічні заяви важливі. Thomson побудований на основі відкритого коду з використанням того, що компанія називає передовими техніками середнього навчання та постнавчання. Для тренування використовувались Westlaw, Practical Law, Checkpoint і Reuters — чотири архіви, доступ до яких більшість юридичних і податкових команд і так оплачують чималі кошти. Сотні профільних експертів були залучені ще на етапі визначення цілей навчання і аж до фінальних оцінок. Що принципово — компанія стверджує, що модель навчена менш ніж на 10% її контенту. Це заявка на наявний резерв, а не застереження.
CTO Джоел Хрон представив це як відмову від доктрини «масштаб — це все»: «Роками AI-індустрія вважала масштаб відповіддю: більші моделі, більше комп'ютерів, більше грошей. Thomson демонструє, що є інший шлях». CEO Стів Хаскер пішов далі, заявивши, що «ранні оцінки ставлять Thomson на рівні з найновішими фронтирними моделями в широкому діапазоні завдань». Першим виробничим застосуванням Thomson стане Tabular Analysis у CoCounsel Legal, з розгортанням у юридичних фірмах і корпоративних юридичних відділах у найближчому релізі. Компанія також згадала «суверенні AI-опції, що незабаром з'являться» — фраза, від якої кожен європейський CTO має насторожитись.
Технічна анатомія
Якщо відкинути маркетинг, архітектура впізнавана для кожного, хто займався постнавчанням протягом останнього року. Берете основу з відкритим кодом (яку саме — не називають). Застосовуєте інтенсивне середнє навчання на доменному корпусі, якого конкуренти юридично не можуть торкнутися. Поверх — постнавчання з оцінками, відібраними експертами. Запускаєте в продуктовому середовищі, де збої видимі та виправні — у цьому випадку Tabular Analysis, задача структурованого вилучення даних, а не відкрита генерація.
Останній вибір — найрозумніший. Tabular Analysis — обмежена задача. Ви завантажуєте документи, заповнюєте комірки, люди перевіряють. Саме такі робочі навантаження, де спеціалізована модель із жорсткими обмеженнями перевершує узагальнену. Поверхня помилок невелика, а ROI від точності величезний — адже неправильна комірка в таблиці due diligence — це реальна юридична відповідальність.
Брендинг «Fiduciary-Grade™» — це торговельний хід, але базова ідея має зуби. Якщо походження навчальних даних, ідентичність оцінювачів і середовище розгортання — все під контролем одного постачальника, ви отримуєте перевіряємий ланцюжок, який API фронтирної моделі сьогодні запропонувати не може. Порівняйте це з тим, що отримують команди, які будують на базі OpenAI або Anthropic: відмінні загальні можливості, непрозорі навчальні дані та спільна модель оренди.
Thomson Reuters заявляє про суттєве перевищення базової моделі у дотриманні інструкцій і ще більше перевищення у роботі з насиченим доменним контентом. Обидва результати — саме те, чого варто очікувати від добре виконаного доменного постнавчання. Заява про корпус навчання менш ніж 10% — це або справжній резерв можливостей, або маркетингове обрамлення майбутніх ітерацій моделі. Моя думка: і те, і інше, а дорожня карта вже складена.
Хто опиняється під загрозою
Три групи цього тижня мають почуватися некомфортно.
По-перше, legaltech-стартапи, які позиціонували себе як тонку обгортку над API класу GPT з тезою «ми дотренували його на юридичних даних». Цей рів щойно виміряли — і він мілкий. Thomson Reuters володіє Westlaw. Якщо ваша диференціація полягала в RAG по публічному прецедентному праву з гарним інтерфейсом, incumbent щойно випустив модель, навчену людьми, які пишуть хедноти. Виробничі інциденти, які я бачив у схожих обгорткових бізнесах, зазвичай починаються з одного й того ж питання на зборах ради директорів: що ми маємо?
По-друге, постачальники фронтирних моделей, що продають у регульованих вертикалях. Кожен провайдер загального призначення має презентацію з юридичними, фінансовими та податковими кейсами. Thomson Reuters щойно дав кожному генеральному раднику обґрунтовану причину надавати перевагу спеціалізованій моделі з вбудованим походженням контенту. Посилання на суверенний AI у заяві Хаскера — не випадкове. Команди, з якими я працював у європейських фінтех-компаніях, вже два роки запитують саме про це: модель, чию лінію навчальних даних можна показати регулятору без купюр.
По-третє, внутрішні AI-платформні команди у великих юридичних фірмах і корпораціях, які витратили 2024–2025 роки на побудову власних стеків пошуку поверх фронтирних API. Якщо Thomson з'явиться в CoCounsel Legal із заявленим профілем точності та вартості, математика «купити vs побудувати» перевернеться. Підписка на Lawyers Weekly за $49 на рік — це дрібниця, але корпоративні витрати на CoCounsel — зовсім ні, і тепер вони включають власну модель замість перепродажу чужого inference.
Незручний висновок: вертикальні гравці з власним контентом і справжніми доменними експертами мають структурну перевагу, яку багато горизонтальних AI-компаній недооцінили. Контент — це рів. Обчислення завжди орендувались.
Посібник для розробки AI
Якщо ви CTO або технічний керівник платформи в регульованій вертикалі, цей запуск змінює ваше планування на Q4. Конкретні дії:
Цього тижня проаудитуйте граф залежностей моделей. Перелічіть кожен робочий процес, який звертається до фронтирного API. Для кожного поставте два питання: чи існує сьогодні доменно-спеціалізована модель, і якщо ні — чи є у вас достатньо власних даних для постнавчального запуску на відкритій основі? Якщо відповідь на друге — «так», запуск Thomson щойно дав вам аргумент для ради директорів.
Перерахуйте вартість inference-стека відносно спеціалізованих альтернатив. Ціни фронтирних моделей знижуються, але все ще є основною статтею витрат у більшості AI P&L. Якщо вертикальна модель може відповідати можливостям за частку вартості, паралельний запуск обох із маршрутизатором — це нудна, але захищена архітектура. Нудне тримається о 2-й ночі.
Розглядайте походження даних як продуктову функцію. Ваші корпоративні клієнти запитуватимуть у RFP, звідки взялися навчальні дані. Майте відповідь. Якщо ваша відповідь — «ми використовуємо сторонній API», починайте будувати суверенну історію зараз — через розгортання on-prem, договірний контроль даних або власну постнавчану модель.
Уважно стежте за розгортанням CoCounsel. Tabular Analysis — вузький перший запуск. Справжній тест — що Thomson Reuters випустить у наступні два квартали. Якщо вони вийдуть за межі структурованого вилучення у відкрите складання документів із тими самими заявами про вартість і точність, теза про вертикальні моделі буде підтверджена.
Ключові висновки
- Thomson Reuters випустив власну LLM, навчену менш ніж на 10% архіву контенту, заявляючи про рівність із фронтирними моделями за частки вартості.
- Перше виробниче застосування — Tabular Analysis у CoCounsel Legal, обмежена задача вилучення даних, де спеціалізовані моделі мають чітку перевагу над узагальненими.
- Контентний рів важливіший за обчислювальний. Вертикальні гравці з власними корпусами та доменними експертами мають структурну перевагу.
- Legaltech-обгортки над фронтирними API — найбільш вразливі. Фронтирні постачальники, що продають у регульовані вертикалі, — другі за вразливістю.
- Суверенний AI — ключова прихована фраза у цьому оголошенні. Очікуйте, що європейські регульовані покупці вимагатимуть підтвердження походження навчальних даних у кожному RFP 2026 року.
Часті запитання
П: Що таке нова AI-модель Thomson Reuters — Thomson?
Thomson — це перша власна велика мовна модель Thomson Reuters, розроблена всередині компанії на основі відкритого коду з доменно-специфічним середнім навчанням і постнавчанням. Вона використовує контент із Westlaw, Practical Law, Checkpoint і Reuters, і першим розгортається в Tabular Analysis у CoCounsel Legal.
П: Як Thomson порівнюється з фронтирними моделями на кшталт GPT або Claude?
CEO Thomson Reuters Стів Хаскер заявив, що ранні оцінки ставлять Thomson на рівні з найновішими фронтирними моделями в широкому діапазоні завдань за частки вартості навчання та inference. Модель також демонструє суттєве перевищення базової моделі у дотриманні інструкцій і ще більше — у роботі з насиченим доменним контентом.
П: Чому це важливо для корпоративної AI-стратегії?
Це підтверджує тезу про вертикальний AI: спеціалізована модель, побудована на власному контенті та оцінках від експертів, може конкурувати із загальними фронтирними моделями для доменних завдань. Команди в регульованих галузях мають переглянути залежності від фронтирних API і почати розглядати походження навчальних даних як продуктову функцію.
Kimi K3 від Moonshot — перша відкрита модель класу 3 трильйони параметрів
Kimi K3 від Moonshot виходить у відкритий доступ 27 липня із 2,8 трильйона параметрів, перемагає Fable у сліпих тестах і обвалює акції Zhipu на 27%.
DeepSeek Harness: Кожен Примітив Агента Тепер є Плагіном
DeepSeek випустив MIT-ліцензований harness для агентів, де моделі, інструменти, пісочниці та сам цикл є змінними плагінами. Ось що це насправді змінює.
Convex залучає $57M через корупцію даних у базах від AI-коду
Convex залучила $57M на основі заяви, що 90% AI-додатків пошкоджують дані у традиційних базах. Що це означає для backend-команд?




