Skip to content
RiverCore
Thomson Reuters выпустила собственную LLM и отказалась от гонки масштабов
Thomson Reuters LLMvertical AIproprietary modelThomson Reuters AI model vs frontier LLMlegal AI language model cost efficiency

Thomson Reuters выпустила собственную LLM и отказалась от гонки масштабов

3 сен 20266 мин. чтенияAlex Drover

Каждый руководитель платформы, хоть раз подписывавший счёт от OpenAI в конце квартала, знает это ощущение: расходы на токены растут быстрее, чем функциональность продукта. Thomson Reuters вышла на сцену с контраргументом. Проприетарная модель, разработанная внутри компании, обученная на небольшой части собственного корпуса и стоящая (по их словам) в разы меньше, чем frontier-вычисления.

Модель называется Thomson. Да, это реальное название продукта. И она направлена прямо в сердце тезиса о вертикальном AI, который многие из нас обсуждали в Slack последние 18 месяцев.

Что произошло

2 сентября 2026 года, как сообщил Lawyers Weekly, Thomson Reuters запустила Thomson — свою первую проприетарную большую языковую модель, разработанную внутри компании и позиционируемую как работающую при значительно меньших затратах по сравнению с сопоставимыми frontier-моделями. Компания представила запуск как «новую главу»: она уже владела контентом, инструментами и экспертами в предметной области. Теперь она владеет и весами модели.

Технические заявления важны. Thomson построена на базе открытого исходного кода с применением того, что компания называет продвинутыми техниками mid-training и post-training. Обучение проводилось на данных Westlaw, Practical Law, Checkpoint и Reuters — четырёх архивах, за доступ к которым большинство юридических и налоговых команд уже платят серьёзные деньги. Сотни профильных экспертов были задействованы на всех этапах — от разработки целей обучения до финальных оценок. Принципиально важно: компания заявляет, что модель обучена менее чем на 10% имеющегося контента. Это декларируемый резерв возможностей, а не оговорка.

CTO Джоэл Хрон представил это как отказ от доктрины «масштаб — это всё»: «Годами AI-индустрия считала масштаб ответом на всё: более крупные модели, больше вычислительных мощностей, больше денег. Thomson показывает, что существует другой путь». CEO Стив Хаскер пошёл ещё дальше, заявив, что «ранние оценки ставят Thomson наравне с новейшими frontier-моделями по широкому спектру задач». Первым продуктивным применением Thomson стал Tabular Analysis в CoCounsel Legal, с развёртыванием для юридических фирм и корпоративных юридических департаментов в предстоящем релизе. Компания также упомянула «опции суверенного AI в будущем» — фраза, которая должна заставить каждого европейского CTO насторожиться.

Техническая анатомия

Убрав маркетинг, архитектура оказывается знакомой каждому, кто занимался post-training в прошлом году. Берётся основа с открытым исходным кодом (конкретное название не называется). На неё накладывается интенсивный mid-training на доменном корпусе, до которого конкуренты юридически не могут добраться. Поверх — post-training с оценками, сформированными экспертами. Модель встраивается в продуктовую поверхность, где сбои видны и исправимы — в данном случае Tabular Analysis, задача структурированного извлечения данных, а не открытой генерации.

Последний выбор — самый умный. Tabular Analysis — ограниченная задача. Вы загружаете документы, заполняете ячейки, люди проверяют. Это именно тот тип нагрузки, где специализированная модель с жёсткими ограничениями превосходит универсальную. Поверхность сбоев невелика, а ROI на точность огромен — ведь неверная ячейка в таблице due diligence несёт реальную юридическую ответственность.

Брендинг «Fiduciary-Grade™» — это торговый приём, но сама идея обоснована. Если происхождение обучающих данных, личность оценщиков и среда развёртывания контролируются одним вендором, вы получаете проверяемую цепочку, которую frontier model API сегодня предложить не может. Сравните это с тем, что получают команды, работающие на OpenAI или Anthropic: отличные общие возможности, непрозрачные обучающие данные и история с общей арендой.

Thomson Reuters заявляет о значимом приросте по сравнению с базовой моделью в следовании инструкциям и ещё большем приросте при работе с плотным доменно-специфичным контентом. Оба результата — именно то, чего следует ожидать от хорошо выполненного доменного post-training. Заявление о менее чем 10% использованного обучающего корпуса — это либо реальный резерв возможностей, либо маркетинговая подача для будущих итераций модели. Моя оценка: и то, и другое, причём дорожная карта уже разработана.

Кто пострадает

Три группы должны чувствовать себя неуютно на этой неделе.

Во-первых, legaltech-стартапы, позиционировавшие себя как тонкие обёртки поверх GPT-класса API с историей «мы дообучили это на юридических данных». Этот ров только что был измерен — и он мелкий. Thomson Reuters владеет Westlaw. Если ваше отличие состояло в RAG поверх публичных судебных дел с красивым интерфейсом, конкурент только что выпустил модель, обученную людьми, которые пишут заголовки к этим делам. Производственные инциденты, которые я наблюдал в аналогичных wrapper-бизнесах, обычно начинаются с одного вопроса на заседании совета директоров: чем мы владеем?

Во-вторых, вендоры frontier-моделей, продающие в регулируемые вертикали. У каждого поставщика универсальных моделей есть презентация с юридическими, финансовыми и налоговыми кейсами. Thomson Reuters только что дала каждому главному юрисконсульту обоснованный повод предпочесть специализированную модель с встроенной провенанс-историей контента. Упоминание суверенного AI в заявлении Хаскера — не случайность. Команды, с которыми я работал в европейском fintech, задавали именно этот вопрос два года: нужна модель, историю обучающих данных которой можно представить регулятору без купюр.

В-третьих, внутренние AI-платформенные команды в крупных юридических фирмах и корпорациях, потратившие 2024–2025 годы на создание кастомных retrieval-стеков поверх frontier API. Если Thomson войдёт в CoCounsel Legal с заявленными показателями точности и стоимости, математика «купить против создать» изменится. Подписка Lawyers Weekly за $49 в год — это округление, но корпоративные расходы на CoCounsel — совсем нет, и теперь они включают проприетарную модель вместо перепродажи чужого инференса.

Неудобный вывод: вертикальные игроки с проприетарным контентом и реальными доменными экспертами имеют структурное преимущество, которое многие горизонтальные AI-компании недооценили. Контент — это ров. Вычисления всегда были арендованными.

Практическое руководство по развитию AI

Если вы CTO или руководитель платформы в регулируемой вертикали, этот запуск меняет ваше планирование на IV квартал. Конкретные действия:

На этой неделе проведите аудит графа зависимостей от моделей. Перечислите каждый рабочий процесс, обращающийся к frontier API. Для каждого задайте два вопроса: существует ли сегодня доменно-специализированная модель, и если нет — владеем ли мы достаточным объёмом проприетарных данных, чтобы рассмотреть post-training на базе открытого исходного кода? Если ответ на второй вопрос положительный, запуск Thomson даёт вам доказательную точку для представления совету директоров.

Пересчитайте стоимость вашего inference-стека по сравнению со специализированными альтернативами. Цены на frontier снижаются, но по-прежнему являются главной статьёй расходов в большинстве AI P&L. Если вертикальная модель может сравняться по возможностям при доле затрат, запуск обеих параллельно с роутером — это скучная, но надёжная архитектура. Скучное выдерживает в 2 часа ночи.

Воспринимайте провенанс обучающих данных как продуктовую функцию. Ваши корпоративные клиенты будут спрашивать в RFP, откуда взялись обучающие данные. Имейте ответ. Если ваш ответ — «мы используем сторонний API», начинайте строить суверенную историю прямо сейчас — через on-prem развёртывание, договорные средства контроля данных или собственную дообученную модель.

Внимательно следите за развёртыванием CoCounsel. Tabular Analysis — узкий первый запуск. Настоящий тест — что Thomson Reuters выпустит в следующие два квартала. Если они выйдут за рамки структурированного извлечения в открытое создание текстов с теми же заявлениями о стоимости и точности, тезис о вертикальной модели будет подтверждён.

Ключевые выводы

  • Thomson Reuters выпустила проприетарную LLM, обученную менее чем на 10% контентного архива, заявляя о паритете с frontier-моделями при значительно меньших затратах.
  • Первое продуктивное применение — Tabular Analysis в CoCounsel Legal, ограниченная задача извлечения данных, где специализированные модели имеют явное преимущество перед универсальными.
  • Контентный ров важнее вычислительного. Вертикальные игроки с проприетарными корпусами и доменными экспертами имеют структурное преимущество.
  • Legaltech-обёртки поверх frontier API наиболее уязвимы. Вендоры frontier-моделей в регулируемых вертикалях — вторые по уязвимости.
  • Суверенный AI — это скрытая ключевая фраза в данном анонсе. Ожидайте, что европейские регулируемые покупатели будут требовать провенанс обучающих данных в каждом RFP 2026 года.

Часто задаваемые вопросы

В: Что такое новая AI-модель Thomson Reuters — Thomson?

Thomson — первая проприетарная большая языковая модель Thomson Reuters, разработанная внутри компании на базе открытого исходного кода с применением доменно-специфичного mid-training и post-training. Она использует контент Westlaw, Practical Law, Checkpoint и Reuters и впервые интегрирована в Tabular Analysis в CoCounsel Legal.

В: Как Thomson сравнивается с frontier-моделями, такими как GPT или Claude?

CEO Thomson Reuters Стив Хаскер заявил, что ранние оценки ставят Thomson наравне с новейшими frontier-моделями по широкому спектру задач при доле затрат на обучение и инференс. Модель также демонстрирует значимый прирост над базовой моделью в следовании инструкциям и ещё больший — при работе с плотным доменно-специфичным контентом.

В: Почему это важно для корпоративной AI-стратегии?

Это подтверждает тезис о вертикальном AI: специализированная модель, построенная на проприетарном контенте и оценках, сформированных экспертами, может конкурировать с универсальными frontier-моделями на доменных задачах. Командам в регулируемых отраслях следует пересмотреть зависимость от frontier API и начать воспринимать провенанс обучающих данных как продуктовую функцию.

AD
Alex Drover
RiverCore Analyst · Dublin, Ireland
ПОДЕЛИТЬСЯ
// ПОХОЖИЕ СТАТЬИ
ГлавнаяРешенияПроектыО насКонтакт
Новости06
Дублин, Ирландия · ЕСGMT+1
LinkedIn
🇷🇺RU