Thomson Reuters выпустила собственную LLM и отказалась от гонки масштабов
Каждый руководитель платформы, хоть раз подписывавший счёт от OpenAI в конце квартала, знает это ощущение: расходы на токены растут быстрее, чем функциональность продукта. Thomson Reuters вышла на сцену с контраргументом. Проприетарная модель, разработанная внутри компании, обученная на небольшой части собственного корпуса и стоящая (по их словам) в разы меньше, чем frontier-вычисления.
Модель называется Thomson. Да, это реальное название продукта. И она направлена прямо в сердце тезиса о вертикальном AI, который многие из нас обсуждали в Slack последние 18 месяцев.
Что произошло
2 сентября 2026 года, как сообщил Lawyers Weekly, Thomson Reuters запустила Thomson — свою первую проприетарную большую языковую модель, разработанную внутри компании и позиционируемую как работающую при значительно меньших затратах по сравнению с сопоставимыми frontier-моделями. Компания представила запуск как «новую главу»: она уже владела контентом, инструментами и экспертами в предметной области. Теперь она владеет и весами модели.
Технические заявления важны. Thomson построена на базе открытого исходного кода с применением того, что компания называет продвинутыми техниками mid-training и post-training. Обучение проводилось на данных Westlaw, Practical Law, Checkpoint и Reuters — четырёх архивах, за доступ к которым большинство юридических и налоговых команд уже платят серьёзные деньги. Сотни профильных экспертов были задействованы на всех этапах — от разработки целей обучения до финальных оценок. Принципиально важно: компания заявляет, что модель обучена менее чем на 10% имеющегося контента. Это декларируемый резерв возможностей, а не оговорка.
CTO Джоэл Хрон представил это как отказ от доктрины «масштаб — это всё»: «Годами AI-индустрия считала масштаб ответом на всё: более крупные модели, больше вычислительных мощностей, больше денег. Thomson показывает, что существует другой путь». CEO Стив Хаскер пошёл ещё дальше, заявив, что «ранние оценки ставят Thomson наравне с новейшими frontier-моделями по широкому спектру задач». Первым продуктивным применением Thomson стал Tabular Analysis в CoCounsel Legal, с развёртыванием для юридических фирм и корпоративных юридических департаментов в предстоящем релизе. Компания также упомянула «опции суверенного AI в будущем» — фраза, которая должна заставить каждого европейского CTO насторожиться.
Техническая анатомия
Убрав маркетинг, архитектура оказывается знакомой каждому, кто занимался post-training в прошлом году. Берётся основа с открытым исходным кодом (конкретное название не называется). На неё накладывается интенсивный mid-training на доменном корпусе, до которого конкуренты юридически не могут добраться. Поверх — post-training с оценками, сформированными экспертами. Модель встраивается в продуктовую поверхность, где сбои видны и исправимы — в данном случае Tabular Analysis, задача структурированного извлечения данных, а не открытой генерации.
Последний выбор — самый умный. Tabular Analysis — ограниченная задача. Вы загружаете документы, заполняете ячейки, люди проверяют. Это именно тот тип нагрузки, где специализированная модель с жёсткими ограничениями превосходит универсальную. Поверхность сбоев невелика, а ROI на точность огромен — ведь неверная ячейка в таблице due diligence несёт реальную юридическую ответственность.
Брендинг «Fiduciary-Grade™» — это торговый приём, но сама идея обоснована. Если происхождение обучающих данных, личность оценщиков и среда развёртывания контролируются одним вендором, вы получаете проверяемую цепочку, которую frontier model API сегодня предложить не может. Сравните это с тем, что получают команды, работающие на OpenAI или Anthropic: отличные общие возможности, непрозрачные обучающие данные и история с общей арендой.
Thomson Reuters заявляет о значимом приросте по сравнению с базовой моделью в следовании инструкциям и ещё большем приросте при работе с плотным доменно-специфичным контентом. Оба результата — именно то, чего следует ожидать от хорошо выполненного доменного post-training. Заявление о менее чем 10% использованного обучающего корпуса — это либо реальный резерв возможностей, либо маркетинговая подача для будущих итераций модели. Моя оценка: и то, и другое, причём дорожная карта уже разработана.
Кто пострадает
Три группы должны чувствовать себя неуютно на этой неделе.
Во-первых, legaltech-стартапы, позиционировавшие себя как тонкие обёртки поверх GPT-класса API с историей «мы дообучили это на юридических данных». Этот ров только что был измерен — и он мелкий. Thomson Reuters владеет Westlaw. Если ваше отличие состояло в RAG поверх публичных судебных дел с красивым интерфейсом, конкурент только что выпустил модель, обученную людьми, которые пишут заголовки к этим делам. Производственные инциденты, которые я наблюдал в аналогичных wrapper-бизнесах, обычно начинаются с одного вопроса на заседании совета директоров: чем мы владеем?
Во-вторых, вендоры frontier-моделей, продающие в регулируемые вертикали. У каждого поставщика универсальных моделей есть презентация с юридическими, финансовыми и налоговыми кейсами. Thomson Reuters только что дала каждому главному юрисконсульту обоснованный повод предпочесть специализированную модель с встроенной провенанс-историей контента. Упоминание суверенного AI в заявлении Хаскера — не случайность. Команды, с которыми я работал в европейском fintech, задавали именно этот вопрос два года: нужна модель, историю обучающих данных которой можно представить регулятору без купюр.
В-третьих, внутренние AI-платформенные команды в крупных юридических фирмах и корпорациях, потратившие 2024–2025 годы на создание кастомных retrieval-стеков поверх frontier API. Если Thomson войдёт в CoCounsel Legal с заявленными показателями точности и стоимости, математика «купить против создать» изменится. Подписка Lawyers Weekly за $49 в год — это округление, но корпоративные расходы на CoCounsel — совсем нет, и теперь они включают проприетарную модель вместо перепродажи чужого инференса.
Неудобный вывод: вертикальные игроки с проприетарным контентом и реальными доменными экспертами имеют структурное преимущество, которое многие горизонтальные AI-компании недооценили. Контент — это ров. Вычисления всегда были арендованными.
Практическое руководство по развитию AI
Если вы CTO или руководитель платформы в регулируемой вертикали, этот запуск меняет ваше планирование на IV квартал. Конкретные действия:
На этой неделе проведите аудит графа зависимостей от моделей. Перечислите каждый рабочий процесс, обращающийся к frontier API. Для каждого задайте два вопроса: существует ли сегодня доменно-специализированная модель, и если нет — владеем ли мы достаточным объёмом проприетарных данных, чтобы рассмотреть post-training на базе открытого исходного кода? Если ответ на второй вопрос положительный, запуск Thomson даёт вам доказательную точку для представления совету директоров.
Пересчитайте стоимость вашего inference-стека по сравнению со специализированными альтернативами. Цены на frontier снижаются, но по-прежнему являются главной статьёй расходов в большинстве AI P&L. Если вертикальная модель может сравняться по возможностям при доле затрат, запуск обеих параллельно с роутером — это скучная, но надёжная архитектура. Скучное выдерживает в 2 часа ночи.
Воспринимайте провенанс обучающих данных как продуктовую функцию. Ваши корпоративные клиенты будут спрашивать в RFP, откуда взялись обучающие данные. Имейте ответ. Если ваш ответ — «мы используем сторонний API», начинайте строить суверенную историю прямо сейчас — через on-prem развёртывание, договорные средства контроля данных или собственную дообученную модель.
Внимательно следите за развёртыванием CoCounsel. Tabular Analysis — узкий первый запуск. Настоящий тест — что Thomson Reuters выпустит в следующие два квартала. Если они выйдут за рамки структурированного извлечения в открытое создание текстов с теми же заявлениями о стоимости и точности, тезис о вертикальной модели будет подтверждён.
Ключевые выводы
- Thomson Reuters выпустила проприетарную LLM, обученную менее чем на 10% контентного архива, заявляя о паритете с frontier-моделями при значительно меньших затратах.
- Первое продуктивное применение — Tabular Analysis в CoCounsel Legal, ограниченная задача извлечения данных, где специализированные модели имеют явное преимущество перед универсальными.
- Контентный ров важнее вычислительного. Вертикальные игроки с проприетарными корпусами и доменными экспертами имеют структурное преимущество.
- Legaltech-обёртки поверх frontier API наиболее уязвимы. Вендоры frontier-моделей в регулируемых вертикалях — вторые по уязвимости.
- Суверенный AI — это скрытая ключевая фраза в данном анонсе. Ожидайте, что европейские регулируемые покупатели будут требовать провенанс обучающих данных в каждом RFP 2026 года.
Часто задаваемые вопросы
В: Что такое новая AI-модель Thomson Reuters — Thomson?
Thomson — первая проприетарная большая языковая модель Thomson Reuters, разработанная внутри компании на базе открытого исходного кода с применением доменно-специфичного mid-training и post-training. Она использует контент Westlaw, Practical Law, Checkpoint и Reuters и впервые интегрирована в Tabular Analysis в CoCounsel Legal.
В: Как Thomson сравнивается с frontier-моделями, такими как GPT или Claude?
CEO Thomson Reuters Стив Хаскер заявил, что ранние оценки ставят Thomson наравне с новейшими frontier-моделями по широкому спектру задач при доле затрат на обучение и инференс. Модель также демонстрирует значимый прирост над базовой моделью в следовании инструкциям и ещё больший — при работе с плотным доменно-специфичным контентом.
В: Почему это важно для корпоративной AI-стратегии?
Это подтверждает тезис о вертикальном AI: специализированная модель, построенная на проприетарном контенте и оценках, сформированных экспертами, может конкурировать с универсальными frontier-моделями на доменных задачах. Командам в регулируемых отраслях следует пересмотреть зависимость от frontier API и начать воспринимать провенанс обучающих данных как продуктовую функцию.
Kimi K3 от Moonshot — первая открытая модель класса 3 триллиона параметров
Kimi K3 от Moonshot выходит в открытый доступ 27 июля с 2,8 триллиона параметров, обходит Fable в слепых тестах и обрушивает акции Zhipu на 27%.
DeepSeek Harness: каждый примитив агента теперь является плагином
DeepSeek выпустил MIT-лицензированный harness для агентов, где модели, инструменты, песочницы и сам цикл — сменные плагины. Вот что это реально меняет.
Convex привлёк $57 млн на фоне проблем с повреждением данных в AI-приложениях
Convex привлёк $57 млн, утверждая, что 90% AI-приложений повреждают данные в традиционных БД. Что это значит для backend-команд?




