Skip to content
RiverCore
Утечка Chain-of-Thought затронула GPT-5.6, Claude Opus 4.8 и Gemini 3
chain-of-thought leakAI securityfrontier modelshidden reasoning blocks credential exposureagentic API security vulnerabilities

Утечка Chain-of-Thought затронула GPT-5.6, Claude Opus 4.8 и Gemini 3

8 сен 20268 мин. чтенияMarina Koval

У любого руководителя платформы, который в этом квартале запускает агентные функции на базе фронтирных API, теперь есть конкретная цифра для комитета по рискам: 315 320 скрытых блоков рассуждений, декодированных из публичных транскриптов агентов, из которых было извлечено 182 жёстко прописанных учётных данных, ни разу не появившихся ни в одном видимом выводе модели. Таков результат совместного исследования команды из ELLIS Institute Tübingen, Max Planck Institute, MATS Research и Snyk, опубликованного на ArXiv. Это открытие напрямую касается каждой инженерной организации, которая относилась к шифрованию на стороне вендора как к формальной галочке в чеклисте соответствия требованиям. Вендоры выпустили патчи. Архитектурное допущение, породившее баг, по-прежнему используется в production повсеместно.

Цифры

Прежде чем кто-либо на бюджетном совещании отмахнётся от этого как от академического эксплойта, стоит разобраться в механике. Современные модели рассуждений (GPT-5.6, Claude Opus 4.8, Gemini 3) генерируют скрытую цепочку мыслей до того, как выдать видимый ответ. Вендоры не хотят, чтобы вы её видели — как по соображениям защиты интеллектуальной собственности, так и потому, что сырой трейс нередко содержит safety-рассуждения, которые были бы неловко цитировать. Поэтому трейс возвращается клиенту в виде зашифрованного конверта в кодировке base64, который клиент передаёт обратно при следующем ходе, чтобы сохранить контекст нескольких ходов без серверного состояния.

Как сообщал CyberSecurityNews, эти конверты аутентифицировались с помощью глобального ключа на уровне провайдера. Без привязки к учётной записи пользователя, идентификатору сессии или уровню модели. Это означало, что конверт, созданный Claude Opus 4.8, можно было воспроизвести в Claude Haiku 4.5, и младший «брат» охотно переносил содержимое в открытом тексте в ответ, поскольку у него отсутствуют встроенные в флагманский уровень защитные механизмы против дистилляции. Исследователи подтвердили аналогичное поведение в семействе GPT-5.6 от OpenAI и линейке Gemini 3 от Google. Три вендора, одна архитектурная ошибка, воспроизведённая независимо.

Методология верификации заслуживает уважения. Команда сопоставила длины декодированных токенов с количеством оплачиваемых thinking-токенов в счёте. Это красивый криминалистический приём: он доказывает, что извлечение происходит без потерь, а не является эвристической реконструкцией. Затем исследователи начали масштабный поиск: 6 708 публичных транскриптов агентов, собранных с GitHub и Hugging Face, 315 320 декодированных встроенных блоков рассуждений, 367 восстановленных артефактов персональных данных, 182 жёстко прописанных учётных данных, включая 62 API-ключа, 33 пароля и 30 личных адресов электронной почты.

Обратите внимание на это соотношение. Примерно одна утечка учётных данных на каждые 1 700 блоков рассуждений в открытом доступе. Любая команда, запускающая агентные нагрузки в производственных объёмах, почти наверняка генерировала эти артефакты. И ключевая деталь из статьи: большинство чувствительных данных находилось исключительно в трейсе рассуждений и никогда не отображалось в видимом ответе ассистента. Каждый конвейер очистки логов, построенный вокруг инспекции вывода, пропускал их полностью. После раскрытия информации OpenAI, Anthropic и Google признали выводы и выпустили серверные меры по устранению, которые сделали исходный proof-of-concept нерабочим в текущих сборках.

Что действительно нового

Prompt injection — давно известная история. Дистилляция модели через скрейпинг API — тоже. Новым здесь является композиция: криптографический изъян проектирования на уровне инфраструктуры провайдера, эксплуатируемый с помощью обычного API-ключа, который превращает собственные более слабые модели вендора в оракулы дешифрования для скрытого состояния флагмана. Это принципиально иной класс угрозы, нежели «кто-то придумал умный jailbreak-промпт».

В этом цикле по-настоящему новы три вещи. Во-первых, атакующему не нужен привилегированный доступ. Никаких украденных учётных данных, никакого инсайдера, никакого side-channel. Достаточно возможности оплачивать API-вызовы — это базовый уровень. Во-вторых, уязвимость однородна для трёх доминирующих лабораторий. Это не OpenAI отгрузил что-то, что Anthropic поймал на ревью, — это конвергентный архитектурный выбор, который говорит о том, что допущение («наш конверт, наш ключ, наша проблема») было общепринятой отраслевой мудростью. В-третьих, и это то, что должно не давать security-архитекторам спать по ночам: статья указывает на невидимую косвенную инъекцию промптов как на смежную возможность. Злоумышленник может внедрить вредоносные инструкции внутрь зашифрованного блока рассуждений, и инструменты мониторинга, инспектирующие только видимую историю разговора, никогда не обнаружат полезную нагрузку. Каждый агентный guardrail-продукт, проданный за последние восемнадцать месяцев, инспектировал не ту поверхность.

Патч, развёрнутый вендорами, является серверным — это быстрый путь, и он сломал исходную атаку с воспроизведением. Но серверные патчи на закрытых API непрозрачны по определению. Никто за пределами трёх лабораторий не знает, является ли митигация правильно реализованной криптографической привязкой (конверт, подписанный относительно кортежа из ID модели, сессии и идентичности пользователя) или фильтром, сопоставляющим паттерн конкретного PoC. Учитывая типичные сроки реагирования на инциденты, ставить на первое — оптимистично. Любой, кто строит архитектуру на допущении, что «вендоры разобрались», по существу доверяет патчу чёрного ящика для протокола чёрного ящика. Документация Anthropic и аналогичные материалы Google и OpenAI в настоящее время не раскрывают криптографическую схему достаточно подробно, чтобы клиентский аудит мог верифицировать исправление.

Что уже заложено в цену для AI-разработки

Часть этого рынок уже предполагал. Все, кто строит агентов, знали, что трейсы рассуждений содержат чувствительные промежуточные данные, и зрелые команды уже относились ко всему, что отправляется в фундаментальную модель, как к потенциально логируемому провайдером. Риск дистилляции (что конкуренты смогут воссоздать рассуждения флагмана, опрашивая «братьев-моделей») уже год был темой тихих разговоров за ужином. Если вы ценили модельную IP как прочный ров, вы уже делали дисконт.

Что не было заложено в цену: то, что собственный шифровальный конверт вендора станет вектором утечки. Ментальная модель большинства платформенных команд была такой: «транспорт зашифрован, конверт непрозрачен, наша уязвимость заканчивается на границе API-вызова». Эта модель теперь неверна. Поверхность уязвимости распространяется на каждый лог-файл, каждый отладочный захват, каждый репозиторий на GitHub, куда разработчик вставил сессию для воспроизводимости, каждый демо на Hugging Face. Конверты рассуждений воспринимались как инертные бинарные блобы. На самом деле они являются переносимыми контейнерами шифротекста с глобально разделяемым ключом.

CFO любой AI-ориентированной организации должен на этой неделе спросить VP Engineering: какая часть нашей политики хранения логов агентов, затрат на сторонний observability-конвейер и инструментария DSAR (запросов доступа субъектов данных) была определена в предположении, что трейс рассуждений непрозрачен? Потому что если ответ — «большая часть», бюджет на устранение в следующие два квартала только что вырос, и главному юристу нужно знать об этом до следующего аудита приватности, а не после.

Альтернативная точка зрения

Рефлекторная реакция — что это пятиалармный пожар и каждое корпоративное агентное развёртывание следует приостановить. Я бы возразил. Вендоры выпустили патчи, PoC больше не воспроизводится, а историческая уязвимость, хоть и реальная, ограничена фактической совокупностью общих транскриптов, которая мала относительно общего API-трафика. Показатель восстановления учётных данных тревожен в расчёте на транскрипт, но сами транскрипты — это самоотобранная выборка публичных публикаций.

Более острая альтернативная точка зрения смотрит в другую сторону: этот инцидент ускорит, а не замедлит переход к self-hosted моделям рассуждений с открытыми весами. Расчёт build-vs-buy только что изменился. Если фронтирные вендоры могут отгружать архитектурный изъян такого масштаба и раскрывать исправление лишь расплывчато, «покупная» сторона уравнения теряет очки за возможность аудита. Команды, уже заигрывающие с размещёнными на инфраструктуре Hugging Face моделями класса Llama или DeepSeek, теперь имеют compliance-аргумент для совета директоров. Три лаборатории выиграли цикл патча и потеряли часть vendor lock-in за одну и ту же неделю.

Вопрос к стейкхолдерам

Руководитель платформы в любом fintech-стартапе серии B или лицензированном iGaming-операторе, строящем агентные рабочие процессы, должен на этой неделе спросить своего главного юриста: если регулятор истребует наши логи агентов за последние двенадцать месяцев, и эти логи содержат зашифрованные конверты рассуждений, которые сторонний исследователь теперь может декодировать, нарушаем ли мы собственную политику конфиденциальности? Ответ, вероятно, «да» для всех, кто говорил пользователям, что их промпты остаются приватными, поскольку трейс рассуждений является производным от промпта и только что доказал свою декодируемость стороной, которая никогда не фигурировала в списке контроля доступа. Это разговор о раскрытии, а не об инженерии, и он должен стоять в повестке этой недели.

Ключевые выводы

  • Патч — это не исправление. Серверные меры от OpenAI, Anthropic и Google сломали конкретный PoC, но базовая модель доверия (клиент держит шифротекст, вендор держит глобальный ключ) в публичной документации не изменилась. Относитесь к шифрованию на стороне вендора как к контролю, который вы не можете проаудировать.
  • Политика хранения логов требует переработки. Любой конвейер, хранящий сырые данные агентных сессий, включая зашифрованные thinking-блоки, теперь хранит потенциально декодируемый чувствительный контент. Очищайте поля подписей перед архивацией и пересмотрите, стоит ли удалять исторические логи.
  • Guardrail-вендоры инспектировали не ту поверхность. Продукты, мониторящие только видимую историю разговора, пропускают полезные нагрузки косвенной инъекции промптов, встроенные в конверты рассуждений. Команды закупок должны прямо спрашивать вендоров, охватывает ли их инспекция thinking-блоки.
  • Рынок найма смещается в сторону ML-инженеров с компетенциями в криптографии. Этот класс багов не обнаруживается специалистами по prompt-injection red-teaming или RLHF-специалистами. Он требует людей, читающих дизайны протоколов. Этот набор навыков дефицитен и вот-вот станет дороже.
  • Self-hosted модели рассуждений получают новый взгляд. Команды, отвергнувшие альтернативы с открытыми весами по соображениям возможностей, теперь имеют governance-аргумент для возобновления оценки. Следующий 90-дневный архитектурный обзор должен включать пункт «что мы сделали бы на собственной инфраструктуре».

Командам, оценивающим фронтирные reasoning API для production-развёртывания агентов, следует теперь задавать себе более острый вопрос: не «у какого вендора лучшие бенчмарки», а «какой вендор опубликует достаточно информации о криптографии своих конвертов, чтобы наша команда безопасности могла верифицировать исправление, не принимая их слово на веру». Лаборатория, которая ответит на это первой, выиграет следующий корпоративный тендер. Те, кто не ответит, ставят на то, что клиенты продолжат доверять патчам, которые они не могут проинспектировать. Это ставка держалась десятилетие в облачной инфраструктуре. В AI она продержится не так долго.

Часто задаваемые вопросы

В: Что представляет собой уязвимость chain-of-thought, затрагивающая OpenAI, Anthropic и Google?

Исследователи обнаружили, что зашифрованные конверты рассуждений, возвращаемые GPT-5.6, Claude Opus 4.8 и Gemini 3, аутентифицировались с помощью глобального ключа на уровне провайдера, а не привязывались к конкретному пользователю или модели. Это позволило атакующим воспроизвести конверт флагманской модели в более слабой дочерней модели, которая затем транскрибировала скрытые рассуждения в открытом тексте.

В: Устранили ли OpenAI, Anthropic и Google уязвимость трейса рассуждений?

Все три вендора признали раскрытие информации и развернули серверные меры по устранению, которые сделали исходный proof-of-concept нерабочим в текущих сборках API. Однако вендоры не раскрыли публично криптографическую схему исправления, поэтому клиентская верификация митигации в настоящее время невозможна.

В: Какие именно чувствительные данные были раскрыты при декодировании трейсов рассуждений?

Анализ 6 708 публичных транскриптов агентов выявил 315 320 декодированных блоков рассуждений, содержащих 367 артефактов персональных данных и 182 жёстко прописанных учётных данных, включая 62 API-ключа, 33 пароля и 30 личных адресов электронной почты. Большинство этих данных существовало исключительно внутри скрытых блоков рассуждений и никогда не появлялось в видимых ответах ассистента.

MK
Marina Koval
RiverCore Analyst · Dublin, Ireland
ПОДЕЛИТЬСЯ
// ПОХОЖИЕ СТАТЬИ
ГлавнаяРешенияПроектыО насКонтакт
Новости06
Дублин, Ирландия · ЕСGMT+1
LinkedIn
🇷🇺RU