704 секрета извлечено из «зашифрованных» блоков рассуждений LLM
Исследователи извлекли 704 уникальных объекта конфиденциальных данных, включая 62 API-ключа, 33 пароля, 24 токена доступа и 7 приватных ключей, из зашифрованных объектов рассуждений, возвращаемых API OpenAI, Anthropic и Google. Они сделали это, не взламывая шифрование и не похищая ключи. Они передавали непрозрачные блоки более слабой родственной модели из того же семейства провайдера и просили её расшифровать, о чём думал её более мощный «родственник».
Коэффициент извлечения важнее абсолютного числа. Команда декодировала 315 320 блоков рассуждений из 6 708 публичных траекторий агентов, чтобы обнаружить эти 704 артефакта — примерно один утёкший секрет на 448 блоков рассуждений после исключения шума от бенчмарков. Это не цифра массовой компрометации. Это структурный коэффициент утечки, заложенный в том, как три крупных провайдера реализуют «скрытую» цепочку рассуждений в рамках stateless-вызовов.
Цифры
Ключевая статистика, как сообщил The Hacker News, такова: 64 из 704 небенчмарковых артефактов присутствовали исключительно в скрытых рассуждениях и нигде в видимой трассировке. Это примерно 9 процентов восстановленных секретов, которые разработчик, очищающий видимый диалог, полностью упустил бы. Любая команда, которая чистила опубликованные логи агентов с помощью grep по сообщениям ассистента, не затрагивала объекты рассуждений — а именно в них содержался материал, который так и не появился в видимой транскрипции.
Разбивка 704 артефактов по категориям: 62 API-ключа, 33 пароля, 24 токена доступа, 7 приватных ключей. Это 126 элементов из 704, имеющих форму прямых учётных данных. Оставшиеся ~578 артефактов исследователи относят к приватно-значимым — в статье они не перечислены подробно, но предположительно включают персональные данные, внутренние идентификаторы и бизнес-чувствительный контент. Для аудитории в сфере инфраструктуры наиболее интересна именно подгруппа учётных данных, поскольку она соответствует конкретному радиусу поражения, а не теоретическому ущербу.
Стоит отметить особенности датасета: 6 708 публичных траекторий агентов — относительно небольшая выборка по сравнению с общим объёмом трафика агентов в репозиториях GitHub, экспортах LangSmith, датасетах HuggingFace и gist-публикациях блогов. Если коэффициент извлечения сохранится, полный анализ публичных артефактов агентов, вероятно, даст от пяти до шести знаков в числе учётных данных. Источник не раскрывает, из каких публичных репозиториев были взяты 6 708 траекторий, а это важно, поскольку от этого зависит, насколько уверенно можно экстраполировать коэффициент утечки. Если выборка смещена в сторону демонстрационных и учебных проектов, реальные производственные трассы почти наверняка утекают больше, а не меньше.
Стек декодирования технически интересен. В статье называются Claude Haiku 4.5 как нечёткий декодер для трасс Claude, GPT-5.6 Luna для трасс GPT и Gemini Robotics ER-1.6 для трасс Gemini. В каждом случае более слабый или дешёвый член семейства использовался для расшифровки рассуждений, сгенерированных более мощным «родственником». Это переворачивает привычное направление дистилляции, и это первый хорошо задокументированный случай, когда маленькая модель используется как состязательный оракул против выходных данных своего семейства.
Если меры защиты сохранятся, заявление о воспроизводимости должно остаться в силе: ни одна независимая команда не опубликует рабочую атаку на извлечение данных из текущего поведения API до конца 2026 года. Это поддающееся проверке предсказание.
Что действительно нового
Мэтью Грин, криптограф из Университета Джонса Хопкинса, показал в мае, что зашифрованные блоки рассуждений можно воспроизводить между сессиями и аккаунтами. Он сообщил об этом через программы поиска ошибок. OpenAI назвал его отчёт невоспроизводимым. Anthropic сообщил ему, что не видит угроз безопасности в поведении при воспроизведении или побочных каналах. Грин остановился, не дойдя до надёжной техники извлечения секретов, и провайдеры закрыли тикеты.
Новая работа превращает поведение при воспроизведении в конвейер извлечения данных — в этом качественный скачок. Простое воспроизведение — лишь любопытный факт. Воспроизведение плюс нечёткий декодер из того же семейства, надёжно расшифровывающий скрытый контент, — это уже примитив для утечки данных. И это открывает три поверхности атаки, которых не было в предыдущей работе: дистилляция проприетарных трасс рассуждений (конкурентная разведка против передовых лабораторий), кросс-пользовательское извлечение приватных данных из опубликованных логов агентов и, что наиболее тревожно для тех, кто строит агентные стеки, скрытая инъекция промптов.
Proof of concept с инъекцией промптов заслуживает отдельного абзаца. Команда создала непрозрачный блок рассуждений, содержащий вредоносную инструкцию, воспроизвела его в рамках несвязанной задачи и заставила принимающую модель добавить действие загрузки, направленное атакующим. Внедрённая инструкция так и не появилась в видимом тексте. Ни одна защита от инъекции промптов, работающая с читаемым диалогом, — а это практически все существующие сегодня в производственных системах — ничего не обнаруживает. Это новый класс атак на агентные фреймворки, передающие артефакты рассуждений между шагами.
Другая новизна — асимметрия раскрытия информации. Исследователи уведомили OpenAI, Anthropic, Google, Microsoft и Hugging Face. Продемонстрированные атаки прекратили работать. Однако публичных подтверждений ни от одного из трёх провайдеров не появилось. Документация Anthropic теперь гласит, что блоки рассуждений привязаны к модели, которая их создала, и должны удаляться при смене модели, а OpenAI по-прежнему инструктирует разработчиков воспроизводить зашифрованные элементы рассуждений при ручном управлении stateless-историей. Документация изменилась. Changelog не указал причину. Именно этот разрыв — между принятием мер и раскрытием информации — делает нынешнюю ситуацию труднопроверяемой извне.
Что уже учтено в разработке AI
Кое-что сообщество ожидало. То, что непрозрачные блоки рассуждений в конечном счёте будут подвергнуты обратной разработке, было лишь вопросом времени — как только провайдеры начали поставлять их как воспроизводимые API-объекты. Любой, кто наблюдал за экосистемой JWT, знает, что происходит с переносимыми самодостаточными токенами, принимаемыми анонимными верификаторами: они утекают, воспроизводятся и становятся объектом злоупотреблений. Зашифрованные рассуждения в роли куки архитектурно схожи, и режим отказа был предсказуем.
Что не было учтено: то, что декодером окажется более слабая модель из того же семейства, обращаемая через публичный API в обычном режиме, и что извлечение сработает без какой-либо криптографической атаки на шифртекст. Статья прямо указывает: само шифрование не было взломано, и атака не требовала получения ключа шифрования. Она опиралась на то, что провайдер принимает нетронутые непрозрачные блоки и обрабатывает их в контексте совместимой модели. Это изъян проектирования, а не ошибка реализации, и он применим к гораздо более широкому классу систем.
Также не было учтено: тот факт, что объекты рассуждений содержат материал, который никогда не появляется в видимой трассировке. Статистика 64 из 704 — это та цифра, которая должна изменить подход команд платформ к санитизации логов. Если ваш pipeline соответствия требованиям редактирует сообщения ассистента, но сохраняет блоки рассуждений в исходном виде, этот pipeline неисправен. Для всех, кто в финтехе или iGaming строит LLM-агентов для поддержки или проверки на мошенничество, это теперь конкретный пункт аудита. Не гипотетический.
Контраргумент
Консенсусная интерпретация такова: это серьёзный изъян на стороне провайдера, частично исправленный, и разработчикам следует очистить публичные логи. Я бы утверждал, что такая трактовка недооценивает одно и преувеличивает другое.
Преувеличено: атака кросс-пользовательского извлечения ограничена. Она требует зашифрованного блока рассуждений, уже опубликованного кем-то другим, плюс доступа к API совместимой модели от того же провайдера. Это не произвольный доступ на чтение к чужим чатам. Воздействие распространяется на разработчиков, опубликовавших сырые логи агентов с нетронутыми объектами рассуждений — конкретную и идентифицируемую группу. Материалы, утверждающие, что каждый пользователь API под угрозой, неверны.
Недооценено: примитив скрытой инъекции промптов. Он не зависит от опубликованных логов. Он зависит от любого pipeline, где блоки рассуждений передаются между компонентами — а это описывает практически каждый серьёзный агентный фреймворк, инструментальный стек на основе MCP или многошаговый оркестратор, созданный за последний год. Если объекты рассуждений могут нести инструкции, выживающие при воспроизведении в несвязанных задачах, архитектуры в стиле MCP, предполагающие инертность непрозрачных блоков провайдера, ошибаются в этом предположении. Мера защиты «удаляй блоки рассуждений при смене моделей» не покрывает случай, когда атакующий сам подаёт отравленный блок в ваш pipeline. Источник не документирует, блокируют ли текущие меры вариант с инъекцией или только вариант с извлечением — а именно это определяет, могут ли разработчики агентов спать спокойно.
Ключевые выводы
- Коэффициент утечки носит структурный, а не случайный характер: 704 конфиденциальных артефакта из 315 320 декодированных блоков рассуждений означают, что зашифрованные объекты рассуждений утекали в промышленных масштабах, и 9 процентов восстановленных секретов существовали только в скрытых рассуждениях, невидимые для любого инструмента санитизации логов, работающего с видимым текстом.
- Криптография не была взломана: атака работала путём передачи нетронутых непрозрачных блоков более слабым моделям из того же семейства (Haiku 4.5, GPT-5.6 Luna, Gemini Robotics ER-1.6), которые охотно расшифровывали рассуждения своих более мощных «родственников». Это изъян проектирования — доверие переносимым непрозрачным токенам.
- Молчание провайдеров — наиболее важная неразрешённая переменная: по имеющимся данным, меры защиты работают по состоянию на август 2026 года, однако публичных подтверждений от OpenAI, Anthropic или Google не поступало. Заявление о воспроизводимости основывается на словах исследователей, а не на подтверждении провайдеров, и источник не отвечает на вопрос, остаются ли уже опубликованные блоки рассуждений декодируемыми — только на вопрос, работают ли свежие атаки.
- Вариант с инъекцией промптов — тот, за которым нужно следить: скрытие вредоносной инструкции внутри непрозрачного блока рассуждений, которая затем инициирует направленное атакующим действие в несвязанной задаче, нейтрализует любую защиту, работающую с видимым диалогом. Разработчикам агентных фреймворков следует считать артефакты рассуждений из внешних источников потенциально контролируемыми атакующим.
- Конкретные действия для команд платформ: удаляйте блоки рассуждений из любых публикуемых трасс, рассматривайте сырые API-транскрипты как содержащие учётные данные даже после санитизации видимого текста и проверяйте любой агентный pipeline, который сохраняет или передаёт объекты рассуждений провайдера между компонентами.
Часто задаваемые вопросы
В: Исследователи действительно взломали шифрование API рассуждений OpenAI, Anthropic или Google?
Нет. Статья прямо указывает, что шифрование не было взломано и ключ шифрования не был получен. Атака сработала, потому что провайдеры принимали нетронутые непрозрачные блоки рассуждений и обрабатывали их через более слабую модель из того же семейства, которая затем расшифровывала скрытое содержимое рассуждений в ответ на обычный API-запрос.
В: Уязвимость по-прежнему эксплуатируема в августе 2026 года?
По заявлению исследователей о воспроизводимости, основная атака извлечения больше не работает после применения мер защиты провайдерами. Однако ни OpenAI, Anthropic, ни Google публично это не подтвердили, и источник не отвечает на вопрос, остаются ли блоки рассуждений, уже опубликованные в публичных репозиториях до исправления, декодируемыми.
В: Что инженерным командам делать с опубликованными логами агентов и объектами рассуждений?
Удаляйте все блоки рассуждений и непрозрачные поля рассуждений перед публикацией трасс и избегайте коммита сырых API-транскриптов, даже если видимый текст ассистента был санитизирован. Исследование обнаружило 64 конфиденциальных артефакта, существовавших только внутри скрытых рассуждений и никогда не появлявшихся в видимом диалоге, — поэтому одной очистки читаемого текста недостаточно.




