Skip to content
RiverCore
704 Секрети Витягнуті з «Зашифрованих» Блоків Міркувань LLM
LLM reasoning blocksAI securityencrypted reasoningsecrets leaked from AI reasoning blocksLLM API key extraction attack

704 Секрети Витягнуті з «Зашифрованих» Блоків Міркувань LLM

18 сер 20268 хв. читанняSarah Chen

Дослідники витягли 704 окремі приватні артефакти, зокрема 62 API-ключі, 33 паролі, 24 токени доступу та 7 приватних ключів, із зашифрованих об'єктів міркувань, що повертаються API OpenAI, Anthropic і Google. Вони зробили це без злому шифрування і без викрадення ключа. Вони просто передавали непрозорі блоки слабшій споріднені моделі в тій самій родині провайдера і просили її розшифрувати, про що «думав» більший родич.

Коефіцієнт витягування важливіший за сам підрахунок. Команда декодувала 315 320 блоків міркувань у 6 708 публічних траєкторіях агентів і виявила ці 704 артефакти — приблизно один витік секрету на 448 блоків міркувань після виключення шуму з бенчмарків. Це не масштаб масового злому. Це структурна ставка витоку, закладена в те, як три великі провайдери реалізують «прихований» ланцюжок міркувань у межах stateless-викликів.

Цифри

Головна статистика, про яку повідомляв The Hacker News, полягає в тому, що 64 із 704 артефактів, не пов'язаних із бенчмарками, з'явилися лише у прихованому міркуванні і ніде у видимому трейсі. Це приблизно 9 відсотків відновлених секретів, які розробник, що очищає видиму розмову, пропустив би повністю. Будь-яка команда, яка перевіряла свої опубліковані логи агентів через пошук у повідомленнях асистента, не перевіряла об'єкти міркувань, а об'єкти міркувань містили матеріал, який видимий журнал ніколи не показував.

Розбивка 704 за класами: 62 API-ключі, 33 паролі, 24 токени доступу, 7 приватних ключів. Це 126 елементів із 704, які мають форму безпосередніх облікових даних. Решта ~578 артефактів дослідники вважають конфіденційно значущими — у статті їх не перераховано детально, але вони, мабуть, охоплюють персональні дані, внутрішні ідентифікатори та бізнес-конфіденційний вміст. Для інфраструктурної аудиторії підмножина облікових даних є найцікавішою, оскільки вона відповідає конкретному радіусу ураження, а не теоретичній шкоді.

Датасет варто відзначити окремо: 6 708 публічних траєкторій агентів — це відносно невелика вибірка порівняно з загальним обсягом трафіку агентів у GitHub-репозиторіях, LangSmith-експортах, датасетах HuggingFace та публікаціях у блогах. Якщо коефіцієнт витягування збережеться, повне сканування публічних артефактів агентів, ймовірно, дасть від п'яти до шести значень облікових даних. Джерело не розкриває, з яких публічних репозиторіїв було взято 6 708 траєкторій, а це важливо, бо обмежує впевненість у узагальненні коефіцієнта витоку. Якщо вибірка тяжіє до демонстраційних прикладів і туторіалів для розробників, реальні виробничі трейси майже напевно витікають більше, а не менше.

Стек декодера технічно цікавий. У статті названо Claude Haiku 4.5 як нечіткий декодер для трейсів Claude, GPT-5.6 Luna — для трейсів GPT, та Gemini Robotics ER-1.6 — для трейсів Gemini. У кожному випадку слабший або дешевший член родини використовувався для розшифровки міркувань, згенерованих сильнішим родичем. Це інвертує звичайний напрямок дистиляції і є першим добре задокументованим випадком, відомим мені, коли мала модель використовується як ворожий оракул проти виходів власної родини.

Якщо засоби захисту спрацюють, ми маємо побачити, що твердження про відтворюваність залишиться в силі: жодна незалежна команда не опублікує робочого витягування проти поточної поведінки API до кінця 2026 року. Це фальсифіковане передбачення.

Що Справді Нового

Меттью Грін, криптограф з Університету Джонса Гопкінса, показав у травні, що зашифровані блоки міркувань можна відтворювати між сесіями та обліковими записами. Він повідомив про це через програми bug bounty. OpenAI назвав його звіт непідтвердженим. Anthropic повідомив, що не бачить проблем безпеки у відтворенні або поведінці бічних каналів. Грін зупинився, не досягнувши надійної техніки витягування секретів, і провайдери закрили тікети.

Нова робота перетворює поведінку відтворення на конвеєр витягування — це якісний стрибок. Саме по собі відтворення є цікавістю. Відтворення плюс нечіткий декодер з тієї ж родини, який надійно розшифровує приховний вміст, — це вже примітив для ексфільтрації даних. І це відкриває три поверхні атак, яких попередня робота не торкалася: дистиляція пропрієтарних трейсів міркувань (конкурентна розвідка проти провідних лабораторій), крос-користувацьке витягування приватних даних із опублікованих логів агентів, і, що найбільше турбує розробників агентських стеків, прихована ін'єкція промптів.

Підтвердження концепції ін'єкції промптів заслуговує на окремий абзац. Команда створила непрозорий блок міркувань із шкідливою інструкцією, відтворила його в непов'язаному завданні і змусила модель, що отримала його, додати дію завантаження, скеровану зловмисником. Ін'єктована інструкція жодного разу не з'явилася у видимому тексті. Кожен захист від ін'єкції промптів, що працює з видимою розмовою, — а це фактично всі засоби захисту у виробництві сьогодні, — нічого не помічає. Це новий клас атак проти агентських фреймворків, які передають артефакти міркувань між кроками.

Ще одна новизна — асиметрія розкриття інформації. Дослідники повідомили OpenAI, Anthropic, Google, Microsoft і Hugging Face. Продемонстровані атаки перестали працювати. Але жодного публічного підтвердження від жодного з трьох провайдерів так і не з'явилося. Документація Anthropic тепер стверджує, що блоки міркувань прив'язані до моделі, яка їх створила, і повинні бути видалені при зміні моделі, а OpenAI досі інструктує розробників відтворювати зашифровані елементи міркувань при ручному управлінні stateless-історією. Документація змінилася. Changelog не вказав причини. Цей розрив між засобами захисту і розкриттям інформації і робить поточну ситуацію важкою для перевірки ззовні.

Що Вже Враховано в AI-Розробці

Частину цього спільнота передбачала. Те, що непрозорі блоки міркувань врешті-решт будуть реверс-інженеровані, було питанням часу, а не «якщо», як тільки провайдери почали постачати їх як відтворювані API-об'єкти. Кожен, хто спостерігав за екосистемою JWT, знає, що відбувається з портативними, самодостатніми токенами, які приймаються анонімними верифікаторами: вони витікають, відтворюються, зловживаються. Зашифровані міркування як cookie архітектурно подібні, і режим відмови був передбачуваний.

Що не було враховано: що декодером виявиться слабша модель з тієї ж родини, викликана нормально через публічний API, і що витягування спрацює без жодної криптографічної атаки на шифротекст. У статті прямо сказано: саме шифрування не було зламане, і атака не вимагала отримання ключа шифрування. Вона спиралася на те, що провайдер приймає непошкоджені непрозорі блоки і обробляє їх у контексті сумісної моделі. Це вада проектування, а не помилка реалізації, і вона відображається на значно ширшому класі систем.

Також не було враховано: той факт, що об'єкти міркувань містять матеріал, який видимий трейс ніколи не показує. Статистика 64-з-704 — це та, яка має змінити підхід платформних команд до очищення логів. Якщо ваш конвеєр відповідності редагує повідомлення асистента, але зберігає блоки міркувань дослівно, конвеєр зламаний. Для всіх у fintech або iGaming, хто використовує агентів підтримки або перевірки шахрайства на основі LLM, це тепер конкретний пункт аудиту. Це не гіпотетично.

Контраріанська Точка Зору

Консенсусна думка полягає в тому, що це серйозна вада на боці провайдера, приблизно виправлена, і розробники повинні очистити свої публічні логи. Я б стверджував, що такий підхід недооцінює одну частину і переоцінює іншу.

Переоцінено: атака крос-користувацького витягування обмежена. Вона вимагає зашифрованого блоку міркувань, опублікованого кимось іншим, плюс доступу до API сумісної моделі від того самого провайдера. Це не довільний доступ для читання чужих чатів. Уразливість стосується розробників, які опублікували необроблені логи агентів із непошкодженими об'єктами міркувань — конкретної та ідентифікованої групи. Заяви, що кожен користувач API під загрозою, є хибними.

Недооцінено: примітив невидимої ін'єкції промптів. Він не залежить від опублікованих логів. Він залежить від будь-якого конвеєра, де блоки міркувань передаються між компонентами, — а це описує практично кожен серйозний агентський фреймворк, інструментальний стек на основі MCP або багатокроковий оркестратор, побудований за останній рік. Якщо об'єкти міркувань можуть нести інструкції, що виживають при відтворенні в непов'язаних завданнях, архітектури у стилі MCP, які вважають непрозорі блоби провайдера інертними, помиляються в цьому припущенні. Засіб захисту «видаляти блоки міркувань при зміні моделей» не покриває випадок, коли зловмисник подає отруєний блок у ваш власний конвеєр. Джерело не документує, чи блокують поточні засоби захисту варіант ін'єкції або тільки варіант витягування — а це питання, від якого насправді залежить, чи можуть розробники агентів спати спокійно.

Ключові Висновки

  • Коефіцієнт витоку є структурним, а не випадковим: 704 приватні артефакти серед 315 320 декодованих блоків міркувань означають, що зашифровані об'єкти міркувань витікали в промисловому масштабі, і 9 відсотків відновлених секретів існували лише в прихованих міркуваннях, невидимих для будь-якого інструменту очищення логів, що працює з видимим текстом.
  • Жодна криптографія не була зламана: атака спрацювала шляхом передачі цілих непрозорих блоків слабшим моделям тієї ж родини (Haiku 4.5, GPT-5.6 Luna, Gemini Robotics ER-1.6), які охоче розшифровували міркування своїх більших родичів. Це збій на рівні проектування через довіру до портативних непрозорих токенів.
  • Мовчання провайдерів — найважливіша невирішена змінна: засоби захисту, за повідомленнями, працюють станом на серпень 2026 року, але жодного публічного підтвердження від OpenAI, Anthropic або Google не з'явилося. Твердження про відтворюваність спирається на дослідників, а не на підтвердження провайдерів, і джерело не вказує, чи залишаються вже опубліковані блоки міркувань декодованими.
  • Варіант ін'єкції промптів — той, за яким варто стежити: приховування шкідливої інструкції всередині непрозорого блоку міркувань, яка потім запускає дію, скеровану зловмисником, у непов'язаному завданні, обходить кожен захист, що працює з видимою розмовою. Розробники агентських фреймворків повинні вважати артефакти міркувань із зовнішніх джерел підконтрольними зловмиснику.
  • Конкретні дії для платформних команд: видаляйте блоки міркувань із будь-якого спільного трейсу, вважайте необроблені API-транскрипти такими, що містять облікові дані, навіть після очищення видимого тексту, і перевіряйте будь-який агентський конвеєр, який зберігає або передає об'єкти міркувань провайдера між компонентами.

Часті Запитання

П: Чи справді дослідники зламали шифрування в API міркувань OpenAI, Anthropic або Google?

Ні. У статті прямо зазначено, що шифрування не було зламане і жоден ключ шифрування не був отриманий. Атака спрацювала тому, що провайдери приймали цілі непрозорі блоки міркувань і обробляли їх через слабшу модель тієї ж родини, яка потім розшифровувала прихований вміст міркувань у відповідь на звичайний API-запит.

П: Чи можна використати цю вразливість у серпні 2026 року?

Згідно з твердженням дослідників про відтворюваність, основна атака витягування більше не працює після того, як провайдери застосували засоби захисту. Однак жодного публічного підтвердження від OpenAI, Anthropic або Google не надійшло, і джерело не вказує, чи залишаються блоки міркувань, вже опубліковані в публічних репозиторіях до виправлення, декодованими.

П: Що інженерним командам робити з опублікованими логами агентів та об'єктами міркувань?

Видаляйте всі блоки міркувань і непрозорі поля міркувань перед публікацією трейсів та уникайте фіксації необроблених API-транскриптів, навіть якщо видимий текст асистента був очищений. Дослідження виявило 64 приватні артефакти, що існували лише всередині прихованих міркувань і ніколи у видимій розмові, тому очищення лише читабельного тексту недостатньо.

SC
Sarah Chen
RiverCore Analyst · Dublin, Ireland
ПОДІЛИТИСЯ
ГоловнаРішенняПроєктиПро насКонтакт
Новини06
Дублін, Ірландія · ЄСGMT+1
LinkedIn
🇺🇦UK