Витік ланцюжка міркувань у GPT-5.6, Claude Opus 4.8 та Gemini 3
Будь-який керівник платформи, що впроваджує агентні функції на основі frontier API цього кварталу, тепер має конкретну цифру для комітету з управління ризиками: 315 320 прихованих блоків міркувань, розшифрованих із публічних транскриптів агентів, — і 182 захардкоджені облікові дані, які жодного разу не з'явилися у видимих відповідях моделі. Це результат спільного дослідження команди з ELLIS Institute Tübingen, Max Planck Institute, MATS Research та Snyk, опублікованого на ArXiv. Він безпосередньо стосується кожної інженерної організації, яка досі розглядала шифрування на стороні вендора як формальний елемент відповідності. Вендори випустили патчі. Архітектурне припущення, що породило помилку, досі залишається у виробничих середовищах повсюдно.
Цифри
Варто розібратися в механіці, перш ніж хтось на нараді з бюджету відмахнеться від цього як від академічного експлойту. Сучасні моделі міркування (GPT-5.6, Claude Opus 4.8, Gemini 3) генерують прихований ланцюжок думок перед тим, як видати видиму відповідь. Вендори не хочуть, щоб ви його бачили — як з міркувань інтелектуальної власності, так і тому, що необроблений трейс часто містить міркування щодо безпеки, які було б незручно цитувати. Тому трейс повертається клієнту у вигляді зашифрованого конверту в кодуванні base64, який клієнт передає назад на наступному кроці для збереження багатоходового контексту без стану на стороні сервера.
Як повідомляло CyberSecurityNews, ці конверти були автентифіковані глобальним ключем на рівні провайдера. Без прив'язки до облікового запису користувача, ідентифікатора сесії чи рівня моделі. Це означає, що конверт, створений Claude Opus 4.8, можна було відтворити через Claude Haiku 4.5, і молодша модель охоче розшифровувала б вміст у відповідь — оскільки їй бракує захисту від дистиляції, вбудованого у флагманський рівень. Дослідники підтвердили ту саму поведінку в сімействі GPT-5.6 від OpenAI та лінійці Gemini 3 від Google. Три вендори, одна архітектурна помилка, відтворена незалежно.
Методологія перевірки заслуговує на повагу. Команда зіставила довжини декодованих токенів із кількістю токенів у рахунках за обдумування. Це чудова судово-технічна знахідка, бо вона доводить, що витяг є беззбитково точним, а не евристичною реконструкцією. Далі дослідники провели масштабний пошук: 6 708 публічних транскриптів агентів зі скрапінгу GitHub та Hugging Face, 315 320 вбудованих блоків міркувань розшифровано, 367 артефактів PII відновлено, 182 захардкоджені облікові дані — зокрема 62 API-ключі, 33 паролі та 30 персональних email-адрес.
Задумайтесь над цим співвідношенням. Приблизно один витік облікових даних на 1 700 блоків міркувань у відкритому доступі. Будь-яка команда, що запускає агентне навантаження у виробничих обсягах, майже напевно генерувала ці артефакти. І ключова деталь із статті: більшість чутливих даних знаходилася виключно в трейсі міркувань і жодного разу не відображалася у видимій відповіді асистента. Кожен конвеєр очищення логів, побудований на основі інспекції виведення, повністю пропускав їх. Після розкриття інформації OpenAI, Anthropic і Google підтвердили знахідки та розгорнули серверні виправлення, які зробили оригінальне підтвердження концепції нефункціональним на поточних збірках.
Що справді нового
Ін'єкція промптів — не новина. Дистиляція моделей через скрапінг API — теж не новина. Новизна тут у комбінації: криптографічна вада на рівні інфраструктури провайдера, яку можна експлуатувати зі звичайним API-ключем і яка перетворює власні слабші моделі вендора на оракули дешифрування для прихованого стану флагманської моделі. Це зовсім інший клас загроз, ніж «хтось придумав вправний джейлбрейк-промпт».
У цьому циклі є три справді нові речі. По-перше, зловмиснику не потрібен привілейований доступ. Жодних вкрадених облікових даних, жодних інсайдерів, жодних побічних каналів. Лише можливість платити за API-виклики — що є мінімальним порогом входу. По-друге, вразливість однорідна для трьох домінуючих лабораторій. Це не OpenAI відправив щось, що Anthropic перехопив під час огляду — це конвергентний архітектурний вибір, який свідчить про те, що припущення («наш конверт, наш ключ, наша проблема») було загальноприйнятою практикою в галузі. По-третє — і це те, що має не давати спати архітекторам безпеки — стаття вказує на невидиму непряму ін'єкцію промптів як на похідну можливість. Зловмисник може вбудувати шкідливі інструкції всередину зашифрованого блоку міркувань, і інструменти моніторингу, які інспектують лише видиму історію розмови, ніколи не побачать цього навантаження. Кожен агентний продукт захисних обмежень, проданий за останні вісімнадцять місяців, інспектував не ту поверхню.
Виправлення, розгорнуте вендорами, є серверним — що є найшвидшим шляхом — і воно зламало оригінальну атаку відтворення. Але серверні патчі на закритих API за визначенням непрозорі. Ніхто за межами трьох лабораторій не знає, чи є пом'якшення криптографічною прив'язкою, зробленою належним чином (конверт підписаний проти кортежу з ідентифікатора моделі, сесії та ідентичності користувача), чи це фільтр, що шукає збіги зі специфічним PoC за шаблоном. Зважаючи на типові терміни реагування на інциденти, ставити на перше — надто оптимістично. Той, хто будує архітектуру на припущенні «вендори впорались», по суті, довіряє патчу-чорному ящику для чорноящикового протоколу. Документація Anthropic та аналогічні матеріали Google і OpenAI наразі не розкривають криптографічну схему достатньо детально, щоб клієнтський аудит міг перевірити виправлення.
Що вже враховано в розробці AI
Частину цього ринок уже передбачав. Усі, хто розробляє агентів, знали, що трейси міркувань містять чутливі проміжні дані, а зрілі команди вже розглядали все, що надсилається до фундаментальної моделі, як потенційно журналоване провайдером. Ризик дистиляції (що конкуренти можуть відтворити міркування флагмана, запитуючи молодші моделі) вже рік тихо обговорюється за закритими дверима. Якщо ви оцінювали IP моделі як стійку конкурентну перевагу, ви вже дисконтували її.
Що не було враховано: що власний конверт шифрування вендора стане вектором витоку. Ментальна модель, за якою працювала більшість платформних команд, була такою: «транспорт зашифрований, конверт непрозорий, наша зона відповідальності закінчується на межі API-виклику». Ця модель тепер хибна. Поверхня впливу поширюється на кожен файл логів, кожен дебаг-знімок, кожен репозиторій GitHub, де розробник вставив сесію для відтворюваності, кожну демонстрацію на Hugging Face. Конверти міркувань сприймалися як інертні бінарні блоби. Насправді це портативні контейнери шифротексту з глобально спільним ключем.
Фінансовий директор будь-якої AI-орієнтованої організації має цього тижня запитати VP Engineering: яка частина нашої політики зберігання логів агентів, витрат на сторонні конвеєри спостережуваності та інструментів DSAR (запитів суб'єктів даних на доступ) була розрахована з припущенням, що трейс міркувань непрозорий? Якщо відповідь — «більшість», бюджет на усунення недоліків на наступні два квартали щойно зріс, і юридичний відділ повинен дізнатися про це до наступного аудиту конфіденційності, а не після.
Контраріанська точка зору
Рефлекторна реакція — це п'ятирівнева тривога і призупинення кожного корпоративного розгортання агентів. Я б посперечався. Вендори виправили проблему, PoC більше не відтворюється, а ретроспективний вплив, хоча й реальний, обмежений фактичною кількістю опублікованих транскриптів, що є незначною часткою від загального API-трафіку. Рівень відновлення облікових даних є тривожним у розрахунку на транскрипт, але самі транскрипти — це самовибірка публічних поширень.
Гостріша контраріанська думка вказує в інший бік: цей інцидент прискорить, а не загальмує перехід до open-weight self-hosted моделей міркування. Розрахунок «будувати vs купувати» щойно змінився. Якщо провідні вендори можуть допустити архітектурну ваду такого характеру і лише розмито розкрити деталі виправлення, то «купити» у цьому рівнянні втрачає очки через недостатню можливість аудиту. Команди, що вже розглядали hosted моделі класу Llama або DeepSeek на інфраструктурі Hugging Face, тепер мають аргумент для відповідності, який можна винести на рівень ради директорів. Три лабораторії виграли цикл патчів і водночас втратили частину аргументів на користь vendor lock-in протягом одного тижня.
Питання для стейкхолдерів
Керівник платформи будь-якого fintech із серією B або ліцензованого оператора iGaming, що будує агентні робочі процеси, має цього тижня запитати свого юридичного директора: якщо регулятор викличе наші логи агентів за останні дванадцять місяців, і ці логи містять зашифровані конверти міркувань, які сторонній дослідник тепер може розшифрувати, — чи порушуємо ми власну політику конфіденційності? Відповідь, мабуть, «так» для будь-кого, хто повідомляв користувачам, що їхні промпти залишаються приватними, адже трейс міркувань є похідним від промпту і щойно виявився декодованим стороною, якої ніколи не було в списку контролю доступу. Це питання для розмови про розкриття інформації, а не інженерне питання, і воно повинне бути в порядку денному цього тижня.
Ключові висновки
- Патч — це не виправлення. Серверні пом'якшення від OpenAI, Anthropic і Google зламали конкретний PoC, але базова модель довіри (клієнт тримає шифротекст, вендор тримає глобальний ключ) залишається незмінною в публічній документації. Ставтеся до шифрування на стороні вендора як до засобу контролю, який ви не можете аудитувати.
- Політика зберігання логів потребує переписування. Будь-який конвеєр, що зберігає необроблені дані агентських сесій, включно із зашифрованими блоками обдумування, тепер зберігає потенційно декодований чутливий вміст. Очищайте поля підпису перед архівуванням і подумайте про видалення історичних логів.
- Вендори захисних обмежень інспектували не ту поверхню. Продукти, що моніторять лише видиму історію розмови, пропускають навантаження непрямої ін'єкції промптів, вбудовані в конверти міркувань. Команди із закупівлі мають прямо запитувати вендорів, чи охоплює їхня інспекція блоки обдумування.
- Ринок найму зміщується в бік ML-інженерів з криптографічною грамотністю. Цей клас помилок не виявляють фахівці з червоних команд для ін'єкції промптів або спеціалісти з RLHF. Для цього потрібні люди, які читають проєкти протоколів. Такий набір навичок рідкісний і незабаром стане дорожчим.
- Self-hosted моделі міркування отримують новий шанс. Команди, що відкидали open-weight альтернативи через недостатні можливості, тепер мають аргумент з точки зору управління, щоб відновити оцінку. Наступний 90-денний архітектурний огляд має включати пункт «що б ми робили на власній інфраструктурі».
Команди, що оцінюють frontier API міркування для виробничих розгортань агентів, тепер мають ставити собі більш гостре питання: не «у якого вендора найкращі бенчмарки», а «який вендор опублікує достатньо інформації про криптографію своїх конвертів, щоб наша служба безпеки могла перевірити виправлення, не покладаючись лише на його слово». Лабораторія, яка відповість першою, виграє наступний цикл корпоративних закупівель. Ті, що не відповідять, роблять ставку на те, що їхні клієнти продовжуватимуть довіряти патчам, які неможливо перевірити. Ця ставка тримала позиції десять років у хмарній інфраструктурі. В AI вона не протримається так довго.
Часті запитання
Q: Що таке вразливість chain-of-thought, що зачіпає OpenAI, Anthropic і Google?
Дослідники виявили, що зашифровані конверти міркувань, які повертають GPT-5.6, Claude Opus 4.8 та Gemini 3, були автентифіковані глобальним ключем на рівні провайдера, а не прив'язані до конкретного користувача чи моделі. Це дозволило зловмисникам відтворити конверт від флагманської моделі через слабшу модель-сиблінг, яка потім розшифровувала приховані міркування у відкритому вигляді.
Q: Чи виправили OpenAI, Anthropic і Google вразливість трейсу міркувань?
Усі три вендори підтвердили розкриття інформації та розгорнули серверні пом'якшення, що зробили оригінальне підтвердження концепції нефункціональним на поточних збірках API. Однак вендори публічно не розкрили деталі криптографічної схеми виправлення, тому клієнтська перевірка пом'якшення наразі неможлива.
Q: Які чутливі дані фактично були розкриті при декодуванні трейсів міркувань?
Аналіз 6 708 публічних транскриптів агентів дав 315 320 декодованих блоків міркувань, що містили 367 артефактів PII і 182 захардкоджені облікові дані, зокрема 62 API-ключі, 33 паролі та 30 персональних email-адрес. Більшість цих даних існувала лише всередині прихованих блоків міркувань і жодного разу не з'являлася у видимих відповідях асистента.
Gemini Omni 1.1 Flash: Розширення сцен до 4K і 40 секунд
Gemini Omni 1.1 Flash від Google розширює генеративне відео до 4K, 40 секунд і 360p-прев'ю за третину ціни. Що це означає для команд, які випускають AI-відео.
Крах Gemini — перемога GCP: що робити технічним лідерам зараз
Jeff Dean пішов, Gemini 3.5 Pro скасовано, а GCP зростає понад 100% YoY. Математика build-vs-rent для AI-платформ щойно кардинально змінилась.
Нелегальний ринок iGaming у Європі досяг €12 млрд, потроївшись з 2019 року
Дослідження на замовлення Euromat оцінює нелегальний ринок онлайн-гемблінгу в Європі у €12 млрд у 2025 році — чверть усього сектору. Крипторейки та перевірки платоспроможності названі серед ключових чинників.




