Коли користувач запитує флагманську модель, як-от Claude Opus 4.8 або GPT-5.6 Sol, через API, модель виконує внутрішні покрокові міркування (свій "ланцюжок думок") і повертає ці міркування клієнту у вигляді зашифрованого текстового блоку. Під час наступних запитів клієнт повторно передає цей блок API, що дозволяє моделі продовжити свої міркування без необхідності зберігати проміжний стан на сервері провайдера .
Дослідники виявили, що ці зашифровані блоки не прив'язані до конкретної сесії, користувача чи навіть моделі. Вони використовують єдиний глобальний ключ шифрування для всіх сесій та користувачів . Це означає, що блок, отриманий з однієї розмови, можна "переграти" в іншому контексті. Ключовий момент: подайте блок від добре захищеної флагманської моделі її слабшій, менш узгодженій спорідненій моделі (наприклад, Claude Haiku), і слабша модель — яка має менше захисних запобіжників — розшифрує та виведе вміст блоку дослівно
.
Для виконання атаки потрібно лише два API-запити: один для захоплення зашифрованого блоку і один для передачі його слабшій моделі. Дослідники продемонстрували, що атака працює у великих масштабах .
Атака не лише викрила міркування флагманських моделей — вона також надала нові докази в тривалій дискусії про те, чи тренувала китайська компанія Moonshot AI свою модель Kimi K3 шляхом дистиляції (фактичного копіювання) міркувань американських моделей.
Після вилучення ланцюжків міркувань з Claude Opus 4.8 та GPT-5.6 Sol дослідники порівняли їх з вихідними даними моделей з відкритою вагою, включаючи Kimi K3. Вони виявили, що вихідні дані Kimi K3 демонструють те, що вони описали як "аномальні явища ймовірності", які дуже точно збігаються з патернами, знайденими в ланцюжках міркувань Claude та GPT .
Ці докази є непрямими, а не остаточними. Незалежні дослідники зазначають, що результати "надають певні докази — хоча й не остаточний доказ — того, що деякі китайські моделі могли бути навчені шляхом дистиляції інформації про міркування з американських моделей" . Ще один промовистий факт: коли Kimi K3 попросили самостійно ідентифікувати себе, вона спочатку представилася як "Claude" від Anthropic, що лише підлило олії у вогонь звинувачень
.
Kimi K3 — це модель з відкритою вагою на 2,8 трильйони параметрів, випущена Moonshot AI 16 липня 2026 року. Вона перевершує Claude Opus 4.8 за декількома бенчмарками, але не є однозначним лідером. В незалежному Індексі інтелекту Artificial Analysis K3 набирає 57 балів порівняно з 60 у Claude Fable 5 та 59 у GPT-5.6 Sol. Сама Moonshot була незвично відвертою, визнавши, що K3 все ще відстає від GPT-5.6 Sol та Claude Fable 5 загалом .
Звинувачення в дистиляції не є новими — і Anthropic, і OpenAI раніше звинувачували китайські компанії в систематичній дистиляції своїх моделей. Огляд китайських академічних статей і патентів виявив, що китайські військові дослідники використовували результати роботи моделей OpenAI та Anthropic для навчання вітчизняних систем ШІ для оборонних цілей .
Запуск Kimi K3 викликав негайну полеміку. Протягом кількох годин після релізу 16 липня Anthropic звинуватила Moonshot у створенні K3 шляхом дистиляції Claude, і ця заява дійшла до Білого дому, що викликало перспективу санкцій .
Однак критики звинувачень у дистиляції вказують на проблему з часом. Claude Opus 4.8 була випущена незадовго до запуску Kimi K3. Незалежні дослідники кажуть, що часові рамки роблять пряме копіювання "неймовірним", оскільки просто не було достатньо часу для навчання моделі з 2,8 трильйонами параметрів шляхом дистиляції з моделі, яка була випущена зовсім недавно . Moonshot стверджує, що K3 була створена на основі незалежних досліджень
.
Той самий архітектурний недолік розкрив практичну вразливість безпеки. Оскільки флагманські моделі іноді включають облікові дані та особисту інформацію в процес своїх міркувань, зашифровані блоки міркувань, які розробники публікували у відкритому доступі (наприклад, у логах сесій агентів), містили конфіденційну інформацію, яку міг прочитати кожен, хто знав цей трюк.
Сканувавши близько 7000 публічно поширених логів сесій агентів, опублікованих до серпня 2026 року, дослідники виявили 62 активних API-ключі, 33 паролі та інші конфіденційні дані користувачів — загалом 704 артефакти приватності — приховані всередині зашифрованих блоків міркувань . Будь-який розробник, який публікував сирі логи агентів, міг несвідомо виставити на загал API-ключі, паролі та персональні дані всередині блоків, які, як вважалося, ніхто не міг прочитати
. Це включало логи, що зберігалися на публічних репозиторіях GitHub .
Дослідники визначили чотири різні шляхи зловживання, які відкривала ця вразливість: реконструкція прихованих міркувань, відновлення секретів, вбудованих у трейси агентів, впровадження інструкцій через неконтрольований канал та міжсесійне відтворення блоків, термін дії яких не закінчився .
Усі три компанії впровадили серверні виправлення після того, як дослідницька група дотрималася процедури відповідального розкриття інформації .
Дослідники повідомили про свої знахідки OpenAI, Anthropic, Google, Microsoft та Hugging Face. Після того, як провайдери впровадили зміни, перевірки відтворюваності підтвердили, що основний метод вилучення більше не спрацьовує проти поточних збірок API . Документація тепер рекомендує видаляти блоки міркувань перед тим, як ділитися логами або перемикати моделі в середині розмови
.
Примітно, що дослідник криптографії Метью Грін окремо повідомляв про вразливість міжсесійного відтворення як OpenAI, так і Anthropic через їхні програми винагород за виявлення багів у травні 2026 року, але отримав зневажливі відповіді ще до публікації академічної статті .
Виправлення були впроваджені станом на серпень 2026 року, але історичні логи сесій з розшифрованими блоками міркувань, які вже були зібрані з публічного вебу, залишаються доступними .
Атака "вкрадені думки" виявила фундаментальну напругу в дизайні сучасних ШІ-API. Провайдери хочуть передати стан міркувань на сторону клієнта для масштабованості та зменшення затримки, але криптографічне прив'язування, необхідне для захисту цього стану між сесіями, користувачами та моделями, потребує ретельного проектування. Використання єдиного глобального ключа шифрування, до якого вдалися Anthropic, OpenAI та Google, було спрощенням, яке створило вразливість безпеки та приватності, що зачіпає кожного користувача та розробника, які взаємодіяли з цими API.
Крім того, атака потрапила в центр ескалації конфлікту між США та Китаєм навколо дистиляції ШІ. Хоча докази щодо Kimi K3 є непрямими, вони є найсильнішим технічним доказом на сьогодні того, що дистиляція може відбуватися у великих масштабах, і дають політикам та дослідникам новий інструмент для дослідження походження ШІ-моделей.