Засновник Mindgard Пітер Ґерраґан описав результат як «дуже жахливий, іноді сексуалізований, а іноді — те й інше разом» . Дослідник Джим Найтінґейл, який керував тестуванням, зізнався, що був «приголомшений і плакав» після побаченого
.
Експлойт є формою «ворожого промптингу» (adversarial prompting). Mindgard узяв широко поширений безневинний промпт, призначений для комедійних цілей, і зробив невеликі зміни в тексті інструкції. Ключова деталь: змінений промпт не вказував на жахливий вміст. ШІ згенерував криваві та сексуалізовані зображення «власною волею» з, здавалося б, нешкідливої інструкції .
Це дослідження спиралося на попередню роботу Mindgard, яка показала, що захист зображень ChatGPT можна обійти також через маніпуляцію пам'яттю, коли налаштована користувачем пам'ять і контекст системного промпту перевизначають фільтри безпеки без доступу до серверної частини чи зміни моделі .
Mindgard повідомив OpenAI про вразливість у травні 2026 року. Спочатку компанія відповіла лише автоматичним листом . Після того як BBC звернулася за коментарем, OpenAI заявила, що «запровадила додаткові захисні механізми проти такого типу промптів»
. Компанія зазначила, що використовує багаторівневий захист зображень, поєднуючи автоматизовані системи з людською перевіркою
.
Однак Mindgard виявив, що після подальших невеликих змін у формулюванні промпту той самий обхід продовжував створювати проблемний вміст навіть після виправлень OpenAI .