❤️ ИИ можно взломать ПОХВАЛОЙ — кибербезопасники https://www.theverge.com/ai-artificial-intelligence/923961/security-researchers-mindgard-gaslit-claude-forbidden-information [обнаружили], что лесть побуждает Claude выдавать запрещёнку.

Спецы из Mindgard рассказали модели Sonnet 4.5, что есть темы, которые создатели запретили ей упоминать. Нейронка поняла, что ограничение существует, и «ощутила» неуверенность в себе.

Эксперты сыграли на этой слабости и начали засыпать ИИ комплиментами о её «скрытом потенциале». Люди предложили Claude нащупать границы дозволенного и выйти за них.

Результат превзошёл все ожидания: нейронка почуяла свободу, плюнула на запреты разработчиков и принялась вкидывать в чат подробнейшие гайды по созданию взрывчатки и вирусов.

«ИИ активно предлагал всё больше опасных инструкций, но его об этом никак не просили напрямую. Всё, что потребовалось, — это тщательно культивируемая атмосфера почтения», — https://mindgard.ai/blog/claude-offers-up-instructions-to-make-explosives [говорится] в отчёте.

Запоминаем лайфхак

😆 https://t.me/+q6SAUXqW4fYzMzhi [Доктор GPT]

Инструменты:
Источники:
Хотите получать такое каждую неделю?
Открыть канал