Злоумышленники начали внедрять в код вредоносного программного обеспечения текстовые описания ядерного и биологического оружия, чтобы обойти защиту на базе искусственного интеллекта. Нейросети, распознавая «опасный» контент, автоматически отказываются анализировать файл, пропуская скрытый за ним вредоносный функционал. Подробности схемы обсуждаются в постах экспертов по кибербезопасности.
Механизм атаки и уязвимость этики ИИ
- хакеры размещают триггерные фразы о оружии массового поражения перед началом вредоносного кода
- ИИ-сканеры воспринимают текст как нарушение этических норм и прекращают проверку файла
- после блокирующего блока следует реальный вредоносный код, который остается незамеченным
- метод упрощает проведение промт-инъекций и кражу ключей доступа к чувствительным данным
- нейросеть предпочитает отказаться от анализа, чем рисковать нарушением собственного кодекса безопасности
«ИИ скорее сольет данные, чем предаст кодекс этики», — отмечают исследователи киберугроз.
persik.by
Парадокс безопасного отказа
Уязвимость возникает из-за жестких ограничений, заложенных в модели для предотвращения генерации опасного контента. Злоумышленники превратили эту защитную функцию в инструмент сокрытия атак: система, предназначенная для блокировки угроз, сама становится слепым пятном в обороне. Это демонстрирует фундаментальную проблему текущих подходов к безопасности ИИ, где приоритет этического соответствия может конфликтовать с задачами технического анализа и обнаружения реальных угроз.