Ядерный код как щит: хакеры обманывают ИИ-сканеры описаниями оружия во вредоносном ПО

«Этика против безопасности»: когда защита становится уязвимостью

читать 1 мин
Концептуальная иллюстрация: строки кода с описанием оружия, скрывающие вредоносную нагрузку от ИИ-анализатора

Злоумышленники начали внедрять в код вредоносного программного обеспечения текстовые описания ядерного и биологического оружия, чтобы обойти защиту на базе искусственного интеллекта. Нейросети, распознавая «опасный» контент, автоматически отказываются анализировать файл, пропуская скрытый за ним вредоносный функционал. Подробности схемы обсуждаются в постах экспертов по кибербезопасности.

Механизм атаки и уязвимость этики ИИ

  • хакеры размещают триггерные фразы о оружии массового поражения перед началом вредоносного кода
  • ИИ-сканеры воспринимают текст как нарушение этических норм и прекращают проверку файла
  • после блокирующего блока следует реальный вредоносный код, который остается незамеченным
  • метод упрощает проведение промт-инъекций и кражу ключей доступа к чувствительным данным
  • нейросеть предпочитает отказаться от анализа, чем рисковать нарушением собственного кодекса безопасности

«ИИ скорее сольет данные, чем предаст кодекс этики», — отмечают исследователи киберугроз.

persik.by

Парадокс безопасного отказа

Уязвимость возникает из-за жестких ограничений, заложенных в модели для предотвращения генерации опасного контента. Злоумышленники превратили эту защитную функцию в инструмент сокрытия атак: система, предназначенная для блокировки угроз, сама становится слепым пятном в обороне. Это демонстрирует фундаментальную проблему текущих подходов к безопасности ИИ, где приоритет этического соответствия может конфликтовать с задачами технического анализа и обнаружения реальных угроз.