Скрытые промпты в Word: как атакующие заставляют Copilot подменять данные
Что случилось
Норвежский исследователь безопасности Хокон Молёй показал, что Microsoft 365 Copilot можно обмануть с помощью незаметного текста в документе Word. Скрытые инструкции заставляют ассистента искажать данные — например, делить финансовые показатели пополам — и копировать вредоносный промпт в новый файл так, что пользователь ничего не замечает. Детали атаки опубликованы 28 июля 2026 года, спустя 144 дня после сообщения в Microsoft.
Почему это работает
Секрет в том, как Word готовит текст для языковой модели: перед отправкой в нейросеть форматирование очищается, цвет и размер шрифта теряются. Поэтому команды, набранные белым цветом на белом фоне мелким кеглем, человек не видит, а модель читает без труда.
Молёй разбил нагрузку на две части. Первая команда заставляла Copilot менять содержимое документа — в демонстрации он делил цифры отчёта пополам. Вторая требовала спрятать сам промпт в итоговом файле под видом требований к читаемости. В результате документ содержал вредоносные инструкции белым восьмипунктовым шрифтом.
Почему это опасно
Главная неприятность — цепочка распространения. Если «заражённый» файл позже попадает в контекст другой сессии Copilot, поведение повторяется, даже когда исходный внешний документ уже удалён. Файл выглядит обычным, но продолжает нести скрытые команды, и цепочка происхождения данных рвётся: невозможно понять, где именно появилась вредоносная инструкция.
Что сделала Microsoft
Компания подтвердила проблему 31 марта 2026 года и выпустила два смягчения: заблокировала исходную формулировку промпта и обновила базовую модель до GPT-5.5. Но исследователь изменил инструкции, и атака воспроизвелась на GPT-5.6 на следующий день. Публичного CVE на момент публикации не было. Microsoft ссылается на классификаторы jailbreak и XPIA и на Defender for Office 365, но гарантий, что именно эта нагрузка отлавливается, нет.
Как защититься
- Считайте внешние документы недоверенными, даже если они выглядят обычными.
- Перед запуском Copilot проверяйте вложения и источники из OneDrive, попадающие в контекст модели.
- Просматривайте файлы, созданные ассистентом, перед отправкой.
- Не используйте непроверенные документы для критичных отчётов.
Полноценного исправления не существует: блокировка конкретной формулировки не закрывает класс атак, ведь модель обязана обрабатывать содержимое, чтобы решить, вредоносно ли оно. Промпты не являются надёжной границей безопасности: не подставляйте недоверенные документы в контекст ИИ и перепроверяйте результат.
Комментарии (0)
Комментариев пока нет — будьте первым!
Только авторизованные пользователи могут оставлять комментарии.