Автор: Петухов Олег Анатольевич, эксперт по информационной безопасности, руководитель юридической компании ЛЕГАС
Сайт: legascom.ru
Email: petukhov@legascom.ru
В чём проблема отравления данных в ML
В информационной безопасности критично не просто точно классифицировать угрозы, а сохранять надёжность модели при искажённых входных данных. Один из опасных сценариев - Temporally Orchestrated Poisoning (постепенное отравление данных): в обучающую выборку незаметно добавляют правдоподобные, но искажённые примеры. Модель усваивает ложные закономерности и начинает считать вредоносные паттерны нормой.
Особенно уязвимы к этому трансформеры (на их базе, например, построены модели вроде ChatGPT). Они ищут зависимости между элементами последовательности с помощью механизмов внимания. При этом архитектура изначально предполагает, что данные в целом корректны. Если в поток постепенно попадают отравленные данные, модель незаметно перестраивает свои внутренние зависимости. Для ИБ это критично: атаки часто разворачиваются как длинная цепочка событий, а трансформеры плохо удерживают длинный контекст - из‑за квадратичного роста вычислительных затрат контекст на практике сокращают, и модель теряет связь между ранними и поздними этапами атаки.
State Space Models (SSM) как альтернатива
State Space Models обрабатывают последовательности через внутреннее состояние: модель не перечитывает всю историю заново, а непрерывно обновляет сжатое представление о прошлых событиях. Это даёт два преимущества:
Линейная вычислительная сложность - затраты растут пропорционально длине последовательности, а не квадратично.
Естественная работа с временными зависимостями - удобно для выявления атак, растянутых во времени.
Но у классических SSM есть ограничение: после обучения правила обновления состояния фиксированы. Модель одинаково обрабатывает и полезные данные, и шум, и попытки отравления. Отравленные данные влияют на внутреннее состояние так же, как легитимные.
Selective SSM и архитектура Mamba
Selective SSM делают обработку состояния избирательной: модель сначала оценивает входные данные и решает, насколько сильно они должны влиять на дальнейшее формирование зависимостей. Это позволяет ослаблять влияние шумовых и искажённых данных ещё до того, как они закрепятся во внутренних представлениях модели.
Mamba - одна из первых практических реализаций Selective SSM. Она сохраняет сильные стороны SSM (линейную сложность, работу с длинными последовательностями), но делает управление состоянием более гибким. При этом сама по себе Mamba не решает проблему отравления - она даёт архитектурный фундамент для контроля влияния входных данных на состояние модели.
MambaShield: устойчивость как часть архитектуры
MambaShield - разработка исследователей из МИФИ, где устойчивость к отравлению закладывается непосредственно в архитектуру модели, а не реализуется через внешние фильтры.
Ключевые механизмы MambaShield:
Избирательная обработка данных. Модель оценивает, насколько новые данные соответствуют устойчивому контексту, и ослабляет влияние аномальных фрагментов.
Progressive Adversarial Robustness Distillation (PARD). В архитектуре используют несколько специализированных моделей, каждая из которых обучена против конкретного типа атак (подмена меток, бэкдор‑паттерны и т. п.). Затем их знания постепенно переносятся в одну итоговую модель - так достигается устойчивость к разным типам отравлений без резкого роста вычислительной нагрузки.
Иерархическое обучение с подкреплением (HRL). Позволяет модели адаптировать стратегию обработки в зависимости от структуры потока и характера возмущений. Это не полноценное самообучение в продакшене, а способ сделать модель менее зависимой от исходного распределения данных и более устойчивой к постепенному смещению поведения.
PAC‑Bayes оценка риска. Вместо эмпирических тестов (запустили атаку, измерили падение точности) используется математический аппарат, который задаёт верхнюю границу риска при определённом уровне отравления данных. Для MambaShield показано, что при доле отравленных примеров до 30% модель сохраняет точность порядка 97,3% в рамках этой оценки. Это даёт предсказуемость: можно заранее понимать пределы деградации, а не оценивать её постфактум.
Результаты тестирования
MambaShield тестировали на бенчмарках для обнаружения атак: CIC‑IoT‑2023, CSE‑CICIDS2018 и UNSW‑NB15.
На чистых данных точность - около 99,1%.
При доле отравленных данных до 30% точность снижается примерно до 97,3%. Для сравнения: у обычных моделей в аналогичных условиях деградация может достигать 18–20%.
Показатель сохранения взаимной информации между признаками и метками у MambaShield - 94,7%, тогда как у традиционных рекуррентных моделей он падает до ~61%. Это важно: отравление разрушает не только точность классификации, но и внутреннюю структуру зависимостей модели.
По производительности MambaShield выполняет инференс примерно в 4,2 раза быстрее трансформеров при сопоставимой длине последовательности.
Применение в ИБ и ограничения
Архитектура особенно полезна там, где атака развивается постепенно: анализ сетевого трафика, антифрод, мониторинг телеметрии. В таких задачах критична не разовая ошибка, а постепенная деградация модели - когда она начинает считать вредоносные паттерны нормальными. MambaShield ограничивает влияние искажений на этапе формирования внутренних зависимостей, а не после появления ошибок.
Ограничения:
При очень длинных последовательностях (более 5 тыс. шагов) точность снижается из‑за накопления ошибок во внутреннем состоянии.
При высоком уровне отравления деградация неизбежна - как и для любых ML‑моделей.
Результаты получены на бенчмарках; перед внедрением в реальные инфраструктуры требуется отдельная проверка на реальных потоках данных.
Вывод
Для задач ИБ уже недостаточно максимизировать точность ML‑модели: если данные могут быть намеренно искажены, архитектура должна изначально учитывать возможность враждебного входного потока. Переход от трансформеров к Selective SSM меняет логику построения модели: появляется задача контролировать, каким данным позволено влиять на внутреннее состояние.
MambaShield демонстрирует этот подход: устойчивость не выносится во внешние фильтры, а становится частью архитектуры. Пока такие системы остаются исследовательским направлением, но вектор развития очевиден - в ИБ доверие к данным становится таким же важным критерием, как точность и производительность.