Більшість наукових робіт про застосування штучного інтелекту в кіберзахисті мають одну спільну слабкість: ШІ-агентів тренують і оцінюють виключно в симуляції, а не на системі, яку вони мають захищати в реальності. Це та сама проблема “sim-to-real gap”, що добре відома в робототехніці, — модель, яка блискуче показує себе на віртуальному полігоні, може провалитися при зіткненні з реальною інфраструктурою.
Команда дослідників з KTH (Швеція) та Swedish Defence Research Agency вирішила закрити цей розрив і протестувала своїх агентів не лише в симуляторі, а на живій мережі — 37 віртуальних машин, реальний SIEM (Wazuh), автоматизований red-team інструмент Lore, який протягом двох годин на епізод намагався просунутися мережею, як справжній зловмисник. Усього — 134 епізоди за місяць спостережень. Рішення агента приймалося на основі живої телеметрії з мережі, перетвореної у формальну модель загроз (Meta Attack Language).
Це принципово інший рівень доказовості, ніж просто “наша модель показала 95% точності на датасеті”. Автори прямо визнають: результати в чистій симуляції не гарантують нічого про поведінку системи в реальних умовах — з реальним шумом, хибними спрацюваннями та непередбачуваною поведінкою користувачів.
Для бізнесу, який обирає рішення з елементами автоматизації та ШІ — будь то EDR/XDR, SOAR чи інші класи інструментів — висновок практичний: перш ніж довіряти системі керування інцидентами, варто перевірити її не на демо-стенді вендора, а на власній інфраструктурі, під реальним навантаженням і реальними сценаріями атак. Саме для цього існує клас рішень breach and attack simulation (BAS) — у портфелі E-Light це, зокрема, Picus Security та Cymulate: вони дозволяють безперервно перевіряти, чи справді засоби захисту виявляють і блокують атаки, а не просто демонструють показники в маркетинговому звіті.