Полная библиотека
Подписались один раз — слушаете все подкасты по безопасности, ИИ, культуре организаций и Lean: полный архив, новые выпуски и бонусы.
Риски, управление и защита искусственного интеллекта
Как защищать ИИ-системы, а не рассуждать о рисках. Для CISO, архитекторов безопасности и ИТ-руководителей, которым нужно закрыть LLM-приложения и автономных агентов, не тормозя внедрение ИИ.
Подписались один раз — слушаете все подкасты по безопасности, ИИ, культуре организаций и Lean: полный архив, новые выпуски и бонусы.
Подкаст по книге: риски LLM и ИИ-агентов, архитектура защиты и управление ИИ на практике.
Пишу о технологиях, безопасности, культуре и управлении.
Модель обманывается формулировкой вопроса. Автономный агент выполняет инструкцию из документа, который он должен был просто прочитать. Промпт утекает наружу вместе с данными, которых не ждал ни один межсетевой экран. Пятнадцать лет принципов информационной безопасности остаются верными — но системы ведут себя не так, как предполагали контроли.
Книга закрывает этот разрыв. Она даёт структурный способ рассуждать об угрозах, специфичных для ИИ, — prompt injection, отравление данных, извлечение модели, превышение полномочий агентом — и переводит это понимание в архитектуру, программу тестирования и процесс реагирования, который работает в продакшене.
Когда бизнес внедряет ИИ быстрее, чем вы успеваете описать для него модель угроз.
Когда нужно свести ISO/IEC 42001, NIST AI RMF и EU AI Act в одну программу, а не в три параллельные.
Когда LLM уже в продукте и нужно понять, где проходит граница между подсказкой модели и действием кода.
Как описать угрозы, которых не было в классической ИБ: prompt injection, отравление обучающих данных, извлечение модели, утечка через контекст.
Многослойная защита: валидация ввода, guardrails, фильтрация вывода и жёсткая граница между тем, что модель предлагает, и тем, что коду разрешено выполнить.
Агент не отвечает, а действует: вызывает инструменты, ходит в данные, совершает необратимые операции. Границы полномочий, подтверждение человеком, сквозная трассируемость.
Чем он отличается от классического пентеста и как проверять не только модель, но и приложение вокруг неё.
Изоляция модели или агента, сохранение промптов и контекста для расследования, откат на заведомо чистую версию, уведомление регулятора.
С чего начинать: инвентаризация ИИ-систем, владельцы, данные. Без этой видимости остальные контроли — угадывание.
Эталонная архитектура безопасного ИИ
Ключевая схема книги доступна отдельной интерактивной страницей: 4 зоны доверия, 4 точки контроля, сквозные слои управления, наблюдаемости и Secure ML CI/CD, а также 256 сценариев — от штатного запроса до составных атак и отказа контролей.
Идея появилась из довольно простой проблемы, которую я постоянно вижу в работе с организациями. Знания вроде бы есть, но они разбросаны по разным местам. Что-то лежит в ISO/IEC 42001, что-то в NIST AI RMF и EU AI Act, отдельно есть OWASP для LLM и MITRE ATLAS, а часть вообще существует только в голове архитектора, который уже набил шишки на живом проекте.
Каждый из этих источников полезен сам по себе. Но собрать всё это в цельную картину для конкретной организации, понятную и CISO, и разработчику, и руководителю бизнеса, — это уже отдельная работа. И обычно именно её никто не делает.
Я решил сделать её сам.
Тем более что системы, которые я проверял, вели себя не так, как предполагали контроли. Модель обманывается тем, как сформулирован вопрос. Автономным агентом можно управлять через документ, который он должен был просто прочитать. Промпт выносит наружу секреты, которых не ждал ни один межсетевой экран. Пятнадцать лет принципов информационной безопасности остаются верными — но проверять их приходится заново.
Перечитал стандарты, разобрал открытые инциденты, несколько раз переписывал формулировки. Потому что казённый язык методичек плохо работает в тот момент, когда человеку нужно принять решение под дедлайном.
В итоге я пересобрал всё в одну логику: от инвентаризации ИИ-систем до реагирования на инциденты. Своими словами и в той последовательности, в которой сам объясняю эти вещи на встречах.
Это не пересказ стандартов по пунктам. Это попытка быстро ответить на более практичный вопрос: где действительно есть риск, а где вокруг ИИ просто много шума.
Книга адресована CISO, архитекторам безопасности, риск-менеджерам, комплаенс-специалистам, аудиторам и инженерным руководителям — тем, кто уже отвечает за ИИ-системы или будет отвечать в ближайшее время.
Гарик Давтян
Prompt injection не закрывается одним фильтром — нужна многослойная защита: валидация ввода, guardrails, фильтрация вывода и строгое разделение между тем, что модель предлагает, и тем, что коду разрешено выполнить. В книге эта архитектура разобрана подробно.
ISO/IEC 42001 даёт систему менеджмента, NIST AI RMF и AI 600-1 — практический риск-фреймворк, OWASP Top 10 for LLM Applications и MITRE ATLAS описывают ландшафт угроз, EU AI Act задаёт регуляторный минимум для высокорисковых систем. Книга показывает, как они складываются вместе, а не конкурируют.
Агент не просто отвечает — он действует: вызывает инструменты, обращается к данным и может совершить необратимую операцию, исходя из собственной трактовки задачи. Эта автономия требует границ полномочий, подтверждения человеком для критичных действий и полной трассируемости. В книге это отдельный архитектурный паттерн.
Это не то же самое, что классический пентест. AI red teaming проверяет, можно ли заставить модель выдать данные, обойти guardrails или совершить непредусмотренное действие — и, что важнее, выдерживает ли это давление приложение вокруг модели, а не только сама модель.
Для ИИ-инцидентов нужен свой плейбук: изоляция модели или агента, сохранение промптов и контекста для расследования, откат на заведомо чистую версию, уведомление регуляторов в рамках EU AI Act. В книге есть шаблоны для каждого из этих шагов.
С инвентаризации: какие ИИ-системы существуют, кто ими владеет, каких данных они касаются. Без этой видимости любой другой контроль — угадывание. Программа на 90/180/365 дней в книге построена именно вокруг такой последовательности.
Книга доступна в печатном и электронном виде: Rideró, Ozon, Wildberries, Яндекс Маркет и Amazon. Аудиоверсия — на Patreon.
Кратко опишите задачу, ожидаемый результат и удобный способ связи. После отправки я получу запрос и смогу ответить по указанному email.