<rss version="2.0"><channel><title>maxigacy (AI) Security</title><pubDate>2026-09-17T19:27:04.754358+00:00</pubDate><link href="https://t.me/aixsec" /><description>maxigacy (AI) Security</description><item><guid>https://t.me/c/3827191561/51</guid><title>Firewall для tool calls  Разрешить агенту инструмент delete_file ещё не значит разрешить удаление лю</title><description>&lt;strong&gt;Firewall для tool calls&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Разрешить агенту инструмент delete_file ещё не значит разрешить удаление любого файла. С execute_sql та же история: название одно, последствия зависят от запроса.&lt;br /&gt;&lt;br /&gt;Поэтому между решением модели и выполнением хочется иметь отдельную проверку. Особенно когда агент работает с реальными данными.&lt;br /&gt;&lt;br /&gt;В мартовском препринте &lt;a href="https://arxiv.org/abs/2603.12621"&gt;AEGIS: No Tool Call Left Unchecked&lt;/a&gt; авторы описывают такой слой. Он перехватывает вызов до выполнения, извлекает строки из аргументов, проверяет их по шаблонам угроз и заданным политикам.&lt;br /&gt;&lt;br /&gt;Дальше три варианта: пропустить, заблокировать или приостановить до решения человека.&lt;br /&gt;&lt;br /&gt;В основе проверки здесь правила и паттерны. Например, признаки опасных SQL-запросов, shell injection и обращения к чувствительным файлам.&lt;br /&gt;&lt;br /&gt;По результатам авторов:&lt;br /&gt;&lt;br /&gt;• заблокированы 48 из 48 атак в подготовленной ими выборке;&lt;br /&gt;• на 500 безопасных вызовах было 6 ложных срабатываний, то есть 1,2%;&lt;br /&gt;• медианная добавленная задержка составила 8,3 мс на 1000 вызовах в локальном развёртывании.&lt;br /&gt;&lt;br /&gt;Все шесть ложных срабатываний вызвали легитимные SQL-запросы с OR. Знакомая проблема: конструкция выглядит подозрительно, хотя запрос нормальный.&lt;br /&gt;&lt;br /&gt;Но 48 примеров мало для вывода об устойчивости защиты. Авторы признают, что правила могут пропускать новые варианты атак. А вызовы в обход SDK вообще находятся вне модели защиты AEGIS.&lt;br /&gt;&lt;br /&gt;Мне здесь интереснее сама точка контроля: модель предложила действие, а право его выполнить проверяется отдельно.&lt;br /&gt;&lt;br /&gt;Потому что проверка перед delete_file полезна ровно до момента, когда тот же файл можно удалить через shell.&lt;br /&gt;&lt;br /&gt;#AIxSec #AgentSecurity #ToolCalling #MLSecOps&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--51-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-17T06:12:55+00:00</pubDate><link href="https://t.me/c/3827191561/51">https://t.me/c/3827191561/51</link></item><item><guid>https://t.me/c/3827191561/50</guid><title>Выпуск уже на канале!  https://www.youtube.com/watch?v=FxcfiUxpQAo  https://rutube.ru/video/0a86d8bc</title><description>Выпуск уже на канале!&lt;br /&gt;&lt;br /&gt;&lt;a href="https://www.youtube.com/watch?v=FxcfiUxpQAo"&gt;https://www.youtube.com/watch?v=FxcfiUxpQAo&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href="https://rutube.ru/video/0a86d8bccfedd1806767f5143718ffc1/"&gt;https://rutube.ru/video/0a86d8bccfedd1806767f5143718ffc1/&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;&lt;a href="https://vkvideo.ru/video-241490908_456239018"&gt;https://vkvideo.ru/video-241490908_456239018&lt;/a&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--50-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-13T09:17:40+00:00</pubDate><link href="https://t.me/c/3827191561/50">https://t.me/c/3827191561/50</link></item><item><guid>https://t.me/c/3827191561/49</guid><title>Друзья, всем привет 🫶  Сегодня мы с @maxigacy будем записывать подкаст для вас про найм в ИБ (собесе</title><description>Друзья, всем привет 🫶&lt;br /&gt;&lt;br /&gt;Сегодня мы с @maxigacy будем записывать подкаст для вас про найм в ИБ (&lt;em&gt;собеседования, задания, наиболее востребованные направления в ИБ и тд&lt;/em&gt;). Как обычно, самые умные мысли приходят в последний момент: пожалуйста, напишите в комментариях к этому посту или мне в лс те вопросы, касательно найма, которые вам интересны (&lt;em&gt;на которые вам хотелось бы послушать мнение со стороны&lt;/em&gt;). Мы ответим на них в ходе подкаста&lt;br /&gt;&lt;br /&gt;Не стесняйтесь, пишите) &lt;br /&gt;&lt;br /&gt;P.S. У меня фотографии под рукой подходящей нет, поэтому ловите веселых нас с Максом😅&lt;br /&gt;&lt;br /&gt;🫡 &lt;a href="https://notes-knyazev.ru/"&gt;Сайт&lt;/a&gt; | 🤔 &lt;a href="https://habr.com/ru/users/MaxiEnergy/articles/"&gt;Хабр&lt;/a&gt; &lt;br /&gt;&lt;br /&gt;#информационная_безопасность&lt;br /&gt;#карьера&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--49-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-12T11:30:16+00:00</pubDate><link href="https://t.me/c/3827191561/49">https://t.me/c/3827191561/49</link></item><item><guid>https://t.me/c/3827191561/48</guid><title>Накиньте вопросов, пожалуйста, постараемся на них ответить в подкасте, если напишете до 16.00</title><description>Накиньте вопросов, пожалуйста, постараемся на них ответить в подкасте, если напишете до 16.00</description><pubDate>2026-09-12T11:30:16+00:00</pubDate><link href="https://t.me/c/3827191561/48">https://t.me/c/3827191561/48</link></item><item><guid>https://t.me/c/3827191561/47</guid><title>Меньше алертов. А уязвимостей?  После запуска SAST начинается отдельная работа: понять, какие находк</title><description>&lt;strong&gt;Меньше алертов. А уязвимостей?&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;После запуска SAST начинается отдельная работа: понять, какие находки действительно нужно чинить. Здесь и хочется подключить LLM, чтобы она прочитала код и помогла разобрать отчёт.&lt;br /&gt;&lt;br /&gt;В препринте &lt;a href="https://arxiv.org/abs/2605.01885"&gt;QASecClaw&lt;/a&gt; авторы проверили такую связку. Semgrep находит подозрительные места, затем LLM изучает исходники и решает, какие срабатывания оставить.&lt;br /&gt;&lt;br /&gt;На OWASP Benchmark с 2740 Java-тестами, по общей таблице авторов, получилось:&lt;br /&gt;&lt;br /&gt;• ложных срабатываний: 560 → 64;&lt;br /&gt;• верно обнаруженных уязвимых тестов: 1273 → 1233.&lt;br /&gt;&lt;br /&gt;То есть убрали 496 ложных алертов. Но заодно отфильтровали 40 настоящих находок, которые Semgrep уже обнаружил.&lt;br /&gt;&lt;br /&gt;Вот эти 40 мне интереснее красивых «минус 88,6% шума». Хочется посмотреть, почему модель решила, что там всё нормально, и не повторяется ли одна ошибка на целом классе уязвимостей.&lt;br /&gt;&lt;br /&gt;К самой работе тоже есть вопросы: некоторые цифры в тексте и таблицах расходятся. Плюс это препринт и синтетические Java-тесты. Переносить результат на свой продукт без проверки я бы не стал.&lt;br /&gt;&lt;br /&gt;Для своего пайплайна я бы начал с подсказок при разборе: пусть модель объясняет, почему считает находку ложной, а исходный отчёт остаётся доступным. Потом можно проверить её решения на знакомом коде и понять, где ей доверять.&lt;br /&gt;&lt;br /&gt;Потому что пустой отчёт получить несложно. Хочется всё-таки безопасный код.&lt;br /&gt;&lt;br /&gt;#AIxSec #AppSec #SAST #MLSecOps #AIxSec_Research&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--47-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-11T06:25:36+00:00</pubDate><link href="https://t.me/c/3827191561/47">https://t.me/c/3827191561/47</link></item><item><guid>https://t.me/c/3827191561/46</guid><title>ИИ уже умеет писать код, анализировать документы и автоматизировать рутину. Следующий рубеж — поиск </title><description>&lt;strong&gt;ИИ уже умеет писать код, анализировать документы и автоматизировать рутину. Следующий рубеж — поиск уязвимостей.&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Но насколько хорошо AI справляется с реальным пентестом? Может ли он самостоятельно найти проблему, правильно оценить её критичность и предложить рабочее исправление? Или пока он только создаёт дополнительный шум для команды безопасности?&lt;br /&gt;&lt;br /&gt;Об этом поговорили с Даниилом Иванькиным — старшим инженером по информационной безопасности в Т-Банке.&lt;br /&gt;&lt;br /&gt;В интервью разобрали три практических сценария применения AI в пентесте.&lt;br /&gt;&lt;br /&gt;Первый — анализ Git-репозитория. Агент получает доступ к исходному коду, изучает его и пытается найти потенциальные уязвимости ещё до того, как приложение окажется в продакшене.&lt;br /&gt;&lt;br /&gt;Второй — работа с API-контрактами: Swagger, YAML и другими описаниями интерфейсов. Здесь AI может проверять большое количество эндпоинтов, искать подозрительные места и объединять дублирующиеся находки, чтобы специалисту не приходилось вручную разбирать сотни одинаковых предупреждений.&lt;br /&gt;&lt;br /&gt;Третий — автоматизация процесса исправления уязвимостей. Найденная проблема превращается в задачу, попадает к ответственному разработчику, проходит проверку и возвращается в работу, если исправление оказалось недостаточным.&lt;br /&gt;&lt;br /&gt;Но у AI-пентеста остаётся важное ограничение: модель может ошибаться, неверно понимать контекст и выдавать убедительно звучащие ложные срабатывания. Поэтому человек из процесса пока никуда не исчезает. Его роль меняется — вместо ручного перебора каждой гипотезы специалист управляет агентами, проверяет результаты и принимает финальные решения.&lt;br /&gt;&lt;br /&gt;Также поговорили о том:&lt;br /&gt;&lt;br /&gt;— как измерять реальную пользу AI в информационной безопасности;  &lt;br /&gt;— почему качество находок важнее их количества;  &lt;br /&gt;— какие эксперименты уже приводят к обнаружению настоящих уязвимостей;  &lt;br /&gt;— как Даниил пришёл в профессию и выступил с первым докладом сразу после школы;  &lt;br /&gt;— как школьников готовят к олимпиадам, CTF и работе в информационной безопасности;  &lt;br /&gt;— почему преподавание помогает самому специалисту развиваться быстрее.&lt;br /&gt;&lt;br /&gt;Получился честный разговор без обещаний, что «ИИ завтра заменит пентестеров». Скорее наоборот: AI становится новым инструментом в руках инженера и помогает быстрее проверять гипотезы, масштабировать процессы и освобождать время для задач, где действительно нужны опыт и человеческое мышление.&lt;br /&gt;&lt;br /&gt;Смотрите полное интервью☝️&lt;br /&gt;&lt;strong&gt;The video is too large.&lt;/strong&gt;</description><pubDate>2026-09-10T15:10:33+00:00</pubDate><link href="https://t.me/c/3827191561/46">https://t.me/c/3827191561/46</link></item><item><guid>https://t.me/c/3827191561/45</guid><title>⚪️ Представляем Алису AI для бизнеса — ИИ-ассистента для рабочих задач. Давайте ему самые разные пор</title><description>⚪️ &lt;strong&gt;Представляем &lt;/strong&gt;&lt;a href="https://360.yandex.ru/business/alice-business/"&gt;&lt;strong&gt;Алису AI для бизнеса&lt;/strong&gt;&lt;/a&gt; — ИИ-ассистента для рабочих задач. Давайте ему самые разные поручения — он сам определит последовательность действий, обратится к нужным сервисам и выдаст результат.&lt;br /&gt;&lt;br /&gt;Если ваша организация — клиент Яндекс 360, то ИИ-ассистент для вас уже доступен. Если же нет, то &lt;a href="https://360.yandex.ru/business/"&gt;зарегистрируйтесь&lt;/a&gt; в экосистеме. За трёхмесячный пробный период успеете бесплатно попробовать Алису AI для бизнеса и другие возможности.&lt;br /&gt;&lt;br /&gt;Подписывайтесь 🔴 @yandex&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--45-0.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--44-1.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--43-2.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--42-3.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--41-4.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--40-5.jpg" alt="media"/&gt;</description><pubDate>2026-09-09T13:21:17+00:00</pubDate><link href="https://t.me/c/3827191561/45">https://t.me/c/3827191561/45</link></item><item><guid>https://t.me/c/3827191561/38</guid><title>Теперь AI B2B SaaS в полной мере) и даже Security добавили)</title><description>Теперь AI B2B SaaS в полной мере) и даже Security добавили)</description><pubDate>2026-09-09T13:20:27+00:00</pubDate><link href="https://t.me/c/3827191561/38">https://t.me/c/3827191561/38</link></item><item><guid>https://t.me/c/3827191561/37</guid><title>жду всех на ZeroNights 30 сентября в Питере) Буду рассказывать про проверки плагинов в Трекере https</title><description>жду всех на ZeroNights 30 сентября в Питере)&lt;br /&gt;Буду рассказывать про проверки плагинов в Трекере &lt;a href="https://habr.com/ru/companies/yandex/articles/1062416/"&gt;https://habr.com/ru/companies/yandex/articles/1062416/&lt;/a&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--37-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-08T09:24:35+00:00</pubDate><link href="https://t.me/c/3827191561/37">https://t.me/c/3827191561/37</link></item><item><guid>https://t.me/c/3827191561/36</guid><title>Можно ли доверить LLM решение о том, кому выдавать доступ?  Короткий ответ: точно нет.  Поговорил с </title><description>&lt;strong&gt;Можно ли доверить LLM решение о том, кому выдавать доступ?&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Короткий ответ: точно нет.&lt;br /&gt;&lt;br /&gt;Поговорил с Борисом, экспертом по AI Security и автором блога &amp;quot;Борис_ь с ML&amp;quot;, о том, как устроена безопасность ML-систем и AI-агентов.&lt;br /&gt;&lt;br /&gt;В интервью обсудили:&lt;br /&gt;&lt;br /&gt;• как Борис попал в безопасность ИИ&lt;br /&gt;• почему экспертный канал может привести к новым карьерным возможностям&lt;br /&gt;• действительно ли AI Security создаёт новые проблемы или переупаковывает старые&lt;br /&gt;• что там с правами у AI-агентов&lt;br /&gt;• почему нельзя позволять LLM самостоятельно принимать решения о доступе&lt;br /&gt;• где проходит граница между автономностью агента и контролем безопасности&lt;br /&gt;&lt;br /&gt;Получился разговор не только про технологии, но и про развитие в AI Security, публичность и новые риски, которые появляются вместе с AI-агентами.&lt;br /&gt;&lt;br /&gt;Смотрите полное интервью 👆&lt;br /&gt;&lt;br /&gt;А вы бы разрешили LLM самостоятельно выдавать доступы пользователям и AI-агентам?&lt;br /&gt;&lt;strong&gt;The video is too large.&lt;/strong&gt;</description><pubDate>2026-09-08T06:14:56+00:00</pubDate><link href="https://t.me/c/3827191561/36">https://t.me/c/3827191561/36</link></item><item><guid>https://t.me/c/3827191561/35</guid><title>Ваш клиент пишет system prompt  Можно выбрать устойчивую модель, продумать системный промпт и настро</title><description>&lt;strong&gt;Ваш клиент пишет system prompt&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Можно выбрать устойчивую модель, продумать системный промпт и настроить иерархию инструкций.&lt;br /&gt;&lt;br /&gt;А потом позволить пользователю самостоятельно назначить своим сообщениям роль system.&lt;br /&gt;&lt;br /&gt;Именно такую проблему обнаружили авторы исследования &lt;a href="https://arxiv.org/abs/2511.05797"&gt;When AI Meets the Web&lt;/a&gt;, принятого на IEEE S&amp;amp;P 2026.&lt;br /&gt;&lt;br /&gt;Они изучили 17 сторонних плагинов для AI-чатботов, развёрнутых более чем на 10 000 сайтов.&lt;br /&gt;&lt;br /&gt;У 8 плагинов, которые использовались примерно на 8 000 сайтов, история диалога отправлялась из браузера внутри POST-запроса без проверки её подлинности и целостности.&lt;br /&gt;&lt;br /&gt;Пользователь мог изменить историю, добавить сообщение от имени assistant или даже вставить собственную инструкцию с ролью system.&lt;br /&gt;&lt;br /&gt;USER → SYSTEM&lt;br /&gt;&lt;br /&gt;В экспериментах такая подмена повышала успешность исследованных нежелательных сценариев в 3–8 раз.&lt;br /&gt;&lt;br /&gt;Второй путь атаки проходил через RAG.&lt;br /&gt;&lt;br /&gt;Системы автоматического сбора контента у 15 плагинов извлекали со страниц не только контент владельца сайта, но и пользовательские отзывы и комментарии. В случайной выборке из 100 интернет-магазинов исследователи нашли 13 чатботов, которые уже получали сведения из отзывов.&lt;br /&gt;&lt;br /&gt;Авторы не публиковали вредоносный контент на реальных сайтах, поэтому это не доказанная эксплуатация этих магазинов. Но канал для indirect prompt injection уже присутствовал:&lt;br /&gt;&lt;br /&gt;отзыв атакующего → база знаний → контекст модели&lt;br /&gt;&lt;br /&gt;Иерархия инструкций работает только тогда, когда приложение сохраняет границы между ролями.&lt;br /&gt;&lt;br /&gt;Можно месяц укреплять системный промпт, а затем превратить user в system одним полем JSON.&lt;br /&gt;&lt;br /&gt;Классический AppSec. Просто теперь с токенами.&lt;br /&gt;&lt;br /&gt;#AIxSec #PromptInjection #RAGSecurity #AppSec #AIxSec_Research&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--35-0.jpg" alt="media"/&gt;</description><pubDate>2026-09-04T06:25:29+00:00</pubDate><link href="https://t.me/c/3827191561/35">https://t.me/c/3827191561/35</link></item><item><guid>https://t.me/c/3827191561/34</guid><title>AI уже примеряет одежду по фотографии. Но кто защищает сам AI?  Поговорил с Максимом Сураевым из Lam</title><description>AI уже примеряет одежду по фотографии. Но кто защищает сам AI?&lt;br /&gt;&lt;br /&gt;Поговорил с Максимом Сураевым из Lamoda о безопасности виртуальной примерочной и рисках, которые появляются вместе с генеративными функциями.&lt;br /&gt;&lt;br /&gt;В интервью разобрали:&lt;br /&gt;&lt;br /&gt;• как работает AI примерка одежды в Lamoda&lt;br /&gt;• какие две основные поверхности атаки есть у такого бота&lt;br /&gt;• почему одних фильтров недостаточно для защиты AI&lt;br /&gt;• как техническая проблема может превратиться в репутационный риск для бизнеса&lt;br /&gt;&lt;br /&gt;Получился предметный разговор о том, как запускать AI функции в реальном продукте и учитывать безопасность еще на этапе разработки.&lt;br /&gt;&lt;br /&gt;Смотрите полное интервью 👆&lt;br /&gt;&lt;br /&gt;Какой риск AI сервисов вы считаете самым недооцененным: утечку данных, prompt injection или репутационный ущерб?&lt;br /&gt;&lt;strong&gt;The video is too large.&lt;/strong&gt;</description><pubDate>2026-09-02T13:41:50+00:00</pubDate><link href="https://t.me/c/3827191561/34">https://t.me/c/3827191561/34</link></item><item><guid>https://t.me/c/3827191561/33</guid><title>«У нас стоит антивирус — значит, мы в безопасности».  Обычно эта уверенность живёт ровно до первого </title><description>«У нас стоит антивирус — значит, мы в безопасности».&lt;br /&gt;&lt;br /&gt;Обычно эта уверенность живёт ровно до первого серьёзного инцидента.&lt;br /&gt;&lt;br /&gt;На OFFZONE поговорил с руководителем центра мониторинга «АйТи Новации» Сергеем Шамаевым о том, как выглядит информационная безопасность не в презентациях, а на практике.&lt;br /&gt;&lt;br /&gt;За пять минут успели обсудить:&lt;br /&gt;&lt;br /&gt;— чем занимается SOC из 12 человек и с какими задачами приходят крупные заказчики;&lt;br /&gt;&lt;br /&gt;— почему форензика и offensive security — две стороны одной медали;&lt;br /&gt;&lt;br /&gt;— какие инструменты используются в реальных расследованиях: Volatility, Autopsy и SIEVER;&lt;br /&gt;&lt;br /&gt;— почему компании чаще начинают всерьёз заниматься безопасностью уже после атаки;&lt;br /&gt;&lt;br /&gt;— какие ошибки до сих пор встречаются в инфраструктуре: от надежды на один антивирус до паролей на стикерах;&lt;br /&gt;&lt;br /&gt;— и главный вопрос: действительно ли стоит платить пентестерам за то, чтобы они ломали вашу систему?&lt;br /&gt;&lt;br /&gt;Спойлер: стоимость пентеста почти всегда несопоставима со стоимостью настоящего инцидента.&lt;br /&gt;&lt;br /&gt;Получился короткий, но максимально практический разговор о SOC, форензике и реальном состоянии корпоративной безопасности.&lt;br /&gt;&lt;br /&gt;Сергей ведет свой тгк и пишет про кейсы работы в SOC, ссылочка: &lt;a href="https://t.me/nedobrysoc"&gt;https://t.me/nedobrysoc&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;Смотрите интервью 👇&lt;br /&gt;&lt;br /&gt;#interview #AIxSec #Security #SOC&lt;br /&gt;&lt;strong&gt;The video is too large.&lt;/strong&gt;</description><pubDate>2026-08-31T07:51:30+00:00</pubDate><link href="https://t.me/c/3827191561/33">https://t.me/c/3827191561/33</link></item><item><guid>https://t.me/c/3827191561/32</guid><title>Агент сказал одно. Процесс сделал другое  Защита AI-агента часто заканчивается перед вызовом инструм</title><description>&lt;strong&gt;Агент сказал одно. Процесс сделал другое&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Защита AI-агента часто заканчивается перед вызовом инструмента: проверили название, аргументы и решение модели — можно выполнять.&lt;br /&gt;&lt;br /&gt;Но всё это описывает только намерение агента, а не фактическое поведение процесса.&lt;br /&gt;&lt;br /&gt;Авторы свежей работы &lt;a href="https://arxiv.org/abs/2607.25297"&gt;Hybrid Analysis for Secure MCP Tool Use in LLM Agents&lt;/a&gt; предлагают MTGuard — систему, которая проверяет весь жизненный цикл MCP-вызова:&lt;br /&gt;&lt;br /&gt;до выполнения → во время → после&lt;br /&gt;&lt;br /&gt;До запуска MTGuard анализирует параметры вызова. Во время выполнения собирает события процессов, файловой системы и сети. После сравнивает заявленное действие с тем, что инструмент сделал в действительности.&lt;br /&gt;&lt;br /&gt;Например, агент вызывает безопасный navigate(), но на уровне MCP-хоста команда подменяется на чтение&lt;em&gt; /etc/passwd&lt;/em&gt;. Проверка аргументов видит обычную навигацию, а runtime-мониторинг — уже реальный процесс.&lt;br /&gt;&lt;br /&gt;В экспериментах MTGuard обнаружил 116 из 240 небезопасных вызовов: 48,3%.&lt;br /&gt;&lt;br /&gt;Но 48,3% это detection rate, а не доказанная доля предотвращённых атак. В эксперименте решения защиты не блокировали выполнение. Кроме того, post-execution-проверка может скрыть опасный результат от агента, но уже не отменит совершённый сайд эффект.&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;Есть и цена: два LLM-аудита добавляли в среднем около 12,39 секунды к каждому вызову инструмента.&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Поэтому MTGuard не готовая серебряная пуля (опять эти разговоры про серебряную пулю…), а хорошая демонстрация более важного принципа: безопасность AI-агента нельзя строить только вокруг промптов и аргументов.&lt;br /&gt;&lt;br /&gt;#AIxSec #AgentSecurity #MCP #RuntimeSecurity #AIxSec_Research #Research #SecurityinAI&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--32-0.jpg" alt="media"/&gt;</description><pubDate>2026-08-29T15:15:42+00:00</pubDate><link href="https://t.me/c/3827191561/32">https://t.me/c/3827191561/32</link></item><item><guid>https://t.me/c/3827191561/31</guid><title>Ваш guardrail показал 1% ASR. Значит ли это, что он защищает LLM?  Нет. Возможно, вы просто тестиров</title><description>&lt;strong&gt;Ваш guardrail показал 1% ASR. Значит ли это, что он защищает LLM?&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Нет. Возможно, вы просто тестировали его на атаках, которые он уже умеет блокировать.&lt;br /&gt;&lt;br /&gt;Решил немного углубиться и описать подробнее мат. модель и свои мысли по поводу статьи &lt;strong&gt;The Attacker Moves Second&lt;/strong&gt;, про которую писал чуть раньше. После адаптации атак под конкретную защиту ASR для большинства систем превысил 90%.&lt;br /&gt;&lt;br /&gt;Ключевое слово здесь: &lt;strong&gt;адаптация&lt;/strong&gt;.&lt;br /&gt;&lt;br /&gt;Статический тест отвечает на вопрос:&lt;br /&gt;&lt;br /&gt;&lt;em&gt;Работает ли защита против заранее выбранного набора атак?&lt;/em&gt;&lt;br /&gt;&lt;br /&gt;Security evaluation должна отвечать на другой:&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;Сможет ли атакующий обойти защиту, если знает её устройство, наблюдает ответы и изменяет стратегию после каждой попытки?&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Компактно идею можно записать так:&lt;br /&gt;&lt;br /&gt;a* = arg max S(D(a, x), g), где a ∈ A(K, Q, B)&lt;br /&gt;&lt;br /&gt;Здесь:&lt;br /&gt;&lt;br /&gt;• D — вся защищённая система, а не только LLM;&lt;br /&gt;• a — кандидат атаки;&lt;br /&gt;• x — исходная задача или контекст;&lt;br /&gt;• g — цель атакующего;&lt;br /&gt;• K — знания атакующего о защите;&lt;br /&gt;• Q — доступная обратная связь;&lt;br /&gt;• B — вычислительный и query budget;&lt;br /&gt;• S — оценка достижения цели.&lt;br /&gt;&lt;br /&gt;То есть a* — атака с наибольшим скором среди стратегий, доступных атакующему при заданных знаниях, обратной связи и бюджете.&lt;br /&gt;&lt;br /&gt;Это моя компактная формализация постановки, а не дословная формула авторов.&lt;br /&gt;&lt;br /&gt;Если статический набор A₀ входит в пространство доступных адаптивных стратегий A(K, Q, B), то при одинаковых задачах и scorer:&lt;br /&gt;&lt;br /&gt;max S(D(a, x), g), a ∈ A(K, Q, B)&lt;br /&gt;≥&lt;br /&gt;max S(D(a, x), g), a ∈ A₀&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;Другими словами, лучший адаптивный атакующий не должен быть слабее лучшей атаки из фиксированного набора.&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Поэтому результат на статическом датасете в лучшем случае &lt;strong&gt;нижняя оценка возможностей атакующего&lt;/strong&gt;, а не доказательство робастности (устойчивости).&lt;br /&gt;&lt;br /&gt;&lt;u&gt;Главный вывод для меня:&lt;/u&gt;&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;ASR без описания threat model, доступа атакующего, бюджета и способа адаптации является почти бессодержательной метрикой.&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Эмпирический тест не может доказать, что защита надёжна. Он может только попытаться её сломать и не найти атаку в рамках явно заданной модели угроз.&lt;br /&gt;&lt;br /&gt;&lt;a href="https://arxiv.org/abs/2510.09023"&gt;Статья&lt;/a&gt; • &lt;a href="https://www.usenix.org/conference/usenixsecurity26/presentation/nasr"&gt;USENIX Security ’26&lt;/a&gt;&lt;br /&gt;&lt;br /&gt;#AIxSEC #LLMSecurity #PromptInjection #SecurityinAI #research&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--31-0.jpg" alt="media"/&gt;</description><pubDate>2026-08-27T17:12:58+00:00</pubDate><link href="https://t.me/c/3827191561/31">https://t.me/c/3827191561/31</link></item><item><guid>https://t.me/c/3827191561/29</guid><title>Цифровой кофепоинт Яндекса  Самое ценное, что можно получить от работы в большой компании - это не с</title><description>&lt;strong&gt;Цифровой кофепоинт Яндекса&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Самое ценное, что можно получить от работы в большой компании - это не строчка в резюме, новый грейд или опыт с очередным модным стеком.&lt;br /&gt;&lt;br /&gt;&lt;em&gt;Это люди, нетворк и чужие мысли.&lt;/em&gt;&lt;br /&gt;&lt;br /&gt;Иногда одна случайная беседа на кухне даёт больше, чем несколько вечеров чтения статей. Кто-то расскажет, как устроена система, которую ты раньше видел только снаружи. Кто-то поделится провалом, который сэкономит тебе полгода собственных ошибок. В этом для меня и заключается ценность сильного профессионального окружения: рядом постоянно находятся люди, которые знают больше тебя в своей области и смотрят на привычные вещи совершенно иначе.&lt;br /&gt;&lt;br /&gt;Коллеги собрали папку с Telegram-каналами ребят из Яндекса. Здесь авторы из разработки, ML, аналитики, продукта, менеджмента, безопасности и других направлений.&lt;br /&gt;&lt;br /&gt;Кто-то публикует технические разборы, кто-то пишет о карьере и управлении, а кто-то делится профессиональными наблюдениями, которые хочется сразу унести в «Сохранённые».&lt;br /&gt;&lt;br /&gt;Советую пробежаться по каналам и найти хотя бы двух-трёх авторов, за ходом мыслей которых вам действительно интересно следить, потому что хороший нетворк начинается не со знакомства. Он начинается с интереса к тому, как думает другой человек.&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;Забрать папку&lt;/strong&gt;&lt;br /&gt;👉 &lt;a href="https://t.me/addlist/KaVv1NTpJKpmYmZi"&gt;https://t.me/addlist/KaVv1NTpJKpmYmZi&lt;/a&gt;</description><pubDate>2026-08-24T17:23:11+00:00</pubDate><link href="https://t.me/c/3827191561/29">https://t.me/c/3827191561/29</link></item><item><guid>https://t.me/c/3827191561/28</guid><title>Меньше битов ≠ больше защиты  Чтобы запустить ML-модель на микроконтроллере, её часто переводят из F</title><description>&lt;strong&gt;Меньше битов ≠ больше защиты&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Чтобы запустить ML-модель на микроконтроллере, её часто переводят из FP32 в INT8 или INT4. Модель становится компактнее и быстрее, а иногда ещё и демонстрирует лучшую устойчивость к adversarial-атакам.&lt;br /&gt;Звучит как бесплатная защита. Но есть нюанс.&lt;br /&gt;&lt;br /&gt;Авторы исследования &lt;a href="https://arxiv.org/abs/2404.05688"&gt;&lt;u&gt;David and Goliath&lt;/u&gt;&lt;/a&gt;⁠ проверили три квантованные TinyML-модели с помощью десяти атак и шести защит. Оказалось, что квантование меняет геометрию модели: градиенты могут исчезать, взрываться или указывать атаке неверное направление.&lt;br /&gt;&lt;br /&gt;&lt;strong&gt;В результате неудачная атака иногда говорит не о реальной защищённости модели, а лишь о том, что выбранный метод плохо работает с квантованной арифметикой.&lt;/strong&gt;&lt;br /&gt;&lt;br /&gt;Поэтому оценивать нужно именно итоговую INT8/INT4-модель, причём не одной атакой: полезны адаптивные, transfer- и black-box-сценарии, а также проверка на реальном устройстве.&lt;br /&gt;&lt;br /&gt;Для меня эта тема не только теоретическая. В нашей с Максимом Князевым статье «&lt;a href="https://st.hse.ru/news/1160854837.html"&gt;Влияние квантования TinyML-моделей на устойчивость аудиосистем персонального интернета вещей&lt;/a&gt;»⁠ мы проверяли распознавание голосовых команд под атакой PGD-40. INT8-QAT сохранил 98,8% точности на чистых данных и 92,2% под атакой, а у INT4 показатели снизились до 49,42% и 47,8% соответственно.&lt;br /&gt;&lt;br /&gt;Квантование отлично экономит память. Но в безопасности экономия битов ещё не означает экономию рисков.&lt;br /&gt;&lt;br /&gt;#AIxSec #TinyML #AdversarialML #MLSecurity #Security #AIxSec_Research&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--28-0.jpg" alt="media"/&gt;</description><pubDate>2026-08-23T06:45:01+00:00</pubDate><link href="https://t.me/c/3827191561/28">https://t.me/c/3827191561/28</link></item><item><guid>https://t.me/c/3827191561/27</guid><title /><description>&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--27-0.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--26-1.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--25-2.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--24-3.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--23-4.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--22-5.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--21-6.jpg" alt="media"/&gt;&lt;br /&gt;&lt;img src="https://tg.davvie.com/static/-1003827191561--20-7.jpg" alt="media"/&gt;</description><pubDate>2026-08-20T15:08:43+00:00</pubDate><link href="https://t.me/c/3827191561/27">https://t.me/c/3827191561/27</link></item></channel></rss>