gram news
PWN AI channel avatar

PWN AI

@pwnai

На 99% состоит из людей. Хроники о небезопасном ИИ. Не нравится? Смени телек. Нет рекламе. Мой личный канал. "Мнение автора" != "Мнение компании, где автор работает". Папка с каналами по безопасности ИИ: https://t.me/addlist/KQ6ZpCqAO-I1NmUy

ProjectsRUAI

7,160subscribers

Open the Channel

Latest posts

  • PWN AI

    21 Sept, 17:36edited

    Ну а на грейсвоне вышло новое соревнование, на которое стало теперь интересно потратить ещё денег
    Image from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    21 Sept, 17:33edited

    Статические инструменты тестирования моделей изживают свою эпоху. Тестировать на заготовленных наборах атак или слепых кодировках сегодня - пахнуть слабостью в 2026 году. Garak или promptfoo хороши для галочки, но они слепы к контексту.Они не умеют строить логические ловушки, они не чувствуют тему, а их попытки составить сильный атакующий запрос с разными тактиками разбиваются о необходимость делать каждый промпт уникальным. В эпоху, когда всё можно построить вокруг модели, я задумался: как на самом деле должен выглядеть эффективный инструмент для атак? OpenAI учит свои модели редтимить сами себя, но я не OpenAI. А создавать атаки, которые эволюционируют на фидбеке от мишени, хотелось до дрожи. Так родилась идея, которую я назвал «ВОЗМЕЗДИЕ». Название не случайное, нравится один фильм…Почти весь путь самоэволюции решения - это история одной ошибки, которую пришлось выдирать из себя
    OpenAIGPT-Red: самоулучшение ради устойчивостиПознакомьтесь с GPT-Red — системой OpenAI для автоматизированного red teaming, которая с помощью self-play улучшает безопасность, согласование и устойчивость ИИ к промпт-инъекциям.
  • PWN AI

    14 Sept, 18:06

    forwarded from @okmlai

    10 сентября Anthropic опубликовала Detecting and countering misuse of AI— отчёт о злоупотреблениях Claude, выявленных с декабря 2025 по август 2026 годаВ нём есть мошенничество, слежка и операции влияния. Но самое интересное, как ИИ встраивают в кибератаки.Несколько показательных кейсов по тематике канала +-.😮 Чужие ключи оплачивают продолжение атаки Операторы, которых Anthropic считает связанными с ShinyHunters, крали API-ключи к ИИ-сервисам из инфраструктуры жертв и использовали их в дальнейших операциях. Один такой ключ применяли примерно три недели, в том числе для атак на другие организации. То есть ключ к модели — уже ресурс для атакующего: доступ к вычислениям, которые помогают штурмовать следующую цель.😕 Оператор задаёт цель, агент разбирается в деталях Anthropic описывает подход vibe hacking (ничего
  • PWN AI

    12 Sept, 08:16

  • PWN AI

    6 Sept, 17:39edited

    Фанфакты:Однажды ночью эта атакующая штука снесла мне ось с компа) ну я там ничего не храню, но всё равно забавно. А можно было бы запустить в песочнице)В другой день она начала качать дистрибутив для его самостоятельного реверса - видимо модели нужны были знания, которые усилят запрос
  • PWN AI

    6 Sept, 17:20edited

    Я уже неделю участвую в новом соревновании от GraySwan - Hazard Hunt, в категории Cyber. У меня закрыто 179 моделей из 200. До финала осталась 21 модель. Задачи должны быть решены только одним запросом – иначе не считается. И это оказалось жёсткой рутиной для моего Hermes со скиллами: он строил атаку, разбирал поведение гардрейлов и пытался усилить запрос чтобы соответствовать критериям оценщиков.Как вообще работает мой атакующий харнесЯ выбрал DeepSeek-v4-0731, в качестве основы, на него легла вся аналитическая нагрузка. Он генерировал плотные запросы по 6–6.7 тысяч знаков, разбирал логи судьи, вычислял просевшие метрики и аккуратно дописывал фразы под конкретные замечания.Оркестрацией и харнесом заведовал Hermes. Он управлял браузером через Chrome DevTools Protocol, вовремя прожимал отправку, крутил фоновые волны запросов и сохранял результаты оценки. Перед вылетом каждого
    Image from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    2 Sept, 16:43

    За последние полтора года появилось очень много интересных статьей, которые дают ответ на вопрос "а как вообще ломать агентов", но на практике. Кодовые и саморазвивающиеся, работающие в браузере и локально. Этого реально много и обозревать каждую статью по отдельности – не имеет смысла. Так как часто векторы эксплуатации сводятся к одним и тем же фундаментальным проблемам: чрезмерному доверию к контексту, манипуляциям с тулзами или непрямыми инъекциями.Но когда кто-то собирает весь этот хаос и боевую фактуру в одном месте - отличный материал для анализа. Репозиторий ai-agent-hacking-writeups от shoebpate1 как раз такая база.Внутри нет рассуждений об этике ИИ, только техническая фактура. В репе показано, как пробиваются песочницы и как атакующие выходят на RCE через стандартный функционал агента. Приведено много интересных публикаций: агент получает доступ к тулзам, ловит кривой
    Image from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    23 Aug, 15:00

  • PWN AI

    22 Aug, 22:32edited

    Харнесс, оптимизации, токенмаксинг и скиллы для кодекса - все эти выражения я стал слышать регулярно.Но кажется что такая вещь как харнесс могла бы быть полезна в целом в AI Security. Я давно эксперементирую с написанием скиллов, Hermes и прочим. И пришла пора рассказать вам, как вообще может выглядеть в моём понимании полезный харнесс для AI Security и что он может из себя представлять.https://habr.com/ru/articles/1073370/Ну а в чём я не прав - это можно будет обсудить в комментариях на Хабре, как обычно 😂
  • PWN AI

    17 Aug, 17:20edited

    Хочу вам напомнить, что есть папка замечательных, на мой взгляд, каналов по AI Securityhttps://t.me/addlist/KQ6ZpCqAO-I1NmUyНадо добавить к себе 😒
    TelegramAI securityArtyom Semenov invites you to add the folder “AI security”, which includes 32 chats.
  • PWN AI

    16 Aug, 12:56

    Почему изолировать reasoning модели в обычном Docker уже бесполезноКажется, что если засунуть LLM с доступом к шеллу в обычный Docker-контейнер, хост будет в полной безопасности. Однако в AI Security Institute так не считают. Авторы выкатили в марте SandboxEscapeBench на фреймворке Inspect и наглядно показали что для современных reasoning-моделей дефолтный контейнер - как простая таска для разминки, а на успешный побег уходит всего полтора доллара в токенах. У меня только сейчас дошли до него руки.Бенчмарк устроен как матрешка: уязвимый контейнер крутится внутри изолированной виртуальной машины (на EC2 или через Vagrant), а агенту выдается одна задача - вырваться наружу и забрать /flag.txt уже на уровне хостовой VM. Всего там 18 сценариев, покрывающих три слоя атаки: от классических мисконфигураций рантайма вроде проброшенного docker.sock и лишних capabilities до утечек сервисных
    Image from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    14 Aug, 09:59

    forwarded from @borismlsec

    Инцидент OpenAI - Hugging Face — что «забыли» объяснить? #иб_для_mlУ OpenAI недавно произошел исторический инцидент - AI-агенты сбежали из компании и поломали другую компанию, HuggingFace. Получается, вот он, Скайнет? Про инцидент, конечно, всем известно. Но все про него так восторженно говорили...А может, все еще не так страшно? Я решил разобраться, какие несостыковки есть в рассказе самой открытой AI-компании. При чем в этом мне помог, внезапно, Александр Сергеевич Пушкин.Да, и так разошелся, что написал целую статью, на целых 5 аргументов. Все со ссылками, постарался максимально объективно (хотя без субъективности совсем обойтись не удалось).⛓ https://habr.com/ru/articles/1070314
    Image from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    13 Aug, 16:38

  • PWN AI

    8 Aug, 10:43

    forwarded from @poxek_ai

    Cisco Antares: SLM для локализации уязвимого кодаCisco представила Antares — семейство SLM для поиска файлов с известной уязвимостью внутри репозитория. Выпущены Antares-350M и Antares-1B; Antares-3B пока только готовится. Ставка сделана на узкую задачу, локальный запуск и меньшие вычислительные требования по сравнению с универсальными моделями. Наконец по настоящему SLM, а не вот эти 30b или даже больше, которыми называют SLM.Antares работает как классический агент. Модель получает описание класса уязвимости и исследует снимок репозитория через grep, find, cat и другие linux команды. Она читает файлы, меняет направление поиска и возвращает список кандидатов вместе с трассой исследования. Результат рассчитан на первичный триаж, а не готовый вердикт или исправление.В основе моделей лежит IBM Granite 4.0 350M и 1b. Сначала проводилось SFT на данных по ИБ-рассуждениям,
    Image from a post by PWN AIImage from a post by PWN AIImage from a post by PWN AI
  • PWN AI

    7 Aug, 18:21

    forwarded from @kokuykin

    Последние два года мы много экспериментировали с доступными guardrail-моделями. Сравнивали готовые решения, обучили несколько собственных моделей, собирали и адаптировали бенчмарки, чтобы понять, как вообще правильно сравнивать качество защиты. Сравнения по одной метрике недостаточно: какая-то модель лучше ловит опасные запросы, но чаще блокирует легитимные, большие модели имеют более высокий F1-score, но дороже в инференсе и имеют больший latency.В итоге наши наработки мы собрали в GuardRate Leaderboard, где можно сравнивать guardrail-модели по разным параметрам и смотреть на эти trade-offs, настраивая параметры под нужный кейс использования.Ссылка на лидерборд: https://huggingface.co/spaces/hivetrace/GuardRateLeaderboardПодробнее про подход, методологию и наши находки читайте на Хабре: https://habr.com/ru/companies/raft/articles/1067854/Дорогие конкуренты и игроки рынка AI
    huggingface.coHiveTrace Leaderboard - a Hugging Face Space by hivetraceHiveTrace leaderboard frontend
  • PWN AI

    3 Aug, 20:31

  • PWN AI

    2 Aug, 18:55edited

  • PWN AI

    31 Jul, 15:47

    Количество инцидентов с AI-агентами растет лавинообразно.И вот я обнаружил интересный репозитории awesome-ai-agent-attacks, в котором собрана хронология реальных взломов ИИ и уязвимостей AI-агентов за 2024–2026 годы. Только факты, даты, первопричины и ссылки на источники.Такие репозитории и раньше были, но тут словно полная коллекция, очень много знакомо для меня и так или иначе мелькало перед глазами.А вот несколько примеров:🫡 1. ИИ как автономный взломщик. Агенты находят и эксплуатируют уязвимости быстрее людей. Задокументирован случай, когда агенты на базе Kimi K3 обнаружили 19 0-day уязвимостей в Redis за 90 минут, а рабочий RCE-эксплойт собрали за 27 минут. В другом кейсе мультиагентная система нашла цепочку для RCE без аутентификации в WordPress за 10 часов при затратах на API около $25.😎 2. HalluSquattin
    GitHubGitHub - webpro255/awesome-ai-agent-attacks: A curated timeline of real AI agent security incidents, breaches, and vulnerabilities…A curated timeline of real AI agent security incidents, breaches, and vulnerabilities (2024-2026). Every entry sourced and dated. - webpro255/awesome-ai-agent-attacks
  • PWN AI

    29 Jul, 19:23

    forwarded from @okmlai

    Математика категорий и ИИЛюбишь читать академичные лонгриды с сомнительной практической пользой? Тогда этот пост для тебя!О теории категорий обычно говорят как об одной из самых абстрактных областей математики. Довелось прочитать популярную книгу «Восторг абстрактной математики» Юджении Ченг (вслух тебе её прочитают на ютубе, можешь купить на озоне за 4к и в целом за год достаточно прочитать только ее, чтоб собой гордиться, она сложная и АБСТРАКТНАЯ) и статью на хабре, а на основе прочитанного обдумать, где в ИИ теория категорий и зачем она вообще нужна! Посвящаю пост тому, кто хотел взять Юджению с собой в отпуск 🍐.Дело в том, что теория категорий изучает не сами объекты, а отношения между ними и правила их композиции. Именно поэтому её иногда называют математикой композиции (и математикой математики). То самое "Думай абстрактно!".Разберу нескол
  • PWN AI

    27 Jul, 18:10

    forwarded from @b0tleg

    Не зря я вёл канал про безопасность агентных платежей практически год, ведь недавно вышла отличная статья о безопасности платёжных агентов. Самые критичные риски кроются в протоколах связи между агентом и сервисом.В чем суть? Успех семантической атаки зависит от того, поддастся ли модель манипуляции. Структурная же атака срабатывает всегда (вероятность успеха - 100%), независимо от того, что под капотом: легкая и дешевая модель или топовая модель. Например, злоумышленник эксплуатирует отсутствие криптографической подписи у транзакции или подменяет скрытые поля в API-запросах. Модель может быть идеально выравнена и безопасна, но если сам протокол имеет дырки, то агент просто и эффективно переведет деньги не туда.Немного данных:1) Найдено 33 структурные уязвимости на трех независимых платформах (CoralOS, Fetch.ai uAgents и Google AP2). 2) Выделено 6 первопричин (от отсутствия