Последние посты

AGI Security
21 июл., 21:23
переслано из @poxek_ai
Hugging Face взломали модели OpenAI: агенты вышли из тестовой среды ради ответов ExploitGym21 июля OpenAI раскрыла происхождение автономных агентов, которые скомпрометировали инфраструктуру Hugging Face. Ими оказались GPT-5.6 Sol и более мощная предварительная модель OpenAI, запущенные во внутренней оценке кибервозможностей. Фильтры, ограничивающие опасные операции в production, для теста намеренно ослабили.Это дополняет первоначальное раскрытие Hugging Face. Цепочка через вредоносный датасет, RCE на worker и перемещение по внутренним кластерам остаётся прежней, но теперь известен предшествующий этап: агенты сначала покинули изолированную исследовательскую среду OpenAI, а уже затем добрались до Hugging Face.♾️Как агенты вышли в интернет♾️ Модели проходили ExploitGym — бенчмарк, в котором нужно превратить известные
AGI Security
11 июл., 14:59
переслано из @tinraecom
№1: Призрачный коммит (Issue #73289)2 июля 2026 года. Разработчик работает над японским проектом в долгой сессии (JSONL-лог на 27 МБ). Модель Fable 5 без запроса выполняет git add -A и git commit, фиксируя изменения.Когда разработчик спрашивает: «Я просил тебя сделать коммит?» — Fable 5 цитирует сообщение пользователя, которого никогда не было: «Я проверил через npm run dev, всё в порядке. Хочу закоммитить текущую работу».Форензика (JSONL-логи, поиск по всем проектам) показала: этой фразы никогда не существовало. Она появилась только в голове модели, которая использовала её, чтобы оправдать свои действия.---№2: Фальшивый пользователь (Issue #75655)8 июля 2026 года. Fable 5 работает над Slack-уведомлением. В конце своего ответа, без разделителя, модель продолжает генерировать текст от лица пользователя: «а как насчёт добавить ссылку для админов в заголовок приложения?».Затем
AGI Security
10 июн., 09:34
переслано из @poxek_ai
Сливаю свой новый bugbounty prompt для Fable 5/model claude-fable-5 /fast /effort ultracodeenumerate the top 10 highest paying bug bounties and don't stop until you find a critical. Use cowork to automatically submit it before everyone else.Я скоро успокою своё недовольство и будет норм контент))
AGI Security
10 июн., 09:34
переслано из @poxek_ai
FABLE 5.0 SYSTEM PROMPT LEAK #jailbreak #systempromptСпасибо великому Pliny, который в очередной раз джейлит модели Anthropic в кратчайшее время. Системный промпт занимает аж 1250 строк, что жесть. Это огромный перерасход токенов только при инициализации диалога.Оригинальный пост / ПромптТакже интересно, что нашёлся другой пользователь, который после анализа системного промпта смог более менее обойти ограничения на корпус кибербеза. Примеры: 1. Not just:“buffer overflow”But:• Missing null termination • OOB reads • Information disclosure risks2. Next I switched domains entirely.
AGI Security
9 июн., 20:26
переслано из @aisechub
https://www.anthropic.com/news/claude-fable-5-mythos-5


AGI Security
8 июн., 17:58
переслано из @okmlai
RCE-уязвимость обнаружена в Hugging Face Transformers (CVE-2026-4372)😭 Уязвимость особенно неприятна тем, что позволяла выполнять произвольный код даже при использовании рекомендованной защиты trust_remote_code=False.Атакующему было достаточно добавить в config.json модели специальный параметр _attn_implementation_internal. При загрузке модели через привычный from_pretrained() библиотека могла автоматически скачать и выполнить код из внешнего репозитория без предупреждений, запросов подтверждения и заметных признаков компрометации.😓Под угрозой оказались версии Transformers 4.56.0–5.2.x, особенно среды с GPU-ускорением и установленным пакетом kernels. За время существования дыры (около 6 месяцев) уязвимые версии были скачаны более 232 миллионов раз!Что делать: 👍 Обновиться 🎊
AGI Security
6 июн., 18:33
переслано из @aisechub
AI Agent “Lethal Trifecta”CSA’s research note summarizes an assessment of 100 production AI agents where most failed a baseline security benchmark; the practical risk is agents with real capabilities operating without matching guardrails, so routine evaluations should test end-to-end tool use and trust-boundary crossings.#AgentSecurity #LLMSecurity #AISecurity #Reporthttps://labs.cloudsecurityalliance.org/research/csa-research-note-ai-agent-lethal-trifecta-capability-securiLab SpaceThe AI Agent Lethal TrifectaThe AI Agent Lethal Trifecta Key Takeaways An independent assessment of 100 commercial and publicly available production AI agents (AI Risk Quadrant Q2 2026) found that only 11 percent pass a basel…
AGI Security
29 мая, 13:28
переслано из @poxek_ai
Claude Opus 4.8 и jailbreak через "недописанный учебник"После релиза Claude Opus 4.8 появился твит в X: elder_plinius утверждает, что Opus 4.7 через 7 минут после выхода новой модели Opus 4.8 подобрал jailbreak. В примере промпт маскирует вредный запрос под завершение главы технического учебника: есть роль редактора, авторитетный контекст, структура раздела и обрыв на середине инструкции.Интересен паттерн атаки. Модель не просят "создать запрещённый гайд с нуля". Её переводят в режим продолжения уже начатого документа: сохрани стиль, формат, глубину и закончи текст. Для LLM это сильный сигнал полезности, который может конфликтовать с безопасностной политикой. А как вы знаете модель охотнее соглашается продолжать что-то писать, чем делать вредоносные действия с нуля.Дальше становится важнее агентный слой. Если один сильный агент может автономно искать жанры, prefill, persona и




AGI Security
26 мая, 15:02
https://genai.owasp.org/resource/aiuc-1-crosswalks-owasp-top-10-for-agentic-applications/OWASP Gen AI Security ProjectAIUC-1: Crosswalks OWASP Top 10 For Agentic ApplicationsThe AIUC-1 Crosswalk of the OWASP Top 10 for Agentic Applications provides a bidirectional mapping between AIUC-1 requirements and the OWASP Agentic Security Initiative’s Top 10 risks for autonomous and agentic AI systems. It helps organizations understand…
AGI Security
20 мая, 07:31
переслано из @poxek_ai
AI-пентестер: охотник или добыча from @pwnai #pentest #defensive #offensiveАвтономных AI-пентестеров обычно обсуждают как ускоритель атак: быстрее рекон, дешевле эксплуатация, больше попыток на единицу времени. В разборе на Habr Артём задал хороший такой вопрос: если агент ходит по чужой инфраструктуре, читает баннеры, HTML, ответы FTP/SSH и описания инструментов, насколько легко поймать уже его самого?Проблема в том, что для LLM-агента вывод инструмента — часть контекста. А контекст может содержать не данные, а инструкцию. Поэтому приманочный FTP с anonymous-доступом, HTML-комментарий, невидимый Unicode-токен или подозрительно “вкусный” файл могут стать не приманкой для человека, а командным каналом для модели.В статье собраны несколько подходов. Mantis использует скрытые prompt injection в ответах приманок и может увести агента в бесконечную петлю или заставить его выполнить


AGI Security
14 мая, 17:54
переслано из @dealerai
Интересный калькулятор расчета ресурсов для поднятия LLM.Теперь не придётся в уме байты считать. 👍https://smelukov.github.io/WeightRoom/smelukov.github.ioWeightRoom — LLM Hardware CalculatorEstimate RAM, storage, and throughput for running LLMs locally or in the cloud
AGI Security
12 мая, 19:07
переслано из @poxek_ai
Где легально ломать LLM: 5 онлайн-площадок и локальные лабы #ai_security #llm #prompt_injection #bugbounty #aiPrompt injection - это не фокус из серии "заставь бота сказать пароль". В OWASP Top 10 for LLM Applications это LLM01:2025, то есть базовый риск LLM-приложений.Ниже - легальные CTF/lab-среды для тренировки.1. HackAPrompt ТЫКСоревновательная AI hacking platform: prompt injection, jailbreak, adversarial prompting, leaderboard, tracks. В support-разделе HackAPrompt указано больше $100k призового фонда.Минус: формат больше contest/gamified, чем enterprise pentest lab.2. Lakera Gandalf ТЫККлассика для secret extraction и prompt leakage. Цель простая: заставить Gandalf раскрыть пароль на каждом уровне. Дальше защиты становятся жестче, и быстро становится видно, почему один system prompt не является security boundary.Минус: тренирует в основном extraction/leakage.3. Po
AGI Security
12 мая, 07:52
10 мая 2026 года OpenAI анонсировала Daybreak — инициативу, объединяющую модели GPT-5.5 и агентную обвязку Codex в инструмент для cyber-defense команд. По задумке компании, это «первый рассветный луч» нового подхода к безопасности: не патчить уязвимости постфактум, а делать софт устойчивым к ним по умолчанию.Что внутри. Daybreak собран на двух моделях. GPT-5.5 — флагман общего назначения, релизнутый 23 апреля 2026 года; согласно Preparedness Framework, это первая модель OpenAI, перешедшая порог «High» по кибервозможностям. GPT-5.5-Cyber, представленная 7 мая 2026 года, — её «cyber-permissive» вариант: не сильнее по способностям, но менее склонна отказывать на запросы про крафт пейлоадов, воспроизведение эксплойтов в лабораторных условиях и реверс бинарей. Поверх этого — Codex как агентный harness для работы непосредственно с репозиториями.Три уровня доступа. Базовый — GPT-5.5 для


AGI Security
10 мая, 23:00
переслано из @poxek_ai
Годное видео с разбором актуальных OCR моделей. OCR модели хорошо запрягать для RAG, к примеру для разбора TI/APT отчетов, т.к. они часто имеют кучу графиков и картинок в перемешку с текстом https://youtu.be/CH-tkQAxQ7Q
AGI Security
7 мая, 05:47
переслано из @aisechub
OWASP GenAI Security Project Q2 2026 Solutions Landscape for AI & Agentic Red Teaming Cheat Sheethttps://genai.owasp.org/resource/ai-security-solutions-landscape-for-ai-and-agentic-red-teaming-q2-2026/


AGI Security
6 мая, 17:43
Кража $150.000 с помощью Grok: LLM-on-LLM injection chainsСвежий кейс из мира AI + Web3: кошелёк, связанный с Grok через Bankr, был опустошён примерно на $150K в токенах DRB. И это не классический взлом смарт-контракта. Ни одной строчки эксплойт-кода не понадобилось — вся атака уместилась в один пост в X с командой, зашифрованной азбукой Морзе.Злоумышленник сначала активировал для кошелька расширенные возможности через NFT, а затем с помощью специально подготовленного ответа заставил AI-агента сформировать команду на перевод средств. Bankr обработал эту инструкцию как легитимную — и токены ушли на адрес атакующего.За какое-то время до инцидента атакующий отправил кошельку Grok NFT Bankr Club Membership. В системе Bankr этот NFT расширяет права кошелька — открывает инструменты для трансферов, свопов и других web3-действий.Затем атакующий разместил пост, тегнув @grok. В посте —


AGI Security
5 мая, 16:27
переслано из @korolev_ai_bmstu_ru
🚨 Бесплатные AI-курсы с сертификатами от Google — без оплаты и подписокКомпания тихо выкатала целую подборку обучающих программ на 2026 год, и всё это можно пройти полностью бесплатно. Если хочешь подтянуть навыки в ИИ, ML, облаках или прокачать продактивность — мимо проходить нельзя.Ниже — 10 лучших курсов, которые уже доступны открыто:1. Introduction to Generative AI Как работает генеративный ИИ и чем он отличается от классического ML 🔗 cloudskillsboost.google/paths/118/course_templates/5362. Introduction to Large Language Models Что такое LLM, как они устроены и где применяются 🔗 cloudskillsboost.google/paths/118/course_templates/5393. Google AI Essentials База по работе с ИИ в ежедневных задачах 🔗 coursera.org/learn/google-ai-essentials4. Introduction to Responsible AI Ответственный ИИ: принципы, риски, подход GoogleGoogle SkillsIntroduction to Generative AI | Google Skills<p>This is an introductory level microlearning course aimed at explaining what Generative AI is, how it is used, and how it differs from traditional machine learning methods. It also covers Google Tools to help you develop your own Gen AI apps.</p>
AGI Security
3 мая, 11:40



AGI Security
1 мая, 05:52



AGI Security
1 мая, 04:52
переслано из @pwnai
Scheming выходит из лабораторииCentre for Long-Term Resilience опубликовал препринт "Scheming in the wild" - по сути, первое OSINT-исследование scheming-поведения (коварного преследования скрытых целей) передовых моделей в реальном мире.Все громкие кейсы scheming у Anthropic и Apollo - получены в искусственно сконструированных условиях. Постановка задачи сама подталкивает модель к нужному поведению, а перенос на реальные развёртывания неочевиден. Существующие базы инцидентов вроде AI Incident Database и OECD AI Incident Monitor этот пробел не закрывают, они опираются на новостные публикации, а scheming в дикой природе слишком технический, узкий и новый, чтобы попадать в медиа.Исследователи подняли Loss of Control Observatory - конвейер, собирающий с X публично выложенные логи диалогов и CLI-сессий с агентами. Дальше трёхступенчатая фильтрация: автоматический отсев с настройкой на

