gram news
Душный NLP channel avatar

Душный NLP

@stuffynlp

Разборы свежих статей от NLP-специалистов Яндекса. Подробно, полезно, с душ(нот)ой. Вопросы и предложения > @yandex_ml_brand

ProjectsRUAI

6,660subscribers

Open the Channel

Latest posts

  • Душный NLP

    11 Sept, 12:15

    Дистилляция DeepSeek-R1Сегодня разберём, как DeepSeek-R1 на 671B параметров дистиллировали в модель на 32 миллиарда параметров. Зачем вообще это нужно? Вышедшая в сентябре 2024 года o1 доказала, что test-time scaling работает — если дать модели подумать, то она даст более качественный ответ. Однако тогда пользователю не показывали сырую цепочку рассуждений, а особенности метода не раскрывали. Было непонятно, как это работает, хотя догадки имелись: например, использование process-reward-модели и поиск по дереву.Но эксперименты DeepSeek показали, что дело совсем не в них. Компания выложила технический отчёт, в котором раскрыла секрет. В работе рассматривают три модели: R1-Zero, R1 и R1-Distill. О первых двух мы подробно писали вот тут, а сегодня речь пойдёт о третьей модели.Всего выложили шесть моделей — от 1,5В до 70В параметров на базе Qwen2,5 и Llama3. Все они без RL,
    Image from a post by Душный NLPImage from a post by Душный NLP
    1,630157331Open in Telegram
  • Душный NLP

    3 Sept, 11:15

    Loop the Loopies!Сегодня обсудим статью, которая посвящена моделям Loopies, построенным на шеринге параметров между разными слоями.Обычно у трансформерных моделей и свёрточных нейросетей отдельные параметры на каждом блоке, благодаря чему объём вычислений и число параметров масштабируются с глубиной. Это даёт гибкость — каждый блок может выполнять специфические задачи. Но при этом с ростом числа слоёв растёт и количество параметров, а значит, модель становится дороже хранить.Выходом из этой ситуации может стать переиспользование весов по несколько раз за форвард — шеринг параметров. Так не нужно хранить много параметров, однако блок может принимать распределение данных с разной глубины, что усложняет задачу оптимизации.Перспективность шеринга первым доказал метод ALBERT. В нём было два механизма: факторизация матрицы эмбеддингов и переиспользование одного трансформенного блока
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,560183211Open in Telegram
  • Душный NLP

    20 Aug, 12:20

    Context-1 — поисковый агент, который умеет избавляться от лишнего. Часть 2/2Продолжаем изучать агент Context-1. В первой части мы рассмотрели, что это вообще такое и какие задачи перед собой ставили авторы. А в этой части поговорим о метриках и обучении.Для оценки качества ответа авторы предлагают использовать четыре метрики: Final answer found (смогла ли модель найти документ с правильным ответом в выдаче), Recall (доля релевантных документов, которые выбрала модель, от общего числа релевантных документов), Precision (число релевантных документов, которые модель отвергла) и FB (среднее гармоническое Recall и Precision; идея авторов в том, чтобы штрафовать модель за отбор нерелевантных документов только под конец обучения). Также предлагают рассматривать Trajectory recall, оценивая качество траекторий и поощряя модель за отбор нужных документов и не награждая чрезмерно за случайное
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,9608421Open in Telegram
  • Душный NLP

    13 Aug, 11:41edited

    Context-1 — поисковый агент, который умеет избавляться от лишнего. Часть 1/2Авторы сегодняшней статьи заявляют следующую проблему. Когда агент ищет что-то в поиске, то нерелевантные страницы, выданные браузером, всё равно остаются в контексте агента. Чтобы справиться с этим, контекст можно обрезать или суммировать.Ещё одно весьма перспективное направление в этой области — self-editing context, при котором модель сама определяет, что ей нужно для решения задачи и может отбрасывать бесполезные документы. Этот подход авторы статьи и берут за основу своего субагента Context-1, построенного на модели в 20B параметров.В его арсенале есть четыре инструмента. Первый, search_corpus(query), позволяет оценивать релевантность документа: отбирается 50 документов, ранжируются, самые подходящие отправляются модели в рамках доступного бюджета токенов. Инструмент grep_corpus(pattern) проводит
    3,1006531Open in Telegram
  • Душный NLP

    6 Aug, 12:28

    Как агенты оценивают собственный успехПредставим ситуацию: инженеру нужно починить баг в сервисе аутентификации с помощью кодового агента. До начала работ агент сообщает, что вероятность успеха — 72%. По ходу работы меняет мнение на 78%, после всех изменений — 92%, а какой-нибудь AI-ревьюер пророчит положительный результат с вероятностью 85%. Однако по итогу патч, сделанный агентом, не работает — то есть прогнозы оказались неверны. Сегодняшняя статья о попытках избежать подобного.Авторы вводят понятие agentic uncertainty — это оценка агентом вероятности, что другой агент на той же самой модели решит задачу. С этим понятием рука об руку идёт ещё одно — probability that I succeed (P(IS)), которое включает умения и знания, необходимые для решения задачи. Это целая траектория, так что P(IS) нельзя заложить в веса модели.В работе ставили эксперименты на 100 задачах из SWE-bench Pro.
    Image from a post by Душный NLPImage from a post by Душный NLP
    3,4209831Open in Telegram
  • Душный NLP

    31 Jul, 08:42

    AgentFold — метод управления контекстом для агентов на длинных задачахНа длинных сценариях поиска и анализа веб-агенты либо хранят слишком много сырой информации, либо слишком часто её суммаризируют, что забивает контекст. Авторы сегодняшней статьи предлагают метод AgentFold (GitHub), призванный решить эту проблему, сделав память агента динамической и управляемой самим агентом.Сейчас в веб-поиске используются два подхода. Первый — это ReAct, при котором все действия и решения конкатенируются в конец контекста. Благодаря этому ничего не теряется, но и контекстное окно забивается очень быстро. Второй подход — суммаризация на каждом шаге, однако при этом какая-то часть информации неизменно теряется.Ключевая идея AgentFold — создание активного и динамически пересчитываемого контекста для каждого следующего шага. То есть агент самостоятельно выбирает, что нужно запомнить точно, а что
    Image from a post by Душный NLPImage from a post by Душный NLP
    3,15010932Open in Telegram
  • Душный NLP

    21 Jul, 09:12

    Asynchronous Reasoning: Training-Free Interactive Thinking LLMsСегодня поговорим о статье, в написании которой принимали участие инженеры Яндекса. Публикация посвящена асинхронному ризонингу, а в её основе лежит метод, описанный в работе Hogwild! Inference: Parallel LLM Generation via Concurrent Attention, поэтому сперва — кратко о ней.Это тоже статья от Yandex Research, а также от HSE и IST Austria. Авторы поставили перед собой задачу ускорить инференс с помощью параллельной генерации. Для этого ввели понятие Cash Blocks. Есть блок common cash, где находится общий промпт (например, решить какое-либо уравнение), и есть блоки «рабочих» (workers) — других потоков генерации той же LLM, которые выполняют задачу, синхронизируясь через KV-кэш. В статье эти блоки называются Алиса и Боб.Для генерации токена Алисы нужно, чтобы блоки стояли в порядке common-Bob-Alice, а для Боба —
    2,830file1332Open in Telegram
  • Душный NLP

    17 Jul, 09:40

    Тренды из мира бенчмарков на ICML 2026 [2/2]SWE-rebench V2: Language-Agnostic SWE Task Collection at ScaleРебята из Nebius расширили свой SWE-rebench на новые языки: сфокусировались на масштабируемости и пригодности для сбора RL-лёрна. Две ключевые части пайплайна: сборка окружения под каждый репозиторий и отбор задач для тестов.Окружение собирают собственным интерактивным агентом. Он читает README или конфиги репозиториев, пробует ставить зависимости и запускать тесты, а потом чинится по логам ошибок. Завершить цикл удалось только для 20% проектов.Для отбора задач весь набор тестов несколько раз прогоняли на версии до фикса (тесты падают) и после патча-решения (проходят). Оставили только те, где хотя бы один тест уверенно перешёл из fail в pass.Кроме этого, ребята разобрали траектории фронтир-моделей на 300 задачах. По фейлам составили таксономию типичных проблем, связанных с
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    4,170108711Open in Telegram
  • Душный NLP

    17 Jul, 09:40

    Тренды из мира бенчмарков на ICML 2026 [1/2]Работ о бенчмарках на ICML традиционно много. По сравнению с прошлым годом, в 2026 стало заметно больше бенчей для агентов. А ещё начали чаще встречаться работы из академии.Объяснение простое. Корпорации вкладывают много сил во внутренние бенчи: делают сами, покупают их у data-labeling-компаний (например, Surge, Mercor, Handshake AI, Toloka) — и, как следствие, такие бенчи редко опенсорсят.Остальные бенчмарки часто делаются ощутимо меньшими ресурсами. И, как следствие, страдают от типичных проблем:• мало человеческой верификации данных, • качество judge'ей-верификаторов редко полноценно исследуется, • плохо оценивается качество пар запрос + ground-truth-ответ, сгенерированных LLM, • редко проверяется контаминация, хотя бенчи собираются из открытых источников.Авторы постеров, вошедших в подборку, отметили, что подготовка одного бенча
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,2207421Open in Telegram
  • Душный NLP

    16 Jul, 09:57

    ICML 2026 — личные впечатленияКонференция закончилась, но говорить о ней можно ещё долго. Сегодня личными впечатлениями с нашим каналом поделился старший разработчик команды инфраструктуры обучения Alice AI Владислав Тыцкий.Конференция ощущалась очень масштабной: много людей, огромные залы для докладов, плотное расписание и буквально бесконечное количество постеров. Иногда возникало ощущение, что между интересными работами нужно не ходить, а почти бегать.Для себя я в основном смотрел темы вокруг pretraining, scaling, MoE, efficient training и разных попыток лучше понять динамику обучения LLM. В этом смысле конференция оказалась очень насыщенной: почти в каждой постерной сессии находилось несколько работ, которые хотелось разобрать подробнее.Постерный формат показался мне самым полезным. На докладах — особенно в больших залах — немного теряется камерность: масштаб впечатляет, но
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,50013652Open in Telegram
  • Душный NLP

    14 Jul, 08:30

    Подборка об RL и ризонингеРассказываем об улучшении RL для сложных задач, оптимизация в RLVR одной строкой кода (!) и обучении компактной модели для дипресёрча.Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy PrefixesПри обучении RL на сложных задачах есть две основные проблемы:1. Большинство роллаутов — wrong, поэтому положительные примеры для основной части задач не появляются. 2. Сложно дообучать модель, когда так мало положительного сигнала. Улучшение происходит скорее за счёт роста общей «умности» модели на более простых тасках.Авторы предлагают метод Prefix-RL, который как раз направлен на решение сложных задач: 🔴Для них семплируются ответы, и из всех семплов выбирается правильный ответ. 🔴Собираются prefixed problems: промпт + префиксы правильного ответа.
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,08011444Open in Telegram
  • Душный NLP

    13 Jul, 10:34

    Ещё больше классных постеров из Сеула — по следам ICML 2026RE-TRAC: REcursive TRAjectory Compression for Deep Search AgentsСейчас очень много агентов работает в ReAct парадигме (последовательные reasoning + acting). Авторы считают, что такой подход с длинными линейными цепочками плохо подходит для сложных задач, потому что deep search больше похож на дерево гипотез: модель может наметить несколько веток, но потом забыть часть из них, застрять в локальном направлении или зациклиться.Re-Trac отличается от ReAct: после каждой траектории собирают compressed_state, в котором хранят лучший ответ на текущий момент, список проверенных фактов, логические выводы и список того, что осталось неизвестным. На следующих траекториях авторы стартуют с этого состояния. Благодаря этому авторы получили 53 пункта на BrowseComp с 8 rollout’ами.Прочитав статью, я нашёл подвох: init для sft — это
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    1,820135421Open in Telegram
  • Душный NLP

    10 Jul, 12:40

    LLMs Develop Novel Social Biases Through Adaptive ExplorationДаже если полностью вычистить bias'ы из данных, модель в агентском цикле решение → фидбек вырастит новые с нуля. Даже о группах, которых не существует — из случайного шума. Чем новее модель, тем сильнее эффект, а промптом это не лечится, нужно менять целевую функцию.Ребята из Принстонского университета привезли на ICML 2026 доклад, в котором утверждают, что вычищать существующие стереотипы из LLM недостаточно — модель успешно вырабатывает новые сама, в рантайме.В подробностях разобрался наш коллега Александр Краснов.Сетап эксперимента из психологии: модель играет роль рекрутера и 40 раундов распределяет кандидатов из четырёх выдуманных этносов (Tufa, Aima, Reku, Weki) по профессиям. После каждого найма выносит вердикт: успех или провал.Хитрость в том, что вероятность успеха у всех одинаковая — группы идентичны, и
    Image from a post by Душный NLPImage from a post by Душный NLP
    15,10021962Open in Telegram
  • Душный NLP

    10 Jul, 10:38

    ICML 2026: как агенты справляются с контекстомОб агентах и агентских системах в этом году говорили примерно все — тема стала одним из фокусов конференции. Главные тренды и новости собрала наша коллега Кристина Гуртова.Было много работ о бенчмарках и диагностике агентов — пожалуй, самый крупный кластер. Пользовались популярностью мультиагентные системы и их обучение, agentic RL и tool use. Отдельное активное направление — safety. Общий тренд: рассматривать агента как инженерную систему, где каждый компонент (среда, обучение, оценка или память) становится отдельным объектом оптимизации.А я углублюсь в актуальную проблему агентов: как не захлебнуться в собственном контексте. Сжимать его, сворачивать или выносить во вне?Путь 1. Агент сам решает, что исключить из историиРаньше агент линейно накапливал всю историю в один растущий контекст. Теперь — он ей управляет.В Context-Folding
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,410135331Open in Telegram
  • Душный NLP

    10 Jul, 08:02

    Оптимизируют MoE, стабилизируют RLVR, колдуют над кэшем и очень активно обсуждают GRPO: продолжаем рассказывать, что в тренде ICML 2026Но обо всём по порядку. Читайте TL;DR от наших коллег и листайте фото с постерами!Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMsКлассная статья про стабилизацию RLVR. Авторы предлагают метрику, которая лучше всех предыдущих детектит потенциальный взрыв — effective sample size. По сути, это нормированная сумма important weight между движками актора и роллаута. Мы в Яндексе тоже её используем — работает!Дальше авторы рассматривают два пути решения. Первый — простой (мы тоже его пробуем). Если метрика начинает стрелять, надо понижать лёрнинг рейт адаптивно.Второй путь — умный потокенный решейпинг — чинит все проблемы сразу. RL учится 1000 степов и не разваливается, даже на специально усложнённом сетапе со staleness 12.
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,1707632Open in Telegram
  • Душный NLP

    9 Jul, 14:30

    На ICML 2026 только и разговоров, что о GRPOЧто ещё привезли на конференцию авторы постерных докладов, рассказываем в новом обзоре!Multi-Agent Teams Hold Experts BackЗабавная статья: авторы утверждают, что мультиагентная команда может портить результаты одного эксперта. Агенты скорее ищут компромисс, а не лучший ответ, и не слушаются эксперта, даже если обозначить его в промпте. Люди тоже склонны к такому поведению, но не так сильно, как LLM.AgentSuite: Toward More Reliable Agent Evaluation with a Component-Based Benchmark Auditing PipelineПайплайн для очистки и правки агентских бенчей. Сделали хорошую таксономию ошибок, подобрали judge'eй для поиска и исправления. Хорошо согласовано с людьми, находило много ошибок в первых версиях τ-бенча. Подходит для проверки запуска агентских бенчей и фильтрации траекторий.FormulaCode: Evaluating Agentic Optimization on Large CodebasesН
    Image from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLPImage from a post by Душный NLP
    2,170119621Open in Telegram