gram news
Аватар канала Душный NLP

Душный NLP

@stuffynlp

Разборы свежих статей от NLP-специалистов Яндекса. Подробно, полезно, с душ(нот)ой. Вопросы и предложения > @yandex_ml_brand

ПроектыRUНейросети

6,660подписчиков

Открыть канал

Последние посты

  • Душный NLP

    11 сент., 12:15

    Дистилляция DeepSeek-R1Сегодня разберём, как DeepSeek-R1 на 671B параметров дистиллировали в модель на 32 миллиарда параметров. Зачем вообще это нужно? Вышедшая в сентябре 2024 года o1 доказала, что test-time scaling работает — если дать модели подумать, то она даст более качественный ответ. Однако тогда пользователю не показывали сырую цепочку рассуждений, а особенности метода не раскрывали. Было непонятно, как это работает, хотя догадки имелись: например, использование process-reward-модели и поиск по дереву.Но эксперименты DeepSeek показали, что дело совсем не в них. Компания выложила технический отчёт, в котором раскрыла секрет. В работе рассматривают три модели: R1-Zero, R1 и R1-Distill. О первых двух мы подробно писали вот тут, а сегодня речь пойдёт о третьей модели.Всего выложили шесть моделей — от 1,5В до 70В параметров на базе Qwen2,5 и Llama3. Все они без RL,
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    1,630157331Открыть в Telegram
  • Душный NLP

    3 сент., 11:15

    Loop the Loopies!Сегодня обсудим статью, которая посвящена моделям Loopies, построенным на шеринге параметров между разными слоями.Обычно у трансформерных моделей и свёрточных нейросетей отдельные параметры на каждом блоке, благодаря чему объём вычислений и число параметров масштабируются с глубиной. Это даёт гибкость — каждый блок может выполнять специфические задачи. Но при этом с ростом числа слоёв растёт и количество параметров, а значит, модель становится дороже хранить.Выходом из этой ситуации может стать переиспользование весов по несколько раз за форвард — шеринг параметров. Так не нужно хранить много параметров, однако блок может принимать распределение данных с разной глубины, что усложняет задачу оптимизации.Перспективность шеринга первым доказал метод ALBERT. В нём было два механизма: факторизация матрицы эмбеддингов и переиспользование одного трансформенного блока
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,560183211Открыть в Telegram
  • Душный NLP

    20 авг., 12:20

    Context-1 — поисковый агент, который умеет избавляться от лишнего. Часть 2/2Продолжаем изучать агент Context-1. В первой части мы рассмотрели, что это вообще такое и какие задачи перед собой ставили авторы. А в этой части поговорим о метриках и обучении.Для оценки качества ответа авторы предлагают использовать четыре метрики: Final answer found (смогла ли модель найти документ с правильным ответом в выдаче), Recall (доля релевантных документов, которые выбрала модель, от общего числа релевантных документов), Precision (число релевантных документов, которые модель отвергла) и FB (среднее гармоническое Recall и Precision; идея авторов в том, чтобы штрафовать модель за отбор нерелевантных документов только под конец обучения). Также предлагают рассматривать Trajectory recall, оценивая качество траекторий и поощряя модель за отбор нужных документов и не награждая чрезмерно за случайное
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,9608421Открыть в Telegram
  • Душный NLP

    13 авг., 11:41изменён

    Context-1 — поисковый агент, который умеет избавляться от лишнего. Часть 1/2Авторы сегодняшней статьи заявляют следующую проблему. Когда агент ищет что-то в поиске, то нерелевантные страницы, выданные браузером, всё равно остаются в контексте агента. Чтобы справиться с этим, контекст можно обрезать или суммировать.Ещё одно весьма перспективное направление в этой области — self-editing context, при котором модель сама определяет, что ей нужно для решения задачи и может отбрасывать бесполезные документы. Этот подход авторы статьи и берут за основу своего субагента Context-1, построенного на модели в 20B параметров.В его арсенале есть четыре инструмента. Первый, search_corpus(query), позволяет оценивать релевантность документа: отбирается 50 документов, ранжируются, самые подходящие отправляются модели в рамках доступного бюджета токенов. Инструмент grep_corpus(pattern) проводит
    3,1006531Открыть в Telegram
  • Душный NLP

    6 авг., 12:28

    Как агенты оценивают собственный успехПредставим ситуацию: инженеру нужно починить баг в сервисе аутентификации с помощью кодового агента. До начала работ агент сообщает, что вероятность успеха — 72%. По ходу работы меняет мнение на 78%, после всех изменений — 92%, а какой-нибудь AI-ревьюер пророчит положительный результат с вероятностью 85%. Однако по итогу патч, сделанный агентом, не работает — то есть прогнозы оказались неверны. Сегодняшняя статья о попытках избежать подобного.Авторы вводят понятие agentic uncertainty — это оценка агентом вероятности, что другой агент на той же самой модели решит задачу. С этим понятием рука об руку идёт ещё одно — probability that I succeed (P(IS)), которое включает умения и знания, необходимые для решения задачи. Это целая траектория, так что P(IS) нельзя заложить в веса модели.В работе ставили эксперименты на 100 задачах из SWE-bench Pro.
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    3,4209831Открыть в Telegram
  • Душный NLP

    31 июл., 08:42

    AgentFold — метод управления контекстом для агентов на длинных задачахНа длинных сценариях поиска и анализа веб-агенты либо хранят слишком много сырой информации, либо слишком часто её суммаризируют, что забивает контекст. Авторы сегодняшней статьи предлагают метод AgentFold (GitHub), призванный решить эту проблему, сделав память агента динамической и управляемой самим агентом.Сейчас в веб-поиске используются два подхода. Первый — это ReAct, при котором все действия и решения конкатенируются в конец контекста. Благодаря этому ничего не теряется, но и контекстное окно забивается очень быстро. Второй подход — суммаризация на каждом шаге, однако при этом какая-то часть информации неизменно теряется.Ключевая идея AgentFold — создание активного и динамически пересчитываемого контекста для каждого следующего шага. То есть агент самостоятельно выбирает, что нужно запомнить точно, а что
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    3,15010932Открыть в Telegram
  • Душный NLP

    21 июл., 09:12

    Asynchronous Reasoning: Training-Free Interactive Thinking LLMsСегодня поговорим о статье, в написании которой принимали участие инженеры Яндекса. Публикация посвящена асинхронному ризонингу, а в её основе лежит метод, описанный в работе Hogwild! Inference: Parallel LLM Generation via Concurrent Attention, поэтому сперва — кратко о ней.Это тоже статья от Yandex Research, а также от HSE и IST Austria. Авторы поставили перед собой задачу ускорить инференс с помощью параллельной генерации. Для этого ввели понятие Cash Blocks. Есть блок common cash, где находится общий промпт (например, решить какое-либо уравнение), и есть блоки «рабочих» (workers) — других потоков генерации той же LLM, которые выполняют задачу, синхронизируясь через KV-кэш. В статье эти блоки называются Алиса и Боб.Для генерации токена Алисы нужно, чтобы блоки стояли в порядке common-Bob-Alice, а для Боба —
    2,830файл1332Открыть в Telegram
  • Душный NLP

    17 июл., 09:40

    Тренды из мира бенчмарков на ICML 2026 [2/2]SWE-rebench V2: Language-Agnostic SWE Task Collection at ScaleРебята из Nebius расширили свой SWE-rebench на новые языки: сфокусировались на масштабируемости и пригодности для сбора RL-лёрна. Две ключевые части пайплайна: сборка окружения под каждый репозиторий и отбор задач для тестов.Окружение собирают собственным интерактивным агентом. Он читает README или конфиги репозиториев, пробует ставить зависимости и запускать тесты, а потом чинится по логам ошибок. Завершить цикл удалось только для 20% проектов.Для отбора задач весь набор тестов несколько раз прогоняли на версии до фикса (тесты падают) и после патча-решения (проходят). Оставили только те, где хотя бы один тест уверенно перешёл из fail в pass.Кроме этого, ребята разобрали траектории фронтир-моделей на 300 задачах. По фейлам составили таксономию типичных проблем, связанных с
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    4,170108711Открыть в Telegram
  • Душный NLP

    17 июл., 09:40

    Тренды из мира бенчмарков на ICML 2026 [1/2]Работ о бенчмарках на ICML традиционно много. По сравнению с прошлым годом, в 2026 стало заметно больше бенчей для агентов. А ещё начали чаще встречаться работы из академии.Объяснение простое. Корпорации вкладывают много сил во внутренние бенчи: делают сами, покупают их у data-labeling-компаний (например, Surge, Mercor, Handshake AI, Toloka) — и, как следствие, такие бенчи редко опенсорсят.Остальные бенчмарки часто делаются ощутимо меньшими ресурсами. И, как следствие, страдают от типичных проблем:• мало человеческой верификации данных, • качество judge'ей-верификаторов редко полноценно исследуется, • плохо оценивается качество пар запрос + ground-truth-ответ, сгенерированных LLM, • редко проверяется контаминация, хотя бенчи собираются из открытых источников.Авторы постеров, вошедших в подборку, отметили, что подготовка одного бенча
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,2207421Открыть в Telegram
  • Душный NLP

    16 июл., 09:57

    ICML 2026 — личные впечатленияКонференция закончилась, но говорить о ней можно ещё долго. Сегодня личными впечатлениями с нашим каналом поделился старший разработчик команды инфраструктуры обучения Alice AI Владислав Тыцкий.Конференция ощущалась очень масштабной: много людей, огромные залы для докладов, плотное расписание и буквально бесконечное количество постеров. Иногда возникало ощущение, что между интересными работами нужно не ходить, а почти бегать.Для себя я в основном смотрел темы вокруг pretraining, scaling, MoE, efficient training и разных попыток лучше понять динамику обучения LLM. В этом смысле конференция оказалась очень насыщенной: почти в каждой постерной сессии находилось несколько работ, которые хотелось разобрать подробнее.Постерный формат показался мне самым полезным. На докладах — особенно в больших залах — немного теряется камерность: масштаб впечатляет, но
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,50013652Открыть в Telegram
  • Душный NLP

    14 июл., 08:30

    Подборка об RL и ризонингеРассказываем об улучшении RL для сложных задач, оптимизация в RLVR одной строкой кода (!) и обучении компактной модели для дипресёрча.Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy PrefixesПри обучении RL на сложных задачах есть две основные проблемы:1. Большинство роллаутов — wrong, поэтому положительные примеры для основной части задач не появляются. 2. Сложно дообучать модель, когда так мало положительного сигнала. Улучшение происходит скорее за счёт роста общей «умности» модели на более простых тасках.Авторы предлагают метод Prefix-RL, который как раз направлен на решение сложных задач: 🔴Для них семплируются ответы, и из всех семплов выбирается правильный ответ. 🔴Собираются prefixed problems: промпт + префиксы правильного ответа.
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,08011444Открыть в Telegram
  • Душный NLP

    13 июл., 10:34

    Ещё больше классных постеров из Сеула — по следам ICML 2026RE-TRAC: REcursive TRAjectory Compression for Deep Search AgentsСейчас очень много агентов работает в ReAct парадигме (последовательные reasoning + acting). Авторы считают, что такой подход с длинными линейными цепочками плохо подходит для сложных задач, потому что deep search больше похож на дерево гипотез: модель может наметить несколько веток, но потом забыть часть из них, застрять в локальном направлении или зациклиться.Re-Trac отличается от ReAct: после каждой траектории собирают compressed_state, в котором хранят лучший ответ на текущий момент, список проверенных фактов, логические выводы и список того, что осталось неизвестным. На следующих траекториях авторы стартуют с этого состояния. Благодаря этому авторы получили 53 пункта на BrowseComp с 8 rollout’ами.Прочитав статью, я нашёл подвох: init для sft — это
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    1,820135421Открыть в Telegram
  • Душный NLP

    10 июл., 12:40

    LLMs Develop Novel Social Biases Through Adaptive ExplorationДаже если полностью вычистить bias'ы из данных, модель в агентском цикле решение → фидбек вырастит новые с нуля. Даже о группах, которых не существует — из случайного шума. Чем новее модель, тем сильнее эффект, а промптом это не лечится, нужно менять целевую функцию.Ребята из Принстонского университета привезли на ICML 2026 доклад, в котором утверждают, что вычищать существующие стереотипы из LLM недостаточно — модель успешно вырабатывает новые сама, в рантайме.В подробностях разобрался наш коллега Александр Краснов.Сетап эксперимента из психологии: модель играет роль рекрутера и 40 раундов распределяет кандидатов из четырёх выдуманных этносов (Tufa, Aima, Reku, Weki) по профессиям. После каждого найма выносит вердикт: успех или провал.Хитрость в том, что вероятность успеха у всех одинаковая — группы идентичны, и
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    15,10021962Открыть в Telegram
  • Душный NLP

    10 июл., 10:38

    ICML 2026: как агенты справляются с контекстомОб агентах и агентских системах в этом году говорили примерно все — тема стала одним из фокусов конференции. Главные тренды и новости собрала наша коллега Кристина Гуртова.Было много работ о бенчмарках и диагностике агентов — пожалуй, самый крупный кластер. Пользовались популярностью мультиагентные системы и их обучение, agentic RL и tool use. Отдельное активное направление — safety. Общий тренд: рассматривать агента как инженерную систему, где каждый компонент (среда, обучение, оценка или память) становится отдельным объектом оптимизации.А я углублюсь в актуальную проблему агентов: как не захлебнуться в собственном контексте. Сжимать его, сворачивать или выносить во вне?Путь 1. Агент сам решает, что исключить из историиРаньше агент линейно накапливал всю историю в один растущий контекст. Теперь — он ей управляет.В Context-Folding
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,410135331Открыть в Telegram
  • Душный NLP

    10 июл., 08:02

    Оптимизируют MoE, стабилизируют RLVR, колдуют над кэшем и очень активно обсуждают GRPO: продолжаем рассказывать, что в тренде ICML 2026Но обо всём по порядку. Читайте TL;DR от наших коллег и листайте фото с постерами!Stable Asynchrony: Variance-Controlled Off-Policy RL for LLMsКлассная статья про стабилизацию RLVR. Авторы предлагают метрику, которая лучше всех предыдущих детектит потенциальный взрыв — effective sample size. По сути, это нормированная сумма important weight между движками актора и роллаута. Мы в Яндексе тоже её используем — работает!Дальше авторы рассматривают два пути решения. Первый — простой (мы тоже его пробуем). Если метрика начинает стрелять, надо понижать лёрнинг рейт адаптивно.Второй путь — умный потокенный решейпинг — чинит все проблемы сразу. RL учится 1000 степов и не разваливается, даже на специально усложнённом сетапе со staleness 12.
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,1707632Открыть в Telegram
  • Душный NLP

    9 июл., 14:30

    На ICML 2026 только и разговоров, что о GRPOЧто ещё привезли на конференцию авторы постерных докладов, рассказываем в новом обзоре!Multi-Agent Teams Hold Experts BackЗабавная статья: авторы утверждают, что мультиагентная команда может портить результаты одного эксперта. Агенты скорее ищут компромисс, а не лучший ответ, и не слушаются эксперта, даже если обозначить его в промпте. Люди тоже склонны к такому поведению, но не так сильно, как LLM.AgentSuite: Toward More Reliable Agent Evaluation with a Component-Based Benchmark Auditing PipelineПайплайн для очистки и правки агентских бенчей. Сделали хорошую таксономию ошибок, подобрали judge'eй для поиска и исправления. Хорошо согласовано с людьми, находило много ошибок в первых версиях τ-бенча. Подходит для проверки запуска агентских бенчей и фильтрации траекторий.FormulaCode: Evaluating Agentic Optimization on Large CodebasesН
    Иллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLPИллюстрация к посту канала Душный NLP
    2,170119621Открыть в Telegram