gram news
Аватар канала commit history

commit history

@c0mmit

история моих коммитов про машинное обучение, карьеру и набитые шишки @ibragim_bad

4,290подписчиков

Открыть канал

Последние посты

  • commit history

    28 июл., 14:40

    Вернувшись с ICML, с головой закопался в новый апдейт SWE-rebench и лидерборда! 🛠️Этот релиз мы сделали масштабнее, он мультиязычный. Собрал 111 задач на 5 языках, сделал кучу прогонов и зарылся в траектории агентов, чтобы отловить, как именно модели читерят и обманывают эвалы.Всю более подробную аналитику собрал в большой блогпост.📊 Статья с разбором: https://teletype.in/@ibragim_bad/swe-rebench-2026-07🏆 Лидерборд: https://swe-rebench.com/
    TeletypeSWE-rebench Leaderboard: большое мультиязычное обновлениеВ свежем релизе SWE-rebench мы собрали 111 задач на пяти популярных языках программирования, ужесточили фильтрацию и добавили аналитику...
    11,00027741Открыть в Telegram
  • commit history

    4 июл., 08:31

    Приехал в Сеул на ICML (одна из трех топ ai конференций) с SWE-rebench-v2, который прошёл сюда, так что буду со стенгазетой на постерной сессии ICML, а потом ещё на воркшопе про код.В этот раз у нас здесь большая команда и сразу две статьи на main track.Приходите, если вы тоже здесь, и пишите — сгоняем попить прохладительные напитки.Фотку приложу со своей прошлой поездки в Сеул, потому что новых пока не сделал.
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    2,870399754Открыть в Telegram
  • commit history

    1 июл., 17:46изменён

    За последний месяц сделали несколько апдейтов SWE-rebench Leaderboard:https://swe-rebench.com/> собрали новые задачи и прогнали кучу моделей на свежем срезе > обновили интерфейс, сделали его более понятным и красивым > добавили rebench в HarborHub: теперь бенчмарк можно запускать в HarborМы немного поменяли формат апдейтов: теперь делаем их не каждый месяц, а примерно раз в два месяца. Зато в каждом таком обновлении сразу прогоняем много моделей на пачке из примерно 100 свежих задач.Ещё один интересный момент: независимый исследователь прогнал наши задачи и задачи SWE-bench Pro на предмет качества. По его оценке, в нашем бенчмарке оказалось меньше задач с явными проблемами, чем в SWE-bench Pro. Это приятно, учитывая, что в последнем апдейте мы не смотрели задачи вручную: всё было собрано автоматически, тогда как в SWE-bench Pro было много ручной разметки.> SWE-rebench audit: 7
    YouTubeМожно ли верить SWE бенчмаркам в 2026? Прожарка бенчмарков от профи. DeepSWE, SWE rebench v2...Tg-канал Родиона AI-Driven Development: https://t.me/ai_driven Tg-канал Ибрагима: https://t.me/c0mmit Tg-канал Максима: https://t.me/etechlead Друзья, вы все еще верите бенчмаркам? Я вот все меньше. Наверняка уже все видели DeepSWE бенчмарк - пожалуй, наиболее…
    2,7801511831Открыть в Telegram
  • commit history

    17 июн., 15:28

    В начале апреля я выступал на AI Engineer Europe – и на днях вышло видео моего доклада!имхо: AI Engineer — сейчас одна из лучших конференций по прикладному AI. Еще у них есть YouTube-канал, на 500к+ подписчиков, куда выкладывают видео выступлений. Там много классных записей!видео доклада: https://youtu.be/wcUJWP6WpGMЯ рассказывал про лидерборд SWE-rebench — динамический бенчмарк со свежими SWE-задачами с GitHub: https://swe-rebench.com/Если бы мне нужно было выделить главные выводы, я бы выбрал эти:> Динамические бенчмарки помогают держать задачи свежими и снижают контаминацию. > Для запуска SWE-эвалов нужны не только GPU: вам также понадобится масштабируемая инфраструктура исполнения для сэндбоксов. > Хорошие задачи должны быть решаемыми, но при этом достаточно сложными и показывать значимую разницу между моделями. > Высококачественные верифицируемые эвалы могут стать основой
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    13,00028189421Открыть в Telegram
  • commit history

    14 мая, 12:20

    Когда-то в университетские годы мы много организовывали мероприятия с минимальным бюджетом. Концерт студвесны на два часа: с костюмами, реквизитом и типографией — умудрялись собрать примерно за 12 тысяч рублей.Потом были ивенты побольше. На одном из награждений нужно было накормить 100+ человек, а бюджет был всё такой же минимальный. Тогда мы собрали волонтёров, которые помогли приготовить огромный казан плова — им в итоге всех и накормили.С тех пор прошло много времени, но любовь к офлайн-ивентам осталась. Особенно в новых городах: это всё ещё один из лучших способов развиртуализироваться, познакомиться с людьми и быстрее погрузиться в локальное комьюнити.И вот теперь мы в Nebius делаем такой ивент уже в нашем лондонском офисе на Holborn 21 мая.Nebius.Build/LON — прикладной ивент для AI-билдеров. Будут выступления от ребят из NVIDIA, JetBrains, Wayve, Tavily и Nebius, разговоры
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    3,8202017122Открыть в Telegram
  • commit history

    28 апр., 15:52

    Буду в Казани, решил сделать небольшое выступление + встречу подписчиков.Поговорим про кодовых агентов. Сделал комфортный уровень для понимания, но при этом плотно по смыслу. Никакой сухой теории или пересказов чужих кейсов — сконцентрированный опыт по агентам и эвалам: как гоняем сами, как сравнивать модели итп. Будет полезно тем, кто уже ими пользуется и/или интересуется темой.Ещё добавил развлекательную часть: расскажу, как агенты «читерят», и поделюсь историями.Приходите, буду рад! Встречаемся в новом IT-парке 4 мая в 18:00https://it-akademiya-3c.timepad.ru/event/3939782/
    4,420211454Открыть в Telegram
  • commit history

    15 апр., 10:46

    Как я смонтировал видео с лекции прямо с телефона (и без ручного труда)Выложил видео с недавнего выступления на Innovation Guild. Посмотреть можно тут.Я никогда не занимался видеомонтажом и не хотел тратить на это время. Был запрос: уложиться в час-два максимум и получить адекватное качество.Более того, я хотел сделать это автоматически и автономно , так что я запустил агента и вышел из дома, потом уже просто с телефона апдейтнул таски (с телефона есть доступ к tmux на маке).Кажется, сейчас записать и свести любую лекцию можно вообще без продакшена и минимальным ручным трудом (чтобы по airdrop скинуть материалы, запустить codex / Claude code и потом загрузить видео на YouTube).📱 Оборудование: Два Айфона и штатив.> Один айфон стоял на штативе и писал видео. > Второй айфон просто положили рядом и включил диктофон. Использовать звук с камеры — плохая идея, он получается глухим
    YouTubeSWE-rebench: Как мы тестировали ИИ-агентов на реальных задачах разработчиковВ этом видео я (Ибрагим Бадертдинов) рассказываю про наш бенчмарк для ИИ-агентов и делюсь результатами тестирования. Это запись моего доклада с лондонского митапа Innovation Guild https://innovators.london/about. О чем поговорим: Как ИИ-программисты (кодинг…
    4,5103532123Открыть в Telegram
  • commit history

    13 апр., 16:10

  • commit history

    13 апр., 16:10

    Два доклада и как прошел AI Engineer: впечатления спикераПрошлая неделя выдалась плотной: я выступил с докладом про SWE-rebench Leaderboard два раза!Сначала заглянул на Innovation Guild. Хорошая аудитория, комфортная атмосфера. Получилось отлично пообщаться, классные вопросы — спасибо Айбулату за приглашение! Если вы в Лондоне, горячо рекомендую заглядывать к ним в офлайне.Про AI Engineer Europe. Это их первый ивент в Европе, и планку они задали высокую. В отличие от академических конференций, здесь выше концентрация более сенсорных практиков + удивило, что большая часть людей, с кем общался были не из Лондона а из СФ и около. Swyx ( один из оргов конфы), сказал, что для ребят из штатов – конфа – вариант, чтобы на деньги компании сгонят потусить в Лондон.Про спикеров: на кейноутах был Pragmatic Engineer, создатель OpenClaw и другиеЕще мне повезло с соседями на ужине для
    3,150191141Открыть в Telegram
  • commit history

    24 мар., 13:38

    Мои новости сразу пачкой:1. Пару недель назад сходил попить кофе с Ross Taylor из gr.inc ($10M raised), кофаундером Papers with Code (кто-то помнит еще такое?) и лидом по ризонингу в Llama 2/3. Сегодня они запустили свою платформу для RL - OpenReward. По сути, это клей между разными датасетами задач для RL и бэкендами для обучения (как Tinker, например). Мы поддержали там SWE-rebench-V2 с первого дня.2. Обновили SWE-rebench Leaderboard. Заняло чуть больше времени, но добавили много нового — смотрите инсайты: https://swe-rebench.com/?insight=feb_2026 еще пост в X бодро разошелся на 120к и привел пару интересных контактов.3. Буду выступать на конфе AI Engineer в Лондоне 9 апреля. У ребят имхо лучшие видео с выступлениями по этой теме. На конфе я расскажу про SWE-rebench: как собираем таски, как гоняем агентов и т.п. Го увидимся, если кто-то тоже там будет (правда, билетов уже нет).
    3,680248421Открыть в Telegram
  • commit history

    6 мар., 15:42

    недавно записали подкаст с ребятами из JetBrains Researchhttps://youtu.be/-G3e0qffIPE?is=MAmdpFNKXu3n16ABПодкаст свежий, это только второй выпуск (первый был с Анной Коган, ex-ceo OpenCV)поговорили про мой путь из стоматологии в рисерч, SWE-rebench, кодовых агентов, наши свежие релизы (SWE-rebench-V2 и contree)!Советую чекнуть профили ведущих! Игорь один из авторов известного курса по CV на степике, это был мой первый курс по CV в 2019, который я экспрессом прошел перед хакатоном.А у Ильи психологический бэкграунд + phd и сейчас он занимается human-AI experience
    YouTubeIbragim Badertdinov: From Dentistry to AI, Coding Agents, SWE-rebench | JetBrains Research PodcastIn our second episode, we chat with Ibragim Badertdinov from Nebius about SWE-rebench, coding agents, and his path from dentistry and AI. Our first episode can be found here: https://youtu.be/W8wFQjKhb7s Episode links: SWE-rebench: https://swe-rebench.com/…
    4,52027198Открыть в Telegram
  • commit history

    3 мар., 10:46

    Последние пару месяцев я плотно работал над этим релизом, и наконец-то мы выкатываем его в опенсорс!📟 Встречайте SWE-rebench-V2: самый большой открытый, мультиязычный датасет для обучения кодовых агентов!Вместе с командой Nebius AI R&D мы построили пайплайн для масштабного сбора задач из реальных GitHub репозиториев и теперь делимся всем с комьюнити. На текущий момент это самый большой и разнообразный открытый датасет подобных задач в мире.Что внутри: > 32 000+ задач — на базе реальных issue + готовый Docker-образ. > 20 языков программирования. Некоторые языки (например, Lua или Clojure) вообще никогда раньше не были покрыты! > 120 000+ дополнительных задач, собранных на базе реальных PR. > Качество — задачи отфильтрованы и размечены с помощью ансамбля LLM. Также мы обогатили их метаданными и добавили интерфейсы, которые проверяются в тестах.Вместе с датасетом мы дропаем
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    49,6006435431Открыть в Telegram
  • commit history

    26 февр., 11:51изменён

    Мы тут в Nebius AI R&D выкатили новый тул для всех, кто работает с кодовыми агентами – ConTree 🌳https://contree.dev/Пока в альфа релизе, будем рады фидбеку и вопросам! Начинаем раскатывать понемногу перед большим релизом, чтобы собрать фидбек и шлифануть все.Мы давно работаем с агентами, и одна из ключевых сильных сторон нашей команды – это умение пилить инфру.С агентами всегда стоит вопрос: где им безопасно и быстро выполнять код? В докере есть ограничения, а обычные виртуалки — слишком медленные. В итоге мы сделали свою песочницу на базе microVM.Пара главных фичей: + Git-like ветвление стейта. Агент доходит до чекпойнта и может запустить 5 вариантов кода параллельно (идеально для MCTS/Beam Search). Если скрипт падает, агент откатывается назад за миллисекунды. Ошибки LLM теперь ничего не стоят.+ Hardware-изоляция. Агент может крашнуть ядро или сделать rm -rf / — ConTree
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    16,20045206Открыть в Telegram
  • commit history

    4 февр., 12:56

    Снова пост-солянка!1. В Google Scholar мой профиль перешагнул отметку в 100 цитирований. Приятно!2. В X (бывший Twitter) есть статья, которая набрала 170млн просмотров. Ждал, что её кто-то переведет, но в итоге сделал это сам для vc и Хабра Суммарно вышло 200тыс просмотров и много полярных комментов. Статья называется: «Как исправить всю свою жизнь за один день».3. Писали статью на конфу. В этот раз основной связкой были VS Code + Codex для работы с LaTeX. В ChatGPT Pro загружал проект целиком вместе с PDF и просил прожарить – удобно искать несоответствия фактов, артефакты верстки. Кстати, пробовал Cursor на месяц, но не зашло: низкие лимиты, слабая модель автодополнения, да и IDE-агентами я почти не пользуюсь (предпочитаю терминальные). В итоге вернулся в VS Code + терминальные агенты.4. Игорь написал классный лонгрид про тестовое в Anthropic. Статья: Anthropic Performance Team
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    4,63031764Открыть в Telegram
  • commit history

    20 янв., 14:29изменён

    Как попробовать Claude Opus 4.5 и другие модели в CLI-агенте бесплатноЗа последние полтора года из первого ряда наблюдал как сильно выросли способности моделей в формате кодинг агентов. При этом кто-то еще не пробовал сделать проект просто агентами, без погружения в код, хотя желание есть.Не у всех есть enterprise-подписка на Codex, Claude или Cursor, либо лишние $100–200 в месяц. При этом $10 в том же Cursor выедаются довольно быстро, если запускать агента на задачах чуть сложнее простых автокомплитов.Фронтирные модели уже нормально работают в агентских обвязках. На бенчмарках топовые модели идут примерно на одном уровне, на последнем ребенче например лидирует Opus. При этом сами агентские скаффолды сходятся к одному и тому же набору инструментов, поэтому можно спокойно пробовать разные cli агенты, не переживая, что они сильно отличаются.Есть такой очередной агент/обвязка. AMP
    AmpcodeDoom 3D clone TypeScript project plan
    4,620241143Открыть в Telegram
  • commit history

    5 янв., 11:40

    Серега @southfreebird параллельно с работой в Nebius с друзьями сделал крутой open-source проект!Авторы: @southfreebird, @Olegbalakhnov и @zaringleb.Ребята обучили и выложили в open-source VLA-модель на базе VLA-0 от Nvidia, только с backbone в 6 раз меньше (0.5B vs 3B в оригинальной работе), которая показывает success rate 94.1% на Libero benchmark (против 94.7% у оригинальной модели).VLA (Vision-Language-Action) это модель, которая смотрит на картинку, понимает текстовую команду и сразу выдаёт действие для робота, типа «возьми кубик и положи справа».Вообще порог входа в robotics ML всё ещё достаточно высокий, поэтому у ребят крутая цель: сделать в open-source воспроизводимые рецепты для файнтюна небольших моделей на небольшом количестве демонстраций.Ссылка на блогпост и модель: https://robot-learning-collective.github.io/vla-0-smolЕсли интересно следить, ребята завели
    13,100видео33851Открыть в Telegram
  • commit history

    4 янв., 11:34

    Открыл сегодня x и увидел пару постов на 100k+ просмотров про статью Recursive Language ModelsСуть такая. Вместо того чтобы запихивать всё в контекст, предлагают относиться к проблеме длинного контекста как к software engineering задаче. Дать LLM инструменты вроде поиска по регуляркам, чтобы она сама обрабатывала контекст, плюс инструмент для запросов в LLM, чтобы параллельно гонять сабагентов. Идейно – обычный агент (codex/claude-code/итд) просто теперь вместо репозитория нужно искать агент работает по большому txt. Приложил картинку из статьи, очень наглядная.Сразу после статьи вышел блогпост от PrimeIntellect (очень бодрые ребята, много делают для agentic rl и хайпуют в x). Они делали эксперименты на эту же тему и показали больше ablations, плюс небольшие улучшения вроде: а давайте инструменты будут доступны только сабагентам, чтобы не раздувать контекст основной LLM.Мои мысли
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    3,79011642Открыть в Telegram
  • commit history

    23 дек. 2025 г., 11:24

    🎄 Релизим 67 074 траектории Qwen3-Coder с OpenHands + 2 RFT чекпоинта.> Мы выкладываем: 67 000+ траекторий по 3 800 решенным задачам в 1 800+ Python репозиториях.> Примерно в 3 раза больше успешных траекторий и в 1.5 раза больше репозиториев, чем в нашем прошлом датасете.> Траектории длинные: в среднем 64 шага, до 100 шагов и контекст до 131k токенов.> RFT на этих данных, SWE-bench Verified: Qwen3-30B-Instruct: 25.7% → 50.3% Pass@1. Qwen3-235B-Instruct: 46.2% → 61.7% Pass@1. Также сильный рост на SWE-rebench September (цифры в блог посте)> Мы сделали много эвалов. прогнали OpenHands с лимитом 100 и 500 шагов. Запускаем на SWE-bench Verified и сентябрьском SWE-rebench.> Мы отдельно проверяем тесты, которые пишет модель. Считаем, как часто тесты корректны. Проверяем, как часто финальный патч модели проходит ее собственные тесты.
    16,5002713711Открыть в Telegram
  • commit history

    4 дек. 2025 г., 18:51

    сейчас будем показывать нашу стенгазету с SWE-rebench, приходите если рядом!🧩 SWE-rebench: an automated pipeline for task collection & decontaminated evaluation 📍 Dec 4 | 11:00 AM–2:00 PM PST | Hall C/D/E #106
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    3,6403452Открыть в Telegram
  • commit history

    2 дек. 2025 г., 16:58

    Приехал в Сан-Диего на NeurIPS 2025, буду рассказывать про SWE-rebench на постерной сессии.NeurIPS 2025 - это одна из самых крупных конференций по ИИ и машинному обучению. Много топовых статей были опубликованы здесь, например, легендарный Attention is All You Need (тогда еще на NIPS 2017, но название поменяли из-за токсичных ассоциаций)Если кто тоже тут, приходите на постерную сессию (позже закину где и когда будет) и пишите - сходим на кофе!P.S. Фотку приложил из Нью-Йорка в который заскочили по пути, так как в Сан-Диего прилетели только вечером.
    Иллюстрация к посту канала commit historyИллюстрация к посту канала commit history
    3,4403713731Открыть в Telegram