gram news
Агенты ИИ | AGI_and_RL channel avatar

Агенты ИИ | AGI_and_RL

@agi_and_rl

Про ии, RL и в целом @tokarev_i_v https://t.me/researchim

ProjectsRUAI

6,140subscribers

Open the Channel

Latest posts

  • Агенты ИИ | AGI_and_RL

    18 Sept, 17:43

    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,12021153211Open in Telegram
  • Агенты ИИ | AGI_and_RL

    18 Sept, 12:50

    Челы натренили прям оч мелкие модельки 25М-121М параметров чтобы на всяких микродевайсах гонять и на некоторых спец задачах должны быть лучше чем более крупные модельки в целом прикольно что они прям оч мелкие. такое и дома можно пытаться делать)https://github.com/cactus-compute/needlePS статьи собираем и проекты делаем в https://t.me/researchim
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,3901443Open in Telegram
  • Агенты ИИ | AGI_and_RL

    17 Sept, 12:20

    штошь. это оно еще не на looped fly brain построеноhttps://www.reddit.com/r/LocalLLaMA/comments/1wi9fau/qwen_38_27b_running_for_63_hours_on_a_rtx_3090_to/
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,3601042Open in Telegram
  • Агенты ИИ | AGI_and_RL

    16 Sept, 16:50

    ☁☁☁☁☁☁☁Ребятки, там 24 сентября состоится Yandex Scale 2026 от Yandex Cloud.🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨
    1,160video1Open in Telegram
  • Агенты ИИ | AGI_and_RL

    16 Sept, 16:12

    Ребятки учили Qwen 3.5 35B A3B молекулы дизайнить. Надеюсь молекулярные на местедальше от ллмки тк что именно за датасеты и фреймворки молекулярные и как они работают я не особо понимаю:Как устроен процесс трена 1. Создают 200k задач, которые относительно просто генерить на молекулах из ZINC. Из ZINC берут исходную молекулу, через RDKit и OpenEye считают 116 молекулярных свойств. Случайно выбирают одно свойство, которое нужно улучшить, ещё 2–4 превращают в ограничения, а через BRICS задают каркас молекулы, который должен сохраниться. Так автоматически получают задачи вида: увеличить QED, но удержать молекулярную массу и TPSA в заданных пределах и сохранить исходный каркас. В статье публичную реализацию их генератора задач не дают. 2. Qwen сама генерирует новую молекулу. Модель получает исходную молекулу + цель + ограничения и предлагает новый SMILES. Затем через инструменты
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,170422Open in Telegram
  • Агенты ИИ | AGI_and_RL

    13 Sept, 12:02

    forwarded from @pruhatech

    Сделал студию для симуляций и обучения роботов.Пока что есть поддержка только ACT и SmolVLA на роборуке за 100 баксов - so100.Куча твиков, ведро готовых ассетов, RL, и прочие вкусности в комплекте.Тестировалась и собиралось на оч специфичном железе, так что правки приветствуются
    1,450video1741Open in Telegram
  • Агенты ИИ | AGI_and_RL

    13 Sept, 10:59

    скоро топ 1 овервотча
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,580video751Open in Telegram
  • Агенты ИИ | AGI_and_RL

    12 Sept, 17:09

    forwarded from @sberlogabig

    Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_cТакже, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,3208511Open in Telegram
  • Агенты ИИ | AGI_and_RL

    10 Sept, 11:32

    Кажется я знаю на чем построена новая моделька OpenAI которая зарешала Навье-Стокса
    2,180video203311Open in Telegram
  • Агенты ИИ | AGI_and_RL

    10 Sept, 09:04

    Дипсики нам выложили мультимодальный DeepSeek-V4.1-Flash 552B A8/16Bкажется прям круто) хотя дома мало кто сможет запустить но мб корпам/стартапам пойдетhttps://huggingface.co/deepseek-ai/DeepSeek-V4.1-FlashКвантов анслота пока не видел
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,8601365Open in Telegram
  • Агенты ИИ | AGI_and_RL

    9 Sept, 18:24

    там рлем учат тот самый мозг мухи играть в beat saber https://x.com/_lyraaaa_/status/2097527368919470162
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,99013331Open in Telegram
  • Агенты ИИ | AGI_and_RL

    9 Sept, 17:53

    Про лупед трансформеры которые возможно лежат в базе Астрыhttps://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-and
    Sebastian Raschka, PhDGPT-6 Astra, Looped Transformers, and Hidden ReasoningA Look at Recurrent Depth, Hidden Chains of Thought, and Recent Research on Looping Transformer Blocks
    1,63031Open in Telegram
  • Агенты ИИ | AGI_and_RL

    9 Sept, 14:52edited

    там рлем учат тот самый мозг мухи играть в beat saberhttps://x.com/_lyraaaa_/status/2097527368919470162
    2,020video2493Open in Telegram
  • Агенты ИИ | AGI_and_RL

    9 Sept, 08:17

    Майкрософты потюнили 4B Qwen-3.5 на 61.5% Swe-bench verified чисто генерацией задач и рлемFrogNano: Training a 4B Coding Agent via Online Task Synthesishttps://microsoft.github.io/debug-gym/static/papers/frognano_technical_report.pdfhttps://microsoft.github.io/debug-gym/
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,9007421Open in Telegram
  • Агенты ИИ | AGI_and_RL

    8 Sept, 13:31

    Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно https://adityamakkar000.github.io/posts/async-rl-jax.html
    adityamakkar000.github.ioAsync RL in Pure JAXAsync RL in JAX
    1,4604311Open in Telegram
  • Агенты ИИ | AGI_and_RL

    4 Sept, 12:07

    Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольноTraining Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763 https://www.alphaxiv.org/ru/abs/2608.15763
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    2,5506331Open in Telegram
  • Агенты ИИ | AGI_and_RL

    2 Sept, 17:20

    Квены потренили Qwen 3.5 4B для автопилота, толькодобавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlmну и учили в 4 этапа все эти частиQwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving https://arxiv.org/abs/2609.00111 https://www.alphaxiv.org/ru/abs/2609.00111https://github.com/QwenLM/Qwen-Drive-1.0PS статьи собираем и проекты делаем в https://t.me/researchim
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    2,540744Open in Telegram
  • Агенты ИИ | AGI_and_RL

    2 Sept, 13:58

    Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero алгоритмовMastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm https://arxiv.org/abs/1712.01815 https://www.alphaxiv.org/ru/abs/1712.01815Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model https://arxiv.org/abs/1911.08265 https://www.alphaxiv.org/ru/abs/1911.08265Online and Offline Reinforcement Learning by Planning with a Learned Model https://arxiv.org/abs/2104.06294 https://www.alphaxiv.org/ru/abs/2104.06294Learning and Planning in Complex Action Spaces https://arxiv.org/abs/2104.06303 https://www.alphaxiv.org/ru/abs/2104.06303Mastering Atari Games with Limited Data https://arxiv.org/abs/2111.00210
    arXiv.orgMastering Chess and Shogi by Self-Play with a General...The game of chess is the most widely-studied domain in the history of artificial intelligence. The strongest programs are based on a combination of sophisticated search techniques, domain-specific...
    1,540852Open in Telegram
  • Агенты ИИ | AGI_and_RL

    1 Sept, 19:00

    Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethackкуча енвоввсе пока в процессе тестов и отладки)Кстати покидайте енвы которые вы хотели бы видеть внутри в комментарииPS проекты делаются тут https://t.me/researchim
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,560842Open in Telegram
  • Агенты ИИ | AGI_and_RL

    1 Sept, 13:45

    автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1https://mvakde.github.io/blog/44-on-arc-1/https://github.com/mvakde/mdlARC/
    Image from a post by Агенты ИИ | AGI_and_RLImage from a post by Агенты ИИ | AGI_and_RL
    1,7801092111Open in Telegram