Latest posts

Агенты ИИ | AGI_and_RL
18 Sept, 17:43



Агенты ИИ | AGI_and_RL
18 Sept, 12:50
Челы натренили прям оч мелкие модельки 25М-121М параметров чтобы на всяких микродевайсах гонять и на некоторых спец задачах должны быть лучше чем более крупные модельки в целом прикольно что они прям оч мелкие. такое и дома можно пытаться делать)https://github.com/cactus-compute/needlePS статьи собираем и проекты делаем в https://t.me/researchim



Агенты ИИ | AGI_and_RL
17 Sept, 12:20
штошь. это оно еще не на looped fly brain построеноhttps://www.reddit.com/r/LocalLLaMA/comments/1wi9fau/qwen_38_27b_running_for_63_hours_on_a_rtx_3090_to/


Агенты ИИ | AGI_and_RL
16 Sept, 16:50
☁☁☁☁☁☁☁Ребятки, там 24 сентября состоится Yandex Scale 2026 от Yandex Cloud.🎨🎨🎨🎨🎨🎨🎨🎨🎨🎨 🎨🎨🎨🎨🎨🎨
Агенты ИИ | AGI_and_RL
16 Sept, 16:12
Ребятки учили Qwen 3.5 35B A3B молекулы дизайнить. Надеюсь молекулярные на местедальше от ллмки тк что именно за датасеты и фреймворки молекулярные и как они работают я не особо понимаю:Как устроен процесс трена 1. Создают 200k задач, которые относительно просто генерить на молекулах из ZINC. Из ZINC берут исходную молекулу, через RDKit и OpenEye считают 116 молекулярных свойств. Случайно выбирают одно свойство, которое нужно улучшить, ещё 2–4 превращают в ограничения, а через BRICS задают каркас молекулы, который должен сохраниться. Так автоматически получают задачи вида: увеличить QED, но удержать молекулярную массу и TPSA в заданных пределах и сохранить исходный каркас. В статье публичную реализацию их генератора задач не дают. 2. Qwen сама генерирует новую молекулу. Модель получает исходную молекулу + цель + ограничения и предлагает новый SMILES. Затем через инструменты




Агенты ИИ | AGI_and_RL
13 Sept, 12:02
forwarded from @pruhatech
Сделал студию для симуляций и обучения роботов.Пока что есть поддержка только ACT и SmolVLA на роборуке за 100 баксов - so100.Куча твиков, ведро готовых ассетов, RL, и прочие вкусности в комплекте.Тестировалась и собиралось на оч специфичном железе, так что правки приветствуются
Агенты ИИ | AGI_and_RL
13 Sept, 10:59
скоро топ 1 овервотча


Агенты ИИ | AGI_and_RL
12 Sept, 17:09
forwarded from @sberlogabig
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_cТакже, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.


Агенты ИИ | AGI_and_RL
10 Sept, 11:32
Кажется я знаю на чем построена новая моделька OpenAI которая зарешала Навье-Стокса
Агенты ИИ | AGI_and_RL
10 Sept, 09:04
Дипсики нам выложили мультимодальный DeepSeek-V4.1-Flash 552B A8/16Bкажется прям круто) хотя дома мало кто сможет запустить но мб корпам/стартапам пойдетhttps://huggingface.co/deepseek-ai/DeepSeek-V4.1-FlashКвантов анслота пока не видел



Агенты ИИ | AGI_and_RL
9 Sept, 18:24
там рлем учат тот самый мозг мухи играть в beat saber https://x.com/_lyraaaa_/status/2097527368919470162


Агенты ИИ | AGI_and_RL
9 Sept, 17:53
Про лупед трансформеры которые возможно лежат в базе Астрыhttps://magazine.sebastianraschka.com/p/gpt-6-astra-looped-transformers-andSebastian Raschka, PhDGPT-6 Astra, Looped Transformers, and Hidden ReasoningA Look at Recurrent Depth, Hidden Chains of Thought, and Recent Research on Looping Transformer Blocks
Агенты ИИ | AGI_and_RL
9 Sept, 14:52edited
там рлем учат тот самый мозг мухи играть в beat saberhttps://x.com/_lyraaaa_/status/2097527368919470162
Агенты ИИ | AGI_and_RL
9 Sept, 08:17
Майкрософты потюнили 4B Qwen-3.5 на 61.5% Swe-bench verified чисто генерацией задач и рлемFrogNano: Training a 4B Coding Agent via Online Task Synthesishttps://microsoft.github.io/debug-gym/static/papers/frognano_technical_report.pdfhttps://microsoft.github.io/debug-gym/




Агенты ИИ | AGI_and_RL
8 Sept, 13:31
Достаточно нишевая инфа про скейлинг ллмного рля на Jax для TPU но мб вам интересно https://adityamakkar000.github.io/posts/async-rl-jax.htmladityamakkar000.github.ioAsync RL in Pure JAXAsync RL in JAX
Агенты ИИ | AGI_and_RL
4 Sept, 12:07
Алибаба потюнили Qwen 3.6-35B-A3B чтобы он лучше обслуживал аватара на стримах нуи в целом схема как там устроено все на скрине, прикольноTraining Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report https://arxiv.org/abs/2608.15763 https://www.alphaxiv.org/ru/abs/2608.15763


Агенты ИИ | AGI_and_RL
2 Sept, 17:20
Квены потренили Qwen 3.5 4B для автопилота, толькодобавили к нему голову в которую 3D данные со сцены заходят (BEV Perception Head) + добавлен planning expert это 32 слоя диффузионного трансформера который генерит траекторию движения (50 точек на 5 секунд) из шума (noisy trajectory на картинке) + представлений из vlmну и учили в 4 этапа все эти частиQwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving https://arxiv.org/abs/2609.00111 https://www.alphaxiv.org/ru/abs/2609.00111https://github.com/QwenLM/Qwen-Drive-1.0PS статьи собираем и проекты делаем в https://t.me/researchim



Агенты ИИ | AGI_and_RL
2 Sept, 13:58
Пока ходил искал алгоритмы которые в студию завести полезно собрал список Zero алгоритмовMastering Chess and Shogi by Self-Play with a General Reinforcement Learning Algorithm https://arxiv.org/abs/1712.01815 https://www.alphaxiv.org/ru/abs/1712.01815Mastering Atari, Go, Chess and Shogi by Planning with a Learned Model https://arxiv.org/abs/1911.08265 https://www.alphaxiv.org/ru/abs/1911.08265Online and Offline Reinforcement Learning by Planning with a Learned Model https://arxiv.org/abs/2104.06294 https://www.alphaxiv.org/ru/abs/2104.06294Learning and Planning in Complex Action Spaces https://arxiv.org/abs/2104.06303 https://www.alphaxiv.org/ru/abs/2104.06303Mastering Atari Games with Limited Data https://arxiv.org/abs/2111.00210arXiv.orgMastering Chess and Shogi by Self-Play with a General...The game of chess is the most widely-studied domain in the history of artificial intelligence. The strongest programs are based on a combination of sophisticated search techniques, domain-specific...
Агенты ИИ | AGI_and_RL
1 Sept, 19:00
Небольшой апдейт по студии https://github.com/researchim-ai/reinforcement-studio туда добавлены некоторые multi agent rl алгоритмы world models и алгоритмы которые с ними работают efficient zero v2 (на скрине тренится на одной из задач nethackкуча енвоввсе пока в процессе тестов и отладки)Кстати покидайте енвы которые вы хотели бы видеть внутри в комментарииPS проекты делаются тут https://t.me/researchim



Агенты ИИ | AGI_and_RL
1 Sept, 13:45
автор пишет что потренил трансформер на 28м параметров за 1.5 часа на 5090 и выбил 44% на ARC-AGI-1https://mvakde.github.io/blog/44-on-arc-1/https://github.com/mvakde/mdlARC/

Related Channels
Other channels in the same section of the catalogue.
