gram news
RnD ML Team channel avatar

RnD ML Team

@rndml_team

RnD ML @ Sber-AI Admin: @hukenovs Repos: https://github.com/ai-forever/

ProjectsRUAI

4,010subscribers

Open the Channel

Latest posts

  • RnD ML Team

    22 Sept, 15:30

    🔎 Агенты-разведчики: ищем обучающие данные в хранилище без каталогаДля претрейна речевых full-duplex моделей нужны сотни тысяч часов речи. Но найти подходящие данные — отдельная инженерная задача: датасеты раскиданы в S3-подобных хранилищах, у каждой команды свои наборы, а знания о них разбросаны по внутренним и внешним источникам, нужно постоянно все обновлять, в идеале без участия человека!В рамках AI RnD Day Максим Метальников рассказал, как мы решили эту задачу с помощью небольших AI-агентов, которые самостоятельно исследуют хранилище и собирают структурированную информацию о датасетах.📌 TLDR В процессе бесконечного сбора речевых данных мы сделали агента-разведчика: он получает задачу, исследует доступное хранилище, скачивает небольшие сэмплы, анализирует аудио и метаданные, читает документацию и в конце формирует карточку датасета. Главная идея — разведка ≠ каталог. Нам не
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    43755211Open in Telegram
  • RnD ML Team

    21 Sept, 17:24

    🎓 AI: Research in actionAI-конференции продолжаются (и похоже не закончатся). Наши коллеги из Sber AI Lab зовут на закрытую конференцию «AI: Research in action».Формат: минимум 10 экспертных докладов, живые демо, возможность задать вопросы исследователям, которые строят этот самый AI. Рассмотрим, как устроены LLM и мультиагентные системы, а также обсудим применение ИИ для анализа поведения и прогнозирования в финансовом секторе.🔬 О чём будет • Как устроены современные LLM и мультиагентные системы • ИИ для анализа поведения и прогнозирования в финансах • Результаты исследований 2025–2026, опубликованные на ACL, SIGIR, AAAI, IJCAI и других топовых конференциях • Путь от фундаментальной модели до продакшенаПодробности 🗓 10 октября, 11:00 📍 Москва, Кутузовский 32сГ 💻 Очно или онлайн-трансляция 🔗 Программа и регистрация#conference #sber
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    828641Open in Telegram
  • RnD ML Team

    20 Sept, 12:53

    🎙 Full-duplex voice modeНаша команда ведет исследования в речевых технологиях, и одна из задач, которую мы решаем — это создание полнодуплексного голосового режима. Это такой класс моделей, которые могут одновременно слушать и говорить, не разбивая диалог на последовательные вызовы.В рамках прошедшей AI RnD Day наши ребята Артемий и Данило рассказали, как это всё устроено и куда движется мир.📌 TLDR Классический голосовой ассистент — это каскад ASR → LLM → TTS + VAD. Пользователь говорит, VAD ждёт конец реплики, ASR переводит речь в текст, LLM думает, TTS озвучивает ответ. Задержка у такой системы складывается из нескольких компонент, а диалог с моделью не нативен. Full-duplex устроен иначе: модель может слушать пользователя, говорить, реагировать на перебивания и менять свою реплику прямо во время разговора.Главный вызов — сделать такую модель не только естественной, но и
    Image from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML Team
    1,440341612119Open in Telegram
  • RnD ML Team

    19 Sept, 20:41

    ⚡️ PML Conf от ЯндексаНе успели закончиться эмоции от Deep Tech Night, а тут очередная конференция от Яндекса для тех, кто делает реальный AI (как говорят сами организаторы)! Сегодня в Москве прошёл Practical ML Conf 2026, вроде бы это уже в четвертый раз. Если коротко: это не просто "ещё один ML-ивент", а точка притяжения большого количества AI-энтузиастов со всей страны, где идет бесконечный нетворк и обмен опытом.🔬 Про программу В центре внимания 2026 года — агентные системы, эффективный инференс LLM, генеративные рекомендации, мультимодальный ИИ, автономный транспорт и робототехника.На докладах побывать практически не удалось, весь день ушел на нетворкинг, но особо зацепил доклад "Agentic Vision: как научить VLM рассуждать и использовать инструменты". Современные VLM часто ошибаются в деталях, при подсчёте объектов и пространственных отношениях. Один из способов повысить
    Image from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML Team
    1,800231810643Open in Telegram
  • RnD ML Team

    18 Sept, 13:30

    🤖➕🌏🟰❤️ Robo Drive Party: закрытый ивент для Physical AI-инженеровЕсли ты в Physical AI и ещё не знаком с командой — это шанс исправить. Будущее AI в выходе моделей в физический мир.🗓 21 сентября, Сбер.Среда Собираем топовых инженеров, которые строят роботов и проектируют архитектуру для взаимодействия с реальностью.⚙️ В программе • Прямой диалог с инженерами и лидами Центра робототехники Сбера — без формальностей, на лёгком вайбе • Разбор текущих проектов: какие задачи решаем, какие архитектуры пробуем, где нужны руки и головы • Нетворкинг с фокусом на коллаборации: если ты в теме — есть шанс найти команду или проект🎯 Для кого • Physical AI / Robotics / Embodied ML • Reinforcement Learning, sim-to-real • Cyber Security для робототехники • Инженеры, которые хотят делать реальных роботов, а не только прототипы💡 Зачем идти
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    1,220863111Open in Telegram
  • RnD ML Team

    18 Sept, 08:08

    forwarded from @sberaiscience

    17 сентября в Москве прошла AI R&D DAY — конференция для исследовательских команд и создателей ИИ-систем 🔥Более 600 участников на одной площадке, 20+ докладов — концентрат практического опыта, знаний и инструментов, готовых к внедрению сразу по возвращении в офис.Обсудили альтернативные архитектуры, обучение моделей и AI-агентов, долгосрочную мультимодальную память, новые модальности и коммуникации, а также бенчмаркинг и стандарты качества AIСреди спикеров — эксперты Сбера (Sber AI, Kandinsky Lab, Центра «ИИ для науки», Центра практического ИИ, Центра робототехники), института AIRI, Лондонского института практических наук, Национального суперкомпьютерного центра в Цзинани и другие создатели ИИ-систем.Видеозаписи докладов уже доступны по ссылкам: 🤩Трек «ML & Research» 🤩Трек «Проду
    895video9521Open in Telegram
  • RnD ML Team

    14 Sept, 14:34

    До AI R&D DAY осталось меньше двух недель 📆 Обсудим альтернативные архитектуры, процессы обучения, память, бенчмаркинг и много чего ещё. В преддверии конференции решили напомнить о регистрации и разыграть 2 проходки на мероприятие. Места в офлайне разлетаются
    airndday.ontico.ruAI R&D DAYКонференция для исследовательских команд по развитию машинного обучения
    1,550321Open in Telegram
  • RnD ML Team

    11 Sept, 11:22edited

    🚀 3/3 EMNLP 2026 🚀Три из трех (!!!) наши статьи по исследованиям жестовых языков (РЖЯ в частности) прошли на EMNLP 2026. Это была последняя переподача, до этого было несколько реджектов на другие крупные конфы. Спасибо всем причастным, кто работал над созданием статей, особенно наших бывших коллег @karinakvanchiani @TOOFACK и @lizaforlizard ♥О чем писали и какие ревью пришли?🔤 Bukva: Russian Sign Language Alphabet https://arxiv.org/abs/2410.08675Bukva — открытый датасет изолированного дактиля (алфавита) русского жестового языка (РЖЯ). Он содержит 3757 видео (33 буквы, включая 8 динамических), записанных 155 дикторами. В качестве бейзлайнов использованы модели с модулем временного сдвига (TSM) на базе MobileNet/ResNet. Также представлено демо-приложение для обучения алфавиту.➕ 155 участников — это огромный шаг вперед по сравнению со старыми датасетами РЖЯ (где было от 4 до
    6,330261171Open in Telegram
  • RnD ML Team

    9 Sept, 09:27

    До AI R&D DAY осталось меньше двух недель 📆Обсудим альтернативные архитектуры, процессы обучения, память, бенчмаркинг и много чего ещё.В преддверии конференции решили напомнить о регистрации и разыграть 2 проходки на мероприятие. Места в офлайне разлетаются быстро, но победителю мы гарантируем посещение 🔥Условия розыгрыша просты: — подписаться на наши с коллегами каналы — пройти небольшой опрос в боте @RnD_DAY_BotИтоги подведём 14 числа отдельным постом 🤖
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    5,30011431Open in Telegram
  • RnD ML Team

    5 Sept, 20:18

    🌌 Deep Tech Night: как Яндекс делает конференцииСегодня прошла Deep Tech Night. Какие впечатления? Яндекс умеет делать ивенты — это факт. Пожалуй, Яндекс это заслуженный топ-1 🌿 по организации конференций для айтишников В РФ (в личном рейтинге админа канала).🔬 Про программу Коротко и по делу: треки по ML, инфраструктуре, много докладов про агенты и их применение в продакшене. Без воды, с живыми демо и спикерами, которые реально строят эти системы. Бонусом пригласили наших коллег из Гигачата 👋, рассказать про последние достижения в обучении российской LLM.🤝 Нетворкинг Главный магнит всех конференций — ты приходишь за докладами, а остаёшься ради людей, даже если уже нет сил стоять. Встретили кучу знакомых, бывших коллег, познакомились с новыми — те самые разговоры, которые ценнее сессий.
    Image from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML Team
    1,9701788311Open in Telegram
  • RnD ML Team

    3 Sept, 15:56edited

    🎧 Middle+ Speech Researcher / ML EngineerИщем ML-инженера, который активно работал с речевыми технологиями: ASR, TTS, омнимодальные речевые LLM.🔬 Над чем сейчас работаем 🏗 Omnimodal Fusion — нативное объединение аудио, текста и визуала в едином латентном пространстве, без костылей ⚡️ Полноценный голосовой full-duplex streaming — архитектура для работы в реальном времени: детекция перебиваний, low-latency инференс, потоковое обновление контекста 🧠 Latent Reasoning — многошаговые рассуждения прямо в hidden state, без генерации промежуточных токенов🛠 Чем предстоит заниматься — Формулировать research-гипотезы и валидировать их — Разбирать SOTA по omnimodal/full-duplex и находить точки для кратного апгрейда — Писать код, который можно воспроизвести: конфиги, чекпоинты, model cards — В случае успешных исследований, публиковаться на NeurIPS/ICLR/Interspeech и т.д. — опционально, но
    7,550711Open in Telegram
  • RnD ML Team

    2 Sept, 18:22

    🤖 Gemini научился понимать видео как агент: динамический анализ вместо статичного просмотра https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-agentic-video-in-gemini/📌 TL;DR Google DeepMind представила agentic video understanding — новую парадигму работы с видео для моделей Gemini. Вместо статичного анализа с фиксированной частотой кадров, модель теперь действует как агент: сама решает, какие моменты смотреть, с какой скоростью и через какую модальность (кадры, аудио, субтитры). Результат — снижение по объему токенов до 88%, ускорение до 66% по стоимости и рост точности до 7% на бенчмарках.Функция доступна в Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash‑Lite через Gemini API в Google AI Studio и Gemini Enterprise Agent Platform.🧠 Проблема: статическое видео — это дорого и неэффективно Раньше модели обрабатывали видео статически — брали фиксированное
    Image from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML Team
    2,0401474Open in Telegram
  • RnD ML Team

    1 Sept, 11:44

    🕳 Prompt injection: когда данные притворяются инструкцией?Решили устроить небольшую активацию с коллегами из Sber AI. Ниже продолжение, а с первыми уроками вы можете ознакомиться в каналах коллег.Языковая модель не различает, где заканчивается ваше задание и начинаются данные. Всё, что попало в контекст — системный промпт, ваш запрос, содержимое файла, текст веб-страницы, комментарий в тикете — для модели один поток текста. Значит, инструкцию в неё можете подложить не только вы. Это и есть prompt injection: во внешних данных спрятана команда, которую агент воспринимает как часть задачи.Пока агент просто отвечает в чате, риск невелик. Но у агента есть инструменты: он читает файлы, ходит в интернет, вызывает API, запускает команды. И тогда чужая инструкция превращается в действие — утечку токенов из .env, коммит с бэкдором, письмо не тому адресату, взлом систем (привет, Claude
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    1,600155311Open in Telegram
  • RnD ML Team

    31 Aug, 10:19

    🚀 MERA Text 2.0 — релиз нового текстового бенчмаркаЗа последние несколько лет модели стали заметно сильнее, и часть привычных текстовых бенчмарков уже перестаёт хорошо различать SOTA-модели. Поэтому мы пересобрали текстовый бенчмарк вокруг навыков, которые всё ещё остаются сложными и содержательными для оценки.В MERA Text 2.0 собрали 12 новых приватных тестов в четырёх группах: — 🧑 Human-Centric — юмор, метафоры, персонажность; — 🇷🇺 Culture-Specific — русский язык и культурный контекст; — 🛠 Agentic — сложные инструкции, структурированные ответы и использование инструментов; — 🧠 Reasoning — неоднозначность, логика и языковое рассуждение.Все тесты приватные, а полный прогон занимает существенно меньше времени. Оценка идёт по фиксированному протоколу и измеряет прежде всего возможности самой модели — без дополнительных reasoning- и agentic-обвязок. Старый публичный бенчмарк мы
    2,12096332Open in Telegram
  • RnD ML Team

    26 Aug, 12:22

    forwarded from @mashkka_ds

    👀#paperwatch Обзор конференции ICME'26В новом #paperwatch Илья Оводов и Марина Бессмертная рассказывают про свою поездку на ICME и про самые интересные статьи, которые они отметили для себя.👉YouTube ✒️Презентация 📌Труды конференции 📌Труды конференции (Worshops)#paperwatch
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    1,870442221Open in Telegram
  • RnD ML Team

    25 Aug, 15:45

    💪 У наших коллег вышло новое поколение GigaEmbeddings — моделей для поиска по документам и построения RAG-системКачество эмбеддингов особенно критично там, где цена ошибки высока: в поддержке клиентов, работе с юридическими и финансовыми документами и внутренними базами знаний. В новой линейке вышли три модели разного размера, которые бесплатно доступны разработчикам и бизнесу под открытой лицензией MIT.В новом поколении: ✔️ Увеличили объём обучающих данных в несколько раз, в том числе за счёт открытых датасетов Nemotron, F2LLM и KALM. ✔️ Усилили английский и код, не потеряв качество ответов на русском, благодаря мержингу экспертов и дистилляции. ✔️ Изменили архитектуру и добавили поддержку vLLM и SGLang — за счёт этого выросла скорость инференса: 3B ускорилась в 1,6 раза, а 10B-A1.8B — в 2 раза по сравнению с предыдущим поколением.Результаты: 🔘 1
    Image from a post by RnD ML TeamImage from a post by RnD ML Team
    2,0401483332Open in Telegram
  • RnD ML Team

    20 Aug, 08:47

    🤖 Automated Sign Language Tutor на IEEE ICME 2026📌 TLDR 5–9 июля наша команда в лице Ильи Оводова и Марины Бессмертной представила на IEEE ICME 2026 (Бангкок, rank A) стенд для обучения РЖЯ/ASL. В статье мы описали технологию + показали работающую систему вживую. Из 1400 работ конференции только 16 попали в демо-трек — гордимся, что мы среди них!⚙️ Что показывали • Реалтайм подход распознавания жестов для русского и американского жестовых языков • Интерактивное обучение: участники конференции могли освоить базовые жесты прямо на стенде • Код выложили в открытый доступ!🌏 Конференция в цифрах • 1400 статей, 5556+ авторов из 80+ стран • 16 работ в демо-треке (мы — одни из них) • Ключевые треки: Video Understanding, Multimedia LLM, Vision-Language Reasoning💡 Что запомнилось • Генерация полноценных мультфильмов с помощью ИИ • VR-шахматы + игра с распознаванием эмоций в голосе • Те
    Image from a post by RnD ML TeamImage from a post by RnD ML TeamImage from a post by RnD ML Team
    1,910144311Open in Telegram
  • RnD ML Team

    14 Aug, 13:46

    🧩 STARM: Открытый фреймворк для рекурсивных reasoning-моделей от AI ForeverНаша команда R&D NLP представила STARM — open-source фреймворк для обучения рекурсивных reasoning-моделей.📌 TLDR STARM — фреймворк для рекурсивных моделей, способных к многошаговым рассуждениям. Мы нашли оптимальную архитектуру, стабилизировали обучение и получили SOTA на алгоритмических бенчмарках. На выходе единая модель для всех задач + поддержка test-time scaling.🧠 Зачем? Рекурсивные модели, когда один блок применяется многократно, теоретически эффективнее трансформеров для алгоритмических задач, но на практике страдали от нестабильности и плохой воспроизводимости. STARM пытается решить эти проблемы.⚙️ Что внутри — Системный поиск лучшей конфигурации рекурсивного блока (нормализация, residual, gating) — Стабилизация обучения: gradient clipping, adaptive LR, curriculum по глубине — Единая архитектура
    GitHubGitHub - ai-forever/STARM: Recursive architecture for algorithmic tasks that repeatedly applies a single computational block. STARM…Recursive architecture for algorithmic tasks that repeatedly applies a single computational block. STARM outperforms models with larger parameter counts on Arithmetic, Conway's Game of Life...
    2,370121291Open in Telegram
  • RnD ML Team

    13 Aug, 08:00

    🇪🇺Доступность цифровых сервисов в ЕСНемного в тему предыдущего поста. С 28 июня 2025 года в Евросоюзе ввели обязательные правила для исполнения частным и государственным бизнесом на рынке ЕС. Европейский акт доступности (European Accessibility Act, EAA) — это директива Евросоюза, которая обязывает делать цифровые продукты и повседневные услуги удобными для людей с ограниченными возможностями, людей с инвалидностью и пожилых граждан.🌍 На что распространяется Закон затрагивает широкий спектр цифровых и электронных товаров, а также сферу услуг: — Интернет-магазины, сайты и мобильные приложения — Электронные книги и софт для их чтения — Банковские и финансовые онлайн-услуги — Терминалы самообслуживания, банкоматы и билетные кассы — Смартфоны, компьютеры, планшеты и операционные системы — Сервисы транспорта и аудиовизуальных медиа — Главные требования закона📌Главные требования
    1,710file32Open in Telegram
  • RnD ML Team

    12 Aug, 19:48edited

    🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст📌 TL;DR DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50).🧠 Зачем? Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт).Можно ли создать единую модель, которая (1)
    3,050video164311Open in Telegram