Latest posts

Neurohive
19 Sept, 13:57
Vidu S2: модель генерирует видео-аватары и редактирует стримы на лету в 720p при 25–42 FPSTsinghua University и Shengshu Technology представили две видеомодели, с помощью которых можно создать цифровой аватар и провести с ним видеозвонок или запустить стрим, а видеопоток редактировать в реальном времени. И все это в 720p при 25–42 FPS. Есть и режим без трансляции: загружаете фотографию и аудиодорожку, получаете готовый ролик, где аватар проговаривает текст по сценарию.Vidu S2-Avatar на основе одной фотографии создает цифровой аватар: он произносит поданную аудиодорожку, меняет выражение лица, переводит взгляд, жестикулирует и выполняет текстовые или голосовые команды, вплоть до танца. Поток не ограничен по длине. Новую опорную картинку можно подать в любой момент прямо посреди трансляции: показали кружку – персонаж берёт её в руку, показали пиджак – надевает его, подали пляж –
Neurohive
9 Sept, 12:19edited
WorldSculpt: модель собирает 3D-сцену с сотнями отдельных объектов из видеоAlaya Lab и Токийский университет представили открытую модель, которая строит 3D-копию комнаты или улицы, где каждый предмет остаётся самостоятельным мэшем. Стул можно выделить, отодвинуть, уронить в физическом движке. Существующие подходы либо склеивают сцену в один кусок геометрии, либо оставляют дыры там, где предмет закрыт другим. Код модели опубликован на Github, веса - на HuggingFace.Из отснятого помещения получается сцена в Blender или Unity, где мебель существует по отдельности: диван можно убрать, стол подвинуть, лампу заменить другой моделью. Для игр так собирают уровни из реальных интерьеров. В AR приложение начинает понимать, что перед ним стол, а не безымянная поверхность. Дизайнеру интерьеров такая сцена даёт готовый набор ассетов вместо цельной болванки. Роботы могут отработать захват кружки в
Neurohive
31 Aug, 12:59
🗣 VoiceMem: фреймворк памяти для голосовых ассистентов поднимает факты из всех прошлых диалогов за 134 мсКоманда из Nanyang Technological University, NUS, Tsinghua и CUHK выпустила VoiceMem - быструю память для голосовых ассистентов, работающих в реальном времени. VoiceMem держит в двух параллельных графах всё, что ассистент узнал о пользователе: быт, здоровье, работу, отношения, цели и знания в одном, характер и эмоции в другом. К моменту, когда пользователь заканчивает фразу, нужный факт уже найден.Речевая модель не может держать в контексте всю историю общения, поэтому после каждого диалога отдельная LLM вытаскивает из него короткие утверждения и складывает их в базу по одной записи на утверждение: «я вегетарианец», «у меня аллергия на орехи», «сестру зовут Аня». Когда пользователь задаёт новый вопрос, из базы достаются несколько подходящих записей и дописываются в промпт
Neurohive
24 Aug, 10:39
4DAnyone: 4D-модель человека из видео, снятого одной камеройИсследователи из Zhejiang University, Robbyant, Ant Group и HKUST представили 4DAnyone - открытый фреймворк, который строит 4D-модель человека на основе видео, снятого с одной камеры. 4DAnyone генерирует 16 согласованных между собой ракурсов, а по ним уже собирается объёмная сцена в формате 4D Gaussian Splatting. Раньше для такого требовалась студия с десятками синхронных камер. Готовую модель человека можно смотреть с любой точки в VR-шлеме, вставлять в игру или AR-сцену, использовать как данные для обучения роботов движению. Наилучшие результаты достигаются при одном человеке в кадре, спокойном движении камеры и облегающей одежде.3D-модель - это объект, который можно осмотреть со всех сторон, но застывший в одной позе. 4D-модель добавляет четвёртую ось - время. Cцена меняется от кадра к кадру, объект двигается, и при этом
Neurohive
11 Aug, 10:58edited
JoyAI-Video-Edit: 16B-модель редактирует видео в реальном времени при 30 FPS в 720p на одной B200Команда Joy Future Academy представила JoyAI-Video-Edit — открытую авторегрессионную диффузионную модель на 16B параметров для редактирования видео в реальном времени. Модель обрабатывает кадры по текстовому промпту по мере их поступления, без доступа к будущим кадрам и не зная длину ролика. Полный сквозной пайплайн выдаёт 30.19 FPS в разрешении 720×1280 на одной Nvidia B200.JoyAI-Video-Edit умеет менять фон, стиль (акварель, масло, мультфильм), добавлять, удалять и заменять объекты и людей в кадре, менять одежду и внешность, изменять движения персонажей и объектов. Отдельно поддерживается редактирование по референсной картинке, когда одежда или предмет с фотографии переносится на человека в видео. Всё это работает поверх исходного ролика, оставляя без изменений движения, композицию и те
Neurohive
3 Aug, 10:06edited
TurboVLA: робот получает команды в разы быстрее при 97% успешных выполнений благодаря замене LLM на BERTИсследователи из Хуачжунского университета науки и технологий и Huawei опубликовали TurboVLA - компактную vision-language-action модель, которая выдаёт действия для робота за 31.2 мс на RTX 4090 и набирает 97.7% на бенчмарке для роботов LIBERO. Главное отличие от других VLA в том, что внутри нет LLM. Вместо неё лёгкий текстовый энкодер BERT, а картинка и инструкция обмениваются информацией напрямую через модуль кросс-внимания. Отсюда 0.2B параметров вместо миллиардов и меньше 1 ГБ видеопамяти на инференсе.Обычно VLA-модели устроены так: робот получает картинку с камеры и текстовую инструкцию по типу «сложи три миски друг на друга». Визуальные признаки сначала проецируются в пространство токенов языковой модели, склеиваются с токенами инструкции, прогоняются через модель, и уже из
Neurohive
22 Jul, 12:44
🗜Bonsai: 1-bit версия Qwen 27B работает на iPhone c сохранением 90% качества ответовСтартап PrismML выпустил Bonsai 27B — бинарную и тернарную версии Qwen3.6-27B, которые сохраняют 90–95% качества исходной модели при сжатии весов в 9.4–14.2 раза. Тернарная версия занимает 5.9 ГБ и работает на ноутбуке (M5 Pro) со скоростью около 26 токенов в секунду, а 1-битная умещается в 3.9 ГБ и генерирует около 11 токенов в секунду на iPhone 17 Pro Max, или около 30 слов в секунду. Это первый случай, когда модель такого класса запускается на телефоне.Обычное квантование ниже 4–5 бит ломает модели резко, а не постепенно. Текст остаётся гладким и уверенным, но рассуждения начинают противоречить сами себе, вызовы инструментов перестают парситься. До сих пор это обходили только обучением с нуля сразу в низкобитном виде (подход BitNet от Microsoft), но такие модели
Neurohive
8 Jul, 11:23
🎮 MIRA: нейросеть полностью симулирует Rocket League для четырёх игроков в 20 FPS, не требуя установки игрыGeneral Intuition, Kyutai и Epic Games представили MIRA — мировую модель, которая полностью симулирует игровую среду Rocket League сразу для четырёх игроков и рисует каждому свою картинку в реальном времени. Движка игры внутри нет вообще. Ни физического движка, который считает столкновения мяча и машин, ни рендерера, который рисует арену. Всё это заменяет одна нейросеть, которая по нажатиям кнопок сама дорисовывает следующий кадр. Игра целиком «живёт» внутри весов модели, поэтому запустить её можно локально, без установки оригинальной Rocket League.Под капотом диффузионный трансформер на 5B параметров. Он предсказывает не пиксели напрямую, а сжатое скрытое представление кадра поверх замороженного экстрактора признаков DINOv3-L: кадры сначала сжимает видео-кодек, модель
Neurohive
2 Jul, 09:05
⚡Выбирать железо для обучения и инференса моделей больше не нужноQwen, Whisper, Deepseek и другие нейросети уже готовы к работе на приватной инфраструктуре. Просто выбираете нужную модель и получаете готовый инференс-сервис в пару кликов в Selectel.Каталог ИИ-моделей Selectel — удобный инструмент для работы с нейросетями, когда нужны безопасность и производительность.Что вы получаете в пару кликов:⚡Большой выбор моделей для ваших задач: для генерации текстов и кода, распознавания речи, создания контента и других. ⚡Производительность и гибкое масштабирование. Инференс-сервис развернут на современном железе с актуальными видеокартами и автоматически адаптируется при росте или снижении нагрузки. ⚡Прогнозируемая стоимость: платите за фактическое время потребления вычислительных ресурсов.Начните работать с ИИ-моделями на выделенной инфраструктуре: https://slc.tl/ibq7gРеклама, АО


Neurohive
1 Jul, 15:08edited
Claude Sonnet 5: сильный агентный апгрейд, но не очевидная замена OpusAnthropic представила Claude Sonnet 5 — новую модель из линейки Claude, доступную в том числе пользователям бесплатного тарифа. Она ориентирована на агентные задачи, программирование, работу с инструментами и корпоративную автоматизацию. По данным Artificial Analysis, Sonnet 5 набрала 53 балла в Intelligence Index и стала моделью №5 в рейтинге по общему интеллекту модели. Она отстает от GPT-5.5 и Claude Opus 4.8 всего на 2–3 балла, от Fable — на 7 баллов, а по сравнению с Sonnet 4.6 прибавила 6 баллов на максимальном уровне рассуждений.В кодинге прирост тоже заметен. Cursor сообщил, что на CursorBench — тесте реальных многофайловых задач из Cursor — Sonnet 5 набрала 57% против 49% у Sonnet 4.6.Но главный нюанс — стоимость. В тестах Artificial Analysis одна задача на Sonnet 5 при стандартной цене API стоила


Neurohive
30 Jun, 07:51
LFM2.5-230M: ультракомпактная модель работает на Raspberry Pi и почти любом современном телефонеКоманда Liquid AI выпустила LFM2.5-230M — одну из самых маленьких языковых моделей на сегодня, всего на 230 миллионов параметров. Модели хватает 293 МБ памяти на Raspberry Pi 5 и 375 МБ на смартфоне. На Raspberry Pi 5 модель выдаёт 42 токена в секунду при декодировании, а на флагмане Galaxy S25 Ultra разгоняется до 213 т/с. Человек читает текст со скоростью примерно 5–7 т/с. На бенчмарках модель конкурирует с моделями вдвое больше и часто их обходит.Модель поставили на человекоподобного робота Unitree G1, и она работала на встроенном чипе NVIDIA Jetson Orin. Модель выступила в качестве слоя выбора навыков: берёт одну команду на обычном языке вроде «постой 2 секунды, потом иди вперёд со скоростью 1 м/с на 3 метра» и раскладывает её на последовательность вызовов готовых низкоуровневых
Neurohive
29 Jun, 08:04
Выбираем железо для обучения и инференса моделей 🔝Простая формула: чем больше у модели параметров, тем более мощное железо нужно для ее инференса. Найти решение для нейросетей разного масштаба можно в Selectel.Более 15 моделей видеокарт — от RTX 4090 до B300 — доступны к аренде в облаке и на выделенных серверах. Облачные серверы подойдут для тех, кому нужна гибкость и быстрая масштабируемость, а выделенные — когда необходима физическая изоляция инфраструктуры, а нагрузки стабильные. Видеокарты в облаке можно арендовать даже на час, цена стартует от 5 рублей.Выбирайте оптимальный сервер с видеокартой и арендуйте его от 5 рублей в час: https://slc.tl/rqf62Реклама, АО «Селектел», erid: 2Vtzqwcao6q
2,260Open in Telegram
Neurohive
19 Jun, 06:05
DreamX-World-5B: открытая модель генерации мира с контролем камеры, текстовым управлением и запоминанием локацийКоманда AMAP-ML опубликовала DreamX-World 1.0 — интерактивную генеративную модель мира, которая превращает текст или изображение в управляемое видео с точным контролем камеры, памятью о ранее посещённых сценах и поддержкой добавления событий по текстовым промптам. Модель работает в фотореалистичных, игровых и стилизованных визуальных доменах.Исследователи дообучили базовую модель Wan2.2-TI2V поэтапно: сначала для управления камерой, затем для долгосрочной памяти о сцене, событийного управления и авторегрессивной генерации длинных видео. На восьми GPU RTX 5090 модель работает в реальном времени со скоростью до 16 FPS.DreamX-World 1.0 — единственная публично доступная модель, поддерживающая все пять уровней управления действиями: реакцию на текстовые промпты, события на
Neurohive
16 Jun, 12:24
🤔 VibeThinker: 3B-модель рассуждает и кодит на уровне DeepSeek V3.2, GLM-5 и Gemini 3 ProКоманда Sina Weibo AI опубликовала VibeThinker-3B — компактную языковую модель, которая на задачах математики и программирования показывает результаты уровня флагманских моделей DeepSeek V3.2, GLM-5 и Gemini 3 Pro, при этом уступая им в размере в 200+ раз. Код и веса модели опубликованы на Github и HuggingFace.Авторы сформулировали гипотезу о параметрическом сжатии: одни способности моделей сжимаемы, другие нет. Верифицируемые рассуждения относятся к первым — алгоритм решения универсален и повторяем, его можно плотно уложить в небольшое число параметров. Энциклопедические знания относятся ко вторым: каждый факт, понятие и редкий сценарий требует отдельного места, поэтому здесь масштаб по-прежнему важен. Оказалось, что 3B параметров достаточно, чтобы войти в топ


Neurohive
4 Jun, 13:24
ESM Cambrian: модель для предсказания и дизайна белков превзошла AlphaFold3 от Google и построила крупнейший атлас белкового мираКоманда исследователей из Biohub представила ESM Cambrian (ESMC) — открытую языковую модель для предсказания и дизайна белков, которая обошла AlphaFold3 от Google по точности предсказания структур белка. Модель построила атлас из 6,8 миллиарда белковых последовательностей — готовую базу для поиска новых лекарств, ферментов и материалов без дорогостоящих лабораторных экспериментов.ESMC спроектировала молекулы с аффинностью до 0,068 нМ к мишеням CTLA-4 и EGFR — это уровень лучших клинически одобренных антител для лечения рака. Классический лабораторный цикл для получения молекулы такого качества занимает месяцы. Авторы показали, что вычислительный скрининг через ESMC даёт сопоставимый результат за дни.ESMC обучена по принципу предсказания замаскированных
Neurohive
28 May, 10:42
LLaVA-OneVision-2-8B: мультимодальная модель анализирует видеопоток через кодек вместо нарезки кадровИсследователи из Glint Lab, AIM for Health Lab и MVP Lab опубликовали LLaVA-OneVision-2 — мультимодальную модель нового поколения, которая переосмысливает то, как нейросеть «смотрит» видео. Вместо того чтобы нарезать видео на равномерные кадры, модель анализирует сжатый видеопоток через кодек.Большинство моделей просто нарезают видео на 8–32 равномерных кадра и выбрасывают остальное. Если что-то важное происходит между двумя отобранными кадрами, модель это просто пропустит. Видеокодеки вроде H.264 уже содержат информацию о том, где в видео происходят изменения, LLaVA-OV-2 использует именно её. Модель отбирает фрагменты с высоким битрейтом, где происходит движение или смена сцены. В итоге токены концентрируются там, где в видео действительно что-то происходит, а не размазываются
Neurohive
21 May, 07:40
LongLive-2.0 — 5B-модель генерирует минутное видео в 720p в реальном времениИсследователи из NVIDIA опубликовали LongLive-2.0 — инфраструктуру для обучения и запуска моделей генерации длинных видео с использованием 4-битного квантования NVFP4. NVFP4 — собственный формат NVIDIA, нативно поддерживаемый на GPU архитектуры Blackwell (GB200), так что полное ускорение доступно только на этом железе. В исследовании сравнивается квантование BF16 и NVFP4. BF16 хранит каждое число в 16 битах, NVFP4 сжимает их до 4 бит, поэтому модель занимает меньше памяти и быстрее считает. Теоретически это должно снижать качество генерации, но авторы показывают, что на практике результаты почти не отличаются от BF16: 85.06 против 84.51 балла на VBench.Wan2.2-TI2V-5B, дообученная с помощью LongLive-2.0, генерирует 720p-видео со скоростью 45.7 FPS. Предыдущие методы выдавали 20-25 FPS при разрешении 480p.
Neurohive
14 May, 13:52
SenseNova-U1: новая мультимодальная архитектура NEO-unify работает напрямую с пикселями без VAEКоманда SenseNova представила мультимодальную архитектуру SenseNova-U1, которая объединяет понимание изображений, генерацию и редактирование внутри единого трансформера без VAE или визуального энкодера. Архитектура NEO-unify не только упрощает модель, но и делает мультимодальное обучение заметно эффективнее: 8B-модель превосходит OmniGen и FLUX.1-Kontext на задачах генерации изображений, инфографики и сложных макетов.Модель умеет генерировать и редактировать изображения, распознавать текст и разбирать документы, работать в мультимодальном чате, выполнять смешанную генерацию текста и изображений, решать задачи визуального рассуждения и создавать инфографику со сложными макетами.SenseNova-U1 изначально обучается как единая мультимодальная фундаментальная модель, а не как набор соединённых




Neurohive
7 May, 11:19edited
OpenSeeker-v2: лучший в своем классе Deep Research агент, созданный академической командой всего на 10600 примерахИсследователи из Шанхайского университета Цзяо Тун представили OpenSeeker-v2 — агента, который самостоятельно исследует интернет в ответ на сложный вопрос: формулирует цепочку поисковых запросов, читает страницы, сопоставляет источники и выдаёт развёрнутый ответ. Для обучения использовалось всего 10600 правильно подобранных примеров, сгенерированных полностью автоматически без участия людей-разметчиков. Модель обучили за один этап, без предобучения и без обучения с подкреплением.OpenSeeker-v2 побила Tongyi DeepResearch от Alibaba на четырёх бенчмарках: 46.0% против 43.4% на BrowseComp, 58.1% против 46.7% на BrowseComp-ZH, 34.6% против 32.9% на Humanity's Last Exam, 78.0% против 75.0% на xbench.OpenSeeker-v2 построен на базе Qwen3-30B-A3B-Thinking-2507 — 30B MoE модели,


Neurohive
28 Apr, 12:21edited
🎮 OpenGame: агент генерирует полноценные браузерные игры по текстовому описаниюИсследователи из CUHK MMLab представили OpenGame — открытый агентный фреймворк для создания 2D-игр. Пользователь пишет идею, агент самостоятельно генерирует код, графику и музыку. На выходе получается работающая браузерная игра.Фреймворк состоит из трёх компонентов: 1. Модель GameCoder-27B, обученная на базе Qwen3.5-27B на репозиториях Phaser/JavaScript в три этапа: дообучение на корпусе без разметки, обучение с учителем, обучение с подкреплением. 2. Агентный пайплайн из 6 фаз: классификация типа игры, построение каркаса проекта (scaffolding), генерация геймдизайн-документа, создание мультимодальных ассетов (изображения, музыка), написание кода, верификация с самоисправлением через запуск билда в браузере. 3. Механизм итеративного улучшения GameSkill. Агент учится на
Related Channels
Other channels in the same section of the catalogue.
