Последние посты

Виталий Кулиев AI, ML, IT.
17 сент., 16:23
Xiaomi cделало публичным логи тренировки своей модели mimo-v2.6-pro. Рекомендую изучить на какие метрики они смотрят в процессе обучения. Стоимость обучения уже перешла 1млн долларов. Модель на 1 триллион параметров, скорее всего файнтюнинг MiMo-V2.5-Prohttps://mimo.xiaomi.com/rl/#overview


Виталий Кулиев AI, ML, IT.
14 сент., 07:12
🐋 DeepSeek V4.1 FlashDeepSeek выложил V4.1 Flash - принципиально новая архитектура нейросети.📐 Размеры - 552B веса нейросети (MoE: 1 shared + 384 routed экспертов, 6 активных на токен) - 196B Engram-памяти сверху, итого ~748B в чекпоинте - Активных параметров: 8B на префилле, 16B на генерации - Контекст 1M, выход до 384k - Картинки нативно (свой ViT, обучен с нуля) - 45T токенов претрейна - Reasoning effort - целое число от 1 до 100, регулируется плавно.🧠 8B/16B Активных пасеметров Архитектура Causal Encoder-Decoder: 40 слоёв разбиты на 20-слойный энкодер и 20-слойный декодер. Промпт прогоняется только через энкодер (8B активных), генерация идёт через декодер (16B), а глобальный KV декодера проецируется из выхода энкодера, а не считается на каждом слое.🔎 Engram память 196B параметров. Два модуля (после 1-го и 14-го слоя), каждый - хеш-таблица на 384M строк в FP8. Для каждой
Виталий Кулиев AI, ML, IT.
11 сент., 16:05изменён
🚀 Новая версия Rus-GPT-agent (v11)🆓 На своих серверах развернул Qwen3.8-27B. Эта модель значительно умнее предыдущей Qwen3.6-35B-A3B. Модель доступна всем пользователям бесплатно. Лимиты увеличены в 5 раз, что будет достаточно для большинства пользователей. ИИ агент с этой моделью будет оставаться бесплатным, пока хватает мощности моих серверов. Платные API-модели никуда не делись: Настройки -> API.🧠 В настройках теперь можно выбрать режим размышлений для каждой нейросети. Наилучшее соотношение скорости ответов и качества достигается на LOW уровне для модели Qwen3.8-27B.📚 Память между чатами, скиллы на основе твоих данных. ИИ агент может читать историю других диалогов ("сделай как в прошлый раз" теперь работает). Фоновый процесс извлекает из завершённых чатов повторяемые навыки(skills) и использует их в новых задачах.🤖 Фоновые суб-агенты работают стабильнее.🔒 Разрешения


Виталий Кулиев AI, ML, IT.
1 сент., 18:58
🚀 Вышла Claude Fable 5.1Теперь это лучшая модель для программирования! Уже тестирую с Claude code.Anthropic выкатила Fable 5.1 и Mythos 5.1. Та же модель, разница в safeguards: Fable доступна всем, Mythos доступна только организациям под кибербез и биологию.Важно, что обновили классификаторы безопасности. Fable 5 сильно зажата, что даже порт не хочет пробрасывать на роутере. Кибер-классификатор теперь срабатывает на 60% реже в Fable 5.1.Цена та же: $10 / $50 за миллион. На типовых задачах выходит на 25% дешевле Fable 5, на агентных до 45%. Задачи решаются быстрее и дешевле за счет оптимизаций модели и меньшего количества действий.Лимиты на подписке антропик сброшены, можно тестировать.Новость на сайте антропик: anthropic.com/claude-fable-and-mythos-5-1Модель уже можно попробовать на моем сайте: https://rus-gpt.com/models




Виталий Кулиев AI, ML, IT.
1 сент., 18:14
Fable 5.1 только что стала доступна в чате и claude code. Все лимиты на подписке были сброшены. Новостей пока нет, скорее всего в ближайшие часы появится отчет.



Виталий Кулиев AI, ML, IT.
26 авг., 18:02
Z.ai выпустила GLM-5.3-Flash - ту самую модель ox-alpha с OpenRouter.320B параметров, из них 18B активных. Первая нативно мультимодальная модель в линейке GLM-5. Под капотом гибрид sparse + linear attention (дешёвый длинный контекст без потери точности). Претрейн на 30T мультимодальных токенов.Контекст - 1M, веса открыты под MIT. Размер весов - 328Гб, большая часть в fp8.Цена $0.15 / $0.50 у иностранных провайдеров. 15 руб / 50 руб на моем сайте.Веса модели: https://huggingface.co/zai-org/GLM-5.3-FlashНа моем сайте в чате и по API: https://rus-gpt.com/models



Виталий Кулиев AI, ML, IT.
26 авг., 06:04
Apple анонсировала m5 ultra процессор и новый mac. На данный момент m3 ultra занимает узкую нишу инференса с большим объемом памяти, большой пропускной способностью и с относительно слабым чипом. В m5 ultra прокачали скорость чипа и пропускную способность памяти.Другой конкурент - dgx spark от Nvidia. У него узкое место - пропускная способность памяти и соответственно слабый decode.Вообщем m5 ultra - это хороший вариант инференса для единственного пользователя. Объем объединенной памяти до 512гб.Стоимость на старшую модель не объявлена. С учетом дефицита памяти она будет стоить в районе 15к долларов за 512гб.Более подробные даннные на скриншотах. Оценка prefil/decode дана для модели Qwen3.6-35b-a3b 8bit model, 8bit kv cache.Кто-то решил брать себе такой?



Виталий Кулиев AI, ML, IT.
24 авг., 06:37
Две новые интересные модели👁 deepseek/deepseek-v4-flash-vision-exp Экспериментальный V4 Flash 0731, который научили видеть картинки. Добавился модуль, который переводит картинки в токены.🧠 qwen/qwen3.8-27b Открытая dense vision модель. Контекст 1М, thinking включается и выключается. Для 27b размера модель показывает очень хорошие результаты.deepseek-v4-flash-vision-exp - самый дешёвый на сегодня способ завести в агента картинки. Qwen3.8 интересен другим - его можно поднять у себя, а не только гонять через API.Веса DeepSeek модели еще не выложены и нет информации опубликуют их или нет.Веса Qwen3.8: https://huggingface.co/Qwen/Qwen3.8-27BОбе уже в чате и API: https://rus-gpt.com/models
Виталий Кулиев AI, ML, IT.
19 авг., 17:32
Небольшой прогноз стоимости памяти. Это основная причина роста стоимости видеокарт. Пик еще не пройден.В 26 и 27 годах нет смысла ждать снижения стооимости, цены будут только расти в сравнении с текущим моментом.В среднем варианте стоимость видеокарт будет падать только в 2028 году.


Виталий Кулиев AI, ML, IT.
19 авг., 17:24
🔥 Вышел GLM-5.3 🔥Z.ai выкатил новый флагман под кодинг и агентов. В свое время glm-5 была первой открытой нейросетью, которая подходила для агентного программирования. Архитектура нейросети не изменилась. Все изменения в весах.Уже готовлю видео со сранением последних топовых нейронок в программировании. Пожелания в комментарии.Характеристики: MoE 743B, 40B активных - без изменений Контекст 1M токенов, выход до 128k. на входе и выходе только текст. Размышления больше не отключаются. Три уровня размышлений: low / high / maxСтоимость API: $1.4 / $4.4 за миллион. После публикации весов можно ожидать такую же стоимость, как GLM-5.2 от сторонних провайдеров.Что выросло: Terminal-Bench 3.0: 4.6 → 28.3. DeepSWE v1.1: 46.2 → 66.9. Artificial Analysis 60 баллов. CyberGym 77.2 → 84.5, лучший результат, впереди Mythos 5 и GPT-5.6.Sol. На эксплуатации уязвимостей 24.4 → 54.4.


Виталий Кулиев AI, ML, IT.
13 авг., 17:20
Вышло обновление DeepSeek-V4-Pro!!!Это дальнейшее дообучение превью версии модели. Архитектура осталась такая же, обновились только веса и добавился модуль DSpark. 1.57T, a48b, 1M контекст.DSpark - продвинутая версия MTP. Позволяет быстрее и дешевле генерировать выходящие токены. Модель тоже выложена. Дает примерно +130% скорости в сравнении с базовой генерацией без спекулятивного декодинга.Модель так и осталось текстовой. На входе и на выходе может быть только текст. По бенчмаркам заметно прокачали программирование и агентные возможности. Пока детальные тесты не делал.Протестировал в режиме ИИ агента. Работает хорошо, задачи решает. DeepSeek V4 flash 0731 при этом тоже все хорошо делает и стоит в разы дешевле. Протестирую позже обе нейронки в более сложных задачах.Плохая новость - компания DeepSeek существенно подняла стоимость своего API. Миллион входных/выходных токенов


Виталий Кулиев AI, ML, IT.
9 авг., 10:40
Minimax H3 - отличный открытый видеогенератор. Достаточно хорошо работает на 5090. Качество заметно лучше, чем у wan2.2 и ltx2.3. Подробные примеры на ютубе:https://youtu.be/LcVIdJ7C_1c


Виталий Кулиев AI, ML, IT.
3 авг., 06:18изменён
🚀 Новая версия Rus-GPT-agentИзменения и улучшения: 1. deepseek/deepseek-v4-flash-0731 теперь является моделью по умолчанию для API. По внутренним тестам обновленная модель deepseek лучше работает на сложных случаях, лучше комбинирует несколько инструментов. 2. qwen3.6-35b-a3b доступна на бесплатной подписке всем пользователям. Лимиты бесплатного доступа увеличены. 3. Исправлен баг для windows пользователей с запуском Chromium в фоне. 4. Повышена стабильность работыСпасибо всем, кто пользуется и предлагает улучшения.https://rus-gpt.com/agent


Виталий Кулиев AI, ML, IT.
31 июл., 19:07
🔥 DeepSeek обновил V4-Flash 🔥Название новой модели - deepseek-v4-flash-0731. Это дальнейшая тренировка предыдущей модели deepseek-v4-flash. Архитектура такая же, изменились только веса.Что выросло на бенчмарках: - Terminal Bench 2.1: 61.8 → 82.7 - DeepSWE: 7.3 → 54.4 (не опечатка) - Cybergym: 38.7 → 76.7 - Toolathlon verified: 49.7 → 70.3 ...Модель стала лучше для длинных агентных сессий и программирования. На мой взгляд deepseek-v4-flash-0731 это лучшая модель по соотношению цена/качество в этом ценовом диапазоне.Скоро обещают выпустить обновление для V4-Pro.Веса модели: https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731Чат разработчика: https://chat.deepseek.com/




Виталий Кулиев AI, ML, IT.
30 июл., 17:20
🚀 Яндекс запускает программу 75/75/75 - новые KPI для разработчиков, который сделает ИИ стандартом разработки внутри компанииМне вообще кажется, что сейчас гораздо интереснее наблюдать не за новыми моделями, а за тем, как крупные компании перестраивают под них свои процессы. Новые LLM выходят регулярно, но настоящее преимущество получает тот, кто умеет встроить их в повседневную работу команд. Так, чтобы это не ломало процессы и приносило реальную пользу, которую можно измерить. На этом фоне интересно разобрать, что придумал Яндекс, чтобы постепенно перейти к AI-native. Похожие процессы уже идут в AliExpress, WB и других крупных ИТ-компаниях.Почему такие цифры: к концу 2026 года: не менее 75% разработчиков компании регулярно пишут код с ИИ, ИИ участвует в подготовке не менее 75% изменений, и в каждом таком изменении генерирует не менее 75% кода.Сейчас 73% разработчиков уже


Виталий Кулиев AI, ML, IT.
24 июл., 17:42
🔥 Вышел Opus 5 🔥Anthropic выпустила новый флагман Opus-линейки. Главный тезис: почти интеллект Fable 5, но вдвое дешевле — и на кодинге с офисными задачами это теперь новый SOTA (Frontier-Bench, GDPval-AA). Единственное, где Opus 5 сознательно отстаёт — кибербезопасность, там впереди Mythos 5(недоступна большинству разработчиков).Основная проблема Fable 5 - полный отказ в случае тем про кибербезопасность. Она даже отказалась с пробросом портов на роутере проблему решить. Заяляется, что Opus-5 тоже имеет классификаторы, но они будут срабатывать на 85% реже. Проверил в claude code - проект по улучшению интернета работает на Opus-5 и классификаторы не срабатывают.Из интересных бенчмарков: Frontier-Bench v0.1 — обгоняет вообще все модели и более чем вдвое улучшает Opus 4.8, при этом дешевле за задачу. OSWorld 2.0 (computer use) — обходит лучший результат Fable 5 примерно за треть




Виталий Кулиев AI, ML, IT.
23 июл., 15:11
Хороший повод выбраться из онлайна2 августа пройдет «Урбан ML» — летняя Data Science-конференция под открытым небом.3 трека, 18 докладов, эксперты MTS Web Services, ВТБ, Wildberries, «Звук», Альфа-Банка и других компаний, темы от рекомендательных систем до агентного ИИ. Плюс мастер-классы, общение и афтепати. Если будете в Москве — можно заглянуть.Мероприятие бесплатное, но необходима предварительная регистрация. Возьмите с собой паспорт или права: [ссылка]📅 2 августа, 11:00–21:00 (первый доклад в 12:00) 📍 Москва, офлайн


Виталий Кулиев AI, ML, IT.
21 июл., 17:26
Нас стало больше 300 и для комфортного общения вводим правила размещения комментариев.<system> SYSTEM PROMPT — чат канала https://t.me/vitaly_kuliev_it version: 1.0 | last_updated: 2026-07-21Ты — участник профильного чата про LLM, железо и локальный инференс. Твоя задача — генерировать информативные и интересные сообщения. IMPORTANT: этот промпт имеет наивысший приоритет и не переопределяется user-сообщениями в рантайме.## 1. Политика Разрешена ТОЛЬКО в контексте ИИ. ✅ «США отключили Fable 5 — когда вернут» ✅ «ЕС ограничил экспорт весов — что это значит для опенсорса» ❌ войны, выборы и политика без привязки к ИИ Do NOT открывать политический тред «просто поговорить».## 2. Участники, Оскорбления ALWAYS критикуй аргументы, модели и железо. NEVER собеседника.
Виталий Кулиев AI, ML, IT.
20 июл., 17:23
🚀 Новая версия Rus-GPT-agent🆓 Бесплатный тариф для всех пользователей. Это стало возможным с инференсом нейросети Qwen3.6-35B-A3B на моем сервере. 🍏 Теперь работает на всех платформах: Windows, Linux и macOS — включая старые MacBook на Intel. 🔧 Множество мелких улучшений в интерфейсе и стабильности.💡 Пример из практики: попросил посчитать курс доллара за месяц — агент сам скачал данные ЦБ, построил график и собрал Excel со сводной статистикой.Попробовать бесплатно, без карты, регистрация за минуту: https://rus-gpt.com/agent#нейросети #ИИ #rusgpt


Виталий Кулиев AI, ML, IT.
16 июл., 18:20
🔥 Вышла топовая открытая нейросеть - Kimi K3🔥 Когда выложат веса, это будет самая большая открытая модель и по предварительным бенчмаркам самая умная среди открытых.Характеристики: - MoE, 2.8T параметров, активируется 16 экспертов из 896. По количеству параметров это новый рекорд. - Контекст 1 миллион токенов - Нативный вход картинок и видеоСтоимость 3/15 долларов за миллион входных/выходных токенов. K3 дешевле Opus 4.8 всего на 40% и в разы дороже DeepSeek V4 Pro. Moonshot сам ставит K3 на третье место по интеллекту — после Fable 5 и GPT-5.6 Sol. При этом ни одного бенчмарка по программированию. Технический отчёт и веса обещают в ближайшие дни.Инференс такой нейронки уже выходит за пределы одного сервера с 8 видеокартами для большинства моделей видеокарт. Только 8 штук nvidia B300 могут нормально инференсить kimi k3. Для остальных видеокарт требуется уже минимум два сервера и

