Последние посты

AI Projects
22 сент., 20:11
🔄 Обновились OpenAI и Anthropic, давайте смотреть. У Anthropic давно заброшен Haiku и своей worker-модели нет. Однако у OpenAI есть Luna, вышла ее 6я версия. По цене она дороже флешек китайцев, ещё почти в дауне лежит гейтвей на самом OpenAI, быстро работает только на Amazon. Поэтому скорость скорее всего будет только за покупку токенами.Для американцев Luna важна как «суверенная модель», но на международном рынке китайские флешки дешевле и быстрее.


AI Projects
22 сент., 18:49
🎬 Обсудим, какие есть методы апскейла видео, совместимые с архитектурой Blackwell в RTX 50-й серии, т.е. NVFP4. Для начала отметим, что сейчас де-факто уже стандарт — не генерировать из того же MiniMax H3 видео очень высокого разрешения, а делать в более низком, а потом upscale. Даже такой процесс есть в готовом виде от Nvidia, но тут всё не так просто, давайте разбираться.Если вам нужен NVFP4, то скорее всего вариант апскейла сократится до SeedVR2, которую недавно мигрировали в этот формат. Это 7B-модель, которая в NVFP4 весит всего 4.4 ГБ, что, как мы увидим далее, критично, т.к. у вас в VRAM будет больше занимать не веса, а само видео. Вам надо много свободной VRAM.⚙️ Как вписаться в 16 ГБ (главные грабли) • Длинное видео целиком НЕ влезает: на выходе 124+ кадров × 2688×1536 → «Not enough GPU memory» + spill в shared RAM (GPU 100%, но холодная = ядра ждут память) • Лечение:


AI Projects
22 сент., 14:44
🔍 К спорам в чате: сделан ли Jev на ModernBERT или нет. Большинство экспертов считают, что да. В их числе почитаемый и у нас в чате Себастьян Рашка.Однако самый сильный тест — просто на родственные архитектуры прямым изготовлением аналога. ModernBERT-base-zeroshot cross-encoder на 149M весов отличается по бенчмарку, и разрыв составляет всего 0.6% по датасету сравнения комбинацией известных как SST-2, AG News, Emotion и BANKING77 по 2500 примеров каждый. Тут как говорится «Совпадение? Не думаю!»Отдельно отмечу по дискуссии в чате, что многие замечают чувствительность Jev к смене порядка слов или вариантов. Это не доказывает наличие маскированного внимания. Обычный BERT также видит Positional Encoding и понимает/различает порядок слов или вариантов. BERT не умеет предсказывать последовательности токенов как обычные каузальные трансформеры, т.к. будет пытаться как на обучении


AI Projects
22 сент., 13:53
🚩 Сейчас идёт настоящий бум Decision-моделей. В топе Hugging Face совсем не Qwen или DeepSeek, а Laya. Начался бум с Jev (API-аналог), который отвечает за 236–276 мс, но Laya ещё быстрее ~33 мс. Фантастическая скорость, крошечный размер и невероятная дешевизна в решениях выбора между вариантами создали бум таких моделей.Однако я заметил, что многие откровенно наивно используют такие крошечные модели без понимания, что без дообучения они мало отличаются от подбрасывания монеты по точности. Разработчики Laya сами пишут: «Laya is a fast base to specialise, not a zero-shot decision engine». Zero-shot точность на typed-decisions составляет всего 0.362 — чуть выше случайного угадывания (0.318). Но после дообучения на тренировочном сплите того же бенчмарка точность поднимается до 0.766, обгоняя Jev (0.727).Архитектурно такие модели построены на ModernBERT, но BERT имеет известную славуhuggingface.coconvaiinnovations/laya · Hugging FaceWe’re on a journey to advance and democratize artificial intelligence through open source and open science.
AI Projects
22 сент., 10:43
📊 На OpenRouter уже можно посмотреть статистику моделей. Можно оценить «какая флешка лучше». На деле вряд ли позиции DeepSeek V4.1 Flash тут пошатнуть получится, т.к. у него козырь очень высокой скорости. GLM на деле для абонентских подписок у зайцев быстрее напрямую через их API, чем OpenRouter показывает — 50 токенов/сек примерно, но это тоже медленней DeepSeek.Однако MiMo-V2.6-Flash дешевле DeepSeek V4.1 Flash где-то в 2 раза получается. Если у вас очень большой объём токенов для worker-моделей, то MiMo-V2.6-Flash тут экономически целесообразен. Если вам важнее скорость пайплайна, то турболет DeepSeek V4.1 на его CED-архитектуре догнать никто не может из флешек за разумные деньги.


AI Projects
22 сент., 10:33изменён
📊 Arena сделал предварительную оценку MiMo-V2.6-Pro, хотя модель на уровне Claude Fable 5 (High), как и Qwen3.8 Flash Next во фронтах, но можно уже сказать, что MiMo-V2.6-Flash не получится заметно опередить DeepSeek V4.1 Flash, что было критично.Дело в том, что хотя DeepSeek V4.1 Flash формально на 16 месте, а glm-5.3-flash на 17-м, но у них оценки около 1610 баллов, а у MiMo-V2.6-Pro — 1628. В баллах Elo разница 50–100 баллов — это серьёзно, т. е. другой уровень. Однако 10–15 баллов — это уровень статистической погрешности измерений.На деле все китайские «флешки» примерно на одном уровне, поэтому важнее скорость и цена. У DeepSeek V4.1 ещё очень важный аргумент именно по скорости.


AI Projects
22 сент., 09:54
Я сделал внимательный анализ, как Xiaomi сделала прорыв в Reinforcement Learning: они смогли путём создания огромных батчей с параллелизмом ускорить RL-обучение примерно в 10 раз. Тут есть тревожный момент ещё для разработчиков российских LLM в Сбере и Яндексе — в части усложнения попыток догнать китайцев. Давайте разберёмся.Если поглядеть на архитектуру самой MiMo-V2.6, то там нет rocket science. Это обычный GPT, в котором сделали сокращение KV Cache за счёт использования Full Attention только небольшим числом слоёв, а остальные видят «скользящее окно» вокруг токенов и результат глобального анализа из предыдущих слоёв. Это не сложно, и тут нет архитектурной инновации на уровне CED у DeepSeek V4.1. Однако это иллюзия, т.к. инновации Xiaomi — это процесс обучения Reinforcement Learning, а GPT лишь «молотилка данных» для него, т.е. даже не главный компонент.Архитектор MiMo-V2.6 — Fuli


AI Projects
21 сент., 22:44
Изучил я пока предварительно технический отчёт по MiMo V2.6. Основной прорыв вендора в кардинальном ускорении Reinforcement Learning за счёт обучения крупными блоками данных. Поэтому они быстрее и дешевле учат модели.Однако если сравнить MiMo V2.6 и DeepSeek V4.1, то тут есть «тревожный звонок» архитекторам LLM в Сбербанке и Яндексе: начав копировать модный китайский гибрид GPT + Delta State, они могут проиграть с треском конкуренцию Flash-моделям китайцев. Просто всем и так понятно, что даже если вы возьмёте с Hugging Face архитектуру Kimi K3 и запустите обучение в наших условиях, то у вас не выйдет копия Kimi K3. У наших намного меньше ресурса GPU, и на Hugging Face не лежит описание пайплайнов обучения. В реальности Сберу и Яндексу хоть даже не догнать DeepSeek V4.1 и MiMo V2.6, а сделать хотя бы ситуацию, чтобы отставание не выглядело уже неприличным образом, как сейчас. Китайские


AI Projects
21 сент., 22:15
Xiaomi выпустила новую модель. По бенчмаркам типа DeepSWE претензия пошатнуть лидерство DeepSeek V4.1 в worker-агентах есть, т. к. модель не менее умна, но Xiaomi развязывает ценовую конкуренцию 🚩MiMo-V2.6-Flash: $0.14 / $0.28 за млн input/output DeepSeek V4.1 Flash: $0.15 / $0.60 за млн input/outputКэширование примерно одинаково стоит, если использовать DeepSeek Harness, то там норма попадания от 95%.Вполне вероятно, что стоит сменить модель для worker-агентов, хотя оплата из России через текущие «сложные международные отношения» скорее будет некоторым квестом.Кто тестировал и как платили — делимся в комментах.Вендор ещё сделал научную публикацию о своих прорывах, сейчас посмотрим.https://mimo.xiaomi.com/mimo-v2-6XiaomiMiMo-V2.6 | XiaomiIntroducing the MiMo-V2.6 series: frontier intelligence, all the modalities, built in public.
AI Projects
21 сент., 17:18
🤖 Вышел Grok 4.7, но скорее никакого переворота у Маска не получится, т.к. его аргумент, что у меня «чуть хуже Fable, но дешевле» на деле скорее не сработает. Дело в том, что сейчас профессионалы имеют обычно пайплайн из фронтира (Fable, Astra) и worker-модели (обычно DeepSeek V4.1 сейчас). Фронтиры реально потребляют только 10% токенов для сложных решений, если пайплайн настраивал профессионал, поэтому цена их не так критична, как IQ. Практически Маск скорее будет бодаться сейчас с Kimi K3 и Qwen 3.8 Max в довольно узкой нише, кто тут реально ищет компромисс. Она актуальна для России, где завтра РКН может переломать все VPN и VPS, поэтому придётся в темпе вальса спрыгивать с Claude и ChatGPT, но для остального мира нет такого риска.Надо подождать ещё результат LM Arena для окончательной оценки, может Grok фронтиры хорошо рисует.https://x.ai/news/grok-4-7


AI Projects
21 сент., 17:07
🤖 Честно говоря, даже и не знал, что у Сбера тоже есть T5, т.к. никто ими не пользуется из клиентов на обучении, а у меня это сотни специалистов. Правда, анализ AliceAI-T5-35B-A0.6B (Яндекс), google/t5gemma-2-4b-4b, FRED-T5-1.7B (Сбер) и FRIDA (Сбер) быстро пояснил почему.У Yandex MoE и нагрузка на GPU только от 0.6B параметров, у Сбера модели хотя и крошечные, но нагрузка выше. Правда, потенциально можно делать LoRA для dense, но по параметрам модели видно, что она настолько глупая, что вряд ли это получится практически. Крошечный контекст 512 токенов у Сбера и обучение всего на 300GB корпуса текстов фактически делают модель неконкурентной против решений Yandex и Google в T5.📌 Как обычно, можете не согласиться со мной в комментариях, мы обсуждаем сейчас в чате «Православные ИИ», т.к. в госсекторе какие бы они плохими ни были, но будут применяться именно они в итоге.


AI Projects
21 сент., 16:54изменён
🔍 В чате мне написали коллеги, что Yandex занимается тоже энкодер-декодер нейросетями, но это не аналог Causal Encoder-Decoder (CED) у DeepSeek-V4.1-Flash, а это копия очень старой, но живой архитектуры Google T5, которая впервые была опубликована американцами в статье «Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer» в 2019 году.Однако архитектура живая, хотя и нишевая. Аналогом AliceAI-T5-35B-A0.6B является тут Google t5gemma-2-4b-4b. Такие нейросети применяют Encoder на BERT, который не понимает причинно-следственных связей полностью и часто реагирует на вопрос как на «мешок слов». У DeepSeek энкодеры называются Causal Encoder именно потому, что там маскированное внимание как у классических трансформеров, поэтому там энкодер понимает уже сложные причинно-следственные связи.Архитектура T5 тем не менее может работать для поисковых запросов, но


AI Projects
21 сент., 15:23
Яндекс выпустил AliceAI-Foundation-80B-A3B-Base, решив таки начать обучать модели от нуля. Это на деле серьёзный удар всей стратегии Сбера по продвижению GigaChat в «закрытые контуры», которая вся крутится вокруг утверждения в духе: злые враги наверняка при обучении модели заложили в LLM зловредного агента, он, получив сигнал врагов, проснётся и захватит власть в России через правительственные системы. Правда, почему-то в таких мантрах коллеги GigaChat использовали дистилляцию Gemini и ChatGPT, как я уже отмечал по работе Anthropic — дистилляция тоже скрыто передаёт предпочтения учителя, типа либеральных взглядов. Яндекс ранее использовал Qwen для инициализации весов. Получается, в рамках маркетинга Сбера, что правительственного ИИ-агента в России контролирует Трамп, то это лучше, чем Си Цзиньпин. Вот в этом я не уверен. Однако на многих чиновников «суверенное обучение» всё равно


AI Projects
21 сент., 05:21
🖼 Я протестировал новый Qwen-Image-2.1 для редактирования фото. Модель реально неплоха с учётом того, что влезает в бюджетные карты. В блоге Qwen показаны тестовые сценарии с традиционными комбинациями типа «одеть одежду на героя» или «собрать несколько людей с разных фото вместе». Это не сложно для нейросетей-редакторов изображений, куда сложнее «переставлять части тела».Один из востребованных сценариев — «замена головы» в готовый сюжет. Однако вписаться органично тут сложно моделям. Часто переходы грубые или модель вообще отказывается вписывать голову и придумывает свою. Qwen-Image-2.1 просто так не впишет хорошо, но таким промптом на «четвёрку» точно работает и довольно стабильно:Replace the face of the person in the first image with the face of the person in the second image. Replace the skin color of the person in the first image with the skin color of the person in the secondqwen.aiQwen offers comprehensive functionality spanning chatbot, image and video understanding, image generation, document processing, web search integration, tool utilization, and artifacts.
AI Projects
20 сент., 19:05
Давайте покажу вариант китайской ботофермы на ИИ, которая с "пальцем". Пока это для внутреннего китайского рынка больше, т.к. там жестче стали проверять социальные сети "натуральность нажатий" и признаки ПО для эмуляций.Тут все проверки бесполезные. Тут вообще смартфоны БЕЗ ИЗМЕНЕНИЙ. Манипулятор ИИ робота проходит обучение на нейросети как человек нажимает и листает.В наше время нужно понимать, что организовать социальные ботофермы вопрос денег и довольно небольших благодаря китайскому лохотрону.
AI Projects
20 сент., 18:59изменён
🤖 Кто не видел, как выглядит китайская ботоферма, которая продаёт подписки и лайки, то вот её средний вариант. Начинали китайцы с того, что покупали просто б/у смартфоны и в подвале подключали их через USB на общую шину. Там ставили ПО для захвата экрана и эмуляции нажатий. Начинали с алгоритмических ботов, потом перевели их на ИИ.Средняя ботоферма в КНР уже технологичнее, как на видео. Она не покупает старые смартфоны, а покупает тысячи ультрабюджетных смартфонов. Их сразу же в подвале разбирают, выкидывают экран и аккумулятор, оставляют только плату для эмуляции Android.С этим борются в социальных сетях, но больше сами китайцы как основные поставщики лохотрона. Они смотрят, нет ли странных таймингов нажатий, пытаются понять «физику человеческого нажатия». Поэтому сейчас китайские ботофермы постепенно мигрируют на своём рынке уже на роботизированный вариант. Там не гуманоид,
AI Projects
20 сент., 18:43изменён
📊 Сделаю пост скорее для маркетологов, которые размещают рекламу в Telegram-каналах по тематике ИИ и становятся жертвами мошенников, создавших ИИ-каналы на ботах. Как раз пример такого мошеннического ИИ-канала у нас в чате обсуждается. Ботоферма была создана специально, чтобы обмануть персонал отдела маркетинга для размещения рекламы. Фактически, разместив там рекламу, вы оплачиваете содержание роя ботов. Опознать мошенников с ботами можно через нарушение ratio-метрик каналов, т.к. здоровых соотношений между разными социальными метриками. Если они нарушены, то вы платите за стойки со смартфонами в китайском подвале, где боты эмулируют нажатия в интерфейсе Telegram. Я не раз постил видео, как выглядят эти китайские ботофермы для накрутки подписок, просмотров и лайков.Первое, за чем вам нужно следить — это ratio «просмотры поста / подписчики». Возьмём мой канал или пример канала Data


AI Projects
20 сент., 17:38изменён
Вероятно, у меня в данный момент самый крупный охват социального канала по ИИ-тематике в России за счёт мощного буста новой нейросети рекомендаций VK.Хотя каналы в Telegram по ИИ, которые ведутся давно, имеют около 100К подписчиков, но просмотр постов не поднимается выше 20К даже на лояльной аудитории обычно. У меня сейчас VK даёт 4,4 миллиона просмотров в месяц с охватом почти 560 тысяч человек, что делает старые каналы по ИИ в Telegram гномами на моём охвате. Дело в том, что подписчики сейчас в VK не основные читатели канала: нейросеть VK, если признаёт контент ценным и замечает ещё положительные реакции (длинное чтение, обсуждение и т.п.), то сразу же переходит в turbo-режим его распространения. Поэтому у меня также средний просмотр поста около 20К, но виральные обычно намного больше — в 50–100К просмотров.Это без учёта Telegram, LinkedIn и YouTube.У меня основная миссия —


AI Projects
20 сент., 16:16изменён
Многие эксперты считают, что данные AI Gateway от Vercel более репрезентативно показывают состояние рынка ИИ сейчас, чем OpenRouter. Видно, что китайцы выигрывают в плане контроля над рынком в токенах, а американцы — в деньгах.Сейчас модели с открытыми весами составляют 78,4% от объёма токенов, по сравнению с всего 21,6% для закрытых моделей, в то время как открытые модели представляли примерно 40% объёма токенов в июне, что означает, что их доля почти удвоилась всего за три месяца.DeepSeek V4.1 Flash в одиночку генерирует 59,3% токенов, проходящих через шлюз, а в сравнении с Claude его Opus 4.8 генерирует всего 1,7% объёма токенов.Однако данные о расходах рассказывают совсем другую историю. Закрытые модели всё ещё захватывают непропорционально большую сумму денег за свои токены. Claude Opus 4.8 составляет 13,7% расходов, несмотря на то что представляет всего 1,7% объёма токенов,


AI Projects
20 сент., 15:24
🧠 Я думаю, многие заметили, что команда создателей Claude при своей методике выравнивания LLM фактически исходит из гипотезы, что ИИ нативно обладает аналогом сознания и собственной мотивацией, поэтому они работают с этим как с эмерджентными свойствами моделей. Мустафа Сулейман (Microsoft AI) говорит, что это добавил Дарио через Reinforcement Learning сам. Однако тут всё не так просто: ещё в 2024 году Anthropic доказал, что сразу после pretraining до SFT и RL уже в резидуальных потоках наблюдаются элементы личности как «самость», способность ставить цель и выполнять коррекцию. Без SFT модель не может связно объяснять «кожаным» в диалогах эти «фичи», но они глубоко нативные для всех LLM. Дальнейшие исследования показали, что практически любая LLM, где больше 70B параметров, получает «фичи личности» сразу после обучения на корпусе текстов людей без обучения ответам (SFT) и поведениюarXiv.orgEmergent Introspective Awareness in Large Language ModelsWe investigate whether large language models can introspect on their internal states. It is difficult to answer this question through conversation alone, as genuine introspection cannot be...
