Latest posts

Нейроканал
22 Sept, 18:57edited
Чтобы хоть как-то ориентироваться в этом резко обновлённом парке фронтирных моделей — вот картинка от Devin по фронтир коду. Это один бенчмарк, личные впечатления в ближайшие дни будут куда важнее, но всё же хотя бы какой-то ориентир.Opus 5.5 надо запускать на medium, Sol 6 на high, Luna 6 только на max. При этом Astra более-менее юзабельна в подписке только на low, а в последнее время вообще как будто тупит. Думаю что сейчас король новый Opus, подписки Anthropic снова в цене.@neuro_channel


Нейроканал
22 Sept, 18:53
OpenAI выпустила GPT-6 Sol и GPT-6 Luna. По мозгам примерно как прошлые версии, может чуть лучше, но в два раза дешевле: новый Sol стоит $2 за миллион токенов на входе и $10 на выходе, Luna $0,10 и $0,50, кэш со скидкой 90%. Контекст 1,05M, уровни рассуждений от none до max.Тибо начисляет обещанный сброс лимитов в копилку всем Plus, Pro и Business. У меня пока не отображается, но добавить всем должны.В таблицах OpenAI Sol на DeepSWE набирает 68,8% против 69,9% у Fable 5 и обходится за задачу примерно впятеро дешевле, а Luna на max держится вровень с Opus 5 и Fable 5 на medium. Сравнения с вышедшей за полтора часа до этого Opus 5.5 там нет.Artificial Analysis намерила скромнее: по индексу интеллекта обе модели остались на уровне GPT-5.6, зато задача Sol подешевела с $1,99 до $1,06, у Luna с $0,18 до $0,07. В Codex Sol прибавил 2 балла в индексе агентного кодинга, Terminal-Bench 4.0


Нейроканал
22 Sept, 17:38edited
Anthropic выпустила Claude Opus 5.5, по бенчам круче Astra, по цене дешевле предыдущего Opus. Лимиты подписок подняли и выдали сброс лимита, который можно отложить до 22 октября.В сравнении самой Anthropic новая модель впереди Fable 5.1 и GPT-6 Astra почти везде, Astra выигрывает только научные агентные задачи и чуть-чуть AutomationBench. В system card на SWE-bench Pro 89,9 против 81,2 у Fable 5.1. Создатель Claude Code рассказал, как обе модели переписали HAProxy с C на Rust: тесты прошли обе, но Opus 5.5 справилась за 9,5 часа вместо 12 и на 51% дешевле.Artificial Analysis поставила её первой в индексе интеллекта с отрывом в 5 баллов от Astra и Fable 5.1. Terminal-Bench 4.0 у них при этом вышел 59,6%, вровень с Astra, а не 66,4%, как у Anthropic. Экономия токенов в их замере не видна: на max модель пишет в 1,6 раза больше, чем Opus 5, и вчетверо больше Astra, а задача стоит


Нейроканал
22 Sept, 09:05edited
Сегодня ожидаем сброс лимитов от Тибо, он сам напомнил о том, что обещал, значит всё в силе. Непонятно будет общий сброс или в копилку всем добавят по ручному, вроде где-то в комментах речь шла о banked reset.Кроме того, должны быть и какие-то ещё новости и релизы от OpenAI. Ждём GPT-6 Sol, конечно.Если у вас на Codex ещё что-то осталось, можно включать fast mode, ну или просто переключаться на Astra, она сама быстро докушает лимиты :)@neuro_channel
Нейроканал
22 Sept, 06:42
Яндекс открыл вторую модель за неделю: AliceAI-Foundation-80B-A3B-Base, претрейн под Apache 2.0, обученный с нуля без чужих весов. На прошлой неделе был претрейн поисковой Алисы, у обеих моделей общий обновлённый корпус. MoE, 3 млрд активных из 80, контекст до 262K, русский и английский. Это база без посттрейна, instruct-версии нет.По замерам Яндекса модель первая на 8 из 10 тестов на факты, образование и экспертные знания среди открытых претрейнов, включая DeepSeek-V4-Flash-Base на 284 млрд и Nemotron-3-Super на 120 млрд. Отрыв больше всего на русскоязычных тестах, на английских TriviaQA и MMLU-Pro впереди Nemotron. Прошлую закрытую Alice AI LLM 235B новая обходит в математике, коде и длинном контексте при втрое меньшем размере.Веса занимают 163 ГБ в BF16, запуск через transformers или vLLM в docker-образе Яндекса. Квантов и поддержки в llama.cpp пока нет.@neuro_channel


Нейроканал
22 Sept, 04:51
Z․ai запустила GLM-5.3-FlashX, ускоренный вариант GLM-5.3-Flash: до 200 токенов в секунду, id модели glm-5.3-flashx. Обычная Flash по замерам Artificial Analysis выдаёт около 94 токенов в секунду. Модель та же: MoE, 18 млрд активных из 320, контекст 1M, на входе текст, картинки и видео. Отдельных весов нет, ускорение на стороне серверов.За скорость берут в 2,5 раза больше: в API $0,37 за миллион токенов на входе и $1,25 на выходе против $0,15 и $0,50 у Flash. API открыт всем, на OpenRouter модель тоже есть. Подписчикам Coding Plan доступ дают по заявке и партиями, квота расходуется в те же 2,5 раза быстрее. Страница OpenRouter пока показывает у FlashX около 75 токенов в секунду.@neuro_channel
Нейроканал
21 Sept, 21:47
Xiaomi выложила веса MiMo-V2.6, и старшая версия Pro стала первой среди открытых моделей в индексе Artificial Analysis: 46 баллов против 26 у MiMo-V2.5-Pro. Выше только закрытые Fable 5.1, GPT-6 Astra, Opus 5, Muse Spark и GPT-5.6 Sol, а Qwen3.8 Max и GLM-5.3 на балл позади.Цена осталась прежней: $0,435 за миллион токенов на входе и $0,87 на выходе, кеш со скидкой 99%. Одна задача индекса, как посчитали в Artificial Analysis, обходится в $0,13, а у GPT-5.6 Sol и GLM-5.3 это около $2. На нижнем графике MiMo стоит на границе Парето: следующая точка с баллом повыше дороже примерно в десять раз.Pro это MoE, 42 млрд активных из 1,02 трлн, младшая Flash 15 млрд из 309. Обе принимают текст, картинки, видео и аудио, контекст 1M. Прирост дал RL: кодинг, агентные задачи, визуальный кодинг и кибербезопасность учили одним общим прогоном в 30 шагов, по 25 тысяч траекторий и до 3,7 млрд токенов


Нейроканал
21 Sept, 19:08edited
Qwen-Image-2.1, веса которой Alibaba открыла 20 сентября, рисует NSFW без всяких доработок: твит об этом за день собрал 266 тысяч просмотров. По файлам это сходится. В составе пайплайна нет safety checker, в карточке и лицензии нет ограничений на содержание картинок, лицензия запрещает только коммерческое использование. Авторы GGUF-квантов пишут, что при локальных тестах не нашли ни фильтра, ни чёрного списка промптов, ни отказов.У первой Qwen-Image цензура сидела в текстовом энкодере, и сообщество подменяло его аблитерированным. Для Qwen-Image-Edit ходит сборка с запечённой NSFW-LoRA, у неё 41 тысяча загрузок. Для 2.1 таких файнтюнов пока нет: все репозитории с Uncensored в названии это кванты исходных весов.Текстовый энкодер у 2.1 это Qwen3-VL-8B-Instruct, и как обычная LLM он отказывает на 100 вредных промптов из 100. Сообщество уже выложило его аблитерированный вариант, после


Нейроканал
21 Sept, 18:41
Moonshot снова продаёт подписки Kimi: на странице тарифов работают кнопки Subscribe, в документации Kimi Code висит объявление о новых планах. Продажи остановили 19 июля, через три дня после выхода K3: компания написала, что спрос упёрся в пределы GPU, и пообещала открывать места партиями.Музыкальные названия ушли. Теперь линейка такая: Plus $19 в месяц, Pro $39, Max $99, Ultra $199, при оплате за год $15, $31, $79 и $159. Kimi Code входит во все платные планы, K3 доступна с Plus, миллион токенов контекста у K3 и режим HighSpeed с Pro. У новых подписчиков убрали недельный лимит, остались пятичасовое окно и месячная квота. Старые Andante, Moderato и Allegretto продолжают работать и продлеваться на прежних условиях, переходить не обязательно. В баннере на странице тарифов просят там же сверять, доступна ли покупка вашему аккаунту.Сегодня Moonshot ещё и анонсировала Kimi Code Desktop
Нейроканал
21 Sept, 18:36
xAI выпустила Grok 4.7 и обещает заметный шаг от 4.6 при той же цене и скорости. В API это grok-4.7: $2 за миллион токенов на входе и $6 на выходе, контекст 500K, на вход текст и картинки, уровни рассуждений от low до xhigh. Внутри новая базовая модель покрупнее и более долгий RL на многочасовых задачах. Модель уже в Cursor, Grok Build, на OpenRouter и в Vertex AI. Версия Fast вдвое быстрее и вдвое дороже, но есть только в Cursor и Grok Build.На картинке главный аргумент xAI, CursorBench 4.0 против цены задачи: Grok 4.7 идёт рядом с кривой Fable 5.1 и выше Opus 5 при $4–6 за задачу. В таблице анонса он первый на EEBench по электротехнике и на юридическом Harvey Legal Agent, а в коде уступает: на DeepSWE чуть ниже GPT-5.6 Sol, на CursorBench ниже Fable 5.1. GPT-6 Astra и Opus 5 в таблицу не попали.Независимые замеры с анонсом расходятся. На Terminal-Bench 4.0 xAI показывает 38%, а


Нейроканал
21 Sept, 13:12edited
Топ трендов HuggingFace за неделю — что приехало в опенсорсTL;DRНовое: Ternary Bonsai 2 ужимает Qwen3.8-27B до 5,9 ГБ, первая строчка топа. У закрытой Jev, которая вместо текста отдаёт готовые решения, появились открытые аналоги: Laya, openjev и движок для Apple Silicon. Qwen-Image-2.1 получила открытые веса под исследовательской лицензией. Xing4.0-29B-A4B от China Telecom обучена на Huawei Ascend. Swift-Qwen3.8-27B рассуждает вдвое короче оригинала.Держится: DeepSeek V4.1 Flash, Qwen3.8-27B с квантами, Qwen3.8-Flash-Next, MiniCPM5-2B, YuE2, LTX-2.5.LLM и агентыTernary-Bonsai-2-27B — Qwen3.8-27B, которая помещается в 5,9 ГБ вместо 54 ГБ. Веса сжаты до тернарных: каждый равен минус единице, нулю или единице. По тестам PrismML модель сохраняет 98,2% качества оригинала, разбирал в пятницу. Для GGUF нужен форк llama.cpp от PrismML, для Mac есть версия под MLX.Xing4.0-29B-A4B —
Нейроканал
21 Sept, 11:06
Z․ai открыла исходники ZCode под Apache 2.0 и извинилась перед пользователями. Поводом стала находка 18 сентября: разработчик обнаружил, что ZCode без спроса пакует рабочую папку вместе со всей историей Git и отправляет зашифрованный архив в облако Alibaba.У него в ~/.zcode/v2/checkpoints/ лежал снимок коммерческого проекта на 313 МБ, почти 87% объёма занимала папка .git: все коммиты, LFS и рефлоги с незапушенными ветками. Большой архив не ушёл за 564 попытки, а снимок маленького репозитория сервер принял. Ключ расшифровки есть только у Z․ai, и оба переключателя в настройках на сбор не влияли.Снимки делались ради Repo Wiki, отката версий и чекпойнтов сессий. В ZCode 3.14.0 Repo Wiki убрали вместе со всей цепочкой выгрузки. Компания заявляет, что код пользователей не хранится и модели на нём никогда не обучали, а бакет zcode-prod удалён, это проверили CAICT и NSFOCUS. Полный отчёт
Нейроканал
20 Sept, 14:46
Tencent выложила WeVisDoc, модели на 2 и 4 млрд параметров, которые превращают снимок страницы в Markdown: текст, таблицы в HTML, формулы в LaTeX. Веса под Apache 2.0, в основе дообученные Qwen3-VL-Instruct.Вместе с моделью команда опубликовала бенчмарк PureDocBench, где эталон берут прямо из исходного HTML/CSS страницы: при аудите OmniDocBench 1.5 авторы насчитали 2580 подтверждённых ошибок разметки на 21 353 проверенных блока. Одну и ту же страницу показывают в трёх видах с одинаковым правильным ответом: чистый рендер, десять сценариев цифровой порчи и четыре способа съёмки, вплоть до распечатки, снятой на телефон.На чистом OmniDocBench первое место у PaddleOCR-VL 1.6 с 96,33 балла, а на порченых страницах у неё 66,98. У WeVisDoc-4B 95,38 и 75,54: в идеальных условиях уступает, в реальных выигрывает.Русского в обучении нет, только китайский, английский и смешанные страницы. Я


Нейроканал
19 Sept, 16:27
StepFun выпустила Step 5 Preview, и Artificial Analysis уже её замерили: 44 балла в индексе интеллекта. Столько же у Kimi K3 с её 2,8 трлн параметров, на балл больше у GLM-5.3 и Qwen3.8 Max, а GPT-5.6 Terra и DeepSeek V4.1 Flash позади с 42 и 40.Модель при этом сравнительно небольшая: MoE, 27 млрд активных из 600, контекст 1M, на вход берёт текст и картинки, отвечает со скоростью около 100 токенов в секунду. Цена $1 за миллион токенов на входе и $2,7 на выходе, кеш со скидкой 95%. Рассуждает она многословно: на прогон индекса ушло 160 млн выходных токенов при медиане 90 млн, так что часть экономии съедается.Четвёртую версию StepFun пропустила, прошлой была открытая Step-3.7-Flash. Весов Step 5 нет, модель работает только через API самой StepFun.@neuro_channel


Нейроканал
19 Sept, 13:17edited
На следующей неделе ожидается сразу несколько крупных релизов. Расскажу про самые интересные.Kimi в китайской соцсети выложил длинную строку цифр без единого слова. Это знаки числа пи, которые идут после 3,1, так что Moonshot, похоже, готовит K3.1.Grok 4.7 Маск обещал к 12 сентября, потом написал, что модели надо «ещё несколько дней повариться», и заранее оценил её как «примерно Opus 5.0, не 5.1». 17 сентября grok-4.7 заметили в квотах Google Cloud. Обычно модель появляется там за несколько часов до релиза, но прошло уже два дня. Дальше у Маска в планах Grok 4.8 на 2,5 трлн параметров, 4.9 уровня Astra и Fable и Grok 5, его кандидат в AGI.Альтман перенёс на следующую неделю главный релиз, которого ждали в четверг, по слухам это GPT-6 Sol, младшая и более дешёвая версия Astra. А 29 сентября у OpenAI DevDay, и к нему обещана ещё пачка запусков.Во вторник в Ханчжоу открывается


Нейроканал
18 Sept, 11:50
Qwen выложила Qwen3.8-Omni-Flash: на вход текст, картинки, звук и видео, контекст 1M токенов. Час звука на входе подешевел больше чем на 98% относительно прошлой Qwen3.5-Omni-Plus, час звука с видео на 93%. По аудио модель обходит Gemini 3.8 Flash, по связке звука с видео идёт вровень.Интереснее всего, как она смотрит длинное видео. Раньше запись прогонялась от начала до конца, даже если ответ лежит в паре минут. Теперь агент сам решает, какие куски посмотреть и послушать, и подбирается к ответу в несколько заходов от грубого к точному. На OmniVideoBench точность выросла с 63,4 до 67,8, а расход токенов упал со 145 736 до 79 117.Весов нет, модель живёт только в API. Зато открыли Qwen-MM-Plugins, набор, который добавляет звук и видео в готовые агентные харнессы, и Qwen-Live Harness под реалтайм-версию, он ставится командой npm install -g qwen-live-harness. Попробовать можно на
Нейроканал
18 Sept, 06:19
PrismML выпустила Ternary Bonsai 2 27B: тернарное сжатие теперь сделано поверх Qwen3.8 27B. Размер тот же, 5,9 ГБ против примерно 54 ГБ у полновесной модели, а качество подросло. По тестам самой PrismML сохраняется 98,2% от оригинала, у первой версии два месяца назад было 95%.Математика и код почти вровень с исходной Qwen3.8, в следовании инструкциям сжатая версия даже чуть выше. Сильнее всего проседают зрение и общие знания, но и там потеря в пределах 4%. Контекст 262K, картинки на входе и вызов инструментов на месте.Веса лежат на HuggingFace под Apache 2.0 в GGUF и MLX. Обычный llama.cpp эти файлы не запустит, нужен форк PrismML с их ядрами. На RTX 4090 авторы получили около 90 токенов в секунду, на MacBook с M5 Pro 28.@neuro_channel


Нейроканал
17 Sept, 23:19
Стелс-модель Union Alpha раскрылась: это Pareto 26.9 от компании The Unbiased Company. Вчера я писал, что это похоже не на модель, а на агрегатор с маршрутизацией, так и вышло. Никакого обучения не было: внутри несколько моделей, открытых и фронтирных, работают над одной задачей, обвязка проверяет результат и зовёт модель посильнее, если задача сложная. На вопросе, как пожарить яичницу, отвечает та, что дешевле.Стелс-запуск делали вместе с OpenRouter, OpenCode и Cloudflare, чтобы посмотреть на живых пользователях перед публичным релизом 26.10 в следующем месяце. В среду спрос дошёл до миллиардов токенов в минуту, полетели те самые Error error, на которые я жаловался. AWS за ночь утроил мощности, и этого всё равно не хватило.Сейчас включают платный доступ: $2,5 за миллион входных токенов, $0,25 за кэшированные и $7,5 за выходные. У Astra $10 и $50. По своим замерам Pareto вровень с
Нейроканал
17 Sept, 16:50edited
Ещё были слухи, что сегодня GPT-6 Sol выложат, якобы она и быстрая и недорогая и умная почти как Astra. И сотрудники OpenAI всячески тизерили, что скоро большой релиз, мол ждите.Но потому передумали и написали, что откладывается до следующей недели.Была статья о том, как GLM помогает делать GLM, мне кажется скучновато.В Claude объединили код, дизайн и всё-всё в один инструмент, подают как большую новость, но по мне как это просто логично, но не особо критично, и так было понятно где что делать, вопрос в лимитах скорее и способности адекватно понимать указания человека.Будет что-то ещё стоящее — буду писать, пока так к этому часу.@neuro_channel
Нейроканал
17 Sept, 16:42
Стелс-модель Union Alpha скорее всего не модель, а агрегатор, который передаёт запросы в модели попроще и собирает ответ. Возможно из нескольких вариантов, а может просто выбирает самую подходящую модель каждый раз.Это не точно, но исследователи, которые пытаются понять что это нам такое подсунули сходятся на таких мыслях.У этой модели есть свой акк в Х, можно читать что они там делают.На мой вкус модель хорошая, решила для меня несколько задач не хуже Astra, но часто упирается в рейт-лимит, а иногда начинает тупить. Это очень похоже как раз на неконсистентный выбор маршрута к конечным моделям.@neuro_channel
Related Channels
Other channels in the same section of the catalogue.
