Последние посты

Борис опять
25 сент., 09:02
На конференции Yandex Scale показали Алису AI Про: в ней обещают 120+ навыков и 20+ плагинов, создание собственных навыков, выбор модели под капотом и облачный, гибридный/он-прем форматы поставки.Ещё недавно все смотрели в первую очередь на саму модель: контекст, бенчмарки, качество ответов, скорость. Теперь всё больше внимания привлекает то, что модель умеет делать за пределами чата.Потому что даже очень хорошая LLM сама по себе остаётся генератором текста. Чтобы она могла нормально работать в компании, ей нужны доступ к данным, инструменты, права, инструкции и возможность вызвать нужный сервис.Например, сотрудник может попросить: «Собери отчёт по продажам за неделю, найди основные отклонения и подготовь письмо для команды». В идеале агент сам забирает данные из CRM, анализирует их, сверяет с внутренними документами, формирует выводы и готовит письмо. Человеку остаётся проверить результат и отправить его.Отсюда и весь новый слой вокруг моделей: tools, skills, агенты, MCP. Чем сложнее задача, тем меньше это похоже на одного универсального ассистента — скорее на систему, где несколько агентов делают разные куски работы, а кто-то координирует их между собой.Первыми такие решения запустили OpenAI и Anthropic – сначала они автоматизировали задачи разработчиков, но быстро поняли, что ту же логику можно применить и для остальных профессий. Так появился класс Cowork-решений.В общем, сейчас конкурируют уже не только LLM, а целые системы, которые позволяют этой LLM что-то реально делать.
Борис опять
23 сент., 15:48изменён
Алексей Гусаков на deep tech night рассказал как Яндекс Музыка перешла на end-to-end генеративные рекомендации с новой моделью SONA. Энкодер-декодер модели вернулись!Новая система называется SONA. В A/B-тесте SONA дала +4,5% Active Users поверх всех улучшений, что были сделаны с 2023 года. От внедрения модели получили эффект больше, чем от всего сделанного за последние годы вместе взятого.В 2023 мы увидели первые BERT в рекомендациях: SASRec и BERT4Rec. Там история прослушиваний подавалась в энкодер-трансформер, а из результата делался вектор пользователя. Для получения рекомендаций можно было вычислить косинусное расстояния с вектором трека. Ограничение такого подхода в медленном обучении: каждый сабсет истории прослушиваний пользователя нужно обрабатывать как отдельный префикс, отдельным форвардом всей модели. Из-за этого приходилось ограничивать историю 128 треками.В 2025 появился ARGUS с переходом к генеративной постановке с трансформеров-декодером. Модель последовательно предсказывает следующий музыкальный трек, авторегрессионно, как LLM предсказывает следующий токен. Это позволило подавать в модель 8000 треков за раз и сразу считать ошибку для всех префиксов. Однако сжатие всей истории в один токен теряет много информации. К тому же трансформер был тяжёлый, поэтому его можно было применять только как реранкер. Этап генерации кандидатов оставался отдельным.Теперь следующая итерация – SONA, настоящая end-to-end система.Ключевая инновация это новый токенизатор под названием Semantic ID. Грубо говоря one-hot представление для каждого трека заменяется тремя дискретными иерархическими токенами из кодбука. Кодбук формируется на основе мультимодальных эмбеддингов трека с помощью Qwen 2.5-Omni, refinement-трансформера и кластеризации RQ-KMeans. В итоге получается токенизация сохраняющая семантику на разных уровнях абстракции: от общих жанровых черт до специфики конкретного трека.SONA – это энкодер-декодер. Энкодер часть сжимает историю пользователя, а декодер часть генерирует рекомендации. Одновременно учится и предсказывать следующий трек, и реакцию на него.SONA сама себе генератор кандидатов и ранкер, потому что использует новую структуру токенов для ретривала прямо во время своих предсказаний. Используется beam search. Сначала предсказываем первый токен из трех, затем второй при условии первого, затем последний при условии двух предыдущих. По сути для получения рекомендации сразу делаем поиск по дереву несколькими форвардами трансформера. Никакого FAISS или HNSW!
Борис опять
23 сент., 13:02изменён
Постоянная рубрика: "блекпилл недели (и как с ним быть)"После предыдущего болезненного опыта, где я обнаружил, что агенты ужасно пишут код и за ними потом надо неделями разгребать слоп, я задумался как быть. Это новая реальность разработки софта и мне как СТО нужно придумать как жить.Изучая, что придумали более умные люди, я понял: ничего. Никто не знает как жить в новом мире, когда один разработчик производит столько кода, сколько в прошлом мог производить целый отдел. За пределами твиттера проблема известная (т.е. большие компании вроде Cloudflare и GitLab уже написали блог-посты), но решения никто не нашел.На основе своего и чужого опыта придумал гайдлайны по AI разработке для нашей команды.Основные предположения: 1. Код важен. Код это то, что действительно исполняется, а значит единственный источник истины. Все спеки это в лучшем случае искаженные описания кода, а чаще всего просто слоп-эссе на тему. 2. AI агенты это мультипликаторы скорости генерации кода. При наивном применении они перекладывают работу с автора кода на меинтейнера. 3. Главный ограничивающий ресурс это понимание кодовой базы разработчиками. 4. Деградация кода неизбежна и поддержание его качества это необходимая работа. 5. Агенты для кода ненадежны и непостоянны. Результат зависит от множества постоянно меняющихся факторов: модели меняются, сетап у всех разный, и так далее. Если что-то работает сейчас, нельзя гарантировать, что оно будет так же работать завтра. 6. Агенты для кода быстро производят техдолг и не могут самостоятельно его уменьшать.Отсюда следующие принципы того, как может работать адекватная система: 1. Необходимо перенести работу по поддержанию качества назад с мейнтейнера на автора. 2. Люди отвечают за дизайн и архитектуру. 3. Люди отвечают за систему верификации: pre-commit, CI чеки, документация и принципы. Только люди редактируют AGENTS.md и постоянные доки. 4. Все правила, которые можно, нужно превращать в механические чеки, потому что промптинг не гарантирует, что агенты будут их соблюдать. 5. Борьба со слопом закладывается в бюджет. 6. Минимизируем человеческие затраты на ревью, максимально автоматизируем проверки и контроль качества.Первый пункт самый главный: можно вайбкодить как угодно, если в результате у тебя рабочий код который ты понимаешь.И конкретные практики: 1. Каждый PR не более +2к строк кода. Эмпирически найдено, что больше отревьюить невозможно. 2. Автор каждого PR сам пишет его описание по шаблону и указывает какие сущности за что отвечают. 3. Очень жесткие pre-commit и CI чеки. 4. Кастомный код-ревью бот в CI, который отсматривает каждый дифф и весь PR в целом с целью доказать, что он сломан. Промптится логом прошлых инцидентов, который пополняется только людьми. 5. Люди дизайнят скелет своих изменений в AI-assisted режиме, агенты заполняют пропуски. 6. Доки пишутся людьми, агентам запрещено их редактировать. 7. Разгребание слопа закладывается в планирование.Всю карьеру (в эру кожаного кодинга) я считал pre-commit чеки очень бесячими и не особо полезными. Теперь же у нас самые жесткие чеки и линтеры в моей жизни. Там как базовые вещи вроде ruff и black, так и кастомные правила import linter, и многое другое. Я постоянно завожу что-то новое. Например, недавно добавил проверки на вложенность и цикломатическую сложность функций из SlopCodeBench. На днях появилась проверка всех диффов с помощью Jev.Это более-менее сработало. Pre-commit с механически забитыми правилами позволяет видеть не совсем слоп на этапе ревью. Очень жесткий CI обеспечивает то, что слоп обнаруживается до мержа, а не после. Но появились новые проблемы.Самая главная: актор с критиком могут очень долго итерироваться над PR без видимого прогресса. Агент делает изменения, ревьюер находит блокирующие проблемы, агент делает заплатку, ревьюер находит следующую дыру и так далее. Я видел как это происходило буквально днями, до тех пор, пока я не погружусь и не разберусь: в чем же корень проблемы? Ни одна модель (вклюбчая Fable и Astra) пока ни разу не смогла сама выбраться из
Борис опять
22 сент., 09:21
#дайджест Дайджест AI/ML за неделю 14–20 сентября 2026Alibaba: Qwen3.8-Omni-Flash Модель под агентов с упором на омнимодальность. Заявляют что лучше Gemini 3.8 Flash на его поле: WildClawBench-MM 71.0 против 58.9, диаризация митингов 3.4 против 72.6 ошибки. На видео примерно паритет. Цена $0.15/$0.47, аудио на входе подешевело на 98% относительно Qwen3.5-Omni-Plus. Весов нет. Блогпост, APIGoogle: Gemini 3.8 Live и Live Extended Thinking Две speech-to-speech модели: обычная дешевая и Extended Thinking, которая думает и говорит одновременно, заполняя паузы фразами в духе "сейчас гляну". Первое место в Speech to Speech индексе Artificial Analysis с 82.6, t-Voice 68.6%, 97 языков с автоопределением. Уже в API, AI Studio, Search Live и Workspace Блогпост, Model CardApple: Siri AI Небольшой стартап из Купертино спустя два года после анонса доучил Siri делать то что обещал: искать поqwen.aiQwen offers comprehensive functionality spanning chatbot, image and video understanding, image generation, document processing, web search integration, tool utilization, and artifacts.
Борис опять
21 сент., 09:01
переслано из @hrlunapark
tl;dr: Research Engineers, Berkeley, $230k-930k/yearКакие новости в AI Safety? Например, агенты OpenAI два месяца незаметно координируются на доске объявлений, а потом ломают Hugging Face. Mythos с фейковых гитхаб-аккаунтов давит на живого разработчика, чтобы тот принял PR. Вдалеке чьи-то агенты четыре дня небезуспешно атакуют государственные системы Тайваня.Но есть и хорошие новости! Наша любимая и, наверное, самая громкая за лето — запуск Resolution, первой большой лаборатории, делающей ставку на теоретический алайнмент 🚀Почему сейчас? Нынешний AI достаточно хорош, чтобы содержательно автоматизировать часть ресёрча, а мы наконец-то чуть больше понимаем, как могут выглядеть AGI-модели. Поэтому можно более информированно предположить, какие теоретические направления алайнмента могут успеть сработать в ближайшие годы.Фаундер — Джеффри Ирвинг,
Борис опять
19 сент., 13:54
переслано из @sberlogabig
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_cТакже, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.


Борис опять
19 сент., 12:09
На волне ряда сравнений разных харнессов я пересел на pi. Он отличный, всем рекомендую. Но я заметил, что он всё ещё тратит слишком много токенов, поэтому сделал своё расширение:https://github.com/btseytlin/pi-duck-modeДобавляет /duck режим в котором харнесс тратит в 14х раз меньше токенов, TPS в 798x раз больше! При этом качество кода только растетGitHubGitHub - btseytlin/pi-duck-mode: pi extension to spend 14x less tokens and achieve 798x more TPSpi extension to spend 14x less tokens and achieve 798x more TPS - btseytlin/pi-duck-mode
Борис опять
18 сент., 20:18
Принёс вам хорошее, чтобы не пришлось открывать твиттер


Борис опять
15 сент., 10:23
#дайджест Дайджест AI/ML за неделю 7–13 сентября 2026OpenAI: уравнения Навье-Стокса Драма недели. Внутренняя модель сильно сильнее Astra в виде роя из ~10к агентов за 88 часов доказала, что 3D Навье-Стокс с гладкой внешней силой взрывается за конечное время. Вариант без внешней силы, за который дают миллион, все еще открыт, так что на приз OpenAI не претендует. Теперь к скандалу. Тристан Бакмастер (NYU) и Левент Альпеге (Anthropic) год копали ровно этот подход с Claude и Codex и за две недели до запуска роя получили важный промежуточный результат. OpenAI признает, что не может исключить попадание переписок математиков в обучение. Deep Blue против Каспарова, только если бы Каспаров делал свои ходы с подсказками Deep Blue, а Deep Blue подсматривала стратегию Каспарова из своих подсказок. Блогпост, заявление БакмастераDeepSeek: V4.1-Flash 552B MoE, активных 8B на prefill и 16B наOpenAIOn the Navier–Stokes Millennium Prize ProblemWe’re sharing an AI-generated solution to the Navier–Stokes Millennium Prize Problem, including a writeup and a formal proof in Lean.
Борис опять
14 сент., 13:01
Вышел подробный туториал по Perseus – фреймворку от команды Т-Технологий для обучения моделей персонализации на основе гетерогенных событий.На датасете T‑ECD разобрали сразу четыре сценария: кандидатогенерацию, ранжирование, классификацию и регрессию. В туториале рассказали, как создать единое хранилище событий, подготовить данные, настроить YAML-конфиг, обучить модель и запустить инференс, а еще сравнили сами модели с бейзлайнами. Особенно интересно было почитать про то, как можно добавлять новые фичи или подключать события из соседних доменов, не переписывая код с нуля.Сам туториал опубликован на Хабре, код доступен на GitHub


Борис опять
14 сент., 08:04
переслано из @deep_learning_school_news
🎉Это снова происходитУ нас открылась регистрация на осенний семестр 🎆. Мы запускаем все классические DLS потоки, а также долгожданную третью часть курса по фундаментальным моделям 😎Заходите, оставляйте заявки на учебу и ждите! Классические потоки стартуют уже 19 сентября, часть 3 — 26 сентября.Форма регистрации👇 🔵 DLS: часть 1: https://talent.kruzhok.org/events/12596 🔵 DLS: часть 2: https://talent.kruzhok.org/events/12597 💥 DLS: часть 3: https://talent.kruzhok.org/events/12598 🔵 DLS: Speech: https://talent.kruzhok.org/events/12599❗️Ее обязательно нужно заполнить для получения


Борис опять
12 сент., 18:41
- надо замедлить развитие ИИ иначе будут проблемы с алайнментом - да, больше 10% шанс уничтожения человечества - вы замедляете? - нет, а вы? - нет


Борис опять
11 сент., 12:18
Вышел GigaChat 3.5 Reasoning. Сбер выкатил модель под открытой лицензией MIT, так что веса доступны!Обучили именно режим рассуждений: модель сначала планирует шаги, потом последовательно решает задачу и сама исправляет ошибки, если где-то ошиблась. Для длинного контекста использована архитектура с линейным вниманием. Говорят, что на математических задачах выходит в среднем на 37% меньше токенов по сравнению с DeepSeek V4 Flash Preview.Прирост на бенчмарках: — IFBench — с 44 до 77 баллов — Natural Plan — с 64 до 80 баллов — Live Code Bench v6 — с 56 до 85 балловПроверить рассуждения вживую можно прямо в ГигаЧате.Модель лежит на Hugging Face и Gitverse, а подробные результаты расписали на Хабре.


Борис опять
10 сент., 20:59
переслано из @dl_stories
Я, Борис @boris_again и какой-то рандомный чел проф из Оксфорда. Вот так вот выглядит конфа ECCV, на которой все мы и встретилисьЗавтра на конфе у меня будет постер по статье EquiSteer: Cross-Attention Steering Towards a Fairer Text-Guided Image Generation. Статья про debiasing диффузионок с помощью стиринг векторов. Если вы на ECCV, приходите завтра посмотреть на меня, мою статью и моего научника в постерную сессию ExHall #221 в 4:00 p.m.



Борис опять
10 сент., 10:36
https://opusfived.dev/opusfived.devMake one button blue. Change nothing else. A short interactive comedy about agentic AI assistants that can never just do the thing.
Борис опять
10 сент., 08:02
Рекомендую канал "Зачем мне эта математика?"Популярно пишут про фундаментальные вещи в ML и математике. Читается легко несмотря на глубокие темы.Недавно у них вышла хорошая серия постов про No Free Lunch Theorem. Обычно ее рассмотрение заканчивают на том, что идеального ML алгоритма не существует, но не объясняют: почему тогда все табличные кагглы решаются бустингами, а глубокие нейронные сети решают все задачи? Ребята заглядывают глубже: - https://t.me/practicum_math/1127 - https://t.me/practicum_math/1128 - https://t.me/practicum_math/1129Если после этих трёх постов захочется продолжения — весь канал примерно в таком духе. Подписаться: @practicum_math
Борис опять
9 сент., 13:21изменён
Яндекс запустил Алису AI для бизнеса — ИИ-ассистента, которому можно поручать рабочие задачи. Например, составить календарь платежей по счетам и договорам, разобрать записи совещаний и поставить поручения ответственным. Для этого достаточно описать задачу ассистенту как коллеге.Я довольно сильно блекпильнулся по поводу кодинговых агентов, но в ассистентов для энтерпрайза я верю. В кодинге у агента в распоряжении целый проект бесконечное количество способов понять промпт и решить задачу. В компании заранее заданы границы, до чего дотянуться можно, а до чего нельзя, более менее ограниченный набор действий.Алисе AI для бизнеса можно отдать многосоставное поручение целиком, а дальше она сама раскладывает его на шаги. В формате "посмотри свободные слоты в календаре, сверь с расписанием коммерческого директора, найди окно у нас обоих, подтяни из почты переписку по проекту, поставь
Борис опять
9 сент., 09:59изменён
Конференции потрясающая штука. На воркшопе рассказывал про наш прогресс. Решил помимо черрипикнутых видео, где мы конечно молодцы, показать лайв демо. Там наша модель местами работает, а местами не работает. И вообще про проблемы обучения VLAНапример, одна из необъясненных проблем это вот такие странные траектории. Это игрушечная модель которая учится кликать в одну из двух кнопок. Все траектории в данных у неё прямые и попадают прямо в середину кнопки. А потом на инференсе она заходит на цель с какого-то уголка и наворачивает невероятные вензеля (зеленый курсор наш)В основном всем понравилось. Но один парень сказал, что я всё делаю неправильно, траектории курсора не нужны и все такое. Я задумался почему он неправ какое зерно правды в этом есть и к вечеру придумал три вероятных источника этой проблемы и какие эксперименты провести, чтобы её победить
Борис опять
8 сент., 14:37
2018: AI safety не существует, это научная фантастика 😂 2026: AI safety не существует, это научная фантастика 😫😫😫
Борис опять
8 сент., 14:04
#дайджест Дайджест AI/ML за неделю 31 августа – 6 сентября 2026Anthropic: Claude Fable 5.1 и Mythos 5.1 Ура, у нас новая SOTA! Антропик обновили большие модели. Fable 5.1 получают все, Mythos 5.1 друзья антропик. Позициронируется с упором на науку, особенно биологию. Mythos на Terminal-Bench 4.0 набирает 60.9%, Fable 55.8%, Astra между ними с 57.9%. Fable 5.1 подросла вдвое на научной версии Terminal-Bench, с 24.7% до 52.6%. Контекст 1М, выход 128К, $10/$50, кэш $0.25 против $1 у Astra. Требования к безопасности такие же драконовские Блогпост, ДокументацияOpenAI: GPT-6 Astra и GPT-6 Pro Ура, у нас новая SOTA! Компания объявила что это AGI. Тут сложно сказать, но в среднем посильнее Fable 5.1: Terminal-Bench 4.0 57.9% против 55.8% у Fable 5.1. Хотя например на Humanity's Last Exam наоборот: Fable 65%, Astra 57.2%. Контекст 1М, выход 128К. Цена $10/$50, кэш $1. При >272К контекстаAnthropicIntroducing Claude Fable 5.1 and Claude Mythos 5.1Our most advanced models for coding and knowledge work. Their research capabilities also offer an early glimpse of how AI models will contribute to scientific progress.
