gram news
Всеволод Викулин channel avatar

Всеволод Викулин

@vikulin_ai

Объясняю, как сделать AI системной бизнес-функцией, а не чередой бессмысленных пилотов. Сайт — vikulin.ai По вопросам — @seva_batareika

ProjectsRUAI

5,090subscribers

Open the Channel

Latest posts

  • Всеволод Викулин

    21 Sept, 06:20edited

    Кому можно вайбкодить и как это делатьУправление AI-агентами очень похоже на управление людьми. Это мало кто в индустрии понимает, но я попробую вас убедить на самом простом примере — вайбкодинге.Про вайбкодинг есть два крайних мнения: от «программисты больше не нужны» до «пользы никакой, раньше писали код, теперь ревьюим Клод». Давайте разберёмся, как к этому подходить, вдохновляясь дисциплиной, которой люди хорошо овладели. Менеджментом.Базовая теория управления от Всеволода ВикулинаЕсть два ключевых фактора, от которых зависит, как передать работу другому исполнителю: экспертность исполнителя в задаче и ваша экспертность в задаче.— Вы эксперт, а исполнитель нет. Тогда вам нужно самому декомпозировать задачу до такого уровня, чтобы исполнитель был экспертен в подзадаче. Потом принять результат подзадачи, дать следующую, и так далее.— Вы не эксперт, а исполнитель эксперт.
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    1,6203222111131Open in Telegram
  • Всеволод Викулин

    16 Sept, 05:49edited

    Кто управляет разработкой AI-проектаНесколько лет назад во время очередного релиза я понял, как называется моя профессия. Проджект-менеджер. Почему-то многие фыркают на это название. Ну, деливери-менеджер. Ну ладно, AI-деливери-менеджер. Так точно должно звучать круто. Сейчас обсудим, что это за зверь и как им стать.В чем задача?Довести проект до прода. И чтобы он был успешным для бизнеса. Как вы понимаете, учитывая плачевную статистику AI-проектов, сделать это сложно. А чтобы ваши проекты были успешными, вам одновременно надо иметь:— Техническую адекватность. Вы должны хорошо знать ML, базово — бэкенд, немного фронтенд и продакт-менеджмент. Не лучше всех в команде, но достаточно, чтобы выслушать профессионала и понять его.— Хорошие софты. Лидерство. Короче, чтобы с вами было хорошо и приятно работать.— Любовь к принятию решений. Вы не самый сильный технарь, но вы должны
    2,420341910532Open in Telegram
  • Всеволод Викулин

    8 Sept, 06:17

    Всеобъемлющая статья про инференс LLMМногие у меня спрашивают, как посчитать GPU и как после этого сохранить рассудок. Потому что насчитали столько, что даже начальник, который очень-очень любит ИИ, не окнет.Теперь у меня есть для вас решение: прочитать мою статью и начать оптимизировать насчитанное.Всю статью старался писать максимально простым языком, чтобы было понятно не только хардкорному инженеру. В ней есть:- Как устроен инференс LLM - Как оценить, сколько на него нужно GPU - Какие есть методы оптимизации - В каких движках это релизованоЧитайте, делитесь с друзьями.И задавайте вовпросы в комментариях или в личные сообщения @seva_batareika.
    vikulin.aiВнедрить LLM и не разориться. Как считать GPU и уменьшать насчитанноеПочему инференс LLM упирается в память, а не в мощность карты, как посчитать нужное количество GPU и как уменьшить это число в разы.
    3,41040208222Open in Telegram
  • Всеволод Викулин

    30 Aug, 08:24

    Как стать AI-native компаниейAI всегда был гонкой инфраструктуры. Если вы хотите крутые AI-продукты, пожалуйста, сделайте логирование всех данных, сложите их в огромное хранилище, потом варите из этого таблички, а сверху табличек обучайте модели на кластере. Хотите покруче — переходите на новую инфраструктуру. Через 2 года сможете. Чтобы варить лучшую AI-кашку, нужно иметь дорогой горшочек. Почти из золота.Мне, кстати, никогда это не нравилось. Я люблю 80% эффекта за 20% усилий. Поэтому мне нравится искать дырки в заборах: нетривиальные решения, которые срезают дорогие и долгие углы. Вот, например, последняя дырка в заборе — как мы описываем процесс для автоматизации через агентов. Дешево и быстро. А дорогие и долгие процессы мне не нравятся. Как-то неспортивно.Вот сейчас открылась огромная дырень в заборе технологичности. И я просто кайфую. Готовы узнать какая?AI может сам
    3,980531712322Open in Telegram
  • Всеволод Викулин

    25 Aug, 06:32

    Первый обзор научной статьи в этом каналеЯ не фанат читать свежие статьи. Сам когда-то занимался физикой и понимаю: 99 % работ никогда не доходят до применения. Читать сто статей, чтобы найти золото, я не могу — я не металлоискатель. У меня свой метод.Я статейный ждун. Жду, когда компании, у которых R&D-отдел в сто раз больше моего, перепробуют все эти статьи и найдут, что реально работает. А потом хитрый ждун про это узнаёт: от знакомых, из пресс-релизов или из тех же статей, но уже от самой компании — с комментарием, где оно работает в проде.Сегодня смотрим на метод, которого я дождался, — AlphaEvolve. По слухам, его уже вовсю применяют наши большие западные коллеги. А теперь и я сам убедился в адекватности подхода. Садитесь поудобнее.Что такое AlphaEvolveСтатья Google DeepMind.Идея проста. Если у вас есть метрика, которую можно посчитать автоматически, — вы можете
    4,480281811222Open in Telegram
  • Всеволод Викулин

    18 Aug, 07:25

    Вам LLM побыстрее или подешевле? Выберите только одноПочему-то во всех командах, где я работал, я всегда отвечал за оценку, сколько нам надо GPU. То ли я выгляжу очень экономным, то ли авторитетным. Хотя для оценки GPU надо быть скорее везучим. Потому что оценить, во сколько нам влетит инференс — очень хитрая задача. И зависит это в первую очередь от терпения наших пользователей. Давайте вместе разбираться.Предсказание в LLM идёт токен за токеном, слева направо. И в прошлом посте мы выяснили, что инференс LLM тормозит, потому что мы на каждый токен гоняем миллиарды весов модели по памяти видеокарты.На самом деле, я вас тогда капелюшечку обманул. Помимо весов модели, нам придётся гонять ещё матрицу с результатами прошлых вычислений — чтобы не пересчитывать заново всё. Хранятся там K и V каждого прошлого токена, отсюда и название: KV-кэш. Подробнее про это самые любознательные
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    3,470231510431Open in Telegram
  • Всеволод Викулин

    15 Aug, 11:25

    Топ постов Всеволода Викулина (по мнению Всеволода Викулина)За последнее время я написал несколько действительно хороших материалов. Но мне решительно не нравится, что еще не все их прочли. Давайте это исправлять!Посты- Почему все делают AI-пилоты, которые я ненавижу- Почему вам должно быть пофиг на рисовалки агентов- Как я очень очень не люблю векторный поиск- Уже пора не делать агентов, а делать агентов, которые делают агентов- Как мы настраиваем метрики качества через пирамиду- Как оценивать инженеров через бодрость- Основный принцип инференса LLM. Разобрался, и мир абсолютно понятен
    2,980331210833Open in Telegram
  • Всеволод Викулин

    13 Aug, 06:04

    Какие команды добиваются экстраординарных результатовЯ ужасный разработчик. Если бы вы видели мой код в проде, вы бы отписались от этого канала.Я довольно неплохой ML-щик: знаю много разных методов (потому что я старый)). Но многие в нашей команде сильно продвинутее меня.Но я отличный менеджер. Если брать менеджмент в ML, я бы, думаю, попал в топ-30 до 30 :) Так что иногда буду писать про управление командами.Какие команды добиваются экстраординарных результатов? Маленькие. Есть пошлое слово talent density — вот это про это. Почему так?Во-первых, бизнес-эффект нелинейно зависит от качества решения. Агент, сделанный на 10% лучше, может дать экономию на 10 тысяч % больше. А качество решения в сложных R&D-задачах определяется самым сильным человеком в команде, а не суммой всех человеков. Так что вам выгоднее, чтобы самую сложную и дорогую проблему решил один гений, а не двести
    3,370412015442Open in Telegram
  • Всеволод Викулин

    12 Aug, 06:13

    Улучшаем качество без обучения. Диаграмма контекст–computeЯ много писал про важность контекста — пришло время упаковать это в нормальную схему. Напомню: у вас два рычага — вычисления на инференсе и контекст.Шаг 0. Берём самую жирную модель, что доступна, и включаем ризонинг, чтобы рассуждала подольше. Экономика не бьётся — пофиг, бабки не проблема.Шаг 1. Берём датасет, прогоняем на нём наш космолёт, смотрим ошибки, собираем контент, который эти ошибки исправляет. Лучше делать это в цикле через другого агента — подробнее тут.Шаг 2. Потом окажется, что знаний дофига, но в них сложно ориентироваться, и модель начинает тупить. Теперь мы упрощаем доступ к знаниям. Улучшаем описания тулов, добавляем заголовки и теги. Строим харнесс, чтобы подсасывать в модель только лучшее. Часть контента дропаем, часть суммаризуем. Тут в итоге должно случиться офигенное качество.Шаг 3. Начинаем
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    3,320301210221Open in Telegram
  • Всеволод Викулин

    7 Aug, 06:38

    Запись моего выступления на Data FestНаходится вот тут. Говорил про экономику и стратегию. Про правильные процессы и полезных в них агентов. Про платформы и форвард-деплойд инженеров. И много шутил.Местами даже удачно. Местами мне до сих пор неловко.Вам точно понравится.
    YouTubeВсеволод Викулин | Реальная автоматизация: в каких процессах AI-агенты приносят пользуСпикер: Всеволод Викулин, Т-Банк, руководитель команды роботов в обслуживании Data Fest 2026: https://ods.ai/events/datafest2026 Презентацию к докладу Вы можете скачать в треке секции Data Strategy ______ Наши соц.сети: Telegram: https://t.me/datafest…
    4,910362111432Open in Telegram
  • Всеволод Викулин

    6 Aug, 06:49edited

    Внедрить AI — это испить чашу боли. А можно ли иначе?Во-первых, я говорю только про крупные внедрения, которые видны в P&L компании. Если вы сделали ассистента, которым никто не пользуется, — это тоже больно, но по-другому.Во-вторых, я не говорю про «продуктовый AI» — это когда у вас большая поверхность в продукте и похожие задачи на входе. Рекомендательные системы, поиск, кредитный скоринг и так далее. Там тоже тяжело, но тяжело технологически. А я — про боль.Мне больно, потому что У ВСЕХ ВСЕ ПО-РАЗНОМУ. Каждый процесс в поддержке отличается от соседнего. Так же будет в бухгалтерии, в разработке и где угодно ещё. У всех миллион интеграций, и большая часть из них устроена по-своему — как будто только для того, чтобы мне было больно (подробнее читайте в моей статье).Хитрый трюк: сделать так, чтобы больно было, но не вамПлатформа. Накрутить заранее миллиард кастомизаций,
    3,31020148221Open in Telegram
  • Всеволод Викулин

    4 Aug, 06:24

    Чтобы ускорить инференс LLM, надо всего лишь... ЧИТАТЬ ДАЛЕЕНе все понимают, что тормозит инференс LLM. Сейчас расскажу — и, честно говоря, дальше вы уже сможете без меня. Почти вся оптимизация следует из этого. Всему виной то, что мы...ГОНЯЕМ ВЕСА ТУДА-СЮДАСовсем базово. В GPU, как и в других вычислительных устройствах, есть два класса памяти: DRAM и SRAM (хихихи, но не так смешно как JEPA у Лекуна).DRAM — относительно дешёвая и относительно медленная. Именно туда вы загружаете модель, когда поднимаете инференс. Допустим, у вас модель на 35B параметров и вы храните её в fp16 (2 байта на вес). Значит, нужно 70 ГБ DRAM. Дальше разбираем на примере H100: там 80 ГБ. Влезло.SRAM — дорогая и быстрая. Дорогого и быстрого логично давать умеренно. В 1000 раз меньше. Зато SRAM сидит вплотную к ядрам, на которых и происходят вычисления. Поэтому веса модели перетекают из DRAM в SRAM — на
    3,420542811632Open in Telegram
  • Всеволод Викулин

    1 Aug, 13:55

    Бизнес-модель моего телеграм-каналаКлянусь вам: раз в неделю мне пишут продюсеры онлайн-курсов. «Сева, у тебя такой классный контент, но ты не монетизируешь его на максимум! Давай опрос проведём, вороночку построим, курсик запишем, прибыль поделим».После быстрого ответа «Нет» они удивляются: а зачем тогда всё это, если не ради того, чтобы стричь бабло? Сейчас расскажу.Я хочу собрать самое крутое сообщество, которое внедряет AI в бизнес. По-настоящему.Не придумывает бесполезные стратегии AI-трансформации. Не вайбкодит личного ассистента для почты генерального директора. Не продаёт курсы «Как стать AI-native мясокомбинатом».Я собираю людей, которые действительно хотят менять этот мир с помощью AI, и помогаю им этого добиться. Тремя способами:— бесплатным советом (просто пишите в личку с вопросом); — совместной работой (мы нанимаем :)); — вот такими, надеюсь, не самыми
    Image from a post by Всеволод ВикулинImage from a post by Всеволод ВикулинImage from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    3,3701702913887Open in Telegram
  • Всеволод Викулин

    30 Jul, 07:44

    5 лет проведения собеседований в одном постеЭта картинка стоила мне 5-ти лет опыта нанимающего менеджера и 3-х лет интенсивной психотерапии.На финальной встрече я редко спрашиваю что-то про LLM. Во-первых, потому что уже до меня спросили. Во-вторых и в главных — потому что я уверен, что это не главное. Те методы NLP-разработки, которые применяем мы сейчас, год назад не использовал вообще никто. А еще через год все снова поменяется. Главное, что я ищу в кандидате, — это софты. И главный из них — бодрость.Термин я украл у бывшего руководителя из Яндекса. Уверен, что, если спросить нас обоих, мы дадим разные определения этого качества. Но при этом я уверен, что понимаем мы его одинаково.Бодрость — это когда человека просишь, и он решает. Он не просит у тебя точного ТЗ, он сам задаст все вопросы. Он не думает про Scrum и Kanban: если нужно, он сам навайбкодит себе подходящий
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    4,4906827121154Open in Telegram
  • Всеволод Викулин

    28 Jul, 06:30edited

    Как вам улучшать LLM, если я запрещаю их дообучатьЯ, кажется, самый большой хейтер дообучения в индустрии. Не потому что не умею — а потому что это технически очень сложная задача, которая может сломать вам жизнь LLM. Писал подробнее тут и тут.И каждый раз слышу в ответ: ты, конечно, умный, Всеволод, но вот у нас качество не 100 %. Как нам улучшать модель без обучения?! Любимая привычка двигать веса в сторону локального минимума засела в нас так крепко, что мы разучились делать все остальное. Что ж, будем меняться.1. Самое главное — контекст. Это ровно тот же backpropagation, только через текст, а не через веса. Посмотрите на цикл: модель ошиблась → вы нашли примеры, где она ошибается (на самом деле другой агент нашел) → дописали их в контекст → перезапустили замер. Очевидные плюсы. Веса не меняются, можно сервить в одном месте. Все очень наглядно — можно глазками проверить, что
    3,74025107532Open in Telegram
  • Всеволод Викулин

    26 Jul, 11:16

    Если вы пропустили наш митап по внедрению GenAI в обслуживаниеТо мы его записали: YouTube и ВК. Там 4 крутецких доклада:1. Вводный про стратегию и платформу2. Как мы замеряем качество агентов3. Про спекулятивный декодинг4. GenAI поверх интерфейсов сотрудников.Рекомендую смотреть ровно в таком порядке. Ссылки на презентации на странице мероприятия.Будут еще крутые митапы, где мы будем собираться нашем уютном комьюнити и делиться, как внедрять агентиков в суровый энтерпрайз.Честно. Технологично. И с чувством юмора :)
    YouTubeКак мы используем спекулятивное декодирование для ускорения LLM инференса — Владислав КругликовРазобрали: → Основные причины, почему LLM медленно генерируют ответы. → Как спекулятивное декодирование ускоряет генерацию без потери качества. → Популярные методы в индустрии. → Что вам делать на практике.
    4,24026196422Open in Telegram
  • Всеволод Викулин

    22 Jul, 06:25

    Один контекст, что правит всемиВ прошлом посте мы обсуждали, как устроена оценка агентов вообще. Сейчас я расскажу, что конкретно делаем мы. И почему я считаю, что это очень круто.О что заземлятьсяЧтобы измерить качество агента, нужен ground truth — точка опоры, относительно которой видно, где он накосячил.Первое, что приходит в голову — взять экспертов. Cпрашивать их: хороший ответ или плохой. Идея рабочая ровно до того момента, пока вы не захотите что-то с ней сделать. Мнение эксперта живёт у него в голове. Его нельзя пересмотреть, про него можно только на кухне поспорить. Вы получаете оценку, но не получаете рычага, как ее улучшить.Регламент — другое дело. Агент отступил от правила — ошибка. Но нельзя просто так взять и написать эту базу знаний выписать. У людей куча правил, которые для них слишком очевидны, чтобы их проговаривать. Поэтому мы строим отдельный агентский
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    4,15016104411Open in Telegram
  • Всеволод Викулин

    13 Jul, 05:55

    Пирамида метрик качестваКогда я разбираюсь, как в проекте устроена оценка качества, меньше всего я хочу найти промпт к GPT-5: «По шкале от 1 бегемотика до 10 бегемотиков оцени, насколько этот ответ полезен пользователю».Но эта школа мысли меня как будто преследует. Прогнали на десяти примерах, вроде что-то выдаёт. LLM-as-a-judge готов, расходимся. Не расходимся. Читаем этот пост.Слои пирамидыКаждый инструмент нужно скалибровать: оценить качество относительно эталона. Мы уже разбирали в статье, что размечать можно как людьми (асессорами), так и моделями (LLM-as-a-judge). То есть калибровать надо всех: LLM, асессоров, людей, которые калибруют асессоров, людей, которые калибруют тех, кто... Ну, вы поняли. В итоге всё это складывается в понятную пирамиду.Она устроена по принципу генерализации: чем выше слой, тем быстрее схватывает разметчик. Но и тем дороже разметить каждый пример.
    Image from a post by Всеволод ВикулинImage from a post by Всеволод Викулин
    4,81028156532Open in Telegram
  • Всеволод Викулин

    3 Jul, 06:53

    Агенты, которые делают агентовМой главный принцип в работе — фокус. Обычно самое важное кроется только в одной ключевой вещи, а всё остальное можно сделать потом, другими людьми или не делать вообще (чаще всего можно не делать).Мы долго пытались найти эту вещь в разработке агентов. Кажется, нашли. Эта ключевая вещь — контекст. А точнее, способ его построения. Неважно, какой у вас оркестратор. Не очень важно, какая под ним LLM — если у неё нет правильного контекста, даже самая мощная модель не справится. И уж совсем неважно, в какой Ui-ке вы всё это рисуете.Почему нельзя просто взять и написать контекстПотому что непонятно, что именно нужно написать.Заранее вы не можете знать что у LLM было в претрейне, а что нужно объяснить про вашу задачу. Знает ли этот стандарт принятый у вас в разработке? А этот аспект права? А слышала ли про новый банковский продукт? Поэтому проще считать,
    5,420372210833Open in Telegram
  • Всеволод Викулин

    29 Jun, 19:44

    Сынок, ты связался с плохой компанией? Мама, я ее основал Анонс: наша команда 29-го июня в офисе Т-Банка проведет митап по внедрению GenAI в операционку. У меня есть твердая уверенность, что я знаю, как это сделать. У вас есть возможность после митапа убедить
    5,02030219221Open in Telegram