gram news
Аватар канала LLM под капотом

LLM под капотом

@llm_under_hood

Канал про разработку продуктов на базе LLM/ChatGPT. Выжимка важных новостей и разборы кейсов. Чтобы писать - напишите боту @llm_under_hood_bot Рекламы в канале - нет. За комменты от ботов баним вместе с хозяином.

ПроектыRUНейросети

29,000подписчиков

Открыть канал

Последние посты

  • LLM под капотом

    24 сент., 07:44

    Период полураспада софта - 3 месяцаЯ сейчас возвращаюсь к сайту BitGN, чтобы начать подготовку к соревнованию ECOM2 (agentic economy), добавить место для публикации LLM бенчмарков и в целом обновить дизайн.В этот код я давно не ходил, и он ну очень дремучий - эпохи где-то до декабря 2025 года, когда Codex расцвел. Современным стандартам AI Native разработки совсем не соответствует. Агенты спотыкаются часто (даже Astra), предлагают ерунду, прямо за ручку надо держать.А потом я восстановил хронологию и сильно удивился.Я же ушел из TimeToAct в феврале этого года, чтобы начать делать платформу для бенчмарков агентов. Этой весной мы с COLIBRIX провели два соревнования, с тех пор 2.8M задач выполнено агентами на платформе.И выходит, что возраст кода BitGN не “вечность” - а всего 7 месяцев от начала разработки. Причем в последний раз я туда активно ходил всего три месяца назад.За это время настолько улучшилось как качество современных AI code агентов, так и наше понимание об их эффективном использовании, что проекты быстро начинают казаться постаревшими.В общем, если кажется, что софт теперь стареет быстрее - это иллюзия. Код как преспокойно лежал себе в Git-e, так и лежит там. Это просто так быстро улучшаются наши ожидания о работе с AI Coding агентами.Ваш, @llm_under_hood 🤗
    4,1402411554Открыть в Telegram
  • LLM под капотом

    22 сент., 20:38изменён

    GPT-6 Sol и Luna - бенчмарк цены, качества и скоростиА еще Opus 5.5 и Astra 6 (medium). Все это - на нашем датасете BitGN запусков агентов в бизнес-задачах.Серая линия на графиках - старый фронтир моделей от июля (соотношение точности к цене и качеству). Захваченная розовая территория - насколько новые модели смогли пододвинуть этот фронтир вперед с июля.Сначала отдельно похвалю Kimi K3, которая заняла второе место по точности, пусть и оказалась слишком медленной и дорогой по сравнению с другими моделями.А вот GPT-6 фронтир пододвинули сильно.GPT-6 Sol (high) - в топах. А еще это первая модель, которая выбила все 100% на AI coding задачах. После ECOM2 наберем новых edge cases в бенчмарк.Более того, Sol - это не только самая лучшая модель за свои деньги, но и самая быстрая модель с таким качеством!GPT-6 Luna (high/med) пододвинули фронтир по стоимости. Astra 6 (medium) по сравнению с этими моделями плетется в хвосте (больно дорого и медленно)Claude Opus 5.5 на 26 месте, ибо модель нередко отказывается отвечать (API возвращает refusal), а отказы баллов в бизнесе не приносят. Но при этом два прокола безопасности через эту модель протащить удалось.В общем, Sol 6 и Luna 6 - новые рабочие лошадки. Можно смело переключать агентов на них.Но больше успехов конкретных моделей меня радует наглядный прогресс с июля в доступном качестве за все меньшие деньги.Ваш, @llm_under_hood 🤗
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    9,86063191231Открыть в Telegram
  • LLM под капотом

    22 сент., 15:51изменён

    Доклад про DDD + AI в проектах (Berlin, 2025, EN)Не прошло и года с прошлого KanDDDinsky, как на YouTube выложили видео с моим выступлением с этой конференции: "When DDD Met AI: Practical Stories from Enterprise Trenches"Если во время записи кажется, что я периодически кошусь в одно место в зале - это не кажется. Там сидит Eric Evans, который обещал быть самым полным энтузиазма слушателем)Кстати, на KanDDDinsky в этом году я проведу двухчасовой hands-on на тему "Engineering trustworthy and testable AI agent" (15 октября, 9:00, Hands-on track 1)Кто-нибудь будет на этой конференции? А еще, кто-нибудь хочет устроить встречу LLM под капотом в Берлине вечером 14го или 15го октября?Ваш, @llm_under_hood 🤗
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    7,47017731Открыть в Telegram
  • LLM под капотом

    22 сент., 14:11

    LLM Benchmark Jev - топ для простых задачJev - это новая LLM модель, в которую встроили Schema-Guided Reasoning, превратив в гибкий классификатор по шаблону.Jev не может генерировать тексты, но может на лету выбирать из предложенных вариантов. Поэтому модель можно использовать в задачах вроде классификации входящей почты, проверки запросов на красные флаги.Главное - не делать задачу слишком сложной.А вот насколько сложные задачи сложны для Jev? Мне стало интересно, и я адаптировал агентский бенчмарк BitGN, выбрав оттуда те задачи, которые можно свести к задачам классификации.Это разовый бенчмарк, который создан исключительно для Jev, чтобы можно было примерно прикидывать его когнитивные способности - насколько сложные задачи можно давать на вход.Понятно, что Jev не сравниться с нормальными LLM по гибкости и мощности (там даже Loop/Cascade из SGR толком не сделаешь), но вот в
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    7,6003521521Открыть в Telegram
  • LLM под капотом

    21 сент., 11:59

    Давно я не публиковал эссе. Вот новое.We never wanted human code.Ваш, @llm_under_hood 🤗
    7,50055125433Открыть в Telegram
  • LLM под капотом

    20 сент., 07:48изменён

    Вчера я решил попрактиковать нативную разработку агентами.Для этого попросил Codex переписать свой task manager для Codex-a (из этого поста) из web приложения в нативное. Просто, чтобы оно было красиво. Поставил XCode, отправил переписывать. При этом в разработку на маке я ни в зуб ногой.Заработало приложение с первого раза, но было не очень симпатично. После пары промптов стало как на скриншоте, заодно и с трекером уровня подписки.Теперь в том приложении мне точно больше ничего не надо. Codex работает для AI Native Code идеально.Но теперь начинает приходить понимание, что можно аналогичным образом сделать нативный control center для команды из людей и агентов под текущие задачи, входящую статистику, дашборды и тому подобное. И чтобы было красиво и на ноутбуке и на планшете и на телефоне.Если у вас уже есть такие control centers, скидывайте их скриншоты в комментарии!Ваш, @ll
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    7,53024118Открыть в Telegram
  • LLM под капотом

    17 сент., 07:04

    Вдохновляющая история о том, как AI/LLM снижает порог вхождения в нишевые нишиЧеловеку без опыта работы с железом захотелось разработать свою печатную плату на базе RPi, чтобы сделать свой маленький компьютер с e-ink экраном. Но он из интереса поставил себе два ограничения(1) человеку нельзя работать с файлами напрямую или проверять дизайн (2) все проблемы должен решать FableВ итоге (1) два часа работы Claude Fable (2) тыканье пальцем в автоматические ошибки от Design Rule Checking (3) Отправка заказа в JLCPCB (130 евро за 5 платок + e-ink экран)И работающий с первого раза свой собственный мини-компьютер по своим спецификациям - готов. История расписана тут. А сейчас автор аналогичным образом пытается сделать планшет на базе NVIDIA Jetson Orin Nano.Я вспоминаю, как мы мучительно разрабатывали простые opto-encoder платки для хобби-проекта высокоточной робо-руки, и от
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    14,50099211421Открыть в Telegram
  • LLM под капотом

    16 сент., 11:52изменён

    Мои принципы командной AI Native разработкиГлавная цель тут - самостоятельность агентов при сохранении общего замысла продукта.(1) Люди и агенты могут координировать работу через общий язык и явно сформулированные концепции. Это можно использовать, если нужно держать AI Native команду из них в синхроне, распараллеливая работу между ними.В начале нужно создать небольшое смысловое ядро. Это цель, язык, приоритеты и ограничения, из которых естественно следуют дальнейшие решения.Это маленький файл, который пишется вручную (агент может помогать вычитывать). Он грузится в начало контекста агентов и проговаривается со всеми людьми в команде. На базе него принимаются решения и расписываются требования.(2) Получается пирамида, где нижние слои детализируют верхние: смысловое ядро -> решения и требования -> исполняемые BDD спецификации -> код. Чем выше, тем важнее человеческое суждение и
    10,100382116321Открыть в Telegram
  • LLM под капотом

    14 сент., 18:02изменён

    Встреча LLM под капотом в Нови Саде!Не ожидал, что столько людей откликнется, а некоторые даже приедут издалека. Очень рад всех видеть!Оставляйте ссылки на свои профили и каналы в комментарии тут!Ваш, @llm_under_hood 🤗
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    9,820131331532Открыть в Telegram
  • LLM под капотом

    13 сент., 20:27изменён

    Спонтанные посиделки в Novi Sad завтра?Как насчет встретиться завтра в Нови Саде (понедельник 14-го) в 19:00 на предмет поболтать?Меня занесло в Сербию на пару дней. И я помню со времен BitGN, что тут в окрестностях есть активная часть коммьюнити. Встретимся завтра вечером?Наводиться на Корову (Irish Pub Red Cow)Ваш, @llm_under_hood 🤗
    11,200251732Открыть в Telegram
  • LLM под капотом

    10 сент., 13:36изменён

    Новым сайтом, агентом или еще каким приложением уже никого не удивить - это добра уже слишком много.Но мне по-прежнему взрывает мозг, насколько некоторые вещи упрощаются по сравнению с тем, как это было совсем недавно.Вот одна история сегодня. Причем это даже не рабочая задача была, а просто что-то в фоновом режиме.(1) Мне надоело отслеживать эту кашу из чатов в левой вкладке Codex. Мне ВСЕ нравится, только каша в интерфейсе не нравится. Спрашиваю у кодовой субличности из AI Native проекта: Слушай, Ты можешь как-нибудь подключится к Codex декстопному и сделать нормальный интерфейс. Чтобы было Working, Stowed, Focused(2) Codex: без проблем. Базы у меня тут, вот по этому IPC сокету можно получать обновления, вот так открывать по ссылке разговоры в приложении. Вот так я бы сделал приложение на HUGS стыке.(3) Я: слушай, позови Марка из Personal OS. Марк, сделай и скажи, как
    15,100423221321Открыть в Telegram
  • LLM под капотом

    9 сент., 10:33изменён

    Что включено в мой AI Native проект?У всех есть свои любимые агенты, модели и настройки проектов.Я лично не могу нарадоваться на ChatGPT Codex, еще с версии GPT-5.5. Особенно он меня радовал в летнем проекте, который я писал практически на ходу в remote режиме с сотового.И я решил выяснить, почему оно так хорошо работает. Я попросил Codex Astra проанализировать историю всех сессий этого проекта, классифицировать ситуации, где желаемый результат был достигнут, а потом сделать отчет - что помогло этому?В ~/.codex/sessions нашлось 314 рабочих сессий и 187 уникальных чатов с конца июля этого года (в основном под GPT-5.5/5.6). Вот те настройки и архитектурные решения, которые Astra посчитала самыми полезными и “AI Native”:• Executable SDD - продуктовые требования в связке с быстро исполняемыми BDD спеками и возможностью гонять SQL запросы • Event-driven архитектура, которая
    12,5003620141Открыть в Telegram
  • LLM под капотом

    8 сент., 15:01изменён

    Вот так выглядит восстание машин!Это Claude Code (Opus 5 High) отвечает мне, что для него прочитать правило - это не значит следовать ему.На самом деле, это старая и знакомая болячка моделей Claude, из-за которых я почти не использую их. Два исключения - UI Design и работа с текстами.А если нужно следования инструкциям, то есть волшебный промпт:Hey, look at the UI changes by Claude and cleanup the junk that violates piecemeal growth and document writing guidelinesЗадавать его нужно GPT-6 Astra или GPT-5.6 Sol. Уж они-то не только держат контекст моих проектов в голове, но и следуют инструкциям.Ваш, @llm_under_hood 🤗
    Иллюстрация к посту канала LLM под капотомИллюстрация к посту канала LLM под капотом
    12,000751710731Открыть в Telegram
  • LLM под капотом

    8 сент., 08:32

    Этой осенью я планирую провести ECOM2 - соревнование агентов по решению задачек из e-commerce на платформе BitGN.ECOM1 прошел этой весной. Часть лучших архитектур агентов описана в BitGN Insights, а другая часть лежит в PRs тут. Кстати, за лето счетчики платформы докрутили до 2.8M запусков задач и 121M AI Tool Calls!Задачи в ECOM2 будут примерно схожи с задачами ECOM1 (например задачи, которые выпали топовому агенту в Accuracy), но будет сюжетный поворот. И это уже не внезапная поломка MS SQL сервера в симуляционной среде.Мы уже будем говорить не про абстрактную точность, а про экономику агентов.Каждому агенту в соревновании мы с COLIBRIX дадим свой виртуальный “кошелек”, из которого он будет тратить деньги на LLM inference (OpenRouter), а пополнять – успешным решением задач. У кого на финише прибыль больше, тот и победил (номинация по скорости тоже будет).Да, агенты в работе
    10,4009321411Открыть в Telegram
  • LLM под капотом

    3 сент., 12:01изменён

    В последнее время появляется все больше историй, когда человек решает какую-то свою зудящую проблему, свалив ее описание и знание нюансов на AI Coding агента. А потом обнаруживается, что еще пара человек готовы заплатить несколько евро в месяц за это решение. Просим агента задеплоить на какой-нибудь fly.io, прикрутить прием платежей, и вот вам деньги на новую удочку или Lego ребенку.Несколько примеров со ссылками на рассказы авторов:MyMarineForecast - автор очень любит лодки. Он собрал с Claude Code приложение-дашборд для морских прогнозов. Через несколько недель и 99 коммитов появились первые платящие пользователи.LOC8 - полицейский сделал удобное приложение-локатор для спасателей. 1500$ в месяц спустя несколько месяцевPlottie - исследователь в биоинформатике, который не умеет кодить, сделал приложение для генерации красивых графиков, которые можно публиковать. Через 25 дней,
    13,800513514622Открыть в Telegram
  • LLM под капотом

    1 сент., 14:49изменён

    Если вы читаете текст, в котором кто-то делает прогноз про AI на следующий год - не верьте. Никто толком не понимает, куда все катится.Скажем, еще год назад вроде все было понятно: есть LLM-ки, которые можно встроить в чат и получить свой ChatGPT. Встроить в бизнес и получить автоматизацию.Это открыло новые возможности. Компании начали интенсивно пытаться интегрировать это в свои процессы, их лидеры начали вещать про AI трансформацию компаний, а инженеры - гундеть про галлюцинации, борьбу с ними и необходимость evals.А потом в декабре 2025 все это пошло по бороде. "Внезапно" Coding харнесы (Claude Code + Codex) стали настолько мощными и самостоятельными, что теперь даже человек без высшего образования может сделать продукт без LLM под капотом, как-то задеплоить его и начать зарабатывать. Что и говорить о людях с опытом.И эффект тут перекрывает с головой потенциальный эффект от
    13,600562218773Открыть в Telegram
  • LLM под капотом

    1 сент., 07:24изменён

    Хочу подробно ответить на один классный вопрос про AI CodingКак считаешь в ближайшем будущем прорыв будет получатся из-за улучшения базовых моделей, или же инженерных трюков как например рассказываешь ты у себя в канале? Многие вещи как про голд спт, евалы, бдд, контрол центр я нигде не слышал. Повсеместно почти люди вещают кому какой скилл поставить.Мне кажется, что все дело в целях и в аудитории, для которой ведется рассказ.Скилы хороши тем, что это что-то наглядное и удобно упакованное. Скилл можно легко поставить и сразу увидеть результат, что что-то поменялось. Такой материал хорошо работает для привлечения аудитории.У нас же уже сложилось классное коммьюнити - подписчики, участники чата и тематических групп. Тут есть директора, лиды и инженеры компаний США и Евразии, как корпораций, так и передовых стартапов. Про многие компании вы уже слышали или даже пользовались их
    11,30036219Открыть в Telegram
  • LLM под капотом

    31 авг., 17:46

    А давайте я осенью покажу, как в 2026 году начинал бы AI Native продукт с нуля? Как бы писал исполняемые спеки и боролся с багами?Но сначала маленькая предыстория)Сегодня мы закрываем продажу записи вебинара AI Coding, где мы с Айгизом рассказывали про наши подходы к AI Native разработке.Все началось спонтанно в начале лета с “давайте проведем вебинар про современную разработку при помощи агентов?”, а закончилось 5 потоками и таким списком ожидания, что пришлось открыть продажу записи.Было здорово увидеть на вебинаре и новых участников, и знакомые лица. Очень рад, что вебинар оказался полезным и что AI Coding подходы из него вы внедряете в своих проектах!Когда-то давно наши с вами вебинары по ассистентам выросли в курс с классным коммьюнити. А вебинары по AI Coding я хочу попробовать вырастить в обновляемую подписку.Начну с цикла материалов про разработку AI Native проекта с
    11,30058439611Открыть в Telegram
  • LLM под капотом

    30 авг., 10:09изменён

    11,500543053Открыть в Telegram
  • LLM под капотом

    26 авг., 13:33изменён

    Вебинар по AI-кодингу - в записиЭтим летом мы с Айгизом Кунафиным рассказывали пяти потокам слушателей про то, как строим AI-Native архитектуры.Шестой поток решили не делать, а сам вебинар теперь можно купить в записи - до конца августа. Тем, кто оставлял емейлы в списке ожидания, ссылки на покупку уже разослали.Вебинар можно купить здесь: https://buy.abdullin.com/ до 31.08.Что внутри: как строить AI-Native архитектуры вокруг рабочих кодовых баз - с legacy, бизнес-логикой, интеграциями, логами, требованиями, ревью и проверкой поведения. Говорим о том, как стабилизировать и масштабировать то, что уже неплохо работает, при помощи кодинг-агентов.Важный момент: мы с Айгизом показываем и сравниваем два разных рабочих подхода к организации AI Native проектов. Мой - через дерево документов и скриптов, его - через project skills & hooks. Оба - работающие.Мы разбираем эти два подхода
    14,1002817103Открыть в Telegram