gram news
AI-Driven Development. Родион Мостовой channel avatar

AI-Driven Development. Родион Мостовой

@ai_driven

Увлекательно рассказываю про AI в разработке, про построение продуктов с LLM под капотом и иногда про .NET. Связь: @rodion_m_tg Чат: @ai_driven_chat

ProjectsRUAI

5,320subscribers

Open the Channel

Latest posts

  • AI-Driven Development. Родион Мостовой

    22 Sept, 12:56

    forwarded from @kdoronin_blog

    Выступление за выступлением.Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что работает, а что нет.Вот вам ещё немного анонсов выступлений на грядущую неделю.Во вторник, 22 сентября, в 18:00 (GMT+3) на буткемпе от NAITION расскажу про feedback-loop в работе с агентами.Как правильно настроенные циклы обратной связи помогают достичь более качественного результата от работы AI-агентов. И о том, как feedback-loop помогают измерить качество процессов.А в среду, 23 сентября, также в 18:00 (GMT+3), выступят мои товарищи по авторским AI-блогам – Родион Мостовой и Максим Ключников (вы могли их видеть у меня на эфирах про код с AI-агентами и про экономию токенов). Они выступят с очень амбициозной темой: "Конвертируем Enterprise-проект в Dark Factory". Расскажут про то, какой путь надо преодолеть компании на пути к этому состоянию.Даты и
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    57565Open in Telegram
  • AI-Driven Development. Родион Мостовой

    22 Sept, 07:05

    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    1,1401331Open in Telegram
  • AI-Driven Development. Родион Мостовой

    21 Sept, 20:21edited

    Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со спокойной душой идешь спать. Спека дошлифовывается, а Девин субагенты потом идут ее выполнять под контролем Астры. Вообще, тщательное разжевывание сложных и неочевидных мест прямо в плане сильной моделью - важнейшая штука в SDD, особенно когда сама работа делегируется агенту подешевле. А планеров в данном случае двое - Астра основная и Fable советник(ца).@ai_driven
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    1,4102211Open in Telegram
  • AI-Driven Development. Родион Мостовой

    18 Sept, 18:50edited

    CognitionIntroducing SWE-2: Pushing the Pareto FrontierToday we’re introducing SWE-2, our most advanced coding model yet. SWE-2 delivers highly competitive agentic coding performance across multiple effort…
    2,8003072Open in Telegram
  • AI-Driven Development. Родион Мостовой

    18 Sept, 13:17

    2,4303114431Open in Telegram
  • AI-Driven Development. Родион Мостовой

    18 Sept, 11:13edited

    Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать
    GitHubGitHub - CodeAlive-AI/mastra-jev-moderation: Input moderation for Mastra agents on TypeSafe Jev — one fileInput moderation for Mastra agents on TypeSafe Jev — one file - CodeAlive-AI/mastra-jev-moderation
    1,80065Open in Telegram
  • AI-Driven Development. Родион Мостовой

    18 Sept, 06:50

    Юзкейсы Jev: улучшение RAG, Browser Use, ...Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно). В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.Я уже успел провести эксперименты с Jev в одном из своих продуктов: 1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    2,13021101Open in Telegram
  • AI-Driven Development. Родион Мостовой

    12 Sept, 07:31

    Нелепости агентовАгентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опусом, а потом на e2e вот такое вот выясняется (см. скрин и пояснения в конце). И это прям системная история - 99% получается хорошо и правдоподобно, а в каком-то неожиданном месте Но справедливости ради - это был сложный и огромный кусок работы на десятки тысяч строк кода, хоть и делался в лучших традициях SDD с хорошим планом.Выводы? 1. Делайте e2e тесты - причем как классические через условный Playwright / XCUIAutomation и тд, так и агентные "JIT" тесты - когда агент сам запускает вашу систему в около продовых условиях и ведет себя как Manual QA. 2. Рефлексируйте - если все-таки что-то вылезло несмотря на все ваши пятьсон уровней гардрейлов, обязательно ищите источник проблемы - то есть, в какой момент вашей даркфактори агентного пайплайна вылеза ошибка и как
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    2,4201341Open in Telegram
  • AI-Driven Development. Родион Мостовой

    11 Sept, 13:49

    DS 4.1 Flash и галлюцинацииТам новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций. Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ.Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    2,450115Open in Telegram
  • AI-Driven Development. Родион Мостовой

    11 Sept, 06:05edited

    Дешевые токены и оркестрацияВ последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины. Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    2,420257Open in Telegram
  • AI-Driven Development. Родион Мостовой

    5 Sept, 18:36edited

    Как вам Астра? Я пробую ей давать небольшие баг фиксы на минимальном ризонинге и она работает очень быстро и делает хорошо. Ловлю приятное ощущение, что теперь кучу хвостов можно позакрывать быстро и хорошо (надеюсь, ощущение не обманчиво). Баги исправляются в одном из моих легаси проектов, который я развиваю еще с 2012 года и он ни разу не AI ready (разве что визуальный фидбек настроен). В общем, пока выглядит так, что low (light) ризонинга вполне достаточно для большинства задач, что и бенчмарки подтверждают - DeepSWE, FrontierCode. Единственное что удручает так это быстрый расход лимитов - даже на моей 200$ подписке. С другой же стороны, когда довольно быстро получаешь ожидаемый результат, то может оно того и стоит. Кстати, с более сложной задачей по качественному RAG по большей базе нормативов пока не справилась ни Fable 5.1 max, ни Astra pro - в очередной раз убеждаюсь насколько
    TelegramMike in Чат AI-Driven DevelopmentГолосовой попробуйте, песня просто. Кстати в голосовом это та же астра и он может быть теперь активирован в любом чате. Но я решил создать проект оркестратор где в одном чате с голосового хочу попробовать оркестрировать другие проекты. Он умеет передать задачу…
    2,91087Open in Telegram
  • AI-Driven Development. Родион Мостовой

    1 Sept, 20:50edited

    Нюансы Fable 5.1 в SWE задачахВ системной карточке Fable 5.1 (которая аж на 212 страниц) как обычно можно найти множество интересных инсайтов. Вот что мне показалось интересным:Нынче один самых важных вопросов - а какой reasoning effort оптимален? Тк мы видим из бенчей, что он напрямую влияет на цену, а значит и на то, как быстро будут уходить лимиты. Кроме того, на некоторых бенчах можно заметить, что более высокий effort ухудшает результаты моделей. Так, например, во FrontierCode (Main субсет) результаты Fable 5.1 после medium не становятся лучше. А если сравнивать medium vs max, то получим 50.9% vs 50.3%, при том, что medium почти в 5 раз дешевле max. Кроме того, в этом бенче Fable 5.1 medium даже вышел дешевле, чем Opus 5 medium, хоть и с чуть более скромным результатом (50.9 vs 53.4), что тоже слегка удивляет. А в карточке Антропик по этому поводу пишут, что на высоком
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    3,650204Open in Telegram
  • AI-Driven Development. Родион Мостовой

    30 Aug, 08:26edited

    Периодически натыкаюсь на разные исследования о том, что в среднем AI не повышает эффективность разработки, что часть команд получают существенный буст, а другая часть наоборот замедляется, да и на моих консультациях это довольно распространенная проблема. Так вот, понятно, что во внедрении AI в существующие процессы и команды разработки куча нюансов и это комплексный процесс, требующий системного подхода и изучения - самостоятельного (больше шишек) либо с условным наставником, который уже успел пройти этот путь (меньше шишек, быстрее профит). Но менее очевидно другое - при внедрении такого мощного бустера, как AI замедление на начальных этапах вполне естественно. Грубо это можно сравнить с тем, как раньше все в вашем городе передвигались на велосипедах и тут все (или не все) резко пересели на автомобили, не успев получить права - да, первое время будет много аварий, но постепенно
    3,090104Open in Telegram
  • AI-Driven Development. Родион Мостовой

    28 Aug, 10:03

    Мы в эфире: https://youtube.com/live/bByMKD_wKpQ?feature=share
    YouTubeJujutsu: решение проблем с Git для агентов — с Фёдором ШереметьевымПоследний месяц я активно использую Jujutsu (JJ) — современную систему контроля версий от Google — в агентной разработке. Обсудим, почему некоторые особенности JJ хорошо подходят для работы с кодовыми агентами: • конфликтные состояния допустимы и могут…
  • AI-Driven Development. Родион Мостовой

    28 Aug, 07:04edited

  • AI-Driven Development. Родион Мостовой

    27 Aug, 23:21edited

    Стрим по Jujutsu: решение проблем с git для агентовПоследний месяц я на своих проектах активно работаю с Jujutsu (JJ) - современной VCS от Google. Это довольно интересная попытка переизобрести Git и часть его особенностей довольно хорошо ложатся на агентную разработку и решают часть ее проблем. Например:- Конфликтные состояния допустимы - то есть, в истории реально могут лежать конфликты, которые вы с агентами сможете решить тогда, когда вам будет удобно - Возможность легко двигать, сплитить и пересобирать коммиты - Еще, там нет понятия unstaged - все, что агенты делают по умолчанию попадает в - это решает проблему потерянных измененийНо есть и разные подводные камни, которые могут мешать привычной работе и их нужно заранее предусмотреть. В общем, мне решение показалось интересным, поэтому я решил рассказать о нем вам и организовать встречу. В кач-ве эксперта я позвал Федора
    YouTubeJujutsu: решение проблем с Git для агентов — с Фёдором ШереметьевымПоследний месяц я активно использую Jujutsu (JJ) — современную систему контроля версий от Google — в агентной разработке. Обсудим, почему некоторые особенности JJ хорошо подходят для работы с кодовыми агентами: • конфликтные состояния допустимы и могут…
    2,570177Open in Telegram
  • AI-Driven Development. Родион Мостовой

    23 Aug, 13:35

    Вайб-релиз Bun на RustНа моей памяти это первый настоящий вайб релиз такого масштаба. Помните тот PR команды bun на миллион строк, который им Claude Code сгенерил. Так вот, прошло чуть более 3 месяцев и они зарелизили апдейт для всех. И результаты впечатляют - мало того, что по множеству метрикам ощутимый прирост, так ещё и +1.5к новых тестов с node.js теперь проходят и на bun (это 80.5% всех тестов node.js). Для меня лично наиболее интересный выигрыш в возможности ускорить тесты в наших проектах на node runtime, ибо с приходом агентной разработки, количество тестов выросло кратко, а выполняться они стали неприлично долго. Попробую обязательно. А если вдруг кто-то уже успел попробовать новый bun - поделитесь в комментариях своим опытом, интересно почитать.Браво команде bun и Антропикам, их купившим.https://bun.com/blog/bun-v1.4@ai_driven
    BunBun 1.4Bun 1.4 rewrites Bun in Rust, ships built-in headless browser automation (Bun.WebView), Bun.Image, Bun.markdown, JSON5, JSONL, Terminal and cron APIs, Node.js 26.3.0 compatibility with 1,517 newly passing tests, parallel test and run, Windows ARM64, and an…
    2,940152Open in Telegram
  • AI-Driven Development. Родион Мостовой

    21 Aug, 07:01

    "Делай хорошо" или антипромптинг Sol Накипело. Помните мы раньше просили модели делать хорошо, учитывать корнер кейсы и тд? Так вот, как минимум с GPT 5.6 Sol настало время наоборот просить агента не делать лишнего и не переусложнять. Это модель, которая
    Image from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион МостовойImage from a post by AI-Driven Development. Родион Мостовой
    2,940259Open in Telegram
  • AI-Driven Development. Родион Мостовой

    20 Aug, 16:07

    forwarded from @kdoronin_blog

    Мы начинаем наш стрим "Как писать код с AI-агентами?"Подключайтесь по ссылке: https://youtube.com/live/x0j1kcagoXg
    YouTubeКак писать код с AI-агентами?Страница донатов: https://www.donationalerts.com/r/kdoronin Подписывайтесь на участников стрима в Telegram: Валера Ковальский – https://t.me/neuraldeep Максим Ключников – https://t.me/etechlead Константин Доронин – https://t.me/kdoronin_blog Проекты гостей…
    1,84062Open in Telegram
  • AI-Driven Development. Родион Мостовой

    20 Aug, 16:07

    Друзья нашего канала в компании с Андреем Бреславом сейчас будут обсуждать как писать код с агентами - такое смотрим с удовольствием