Последние посты

AI-Driven Development. Родион Мостовой
22 сент., 12:56
переслано из @kdoronin_blog
Выступление за выступлением.Примерно так проходит для меня сентябрь. Много знакомств, интересных историй и опыта о том, что работает, а что нет.Вот вам ещё немного анонсов выступлений на грядущую неделю.Во вторник, 22 сентября, в 18:00 (GMT+3) на буткемпе от NAITION расскажу про feedback-loop в работе с агентами.Как правильно настроенные циклы обратной связи помогают достичь более качественного результата от работы AI-агентов. И о том, как feedback-loop помогают измерить качество процессов.А в среду, 23 сентября, также в 18:00 (GMT+3), выступят мои товарищи по авторским AI-блогам – Родион Мостовой и Максим Ключников (вы могли их видеть у меня на эфирах про код с AI-агентами и про экономию токенов). Они выступят с очень амбициозной темой: "Конвертируем Enterprise-проект в Dark Factory". Расскажут про то, какой путь надо преодолеть компании на пути к этому состоянию.Даты и


AI-Driven Development. Родион Мостовой
22 сент., 07:05



AI-Driven Development. Родион Мостовой
21 сент., 20:21изменён
Вот за что люблю очередь сообщений в Codex. Накидываешь задачи на ночь одну за другой и со спокойной душой идешь спать. Спека дошлифовывается, а Девин субагенты потом идут ее выполнять под контролем Астры. Вообще, тщательное разжевывание сложных и неочевидных мест прямо в плане сильной моделью - важнейшая штука в SDD, особенно когда сама работа делегируется агенту подешевле. А планеров в данном случае двое - Астра основная и Fable советник(ца).@ai_driven

- CognitionIntroducing SWE-2: Pushing the Pareto FrontierToday we’re introducing SWE-2, our most advanced coding model yet. SWE-2 delivers highly competitive agentic coding performance across multiple effort…

AI-Driven Development. Родион Мостовой
18 сент., 18:50изменён

AI-Driven Development. Родион Мостовой
18 сент., 13:17

AI-Driven Development. Родион Мостовой
18 сент., 11:13изменён
Юзкейсы Jev: улучшение RAG, Browser Use, ... Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показыватьGitHubGitHub - CodeAlive-AI/mastra-jev-moderation: Input moderation for Mastra agents on TypeSafe Jev — one fileInput moderation for Mastra agents on TypeSafe Jev — one file - CodeAlive-AI/mastra-jev-moderation
AI-Driven Development. Родион Мостовой
18 сент., 06:50
Юзкейсы Jev: улучшение RAG, Browser Use, ...Вы, наверное, уже видели, что появилась новая интересная LLMка Jev - суть ее в том, что она умеет, прежде всего, выбирать правильный вариант ответа (Choice), ну или бинарно отвечать на запрос (Noul) и показывать вероятности каждого варианта. В принципе, современные LLM тоже такое умеют через structured output, но ключевая фишка Jev в том, что делает она это очень быстро и дешево (генерируя ответ в параллель, а не последовательно). В целом, для агентостроителей это дает возможность ускорить и удешить разные участки своих агентов / пайплайнов.Я уже успел провести эксперименты с Jev в одном из своих продуктов: 1. Внутри RAG пайплайна в качестве реранкера: в целом, реранкинг через Choice получился качественнее, быстрее и дешевле, чем реранкинг через Voyage rerank-2.5, Qwen3-Reranker-8B, Cohere rerank-v4-pro (см. скрин). Вообще, для RAGов это



AI-Driven Development. Родион Мостовой
12 сент., 07:31
Нелепости агентовАгентная разработка - веселая штука конечно. Вот планируешь и кодишь несколько дней с Астрой, Фейблом и Опусом, а потом на e2e вот такое вот выясняется (см. скрин и пояснения в конце). И это прям системная история - 99% получается хорошо и правдоподобно, а в каком-то неожиданном месте Но справедливости ради - это был сложный и огромный кусок работы на десятки тысяч строк кода, хоть и делался в лучших традициях SDD с хорошим планом.Выводы? 1. Делайте e2e тесты - причем как классические через условный Playwright / XCUIAutomation и тд, так и агентные "JIT" тесты - когда агент сам запускает вашу систему в около продовых условиях и ведет себя как Manual QA. 2. Рефлексируйте - если все-таки что-то вылезло несмотря на все ваши пятьсон уровней гардрейлов, обязательно ищите источник проблемы - то есть, в какой момент вашей даркфактори агентного пайплайна вылеза ошибка и как


AI-Driven Development. Родион Мостовой
11 сент., 13:49
DS 4.1 Flash и галлюцинацииТам новый дипсик впечатляющие результаты показывает на бенчах и вообще выглядит как новый победитель по Парето-фронт (наиболее оптимальная модель по соотношению цены и качества). Но есть один нюанс, о котором мало кто говорит - это показатель модели в бенчмарке AA-Omniscience. И из топовых моделей довольно слабый результат: -5 в общем забеге (AA-Omniscience Index) и 95% в рейтинге галлюцинаций, и это прям антирекорд. Для сравнения у GLM-5.3-Flash 7 в AA-Omniscience Index и 28% показатель галлюцинаций. Понятно, что AA-Omniscience измеряет родные знания моделей, без внешних tools - тем не менее, если ваш RAG агент все-таки не найдет релевантное, дипсик с большей вероятностью выдумает ответ.Ну и конечно, напомню, что всегда следует проверять новые модельки на ваших evals, измеряющих возможности модели в ваших конкретных задачах - сейчас наличие таких


AI-Driven Development. Родион Мостовой
11 сент., 06:05изменён
Дешевые токены и оркестрацияВ последнее время замечаю тенденцию повышения аппетитов на токены - проектов и фич кодится все больше и их масштабы только растут. Если раньше я мог заваншотить агенту задачу на несколько тысяч строк кода (по спеке обычно), то теперь задачи на десятки тысяч LoC, а иногда и на сотню тысяч становятся нормой (дни или недели работы). И я заметил, что с появлением Астры этот аппетит только вырос - она позволяет делать довольно мощные планы, которые позволяют быстро получать результат, соответствующий ожиданиям. Так вот, к чему это я? К тому, что потребность в дешевых, но стабильных и быстрых моделях-исполнителях растет. Такие модели - это просто воркеры, от которых зачастую требуется просто тщательно выполнить план без отсебятины. Так вот, я уже рассказывал про очень щедрые лимиты на Grok 4.5 из подписки Grok Heavy, которую ранее можно было купить за 100$ на 3


AI-Driven Development. Родион Мостовой
5 сент., 18:36изменён
Как вам Астра? Я пробую ей давать небольшие баг фиксы на минимальном ризонинге и она работает очень быстро и делает хорошо. Ловлю приятное ощущение, что теперь кучу хвостов можно позакрывать быстро и хорошо (надеюсь, ощущение не обманчиво). Баги исправляются в одном из моих легаси проектов, который я развиваю еще с 2012 года и он ни разу не AI ready (разве что визуальный фидбек настроен). В общем, пока выглядит так, что low (light) ризонинга вполне достаточно для большинства задач, что и бенчмарки подтверждают - DeepSWE, FrontierCode. Единственное что удручает так это быстрый расход лимитов - даже на моей 200$ подписке. С другой же стороны, когда довольно быстро получаешь ожидаемый результат, то может оно того и стоит. Кстати, с более сложной задачей по качественному RAG по большей базе нормативов пока не справилась ни Fable 5.1 max, ни Astra pro - в очередной раз убеждаюсь насколькоTelegramMike in Чат AI-Driven DevelopmentГолосовой попробуйте, песня просто. Кстати в голосовом это та же астра и он может быть теперь активирован в любом чате. Но я решил создать проект оркестратор где в одном чате с голосового хочу попробовать оркестрировать другие проекты. Он умеет передать задачу…
AI-Driven Development. Родион Мостовой
1 сент., 20:50изменён
Нюансы Fable 5.1 в SWE задачахВ системной карточке Fable 5.1 (которая аж на 212 страниц) как обычно можно найти множество интересных инсайтов. Вот что мне показалось интересным:Нынче один самых важных вопросов - а какой reasoning effort оптимален? Тк мы видим из бенчей, что он напрямую влияет на цену, а значит и на то, как быстро будут уходить лимиты. Кроме того, на некоторых бенчах можно заметить, что более высокий effort ухудшает результаты моделей. Так, например, во FrontierCode (Main субсет) результаты Fable 5.1 после medium не становятся лучше. А если сравнивать medium vs max, то получим 50.9% vs 50.3%, при том, что medium почти в 5 раз дешевле max. Кроме того, в этом бенче Fable 5.1 medium даже вышел дешевле, чем Opus 5 medium, хоть и с чуть более скромным результатом (50.9 vs 53.4), что тоже слегка удивляет. А в карточке Антропик по этому поводу пишут, что на высоком


AI-Driven Development. Родион Мостовой
30 авг., 08:26изменён
Периодически натыкаюсь на разные исследования о том, что в среднем AI не повышает эффективность разработки, что часть команд получают существенный буст, а другая часть наоборот замедляется, да и на моих консультациях это довольно распространенная проблема. Так вот, понятно, что во внедрении AI в существующие процессы и команды разработки куча нюансов и это комплексный процесс, требующий системного подхода и изучения - самостоятельного (больше шишек) либо с условным наставником, который уже успел пройти этот путь (меньше шишек, быстрее профит). Но менее очевидно другое - при внедрении такого мощного бустера, как AI замедление на начальных этапах вполне естественно. Грубо это можно сравнить с тем, как раньше все в вашем городе передвигались на велосипедах и тут все (или не все) резко пересели на автомобили, не успев получить права - да, первое время будет много аварий, но постепенно
AI-Driven Development. Родион Мостовой
28 авг., 10:03
Мы в эфире: https://youtube.com/live/bByMKD_wKpQ?feature=shareYouTubeJujutsu: решение проблем с Git для агентов — с Фёдором ШереметьевымПоследний месяц я активно использую Jujutsu (JJ) — современную систему контроля версий от Google — в агентной разработке. Обсудим, почему некоторые особенности JJ хорошо подходят для работы с кодовыми агентами: • конфликтные состояния допустимы и могут…
AI-Driven Development. Родион Мостовой
28 авг., 07:04изменён

AI-Driven Development. Родион Мостовой
27 авг., 23:21изменён
Стрим по Jujutsu: решение проблем с git для агентовПоследний месяц я на своих проектах активно работаю с Jujutsu (JJ) - современной VCS от Google. Это довольно интересная попытка переизобрести Git и часть его особенностей довольно хорошо ложатся на агентную разработку и решают часть ее проблем. Например:- Конфликтные состояния допустимы - то есть, в истории реально могут лежать конфликты, которые вы с агентами сможете решить тогда, когда вам будет удобно - Возможность легко двигать, сплитить и пересобирать коммиты - Еще, там нет понятия unstaged - все, что агенты делают по умолчанию попадает в - это решает проблему потерянных измененийНо есть и разные подводные камни, которые могут мешать привычной работе и их нужно заранее предусмотреть. В общем, мне решение показалось интересным, поэтому я решил рассказать о нем вам и организовать встречу. В кач-ве эксперта я позвал ФедораYouTubeJujutsu: решение проблем с Git для агентов — с Фёдором ШереметьевымПоследний месяц я активно использую Jujutsu (JJ) — современную систему контроля версий от Google — в агентной разработке. Обсудим, почему некоторые особенности JJ хорошо подходят для работы с кодовыми агентами: • конфликтные состояния допустимы и могут…
AI-Driven Development. Родион Мостовой
23 авг., 13:35
Вайб-релиз Bun на RustНа моей памяти это первый настоящий вайб релиз такого масштаба. Помните тот PR команды bun на миллион строк, который им Claude Code сгенерил. Так вот, прошло чуть более 3 месяцев и они зарелизили апдейт для всех. И результаты впечатляют - мало того, что по множеству метрикам ощутимый прирост, так ещё и +1.5к новых тестов с node.js теперь проходят и на bun (это 80.5% всех тестов node.js). Для меня лично наиболее интересный выигрыш в возможности ускорить тесты в наших проектах на node runtime, ибо с приходом агентной разработки, количество тестов выросло кратко, а выполняться они стали неприлично долго. Попробую обязательно. А если вдруг кто-то уже успел попробовать новый bun - поделитесь в комментариях своим опытом, интересно почитать.Браво команде bun и Антропикам, их купившим.https://bun.com/blog/bun-v1.4@ai_drivenBunBun 1.4Bun 1.4 rewrites Bun in Rust, ships built-in headless browser automation (Bun.WebView), Bun.Image, Bun.markdown, JSON5, JSONL, Terminal and cron APIs, Node.js 26.3.0 compatibility with 1,517 newly passing tests, parallel test and run, Windows ARM64, and an…
AI-Driven Development. Родион Мостовой
21 авг., 07:01
"Делай хорошо" или антипромптинг Sol Накипело. Помните мы раньше просили модели делать хорошо, учитывать корнер кейсы и тд? Так вот, как минимум с GPT 5.6 Sol настало время наоборот просить агента не делать лишнего и не переусложнять. Это модель, которая




AI-Driven Development. Родион Мостовой
20 авг., 16:07
переслано из @kdoronin_blog
Мы начинаем наш стрим "Как писать код с AI-агентами?"Подключайтесь по ссылке: https://youtube.com/live/x0j1kcagoXgYouTubeКак писать код с AI-агентами?Страница донатов: https://www.donationalerts.com/r/kdoronin Подписывайтесь на участников стрима в Telegram: Валера Ковальский – https://t.me/neuraldeep Максим Ключников – https://t.me/etechlead Константин Доронин – https://t.me/kdoronin_blog Проекты гостей…
AI-Driven Development. Родион Мостовой
20 авг., 16:07
Друзья нашего канала в компании с Андреем Бреславом сейчас будут обсуждать как писать код с агентами - такое смотрим с удовольствием2,410Открыть в Telegram
