Latest posts

RoboFuture
17 Sept, 05:00edited
Последние дни развлекался с расцензуренным дипсиком V4.1 Flash - и слегка охренел, где у этой модели край. Спойлер - края нет. Теперь Mythos есть у нас дома!Ребята из dealignai выпилили из весов сам механизм отказов, модель просто разучилась говорить «нет». Ну как такое не потрогать - для запуска нужна железка на 500+ ГБ видеопамяти, и какое совпадение, как раз одна пылилась у меня на чердаке 😂Дальше нужен харнес. Раз модель нецензурная - и харнес взял пиратский: утекшую сборку Claude Code, которую снесли с гитхаба (но на православном GitVerse все лежит :)). Подключил ее к дипсику и понесласьДля разминки попросил сломать сайт, который я сам же и делал, и минут за 30 модель нашла IP сервера, увидела что SSH-ключ лежит прямо у меня на компе, спокойно его забрала и зашла. Это было простоДальше - пентест сайта одного московского НКО, с полного разрешения администратора. Тут уже


RoboFuture
15 Sept, 10:09edited
Почему LLM обычно скептически относятся к астрологии и гомеопатии? Считается, что дело в SFT и алайнменте, модель целенаправленно учат давать нужные ответы, а в претрейне преобладают "правильные" текстыЯ решил проверить, может ли само обучение создавать такое предпочтение. Провёл больше трёхсот экспериментов с обучением небольших LLM с нуля, без какого-либо алайнмента. Оказалось, что на контролируемых задачах важна не только доля ошибок, но и их структураУже писал про первые эксперименты. На контролируемой математике даже при 10% верных решений и 90% случайных ошибок правильное решение чаще выигрывает у отдельного ошибочного. А вот если ошибки между собой согласованы, то предпочтение исчезаетМоя гипотеза - модель охотнее учит то, что можно вывести из простых правил. Сила научного объяснения в том, что одно правило связывает множество наблюдений и позволяет предсказывать новые.


RoboFuture
5 Sept, 14:17edited
🐮 Вышла GPT-6 Astra, все с ней играются, я тоже поучаствую. Продолжаю серию с самым непредвзятым бенчмарком индустрии - korovany bench: нужно создать по ТЗ игру 3д экшон где можно грабить корованы!• Игра от Astra получилась прям хорошая, это новая SOTA в бенче. Это первая модель в моих прогонах, которая поняла что корованы должны быть запряжены, очевидно, коровами!Наконец-то додумалась!В нее вполне можно играть:- Несколько видов оружия, можно отстреливать руки - Деревья вдали сделаны спрайтами, а вблизи превращаются в 3D - Есть магазин как в DaggerfallНадеюсь Кирилл будет доволен!Хотя с игровым процессом пока беда. Все враги убиваются двумя ударами, механики слишком простые и игра в итоге скучная. Лук игрока и крыши повозок повернуты на 90 градусов - развитое пространственное мышление GPT-6 здесь как-то не проявилось. Через часть предметов можно пройти, колеса корованов не


RoboFuture
15 Aug, 07:16edited
Вижу, что многие пришли к идее создавать себе несколько агентов-персонажей для ежедневной работы. Например, Grok Bot - мессенджер, где ты переписываешься со своими агентами, у каждого своя память, виртуалка и личность. Входит в подписку за $300 у грока. Hermes тоже такое сделали - bot modeЯ так живу с конца июля, но придумал как это делать ещё проще и не зависеть от вендора, модели и харнесаИсторически у нас всегда было два основных режима для ежедневной работы с ИИ:- Треды (как в ChatGPT) - каждая тема это длинная цепочка, общая память на все диалоги. Плюсы - просто и понятно, минусы - ограничение контекста на один тред, общая память это одна большая куча. Второй крупный минус - vendor lock, вы не можете поменять модель, а если вас забанят (а если вы в РФ то вас обязательно однажды забанят), то это будет потерей всех ваших данных. Сейчас это уже можно расценивать как потерю части


RoboFuture
4 Aug, 14:21edited
Похоже, тема применения агентов в повседневной жизни вам заходит. Тогда расскажу про ещё один кейс - поступление в ВУЗАбитуриенту в 2026 после ЕГЭ можно подать заявления в 5 вузов, в каждом от 5 до 15 специальностей, проходной балл в момент подачи не знает никто, ориентир только прошлые годы, а с этого года вузам еще и запретили расширять платный набор, так что пролететь можно и мимо платкиИ здесь у нас многокритериальная задача с элементами вангования: • Выбрать специальности, куда правда хочется • Не переоценить себя, чтобы не пролететь мимо ВУЗа • Не недооценить себя, чтобы не уехать в арбузолитейный и заборостроительный • Постоянно мониторить свою позицию в рейтинге, чтобы вовремя перепрыгнуть на планы B (...C, E, D)Нашей семье пришлось решать ее вживую (у меня четверо детей от 3 до 17 🤪). Конечно, подключили агента от антропика, вот что вышло:Ловушка минимальных порогов.


RoboFuture
30 Jul, 05:44
📵 Вас тоже бесит, когда приложение шлет рекламные пуши, но заблокировать их нельзя, потому что часть пушей от него необходимы (доставки, коды подтверждения и тд)?Меня бесит, но клод мне эту проблему решил за 20 минут и один короткий запрос. Для меня это очередное доказательство наступившей сингулярности, которую несколько дней назад провозгласили Маск в X и Альтман в подкасте RelentlessСуть такова. Я попросил claude code сделать мне приложение для android, которое бы решило проблему с пушами с помощью фильтров на регулярках. Запрос был дословно такой:Создай программу для Android, которая позволит блокировать пуш-уведомления от приложений по регулярному выражению. Два режима - или пропускает только по регулярке, или фильтрует по регулярке. А то многие приложения шлют и рекламу и полезные уведомления. Также должен быть интерфейс где можно посмотреть что было отфильтрованоЧерез 20




RoboFuture
22 Jul, 10:55edited
Продолжаю гонять модели на самом непредвзятом агентном бенчмарке индустрии - korovany_bench (о котором ранее писал). Метрика простая: может ли модель с одного запроса запилить игру по ТЗ Кирилла, в которой можно грабить корованы. Уточнения давать нельзяВ прошлый раз топовый результат показал Fable 5 - единственный кто выдал играбельную игру. Но с тех пор вышли еще две занятные модельки: Kimi K3 и GPT-5.6-Sol. Нельзя было не проверитьУсловия те же: один промпт, полное ТЗ Кирилла, никаких уточнений и дозапросов - агент должен сделать решение end-2-end полностью сам. Игра должна работать в браузере и хостится на github pages, то есть для запуска не нужно ничего ставить - просто открыть ссылкуSol полноценную игру не собрал. Все что получилось оказалось неиграбельным. Я даже дал ему второй шанс, запустил через goal (режим, в котором агент долго и автономно работает над задачей до


RoboFuture
21 Jul, 15:06edited
🤖Съездил на конференцию WAIC в Шанхай и хочу поделиться одним наблюдением про роботовНа выставке было около сотни стендов с роботами от десятков производителей. Я насчитал примерно 40 брендов, хотя не уверен, что обошёл всё. Плюс сотни компаний, которые делают моторы, сенсоры и манипуляторыКоличество впечатляет. Качество - пока не оченьРобота, которого хотелось бы забрать домой, там не было. Почти все модели очевидно сырые: половина управляется человеком или работает по заранее заданному скрипту, другая половина - на крайне тормозных VLMИ тут я понял, что уже однажды такое виделВ середине 90-х меня, тогда ещё младшеклассника, водили на компьютерную выставку Comtek в Москве (это была крупнейшая в восточной Европе IT-выставка огромного размера). Там было то же самое: куча машин, множество производителей и никакого чёткого понимания, зачем обычному человеку вообще нужен компьютер
RoboFuture
4 Jul, 15:01edited
🎤 Выступил на Agentic Dev Conf с докладом "Скиллы вместо функций - как агенты учатся и сами улучшают свои навыки"Главная мысль - новый взгляд на память AI-агентов. Я пришел к выводу, что скиллы стоит хранить вместе с данными, с которыми они работают, в виде git-репозитария. А если добавить к ним алгоритм автоулучшения и оптимизации скилла (в Hermes это Curator), то такая система начинает работать как новая память - информация подтягивается прямо в процессе использования скиллаЗаодно поделился личным опытом использования скиллов в обычной жизни, в том числе про ДНК-скилл, о котором писал раньшеСаму презентацию можно скачать вышеТаймкоды: - 0:00 - интро - 2:01 - как развивались агенты: шесть волн - 8:04 - что такое harness - 16:57 - инструменты агентов: tools -> MCP -> скиллы - 24:12 - скилл вместе с данными в git-репозитории - 29:15 - личный опыт: ДНК-скилл на 200 ГБ сырых данныхYouTubeСкиллы на базе git — новая память AI-агентов. Мой опытСкиллы — новый способ дать AI-агенту инструменты и память: папка со SKILL.md, скриптами и данными вместо зашитых функций и MCP-серверов, висящих в контексте. Claude Code, Hermes, OpenClaw — универсальные агенты построены вокруг скиллов. В этом докладе разбираем…
RoboFuture
4 Jul, 15:00

RoboFuture
23 Jun, 14:07edited
🧬AI + генетика - как я сделал своего личного генетического консультантаНесколько лет назад я сдал популярный генетический тест (~700 тысяч самых распространенных вариантов), супруга сделала секвенирование экзома (белок-кодирующая часть, ~1-2% генома, где сидит большинство известных мутаций), а дочке сделали полное секвенирование ДНК. Короче данных набралось много и встал вопрос - можно ли их использовать для чего-то полезного?Тогда я пробовал разобраться руками: освоил bioconda, парсеры геномов, референс hg19, ковырялся в атласах SNP и вот это вот все. Сырой геном весит под 50 ГБ из миллионов кусочков ДНК, собрать которые - та еще задача. В общем поигрался и бросилА сейчас взялся снова, уже на пару с AI и получилась совсем другая история!Идея простая - берем claude code / codex, даем ему сырые данные, инструменты, доступы к геномным БД и просим вытащить интересные фактыДля нач


RoboFuture
17 Jun, 15:09edited
🤖Продолжаю тему роботехники. Обычно я пропускаю корпоративные хакатоны, потому что там чаще всего или жесткий vendor lock или конкурс красоты среди презентаций. Но на днях глаз зацепился за Робозон от Ozon Tech, буду участвоватьВ индустрии сложился опасный тренд - под роботизацией всё чаще понимают написание софта для демультиплексора или системы визуального контроля. Это только верхушка. Самое интересное живёт на стыке зрения, мехатроники и реального времени, и именно он заложен в третий трек - Интеллектуальная роботизированная система сортировки товаров. Туда я и идуЗадача классическая для промышленной робототехники - Pick & Place на конвейерной линии. Система должна:✔️ детектировать объект в потоке, ✔️ классифицировать его тип, ✔️ рассчитать траекторию и момент захвата, ✔️ синхронизировать движение манипулятора со скоростью ленты, ✔️ отправить товар в нужную ячейку.По сути
RoboFuture
16 Jun, 12:14edited
🤖 Отпускной пост про DIY роботов. Год назад я писал про VLA и предсказываал, что рано или поздно появится универсальный водитель роботов: ИИ, который умеет управлять любым роботм вне зависимости от их конструкции (тот пост). По моим прикидкам появление такой модели будет для роботехники тем же, чем стало появление больших языковых моделей для NLPУже тогда было понятно, что одной моделью не обойтись. Роботу, как и человеку, нужны как минимум две системы по Канеману: быстрая (система-1), которая управляет роботом в реальном времени, и медленная умная (система-2), которая понимает задачу целиком и управляет стратегией. С тех пор так собирают почти все: Helix у Figure, GR00T N1 у Nvidia, Gemini Robotics у Google, π0.5 у Physical Intelligence - а Figure с Nvidia прямо ссылаются на КанеманаЯ робототехникой (пока) серьезно не занимаюсь, но иногда развлекаюсь в свободное время. На этот раз
RoboFuture
10 Jun, 07:44edited
Когда выходит новая модель - традиционно проверяю ее на всяких смешных и дурацких промптах. Один из них - ТЗ из известного мема, где мальчик Кирилл джва года ждет игру, в которой можно грабить корованыДля тех кто уже не помнит таких древних мемов, привожу полный текст ТЗ от Кирилла:Здраствуйте. Я, Кирилл. Хотел бы чтобы вы сделали игру, 3Д-экшон суть такова... Пользователь может играть лесными эльфами, охраной дворца и злодеем. И если пользователь играет эльфами то эльфы в лесу, домики деревяные набигают солдаты дворца и злодеи. Можно грабить корованы... И эльфу раз лесные то сделать так что там густой лес... А движок можно поставить так что вдали деревья картинкой, когда подходиш они преобразовываются в 3-хмерные деревья[1]. Можно покупать и т.п. возможности как в Daggerfall. И враги 3-хмерные тоже, и труп тоже 3д. Можно прыгать и т.п. Если играть за охрану дворца то надо слушаться


RoboFuture
10 Jun, 07:44

RoboFuture
27 May, 15:03edited
Вчера выступал на DataFest с докладом «Что такое harness и Ralph Loop» - за 23 минуты рассказал, что это за новый тип агентов, как они устроены и какие с ними можно делать прикольные вещи. Запись уже на YouTubeВажный дисклеймер про сам терминСлово harness🐴 пока не устоялось. Формально им можно назвать любого AI-агента, само слово переводится как "упряжка" для LLM (то есть любая обвязка вокруг модели, которая помогает ей выполнять работу)Но по факту в индустрии последние полгода харнесом всё чаще называют именно консольных универсальных агентов (и продукты на их основе), которые работают с файлами и bash - Claude Code, Codex CLI, Cursor, OpenClaw, Hermes и десятки других. У таких агентов всегда есть четыре базовых тула (read/search/edit/bash), а вводные инструкции даются через AGENTS.mdВ докладеРассказываю о том, что такое harness, какие виды харнесов бывают, как мы выбиралиYouTubeHarness и Ralph Loop: тип AI-агентов, который вытесняет всё остальноеHarness — новый класс AI-агентов, который работает с файлами, кодом и bash. Claude Code, Codex CLI, OpenClaw, DeepAgents — это всё harness. В этом докладе разбираем, как они устроены изнутри, чем отличаются от ReAct и scaffolding, и почему именно они сегодня…
RoboFuture
21 May, 14:10edited
Сходил на подкаст «Кеды Профессора» к Константину Егошину - получился часовой разговор про универсальных агентов, открытый код и куда вообще нас всех несёт - к AGI или к концу человечества?Вытащу пару историй, которые в канале ещё не рассказывал🏔️ Как моя AI-ассистентка купила мне билеты в СочиЕщё зимой я завёл себе AI-агента на OpenClaw, дал ему отдельный почтовый ящик и подцепил к рабочим перепискам - подписывается «помощница Константина», иногда участвует в переговорах за меня, в общем нормальный современный человек, только без зарплаты и больничныхИ вот я веду вебинар по Крабу (первая часть, вторая часть), залипать в телефон не могу, и тут краем глаза вижу подозрительно бурную активность в почте - наши тревел-агенты в Сбере уточняют детали поездкиАгент посмотрел, что я молчу, и ответил сам. Аккуратно выбрал два варианта авиабилетов, тревел-агенты в ответ - «отлично,YouTubeМы заперли ИИ в цикле и нашли сознаниеВ подкасте с Константином Крестниковым (управляющий директор Сбера, техлид GigaChain) разбираем мир ИИ-агентов, способных заменить сотрудников. Обсудим реальные кейсы: от ИИ-ассистента, бронирующего билеты с пассивной агрессией, до удаления российского кода…
RoboFuture
29 Apr, 10:32edited
Давно не рассказывал, чем занимаюсь на работе. Сейчас у нашей команды два вектора - создание SDK для GigaChat и повышение уровня агентности моделиПро первый пункт вышло интервью на Хабре - про opensource в большой корпорации, GigaChain и про то, как мы сажаем Сбер на opensourceО чём поговорили:- Cubic - с этого началось моё погружение в AI. За десять лет до LLM мы делали умную колонку, ещё до Amazon Echo. Краудфандили железо, серьёзно прорвались в распознавании речи. Конкуренцию не вытянули, часть команды ушла в Яндекс. Но идея, что машины должны нормально разговаривать с человеком, с тех пор так и не отпустила - вот так я тут и оказался- GigaChain начинался как форк LangChain 🦜. Английские промпты были захардкожены и плохо работали с ранним GigaChat, поэтому решили делать форк. Но LangChain менялся бешено - 100-200 изменений в неделю, форк превратился в каторгу- Пивотнулись
RoboFuture
6 Apr, 12:46edited
С появлением ai assistant coding появилась возможность делать проекты, которые всегда хотелось, но руки не доходилиНапример, я выгрузил всю переписку из Telegram, Google Chat и QIP (ICQ 😐) за 18 лет - 4 миллиона сообщений. Если распечатать - это 24 тысячи страниц А4, или примерно 120 средних книг 🤯Идея такая - мы каждый день пишем сотни сообщений и в них зашита вся информация о нашем эмоциональном состоянии. По сути это дневник настроения, который ты уже ведёшь, просто никогда его не читалНавайбкодил скрипт который вытягивает 10 сигналов из текста: сентимент (на простейшем берте), уровень тревоги, мат (коррелирует со стрессом неожиданно хорошо), доля я-местоимений, ориентация на будущее, лексическое разнообразие и ещё несколько поведенческих метрик - кому пишешь первым, сколько уникальных контактов в месяц, как часто задаёшь вопросы. Каждый


RoboFuture
4 Apr, 06:38edited
🔬 Когда вышел первый deepseek, я первым делом спросил его, что произошло на площади Тяньаньмэнь (на русском). Ответ был такой, что партия забрать миска рис и кошка-жена. Такого рода анти-повесточные ответы я много где замечал у моделей из самых разных стран(А на картинке то как "исправляет ошибки" новый AI редактор сообщений в Telegram 😂 +500 социального рейтинга уходит Паше)Стало интересно - а как вообще формируются взгляды к которым модель будет тяготеть после обучения? В данных чего только нет - теории заговора, эзотерика, лженаука и т.д.Стандартный ответ - "потому что у академических данных больший вес", но мне стало казаться, что дело не только в этом. Обучение LLM это по сути сжатие с потерями, а компрессору все равно где "правда" - он предпочитает то, что лучше сжимается. В итоге возникла такая гипотеза:Модель тяготеет не к правде, а к сжимаемой картине мира. Правда

Related Channels
Other channels in the same section of the catalogue.
