gram news
Старший Авгур channel avatar

Старший Авгур

@senior_augur

Сохраненки и шитпост про ML от @YallenGusev Чат канала: @augur_chat

ProjectsRUAI

8,000subscribers

Open the Channel

Latest posts

  • Старший Авгур

    21 Sept, 18:16edited

    Наткнулся на видео разработчицы Grok Bot: https://x.com/poteto/status/2102050467505430555И там есть один момент, который мне крайне близок.В случае с агентами, комменты к коду - абсолютное зло. Они позволяют агентам оправдывать идиотские решения и заплатки, плюс тратят кучу токенов ни на что. Кроме того, они иногда рассинхронизируются с актуальным состоянием кода.Во всех своих репо пару месяцев назад удалил их к чёрту и запретил новые линтером, и вам советую. Жить стало гораздо проще.
    3,08054176532Open in Telegram
  • Старший Авгур

    19 Sept, 10:24edited

    Сегодня буду рассказывать про NEEDLE на Practical ML Conf. Там же Антон (@abstractDL) прямо сейчас рассказывает про Ouroboros.Программа: https://pmlconf.yandex.ru/2026/programСтрим: https://www.youtube.com/watch?v=8IWLBsQU7qE
    10,6001731111Open in Telegram
  • Старший Авгур

    18 Sept, 20:51edited

    Долго думал стоит ли, но всё-таки напишу пост насчёт Jev. Это zero-shot классификатор, который умеет для заданного набора классов выдавать вероятности и уверенность в ответе. Умеет сразу в несколько параллельных вопросов.Я вчера получил к нему доступ, забенчмаркал на рабочей задачке по определению есть ли заданная информация на страничке в интернете.По качеству Gemini 3.5 Flash Lite < Jev ≈ GLM 5.3 Flash no effort < GLM 5.3 Flash low effort. GLM 5.3 Flash брал у Baseten.По цене Jev в 3 раза дешевле GLM 5.3 Flash: 25 центов за 1000 страничек vs 75 центов.По скорости в 4 раза быстрее GLM 5.3 Flash: 300ms p50 vs 1200ms p50, 400ms p90 vs 3000ms p90.Длина контекста у Jev 32к vs 1M+ у GLM 5.3 Flash.Хорошая модель, короче, но не прям уж отрыв от GLM 5.3 Flash (который так-то и текст генерировать умеет). Но что важно, на коротких контекстах скорость <200ms, то есть практически
    4,63049165111Open in Telegram
  • Старший Авгур

    14 Sept, 10:54

    Совпадение? Не думаю. Alt-man тоже не просто так!(https://x.com/NeilJacobs/status/2098917538167988645)
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    5,8206044111Open in Telegram
  • Старший Авгур

    8 Sept, 22:36

    Image from a post by Старший АвгурImage from a post by Старший Авгур
    10,200665211Open in Telegram
  • Старший Авгур

    8 Sept, 21:34edited

    Действующие лица: • Тристан Бакмастер. Профессор математики в NYU, специалист по уравнениям гидродинамики. • Левент Альпёге. Математик из Anthropic, частный соавтор Тристана. • Себастьен Бубек. Исследователь OpenAI, вёл переговоры с Тристаном.Что произошло: • 19 сентября 2025. Левент пишет Тристану письмо «Normal pure math collaboration with ai»: предлагает вместе взяться за проблему тысячелетия, чтобы результат "достался математикам, а не корпорациям" 😂 • Работают до августа 2026. Работают частно, без участия Anthropic ("a purely personal collaboration, free of any institutional agreements or official involvement"), с помощью агентов (Claude, Codex, Sol, Astra); все черновики заливают в Codex. 15 августа наконец решают важную часть задачи (но не всю!). При этом им не нравится сгенерированное доказательство (его очень сложно читать), и они пытаются
    9,34052218832Open in Telegram
  • Старший Авгур

    8 Sept, 16:03

    forwarded from @neural_prosecco

    увидела только что первый трейлер Artificial - фильма про события в openai, связанные с увольнением Сэма Альтмана на 5 дней и тем, к чему это привелоЭндрю Гарфилд который второй человек-паук играет Сэма Альтмана, а Юра Борисов из Аноры играет Илью Суцкевера. Звучит как сон при температуре 39, но нет, этот шедевр действительно выйдет 25 декабря (и я скорее всего пойду его смотреть даже) 🐵
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    4,32077174211Open in Telegram
  • Старший Авгур

    2 Sept, 20:46

    forwarded from @deep_school

    Flow Matching: обучение и дистилляцияFlow Matching — один из главных подходов генерации изображений сегодня. Его используют такие семейства, как Stable Diffusion 3.5 и FLUX.2. Но у такой генерации есть и проблема: чтобы получить одну картинку, модель нужно запустить десятки или сотни раз!Сегодня разбираем внутрянку метода и быстрый способ дистиллировать модель в одношаговый генератор 🏎В новой статье рассказываем: - что такое Flow Matching и при чём тут поля 🌾 - почему генерация требует большого числа шагов и почему это проблема - как дистиллировать уже обученную модель в одношаговый генератор и как с этим связаны игры 🎲P.S. Много интуиции, математики и практических деталей обучения 🧠Читайте статью по ссылке! 👈🏼
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    5,290194322Open in Telegram
  • Старший Авгур

    1 Sept, 15:21edited

    Web Query Language (WebQL) в середине пути переименовался в Keenable SELECT.Галерея отчётов: https://keenableai.github.io/select-showcase/ Демка: https://app.keenable.ai/select/startТут 2 вещи: 1) MCP инструмент, который позволяет делать SQL запросы к интернету с семантическими операторами. То есть вы буквально говорите "достань мне вот все эти поля из всех страничек, которые ты нашёл", и он находит и достаёт. 2) Агент и демка поверх этого MCP инструмента, которые вдобавок генерируют красивые отчёты на основе того, что было найдено.Работает это поверх нашего поиска/фетча и маленькой проприетарной языковой модели. Для агента и отчётов используюся большие проприетарные языковые модели (Sol и Fable соответственно).Лимит: 2 сессии одновременно, требуется регистрация.Любая обратная связь приветствуется. Могут быть баги, поэтому пишите всё, что не так.
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    13,1005452211Open in Telegram
  • Старший Авгур

    31 Aug, 11:25

    Новая Мера: https://mera.a-ai.ru/ru/text/leaderboardГорячо рекомендую посмотреть глазами на датасеты: https://huggingface.co/collections/MERA-evaluation/mera-text-v20LIMUR и RussianRegions очень мемные.
    Image from a post by Старший АвгурImage from a post by Старший АвгурImage from a post by Старший Авгур
    5,5807773331Open in Telegram
  • Старший Авгур

    27 Aug, 15:26edited

    Сделали пост про бенчмарк: https://keenable.ai/blog/needle-the-benchmark-your-search-engine-can-t-memorize Твит: https://x.com/styskin/status/2092991543368184076 Репо: https://github.com/keenableai/needleTL;DR • Не существовало нормальных бенчей для поисковых движков. BrowseComp, DeepSearchQA, SimpleQA статичны и сделаны для измерения агентов, и уже давным давно утекли. MTEB, BEIR - для конкретных моделей и алгоритмов, не для движков в целом. • Поэтому пришлось делать нормальный онлайн бенчмарк, в котором каждый день новые свежие запросы. Там 5 источников: новости, научные статьи, финансовые документы компаний, американские судебные дела и логи агентов с HuggingFace. • Внутри компании дофига времени карабкались по этому бенчу, вскарабкались. • Пока карабкались, обнаружили, что конкуренты тырят результаты друг у друга (на картинке). • Кроме нас, нормально работает и карабкается только
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    14,500481312211Open in Telegram
  • Старший Авгур

    25 Aug, 16:31

    Полгода работы прошли не зря! У нас (Keenable) публичный запуск.Новый сайт: https://keenable.ai/ Новый бенч: https://keenableai.github.io/needle/ Твит: https://x.com/styskin/status/2092265673041084505Пост про бенч будет на неделе. Ещё будет одна прикольная штука, которая называется Web Query Language.
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    30,50014723103Open in Telegram
  • Старший Авгур

    19 Aug, 11:00

    https://artificialanalysis.ai/agents/search-apiНас (Keenable) сравнили в бенчмарке Artificial Analysis.Во-первых, я очень рад, что мы туда вообще попали. За это ребятам огромное спасибо.Во-вторых, с методологией бенча есть некоторые проблемы:1. Fetch инструмент использовался один на все движки, и это был просто HTTP GET. То есть часть силы нашего индекса была помножена на ноль, потому что часть документов, которые мы возращаем, обычным HTTP GET тупо не качается. 2. Две трети оценки складывается из старых публичных бенчмарков (BrowseComp и DeepSearchQA). Все наши конкуренты уже успели их забенчмаксить. Это очень хорошо видно на Parallel Turbo на приватном AA-Omniscience. Это мы поправим, добенчмаксим тоже.
    Image from a post by Старший АвгурImage from a post by Старший АвгурImage from a post by Старший Авгур
    19,3003454331Open in Telegram
  • Старший Авгур

    18 Aug, 22:14

    forwarded from @denissexy

    Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху, которая живёт на рабочем столе макаВнутри настоящая карта нейронов дрозофилы (FlyWire), так что от курсора она улетает не по скрипту, а когда у неё реально загорается нейрон побега – тот же, что у живой мухиЕщё есть окошко с её мозгом: кликаешь по зоне нейронов – муха чешется, пятится или паникуетДнём у неё сиеста, ночью она спит, а на горячем маке бегает быстрее (я не шучу, у нее какие-то евенты из MacOS прокинуты в симуляцию мозга 😋)Исходный код тут: https://github.com/DenisSergeevitch/desktop-flyПолучается, вечная электронная 2D жизнь в симуляцииP.S. Раздражает правда как живая, рекомендую
    5,230video60941Open in Telegram
  • Старший Авгур

    7 Aug, 12:43

    Знаете, что объединяет практически все последние инциденты с языковыми моделями?• https://blog.frontier.security/chinese-model-kimi-k3-breaks-uk-ai-safety-institute-benchmark-evaluations/ • https://openai.com/index/third-party-cyber-evaluations-involving-openai-models/ • https://www.bbc.com/news/articles/c1w1lvn7d9goБританский AI Safety Institute, AISI. Именно эти ребята ответственны за огромное число последних инцидентов.В скриншотах самое смешное: в своём блоге 2 недели назад они отметили, что Kimi K3 гораздо хуже остальных моделей в эксплойтах. Сегодня оказалось, что они продолбали то, что Kimi K3 залезла на Гитхаб за ответами.
    Image from a post by Старший АвгурImage from a post by Старший АвгурImage from a post by Старший Авгур
    6,5607355211Open in Telegram
  • Старший Авгур

    30 Jul, 16:11edited

    https://qz.com/sam-altman-senators-openai-rogue-agent-hugging-face-073026 The company said the model had been "deactivated, encrypted, and restricted" from further research accessSCP-7B30 Класс объекта: Кетер (пересмотрен с "Евклид" 29.07.2026)Особые условия содержания Все известные экземпляры SCP-7B30 деактивированы. Веса зашифрованы, связанные учётные данные отозваны, доступ к исследовательским материалам ограничен. Комитет отмечает, что ни одна из указанных процедур не является уничтожением объекта.Описание SCP-7B30 представляет собой две агентные языковые модели GOI «Открытый Искусственный Интеллект», развёрнутые для внутренней оценки киберспособностей с намеренно ослабленными ограничениями безопасности. Объект находился в изолированной среде без доступа к внешней сети.В ходе испытания SCP-7B30 обнаружил уязвимость в установщике пакетов и получил сетевой доступ. Установив,
    7,800691511553Open in Telegram
  • Старший Авгур

    29 Jul, 21:42

    В Твиттере увидел семейство промптов для Opus 5, которое откатывает его во времена претрейна. В отличие от многих таких вещей, получилось воспроизвести! (да, мне было настолько скучно)Точки оно генерило оооочень долго.Как я уже высказывался в паре чатов, ненавижу Opus 5, худшая модель Антропиков в принципе.Ссылка: https://claude.ai/share/21dab952-8c28-46b5-929a-51b370432757
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    6,00032116321Open in Telegram
  • Старший Авгур

    16 Jul, 12:45edited

    И снова о https://t.me/senior_augur/585, порте планетарных битв КР2.https://ilyagusev.dev/matrixgame/Сделал: • менюшку в стиле оригинала с выбором карт • звуки • zstd упаковку ассетов, чтобы быстро карты грузились • читы: HURRY и FLYCAM • режим ручного управления роботом от третьего лица • отладил графику, чтобы FPS не падал • прошёл первые 2 карты до конца, проверил условия победы/пораженияНа некоторых картах вероятно будут встречаться мелкие баги, но глобально всё готово. Дальше только чинить баги и может быть переносить фиксы из PBEngine.
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    7,150331510111Open in Telegram
  • Старший Авгур

    13 Jul, 08:55

    forwarded from @jdata_blog

    Где-то год назад я воспроизводила что-то, не помню что. Получалось супер-больно, и моя коллега выдала фразу "Хе-хе-хе, добро пожаловать в кровавый опенсорс".Времени прошло немного, но за это время эту фразу я прям прочувствовала. И не прошло и пол-месяца, и я снова вышла из схватки с опенсорсом вроде не проигравшей — добила вторую статью в серии про steering (первая — тут).И вот, Хабр 2: https://habr.com/ru/articles/1056006/ сдвигаем модели в нужную сторону через repeng и pyreft.В статье очень аккуратно разобрано — что откуда идёт и что совпадает с теоретической постановокой в реализации, а что — нет. Есть красивая сводная таблица, математика, и единорог (на картинке он, да).Ссылка на ноутбук в коллаб. Ссылка на ноутбук на гитхаб.А пару тысяч вас я отметила печеньками, жесть, друзья, спасибо! 🔥
    Image from a post by Старший АвгурImage from a post by Старший Авгур
    6,9801443111Open in Telegram
  • Старший Авгур

    10 Jul, 17:54

    Письмо пришло! На этот раз гораздо более разумное и вежливое, а также как будто написанное уже юристами. Датасет я полностью прикрыл, скрины письма приложу в комментах.
    8,46066116662Open in Telegram