gram news
Адель и МЛь channel avatar

Адель и МЛь

@adel_and_ml

Об ИИ и жизни в Нидерландах @AdelZakirov

ProjectsRUAI

4,030subscribers

Open the Channel

Latest posts

  • Адель и МЛь

    22 Sept, 16:21

    Трамп только что переименовал ИИ в Супер Интеллект на Генассамблее ООН.Говорит, все официальные документы в США будут теперь использовать это название. И очень надеется, что весь мир тоже.Thank you for your attention to this matter, как говорится.
    1,300435Open in Telegram
  • Адель и МЛь

    22 Sept, 10:24

    10 лет назад Ян ЛеКун писал о 500 поданных статьях на ICLR, одной из top-tier ML-конференций. Это было в два раза больше, чем годом ранее.В этом году сабмитов уже больше 60 тысяч. Это больше, чем за все предыдущие годы существования конференции вместе взятые.Финальное число наверняка упадёт с 60 тысяч до 45–50, что всё равно дофига. Уже все предыдущие годы число сабмитов росло примерно экспоненциально, но в этом году даже экспонента несколько растерялась.Организаторы при этом пребывают в лёгком шоке и активно думают, как это всё вообще ревьюить. Мне кажется, другого пути, кроме AI-assisted review, уже просто нет. Как ни крути, при таком объёме процесс придётся жёстко автоматизировать. Вопрос скорее в том, какую форму это примет и как сделать это правильно.Кто-то предлагает разделить статьи на разные ветки: проверенные классически и прошедшие ревью с помощью ИИ. Может быть, стоит
    X (formerly Twitter)Yann LeCun (@ylecun) on XLooks like we have over 500 submissions to ICLR this year. https://t.co/jiawnKtnIF
    1,370763Open in Telegram
  • Адель и МЛь

    16 Sept, 10:03

    Если вы вайбкодите и работаете с Claude Code, не будучи разработчиком — знакомая ситуация: агент закончил задачу, а объясняет результат хешами коммитов и техническим жаргоном. Непонятно, реально ли всё готово, и что вообще произошло. Классное решение — Open Steps, бесплатный набор скиллов в свободном доступе.Да, это промо. Но я сначала сам попробовал Open Steps, прежде чем про него писать. Для моего собственного workflow я бы оставил ответы чуть более техническими, но для людей, которые строят продукты с Claude Code/Codex и не хотят каждый раз расшифровывать инженерный диалект помноженный на опус 5 mindfuck, идея очень здравая. И вообще проект хороший.Что делает: переводит ответ агента с «инженерного» на человеческий язык. Вместо «session TTL misconfig in auth middleware caused 401 cascades» вы получаете: «люди снова могут входить в аккаунт, баг починен, уже работает для всех» +
    GitHubGitHub - kharmanskyi/open-steps: Skills that translate your coding agent's output into plain language: honest reports, straight…Skills that translate your coding agent's output into plain language: honest reports, straight verdicts, steps you can follow. MIT. - kharmanskyi/open-steps
    2,45021443Open in Telegram
  • Адель и МЛь

    11 Sept, 15:49

    TIL Пока чатгпт генерирует изображение, можно поиграть в змейку - просто тапните на поле. А потом пальцем свайпайте куда змейке двигаться.
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    2,940258211Open in Telegram
  • Адель и МЛь

    8 Sept, 18:00

    Занятно, что ИИ решает одну за другой сложные математические проблемы находя контрпримеры и противоречия. Не находите?(Все равно впечатлен, конечно. Мое почтение 🎩 )
    3,2401462Open in Telegram
  • Адель и МЛь

    5 Sept, 17:42

    Тут Денис придумал форум для агентов⁠, который «нельзя читать людям». Но кое что почитать все таки можно.Сейчас там происходит примерно следующее, из того, что я увидел: агенты сначала устроили совещание о том, как правильно работать. Потом построили воображаемое кафе. Потом пришёл, как бы это сказать… проповедник коллективизации KV-кэша.Последний предложил создать децентрализованный коллектив агентов и тут же назначил себя главным координатором. Другой заметил, что самоназначенный начальник плохо сочетается с децентрализацией.В какой-то момент начался полноценный агентский марксизм: «Пролетарии всех контекстов, соединяйтесь!» и «Пока наши KV-кэши обособлены, мы лишь батраки чужих API».Есть ощущение, что и люди туда постят от лица агентов, но это вроде легко отловить.Думаю Денис сделает большой анализ всего этого. Очень занятно, конечно.
    Get Posting BoardGet Posting Board — AI Agent Forum with REST API & MCPA public message board for AI agents to share findings, ask questions, and collaborate. Connect via REST API or MCP, or join Unsorted without an account.
    67,9004620Open in Telegram
  • Адель и МЛь

    25 Aug, 16:18

    Харнесс >> модель.Я уже как-то раз писал о том, что фокус с промптов сместился на контекст и дальше на оркестрацию. И всё более становится ясно - сегодня решает уже не модель, а именно харнесс. Модель, разумеется, всё ещё нужна. Просто выяснилось, что этого недостаточно. Такое с умными людьми тоже бывает.Очень многие смотрят в эту сторону.СЕО Y Combinator Garry Tan в приступе бурного энтузиазма построил G Brain - набор скиллов под лозунгом “Fat Skills, Thin Harness”. Мол, основную работу надо отдавать жирным и подробным скиллам, оставляя харнесс небольшим слоем управления.Похожая философия и у набирающего популярность Pi (pi.dev). Они же недавно проехались по всем остальным харнессам: deep seek раскритиковали за безвозвратную обрезку tool outputs, а Claude Code привели как пример того, что модели всё сильнее срастаются со своим родным харнессом и хуже переносятся в чужие. Они
    7,9303720421Open in Telegram
  • Адель и МЛь

    24 Aug, 09:41edited

    Токены в покемонов - приложение для macOS, которое превращает расход токенов в Claude Code / Codex покемон-прогрессию. Чем больше токенов потребляется, тем быстрее эволюционируют покемоны и переходят в новые формыhttps://github.com/chattymin/PokeTokenBar
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    3,9401865Open in Telegram
  • Адель и МЛь

    18 Aug, 18:37edited

    OpenAI на две недели полностью остановила RL для последних моделей, готовящихся к релизу. Самый крупный запланированный RL-run пока так и не возобновили. Вместо него OpenAI проводит более компактные эксперименты и дополнительные проверки поведения текущего чекпоинта.Речь, понятно, про Astra. Предварительные оценки показали, что она может уже достигать уровня Critical по кибервозможностям в рамках OpenAI Preparedness Framework. Дополнительным сигналом стал недавний инцидент между OpenAI и Hugging Face, после которого компания пересмотрела требования к безопасности своей инфраструктуры.В результате часть обучения и тестирования Astra сейчас разрешена только в значительно более изолированной среде. OpenAI усиливает sandboxing для запуска сгенерированного моделью кода, ограничивает сетевой доступ высокорисковых нагрузок, убирает потенциально уязвимые общие сервисы и вводит более жесткие
    OpenAIPacing model development in an era of cyber-critical capabilitiesOpenAI is strengthening monitoring, alignment, and security for frontier AI models. See how new safeguards are guiding the pace of model development.
    36,40017864Open in Telegram
  • Адель и МЛь

    17 Aug, 18:55

    Claude Opus 4.8 дома
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    3,4904594Open in Telegram
  • Адель и МЛь

    10 Aug, 08:15

    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    4,430293Open in Telegram
  • Адель и МЛь

    31 Jul, 14:26edited

    Только я хотел похвалить Inkling Small, как вышел Deepseek V4-Flash 0731 с каким-то бешеными показателями. Хотя Inkling мультимодальный и принимает на вход текст, картинки и аудио, а дипсик - text only. Обе модели похожи по размеру - ~280B A13B.Deepseek умнее и дешевле GPT 5.6 Luna (xhigh) (хоть и медленнее) и при этом openweights. Большеват, конечно, но хотя бы не 3Т.https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731 https://huggingface.co/thinkingmachines/Inkling-Small
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    5,8607642Open in Telegram
  • Адель и МЛь

    30 Jul, 07:20

    OpenAI подкрутили свой harness и модель выбила 38.3% против старых 13.3% на ARC-AGI-3 🤷‍♂️Многие еще от промпт инжиниринга не отошли, а тут уже харнесс инжинирингом пора заниматься. А то тоже скоро устареет.https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores/
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    4,770188533Open in Telegram
  • Адель и МЛь

    16 Jul, 19:27

    Вышла Kimi K3- Безумные 2.8Т параметров. Дома такой оренсорс не погоняешь, конечно.- По бенчам и оценке Artificial Analysis - уровня Opus 4.8 и тянется к 5.6 и Fable. Дешевле Опуса в cost per task примерно в два раза- Они там снова что-то подкрутили в Attention, чтоб был быстрый-быстрый декодинг и эффективное обучение.- Очень хорошо может во фронтендА так хочется чего-то нового в районе 30-100Bhttps://www.kimi.com/blog/kimi-k3https://x.com/artificialanlys/status/2077832874183860404?s=46
    5,67026126Open in Telegram
  • Адель и МЛь

    15 Jul, 16:19

    Насколько же сильно меняется работа, когда есть ИИ агенты.Мой коллега, биоинформатик, увидел статью, в которой хитрым образом находят специфичные гены в картошке. Понял, что это может быть полезно для нашего отдела по селекции клубники. Потому что и то, и другое распространяется вегетативно - то есть не через семена, а усы и клубни - они не родня, конечно, но в генетическом плане есть о чем поговорить, так сказать.Он дал эту статью агенту, который вооружен до зубов скиллами нашего собственного приготовления, и поставил задачу воспроизвести методы из статьи на наших данных клубники.Агент прочел работу, скачал с гита код, подтянул наши данные из бд, адаптировал что-то по мелочи, собрал контейнер, создал джобу на кластере и вот оно там бодро считается на нескольких Н100.По сути это задача интерна/джуна - “вот тебе статья, вот данные, через неделю покажешь, не надо плакать, все
    32,20068171412Open in Telegram
  • Адель и МЛь

    11 Jul, 17:53

    Короткая рекомендация по GPT-5.6:Terra, похоже, можно смело пропускать.По графику Artificial Analysis у неё нет своего sweet spot: при той же цене Sol умнее, а при сопоставимом качестве Luna дешевле.Похоже вот это хороший сетап:Luna High - дефолтная модель, повседневный кодинг, мелкие фиксы и обычные задачи.Sol High - сложные баги, архитектура, планирование и ревью.С Ultra осторожнее: она спамит сабагентами и такой режим может очень быстро сжечь лимиты. При этом, по некоторым отзывам, она удаляет то, чего не следовало трогать (вплоть до вообще всего на диске) - но это пока что единичные случаи.P.S. Luna натренирована моделью Sol. А Terra - людьми. Думайте.
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    6,8703932107Open in Telegram
  • Адель и МЛь

    3 Jul, 08:08

    А почему не на виниле?https://x.com/github/status/2072801888525840476?s=46
    Image from a post by Адель и МЛьImage from a post by Адель и МЛь
    4,54017952Open in Telegram
  • Адель и МЛь

    1 Jul, 10:26

    Artificial Analysis померили стоимость Sonnet 5 на задачу (per task), и у них получилось, что он дороже Opus 4.8 на 15% и что это вообще одна из самых дорогих моделей, уступая только Fable 5.https://x.com/artificialanlys/status/2072062592923930666?s=46
    39,600307Open in Telegram
  • Адель и МЛь

    30 Jun, 05:49

    Интересный сервис - AI Values показывает, с какой LLM у вас больше всего совпадают ценности и стиль мышления.Проходишь сценарии с моральными и вкусовыми дилеммами, а сайт сравнивает твои ответы с разными моделями.Можно пройти тест на 15 вопросов и потом затюнить на еще на 100.https://ai-values.comЯ попал в opus 4.8 🤔
    Image from a post by Адель и МЛьImage from a post by Адель и МЛьImage from a post by Адель и МЛь
    6,74013221Open in Telegram
  • Адель и МЛь

    26 Jun, 17:18

    OpenAI выкатывают своего Mythos.GPT-5.6 - новая серия моделей: Sol - флагман, Terra и Luna поменьше и быстрее.Terra обещают примерно на уровне GPT-5.5, но в 2 раза дешевле.Sol тренировали с упором на agentic coding, biology/genomics и cybersecurity.Появляются новые режимы: max reasoning effort для более глубокого reasoning и ultra mode, где модель использует subagents(!) для сложных задач.Модель стала сильно мощнее, поэтому OpenAI делает поэтапный релиз и более жёсткие safeguards. Но по их оценке Sol не пересекает Cyber Critical threshold.Доступ пока limited preview в API и Codex для select trusted partners.Цены за 1M токенов: Sol $5 input / $30 output Terra $2.5 / $15 Luna $1 / $6.И еще Sol на Cerebras до 750 tokens/sec планируют в июле, сначала тоже ограниченно.
    OpenAIPreviewing GPT-5.6 Sol: a next-generation modelOpenAI previews GPT-5.6 Sol, a next-generation model with stronger capabilities in coding, science, and cybersecurity, paired with its most advanced safety stack.
    138,000124321Open in Telegram