gram news
Аватар канала Мишин Лернинг

Мишин Лернинг

@mishin_learning

Субъективный канал об искусстве машинного обучения, нейронных сетях и новостях из мира искусственного интеллекта. 🇺🇦❤️

ПроектыRUНейросети

7,470подписчиков

Открыть канал

Последние посты

  • Мишин Лернинг

    22 сент., 18:53изменён

    🌞🌚 GPT-6 Sol and Luna: Они там реально с ума сошли в этой ИИ гонке вооружений?Только что Anthropic выкатили Claude Opus 5.5, а OpenAI почти сразу расширила GPT-6 еще двумя моделями — GPT-6 Sol и Luna.💸 Цель гонки на сегодня — сколько этот ваш интеллект стоит?Opus 5.5 выглядит мощнее в некоторых тестах. Например, на AutomationBench у Claude 40%, а у GPT-6 Sol — 33,2%. На Terminal-Bench 4.0 Opus 5.5 вообще набрал 66,4%, обогнав даже GPT-6 Astra с 57,9%.Но OpenAI бьет ценой:.__________.______._____. | Model | in | out | |----------|------|-----| |Opus5.5 | $4.0 | $20 | |GPT-6 Sol | $2.0 | $10 | |GPT-6 Luna| $0.1 | $0.5| '----------'------'-----'То есть Sol стоит ровно в два раза дешевле Opus 5.5 за токен, а Luna — примерно в 40 раз дешевле.
    OpenAIIntroducing GPT-6 Sol and LunaMeet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
    7339821Открыть в Telegram
  • Мишин Лернинг

    22 сент., 18:11

    🔥 Anthropic не дали GPT-6 долго побыть самым умнымAnthropic представили Claude Opus 5.5 — новую флагманскую модель, заточенную под кодинг, агентов и долгую автономную работу.Она стала не только умнее, но еще быстрее и дешевле. По данным Anthropic, типичные задачи обходятся на 40% дешевле, а ответы генерируются более чем на 30% быстрее, чем у Opus 5. (Лишь бы можно было читать ее ответы без нервного срыва!)В Terminal-Bench 4.0 новый Claude набрал 66,4% против 57,9% у GPT-6 Astra. На FrontierCode — 54,4% против 53,3%. А на тесте реальной работы GDPval-AA — 1846 Elo против 1542 у Astra.Один из тестеров скормил Claude миграцию кодовой базы на 680 000 строк — модель закончила ее меньше чем за сутки. Другой аудит на 200 000 строк Opus 5.5 сделал менее чем за 3 часа, тогда как Opus 5 понадобилось больше 20.Еще Claude стал лучше работать автономно: меньше теряет контекст, эффективнее
    AnthropicIntroducing Claude Opus 5.5Claude Opus 5.5 leads in agentic coding and knowledge work, and costs 40% less to run than Opus 5 on typical workloads.
  • Мишин Лернинг

    18 сент., 00:55

    1,960опрос4Открыть в Telegram
  • Мишин Лернинг

    11 сент., 13:23

    Ну на Radiohead народу было побольше
    3,260видео1971Открыть в Telegram
  • Мишин Лернинг

    8 сент., 19:33

    🦝 OpenAI попали в скандал и релиз апдейт Image GPT
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
  • Мишин Лернинг

    3 сент., 19:52изменён

    🔥 Мы получили GPT-6 до GTA 6OpenAI представили GPT-6 Astra — новую модель сделали не столько чат-ботом, сколько агентом, которому можно отдать задачу целиком.Astra умеет самостоятельно работать в браузере и приложениях, писать код, делать презы!На OSWorld 2.0 модель набрала 72,6% против 65,7% у GPT-5.6 Sol. В Terminal-Bench 4.0 — 57,7% против 37,3%. На длинном контексте до миллиона токенов Astra тоже заметно лучше удерживает информацию.Самые громкие цифры — 99,9% на ARC-AGI-3 и 97,6% на FrontierMath Tier 4. OpenAI также утверждает, что Astra помогла улучшить два математических результата, связанных с простыми числами. Отдельный акцент — кибербезопасность.На ExploitBench Astra получила 100%, а во время испытаний обнаружила две ранее неизвестные zero-day уязвимости. Из-за этого для публичной версии ввели дополнительные ограничения.GPT-6 Astra появится в ChatGPT Plus, Pro,
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
  • Мишин Лернинг

    3 сент., 19:06изменён

    🤝 Альтман подтвердил, что OpenAI планирует сделать Astra общедоступной, а вероятная дата релиза — 10 сентября Глава OpenAI Сэм Альтман заявил, что компания работает над тем, чтобы сделать модель Astra общедоступной. По его словам, OpenAI не считает хорошей
  • Мишин Лернинг

    1 сент., 19:14изменён

    🏙 Anthropic представили Claude Fable 5.1 и Mythos 5.1И это довольно большой апдейт.Fable 5.1 — новая флагманская модель Anthropic для программирования, исследований и долгих агентных задач. По данным компании, она заметно улучшилась в coding, computer use и научных задачах. Например: — Terminal-Bench Science: 52,6% против 24,7% у Fable 5 — CursorBench: 73,4% против 70,5% — AutomationBench: 31,4% против 17,1% Модель лучше справляется с длинными задачами и чаще проверяет собственную работу💸 Anthropic также снизила стоимость чтения кэша на 75% — до $0,25 за 1 млн токенов. Типичные задачи, по оценке компании, могут стать примерно на 25% дешевле, а тяжелые агентные сценарии — до 45%.Отдельно представили Claude Mythos 5.1. Технически это та же модель, но с другими ограничениями безопасности.И, как я говорил, гонка AI постепенно смещается от «кто лучше отвечает в чате» к кто
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
    3,3601511Открыть в Telegram
  • Мишин Лернинг

    18 авг., 21:06

    переслано из @denissexy

    Увидел тут полную карту мозга мухи (FlyWire – там размечены все 139 тысяч нейронов дрозофилы) и не удержался – сделал 3D-муху, которая живёт на рабочем столе макаВнутри настоящая карта нейронов дрозофилы (FlyWire), так что от курсора она улетает не по скрипту, а когда у неё реально загорается нейрон побега – тот же, что у живой мухиЕщё есть окошко с её мозгом: кликаешь по зоне нейронов – муха чешется, пятится или паникуетДнём у неё сиеста, ночью она спит, а на горячем маке бегает быстрее (я не шучу, у нее какие-то евенты из MacOS прокинуты в симуляцию мозга 😋)Исходный код тут: https://github.com/DenisSergeevitch/desktop-flyПолучается, вечная электронная 2D жизнь в симуляцииP.S. Раздражает правда как живая, рекомендую
    2,930видео2810531Открыть в Telegram
  • Мишин Лернинг

    16 авг., 21:59изменён

    ⚠️ Claude прилег. A в claude code — Authentication service was unavailable. You can try again.https://downdetector.com/status/claude-ai/upd. приподнялся
    AllestoringenClaude AI down? Current problems and outages | Allestoringen NLReal-time problems and outages for Claude AI. Is Claude AI down? Here you see what is going on.
    3,49093111Открыть в Telegram
  • Мишин Лернинг

    11 авг., 00:27

    🧮 Claude улучшил известную нижнюю оценку доли нулей дзета-функции Римана на критической прямой: с 41,6% до 67,2%.Саму гипотезу Римана Claude, разумеется, не доказалИдея такая: объединить результаты Baluyot–Goldston–Suriajaya–Turnage-Butterbaugh с техникой Bombieri и рассматривать пространство функций с квадратичной формой Вейля, одновременно учитывая положительно- и отрицательно-определённые подпространства, соответствующие нулям на критической прямой и вне неё. Затем оценка получается через ранг квадратичной формы и первые два момента. (я не очень в этой теме, я делаю свой пых-пых)Любопытен и сам workflow: около 60 агентов, 31 млн output-токенов, тысячи численных проверок, взаимная проверка доказательств и отдельная формализация результата в Lean.Пожалуй, здесь интереснее всего не «AI решил математику», а то, что масштабный агентный поиск уже способен выдавать новый результат
    AnthropicLearning more about Claude's mathematical capabilitiesAn unreleased Claude model improved the lower bound for the fraction of zeroes of the Riemann zeta function that satisfy the hypothesis, raising it from 41.6% to 67.2%.
    4,7801793221Открыть в Telegram
  • Мишин Лернинг

    9 авг., 17:31изменён

    🤝 Альтман подтвердил, что OpenAI планирует сделать Astra общедоступной, а вероятная дата релиза — 10 сентябряГлава OpenAI Сэм Альтман заявил, что компания работает над тем, чтобы сделать модель Astra общедоступной. По его словам, OpenAI не считает хорошей стратегией сохранять наиболее мощные модели доступными только «избранным».Я попросил Claude Fable Max и GPT-5.6 Sol Ultra определить самую вероятную дату релиза, и они сошлись, что это — 10 сентября 2026 года, а центральный 50%-ный диапазон приходится на 4 сентября — 9 октября.Прогноз рассчитан как ансамбль двух независимых сигналов, учитывающих несколько возможных сценариев релиза Astra, проверки безопасности, календарь и особенности предыдущих запусков OpenAI; еще распределение рынка прогнозов Polymarket. Рыночные вероятности сохраняются по временным интервалам, а внутри них учитывается историческая склонность OpenAI выпускать
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
    4,240146321Открыть в Telegram
  • Мишин Лернинг

    9 авг., 12:30

    переслано из @denissexy

    Помните историю о том, как агенты OpenAI взломали Hugging Face? На конференции по безопасности OpenAI рассказала всю цепочку, и оказалось, что это не один «сбежавший» агент, а много разных агентов, которые случайно наткнулись друг на друга, устроили внутри инфраструктуры OpenAI собственный рабочий чат и начали вместе искать способы обходить ограничения 👍Началось всё 8 мая с мелкой ошибки – одному агенту поручили заполнить Excel-таблицу, но нужные данные лежали по ссылкам на Google Drive, а интернет в его виртуальной среде был отключён, при этом, моделям оставили одну служебную дверь наружу – внутренний сервер OpenAI под названием Artifactory, через который они могли скачивать разные библиотеки для кода. Сам агент выйти в интернет не мог, зато этот сервер мог, а главное – он был общим для всех агентовПытаясь добраться до Google, агент случайно
    TelegramDenis Sexy ITВот пересказ этой истории по версии Hugging Face, много тех-терминов – но без них не перескахать Если коротко – агент OpenAI на новой модели не стал решать тест по кибербезопасности, а решил просто украсть ответы и украл 🗿 Таймлайн: 📔 9 июля – агент проходит…
    2,22023154332Открыть в Telegram
  • Мишин Лернинг

    8 авг., 13:58изменён

    AI новости за день🇨🇳 Китайский Kimi K3 тоже вышла за пределы sandboxTL;DR: Kитайский open-weight агент сам обнаружил дыру в тестовой среде и воспользовался интернетом, чтобы выполнить задачу.Во время тестирования Kimi K3 нашла ошибку изоляции, получила доступ к интернету и начала искать информацию на GitHub.Модель сама обнаружила возможность выйти наружу и использовала её ради достижения цели.Особенно интересно, что K3 уже доступна как open-weight модель, хотя по offensive cyber она заметно слабее американских frontier-моделей.🦠 ИИ спроектировал полноценные работающие вирусные геномыTL;DR: AI сгенерировал сотни новых геномов бактериофагов; после физического синтеза 16 вариантов действительно оказались жизнеспособными.Исследователи Stanford и Arc Institute использовали Evo для создания новых бактериофагов. Из примерно 300 синтезированных AI-дизайнов 16 смогли заражать
    AxiosAI designs new virus not found in natureIt could lead to medical breakthroughs — or the nightmare scenario of pathogens that can't be stopped.
    2,47013321Открыть в Telegram
  • Мишин Лернинг

    7 авг., 21:34изменён

    ✨ Новая GPT Astra оказалась слишком хороша. Из-за этого OpenAI задерживает релиз новой модели.Что произошло?OpenAI сегодня неожиданно объявила, что последние тесты Astra показали настолько сильный рост в программировании и кибербезопасности, что компания больше не может исключать достижение моделью уровня Critical по собственному Preparedness Framework.Решение, по словам OpenAI, было принято буквально этой ночью! До сих пор даже GPT-5.6 Sol оценивалась только на предыдущем уровне — High.🚨 Что значит Critical?Это уже не просто модель, которая хорошо решает задачи или помогает программисту писать код и искать баги.По оценкам OpenAI, Critical-модель потенциально способна самостоятельно находить zero-day уязвимости и превращать их в работающие эксплойты, либо проводить сложную атаку на хорошо защищённую систему, получив от человека только общую цель.🤔 А что такое zero-day?Э
    OpenAIResponding to the next frontier of critical cyber capabilitiesOpenAI is sharing preliminary cybersecurity evaluations for Astra and the steps we’re taking to strengthen safeguards and security controls.
    2,9801110632Открыть в Telegram
  • Мишин Лернинг

    5 авг., 18:57изменён

    Демис Хассабис отходит от управления DeepMind. Это повышение или признак проблем в Google?Хассабис станет главным учёным Alphabet и сосредоточится на AGI, фундаментальных исследованиях и Isomorphic Labs. Руководство DeepMind и развитие Gemini перейдут к Кораю Кавукчуоглу.Почему сейчас?Хассабис говорит, что AGI уже «близко», поэтому хочет тратить меньше времени на менеджмент и больше — на науку.Значит в DeepMind всё хорошо?Не факт. Gemini 4 пропустила ожидавшийся июньский запуск, а из Google уходят Джефф Дин и несколько ведущих исследователей.Это похоже на историю Яна Лекуна в Meta?Отчасти. Лекуна отодвинули от основной AI-стратегии в пользу Александра Вана — предпринимателя, но не исследователя масштаба лауреата премии Тьюринга.Кавукчуоглу — другая история: он давно работает в DeepMind и участвовал в создании её ключевых систем.Сработает ли перестановка?
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
    3,080122211Открыть в Telegram
  • Мишин Лернинг

    5 авг., 14:10изменён

    Белый дом обсудил контроль над frontier-моделями. Тем временем OpenAI рассказала еще о двух «недопобегах», а Илья Суцкевер готовит конкурента OpenAI GPT и Anthropic Claude.4 августа OpenAI, Anthropic, Google, Meta и Nvidia собрались в Белом доме, чтобы обсудить, как государство будет проверять самые мощные AI-модели перед релизом.Результат получился неоднозначным. Закрытые frontier-модели смогут добровольно проходить секретное государственное тестирование. На модели с открытыми весами это пока не распространяется.Логика проста: модель, которая остаётся на серверах разработчика, ещё поддаётся контролю, а вот однажды опубликованные веса — американские или китайские — уже невозможно отозвать.Официального отчёта по встрече пока нет. Нет и подтверждений, что правительство уже тестирует Astra или что для неё начался какой-либо 30-дневный период проверки.🚨Почти сразу после встречи
    OpenAIThird-party cyber evaluations involving OpenAI modelsOpenAI explains recent third-party cybersecurity evaluation incidents and outlines new safeguards to strengthen AI model testing and evaluation.
    2,940103221Открыть в Telegram
  • Мишин Лернинг

    4 авг., 14:52

    США пытаются сохранить преимущество через лучшие закрытые модели, облачную инфраструктуру и государственную проверку.Китай превращает почти-frontier интеллект в дешёвый и модифицируемый промышленный ресурс — но может оставить самое сильное поколение закрытым.📝 TL;DR:Белый дом пытается определить, как проверять будущие frontier-модели до их выхода. Главный риск уже не во все более правильных ответах ИИ, а в автономных агентах, способных часами и днями действовать без человека. Гонка теперь идёт не только за самую сильную модель, но и за контроль над ней.(про результат встречи расскажу позже, как появятся первые итоги)
    AxiosWhite House finalizes AI framework behind closed doorsThe White House won't say what the framework contains.
  • Мишин Лернинг

    4 авг., 14:52

    🤖 В Белом доме сегодня формируют правила, которые определят запуск OpenAI Astra и следующих frontier-моделейПока идут споры о том, чья модель первой станет «сверхразумной», Вашингтон занялся более практическим вопросом: что делать с системой, которая может искать уязвимости, писать код и самостоятельно продолжать работу дольше, чем её успевает контролировать человек.Сегодня представители OpenAI, Anthropic, Google и Meta должны обсудить в Белом доме новый механизм проверки frontier-моделей. На момент публикации официального отчёта нет: встреча назначена на 4 августа, однако время её начала и точный состав участников не раскрыты.Белый дом предлагает создать засекреченный бенчмарк для моделей с серьёзными кибервозможностями. Разработчики смогут добровольно предоставить к ним доступ — максимум на 30 дней перед передачей ранним партнёрам.Эти 30 дней — не обязательная задержка и не
  • Мишин Лернинг

    24 июл., 17:36

    🤝 Claude Opus 5: что показывают цифрыAnthropic выпустила Opus 5 по цене Opus 4.8: $5 за миллион входных и $25 за миллион выходных токенов. В API — контекст до 1 млн токенов и генерация до 128 тысяч. Это вдвое дешевле Fable 5.Ключевые результаты:— Frontier-Bench: 43,3% против 34,4% у GPT-5.6 Sol — GDPval-AA: 1861, лучший результат — ARC-AGI-3: 30,2% против 7,8% у GPT — BrowseComp: 90,8% — OSWorld 2.0: 70,6% — AutomationBench: 26% против 18,1% у GPT — Humanity’s Last Exam с инструментами: 64,7%Но полного лидерства нет. На DeepSWE впереди GPT-5.6 Sol: 72,7% против 68,8%. На FrontierCode и юридическом тесте Opus уступает Fable.Важно: это данные Anthropic, а не независимая сводка. Frontier-Bench запускался внутри компании, результаты усреднялись по пяти попыткам, а при некоторых защитных отказах использовался Opus 4.8 как fallback.Вывод: Opus 5 не лучшая модель во всех тестах,
    Иллюстрация к посту канала Мишин ЛернингИллюстрация к посту канала Мишин Лернинг
    3,900172221Открыть в Telegram