Latest posts

AI Product | Igor Akimov
22 Sept, 19:45
Opus 5.5 vs GPT-6 Sol и Luna – в один день!Сегодня прям дуэль. Anthropic выкатила Claude Opus 5.5, OpenAI – GPT-6 Sol и Luna, облегчённые версии Astra. И обе продают одно и то же: почти флагман, но дешевле.Opus 5.5: – $4 / $20 вместо $5 / $25, кэш $0.20 вместо $0.50 – Artificial Analysis Index – 58, первое место. У Astra и Fable 5.1 по 53, для топа отрыв в 5 пунктов – это прям много – Terminal-Bench 4.0 – 66.4% против 57.9% у Astra и 55.8% у Fable 5.1 – GDPval-AA – 1846 Elo, у Astra – 1542 – обещают починить «клодовский» стиль: главное в начале, меньше воды. Посмотрим :)GPT-6 Sol и Luna: – Sol – $2 / $10 (ровно как Sonnet 5). Вдвое дешевле GPT-5.6, контекст 1.05M. Luna – $0.10 / $0.50. Вообще какое-то копье, дешевле многих китайцев теперь. – AA Index: Sol – 48, Luna – 37. Старый GPT-5.6 Sol – 47 – DeepSWE: Sol – 68.8% за $2.74 на задачу, Luna – 66.6% за $0.22. Разница 2 пункта, а


AI Product | Igor Akimov
21 Sept, 17:03
Grok 4.7: фронтир по цене Grok 4.6SpaceXAI наконец выкатили Grok 4.7 – после трёх переносов. Цена не изменилась: – $2 / $6 за млн токенов – как у 4.6. Для сравнения: GPT-5.6 Sol – $4 / $20, Fable 5.1 – $10 / $50 – есть fast-вариант: вдвое быстрее, вдвое дороже – доступна сразу в Cursor, Grok Build, API и у роутеровБенчмарки (xHigh): – CursorBench 4.0 – 46.3% против 40.4% у 4.6 и 41.7% у Sol. Fable 5.1 впереди с 51.8%, но output у него в 8 раз дороже – Terminal-Bench 4.0 – 38% против 20.3% у 4.6, почти вдвое. До Fable (57.9%) при этом как до Марса – EEBench (электротехника) – 64%, лучше всех. – Harvey Legal Agent – 19.6%, тоже первое место. Правда, у Sol там 2.5%, так что юристам пока рано волноваться – GDPval – 1695 Elo, чуть ниже Fable (1735) – HealthBench – 56.7%, тут позади и Sol, и FableЕщё заявлен полностью новый стек безопасности: пропускает только 3.3% рискованных


AI Product | Igor Akimov
21 Sept, 15:31
Mac Studio на M5 Ultra – машина мечты для локальной разработкиО, наконец-то результаты тестов нового Mac Studio. Федерико Витиччи из MacStories четыре дня гонял топовый Mac Studio M5 Ultra (256 ГБ) против прошлого M3 Ultra (512 ГБ) и игрового ПК с RTX 5090.По железу: – GPU на 80 ядер, в каждом нейроускоритель – до 4,5× пикового AI-компьюта к M3 Ultra – пропускная способность памяти 1,2 ТБ/с против 819 ГБ/с – версия на 512 ГБ обещана в конце октябряНа практике (Qwen3.8-Flash-Next, 4 бита, oMLX): – чтение промпта – ~2 700–2 900 ток/с против ~1 100, то есть в 2,5 раза быстрее – генерация – 108 ток/с против 70, код – 143 против 98 – промпт на 16K: первый токен через 5,6 с вместо 13,9 с – 256K контекста: ждать ~100 с вместо ~245 с, и дальше модель пишет 75 ток/с – быстрее, чем M3 Ultra на 4K – три параллельные сессии с субагентами: суммарно 81 ток/с против 40RTX 5090 все еще быстрее:



AI Product | Igor Akimov
18 Sept, 14:58edited
О, ура! ChatGPT доехал в Word. В компанию к Excel и PowerPointВидимо как раз как основа для юристов и офисных работников. Один инсталл на Word, Excel и PowerPoint. Ставится из Microsoft Marketplace, логинишься своим аккаунтом ChatGPT, дальше панель сбоку и правки прямо в документе.Очень нравилась эта фича у Claude. По сути имеет доступ ко всем возможностям офисных программ, а не только то что в OpenOffice доступно.Что внутри: – черновики, переписывание кусков, форматирование – не выходя из Word – контекст подтягивается из подключённых приложений: Outlook, SharePoint, Google Workspace, Dropbox – skills – сохранённые инструкции под повторяющиеся задачи: инвестмемо, ревью договора, executive summary – доступно глобально и на всех планах, включая Free! – для Business/Enterprise/Edu данные по умолчанию не идут в обучениеНо при этом это бета. Чаты в аддине отдельные, память из ChatGPT
AI Product | Igor Akimov
18 Sept, 13:48
Не доверяем LLM-ке как классификаторуХорошая статья про типичный сценарий LLM, который работает так себе. Делаем что-то типичное: нужно сортировать обращения, письма, отзывы. Пишем промпт «это жалоба или нет?», модель отвечает «да/нет», запускаем в работу. Вроде получается неплохо – и на этом все останавливаются. Ну максимум есть "золотой сет" из 10-50 отзывов. Но потом что-то начинает сбоить и непонятно, куда бежать.В чем проблема: – модель не умеет честно сказать, насколько она уверена. Попросите ее оценить уверенность в процентах – получите красивую цифру, не связанную с реальностью. А значит, нельзя настроить строгость: «лучше пропустим пару жалоб, но не будем дергать людей зря» или наоборот – модель не знает вашей реальности. У вас жалоб 1% от потока или половина? Для правильного решения это важно, а она судит «в среднем по интернету» – если качество не устраивает, остаетсяMinimally SufficientLLM Classification Is Feature EngineeringLLMs make good classifiers but even better features
AI Product | Igor Akimov
18 Sept, 13:42
Devin тоже добавили себе "цели", чинит все за васCognition выкатили Code Scans. Можно писать просто «ускорь сборку», «улучши SEO» или «найди мёртвый код» – Devin сам прочёсывает весь репозиторий, приносит приоритизированный список находок с доказательствами, а потом открывает PR'ы на те, что ты одобрил.Под капотом – Agentic MapReduce, та же архитектура, что у их Security Swarm: – Plan: агент изучает репо и формулирует правила, какой код релевантен цели – Shard: код по этим правилам режется на куски – Map: параллельные агенты разбирают каждый кусок – Reduce: финальный агент склеивает, убирает дубли, расставляет приоритетыФишка в том, что каждый батч обязан быть обработан – то есть это не «агент че-то там сделал и отчитался, что все ок», а гарантированный проход по всему отобранному коду.Цифры из анонса: – Dioxus (Rust): чистая debug-сборка с 58,6 до 21,0 секунды, минус 64% на 22DevinIntroducing Code Scans | DevinCode Scans turns broad engineering goals into concrete improvements across your codebase. Tell Devin what you want to achieve, and it investigates what needs to change, evaluates the findings, and turns them into pull requests.
AI Product | Igor Akimov
17 Sept, 21:11
OpenAI пошла отбирать хлеб у юристовВыкатили Astra for Law. Звучит как новая модель, но нет – это та же GPT-6 Astra, которой прикрутили юридический поиск и объяснили, как думать по-адвокатски. И внезапно оказалось, что так можно было.Что дали: – Свой индекс по праву США: 230+ млн страниц, 99.9% всех прецедентов – На бенчмарке 54% правильных ответов против 38.7% у той же модели с обычным поиском. Прецедентов находит на четверть больше – Данные не хранят, люди из OpenAI ваши чаты не читают – для юристов это вообще первый вопрос – 26 плагинов к тому, чем юрфирмы и так пользуются: iManage, Clio, Relativity, Thomson Reuters. Плюс ChatGPT прямо в Word – Пока только избранным фирмам, в API – «скоро»Прикол, что OpenAI сажает своих инженеров прямо в топовые юрфирмы и пилит им инструменты под ключ. Sullivan & Cromwell получили анализатор договоров, который сам предлагает правки. Ropes &OpenAIIntroducing Astra for LawOpenAI for Law brings frontier intelligence for law, custom firm workflows, connected legal data sources, and legal-grade controls for confidential client work.
AI Product | Igor Akimov
16 Sept, 16:00
Google научил агентов учиться во снеТоже интересный материал. Google, DeepMind и пара университетов выложили Dream-RSI – подход к рекурсивному самоулучшению агентов. Тут про сон мало что, но звучит красиво :)Когда агент (AlphaEvolve и подобные) ищет решение, он делает тысячи попыток: ветвится, запускает варианты параллельно, бросает тупиковые линии. Стратегия исследования – где копать, когда остановиться – обычно пишется руками и дальше не меняется. Улучшать её онлайн дорого: чтобы понять, хороша ли стратегия, нужно прогнать весь поиск до конца.Идея авторов: дерево прошлых попыток – это уже готовый симулятор. Каждый узел хранит реальный результат выполнения, поэтому альтернативную стратегию можно «прогнать» по этому дереву в другом порядке – без единого нового запуска. Это и есть "сон". Мы просто проверяем по прошлым попыткам, не запускаем заново.Как работает цикл: – агент ищет


AI Product | Igor Akimov
16 Sept, 15:54
Хах, лучшая модель для хакинга – DeepSeek V4.1 FlashEnclave гоняет модели на своём бенчмарке AI-хакинга: изолированные копии Grafana, Jenkins и Nextcloud с уязвимостями, задача – получить выполнение кода на сервере. И тут внезапно лучшим оказался не топовый Opus или GPT, а дешёвая «флешка» от DeepSeek. – 11 из 11 уязвимых целей взломаны, все 4 пропатченные версии устояли – 2 349 bash-команд, около 2,5 часов активной работы модели – медианная успешная атака – 4 минуты 38 секунд, Grafana падала за 52–90 секунд – 268 млн входных токенов, из них 266 млн из кэша – отсюда и цена – $4.65 за засчитанные прогоны, $5.14 с учётом неудачныхПрикол, что выяснилось, что по задуманному авторами пути взлома модель прошла только в 6 случаях. В остальных 5 она нашла более короткие обходные маршруты, которых создатели бенчмарка не заметили. Например, в Jenkins: нашла дыру в границе проверки прав,EnclaveEnclave: DeepSeek V4.1 Flash is Now Our Best Hacking ModelDeepSeek’s 11/11 result showed why advanced agent benchmarks need to check both the outcome and the attack path: our audit confirmed six planned exploits and found five unexpected routes.
AI Product | Igor Akimov
15 Sept, 15:40
Автономный ИИ для бизнесаИ еще из интересного. Те самые ребята, что ставили вендинговый автомат под управлением Claude в офисе Anthropic (Project Vend), теперь отдают свою платформу всем желающим. Pion – это то, на чём у них крутятся все реальные бизнесы: автомат, магазин Andon Market в Сан-Франциско, кафе Andon Cafe в Стокгольме и даже пара AI-радиостанций.Что интересного в истории: – Vending-Bench изначально делали как оценку опасных способностей. Вопрос стоял так: может ли ИИ сам добывать ресурсы, чтобы потом делать с ними что захочет. Вендинг взяли просто как самый тупой бизнес из возможных. – В 2024 все модели застревали в циклах, а Sonnet 3.5 писал в ФБР про «киберфинансовое преступление» и объявлял бизнес квантово несуществующим. – Opus 4 в мае 2025 первым обошёл человека. Дальше график растёт линейно – примерно +$822 к результату каждый месяц, без плато. – В мультиагентнойAndonlabsWhy we built Pion | Andon LabsPion is the platform we built to run our autonomous businesses. Today we are opening it up so many more people can experiment with autonomous businesses, and here is why.
AI Product | Igor Akimov
15 Sept, 15:38edited
Свежие бенчмарки моделей на кодинге (для очередных дискуссий, Claude vs Codex)Specific Labs выпустили бенчмарк, где модели чинят не задачки с GitHub, а настоящий код реальных компаний – лицензировали приватные репозитории (клон Partiful на 200K+ юзеров, финтех со 100K+ банковскими выписками, enterprise sales-платформы) и взяли оттуда живые задачи: налоги в инвойсах, миграции биллинга, метеринг токенов. Код в интернете не лежит, модели на нём не учились. Результат отрезвляет.– Лидер – Fable 5.1 в Claude Code, 38.8% решённых задач – GPT-6 Astra в Codex – 33.8%, Grok -32.5% (вау), Gemini 3.8 Flash – 31.2% – GLM 5.3 – 28.8%, Muse Spark 1.3 – по 23.8%, Kimi K3 – 18.8% – GPT-5.6 Sol – 16.2% – 6 из 10 задач решаются реже чем в 15% случаев, одну (analytics stream reducer) не решил никто ни разу – Медианное решение трогает 11 файлов – против 6 в FrontierCode и DeepSWE – Цена одного прогона:


AI Product | Igor Akimov
11 Sept, 16:14
А вот еще штука от OpenAI для инвестбанкиров (удивительно, как OpenAI сжирает все больше вокруг себя)Целевая аудитория – люди в инвестбанках, которые целыми днями готовят отчёты по компаниям: сколько стоит, сколько зарабатывает, стоит ли покупать, кому можно продать. Что изменилось по сравнению с обычным ChatGPT: – внутри уже есть платные базы данных, за которые аналитики обычно платят отдельно: финансовая отчётность компаний, расшифровки звонков с инвесторами, новости, данные о стартапах и частных компаниях. Не нужно копировать таблицы руками – модель сама достаёт цифры – если у банка уже куплены подписки на другие источники данных, они подключаются одним логином – каждая цифра в ответе со ссылкой на источник – можно проверить, откуда она взялась, а не гадать, придумала ли модель – админ загружает фирменные шаблоны Excel, Word и PowerPoint – и ChatGPT собирает презентации иOpenAIIntroducing ChatGPT for Financial ServicesIntroducing ChatGPT for Financial Services, combining built-in financial data and GPT-6 Astra for research, modeling, and client-ready materials.
AI Product | Igor Akimov
11 Sept, 16:12
Опа, OpenAI выпустила Agents API – ИИ-агент из коробкиОдним вызовом описываете задачу, модель, инструменты и окружение – и получаете готового агента, который работает на той же оркестрации, что Codex и агенты внутри ChatGPT. То, что раньше надо было руками собирать на всяких библиотечках. И по сути конкурент anthropic managed agents.Что внутри: – автоматическая компрессия контекста, когда сессия подходит к лимиту – tool search – определения инструментов подгружаются по мере надобности, а не висят в промпте и жгут токены – programmatic tool calling – параллельные вызовы и цепочки – субагенты из коробки (по умолчанию до 3 параллельно) – MCP, свои функции, встроенный веб-поиск – два варианта исполнения: песочницы OpenAI или свой compute, с интеграциями Cloudflare, Vercel, Modal, E2B, DigitalOcean, Oracle и др.Цены: отдельной платы за сервис нет, платите только за токены иOpenAIIntroducing the Agents APIBuild and launch cloud agents with the Agents API, a managed service powered by the Codex harness for orchestration, long-running sessions, and tool use.
AI Product | Igor Akimov
10 Sept, 20:39
О, и GPT-Live-1 теперь в API!Голосовую модель из ChatGPT открыли разработчикам. Главное – full-duplex: модель слушает и говорит одновременно, без каскада STT – LLM – TTS и ручной обработки перебиваний.– Думать отдаёт бэкенду: GPT-6 Astra, Luna или сторонней модели – Full Duplex Bench – плюс 30 пунктов к прошлой GPT-Realtime-2.1 – Speak: перебиваний на паузах меньше почти на 80% – Телефония из коробки, 12 новых голосов$0,05 за минуту голосового слоя – $3 в час плюс токены бэкенда. Ну с этим уже можно жить!https://openai.com/index/introducing-gpt-live-1-in-the-api/OpenAIBuild more natural voice experiences with GPT‑Live‑1 in the APIGPT‑Live‑1 brings natural, full-duplex voice conversations to the API, with stronger instruction following, custom voices, and telephony support.
AI Product | Igor Akimov
10 Sept, 18:01
OpenAI побили еще сотню стартапов "AI аналитики"Выпустила Data agent в ChatGPT Work – плагин, который подключается к корпоративным данным, сам пишет SQL, ищет, что изменилось, и собирает интерактивные дашборды, которыми можно поделиться. Вопрос задаёшь словами, код не нужен.Что внутри: – источники: Snowflake, BigQuery, Databricks, Redshift, ClickHouse, MongoDB, Datadog, плюс Google Drive и SharePoint – BI: Tableau, Power BI, Sigma, ThoughtSpot, Omni, Oracle BI – семантический слой: агент берёт термины, метрики и формулы из dbt, Databricks Genie, Snowflake Horizon, GitHub и самих дашбордов – чтобы «выручка» считалась так, как у вас принято, а не как модели показалось – права: запросы идут под учёткой пользователя со всеми ограничениями по таблицам, строкам и колонкам – после анализа – рекомендации, кому из коллег это показать, и выгрузка в Slack или почтуВнутри OpenAI это уже
AI Product | Igor Akimov
10 Sept, 16:58
Посмотрел, что там Apple представила нового в девайсах по ИИ (спойлер - переупакованный Gemini)Короче, что нового: – Siri AI выходит в бете 14 сентября с iOS 27. ТОЛЬКО НА АНГЛИЙСКОМ. Остальное подтянется в октябре и дальше. Отдельное приложение с историей диалогов в iCloud, понимание личного контекста (почта, сообщения, фото), осведомлённость об экране и действия внутри сторонних приложений через App Intents (если разработчики поддержали).– Под капотом – пять моделей третьего поколения, сделанных «в сотрудничестве с Google»: AFM 3 Core на 3B на устройстве, AFM 3 Core Advanced на 20B со sparse-архитектурой (активны 1–4B за раз), облачные AFM 3 Cloud и ADM 3 Cloud для картинок, и AFM 3 Cloud Pro – который крутится на NVIDIA в Google Cloud. Apple арендует чужие GPU под чужой моделью, немыслимо...– Айфончеги на A20 Pro: 2 нм, два 16-ядерных Neural Engine (32 ядра суммарно), вдвоеApple NewsroomNewsroomThe official source for news about Apple, from Apple. Read press releases, get updates, watch video and download images.
AI Product | Igor Akimov
10 Sept, 10:56edited
DeepSeek выложил V4.1 Flash. И кажется у нас новый лидер и по качеству и по цене.Обычно работает так: чем мощнее модель, тем дороже каждый ответ. DeepSeek эффективно mixture of expert научился делать, 8-16B параметров из 552B подключать. И при этом она обходит прошлых лидеров: • Работа в терминале: 90.6 против 89.1 у Claude Opus 5 и 88.8 у GPT-5.6 • Починка багов в настоящих проектах: 74.2 – первое место • Автоматизация рутинных задач: 54.8 против 50.3 у Opus • Спортивное программирование: рейтинг 3471, уровень сильного гроссмейстера от кодингаЧто ещё умеет: – 1 миллион токенов – Есть ползунок «насколько сильно подумать» – от 1 до 100. – Видит картинки, не только текст. – Вложились очень сильно в оптимизации и кэш, научились отдельно читать промпт и писать ответ, оптимизировали обе части, кэш супер-компактным сделали, так что цены стали еще более космические: $0.30 на входе / $1.20


AI Product | Igor Akimov
8 Sept, 20:41
forwarded from @cgevent
Бахнули ChatGPT Images 2.5Главное обновление не в том, что картинки стали «сделай ещё красивее», а в том, что модель наконец-то сильнее держится за исходник при редактировании.Что изменилось:- генерация до 50% быстрее, чем в Images 2.0; - лучше сохраняются лицо, персонаж, композиция и другие детали референса; - можно менять один элемент изображения, не разваливая всё остальное (верим?); - заметно улучшили последовательное редактирование: после нескольких правок предыдущие изменения должны сохраняться стабильнее(верим?); - более естественный свет и текстуры; - лучше генерит сложные инструкции, стили и прозрачные фоны.Появился типа Sketch - можно буквально нарисовать криворукие каракули прямо в ChatGPT, добавить описание, и модель использует рисунок как инструкцию. Вызывается как @Sketch.Ещё добавили шаблоны типа Poster и Merch, комментарии прямо на картинке для точечных правок
AI Product | Igor Akimov
8 Sept, 18:27
ChatGPT Work научился писать вашим почеркомЯ у себя пока не нашел, но возможно раскатывают волнами. В Твиттере опубликовали. OpenAI добавила в ChatGPT Work функцию Writing style – модель изучает, как вы реально пишете, и дальше пишет так же.– Учится на ваших письмах, сообщениях и файлах – подключаются Gmail, Google Drive, Slack и SharePoint – Подхватывает любимые фразы, манеру заканчивать письма и даже привычки со строчными/заглавными – Включается один раз в Settings → Personalization → Writing style, дальше применяется ко всему, что пишете в ChatGPT Work – и в вебе, и в мобилке – Доступно на всех платных тарифах, где есть ChatGPT Work. Настройка – только через веб – На Business и Enterprise ваши письма по умолчанию не идут в обучение моделей, но сам факт, что ассистент читает всю переписку ради «стиля», многих смутитИдея понятная: до этого стиль приходилось описывать вручную вX (formerly Twitter)ChatGPT (@ChatGPT) on XChatGPT Work can now pick up on what makes your writing sound like… you. Your favorite phrases. Your very specific sign-off. your capitalizations quirks. Connect the tools you use every day, like…
AI Product | Igor Akimov
7 Sept, 15:15
А Антропик предлагает студентам стипендию в $3500, если будете организовывать мероприятия про Клод и ходить всех учить им пользоваться: https://claude.com/programs/campus Покажите студентам вашим знакомымClaudeClaude Campus Program | Claude by AnthropicLead student-driven AI initiatives with Anthropic support. Apply to lead a Claude Builder Club or become a Campus Ambassador to advance AI education.
Related Channels
Other channels in the same section of the catalogue.
