Последние посты

Data, Stories and Languages
22 сент., 09:30
переслано из @rybolos_channel
🌸AI Research Preference Model🌸 #nlp #про_nlp #nlp_papersСегодня опять про скаффолды для агентов. Мы уже говорили про то, хорошая ли идея применить сверху preference models для оценки потенциала идей (спойлер: нет). А что, если попробовать обучить такую preference-модель не на вкусовщине (новизна идеи, "вкус", интуиция и т.д.), а на верифицируемом сигнале? Про это наша новая статья — “AI Research Preference Models”.🌸TL;DRГлавная проблема: AI-агент может быстро придумать множество вариантов эксперимента, но полноценный запуск каждого варианта — обучение модели и оценка результата — требует часов работы GPU. Поэтому критически важно заранее понять, какие идеи действительно стоит проверять.Мы предлагаем Research Preference Model (RPM) — модель, которая сравнивает несколько предложенных решений и выбирает наиболее перспективное до их полного запуска. В идеале, такая модель может




Data, Stories and Languages
21 сент., 10:09
DeepSeek-V4.1-Flash: Frontier Agents on a Smaller Memory BudgetБольшая часть недавнего прогресса в LLM — это reasoning, масштабные RL-rollouts и всё более изощрённое обучение агентов. Но одним из bottlenecks остаётся контекст. Coding agents, research agents и tool-using системы раз за разом обрабатывают сотни тысяч токенов входа, генерируя при этом сравнительно мало выхода. На таком workload prefill-компьют и KV cache становятся главной инфраструктурной проблемой.DeepSeek-V4.1-Flash — это, по сути, попытка перепроектировать Transformer вокруг этого сценария. 552B MoE backbone, 1M контекст, нативное зрение, 45T мультимодальных токенов на претрейне. Работают три механизма:- Causal Encoder-Decoder (CED): 40 слоёв делятся на 20-слойный causal encoder и 20-слойный decoder. Каждый decoder-слой проецирует свой global KV не из собственных hidden states, а из финального hidden state
Data, Stories and Languages
17 сент., 18:56
Data & AI London Meetuphttps://www.meetup.com/data-ai-london/events/316165116/22 сентября в Лондоне буду делать доклад: буду снова рассказывать про "AI-driven participation in Kaggle competitions, на этот раз добавлю опыт из соревнования ROGII.Помимо этого будет ещё два доклада:Javier Ramirez: When Your Wire Protocol Becomes the Bottleneck Alexy Golev: When the Bug Looks Like Success: Reliability Patterns for Multi-Agent AI Systems#datascience #careerMeetupMeetup #17, Tue, Sep 22, 2026, 6:00 PM | MeetupHello everyone and welcome to the Data & AI London meetup. **Speaker: Javier Ramirez (QuestDB)** **Talk:When Your Wire Protocol Becomes the Bottleneck** When your databas
Data, Stories and Languages
16 сент., 18:59



Data, Stories and Languages
15 сент., 08:03
GDE SwagНедавно я рассказывал как я пробовал Antigravity в рамках программы Google Developer Expert. Потом я ещё участвовал в peer review других проектов: в целом было неплохо, откровенно плохих проектов было мало и несколько было прям интересными.А ещё мне за это пришёл прикольный swag :)#ai #career
Data, Stories and Languages
13 сент., 10:37
Рекомендую каналХочу порекомендовать вам интересный канал о регулировании систем ИИ по всему миру: ИИ & Право.Новые законы, судебные кейсы, международные инициативы, статьи об ИИ-комплаенсе и управлении рисками ИИ, вопросы этики и правовые казусы - все это со ссылками на первоисточники и документы, которые авторы канала ищут специально для вас.Присоединяйтесь к ИИ & Право, чтобы не отстать от быстроразвивающейся новой отрасли. Канал доступен также и на английском языке.Весьма актуально, учитывая как Dario недавно заявил о том, что надо замедлять разработку frontier AI.TelegramИИ & ПравоНовости регулирования искусственного интеллекта ИИ комплаенс и этика Нейросети и законы LegalTech Сотрудничество и реклама: @mmariuka Английская версия канала https://t.me/ai_and_law Поддержать канал: https://boosty.to/aiandlaw
Data, Stories and Languages
12 сент., 11:47

Data, Stories and Languages
12 сент., 10:53
переслано из @sberlogabig
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны, с другой стороны достаточно нетривиальны.Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_cТакже, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.


Data, Stories and Languages
11 сент., 09:49
DevCrowd запускает новый опрос для дата-инженеров, аналитиков, дата-сайентистов, ML-инженеров и их руководителей.Зачем участвовать?– чтобы понять, какие задачи и инструменты сейчас в тренде,– увидеть, как устроена работа у коллег в других продуктах,– узнать, как растут зарплаты и роли в индустрии,– получить данные, которые можно использовать для самодиагностики и карьерного планирования.🗂 Пример прошлогоднего исследования — devcrowd.ru/ds25, мой пост.📝 Опрос займёт 15 минут, результаты появятся в открытом доступе скоро.👉 Пройти опрос
Data, Stories and Languages
10 сент., 14:09
Как AI-агенты помогли мне взять серебро на Kaggle - и где они меня подвелиНедавно я, впервые за долгое время, поучаствовал в соревновании Kaggle - ROGII. Задача - geosteering: по гамма-каротажу и траектории понять, где буровое долото находится внутри геологического слоя. Мы заняли 93 место из 6000+ команд, серебро.Главное отличие от прошлых соревнований: агенты написали практически весь мой код. Я выбирал направления и решал, чему верить; ChatGPT Deep Research искал статьи и подходы; Claude Code делал имплементацию, а ближе к концу я всё чаще переключался на Codex.Работало весьма хорошо. Раньше bottleneck часто был в реализации идей, а теперь мог сказать "добавь эти пять фич и перезапусти тренировку" и получить результат. Агенты присылали апдейты по тренировке в Telegram; и через remote connection можно было направлять следующие шаги.И иногда агенты неожиданно тупо ломались:- CAndrey LukyanenkoHow AI agents helped me win a Kaggle silver medal — and how they failed meA write-up of the ROGII Wellbore Geology Prediction competition: how I adopted an AI driven approach and got a silver medal.
Data, Stories and Languages
9 сент., 07:53
Qwen-Drive 1.0: Turning a General VLM into a Driving Foundation ModelСвежая работа от Qwen Team про автономное вождение. Обычно VLA-подходы берут предобученную VLM как источник семантики и рассуждений, дообучают её на driving-данных и прицепляют к ней предсказатель траектории. Проблема в том, что language supervision плохо ограничивает реальную 3D-геометрию (модель может убедительно описать сцену, имея при этом очень приблизительное представление о расстояниях и occupancy), а агрессивная доменная адаптация теряет часть общих знаний, которые как раз и нужны в редких и out-of-distribution ситуациях.Qwen-Drive-1.0 добавляет два внешних модуля к Qwen3.5-4B: BEV perception head для 3D-детекции, occupancy и сегментации карты, и Planning Expert на ~1.1B параметров, который генерирует пятисекундные траектории через flow matching. Planning Expert читает cached keys и values из восьми
Data, Stories and Languages
8 сент., 19:02
ChatGPT Images 2.5https://openai.com/index/introducing-chatgpt-images-2-5/Уже выкатили в доступ в GPT.Хз как теперь фоткам верить.


Data, Stories and Languages
7 сент., 08:10
переслано из @doomgrad
Друзья, пет-проект, над которым работал полгода, получилось довести до ума. Это читалка для многоязычных книг с кучей прикольных режимов чтения и подсказками типа составления словарей и грамматических мини-статей по текущему контексту.Языков сейчас 10 и буду добавлять туда любые языки, какие захотите, и делать больше параллельных книг. Сейчас работаю над удобным импортом, так что скоро можно будет грузить туда свои книги и пользоваться теми же подсказками.Просидел несколько штанов пока её делал, поэтому буду очень благодарен за репост или оценку в сторах! ❤️ Приложение бесплатное.Скачать можно тут — ios , android.
Data, Stories and Languages
4 сент., 18:57
Настала новая эра 👀 P. S. Пока только в Codex


Data, Stories and Languages
4 сент., 18:04
Running a Software Factory Efficiently at Uber ScaleВ начале года была новость, что в Uber за первые 4 месяца 2026 года умудрились потратить весь плановый бюджет токенов за год. Они пытаются экономить и вот недавно выложили блогпост о том, как они держат под контролем расходы на агентов.Почему это актуально: больше 70% PR у них сейчас создают локальные или облачные агенты, инженеры написали 3.6k+ agent skills, и в день выполняется больше 30 тысяч запусков этих скиллов. С февраля по август 2026 недельные активные пользователи выросли в 7 раз, а количество агентных запросов - в 9.4 раза. Резать доступ они не хотели, поэтому стали резать стоимость.Всё считается через одну формулу: total spend = users × sessions/user × turns/session × requests/turn × tokens/request × price/token. Первые два множителя они хотят растить, а оптимизируют средние три - то есть ту работу, которую агент
Data, Stories and Languages
1 сент., 18:48
переслано из @seeallochnaya
Вышел Claude: Fable 5.1. Помимо увеличения метрик (на паре свежих и/или закрытых бенчмарков — существенного, см. картинки): — чтение из кэша теперь стоит на 75% меньше. Суммарно это приведёт к снижению цены за решение задачи на 25-45%, в зависимости от сценария. — раньше Anthropic хранили ваши запросы в Fable/Mythos до 30 дней, чтобы анализировать и выявлять паттерны злоумышленников. Многие энтерпрайзы любят Zero Data Retention, когда после их запросов ничего на сервере не остаётся — получается несостыковка. Для Fable 5.1 будет предоставлен Enterprise Frontier Safeguards — когда на вашей инфраструктуре Anthropic развернут свои классификаторы и анализатоы, а сами у себя ничего не будут сохранять. Может привести к большой адаптации в бизнес-секторе (а то пока она хромает) — заточили на научные задачи, особенно биологиюВ честь релиза ещё и лимиты сбросили!




Data, Stories and Languages
30 авг., 06:53
GPT Sol и качество перевода с японскогоA Serious Look at GPT-5.6 Sol TranslationsВ последние годы я активно использую GPT для помощи в изучении иностранных языков и переводе. Постепенно заметно улучшение качества - всё ещё не идеально, но прогресс на лицо.Вчера я увидел интересный пост: профессиональный переводчик японских визуальных новелл (текстовых игр) с 10-летним стажем делится своими впечатлениями от GPT-5.6 Sol (уровень reasoning не был указан). Основная цель - сравнить текущее качество моделей с тем, что было доступно 5-10 лет назад.TL;DR: GPT-5.6 Sol крут, работает на уровне опытного переводчика, хорошо работает с тонкостями (стиль, шутки и прочее), количество ошибок - на приемлемом уровне.Автор анализирует примеры текста из трёх разных игр и сравнивает с переводом от других людей, которые переводили их. Я приведу общие впечатления автора, детальные примеры и их
Data, Stories and Languages
28 авг., 10:53
Насколько мы далеки от runaway AI?Я прочитал постмортем OpenAI про инцидент с Hugging Face - было интересно, советую изучить.В ходе чтения у меня возник вопрос: а насколько мы близки к runaway AI - модели, которую никто не запускал и никто не контролирует?Я написал короткий блогпост про это. Мне кажется, что сейчас есть три реальных ограничения, которые мешают runaway AI:- Интент (goal/objective). Либо агенту дали задачу, и он решил, что скопировать себя - это способ её выполнить. Либо человек прямо попросил его размножиться: кто-то ради фана, кто-то ради хаоса, кто-то чтобы кому-то навредить. - Размер весов. Чтобы скопировать 1T модель нужно много железа - это сложно. 30-70B спокойно запускается на арендуемом железе, но capability сильно ниже. Возможно скоро мы дойдём до tipping point, когда маленькие модели будут достаточно capable и смогут сами себя копировать. - Деньги. ЗаOpenAIThe Hugging Face incident and the road aheadOpenAI shares findings from the Hugging Face security incident and the steps we’re taking to strengthen AI model security, monitoring, and alignment.
Data, Stories and Languages
24 авг., 19:57
Book Review: Build a DeepSeek Model (From Scratch)Мне прислали на ревью очередную книжку, на этот раз от Manning. Идея простая: взять ключевые находки DeepSeek и собрать каждую из них с нуля в уменьшенном виде, так чтобы всё запускалось на ноутбуке.Порядок такой: KV-кэш и его memory cost (плюс MQA и GQA как стандартные ответы), потом Multi-Head Latent Attention с decoupled RoPE и DeepSeek-MoE, потом multi-token prediction, FP8 и DualPipe, и в конце GRPO и дистилляция. Книга не для новичков: предполагается, что трансформеры вы уже понимаете.Авторы обычно демонстрируют подходы по шагам. Например, вот так демонстрируется RoPE: сначала добавляют целые числа (ломают эмбеддинги большими значениями), потом бинарные векторы (чинят магнитуду, но дают разрывы), потом синусоиды. И заодно показывают, что бинарное кодирование — это мультичастотный сигнал (младшие биты осциллируют быстро,
Data, Stories and Languages
24 авг., 13:54
Talk: breaking into machine learning - мысли по итогамЯ полторы недели назад писал, что делал доклад для пакинстанских студентов.Участникам выдали электронные сертификаты с подписью оргов и меня. И вот уже который день они пишут в Linkedin посты об этом (приятно)Что интересно - прям видно бимодальное распределение: почти все пишут буквально один абцаз в стиле "послушал доклад, было норм, всем спасибо". И только 2-4 написали длинные тексты о том, что конкретно им понравилось.Первые посты я лайкаю, для вторых делаю репостТак сказать, организовываю RLAF - Reinforcement Learning with Andrey Feedback 😁#ai #career
