gram news
Data Portal | DS & ML channel avatar

Data Portal | DS & ML

@llmscience

Всё самое интересное из мира LLM, Data Science и машинного обучения adds: @devmangx Автор: @ScienceLLM

ProjectsRUAI

8,380subscribers

Open the Channel

Latest posts

  • Data Portal | DS & ML

    22 Sept, 15:17

    «Mathematical Pathways to Machine Learning» — новое введение в математические основы машинного обучения, опубликованное в августе 2026 года.Это сборник конспектов лекций, в котором математика последовательно выводится с базовых принципов. В нём рассматриваются векторы и матрицы, внутреннее и внешнее произведения, ортогональность и проекции, процесс Грама — Шмидта и QR-разложение, собственные значения и собственные векторы, SVD, PCA, производные и градиенты, якобианы, гессианы, разложения Тейлора, выпуклость, метод наименьших квадратов, градиентный спуск, сходимость и обусловленность, метод Ньютона, момент, множители Лагранжа, условия KKT, двойственность и метод опорных векторов.Математические концепции напрямую связываются с реальными задачами машинного обучения, включая нейронные сети и обратное распространение ошибки, PageRank, рекомендательные системы, снижение размерности,
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    22 Sept, 11:13

    Google DeepMind, Meta и Amazon опубликовали 135-страничную дорожную карту, которая по-новому определяет, что вообще представляют собой ИИ-агенты.Вот эта дорожная карта: https://arxiv.org/pdf/2601.12538
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    22 Sept, 10:12

    Проекты, которые можно собрать за выходные, если у вас уже средний уровень:1. Рой из нескольких агентов для сложных задач вроде исследований и математики 2. Среда выполнения для агента с состоянием, сессиями, памятью и остальной инфраструктурой 3. Сервис инференса LLM с продуманной системной архитектурой 4. Среда для голосовых агентов 5. Распределённая симуляция LLM 6. Агент на VLM с циклом мировой модели для работы с интерфейсами, скриншотами и документами 7. Среда с моделью вознаграждения за процесс и поиском для математики, кода и агентного RAG 8. Каскад моделей или смесь маршрутизаторов с ограничениями по стоимости, задержке и качеству 9. Система долговременной памяти с сохранением, вытеснением, повторной загрузкой и средой оценки 10. RL-среда для агентов, использующих инструменты, с хранением траекторий и циклом GRPO/DPO 11. Система наблюдаемости за агентами: трассировки,
  • Data Portal | DS & ML

    22 Sept, 05:10

    Архитектура GPU | Руководство по инференсу LLMhttps://handbook.modular.com/kernel-optimization/gpu-architecture-fundamentals/Добавьте это в свою подборку материалов по LLM.«Прежде чем писать или оптимизировать GPU-ядра, нужно понимать, как именно GPU выполняет код. Без этого советы вроде “увеличьте occupancy” или “уменьшите конфликты банков shared memory” превращаются просто в набор правил, которые приходится запоминать. Вы не до конца понимаете, когда они применимы, а когда нет.В этом разделе разбирается архитектура современных GPU на уровне, необходимом для работы с ядрами. Основной акцент сделан на оборудовании NVIDIA, поскольку CUDA сегодня доминирует в значительной части экосистемы LLM-инференса. При этом базовые принципы в целом применимы и к GPU AMD, и к другим параллельным ускорителям».
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    22 Sept, 04:41

    Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные. Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось. AA Intelligence
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    22 Sept, 04:30

    Китай снова в игре: Xiaomi ночью выпустила MiMo-V2.6 Pro и Flash и результаты очень сильные.Xiaomi потратила 130 часов, 75 млрд токенов и $2,6 млн на RL, чтобы вывести MiMo-V2.6 Pro на первое место среди открытых моделей. И у них получилось.AA Intelligence Index — 46,32, выше Kimi K3 и Qwen3.8 Max. При этом цена осталась такой же, как у V2.5.При сопоставимом уровне интеллекта стоимость запросов составляет всего 1/20–1/60 от международных флагманов:• MiMo-V2.6 Pro — $0.435 / $0.87 • MiMo-V2.6 Flash — $0.14 / $0.28, примерно треть цены Pro • DeepSeek V4 Pro — около $0.66–1.32 / $1.98–3.96, Pro дешевле примерно в 2–5 раз • GLM-5.3 — около $1.40 / $4.40, Pro дешевле примерно в 3–5 раз • Qwen3.8 Max — около $2 / $6, Pro дешевле примерно в 5–7 раз • Gemini 3.5 Flash — около $1.50 / $9, Pro дешевле примерно в 3–10 раз • Gemini 3.1 Pro — около $2 / $12, Pro дешевле примерно в 5–14 раз •
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    21 Sept, 16:06edited

    Исследователь OpenAI Алиса Лю прошла 57 собеседований перед тем, как попасть в компанию, а затем открыто опубликовала весь свой путь подготовки и поиска работы.Если вы готовитесь к позициям Research Scientist или MTS, это один из самых насыщенных практических материалов, которые сейчас можно найти.Можно использовать её конспекты напрямую или просто взять список тем и пройти их самостоятельно. Такое публикуют редко.Конспекты по LLM: https://alisawuffles.notion.site/alisa-s-book-of-llmsМатематика: https://alisawuffles.notion.site/math-notesРазбор поиска работы и собеседований: https://alisawuffles.github.io/blog/job-search/
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    21 Sept, 15:17

    «Precalculus» — бесплатная книга, которую я рекомендую, когда меня спрашивают о хорошем ресурсе по базовой математике.Она охватывает многие основы, необходимые перед переходом к математическому анализу и более продвинутой математике. Книга начинается с вещественных чисел, декартовой плоскости, отношений и функций, а затем переходит к линейным, квадратичным, полиномиальным, рациональным, показательным и логарифмическим функциям.Также рассматриваются конические сечения, системы уравнений, матрицы, определители, последовательности, математическая индукция, биномиальная теорема и значительный объём тригонометрии, включая тождества, обратные тригонометрические функции, тригонометрические уравнения, полярные координаты, векторы и параметрические уравнения.В книге больше 1 000 страниц, а по ходу глав есть множество упражнений и ответов к ним. Поэтому она подходит как для первого изучения
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    21 Sept, 08:10

    Вот один из лучших материалов для начала, если хотите понять, что процессор на самом деле делает.https://youtu.be/GU8MnZI0snA
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    20 Sept, 15:17

    Apple развивает MLX-LM — инструмент, который позволяет запускать и дообучать языковые модели прямо на Mac.Проект создан командой ml-explore и уже набрал более 7 тыс. звёзд на GitHub.Главное преимущество — простой запуск. Вместо ручного поиска квантованной версии модели и настройки среды достаточно одной команды и имени модели с Hugging Face. По умолчанию можно запустить 4-битную Llama 3.2 3B, а другую модель выбрать через параметр --model.В той же среде поддерживаются LoRA и полное дообучение, в том числе для квантованных моделей. Вычисления можно распределять между несколькими машинами через mx.distributed.Для длинного контекста есть вращающийся KV-кэш и кэш подсказок, поэтому при повторной работе с одним документом не нужно каждый раз заново обрабатывать весь контекст.И главное — модель работает локально, поэтому данные остаются на устройстве.https://github.com/ml-explore/m
    GitHubGitHub - ml-explore/mlx-lm: Run LLMs with MLXRun LLMs with MLX. Contribute to ml-explore/mlx-lm development by creating an account on GitHub.
  • Data Portal | DS & ML

    20 Sept, 09:11

    Bespoke Labs выпустила Nimble — открытый аналог Jev с опубликованными данными, рецептом обучения и весами модели.Nimble построен на Qwen3.5-9B и дообучен через LoRA без дистилляции из Jev. Сам Jev использовался только как ориентир для оценки качества.Ключевой метод — контрастный отбор данных: в примерах меняется один критически важный факт, который должен изменить итоговое решение. Все данные синтетические и охватывают 10 категорий, при этом обучающая и тестовая выборки разделены.Модель не генерирует длинный текст, а напрямую работает с вероятностями токенов возможных ответов через параллельное ограниченное декодирование.На собственном наборе тестов базовый Qwen получил 66%, Nimble — 90%, Jev — 93%. Задержка на H100 составляет около 100 мс, а модель можно запускать локально на MacBook.Обучение с подкреплением пока не использовалось.Код: https://github.com/bespokelabsai/nimble
    GitHubGitHub - bespokelabsai/nimble: Local typed decisions, contrastive data curation, and model evaluation.Local typed decisions, contrastive data curation, and model evaluation. - bespokelabsai/nimble
  • Data Portal | DS & ML

    20 Sept, 07:09

    В открытом доступе появился GuppyLM — проект, который позволяет обучить языковую модель на 9 млн параметров с нуля примерно за пять минут.Репозиторий включает весь процесс обучения и рассчитан на быстрые эксперименты с небольшими языковыми моделями без крупной инфраструктуры.https://github.com/arman-bd/guppylm
    GitHubGitHub - arman-bd/guppylm: A ~9M parameter LLM that talks like a small fish.A ~9M parameter LLM that talks like a small fish. Contribute to arman-bd/guppylm development by creating an account on GitHub.
  • Data Portal | DS & ML

    20 Sept, 06:10

    На выходные — отличный материал по современному программированию GPU для систем машинного обучения.MLC Community разбирает архитектуру GPU практически с нуля: потоки и варпы, иерархию памяти, CUDA Cores и Tensor Cores, TMA, устройство Blackwell, GEMM и Flash Attention 4. Отдельный упор сделан на то, как писать действительно быстрые ядра и эффективно загружать вычислительные блоки GPU.https://mlc.ai/modern-gpu-programming-for-mlsys/chapter_background/index.html
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    20 Sept, 05:10

    MIT открыл полный курс по визуальной навигации для автономных систем.Программа охватывает весь путь от восприятия окружающей среды до управления движением, а не отдельные алгоритмы. В курс входят 2D- и 3D-зрение, визуальная и визуально-инерциальная одометрия, SLAM, распознавание мест, построение карт, планирование траекторий и методы машинного обучения для задач навигации.Курс рассчитан прежде всего на разработчиков робототехники, беспилотников и автономных автомобилей.Все материалы доступны бесплатно, включая лекции, слайды и конспекты.https://vnav.mit.edu
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    19 Sept, 15:17

    Если вы изучаете экономику или интересуетесь пересечением эконометрики, причинно-следственного анализа и машинного обучения, стоит прочитать работу Сьюзан Эйти.Она разбирает, что машинное обучение действительно может дать экономике и эконометрике, а где его возможности заканчиваются.Особенно полезно для понимания того, чем прогнозирование отличается от установления причинно-следственных связей и почему хорошие предсказания сами по себе ещё не отвечают на экономические вопросы.https://nber.org/books-and-chapters/economics-artificial-intelligence-agenda/impact-machine-learning-economics
    Image from a post by Data Portal | DS & MLImage from a post by Data Portal | DS & ML
  • Data Portal | DS & ML

    19 Sept, 11:11

    Вышел подробный разбор управления роботами для тех, кто приходит в робототехнику из машинного обучения и не имеет профильной подготовки.Автор на примере манипулятора SO-100 из проекта LeRobot показывает, что именно делает выход модели с сервоприводом, как работает ПИД-регулятор и почему дешёвые манипуляторы перелетают нужное положение.Также разбираются запись данных при телеуправлении, пространство суставов и пространство задачи, прямая и обратная кинематика, ограничения рабочей области SO-100 и различия между тем, что предсказывают ACT и OpenVLA.Всё сопровождается анимациями и практическими примерами. Следующий материал будет посвящён ACT.
  • Data Portal | DS & ML

    19 Sept, 04:41

    Курс в Стэнфорде «Современный разработчик программного обеспечения» стартует в следующий вторник.В этом репозитории на GitHub будут публиковаться все задания. Там уже доступны задания с прошлого года.https://github.com/mihail911/modern-software-dev-assignments
    GitHubGitHub - mihail911/modern-software-dev-assignments: Assignments for CS146S: The Modern Software Dev (Stanford University Fall 2026/2025)Assignments for CS146S: The Modern Software Dev (Stanford University Fall 2026/2025) - mihail911/modern-software-dev-assignments
  • Data Portal | DS & ML

    18 Sept, 11:13

    Один из создателей ChatGPT представил принципиально новый тип ИИ-моделей. Два года, Диогу Алмейда, втайне разрабатывал Jev — модель, которая не пишет текст и не генерирует токены последовательно. Она получает любые неструктурированные данные и параллельно
  • Data Portal | DS & ML

    18 Sept, 10:12

    Jev вышел всего несколько дней назад, а NanoJev уже выложил в открытый доступ весь пайплайн. И это не просто обёртка над API: здесь модель для параллельного принятия решений на 0,6 млрд параметров, данные и полный пайплайн обучения.NanoJev буквально раскладывает по полочкам весь подход: "состояние + вопрос → полное распределение вероятностей без декодирования токенов".В основе — всего лишь Qwen3-0.6B. За один проход модель может параллельно обрабатывать сразу несколько состояний и несколько вопросов.Число вариантов динамическое — от 2 до 255. Поддерживаются три типа структурированных решений: Choice, Boolean и Score.В лабиринте 50×50 модель дошла до финиша за 244 шага, столкнувшись 36 раз. В «Змейке» 12×12 съела 27 единиц еды и при этом осталась жива.Модель и данные полностью открыты. Есть всё сразу: обучение, оценка, постоянно работающий сервис инференса и демонстрация со
    GitHubGitHub - TianyuCodings/NanoJev: A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline.A nano replica of Jev: parallel decisions, dynamic candidates, and an end-to-end training pipeline. - TianyuCodings/NanoJev
  • Data Portal | DS & ML

    18 Sept, 08:10

    Небольшое напоминание: вы можете дообучить более 500 моделей с открытым исходным кодом прямо в бесплатном Google Colab.Можно даже загрузить PDF или CSV и превратить их в готовые синтетические датасеты.1. Откройте Google Colab по ссылке. 2. Запустите блоки для установки Unsloth Studio. 3. Выберите модель. 4. Загрузите датасет. 5. Всё готово.После этого модель, конечно же, можно экспортировать.https://github.com/unslothai/unslothhttps://unsloth.ai/docs/new/studio#features