gram news
Аватар канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

@dsproglib

Все самое полезное для дата сайентиста в одном канале. Учиться у нас: clc.to/6qVHgg По рекламе: @proglib_adv Для обратной связи: @proglibrary_feeedback_bot РКН: https://gosuslugi.ru/snet/67a5b03124c8ba6dcaa121c9

ПроектыRUНейросети

18,400подписчиков

Открыть канал

Последние посты

  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    24 сент., 08:09

    🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов.Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    23 сент., 09:41

    RAG vs. Agentic RAG: в чём разница ❔📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
    1,050видео732Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    22 сент., 15:26

    переслано из @mlunderhood

    Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0.Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами.По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
    1,030111Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    22 сент., 10:48

    🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начатьВот набор, который реально закрывает почти все задачи:🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU.🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля.🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами.🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас.🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO
    1,050321Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    21 сент., 12:09

    🎲 Что общего у кубика Рубика и AI? Поиск по пространству состоянийКубик Рубика можно представить как граф:— каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному.У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов.Похожий принцип действительно используется в задачах поиска:🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий.Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей.📍 Навигация: Вакансии • Задачи • Собесы
    981видео21Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    20 сент., 10:00

    переслано из @ds_problems_lib

    Что выведет код?👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None🐸 Библиотека задач по Data Science
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
    96921151Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    19 сент., 11:03

    🌞 3 open-source инструмента для AI-агентов🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных.Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
    1,110видео53Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    18 сент., 15:02

    А вы уже забрали свой подарок ко Дню программиста?К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLSРеклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    18 сент., 12:01

    📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    17 сент., 15:21

    🤗 Fine-tuning LLM в Google Colab — без собственной GPUUnsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab.Что можно сделать:1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат.Подойдёт, чтобы:— попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM.⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета.
    1,400видео93Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    15 сент., 09:49

    🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagationSakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями.В основе:— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах.Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть.Почему интересно:— обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа.
    1,480видео5Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    14 сент., 20:02изменён

    😭 Как не потратить недельный лимит AI-кодинга за три дня?Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.🔘 Поговорим о том:— когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge.✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.⬇️ 17 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    14 сент., 16:10

    🧠 DeepSeek-V4.1-Flash без встроенных ограниченийНа Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.Что заявлено:🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang.Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.📊 Результаты авторских тестов:HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели.
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    14 сент., 12:01

    📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
    1,390811Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    13 сент., 15:01

    🌸 Вселенная намекает: пора уже начать этот курсС 14 сентября цены в Proglib Academy вырастут на 20% 👀Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏📍 Выбрать курс
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    12 сент., 11:02

    ⚡️ Шпаргалка: Bagging vs Boosting👉 BaggingИдея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение.Как работает:✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование)Примеры:✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    12 сент., 10:02

    🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезнымЧто реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.Задавайте всё, что давно хотелось спросить 📍📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    11 сент., 10:18изменён

    🤔 Почему поиск понимает, что один документ релевантнее другого?Например, запрос:python machine learningПочему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.Он учитывает:TF — насколько часто термин встречается в документе;IDF — насколько термин редкий во всей коллекции;длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.Упрощённо:
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
    1,350522Открыть в Telegram
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    10 сент., 09:43

    📊 Всё о непрерывном равномерном распределенииРазбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
  • Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение

    9 сент., 15:05

    🤩 Pixeltable — декларативная инфраструктура данных для AIЕдинственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений.С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД.🤩 Особенности:— Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества системУстановка:pip install pixeltable🔗 Документация и примеры📍 Навигация: Вакансии • Задачи • Собесы
    Иллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучениеИллюстрация к посту канала Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
    1,470221Открыть в Telegram