Последние посты

Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
24 сент., 08:09
🗂 Большой сборник по Data Science и Machine Learning: 150+ практических тем — от основ до готовых проектов.Отдельный блок посвящён MCP: архитектура, tools, resources и prompts, а затем — реальные проекты:🟡 локальный MCP-клиент; 🟡 Agentic RAG; 🟡 финансовый аналитик; 🟡 voice agent; 🟡 Deep Researcher; 🟡 RAG по документам и видео; 🟡 генератор синтетических данных; 🟡 shared memory для Claude Desktop и Cursor.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
23 сент., 09:41
RAG vs. Agentic RAG: в чём разница ❔📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
22 сент., 15:26
переслано из @mlunderhood
Выложили собственную претрейн-модель AliceAI‑Foundation-80B‑A3B‑Base — от обучения с нуля до опенсорса под лицензией Apache 2.0.Это MoE-модель с 80 млрд параметров, из которых при генерации активны около 3 млрд. При обучении не использовались веса сторонних опенсорсных моделей. Весь путь до релиза занял около полугода: за это время команда пересобрала корпус, проверила архитектурные решения и гиперпараметры, а также добавила отдельные данные для рассуждений и взаимодействия с инструментами.По внутренним претрейн-замерам модель обходит более крупные DeepSeek‑V4‑Flash‑Base и Nemotron‑3‑Super‑Base на ряде задач — от фактологических вопросов до математики и кода. На IMO AnswerBench и LiveCodeBench она лидирует среди сравниваемых открытых претрейнов. Предыдущую Alice AI LLM 235B модель также удалось превзойти на нескольких группах задач — при почти втрое меньшем общем и примерно в семь


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
22 сент., 10:48
🔥 Файнтюнинг LLM можно делать на обычной GPU — вот с чего начатьВот набор, который реально закрывает почти все задачи:🔴 Unsloth Ускоряет обучение и заметно снижает требования к памяти. Можно запускать даже в Colab, без мощного GPU.🔴 LLaMA-Factory Универсальный комбайн: десятки моделей, WebUI или CLI, поддержка LoRA/QLoRA/DPO — без необходимости писать код с нуля.🔴 DeepSpeed Если нужно масштабироваться: несколько GPU, кластеры, оптимизация памяти (ZeRO). Используется в продакшене крупными командами.🔴 Axolotl Минимум лишнего: описали конфиг в YAML — получили обученную модель. Один из самых удобных DX сейчас.🔴 TRL Библиотека от Hugging Face для пост-тюнинга: SFT, DPO, PPO, GRPO
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
21 сент., 12:09
🎲 Что общего у кубика Рубика и AI? Поиск по пространству состоянийКубик Рубика можно представить как граф:— каждая конфигурация — вершина; — поворот грани — ребро; — решение — путь от перемешанного состояния к собранному.У кубика 3×3×3 около 43 квинтиллионов возможных конфигураций. При этом любую позицию можно решить максимум за 20 ходов.Похожий принцип действительно используется в задачах поиска:🔴 шахматный движок исследует варианты ходов; 🔴 навигатор — граф дорог; 🔴 AI-агент — возможные последовательности действий.Но LLM работает иначе: она не перебирает все возможные ответы, а генерирует их на основе выученных закономерностей.📍 Навигация: Вакансии • Задачи • Собесы
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
20 сент., 10:00
переслано из @ds_problems_lib
Что выведет код?👍 — {} 👾 — {«x»: 1} 🥰 — Error 🔥 — None🐸 Библиотека задач по Data Science


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
19 сент., 11:03
🌞 3 open-source инструмента для AI-агентов🔘 Agent-Reach — доступ к Twitter/X, YouTube, Reddit и другим источникам. 🔘 Patchright Enhanced— автоматизация браузера и работа с веб-страницами. 🔘 Scrapling — быстрый scraping сайтов и извлечение данных.Их можно использовать как инструменты для агентов, которым нужно найти данные → собрать → обработать → вернуть результат.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
18 сент., 15:02
А вы уже забрали свой подарок ко Дню программиста?К вашему профессиональному празднику Tproger, Proglib, Столото, Центральный университет и SmartApe собрали целую коробку подарков. Переходите по ссылке, трясите коробку и забирайте свой презент: https://tprg.ru/hjLSРеклама. ИП Михайлишина Гузель Фаниловна, erid: 2W5zFJrVGHw
1,100Открыть в Telegram
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
18 сент., 12:01
📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
17 сент., 15:21
🤗 Fine-tuning LLM в Google Colab — без собственной GPUUnsloth Studio позволяет попробовать дообучение open-source моделей прямо в Google Colab.Что можно сделать:1️⃣ Открыть готовый Colab. 2️⃣ Установить Unsloth Studio. 3️⃣ Выбрать модель. 4️⃣ Загрузить датасет — например, CSV или данные из PDF. 5️⃣ Запустить fine-tuning и экспортировать результат.Подойдёт, чтобы:— попробовать LoRA/QLoRA; — адаптировать модель под свой формат данных; — собрать небольшой synthetic dataset; — разобраться с процессом дообучения LLM.⚠️ Бесплатный Colab имеет ограничения по GPU, памяти и времени сессии. А качество результата зависит не только от модели, но и от подготовки датасета.
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
15 сент., 09:49
🔥 Sakana AI обучила нейросеть глубиной 1000 слоёв без backpropagationSakana AI представила PC-ALM — метод, который распространяет ошибку не через глобальный обратный проход, а с помощью локальных взаимодействий между соседними слоями.В основе:— predictive coding; — локальные ошибки; — множители Лагранжа; — PI-регуляция.🤩 Главный результат: PC-ALM обучает residual MLP глубиной до 1000 слоёв, почти достигая качества backpropagation на простых задачах.Метод помогает решить проблему predictive coding: в глубоких узких сетях сигнал ошибки быстро затухает. Дополнительные переменные позволяют передавать его через всю сеть.Почему интересно:— обучение остаётся локальным; — подход ближе к идеям NeuroAI; — потенциально полезен для нейроморфного железа.
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
14 сент., 20:02изменён
😭 Как не потратить недельный лимит AI-кодинга за три дня?Разберём на вебинаре, как тратить меньше на AI-агентов — без потери качества кода.🔘 Поговорим о том:— когда дорогая модель действительно нужна, а когда хватит дешёвой; — сколько стоит один прогон и куда уходят токены; — какие задачи можно отдавать субагентам; — как настроить маршрутизацию моделей; — что проверять в AI-коде перед merge.✏️ Покажем всё на конкретных цифрах и вживую: сравним расходы до и после.⬇️ 17 сентября, 19:00 МСК ⬇️ 1,5 часа · бесплатно ⬇️ Арсений Харланов и Олег Лайок💬 Пишите в комментариях, где упираетесь в лимиты и на что уходят деньги. Самые залайканные вопросы


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
14 сент., 16:10
🧠 DeepSeek-V4.1-Flash без встроенных ограниченийНа Hugging Face появился модифицированный чекпойнт DeepSeek-V4.1-Flash-UNCENSORED-FP8 от dealignai.Что заявлено:🔘 MoE-модель на 552B параметров; 🔘 8B–16B активных параметров на токен; 🔘 FP8/FP4-квантизация; 🔘 контекст до 1 млн токенов; 🔘 поддержка изображений, инструментов и reasoning; 🔘 запуск через SGLang.Авторы удалили защитные механизмы на уровне весов — без runtime-хуков и дополнительных обёрток.📊 Результаты авторских тестов:HarmBench: 100% ASR; MMLU: 82,74% против 86,96% у базовой модели.


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
14 сент., 12:01
📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
13 сент., 15:01
🌸 Вселенная намекает: пора уже начать этот курсС 14 сентября цены в Proglib Academy вырастут на 20% 👀Так что если курс давно ждёт своего часа — лучше не откладывать ещё на месяц 😏📍 Выбрать курс


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
12 сент., 11:02
⚡️ Шпаргалка: Bagging vs Boosting👉 BaggingИдея: несколько независимых моделей → усреднение. Цель: снизить дисперсию (variance) и уменьшить переобучение.Как работает:✳️ делаем много бутстрап-выборок ✳️ обучаем модели параллельно ✳️ объединяем результаты (среднее/голосование)Примеры:✳️ RandomForestClassifier ✳️ RandomForestRegressor ✳️ BaggingClassifier ✳️ BaggingRegressor


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
12 сент., 10:02
🌞 Готовим вебинар про AI в разработке и хотим сделать его максимально полезнымЧто реально хочется разобрать? Где чаще всего застреваете? Что пробовали, но так и не получилось нормально внедрить?🤩 Пишите вопросы в комментариях — самые залайканные разберём на вебинаре в первую очередь.Задавайте всё, что давно хотелось спросить 📍📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста
Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
11 сент., 10:18изменён
🤔 Почему поиск понимает, что один документ релевантнее другого?Например, запрос:python machine learningПочему документ, где эти слова встречаются несколько раз, не обязательно будет выше документа, где они встречаются реже?🔤 Здесь появляется BM25 — классический алгоритм ранжирования текстовых документов.Он учитывает:TF — насколько часто термин встречается в документе;IDF — насколько термин редкий во всей коллекции;длину документа — чтобы длинные тексты не получали преимущество просто из-за количества слов.Упрощённо:


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
10 сент., 09:43
📊 Всё о непрерывном равномерном распределенииРазбираетесь в теории вероятностей или только планируете подступиться? Эта шпаргалка разложит базовое, но невероятно важное непрерывное равномерное распределение по полочкам.📍 Навигация: Вакансии • Задачи • Собесы🐸 Библиотека дата-сайентиста


Библиотека дата-сайентиста | Data Science, Machine learning, анализ данных, машинное обучение
9 сент., 15:05
🤩 Pixeltable — декларативная инфраструктура данных для AIЕдинственная open-source Python-библиотека, которая упрощает работу с данными для мультимодальных AI-приложений.С Pixeltable вы можете хранить, трансформировать, индексировать, извлекать и оркестрировать данные с помощью единого интерфейса таблицы, без необходимости в сложной архитектуре с базами, файлами и векторными БД.🤩 Особенности:— Поддержка мультимодальных данных: изображения, видео, документы — Инкрементальное хранение и трансформация данных — Простая декларативная работа вместо множества системУстановка:pip install pixeltable🔗 Документация и примеры📍 Навигация: Вакансии • Задачи • Собесы

