gram news
DL in NLP channel avatar

DL in NLP

@dlinnlp

Новости и обзоры статей на тему обработки естественного языка, нейросетей и всего такого. Связь: @dropout05 (рекламы нет)

ProjectsRUAI

11,612subscribers

Open the Channel

Latest posts

  • DL in NLP

    21 Feb 2025, 19:52edited

    https://www.youtube.com/watch?v=uVcBa6NXAbkhttps://www.1x.tech/discover/introducing-neo-gamma
    YouTubeIntroducing NEO Gamma | Another Step Closer to HomeNEO Gamma is the next generation of home humanoids designed and engineered by 1X Technologies. The Gamma series includes improvements across NEO’s hardware and AI, featuring a new design that is deeply considerate of life at home. The future of Home Humanoids…
    13,300301351Open in Telegram
  • DL in NLP

    27 Jan 2025, 21:38

    forwarded from @gonzo_ml

    В продолжение темы, Jay Alammar, у которого были прекрасные визуальные объяснения про работу трансформера, в сто раз лучшие оригинальной статьи, выпустил только что иллюстрированный DeepSeek-R1https://newsletter.languagemodels.co/p/the-illustrated-deepseek-r1
    newsletter.languagemodels.coThe Illustrated DeepSeek-R1A recipe for reasoning LLMs
    13,600841Open in Telegram
  • DL in NLP

    23 Jan 2025, 21:40edited

    Всем приветики. Давно не было постов, тк становится всё сложнее вести канал. Не буду обещать что исправлюсь, но буду постить когда есть что-то о чём другие каналы не говорят достаточно.И сегодня будут не новости (о ChatGPT Operator можете прочитать где угодно), а открытая позиция на PhD студента в моей старой лабе в UMass Lowell - Text Machine Lab.Это NLPшная позиция с довольно широким спектром того чем можно заниматься: от interpretability и prompting до alignment, мультимодальных моделей, low-rank training, PEFT итд. Глава лабы - Prof. Anna Rumshisky исследователь в UMass Lowell, MIT и в Amazon Alexa AI/Amazon AGI. Например, она один из авторов Amazon NovaТребования: релевантный бакалавриат+магристратура/специалитет, хорошее понимание линейной алгебры, анализа, вероятности, базовые знания Deep Learning и NLP. Большим плюсом будут опубликованные статьи (включая воркшопы), но
    Image from a post by DL in NLPImage from a post by DL in NLP
    18,30066201511Open in Telegram
  • DL in NLP

    23 Nov 2024, 23:16

    Programming Massively Parallel Processors https://a.co/d/6QEiuCqНаткнулся на книгу которая кажется весьма известна в мире GPU-программирования. Она довольно детально погружается в Nvidia GPU и CUDA. В четвертом издании (2022 года) ещё и добавили современные архитектуры: Ampere (A100) и Hopper (H100). Это важно тк архитектуры довольно сильно изменились с 2016 года.Очень надеюсь просмотреть хотя бы по-диагонали и найти что-то полезное для себя, но вообще выглядит что если хотите низкоуровнево прогать на GPU это must read.Если погуглить четвертое издание то можно найти и более бесплатные альтернативы амазону
    14,200591Open in Telegram
  • DL in NLP

    10 Oct 2024, 18:51

    Но дадут ли нобелевку по литературе за Deep Learning Book
    16,9001159717521Open in Telegram
  • DL in NLP

    8 Oct 2024, 16:08

    Почему не стоит верить nvidia-smi “GPU utilization” arthurchiao.github.io/blog/understanding-gpu-performance/Nvidia использует очень особый способ определения утилизации GPU. 100% означают не что девайс загружен на 100%, а что хотя бы одно ядро было использовано хотя бы чуть-чуть 100% времени за последние N (мили)секундОчень яркий пример это примитивы синхронизации: когда вы вызываете torch.barrier GPU Utilization становится 100% при том что на самом деле железо просто «активно ждет».Для реальной оценки загруженности GPU лучше использовать SM Occupancy которая показывает средний процент загрузки ядер GPU (то что я бы изначально ожидал увидеть от utilization честно говоря).Для этого рекомендуют использовать dcgm-exporter
    GitHubml-engineering/compute/accelerator/nvidia/debug.md at master · stas00/ml-engineeringMachine Learning Engineering Open Book. Contribute to stas00/ml-engineering development by creating an account on GitHub.
    20,700832211311Open in Telegram
  • DL in NLP

    2 Oct 2024, 16:46edited

    Soumith Chintala (создатель pytorch) выдаёт базу о том как тренироваться на 10К GPU x.com/soumithchintala/status/1841498799652708712Оч короткий TL;DR (всем рекомендую прочитать оригинал, он не длинный)1. Maximize batch size and GPU utilization: 3D parallelism + gradient checkpointing 1. Overlap communication, e.g. while N-1th layer is computing backward, all GPUs with an Nth layer can all-reduce 1. Optimize for your GPU cluster network topology1. Failure recovery, at 10k GPU scale, things fail all the time -- GPUs, NICs, cables, etc 1. At 10K scale bit flips actually become a problem and can cause loss explosions. Save your model state as frequently and as quickly as you can. To speed it up save it in shards and to CPU memory first and then in a seaprate thread write to disk
    13,700372091Open in Telegram
  • DL in NLP

    25 Sept 2024, 08:09

    O1 mini inference scaling experimentsПрикольное саммари экспериментов одного чела. Коротко: если убедить модель дольше думать (что пока что непросто) pass@1 реально будет расти лог-линейно. При этом это скорее всего не majority voting или self consistency тк эти методы упираются в потолок
    13,3002822Open in Telegram
  • DL in NLP

    25 Sept 2024, 08:09

    https://x.com/hughbzhang/status/1838288923656941860?s=12&t=QgBLS4SmhE8cqdYBmhrqJA
    X (formerly Twitter)Hugh Zhang (@hughbzhang) on XOpenAI recently released the o1 family of models and a graph showing scaling laws for test-time compute — sadly without the x-axis labeled. Using only the public o1-mini API, I tried to reconstruct the graph as closely as possible. Original on left, my best…
  • DL in NLP

    17 Sept 2024, 03:42edited

    OpenDuck - очень классный проект по опенсорсной (хард+софт) реимплементации диснеевского роботаhttps://github.com/apirrone/Open_Duck_MiniОчень мило. Буду следить за ними. А вот тут они уже умеют стоять: https://x.com/antoinepirrone/status/1835679313506562502
    GitHubGitHub - apirrone/Open_Duck_Mini: Making a mini version of the BDX droid. https://discord.gg/UtJZsgfQGeMaking a mini version of the BDX droid. https://discord.gg/UtJZsgfQGe - apirrone/Open_Duck_Mini
    13,9001763Open in Telegram
  • DL in NLP

    14 Sept 2024, 18:21

    forwarded from @ai_newz

    Наткнулся в Твиттере на шикарную визуализацию LLM. Как выяснилось, ей уже целый год, но для новичков это все ещё полезная штука.Кроме красивой 3D-модельки, здесь еще подробный гайд по работе каждого элемента, как говорит автор, до каждого "сложить и умножить".По архитектурам там есть GPT-2, nanoGPT, GPT-2 XL, ну и GPT-3.Ссылочка на визуализацию@ai_newz
    9,520video74231433Open in Telegram
  • DL in NLP

    12 Sept 2024, 17:29edited

    🍓 openai.com/index/learning-to-reason-with-llms1. GPT-o1 это затюненая с помощью RL модель на улучшение reasoning (деталей как это сделано, конечно же нет) 1. Scaling c train-time compute (как долго делать RL) и test-time compute (как долго генерировать ответ) -- на текущих графиках никакого намёка на то чтобы модель выходила на плато 🔥 1. По сравнению с 4o на codeforces o1 получает 89 перцентиль вместо 11 1. В PhD-level GPTQA Diamond по физике pass@1 улучшили с 60% до 93% 1. По human preferences люди предпочитают o1 в 60% случаев в проге, и 70% в математикеЖдём когда будет доступно в chatgpt и API публично
    Image from a post by DL in NLPImage from a post by DL in NLP
    10,200721261Open in Telegram
  • DL in NLP

    7 Sept 2024, 21:50edited

    И ещё немного новостей о NEO. Собрал всё в батч чтобы не получилось так что канал всё время пишет о 1Х1. Эпизод S3 где мы больше показываем что мы уже умеем и куда движемся: тык 1. Follow-up эпизод где мы деплоим Neo домой к Джейсону: тык 1. Часовое интервью с Бернтом. Больше технических деталей и больше о нашей стратегии. Кстати Бернт реально неплохо разбирается во всём техническом стаке компании. Он сам сделал наши моторы, периодически помогает с сервисом роботов когда нужны дополнительные руки. Оч советую: тык1. Заметка Scott Walter об устройстве рук Neo и Оптимуса: тык 1. Подаст First Principles с Эриком, нашим VP of AI: тыкМы работали над тем чтобы наконец-то показать Neo очень много, включая итерации над железом, controls, RL, остальным AI, и в конце-концов съемками чтобы получить perfect shot. Иногда по 15+ часов в день и без выходных (добро пожаловать в work-life balance
    12,100video6918121Open in Telegram
  • DL in NLP

    30 Aug 2024, 17:41edited

    Introducing NEO Beta youtube.com/watch?v=bUrLuUxv9gEМы (1X Technologies) наконец-то показали нашего нового робота публично! Neo это наше второе (и на данный момент уже основное) поколение роботов. В отличие от Eve у Neo пять пальцев и две ноги, что позволяет решать гораздо больше задач. В отличие от других гуманоидных роботов Neo может безопасно находиться радом с людьми из-за compliant моторов, при этом он всё ещё обладает довольно большой силой, сопостовимой с другими гуманоидами (и может быть даже превосходящей некоторых). Надеюсь в ближайшее время мы пошерим больше деталей о том что уже сейчас может Neo.(Продолжаю орать с комментариев о том что это человек в костюме, разработчики железа воспринимают это как комплемент пхпх)
    YouTubeIntroducing NEO Beta | A Humanoid Robot for the Home#1X #humanoid #neo We are excited to introduce NEO Beta–the pre-production build of our home humanoid. About 1X: 1X is an AI robotics company that develops safe, intelligent humanoid robots designed to work alongside humans. Founded in 2014, 1X is headquartered…
    38,00095126543Open in Telegram
  • DL in NLP

    28 Aug 2024, 18:48

    LeRobotDataset huggingface.co/blog/video-encodingHuggingFace потихоньку погружается в робототехнику и вчера они представили свой формат данных и даталоадер для рободанных.В чём проблема? Большая часть рободанных это видео + syncronized time series. Видео это наибольшая проблема. Если хранить их в том же сжатом формате что мы обычно используем для просмотра, то чтение рандомных кадров будет очень медленным. Если хранить их в разжатом формате, то 1) занимает много места 2) очень нагружает ваш диск / сеть во врема чтения и легко упереться в лимиты железаHF поглядели на ffmpeg, подкрутили настройки, и нашли отличный баланс между сжатием и скоростью чтения рандомных кадров. Обернули это в LeRobot и описали в блогпосте. Оч советую
    Image from a post by DL in NLPImage from a post by DL in NLP
    12,6004817111Open in Telegram
  • DL in NLP

    27 Aug 2024, 15:34edited

    Антропик опубликовали систем промты Claudehttps://docs.anthropic.com/en/release-notes/system-promptsЯ до сих пор не перестаю удивляться насколько сильно длина систем промта выросла и что в отличие от LLM предыдущего поколения (GPT3, OPT, BLOOM) промты стали выглядеть совсем как обычный текст который ты описываешь как будто общаешься с человеком.Немного поорал с багфиксов «If Claude cannot or will not perform a task, it tells the user this without apologizing to them» и «Claude responds directly to all human messages without unnecessary affirmations or filler phrases like “Certainly!”, “Of course!”, “Absolutely!”, “Great!”, “Sure!”, etc»
    Claude Platform DocsSystem promptsSee updates to the core system prompts on [claude.ai](https://claude.ai) and the [Claude iOS app](https://anthropic.com/ios) and [Claude Android app](https://anthropic.com/android).
    12,0005710431Open in Telegram
  • DL in NLP

    26 Aug 2024, 17:02

    forwarded from @ai_newz

    Внимание! Hugging Face представляет конструктор «Собери сам роборуку и обучи ее»Вкомплект входит: - Конструктор «Собери сам» — роборука с ссылками для заказа запчастей ~ $300 (опционально есть еще вторая за $250) + файлы для принтера. Гайды по: - Cборке и калибровке. - Записи собственного датасета на камеру телефона. - Тренировке нейросетей для управления рукой.Прикольная инициатива, ребята надеются максимально помочь начинающим в надежде привлечь больше рук (кожаных, а не робо-) в опен-сорс, что, в общем-то, шикарно!Расходники вышли дороговатыми, но это уже не $108K за домашнего робогуманоида + скоро обещают выпустить новую версию, говорят уложились в $150 за обе руки.Чел научил две роборуки складывать футболки на 100 примерах за одну ночь тренировки. Здесь для обучения используется способ, похожий на тот, что я описывал в посте про живую сталь. Там можно почитать подробнее.Хо
    8,140video301042Open in Telegram
  • DL in NLP

    18 Jul 2024, 16:17

    forwarded from @ai_newz

    Не прошло и недели, а у Mistral новый релиз!Новую "малую" модель NeMo тренировали совместно с Nvidia. У неё 12 миллиардов параметров, 128k контекста, инференс в fp8 без потери в качестве, сделана так, чтобы влезала в 4090.NeMo - нативно мультиязычная модель, тренировали в том числе на русском, немецком, японском, китайском. И тут она конкурентов и в хвост, и в гриву. Обновили и токенизатор - он теперь на 36% эффективнее для русского, на 11% для английского, а на некоторых языках прирост по эффективности в 3-4 раза. Интересно, в токенах найдутся пасхалки?С бенчами опять шалят: сравнивают только базовые модели, а бенчи для Instruct версий публикуют только специализированные, не общие.Заметьте, как "малые" модельки растут в размере: 7B превратилось в 8, потом в 9, а сейчас уже 12Веса Блог@ai_newz
    Image from a post by DL in NLPImage from a post by DL in NLPImage from a post by DL in NLP
    11,600181211Open in Telegram
  • DL in NLP

    12 Jul 2024, 02:51

    FlashAttention-3 📸Блог и статья: tridao.me/blog/2024/flash3/ Код: github.com/Dao-AILab/flash-attention1.5-2.0 раза быстрее чем FlashAttention 2 в FP16, почти в 3 раза быстрее в FP8Flash 2 был оптимизирован под А100 и достигал 70% теоретических max flops, Flash 3 оптимизирован под H100 и достигает 75%. Для этого активно использовали библиотеку NVIDIA CUTLASS которая почти напрямую общается с железом и позволяет использовать хитрые фичи H100. Например использовать специальное железо (Tensor Memory Accelerator) для копирования тензоров между global и shared memory и Warpgroup Matrix Multiply-Accumulate (который я так и не понял что такое, но как-то связан с тензорными ядрами)Сверху этого переписали код чтобы матричное умножение вычислялось (на tensor cores) параллельно с softmax (на multi-function unit) и сделали пару хаков чтобы FP8 давал более точные результатыВыглядит очень
    Image from a post by DL in NLPImage from a post by DL in NLP
    11,3003373Open in Telegram
  • DL in NLP

    20 Jun 2024, 21:05

    Image from a post by DL in NLPImage from a post by DL in NLP
    11,800127181Open in Telegram