gram news
grokaem себя channel avatar

grokaem себя

@grokaem_seby

A bunch of things that I encounter during my journey as NLP/Audio developer

ProjectsRUProgramming

2,720subscribers

Open the Channel

Latest posts

  • grokaem себя

    31 Aug, 16:32

    Картина ясная: живой server.py ровно один — 2562834, это .-сервер из диагностического прогона (31 минута, совпадает с .log от 11:56). Он держит 47110. Все остальные — осиротевшие обёртки ☠️.sh, чьи python-дети уже умерли ☠️; .-сервер, который ты подняла в 12:03 (), своего server.py в списке не имеет — он не смог занять порт и отвалился. Обучения среди процессов нет, всё это сегодняшние серверы. Убивай всё: ☠️Перейти на русский с Клауд не было ошибкой
    795281Open in Telegram
  • grokaem себя

    21 Aug, 11:37

    Как люди с дисклексией читают все эти тексты от клода?
    1,520273Open in Telegram
  • grokaem себя

    21 Aug, 09:26

    Не помню, рекомендовала ли вам этот прекрасный трекер, который я юзаю уже пару лет.Toggl. Есть и приложение, и веб версия.Он абсолютно бесплатный и дает возможность понять, сколько времени у вас уходит на проекты.Предполагаю, что это лучший вариант для фрилансеров, но мне нравится как он позволяет поймать себя на мысли, что я не так уж и много времени потратила или наоборот уж слишком долго делаю один и тот же проект….
    Image from a post by grokaem себяImage from a post by grokaem себяImage from a post by grokaem себя
    1,620299Open in Telegram
  • grokaem себя

    16 Aug, 11:39

    Не знаю, старею ли я, но мне очень нравятся email рассылки. Я нахожу их более полезными, чем посты, они ощущаются чуть более официальными и менее громоздкими, чем лонгриды.Я вам уже советовала Paperzilla, от них я получаю подборку статей.Недавно нашла Voice AI Space. Как и многие, они публикуют новости стартапов как в Европе, так и в США. Кроме того, у них есть маленькие roundups, если вам интересно, кто сколько поднял в раундах. Также интересно читать короткие интервью с людьми из voice ai, например, с Сардором. На сайте также есть подборки вакансий, митапы и видеопрезентации с этих встреч.Такие подборки мне упрощают жизнь и не приходится пробираться через дебри Твиттера и линкедина
    Image from a post by grokaem себяImage from a post by grokaem себя
    1,710221Open in Telegram
  • grokaem себя

    21 Jul, 18:01

    Готовлю письмо для compliance, чтобы я могла законно писать здесь про tts. Мне конечно приятно, что имя техножрицы тут же выпадает, но я не такая крутая)))Вот так и путает он людей.
    Image from a post by grokaem себяImage from a post by grokaem себя
    1,960337Open in Telegram
  • grokaem себя

    18 Jul, 16:59

  • grokaem себя

    18 Jul, 16:39

    Илья и Илья сделали хороший корпус русской речи на 20 часов. Диалоги актеров, правильно выставленные микрофоны, сделаны лейблы эмоций. Ребята большие молодцы! К сожалению, в опенсорсе мало датасетов такого качества, а часто для тренировки лучше меньше, но качественно. Отмечу, что диалоги все таки были scripted, имейте это в виду под свои задачи.Датасет Посты Ильи и Ильи (1, 2)
    huggingface.colangswap/dialogs-ru-emotional-conversations · Datasets at Hugging FaceWe’re on a journey to advance and democratize artificial intelligence through open source and open science.
    1,8501521Open in Telegram
  • grokaem себя

    14 Jul, 11:29

    Одна из фичей iOS, которую я очень люблю - рандомные фотографии из пленки. Иногда я даже забываю, что делала эти фотографии сама.
    Image from a post by grokaem себяImage from a post by grokaem себяImage from a post by grokaem себяImage from a post by grokaem себя
    1,770261471Open in Telegram
  • grokaem себя

    13 Jul, 08:15

    Впервые за весь мой путь в образовании я взяла отпуск, чтобы подготовиться к экзаменам. Причина — я слишком долго ставила работу выше учёбы (как и всегда), поэтому чувствовала, что не особо готова к последним экзаменам.В этом семестре я сдаю Parsing, Machine Translation, Reinforcement Learning и делаю проект по TTS. Первые два кажутся мне ужасно скучными и неинтересными, но это плата за мою ошибку с бюрократией.Мысль о том, как я буду рада больше не сдавать экзамены, греет мне душу, а старый девиз «просто надо» как-то помогает продолжать. Ну и мысль наконец-то вернуться к только коду звучит как награда.
    1,700video4923Open in Telegram
  • grokaem себя

    10 Jul, 12:20

    Если вы занимаетесь TTS, что вы бы добавили в смесь RL + TTS?
  • grokaem себя

    7 Jul, 10:39

    Бонус - TTS latency benchmark на разных GPUhttps://gigagpu.com/tts-latency-benchmarks/
    Image from a post by grokaem себяImage from a post by grokaem себя
  • grokaem себя

    7 Jul, 10:37

    В большинстве своем при поиске latency метрик мы находим общую latency = написал текст/сказал текст и получил аудио обратно. Однако за этим стоит не только большая доля инженерии, но и модули модели. Метрики, которые мы здесь рассмотрим:• FTL - first packet latency • TPP - first packet decode • DEC - mean packet decode • FPL - first packet latency • RTFx - audio_duration / processing time - общий throughput пайплайнаЧаще всего работаем с пайплайном: текст -> LM based TTS - - - > audio codebook tokens - - - -> Codebook based VocoderFTL - это путь от текста к первому audio codebook token. Это может быть как и один токен, который генерит большая модель, так и sequence токенов, которые генерит какой-то depth transformer, а может быть вообще multi-token generation от главной модели. Так или иначе на выходе только дискретный токен / латентный вектор.На эту метрику влияют кроме всех
    1,84041Open in Telegram
  • grokaem себя

    3 Jul, 11:29

    Мне кажется, или по гитхабу ходят какие-то агенты? Я хз как объяснить, что кто-то попытался заюзать нашего бота 20го года
    Image from a post by grokaem себяImage from a post by grokaem себя
    1,840531Open in Telegram
  • grokaem себя

    28 Jun, 04:55

    Original post by eleven labs hrМне кажется, я так ищу друзей если честно))
    Image from a post by grokaem себяImage from a post by grokaem себя
    2,50026113Open in Telegram
  • grokaem себя

    25 Jun, 19:14

    Путь девушки с Phd в openai. Интересные заметки https://alisawuffles.github.io/blog/job-search/#appendix-learning-resourcesЕе же заметки с LLM, краткие и емкие, но их не получится использовать как книгу (inference, post-training, accounting). Отлично использовать как прогон для вопросов.Ее же заметки по математикеЧто мне откликнулось в ее рассказе: Studying carried enormous side benefits for me. Having a wider breadth of knowledge directly improved my confidence as a researcher. I became more secure in conversations because I was less worried about gaps in my knowledge being exposed, and no longer felt compelled to hide them when they came up.I also tailored my research pitch depending on the role; interviewers are tired, so hitting the right keywords makes it easier for them to believe that your profile is relevant.Practice interviews are helpful, but also recognize that your
    alisawuffles.github.ioNotes on the Industry Job Search
    2,5102972Open in Telegram
  • grokaem себя

    19 Jun, 20:00edited

    Genuine question: везде как один из use case voice ai вижу телефонию и холодные звонки. Неужто кто-то действительно отвечает на звонки в наше время?Мне вообще никто никогда не звонит, даже какие-то приемы врачей-услуг проходят в сообщениях. Это мой bubble такой или это действительно старый костыль? Если нет, какие у вас истории таких звонков?
    2,360121Open in Telegram
  • grokaem себя

    13 Jun, 07:17

    Zyphra Zonos2Blog: http://zyphra.com/our-work/zonos2 тут и аудио примеры Weights: http://huggingface.co/Zyphra/ZONOS2 Inference code: http://github.com/Zyphra/ZONOS2Сразу ответ на самый популярный вопрос - русский язык есть.Про изменения в архитектуре: • no phonemes, raw utf-8 • две модели, stable and expressive. Появились они из наблюдения о wer и voice cloning: we observe that most TTS models score substantially lower than the ‘natural’ error rate of the evaluating ASR model vs the actual ground truth text. Авторы считают, что идеальный voice cloning не может быть без потери wer если audio prompt без с шумом и не самым четким произношением. Наверное, я могу отчасти согласиться. Да, это крутая идея разделить этот баланс между идеальным voice clone и наоборот очищенным промтом и идеальным wer. Однако здесь мне кажется не задаются вопросом о том, как считается wer. Те же
    2,680video7Open in Telegram
  • grokaem себя

    11 Jun, 17:16

    MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis https://arxiv.org/abs/2603.12342 https://mamtratts.github.io/ - audio samplesПроблема LM based TTS в очень многих вещах начиная от дискретных codec, заканчивая большим компьютом. И хотя многие стараются улучшить инференс таких моделей более инженерными модными молодежными штуками из мира LLM (GQA, speculative decoding, sparse attention), latency и rtf сделать меньше от этого не особо получается.Один из вариантов, который предлагает общество, это отказаться от причины проблемы и попробовать другие архитектуры. Например, mamba - это как rnn только круче.Тут про mamba с картинкамиАвторы этой статьи говорят, что тренировать mamba based сложно и долго, поэтому они попробовали перенести часть слоев от attention в mamba. Для этого они использовали linear mapping. Единственный момент, который не получается также легко
    arXiv.orgMamTra: A Hybrid Mamba-Transformer Backbone for Speech SynthesisDespite the remarkable quality of LLM-based text-to-speech systems, their reliance on autoregressive Transformers leads to quadratic computational complexity, which severely limits practical...
  • grokaem себя

    5 Jun, 07:54

    Веду notion с 2021 и я хз когда я это писала и откуда я это слышала, но сейчас третий пункт hits hard
    Image from a post by grokaem себяImage from a post by grokaem себя
    1,840292Open in Telegram
  • grokaem себя

    3 Jun, 13:38

    Стадия - прыгать от одного интересного занятия к другому и пока делаешь его думать ох вот бы щас другое поделать
    2,02933114Open in Telegram