gram news
Аватар канала grokaem себя

grokaem себя

@grokaem_seby

A bunch of things that I encounter during my journey as NLP/Audio developer

2,720подписчиков

Открыть канал

Последние посты

  • grokaem себя

    31 авг., 16:32

    Картина ясная: живой server.py ровно один — 2562834, это .-сервер из диагностического прогона (31 минута, совпадает с .log от 11:56). Он держит 47110. Все остальные — осиротевшие обёртки ☠️.sh, чьи python-дети уже умерли ☠️; .-сервер, который ты подняла в 12:03 (), своего server.py в списке не имеет — он не смог занять порт и отвалился. Обучения среди процессов нет, всё это сегодняшние серверы. Убивай всё: ☠️Перейти на русский с Клауд не было ошибкой
  • grokaem себя

    21 авг., 11:37

    Как люди с дисклексией читают все эти тексты от клода?
  • grokaem себя

    21 авг., 09:26

    Не помню, рекомендовала ли вам этот прекрасный трекер, который я юзаю уже пару лет.Toggl. Есть и приложение, и веб версия.Он абсолютно бесплатный и дает возможность понять, сколько времени у вас уходит на проекты.Предполагаю, что это лучший вариант для фрилансеров, но мне нравится как он позволяет поймать себя на мысли, что я не так уж и много времени потратила или наоборот уж слишком долго делаю один и тот же проект….
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
  • grokaem себя

    16 авг., 11:39

    Не знаю, старею ли я, но мне очень нравятся email рассылки. Я нахожу их более полезными, чем посты, они ощущаются чуть более официальными и менее громоздкими, чем лонгриды.Я вам уже советовала Paperzilla, от них я получаю подборку статей.Недавно нашла Voice AI Space. Как и многие, они публикуют новости стартапов как в Европе, так и в США. Кроме того, у них есть маленькие roundups, если вам интересно, кто сколько поднял в раундах. Также интересно читать короткие интервью с людьми из voice ai, например, с Сардором. На сайте также есть подборки вакансий, митапы и видеопрезентации с этих встреч.Такие подборки мне упрощают жизнь и не приходится пробираться через дебри Твиттера и линкедина
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
  • grokaem себя

    21 июл., 18:01

    Готовлю письмо для compliance, чтобы я могла законно писать здесь про tts. Мне конечно приятно, что имя техножрицы тут же выпадает, но я не такая крутая)))Вот так и путает он людей.
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
  • grokaem себя

    18 июл., 16:59

  • grokaem себя

    18 июл., 16:39

    Илья и Илья сделали хороший корпус русской речи на 20 часов. Диалоги актеров, правильно выставленные микрофоны, сделаны лейблы эмоций. Ребята большие молодцы! К сожалению, в опенсорсе мало датасетов такого качества, а часто для тренировки лучше меньше, но качественно. Отмечу, что диалоги все таки были scripted, имейте это в виду под свои задачи.Датасет Посты Ильи и Ильи (1, 2)
    huggingface.colangswap/dialogs-ru-emotional-conversations · Datasets at Hugging FaceWe’re on a journey to advance and democratize artificial intelligence through open source and open science.
    1,8501521Открыть в Telegram
  • grokaem себя

    14 июл., 11:29

    Одна из фичей iOS, которую я очень люблю - рандомные фотографии из пленки. Иногда я даже забываю, что делала эти фотографии сама.
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
    1,770261471Открыть в Telegram
  • grokaem себя

    13 июл., 08:15

    Впервые за весь мой путь в образовании я взяла отпуск, чтобы подготовиться к экзаменам. Причина — я слишком долго ставила работу выше учёбы (как и всегда), поэтому чувствовала, что не особо готова к последним экзаменам.В этом семестре я сдаю Parsing, Machine Translation, Reinforcement Learning и делаю проект по TTS. Первые два кажутся мне ужасно скучными и неинтересными, но это плата за мою ошибку с бюрократией.Мысль о том, как я буду рада больше не сдавать экзамены, греет мне душу, а старый девиз «просто надо» как-то помогает продолжать. Ну и мысль наконец-то вернуться к только коду звучит как награда.
    1,700видео4923Открыть в Telegram
  • grokaem себя

    10 июл., 12:20

    Если вы занимаетесь TTS, что вы бы добавили в смесь RL + TTS?
  • grokaem себя

    7 июл., 10:39

    Бонус - TTS latency benchmark на разных GPUhttps://gigagpu.com/tts-latency-benchmarks/
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
  • grokaem себя

    7 июл., 10:37

    В большинстве своем при поиске latency метрик мы находим общую latency = написал текст/сказал текст и получил аудио обратно. Однако за этим стоит не только большая доля инженерии, но и модули модели. Метрики, которые мы здесь рассмотрим:• FTL - first packet latency • TPP - first packet decode • DEC - mean packet decode • FPL - first packet latency • RTFx - audio_duration / processing time - общий throughput пайплайнаЧаще всего работаем с пайплайном: текст -> LM based TTS - - - > audio codebook tokens - - - -> Codebook based VocoderFTL - это путь от текста к первому audio codebook token. Это может быть как и один токен, который генерит большая модель, так и sequence токенов, которые генерит какой-то depth transformer, а может быть вообще multi-token generation от главной модели. Так или иначе на выходе только дискретный токен / латентный вектор.На эту метрику влияют кроме всех
  • grokaem себя

    3 июл., 11:29

    Мне кажется, или по гитхабу ходят какие-то агенты? Я хз как объяснить, что кто-то попытался заюзать нашего бота 20го года
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
    1,840531Открыть в Telegram
  • grokaem себя

    28 июн., 04:55

    Original post by eleven labs hrМне кажется, я так ищу друзей если честно))
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
    2,50026113Открыть в Telegram
  • grokaem себя

    25 июн., 19:14

    Путь девушки с Phd в openai. Интересные заметки https://alisawuffles.github.io/blog/job-search/#appendix-learning-resourcesЕе же заметки с LLM, краткие и емкие, но их не получится использовать как книгу (inference, post-training, accounting). Отлично использовать как прогон для вопросов.Ее же заметки по математикеЧто мне откликнулось в ее рассказе: Studying carried enormous side benefits for me. Having a wider breadth of knowledge directly improved my confidence as a researcher. I became more secure in conversations because I was less worried about gaps in my knowledge being exposed, and no longer felt compelled to hide them when they came up.I also tailored my research pitch depending on the role; interviewers are tired, so hitting the right keywords makes it easier for them to believe that your profile is relevant.Practice interviews are helpful, but also recognize that your
    alisawuffles.github.ioNotes on the Industry Job Search
    2,5102972Открыть в Telegram
  • grokaem себя

    19 июн., 20:00изменён

    Genuine question: везде как один из use case voice ai вижу телефонию и холодные звонки. Неужто кто-то действительно отвечает на звонки в наше время?Мне вообще никто никогда не звонит, даже какие-то приемы врачей-услуг проходят в сообщениях. Это мой bubble такой или это действительно старый костыль? Если нет, какие у вас истории таких звонков?
  • grokaem себя

    13 июн., 07:17

    Zyphra Zonos2Blog: http://zyphra.com/our-work/zonos2 тут и аудио примеры Weights: http://huggingface.co/Zyphra/ZONOS2 Inference code: http://github.com/Zyphra/ZONOS2Сразу ответ на самый популярный вопрос - русский язык есть.Про изменения в архитектуре: • no phonemes, raw utf-8 • две модели, stable and expressive. Появились они из наблюдения о wer и voice cloning: we observe that most TTS models score substantially lower than the ‘natural’ error rate of the evaluating ASR model vs the actual ground truth text. Авторы считают, что идеальный voice cloning не может быть без потери wer если audio prompt без с шумом и не самым четким произношением. Наверное, я могу отчасти согласиться. Да, это крутая идея разделить этот баланс между идеальным voice clone и наоборот очищенным промтом и идеальным wer. Однако здесь мне кажется не задаются вопросом о том, как считается wer. Те же
    2,680видео7Открыть в Telegram
  • grokaem себя

    11 июн., 17:16

    MamTra: A Hybrid Mamba-Transformer Backbone for Speech Synthesis https://arxiv.org/abs/2603.12342 https://mamtratts.github.io/ - audio samplesПроблема LM based TTS в очень многих вещах начиная от дискретных codec, заканчивая большим компьютом. И хотя многие стараются улучшить инференс таких моделей более инженерными модными молодежными штуками из мира LLM (GQA, speculative decoding, sparse attention), latency и rtf сделать меньше от этого не особо получается.Один из вариантов, который предлагает общество, это отказаться от причины проблемы и попробовать другие архитектуры. Например, mamba - это как rnn только круче.Тут про mamba с картинкамиАвторы этой статьи говорят, что тренировать mamba based сложно и долго, поэтому они попробовали перенести часть слоев от attention в mamba. Для этого они использовали linear mapping. Единственный момент, который не получается также легко
    arXiv.orgMamTra: A Hybrid Mamba-Transformer Backbone for Speech SynthesisDespite the remarkable quality of LLM-based text-to-speech systems, their reliance on autoregressive Transformers leads to quadratic computational complexity, which severely limits practical...
  • grokaem себя

    5 июн., 07:54

    Веду notion с 2021 и я хз когда я это писала и откуда я это слышала, но сейчас третий пункт hits hard
    Иллюстрация к посту канала grokaem себяИллюстрация к посту канала grokaem себя
  • grokaem себя

    3 июн., 13:38

    Стадия - прыгать от одного интересного занятия к другому и пока делаешь его думать ох вот бы щас другое поделать
    2,02933114Открыть в Telegram