Ruslan Dev
Open in Telegram
Записки странствующего инженера Чат — https://t.me/ruslandevchat ЛС — @ruslanperesy
Show more470
Subscribers
No data24 hours
No data7 days
No data30 days
Data loading in progress...
Similar Channels
No data
Any problems? Please refresh the page or contact our support manager.
Tags Cloud
No data
Any problems? Please refresh the page or contact our support manager.
Incoming and Outgoing Mentions
---
---
---
---
---
---
Attracting Subscribers
December '24
December '24
+24
in 1 channels
November '24
+48
in 1 channels
Get PRO
October '24
+60
in 1 channels
Get PRO
September '24
+173
in 2 channels
Get PRO
August '24
+3
in 0 channels
Get PRO
July '24
+78
in 0 channels
Get PRO
June '24
+479
in 0 channels
| Date | Subscriber Growth | Mentions | Channels | |
| 21 December | +2 | |||
| 20 December | 0 | |||
| 19 December | 0 | |||
| 18 December | +1 | |||
| 17 December | 0 | |||
| 16 December | 0 | |||
| 15 December | +2 | |||
| 14 December | 0 | |||
| 13 December | 0 | |||
| 12 December | +2 | |||
| 11 December | +2 | |||
| 10 December | +2 | |||
| 09 December | +1 | |||
| 08 December | 0 | |||
| 07 December | +2 | |||
| 06 December | +1 | |||
| 05 December | +3 | |||
| 04 December | +4 | |||
| 03 December | 0 | |||
| 02 December | 0 | |||
| 01 December | +2 |
Channel Posts
А вот и видео о том, как собрать датасет с помощью GPT-4o и обучить на нем ламу:
https://youtu.be/v31kb_GARY0?feature=shared
| 2 | Llama-3-8B-GPT-4o
https://huggingface.co/ruslandev/llama-3-8b-gpt-4o
Эту модель я обучил на своем датасете - вот он:
https://huggingface.co/datasets/ruslandev/tagengo-subset-gpt-4o
Датасет представляет собой выборку 3000 промптов из Tagengo, на трех языках - русский, английский и китайский. Ответы к промптам сгенерировал GPT-4o. Код, с помощью которого я собрал датасет, прилагается по ссылке выше.
Модель обучена на 3 эпохи. Я выполнил оценку на ru_mt_bench, получил результат 7.36 - довольно неплохо для такого маленького датасета. | 372 |
| 3 | Основные моменты моего последнего видео про бенчмарки я собрал в этой статье:
https://vk.com/@immers.cloud-benchmarki-bolshih-yazykovyh-modelei-multiyazychnyi-mt-bench
Здесь же и пошаговый гайд c shell-командами - как выполнить мультиязычный MT-Bench для своей LLM. | 531 |
| 4 | GPT-4o, новая модель OpenAI, помимо прочих особенностей отличается мультиязычностью.
Есть такая идея - задействовать эту модель для сбора датасета, на котором потом можно файнтюнить ту же ламу-3.
Получится осуществить или нет - посмотрим. К тому же, чтобы оценить, насколько эффективен файнтюнинг на таких данных в сравнении с тем же Tagengo, нужен подходящий мультиязычный бенчмарк. Как раз об этом мое видео:
https://youtu.be/JrdY8s1XRyo
Это обзор наиболее известных бенчмарков - MMLU, TruthfulQA, HellaSwag и других. А также практического применения бенчмарка MT-Bench для оценки моделей на английском и русском языке. | 525 |
| 5 | Это еще не Sora, но мы уже близко
Попробовать можно здесь: https://huggingface.co/spaces/LanguageBind/Open-Sora-Plan-v1.1.0 | 475 |
| 6 | Open-Sora-Plan v1.1.0
Разработчики опубликовали веса, код, данные и демо новой версии диффузионного трансформера. На этот раз в дело пошел более серьезный набор данных. Только на разметку было потрачено 240 часов на 32 H100, чтобы сгенерировать текстовые описания для изображений и видео с помощью LLaVA и ShareGPT4Video. Эти данные затем были использованы для обучения text2video модели.
Выборка данных:
- выборка из SA-1B датасетета, 11 миллионов пар изображение-текст
- Anytext-3M - 1.9 миллиона пар с описаниями, сгенерированными моделью InternVL
- Human-160k - еще 162 тысячи высококачественных изображений из датасета LAION-5B
~ 3000 часов видеоданных с платформ Mixkit, Pixabay и Pexels. В 10 раз больше видео, чем в выборке первой версии Open-Sora-Plan
При 3-дневном обучении на 80 H100 были замечены некоторые странности. Одна из идей диффузионного трансформера в том, что с масштабированием модели, данных и итераций обучения повышается качество генерации видео. Но после двух эпох обучения (50k шагов) модель достигла пика своего качества, а более поздние чекпоинты на 70-100k шагов показывали производительность ниже.
Вероятно, виноват оверфиттинг, надо собрать больше данных или изменить архитектуру модели.
На второй стадии модель была обучена на большом кластере Huawei Ascend (512 Ascend, 72 часа). Процессор Huawei Ascend - альтернатива GPU, с помощью которой проекту Open-Sora-Plan, по-видимому, удалось решить проблему нехватки видеокарт NVIDIA. Ключевой момент - модель, обученная на Huawei Ascend, может быть загружена на GPU, и качество ее инференса не изменится.
На третьей стадии обучения число кадров видео было увеличено до 513 (примерно 21 секунда в 24 FPS). При этом появились проблемы с согласованностью кадров во времени, что наводит на те же выводы, что и первая стадия - нужно масштабирование набора данных и, вероятно, модификация архитектуры модели.
Полный отчет по версии v1.1.0 читайте тут: https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/Report-v1.1.0.md | 439 |
| 7 | Моя статья по файнтюнингу и квантизации Llama-3 70B:
https://vk.com/@immers.cloud-faintuning-i-kvantizaciya-llama-3-70b
Эта статья дополняет мое последнее видео, более детально освещая некоторые важные моменты.
В частности - я включил в нее несколько слов о ChatML, формате промпта, который был использован в видео, и самое интересное - пояснение, что именно происходит внутри команды python gptchain.py train.
Также статья содержит инструкции, как выполнить файнтюнинг, инференс и квантизацию с помощью моего фреймворка. Можете использовать как мануал. | 543 |
| 8 | А вот и видео про файнтюнинг Llama-3 70B.
Точнее, там две части: файнтюнинг и квантизация.
Квантизацию Pytorch модели в gguf теперь поддерживает мой фреймворк, например:
python gptchain.py quant -m [путь к pytorch чекпоинту] \
-qm q4_k_m \
-sp [путь к папке, где будет лежать
ваша компактная модель в gguf формате]
Показан и запуск полученного gguf через llama.cpp
https://youtu.be/ML4M1UQHxbU | 563 |
| 9 | Попытался научить Llama-3 70B следовать инструкциям на русском языке.
Получилось по-моему неплохо, еще хочу проверить на MT bench.
Недавно я наткнулся на очень интересный датасет - tagengo-gpt4. Это 78 тысяч текстовых выборок, полученных таким образом - взяли инпуты из датасета lmsys-chat-1m, и по ним GPT-4 сгенерировал ответы. Главное преимущество - датасет мультиязычный. Содержит в том числе 8 тысяч выборок на русском.
В процессе обучения было несколько проблем - во-первых, мой фреймворк gptchain пока не умеет параллелить модель на несколько GPU при обучении. Это ограничение библиотеки unsloth, которое обещали устранить в ближайшее время.
А пока обучение на 1x NVIDIA H100 заняло 7 часов, только чтобы пройти 2400 итераций, это даже не полная эпоха. По-хорошему нужно несколько дней.
Метрики обучения - в карточке модели на HF:
https://huggingface.co/ruslandev/llama-3-70b-tagengo | 544 |
| 10 | Файнтюнинг Llama 3.
Кажется, что еще не так давно это было невероятно сложно. Даже если вспомнить первую реализацию QLoRA - это был сложный код, на стеке transformers+pytorch он работал с багами и доставлял головную боль.
А сегодня программные инструменты претерпели громадные улучшения. Вчера я добавил новый функционал в свой собственный инструмент gptchain - с его помощью модели можно теперь файнтюнить одной консольной командой. Под капотом мой фреймворк использует библиотеки Unsloth и Transformer Reinforcement Learning (TRL), которые реально делают файнтюнинг суперэффективным. Unsloth, например, реализует QLoRA, экономя около 60% видеопямяти и ускоряя обучение в несколько раз.
Пример обучения llama-3-8b на датасете Samantha в этом видео. Репозиторий с кодом по ссылке в описании
https://youtu.be/8G6Tp8IX4rQ?feature=shared | 773 |
| 11 | Постепенно, шаг за шагом диффузионные трансформеры эволюционируют
https://github.com/PKU-YuanGroup/MagicTime | 835 |
| 12 | Шествие MoE моделей продолжается
Не успел я написать, что архитектура Mixture-of-Experts - новый тренд, как Mistral AI выкатили Mixtral 8x-22B
https://x.com/MistralAI/status/1777869263778291896
Видимо решили, что раз уж лаборатория Маска и Датабрикс не жалеют денег на оперсорсные LLM, то чего уж там - и выложили своего монстра на 176 миллиардов параметров.
А ведь еще недавно говорили, что не будут открывать код своих лучших моделей, интегрировались в AI платформу Microsoft и вообще собирались повторить путь OpenAI.
Ну, хорошие новости, в общем. | 866 |
| 13 | Пробую свои силы в написании статей по архитектуре LLM. Не совсем research paper (пока), формул вы в моей статье не найдете. Это скорее обзорное исследование с точки зрения разработчика.
Слышали о новой Mixture-of-Experts модели - DBRX?
Прослеживается заметный тренд: Mixtral-8x7b, Grok-1, а теперь эта 132B-модель от Databricks. В чем же ключевое преимущество MoE? И каковы перспективы развития этой архитектуры?
P.S. Статья на английском, но если у кого есть желание прочесть - буду рад вашим комментариям
https://docs.google.com/document/d/1khbdeK9LrwVzL2IsFl9vcYMiW1Kya3KyJindh3GonNs/edit?usp=sharing | 644 |
| 14 | Тестировал text-to-video модель Open-Sora-Plan, решил испытать ее кинематографичность.
Попробовал сгенерировать пару сцен в стиле триллера Джона Ву.
Золотых рыбок и котят генерить уже надоело.
Результат как есть, никаких фильтров, никакого увеличения разрешения, минимальный монтаж. Странно, но модель, похоже, имеет общее представление о сеттинге гонконгского боевика) Откуда, казалось бы? Пока ее обучали на небольшом (40k) наборе стоковых видео...
Кстати, если кто хочет протестить демо Open-Sora-Plan 1.0, скачать веса модели, запустить локально или в Google Colab - пожалуйста:
https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/Report-v1.0.0.md
Помимо весов, только что загружены данные, на которых обучена модель:
https://huggingface.co/datasets/LanguageBind/Open-Sora-Plan-v1.0.0 | 594 |
| 15 | Исследователи из Пекинского университета продвинулись в разработке Open-Sora-Plan
Помимо модели-трансформера, Sora использует отдельную нейросеть для сжатия видео в латентное пространство. В оригинальной реализации DiT в роли этой нейросети выступает VAE - Variational Autoencoder. Точно такой же используется в Stable Diffusion. VAE - это сверточная нейросеть, convnet, которая выполняет функцию энкодера, преобразуя пиксели в латенты.
Вчера в вичат группе Open-Sora-Plan объявили о релизе CausalVideoVae, модели, которая поддерживает работу как с изображениями, так и с видео. Выше - пример видео, которое было сжато в латентное представление, а затем реконструировано с помощью этой модели. Как видите, CausalVideoVae поддерживает видео в как минимум в HD качестве.
Технический отчет CausalVideoVae:
https://github.com/PKU-YuanGroup/Open-Sora-Plan/blob/main/docs/CausalVideoVAE.md | 730 |
| 16 | А вот и видео о том, как портировать Grok на transformers с бэкендом pytorch https://youtu.be/3cBEyEOsVmk?feature=shared
Ссылка на веса и колаб для инференса в 4bit - в описании | 717 |
| 17 | Веселая неделя. В свободное время портировал Грок на Pytorch - чтобы можно было запустить этого зверя на стеке Нuggingface transformers. Сжать веса до 4-bit, чтобы поместились в 4x A100 80gb. Для инференса оригинальный Грок на фреймворке Jax требует восемь таких A100.
Сегодня в итоге все получилось, на видео вы можете лицезреть класс pytorch-модели Грок, плюс bitsandbytes-конфиг для квантизации в 4-bit. Модель успешно выдала первые токены на четырех А100, и довольно быстро.
Ничего бы не вышло без комьюнити Huggingface - кто-то уже успел сконвертировать веса в float16 для pytorch, так как изначально xAI их выложили в восьмибитном формате, и адаптировать код модели Mixtral 8x7b из библиотеки transformers. Сильно упростил дело тот факт, что архитектура Грока очень похожа на Mixtral. | 679 |
| 18 | Вчера лаборатория Маска - xAI - выложила в открытый доступ веса Grok, а заодно и репозиторий с кодом.
Пока понятно только одно - это самая большая MoE (Mixture of Experts) и, похоже, вообще самая большая LLM с открытыми весами. 314 миллиардов параметров, однако.
Второй, не столь очевидный факт - это "base" модель, НЕ instruction-tuned, то есть она обучена на огромном текстовом корпусе (очевидно, в ней весь Твиттер), но ее не файнтюнили для решения конкретных задач. Другие примеры base, или foundational моделей - Llama 2 base или тот же GPT-4.
Предполагается, что веса Grok-1 - материал для файнтюнинга, которому сообщество AI-разработчиков найдет применение. Или не найдет, потому что для файнтюнинга такого монстра нужно немерено GPU-часов и видеопамяти, даже со всевозможными LoRA. Ну, и данные где-то нужно взять. | 680 |
| 19 | Прогулялся сегодня как следует. Вообще-то я собирался в Куала-Лумпур, посетить Microsoft Build: AI Day, но его отменили - не приехал гендиректор Майкрософт, Сатья Наделла. Зря не приехал, сейчас в Малайзии красиво. Цветет "малайская сакура", дерево текома. | 685 |
| 20 | Подверждаются мои ожидания - можно разработать алгоритм для обучения AI-модели, но нельзя заполучить столько GPU, сколько нужно для полной реализации ее возможностей. Пока нельзя, во всяком случае.
Я читал, как CEO Perplexity AI пытался нанять специалиста, который просто сказал следующее: "Приходи, когда у тебя будет десять тысяч H100."
А вот пример конкретнее, проект, за которым я наблюдаю последнюю неделю - Open-Sora-Plan от Пекинского университета.
Сегодня закончили двухдневное обучение DiT-модели на восьми NVIDIA A100 80gb. График обучения прилагается. Перед этим за несколько дней собрали фреймворк на основе Latte, отрытой реализации Diffusion Transformer. Фреймворк позволяет обучать модель для генерации видео в 1080p (точнее говоря, с 2x super resolution и интерполяцией кадров получаем 1080p в 30FPS длительностью до одной минуты).
Вот как один из разработчиков Open-Sora-Plan резюмировал сегодня в Вичате:
На текущий момент первые эксперименты показали, что не проблема написать код для генерации видео по тексту, по заданной категории либо для случайной генерации. Чтобы улучшить результат, нужно больше вычислительных мощностей и данных. | 785 |
