uz
Feedback
DL in NLP

DL in NLP

Kanalga Telegram’da o‘tish

Новости и обзоры статей на тему обработки естественного языка, нейросетей и всего такого. Связь: @dropout05 (рекламы нет)

Ko'proq ko'rsatish

📈 Telegram kanali DL in NLP analitikasi

DL in NLP (@dlinnlp) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 12 519 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 8 577-o'rinni va Rossiya mintaqasida 54 244-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 12 519 obunachiga ega bo‘ldi.

21 Avgust, 2025 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni -52 ga, so‘nggi 24 soatda esa 0 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 0% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining N/A% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 0 marta ko‘riladi; birinchi sutkada odatda 0 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 0 ta reaksiya keladi.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
Новости и обзоры статей на тему обработки естественного языка, нейросетей и всего такого. Связь: @dropout05 (рекламы нет)

Yuqori yangilanish chastotasi (oxirgi ma’lumot 22 Avgust, 2025 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

12 519
Obunachilar
Ma'lumot yo'q24 soatlar
+37 kun
-5230 kun
Postlar arxiv
DL in NLP
12 519
photo content

DL in NLP
12 519
Тут знакомая DL-школа DeepSchool, про которых я уже писал раньше ищет преподавателей на курс по LLM с опытом работы в индустр
Тут знакомая DL-школа DeepSchool, про которых я уже писал раньше ищет преподавателей на курс по LLM с опытом работы в индустрии Я когда-то сам вел лекции и если вы хотите заполнить пробелы в своих знаниях и систематизировать их, то преподавание — отличный вариант, плюс есть возможность пообщаться с другими препами и узнать их мнения / заполнить пробелы в каких-то очень узких областях Что ребята дают: — доступ ко всем курсам школы: можно приходить на лекции, задавать вопросы, сдавать домашки и получать ревью — оплата за подготовку материалов — оплата за лекции и ревью заданий — редактор поможет с текстами — а дизайнер нарисует красивую презентацию Что ребята ждут: — опыт в DL-индустрии/ресёрче от 3 лет — опыт работы с LLM от 1 года Если вы работаете с LLM, хотите пообщаться с другими практикующими инженерами, вместе поработать и перенять опыт, заполните, пожалуйста, эту форму

DL in NLP
12 519
MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding Zuhri et al arxiv.org/abs/2406.09297 Помните mult
MLKV: Multi-Layer Key-Value Heads for Memory Efficient Transformer Decoding Zuhri et al arxiv.org/abs/2406.09297 Помните multi-query attention где вместо того чтобы у вас были разные key, query, value на каждую голову вы используете одни и те же kv для всех и разными бывают только query? Это очень классная идея которая сильно сокращает размер kv cache позволяя упихивать более длинные тексты или большие батчи в тот же объем памяти с минимальной потерей качества. Авторы multi-layer kv heads предлагают сделать еще один шаг в эту сторону и предлагают шарить kv между соседними слоями тоже. То есть мы разбиваем наши слои на блоки, например по 4 слоя. И в каждой группе из 4 слоёв только лишь первый слой считает kv, остальные используют только query. Потеря качества хоть и небольшая, но достаточно заметная, но иногда приходится упихивать неупихиваемое в GPU и хорошо иметь больше способов делать tradeoffs.

DL in NLP
12 519
1X AI Update, May youtube.com/watch?v=bzn9O37fRMQ Мы записали ещё один видос с тем как EVE могут полностью автономно прибраться в офисе. Вообще демки довольно хороши для того чтобы коллектить большое количество полезных данных тк заставляют тебя думать о более полезных задачах и делать модели которые решают их с реально высоким success rate.

DL in NLP
12 519
Очень крутая лекция Jason Wei (chain of thought, emergent abilities) и Hyung Won (Flan-PaLM) из OpenAI о языковых моделях, emergent abilities, и прочих интересных штуках https://youtu.be/3gb-ZkVRemQ

DL in NLP
12 519
photo content

DL in NLP
12 519
GPT4o openai.com/index/hello-gpt-4o/ Буква o в GPT4o означает "omnimodel". Новая моделька, аналогично gemini, может принимать на вход текст, аудио, картинки (и видео?) и генерировать эти модальности (текст, аудио, картинки, простенькое 3D) Например, модель может суммаризировать видео, редактировать изображения, генерировать комиксы итд Но самое впечатляющее это конечно же аудио. Новый (слегка кринж) очень живой и эмоциональный голос, который можно просить менять стиль, например насколько он звучит драматично или роботично, можно просить петь итд. Очень круто то что модель может обрабатывать и аудио и видео (как бы) одновременно. То есть ChatGPT слушает вас, но может и смотреть на то что вы показывете на камере -- теперь можно скидывать не только фотографию но и включать видео стрим. Моделька будет основной моделью в ChatGPT, включая и беслпатных юзеров. Из того что я понял разница между платными и беслпатными теперь будет только в лимите запросов в день. По метрикам, чуть-чуть лучше чем GPT4-turbo. Возможно мы уже подходим к потолку этих бенчмарков и скоро надо будет делать другие. Очень рекомендую посмотреть видео с новой моделью, картинки не передают то насколько аудио крутое. Например посмотрите вот эти два видоса: тык, тык Из презентации очень сильное впечатление что OAI окончательно стали продуктовой компанией. И 100% они специально поставили свою презентацию за день до гугловой. Такое ощущение что они поставили перед собой цель -- уничтожить гугл. В общем очень крутая презентация, посмотрим как другие компании будут использовать новые API

DL in NLP
12 519
Let's Think Dot by Dot: Hidden Computation in Transformer Language Models arxiv.org/abs/2404.15758 We show that transformers can use meaningless filler tokens (e.g., '......') in place of a chain of thought to solve two hard algorithmic tasks they could not solve when responding without intermediate tokens.

DL in NLP
12 519
Llama 3 llama.meta.com/llama3/ Немного странный анонс моделей с приговоркой "статья будет чуть позже", meta раньше так не дел
Llama 3 llama.meta.com/llama3/ Немного странный анонс моделей с приговоркой "статья будет чуть позже", meta раньше так не делали, но всё равно модели очень крутые и уже доступны Детали: 1. 16K GPU 🤯 1. 15T токенов 🤯🤯 1. Веса моделей на 8B и 70B параметров уже доступны 🎉 1. Тренируют модель на 405B параметров (без MoE) 🤯 1. 8K длина контекста 1. Архиткетурно самые большие отличия: Grouped Query Attention и 128K vocab size 1. Для тренировки оценивали scaling laws на разных доменах датасета (и на downstream задачах) после чего из них высчитывали оптимальное взвешивание 1. Никаких отклонений от scaling laws даже на 15T токенах для 8B модели Бенчмарки: 1. На MMLU, Llama 3 8B работает на уровне PALM-540B и Chinchilla 70B 1. Там же Llama 70B обходит Claude 3 Sonnet и Mistral Large

DL in NLP
12 519
Repost from Сиолошная
У Dwarkesh новый выпуск подкаста с двумя LLM-щиками. Именно из превью этой беседы я вчера узнал про статью о генерализации и
У Dwarkesh новый выпуск подкаста с двумя LLM-щиками. Именно из превью этой беседы я вчера узнал про статью о генерализации и интерпретируемости, детали которой расписал в канале. Один из гостей — нейробиолог, переключившийся в интерпретируемость моделей (и проводящий аналогии с мозгом) и работающий в Anthropic. Второй — исследователь в DeepMind. Он молодой, работает буквально 2 года в индустрии, но один из создателей трансформера говорил, что без этого парня Gemini могла бы не состояться, и вообще он один из лучших и недооцененных спецов в области. Должно быть очень интересно, го смотреть: https://www.youtube.com/watch?v=UTuuTTnjxMQ Затрагивают следующие топики: — Long contexts — Intelligence is just associations — Intelligence explosion & great researchers — Superposition & secret communication — Agents & true reasoning — How Sholto & Trenton got into AI research — Are feature spaces the wrong way to think about intelligence? — Will interp actually work on superhuman models

DL in NLP
12 519
Repost from эйай ньюз
Jamba - вроде Mamba, вроде MoE, вроде трансформер, и в то же время ничто из этого Заявляют, что по бенчам на уровне Mixtral 8
+2
Jamba - вроде Mamba, вроде MoE, вроде трансформер, и в то же время ничто из этого Заявляют, что по бенчам на уровне Mixtral 8x7b, параметров в целом чуть больше (52B vs 46.7B у Mixtral), но активируется чуть меньше (12B vs 12.9B у Mixtral). Говорят что поддерживается контекст вплоть до 256к, но относиться к этому стоит скептически. В целом не заслуживало бы внимания, если бы не архитектура. А вот архитектурно это ОЧЕНЬ странная модель – мешают сразу три типа слоёв (см. вторую каритнку). В каждом блоке в 8 слоёв 4 MoE, 3 Mamba и 1 классический трансформерный. То есть на бумаге там 16 экспертов, из них активных 2, но тем не менее половина активируемых параметров при работе модели - dense. Зачем так - сделали - непонятно, но вроде работает. Главное преимущество по сравнению перед Mixtral - поддержка очень длинного контекста - 140к на одной A100, против 64k у Mixtral, причём на длинных контекстах Jamba вплоть до 3 раз быстрее. Главная проблема таких заявлений – непонятно как эта модель ведёт с такими огромными контекстами. Результатов для Needle In a Haystack бенчмарка нет. В целом ничего не понятно, но очень интересно.😊 Веса Блогпост @ai_newz

DL in NLP
12 519
Очень классное интервью с Андреем https://twitter.com/stephzhan/status/1773027310587056433 Обсудили немного истории OAI и самого Андрея, насколько scale всё важен (всё ещё #1) какие другие вещи важны. Кажется это первое интервью за долгое время от которого я услышал интересные ответы на тему того куда мы двигаемся в ближайший год Для себя всё больше понимаю насколько работа над инфраструктрой более важна чем над самими моделями/лоссами/прочим обучением и если раньше видел это как 90% инфра 10% модели кажется сейчас кажется что 99.9% инфра 0.1% модели (но обучать модели всё ещё веселее что проблема 😅)

DL in NLP
12 519
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training McKinzie et al., [Apple] arxiv.org/abs/2403.09611 Apple вз
MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training McKinzie et al., [Apple] arxiv.org/abs/2403.09611 Apple взяла себя в руки и последнее время от них прямо пошли хорошие статье. В этой статье представляют семейство мультимодальных языковых моделей MM1 Научная ценность статьи в большом числе абляционных исследованиях. Авторы приходят к следующим выводам: Для качества моделей более всего важны следующие вещи (от более важных к менее важным): 1. Разрешение изображений 2. Выбор лосса 3. Размер модели 4. Размер данных Также выясняют что для few-shot лучше всего моделировать image-text interleave (как Flamingo), а для zero-shot лучше всего image-capiton pairs (как CLIP). При этом архитектура нейросети минимально влияет на качество. Просто кидайте в трансформер которых подходит вам больше всего. Например когда у вас достаточно хорошая модель с достаточно высоким разрешением изображений не важно как именно вы пулите изображения для передачи в LLM: среднее, attention, или convolusion дают примерно один и тот же результат. Интересно, что тренировка на тексте (без изображений) значительно улучшает few-shot. Кастательно соотношения данных, из того с чем эксперимертировали в статье лучше всего работает соотношение caption:interleaved:text 5:5:1 Код и веса к сожалению не опубликованы 😓

DL in NLP
12 519
openai.com/blog/openai-elon-musk Почитайте блогпост и прикреплённые к нему имеилы. Кажется это довольно сильный ответ на иск
openai.com/blog/openai-elon-musk Почитайте блогпост и прикреплённые к нему имеилы. Кажется это довольно сильный ответ на иск Маска, но посмотрим куда это зайдёт. Из имеилов я немного удивился что уже в 2016 Сацкевер верил в скейлинг

DL in NLP
12 519
Humanoid Locomotion as Next Token Prediction arxiv.org/abs/2402.19469 В этом году с гуманоидными роботами будет жара. Авторы
Humanoid Locomotion as Next Token Prediction arxiv.org/abs/2402.19469 В этом году с гуманоидными роботами будет жара. Авторы предлагают обучать языковую модель на сенсомоторных траекториях с роботов или из YouTube видео людей где траектории получены с помощью обратной кинематики (использовали PHALP) Обучались на: 1. Траекториях робота который управляется классическим алгоритмом 1. Траекториях из симуляции с RL-policy 1. Человеческих motion-capture 1. YouTube видео с людьми к которым применяли обратную кинематику чтобы получить траекторию Плюсы подхода к этому через языковое моделирование: можно обучаться на данных у которых отсутствуют некоторые модальности. Например на YouTube видосах у вас нету actions, есть только траектория. Вы просто маскируете эти отсутствующие токены и языковая модель просто делает своё дело. Модель обученная всего на 27 часах данных может управлять роботом в городе без какого-либо дообучения 🔥 Также показали наметки scaling law, но самая большая моделька (всего 8M параметров lol) уже отходит от scaling law, так что возможно данных надо сильно больше.

DL in NLP
12 519
Repost from AI для Всех
Вышел официальный курс от OpenAI: как пользоваться ChatGPT Уникальный курс от OpenAI, раскрывающий все секреты работы с ChatG
Вышел официальный курс от OpenAI: как пользоваться ChatGPT Уникальный курс от OpenAI, раскрывающий все секреты работы с ChatGPT, от регистрации до разработки сложных запросов. В эпоху цифровых технологий знание того, как эффективно использовать инструменты искусственного интеллекта, становится не просто преимуществом, а необходимостью. OpenAI выпустили курс, который станет вашим надежным помощником в освоении ChatGPT – от создания аккаунта до написания первого запроса. В курсе вы научитесь: - Использованию ChatGPT в качестве персонального ассистента: Узнайте, как максимально повысить свою продуктивность, используя ChatGPT для выполнения повседневных задач. - Разработка запросов и Prompt Engineering: Освоите искусство формулирования запросов, чтобы получать максимально точные и полезные ответы. - Введение в DALLE-3, GPT 3.5 и GPT 4: Погрузитесь в возможности последних версий GPT и научитесь создавать уникальный контент. Не упустите возможность усилить свои навыки и расширить границы возможного с помощью последних технологий от OpenAI (а еще получить сертификат). Смотреть курс

DL in NLP
12 519
Апдейт того что умеют делать наши роботы в 1X Technologies youtube.com/watch?v=iHXuU3nTXfQ Полностью автономно, видео не ускорено (1X speed), все действия контролирует нейросетка end2end

DL in NLP
12 519
Наткнулся на сайт который кажется как толока но для профессионалов в программировании, математике, физике и других дисциплинах. Очень забавная ниша которой кажется не существовало ещё год назад. Вообще очень интересно докуда это дойдёт через пару лет когда выйдет GPT6. Многие из тех вещей которые мы сейчас делаем каждый день в GPT4 я лично вообще не мог себе представить всего 2 года назад. Что если реально уже скоро будут какие-то нетривиальные результаты LLM в том чтобы автономно заниматься физикой или математикой? Я хоть серьёзными науками и не занимаюсь (практический DL на науку не тянет), но впервые подумал что и нас можно будет со временем заменить. Надо поставить себе напоминалку сделать ретроспективу этого поста в январе 2026 😅 https://tryoutlier.com

DL in NLP
12 519
Early Weight Averaging meets High Learning Rates for LLM Pre-training Sanyal et al., [UT Austin] arxiv.org/abs/2306.03241 Исс
+2
Early Weight Averaging meets High Learning Rates for LLM Pre-training Sanyal et al., [UT Austin] arxiv.org/abs/2306.03241 Исследования того а что будет если мы просто усредним несколько моделей всегда были слегка безумной, но очень эффективной идеей улучшения качества моделей. В этой статье авторы показывают что это можно делать не только с финальными чекпоинтами, но и во время тренировки. Авторы предлагают алгоритм LAWA (LAtest Weight Averaging) который выглядит так: 1. В начале тренируемся как обычно, сохраняем чекпоинты модели каждые N~1000 итераций 2. Когда мы достигаем update_step % N == 0, берём последние M~10 чекпоинтов и усредняем их, заменяем веса модели 3. Продолжаем тренироваться Метод очень похож на EMA, но тут мы выполняем его не только для тестирования модели, но и для тренировки. Интересные моменты: оптимальный lr для LAWA заметно выше чем оптимальный lr для обычной тренировки, а также LAWA позволяет избежать нестабильностей лосса когда он внезапно взрывается 🔥 В конце хотелось бы ещё сказать про подробности экспериментов. Порог входа в рисёч предтренировки это ~8xA100. Но есть альтернатива: Pythia и LLM360 зарелизили не только финальный чекпоинт, но и чекпоинты каждую 1000 итераций, а также порядок данных. Это означает что вы можете "вклиниться" со своим методом в середину тренировки и проверить как он работает в начале/середине/конце обучения. Это относительно дешево и так и были проведены большинство экспериментов.

DL in NLP
12 519
Repost from Kali Novskaya
🌸Бесплатные курсы по LLM🌸 #nlp #про_nlp Небольшое обновление поста про бесплатные курсы NLP/LLM, на этот раз добавлю англоязычных материалов. Всё разбила на две группы: посложнее и поприкладнее-попроще. 🌸Для MLE: Для курсов требуется английский, требуется Python, основы машинного обучения, базовая теория вероятности и статистика, линейная алгебра. 🟣CS224N: Natural Language Processing with Deep Learning https://web.stanford.edu/class/cs224n/ Крутой стэнфордский курс, идет каждый год с обновлениями. В этом году впервые лекции решили не выкладывать на youtube, хотя остались в публичном доступе все лекции 2023 — их очень советую. 🟣Chris Manning — конспекты https://web.stanford.edu/class/cs224n/readings/cs224n-self-attention-transformers-2023_draft.pdf Преподаватель курса выше и один из самых успешных ученых, авторов исследовательских работ без большого компьюта (DPO, Backpack language models), Крис Маннинг все материалы лекций выкладывает в открытый доступ. По датам обновлений видно, что обновленные материалы -- для курса 2024 года, пользуйтесь! https://web.stanford.edu/class/cs224n/readings/ 🟣Dan Jurafsky — Speech and Language Processing (3rd ed. draft) Автор основного за последние 20 лет учебника по NLP, и тоже из Стэнфорда, Дэн Журафски продолжает выкладывать в открытый доступ новые главы учебника, постоянно обновляя старые. Это вообще практически единственная книга, которую можно прочитать целиком и уже иметь ключи к пониманию 80% происходящего в индустрии. Последнее обновление учебника – 5 января 2024: https://web.stanford.edu/~jurafsky/slpdraft/ 🟣Transformers United https://web.stanford.edu/class/cs25/prev_years/2023_winter/index.html Второй по важности курс, чтобы понимать, что происходит — с общей направленностью на NLP, CV и мультимодальные модели. 🌸Курсы попроще Требуется только английский и Python 🟣HuggingFace NLP Course https://huggingface.co/learn/nlp-course/ Верхнеуровневый курс прикладной направленности, научит запускать инференс и тюнинг основных моделей, позволит примерно понять, что происходит внутри и какие параметры ставить для каких задач. 🟣Cohere LLM University https://docs.cohere.com/docs/llmu Все настроено, конечно, чтобы вас научить работать именно с продуктами Cohere, но сами по себе обзорные материалы неплохие. Из плюсов — есть Discord сообщество курса. 🟣Learn Prompting https://learnprompting.org/docs/intro Хороший дополняемый сборник лучших практик по промпт-инжинирингу, построению chain-of-thought, reasoning, построению ансамблей и систем проверки пайплайнов с промптами.