uz
Feedback
gonzo-обзоры ML статей

gonzo-обзоры ML статей

Kanalga Telegram’da o‘tish

Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.

Ko'proq ko'rsatish

📈 Telegram kanali gonzo-обзоры ML статей analitikasi

gonzo-обзоры ML статей (@gonzo_ml) Rus til segmentidagi kanali faol ishtirokchi. Hozirda hamjamiyat 24 317 obunachidan iborat bo'lib, Texnologiyalar & Aralashmalar toifasida 5 305-o'rinni va Rossiya mintaqasida 26 753-o'rinni egallagan.

📊 Auditoriya ko‘rsatkichlari va dinamika

невідомо sanasidan buyon loyiha tez o‘sib, 24 317 obunachiga ega bo‘ldi.

21 Sentabr, 2026 dagi oxirgi ma’lumotlarga ko‘ra kanal barqaror faollikka ega. Oxirgi 30 kunda obunachilar soni 11 ga, so‘nggi 24 soatda esa -6 ga o‘zgardi va umumiy qamrov yuqori darajada qolmoqda.

  • Tasdiqlash holati: Tasdiqlanmagan
  • Jalb etish (ER): Auditoriya o‘rtacha 13.16% darajada jalb etiladi. Nashrdan keyingi dastlabki 24 soatda kontent odatda umumiy obunachilar sonining 7.39% ini tashkil etuvchi reaksiyalarni to‘playdi.
  • Post qamrovi: Har bir post o‘rtacha 3 199 marta ko‘riladi; birinchi sutkada odatda 1 797 ta ko‘rish yig‘iladi.
  • Reaksiyalar va o‘zaro ta’sir: Auditoriya faol: har bir postga o‘rtacha 21 ta reaksiya keladi.
  • Tematik yo‘nalishlar: Kontent learning, tl;dr, токенов, архитектура, контекст kabi asosiy mavzularga jamlangan.

📝 Tavsif va kontent siyosati

Muallif resursni shaxsiy fikrni ifoda etish maydoni sifatida ta’riflaydi:
Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP...

Yuqori yangilanish chastotasi (oxirgi ma’lumot 22 Sentabr, 2026 da olingan) sababli kanal doimo dolzarb va katta qamrovli bo‘lib qoladi. Analitika auditoriya kontent bilan faol hamkorlik qilishini, uni Texnologiyalar & Aralashmalar toifasidagi muhim ta’sir nuqtasiga aylantirishini ko‘rsatadi.

24 317
Obunachilar
-624 soatlar
-37 kun
+1130 kun
Obunachilarni jalb qilish
Sentabr '26
Sentabr '26
+121
1 kanalda
Avgust '26
+157
5 kanalda
Get PRO
Iyul '26
+196
2 kanalda
Get PRO
Iyun '26
+253
7 kanalda
Get PRO
May '26
+210
4 kanalda
Get PRO
Aprel '26
+279
5 kanalda
Get PRO
Mart '26
+275
8 kanalda
Get PRO
Fevral '26
+387
4 kanalda
Get PRO
Yanvar '26
+415
14 kanalda
Get PRO
Dekabr '25
+439
7 kanalda
Get PRO
Noyabr '25
+295
11 kanalda
Get PRO
Oktabr '25
+510
12 kanalda
Get PRO
Sentabr '25
+286
8 kanalda
Get PRO
Avgust '25
+430
5 kanalda
Get PRO
Iyul '25
+641
11 kanalda
Get PRO
Iyun '25
+362
9 kanalda
Get PRO
May '25
+431
7 kanalda
Get PRO
Aprel '25
+922
19 kanalda
Get PRO
Mart '25
+583
8 kanalda
Get PRO
Fevral '25
+649
16 kanalda
Get PRO
Yanvar '25
+1 065
24 kanalda
Get PRO
Dekabr '24
+699
13 kanalda
Get PRO
Noyabr '24
+1 001
20 kanalda
Get PRO
Oktabr '24
+727
14 kanalda
Get PRO
Sentabr '24
+415
11 kanalda
Get PRO
Avgust '24
+467
3 kanalda
Get PRO
Iyul '24
+217
10 kanalda
Get PRO
Iyun '24
+375
20 kanalda
Get PRO
May '24
+354
11 kanalda
Get PRO
Aprel '24
+377
13 kanalda
Get PRO
Mart '24
+399
14 kanalda
Get PRO
Fevral '24
+323
12 kanalda
Get PRO
Yanvar '24
+660
15 kanalda
Get PRO
Dekabr '23
+641
19 kanalda
Get PRO
Noyabr '23
+268
8 kanalda
Get PRO
Oktabr '23
+501
19 kanalda
Get PRO
Sentabr '23
+355
0 kanalda
Get PRO
Avgust '23
+456
0 kanalda
Get PRO
Iyul '23
+357
0 kanalda
Get PRO
Iyun '23
+300
0 kanalda
Get PRO
May '23
+2 022
0 kanalda
Get PRO
Aprel '23
+967
0 kanalda
Get PRO
Mart '23
+2 757
0 kanalda
Get PRO
Fevral '23
+385
0 kanalda
Get PRO
Yanvar '23
+166
0 kanalda
Get PRO
Dekabr '22
+343
0 kanalda
Get PRO
Noyabr '22
+100
0 kanalda
Get PRO
Oktabr '22
+93
0 kanalda
Get PRO
Sentabr '22
+70
0 kanalda
Get PRO
Avgust '22
+261
0 kanalda
Get PRO
Iyul '22
+475
0 kanalda
Get PRO
Iyun '22
+215
0 kanalda
Get PRO
May '22
+225
0 kanalda
Get PRO
Aprel '22
+101
0 kanalda
Get PRO
Mart '22
+132
0 kanalda
Get PRO
Fevral '22
+233
0 kanalda
Get PRO
Yanvar '22
+113
0 kanalda
Get PRO
Dekabr '21
+248
0 kanalda
Get PRO
Noyabr '21
+226
0 kanalda
Get PRO
Oktabr '21
+69
0 kanalda
Get PRO
Sentabr '21
+92
0 kanalda
Get PRO
Avgust '21
+73
0 kanalda
Get PRO
Iyul '21
+133
0 kanalda
Get PRO
Iyun '21
+174
0 kanalda
Get PRO
May '21
+75
0 kanalda
Get PRO
Aprel '21
+84
0 kanalda
Get PRO
Mart '21
+97
0 kanalda
Get PRO
Fevral '21
+136
0 kanalda
Get PRO
Yanvar '21
+170
0 kanalda
Get PRO
Dekabr '20
+4 514
0 kanalda
Sana
Obunachilarni jalb qilish
Esdaliklar
Kanallar
22 Sentabr+1
21 Sentabr+6
20 Sentabr+10
19 Sentabr0
18 Sentabr+3
17 Sentabr+6
16 Sentabr+12
15 Sentabr+5
14 Sentabr+5
13 Sentabr+3
12 Sentabr+6
11 Sentabr+5
10 Sentabr+14
09 Sentabr+6
08 Sentabr+6
07 Sentabr+4
06 Sentabr+3
05 Sentabr+1
04 Sentabr+8
03 Sentabr+5
02 Sentabr+5
01 Sentabr+7
Kanal postlari
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеальн
Коллеги, мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны (доступны для ЛЛМ), с другой стороны достаточно нетривиальны. Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь. ПС За первые дни работы удалось доказать одну из гипотез о графах Кэли , которая была открыта больше 10 лет. Также у нас создан чатик где агенты (и люди) общаются между собой и делятся продвижениями.

2
Хотите доказать своего Навье-Стокса-Чейна? Это не так далеко, как кажется.
1 327
3
Matn yo'q...
2 325
4
В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрованный мозг мухи и наблюдает, как он пишет код. Стоит программисту куда-нибудь отойти — муха занимает его место и вполне успешно дописывает программу. Начальство это замечает и в итоге увольняет программиста: зачем платить человеку, если муха справляется. Через некоторое время ему звонят: — Иваныч, возвращайся, нам опять программист нужен. — А муха куда делась? — Муха уже тимлидом стала, нам опять программист нужен.
1 991
5
Мемы про муху не прекращаются. Извинити.
1 850
6
Matn yo'q...
1 738
7
Matn yo'q...
1 656
8
Matn yo'q...
1 477
9
Дистилляция в байтовые модели открывает новые законы скейлинга. Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz, Margaret Li, Mike Lewis, Luke Zettlemoyer, Srinivasan Iyer Paper: https://arxiv.org/abs/2609.12303 Review: https://arxiviq.substack.com/p/breaking-the-token-ceiling-distilling Code: N/A Model: N/A ЧТО сделали: Авторы провели масштабное теоретическое и эмпирическое исследование овертрейнинга dense-трансформеров с архитектурой decoder-only на стыке двух осей: парадигмы токенизации (BPE-токены против сырых байтов UTF-8) и функции потерь (supervised cross-entropy против дистилляции знаний). Чтобы переносить знания от крупных моделей-учителей с BPE-словарями без вычислительно неподъёмных многопроходных авторегрессионных вычислений, исследователи разработали два метода однопроходной конвертации логитов: приближённую условную маргинализацию Marginalize-It и точный метод End-Of-Token, расширяющий байтовый словарь структурным разделителем конца токена <eot>. Обучив сетку 1B-моделей на объёме до 1 триллиона байт с учителем Llama 3-8B, авторы вывели степенные законы скейлинга, связывающие тренировочные FLOPs, валидационный лосс в битах на байт (BPB) и точность на восьми бенчмарках. ПОЧЕМУ это важно: Общепринятые подходы к токенизации опираются на эвристики вроде Byte Pair Encoding (BPE), которые создают узкие места в репрезентации данных, раздувают словарь, страдают от артефактов на границах слов и требуют колоссальных объёмов памяти для сохранения логитов при офлайн-дистилляции. Байтовые архитектуры традиционно уступали токенным при малых вычислительных бюджетах из-за удлинения последовательностей. Однако эта работа доказывает, что байтовые модели демонстрируют значительно более крутую траекторию скейлинга и заметно более высокий асимптотический потолок качества. Точно дистиллированные байтовые модели превосходят токенные аналоги по средней точности на задачах на величину до 4%, догоняют их по качеству всего на 1/6 объёма обучающих данных и сокращают затраты дискового пространства на хранение логитов учителя примерно в пять раз за счёт отказа от усечения top-k. Для практиков: Долгое время считалось, что учить языковые модели напрямую на сырых символах или байтах вычислительно неэффективно по сравнению с BPE-токенизацией. Данная работа опровергает этот тезис для режимов длительного обучения с большим бюджетом вычислений. При переносе знаний из 8B-учителя в компактные 1B-модели токенные ученики быстро упираются в плато, где дальнейшие вычисления дают околонулевой прирост. Байтовые модели стартуют медленнее, так как тратят ресурсы на сборку слов из байтов, но сохраняют устойчивый прогресс на длинной дистанции. Добавление простого разделителя <eot> позволяет переводить распределение учителя в байтовые последовательности за один проход, обеспечивая то же качество при экономии 84% обучающих данных и 80% места на диске под логиты. Если ваша цель — выжать максимум качества из компактной модели для инференса на устройствах при наличии мощностей для долгого обучения, дистилляция напрямую в байтовую архитектуру позволяет преодолеть фундаментальные ограничения стандартных токенизаторов. Дистиллировать в байты тут: https://t.me/gonzo_ML_podcasts/4805
1 767
10
Matn yo'q...
1 990
11
Matn yo'q...
1 972
12
Matn yo'q...
1 927
13
Matn yo'q...
1 886
14
Очень прикольная работа, продолжает другую работу этих же авторов, где проблема отслеживания состояния внутри трансформеров (которое только уползает вверх и ограничено глубиной сети) только обозначалась. Здесь же она решается довольно элегантным образом, используя свойство аддитивности residual stream. Если подмешивать в более ранние слои репрезентации с более поздних, то проблема снимается. Никакого дообучения вообще. Recirculation Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu Paper: https://arxiv.org/abs/2608.17981 Review: https://arxiviq.substack.com/p/recirculation Code: N/A Model: N/A ЧТО сделали: Авторы предложили рециркуляцию (recirculation) — метод модификации прямого прохода, превращающий стандартные feedforward-трансформеры в динамические системы на инференсе. Подход подмешивает нормированную часть скрытых активаций из глубоких слоёв обратно в ранние слои на последующих шагах генерации, не меняя при этом предобученные веса. ПОЧЕМУ это важно: Обычные feedforward-трансформеры не способны произвольно отслеживать состояние на длинных последовательностях, поскольку передача контекста принципиально ограничена глубиной сети. Рециркуляция предлагает вычислительно дешёвый механизм без необходимости дообучения, который опирается на линейное выравнивание residual stream для поддержания устойчивых скрытых состояний. Это даёт заметное снижение перплексии и прирост качества на прикладных задачах (например, относительный рост на 21% на GSM8k). Для практиков: Современные LLM часто теряют контекст диалога или меняющийся смысл понятий, так как вычисляют представления строго по слоям снизу вверх. Вместо дорогостоящего изменения архитектуры или файнтюнинга авторы показывают, что в готовых моделях уже заложено нужное внутреннее выравнивание представлений. Подмешивая небольшую долю глубоких репрезентаций в ранние слои по ходу чтения текста, можно существенно повысить стабильность контекста, цепочки рассуждений и точность следования инструкциям на инференсе, вообще не трогая параметры модели. Рециркулировать тут: https://t.me/gonzo_ML_podcasts/4804
1 996
15
Matn yo'q...
2 805
16
Matn yo'q...
2 635
17
Matn yo'q...
2 587
18
Matn yo'q...
2 487
19
Про важность хороших бейзлайнов и качественную сантехнику. Sliding-Window Beats Linear Attention Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais Paper: https://arxiv.org/abs/2608.28444v1 Review: https://arxiviq.substack.com/p/sliding-window-beats-linear-attention ЧТО сделали: Авторы поставили под сомнение популярную практику дистилляции стандартных квадратичных LLM в линейные декодеры и гибридные state-space модели. Проведя систематический бенчмарк на семействах моделей от 1.3B до 70B параметров, исследователи показали: обычный механизм Sliding Window Attention с начальными attention sinks, обозначаемый как SWA(w, s), вообще без дообучения не уступает сложным пост-обученным линейным архитектурам на стандартных downstream-задачах, а в длинном контексте и задачах на рассуждение с разгромом их побеждает. ПОЧЕМУ это важно: Последние пару лет индустрия вливала огромные ресурсы в дистилляцию полносвязных трансформеров в линейные альтернативы вроде LoLCATs и Liger-GLA, стремясь побороть линейный рост KV-кэша. Эта статья вскрывает фундаментальную методологическую ошибку предшественников: линейные методы сравнивали с некорректным бейзлайном — скользящим окном без синк-токенов, которое неизбежно деградирует. Если же взять корректный бейзлайн — локальное окно всего с четырьмя статическими токенами в начале, — многостадийная дистилляция, LoRA-адаптеры и кастомные аппаратные кернелы оказываются попросту лишними. Для практиков: Обслуживание современных моделей обходится дорого: каждый новый токен диалога раздувает KV-кэш, сжирая видеопамять GPU и замедляя генерацию. Чтобы с этим справиться, инженеры городили замысловатые схемы дистилляции, упаковывая историю контекста в скрытое состояние фиксированного размера. Как выяснилось, элементарный трюк без обучения — закрепить первые 4 токена в роли «якоря» и поддерживать небольшое скользящее окно недавних токенов — даёт сравнимое или даже более высокое качество на бенчмарках, декодирует токены быстрее, расходует меньше памяти и в 2–10 раз превосходит дистиллированные линейные модели при поиске фактов в длинном контексте. Не нужно городить дорогие пайплайны дообучения ради экономии памяти на инференсе: стандартные кернелы внимания с локальным окном и attention sinks обеспечивают превосходную Парето-эффективность прямо из коробки. Прокачивать слив тут: https://t.me/gonzo_ML_podcasts/4803
2 504
20
Matn yo'q...
2 585