gonzo-обзоры ML статей
Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.
Show more📈 Analytical overview of Telegram channel gonzo-обзоры ML статей
Channel gonzo-обзоры ML статей (@gonzo_ml) in the Russian language segment is an active participant. Currently, the community unites 24 332 subscribers, ranking 5 305 in the Technologies & Applications category and 26 753 in the Russia region.
📊 Audience metrics and dynamics
Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 24 332 subscribers.
According to the latest data from 21 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 11 over the last 30 days and by -6 over the last 24 hours, overall reach remains high.
- Verification status: Not verified
- Engagement rate (ER): The average audience engagement rate is 13.16%. Within the first 24 hours after publication, content typically collects 7.39% reactions from the total number of subscribers.
- Post reach: On average, each post receives 3 199 views. Within the first day, a publication typically gains 1 797 views.
- Reactions and interaction: The audience actively supports content: the average number of reactions per post is 21.
- Thematic interests: Content is focused on key topics such as learning, tl;dr, токенов, архитектура, контекст.
📝 Description and content policy
The author describes the resource as a platform for expressing subjective opinions:
“Авторы:
Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика.
Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP...”
Thanks to the high frequency of updates (latest data received on 22 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.
Data loading in progress...
| Date | Subscriber Growth | Mentions | Channels | |
| 23 September | 0 | |||
| 22 September | +24 | |||
| 21 September | +6 | |||
| 20 September | +10 | |||
| 19 September | 0 | |||
| 18 September | +3 | |||
| 17 September | +6 | |||
| 16 September | +12 | |||
| 15 September | +5 | |||
| 14 September | +5 | |||
| 13 September | +3 | |||
| 12 September | +6 | |||
| 11 September | +5 | |||
| 10 September | +14 | |||
| 09 September | +6 | |||
| 08 September | +6 | |||
| 07 September | +4 | |||
| 06 September | +3 | |||
| 05 September | +1 | |||
| 04 September | +8 | |||
| 03 September | +5 | |||
| 02 September | +5 | |||
| 01 September | +7 |
| 2 | No text... | 1 616 |
| 3 | No text... | 1 504 |
| 4 | Давайте для разнообразия про что-то полезное в народном хозяйстве. Про погоду.
WeatherNext 3: Increasing resolution and performance of global weather models with raw observations
Stephan Rasp, Boris Babenko, Dominic Masters, Andrew El-Kadi, Samier Merchant, Guy Shalev, Ilan Price, Fred Zyda, Remi Lam, Sasha Shysheya, Matthew Willson, Stratis Markou, Shreya Agrawal, Suhani Vora, Mohammed Alewi Hassen, Sunny Mak, Tom R. Andersson, Megan Bela, Akib Uddin, Nofar Peled Levi, Ben Gaiarin, Ferran Alet, Aaron Bell, Peter Battaglia, and Alvaro Sanchez-Gonzalez
Paper: https://arxiv.org/abs/2609.03582
Review: https://arxiviq.substack.com/p/weathernext-3-increasing-resolution
Code: N/A
Model: https://developers.google.com/weathernext/guides/models
Blog: https://deepmind.google/science/weathernext/
ЧТО сделали: Авторы представили WeatherNext 3 (WN3) — оперативную глобальную вероятностную систему прогнозирования погоды на базе функциональных генеративных сетей (Functional Generative Networks), которая полностью отказывается от классической зависимости от численных реанализов. Работая по схеме «энкодер–процессор–декодер» на многомасштабной икосаэдрической сетке, WN3 напрямую принимает сырые низколатентные геостационарные спутниковые мозаики и предсказывает как поля высокого разрешения на регулярной сетке (почасовые приземные переменные с шагом 0.1° и спутниковые осадки), так и внесеточные непрерывные переменные, включая приземную температуру и точку росы на конкретных метеостанциях, а также характеристики тропических циклонов.
ПОЧЕМУ это важно: Традиционное численное прогнозирование погоды (NWP) и ранние нейросетевые модели жёстко привязаны к циклам анализа атмосферы. Эти циклы отстают от реального времени на 6–12 часов, наследуют систематические погрешности реанализа и отбрасывают неструктурированные наблюдения. Объединив усвоение данных, моделирование динамики и локальный статистический постпроцессинг в единый end-to-end пайплайн, WN3 устанавливает новый SOTA в вероятностном среднесрочном прогнозе. Модель даёт выигрыш в оперативной актуальности на 2–3 часа за счёт почасовой инициализации, снижает ошибку CRPS на 30–40% для приземной температуры на станциях по сравнению с физическими и нейросетевыми бейзлайнами и уменьшает ошибку прогноза осадков на коротких горизонтах вплоть до 60%.
Для практиков: Прогноз погоды исторически строился в три изолированных этапа: объединение показаний сотен датчиков в сглаженное сеточное состояние атмосферы, расчёт физических уравнений на суперкомпьютере и последующий локальный статистический даунскейлинг под рельеф конкретных станций. Поскольку глобальный анализ считается часами и выходит лишь раз в 6 часов, прогнозы устаревают ещё до публикации. WN3 сжимает эту цепочку в одну нейросеть: модель ежечасно принимает свежие спутниковые снимки, обучается напрямую по данным физических метеостанций и радаров и выдаёт локализованный прогноз с учётом высоты и рельефа местности без ручного постпроцессинга, значительно превосходя и классические физические ансамбли, и существующие погодные нейросети.
Предсказывать погоду тут: https://t.me/gonzo_ML_podcasts/4806 | 1 384 |
| 5 | Коллеги,
мы сейчас пытаемся заставить ллм продвигать математику. В нашем проекте CayleyPy у нас много гипотез которые идеально ложатся на ллм - с одной стороны они (вероятно) не супер сложны (доступны для ЛЛМ), с другой стороны достаточно нетривиальны.
Если у кого есть интерес к коллаборации в этом направлении - будем очень рады - напишите @alexander_v_c
Также, если у Вас есть доступы к мощным моделям или опыт в auto-research - Вы могли бы нам очень помочь.
ПС
За первые дни работы удалось доказать одну из гипотез о графах Кэли , которая была открыта больше 10 лет. Также у нас создан чатик где агенты (и люди) общаются между собой и делятся продвижениями. | 1 787 |
| 6 | Хотите доказать своего Навье-Стокса-Чейна? Это не так далеко, как кажется. | 2 220 |
| 7 | No text... | 2 686 |
| 8 | В крупной айти компании работает программист. Рядом на мониторе постоянно запущен оцифрованный мозг мухи и наблюдает, как он пишет код.
Стоит программисту куда-нибудь отойти — муха занимает его место и вполне успешно дописывает программу.
Начальство это замечает и в итоге увольняет программиста: зачем платить человеку, если муха справляется.
Через некоторое время ему звонят:
— Иваныч, возвращайся, нам опять программист нужен.
— А муха куда делась?
— Муха уже тимлидом стала, нам опять программист нужен. | 2 266 |
| 9 | Мемы про муху не прекращаются. Извинити. | 2 119 |
| 10 | No text... | 1 995 |
| 11 | No text... | 1 904 |
| 12 | No text... | 1 723 |
| 13 | Дистилляция в байтовые модели открывает новые законы скейлинга.
Breaking the Token Ceiling: Distilling Smaller, Stronger Byte Models
Kalyani Marathe, Artidoro Pagnoni, Tomasz Limisiewicz, Margaret Li, Mike Lewis, Luke Zettlemoyer, Srinivasan Iyer
Paper: https://arxiv.org/abs/2609.12303
Review: https://arxiviq.substack.com/p/breaking-the-token-ceiling-distilling
Code: N/A
Model: N/A
ЧТО сделали: Авторы провели масштабное теоретическое и эмпирическое исследование овертрейнинга dense-трансформеров с архитектурой decoder-only на стыке двух осей: парадигмы токенизации (BPE-токены против сырых байтов UTF-8) и функции потерь (supervised cross-entropy против дистилляции знаний). Чтобы переносить знания от крупных моделей-учителей с BPE-словарями без вычислительно неподъёмных многопроходных авторегрессионных вычислений, исследователи разработали два метода однопроходной конвертации логитов: приближённую условную маргинализацию Marginalize-It и точный метод End-Of-Token, расширяющий байтовый словарь структурным разделителем конца токена <eot>. Обучив сетку 1B-моделей на объёме до 1 триллиона байт с учителем Llama 3-8B, авторы вывели степенные законы скейлинга, связывающие тренировочные FLOPs, валидационный лосс в битах на байт (BPB) и точность на восьми бенчмарках.
ПОЧЕМУ это важно: Общепринятые подходы к токенизации опираются на эвристики вроде Byte Pair Encoding (BPE), которые создают узкие места в репрезентации данных, раздувают словарь, страдают от артефактов на границах слов и требуют колоссальных объёмов памяти для сохранения логитов при офлайн-дистилляции. Байтовые архитектуры традиционно уступали токенным при малых вычислительных бюджетах из-за удлинения последовательностей. Однако эта работа доказывает, что байтовые модели демонстрируют значительно более крутую траекторию скейлинга и заметно более высокий асимптотический потолок качества. Точно дистиллированные байтовые модели превосходят токенные аналоги по средней точности на задачах на величину до 4%, догоняют их по качеству всего на 1/6 объёма обучающих данных и сокращают затраты дискового пространства на хранение логитов учителя примерно в пять раз за счёт отказа от усечения top-k.
Для практиков: Долгое время считалось, что учить языковые модели напрямую на сырых символах или байтах вычислительно неэффективно по сравнению с BPE-токенизацией. Данная работа опровергает этот тезис для режимов длительного обучения с большим бюджетом вычислений. При переносе знаний из 8B-учителя в компактные 1B-модели токенные ученики быстро упираются в плато, где дальнейшие вычисления дают околонулевой прирост. Байтовые модели стартуют медленнее, так как тратят ресурсы на сборку слов из байтов, но сохраняют устойчивый прогресс на длинной дистанции. Добавление простого разделителя <eot> позволяет переводить распределение учителя в байтовые последовательности за один проход, обеспечивая то же качество при экономии 84% обучающих данных и 80% места на диске под логиты. Если ваша цель — выжать максимум качества из компактной модели для инференса на устройствах при наличии мощностей для долгого обучения, дистилляция напрямую в байтовую архитектуру позволяет преодолеть фундаментальные ограничения стандартных токенизаторов.
Дистиллировать в байты тут: https://t.me/gonzo_ML_podcasts/4805 | 2 023 |
| 14 | No text... | 2 092 |
| 15 | No text... | 2 068 |
| 16 | No text... | 2 054 |
| 17 | No text... | 2 022 |
| 18 | Очень прикольная работа, продолжает другую работу этих же авторов, где проблема отслеживания состояния внутри трансформеров (которое только уползает вверх и ограничено глубиной сети) только обозначалась. Здесь же она решается довольно элегантным образом, используя свойство аддитивности residual stream. Если подмешивать в более ранние слои репрезентации с более поздних, то проблема снимается. Никакого дообучения вообще.
Recirculation
Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu
Paper: https://arxiv.org/abs/2608.17981
Review: https://arxiviq.substack.com/p/recirculation
Code: N/A
Model: N/A
ЧТО сделали: Авторы предложили рециркуляцию (recirculation) — метод модификации прямого прохода, превращающий стандартные feedforward-трансформеры в динамические системы на инференсе. Подход подмешивает нормированную часть скрытых активаций из глубоких слоёв обратно в ранние слои на последующих шагах генерации, не меняя при этом предобученные веса.
ПОЧЕМУ это важно: Обычные feedforward-трансформеры не способны произвольно отслеживать состояние на длинных последовательностях, поскольку передача контекста принципиально ограничена глубиной сети. Рециркуляция предлагает вычислительно дешёвый механизм без необходимости дообучения, который опирается на линейное выравнивание residual stream для поддержания устойчивых скрытых состояний. Это даёт заметное снижение перплексии и прирост качества на прикладных задачах (например, относительный рост на 21% на GSM8k).
Для практиков: Современные LLM часто теряют контекст диалога или меняющийся смысл понятий, так как вычисляют представления строго по слоям снизу вверх. Вместо дорогостоящего изменения архитектуры или файнтюнинга авторы показывают, что в готовых моделях уже заложено нужное внутреннее выравнивание представлений. Подмешивая небольшую долю глубоких репрезентаций в ранние слои по ходу чтения текста, можно существенно повысить стабильность контекста, цепочки рассуждений и точность следования инструкциям на инференсе, вообще не трогая параметры модели.
Рециркулировать тут: https://t.me/gonzo_ML_podcasts/4804 | 2 180 |
| 19 | No text... | 2 958 |
| 20 | No text... | 2 784 |
