ru
Feedback
gonzo-обзоры ML статей

gonzo-обзоры ML статей

Открыть в Telegram

Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.

Больше

📈 Аналитический обзор Telegram-канала gonzo-обзоры ML статей

Канал gonzo-обзоры ML статей (@gonzo_ml) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 24 341 подписчиков, занимая 5 438 место в категории Технологии и приложения и 27 174 место в регионе Россия.

📊 Показатели аудитории и динамика

С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 24 341 подписчиков.

Согласно последним данным от 26 июля, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило 21, а за последние 24 часа — -2, при этом общий охват остаётся высоким.

  • Статус верификации: Не верифицирован
  • Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 9.63%. В первые 24 часа после публикации контент обычно набирает 6.69% реакций от общего числа подписчиков.
  • Охват публикаций: В среднем каждый пост получает 2 344 просмотров. В течение первых суток публикация набирает 1 629 просмотров.
  • Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 10.
  • Тематические интересы: Контент сосредоточен на ключевых темах, таких как learning, tl;dr, токенов, архитектура, контекст.

📝 Описание и контентная политика

Автор описывает ресурс как площадку для выражения субъективного мнения:
Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP...

Благодаря высокой частоте обновлений (последние данные получены 27 июля, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.

24 341
Подписчики
-224 часа
+37 дней
+2130 день
Архив постов
Just in case, сегодня начинается конфа AGI-26, есть стримы онлайн. https://agi-conference.org/schedule

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

50 оттенков continual learning'а. When Does Continual Learning Require Learning _Anne Harrington, Nayan Saxena, Michael Murphy, Anastasia Borovykh, Zeyu Yun, Sridhar Kamath, Ara Eindra Kyi, Trevor Darrell, Jitendra Malik, Yutong Bai_ Paper: https://arxiv.org/abs/2607.07847 Code: https://github.com/anneharrington/studying-cl Review: https://arxiviq.substack.com/p/when-does-continual-learning-require Model: N/A # TL;DR ЧТО сделали: Авторы представляют унифицированный, независимый от конкретных механизмов фреймворк для оценки непрерывного обучения (continual learning) в LLM. В нём напрямую сравниваются восемь методов адаптации — от промптинга до классического обучения с учителем, обучения с подкреплением и сжатия контекста — на четырёх реалистичных сценариях изменения среды: сдвиге доменов, обновлении фактов, временном дрейфе и накоплении состояния агента. ПОЧЕМУ это важно: Исследование математически и эмпирически доказывает, что непрерывное обучение — это не единая монолитная способность, а набор компромиссов, зависящих от характера изменений среды. Универсального метода нет: медленные временные тренды требуют дистилляции для стабильности, дискретные обновления фактов — онлайн-RL, а агентские среды — файнтюнинга весов или специализированного промптинга. Работа даёт чёткую инструкцию, когда моделям нужно обновлять веса внутри модели (in-weights), а когда достаточно внешних надстроек. Для практиков: Если перед вами стоит задача долгосрочной адаптации LLM, забудьте об универсальных решениях. Для исправления фактов используйте онлайн-RL (например, GRPO), для плавной адаптации к домену — дистилляцию (SDFT), а для сложных агентских сред — файнтюнинг весов или продвинутый промпт-инжиниринг. Диссекция continual learning тут: https://t.me/gonzo_ML_podcasts/4615

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Прунинг через функциональный анализ. Выглядит красиво. Hilbert Operator for Progressive Encoding (HOPE): A Mathematical Framework for Deconstructing Learned Representations in Deep Networks Hossein Mobahi, Peter L. Bartlett Статья: https://arxiv.org/abs/2607.21366 Ревью: https://arxiviq.substack.com/p/hilbert-operator-for-progressive Код: N/A Модель: N/A # TL;DR Что сделали: Авторы предложили HOPE — математический подход, который позволяет анализировать и сжимать нейросети, переводя их из дискретных списков чисел (весов) в непрерывные математические функции. Объединив этот взгляд со статистикой самой модели, алгоритм научился прореживать, объединять и удалять целые слои без единого разрыва прогона реальных данных. Почему это важно: Обычно модели сжимают или изучают, опираясь либо на величину параметров (что бывает математически обманчиво), либо на прогоны реальных данных (что дорого и не всегда безопасно для приватности). Переход строго в «пространство функций» даёт чёткий, автоматизированный способ уменьшать модели и защищать их базовые знания при обучении новым задачам. Функционально прунить тут:https://t.me/gonzo_ML_podcasts/4606

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Repost from gonzo_ML_podcasts
photo content

Ну и чего-нибудь более классического для тех, кому про жызнь менее интересно. Новости зацикленных трансформеров, модель примерно продакшн уровня. The Compute-Matched Paradigm: Rethinking Recurrent Depth with the Loopie Series Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai Paper: https://arxiv.org/abs/2607.16051 Review: https://arxiviq.substack.com/p/loop-the-loopies Code: https://github.com/IQuestLab/loopie/megatron, https://github.com/IQuestLab/loopie/vllm (404 for now) Model: https://huggingface.co/IQuestLab/Loopie-20B-A2B-preview, https://huggingface.co/IQuestLab/Loopie-6B-A0.6B-preview (404 for now) # TL;DR ЧТО сделали: Авторы из IQuest Research представили семейство Loopie — новый класс рекуррентных языковых моделей (LLM) с архитектурой Mixture-of-Experts (MoE), где используется механизм "layer-loop" (зацикливание отдельных слоёв). Разработав подход к масштабированию с учётом железа, исследователи сбалансировали физическую глубину, ширину и рекуррентную глубину сети так, чтобы уместиться в вычислительный бюджет на предобучение, аналогичный нерекуррентным бейзлайнам. После предобучения модели дообучались с помощью масштабного пайплайна Supervised Pre-Training (SPT) и обучения с подкреплением (RL) на уровне последовательностей для развития продвинутых способностей к рассуждению. ПОЧЕМУ это важно: Исследования рекуррентных архитектур исторически страдали от проблемы некорректного учёта вычислений: зацикленные модели часто заявляли о своём превосходстве, сравнивая лишь количество параметров, но при этом неявно умножая реальные затраты FLOPs на обучение. Эта работа устраняет данный боттлнек. Доказав, что грамотно настроенная рекуррентная глубина превосходит традиционное масштабирование слоёв при строго фиксированном вычислительном бюджете, авторы легитимизируют рекуррентность как полноценный и высокоэффективный вектор масштабирования для foundation-моделей на триллионы параметров. Для практиков: Если вы упираетесь в ограничения памяти по активациям, локальное зацикливание слоёв позволяет значительно увеличить размер микробатча. Это повышает утилизацию GPU без роста общего физического времени обучения, позволяя направить сэкономленные ресурсы на расширение скрытой размерности модели. Зацикливать трансформеры тут: https://t.me/gonzo_ML_podcasts/4595

Repost from gonzo_ML_podcasts
photo content