fa
Feedback
gonzo-обзоры ML статей

gonzo-обзоры ML статей

رفتن به کانال در Telegram

Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP, RL.

نمایش بیشتر

📈 تحلیل کانال تلگرام gonzo-обзоры ML статей

کانال gonzo-обзоры ML статей (@gonzo_ml) در بخش زبانی روسی بازیگری فعال است. در حال حاضر جامعه شامل 24 317 مشترک است و جایگاه 5 323 را در دسته فناوری و برنامه‌ها و رتبه 26 798 را در منطقه روسيا دارد.

📊 شاخص‌های مخاطب و پویایی

از زمان ایجاد در невідомо، پروژه رشد سریعی داشته و 24 317 مشترک جذب کرده است.

بر اساس آخرین داده‌ها در تاریخ 15 سپتامبر, 2026، کانال فعالیت پایداری دارد. در ۳۰ روز گذشته تغییر اعضا برابر 0 و در ۲۴ ساعت گذشته برابر -3 بوده و همچنان دسترسی گسترده‌ای حفظ شده است.

  • وضعیت تأیید: تأیید نشده
  • نرخ تعامل (ER): میانگین تعامل مخاطب 11.08% است و در ۲۴ ساعت نخست پس از انتشار، محتوا معمولاً 7.65% واکنش نسبت به کل مشترکان کسب می‌کند.
  • دسترسی پست‌ها: هر پست به طور میانگین 2 694 بازدید دریافت می‌کند. در اولین روز معمولاً 1 859 بازدید جمع‌آوری می‌شود.
  • واکنش‌ها و تعامل: مخاطبان به‌طور فعال حمایت می‌کنند؛ میانگین واکنش به هر پست 13 است.
  • علایق موضوعی: محتوا بر موضوعات کلیدی مانند learning, tl;dr, токенов, архитектура, контекст تمرکز دارد.

📝 توضیح و سیاست محتوایی

نویسنده این فضا را محل بیان دیدگاه‌های شخصی توصیف می‌کند:
Авторы: Гриша Сапунов, ранее руководитель разработки Яндекс-Новостей, ныне CTO Intento. Области интересов: AI/ML/DL, биоинформатика. Лёша Тихонов, ранее аналитик в Яндексе, автор Автопоэта, Нейронной Обороны... Области интересов: discrete domain, NLP...

به لطف به‌روزرسانی‌های پرتکرار (آخرین داده در تاریخ 16 سپتامبر, 2026)، کانال همواره به‌روز و دارای دسترسی بالاست. تحلیل‌ها نشان می‌دهد مخاطبان به‌طور فعال با محتوا تعامل دارند و آن را به نقطه اثرگذاری مهم در دسته فناوری و برنامه‌ها تبدیل کرده‌اند.

24 317
مشترکین
-324 ساعت
-57 روز
اطلاعاتی وجود ندارد30 روز

در حال بارگیری داده...

جذب مشترکین
سپتامبر '26
سپتامبر '26
+86
در 0 کانال‌ها
اوت '26
+157
در 5 کانال‌ها
Get PRO
ژوئیه '26
+196
در 2 کانال‌ها
Get PRO
ژوئن '26
+253
در 7 کانال‌ها
Get PRO
مه '26
+210
در 3 کانال‌ها
Get PRO
آوریل '26
+279
در 5 کانال‌ها
Get PRO
مارس '26
+275
در 8 کانال‌ها
Get PRO
فوریه '26
+387
در 4 کانال‌ها
Get PRO
ژانویه '26
+415
در 14 کانال‌ها
Get PRO
دسامبر '25
+439
در 7 کانال‌ها
Get PRO
نوامبر '25
+295
در 11 کانال‌ها
Get PRO
اکتبر '25
+510
در 12 کانال‌ها
Get PRO
سپتامبر '25
+286
در 8 کانال‌ها
Get PRO
اوت '25
+430
در 5 کانال‌ها
Get PRO
ژوئیه '25
+641
در 11 کانال‌ها
Get PRO
ژوئن '25
+362
در 9 کانال‌ها
Get PRO
مه '25
+431
در 7 کانال‌ها
Get PRO
آوریل '25
+922
در 19 کانال‌ها
Get PRO
مارس '25
+583
در 8 کانال‌ها
Get PRO
فوریه '25
+649
در 16 کانال‌ها
Get PRO
ژانویه '25
+1 065
در 24 کانال‌ها
Get PRO
دسامبر '24
+699
در 13 کانال‌ها
Get PRO
نوامبر '24
+1 001
در 20 کانال‌ها
Get PRO
اکتبر '24
+727
در 14 کانال‌ها
Get PRO
سپتامبر '24
+415
در 11 کانال‌ها
Get PRO
اوت '24
+467
در 3 کانال‌ها
Get PRO
ژوئیه '24
+217
در 10 کانال‌ها
Get PRO
ژوئن '24
+375
در 20 کانال‌ها
Get PRO
مه '24
+354
در 11 کانال‌ها
Get PRO
آوریل '24
+377
در 13 کانال‌ها
Get PRO
مارس '24
+399
در 14 کانال‌ها
Get PRO
فوریه '24
+323
در 12 کانال‌ها
Get PRO
ژانویه '24
+660
در 15 کانال‌ها
Get PRO
دسامبر '23
+641
در 19 کانال‌ها
Get PRO
نوامبر '23
+268
در 8 کانال‌ها
Get PRO
اکتبر '23
+501
در 19 کانال‌ها
Get PRO
سپتامبر '23
+355
در 0 کانال‌ها
Get PRO
اوت '23
+456
در 0 کانال‌ها
Get PRO
ژوئیه '23
+357
در 0 کانال‌ها
Get PRO
ژوئن '23
+300
در 0 کانال‌ها
Get PRO
مه '23
+2 022
در 0 کانال‌ها
Get PRO
آوریل '23
+967
در 0 کانال‌ها
Get PRO
مارس '23
+2 757
در 0 کانال‌ها
Get PRO
فوریه '23
+385
در 0 کانال‌ها
Get PRO
ژانویه '23
+166
در 0 کانال‌ها
Get PRO
دسامبر '22
+343
در 0 کانال‌ها
Get PRO
نوامبر '22
+100
در 0 کانال‌ها
Get PRO
اکتبر '22
+93
در 0 کانال‌ها
Get PRO
سپتامبر '22
+70
در 0 کانال‌ها
Get PRO
اوت '22
+261
در 0 کانال‌ها
Get PRO
ژوئیه '22
+475
در 0 کانال‌ها
Get PRO
ژوئن '22
+215
در 0 کانال‌ها
Get PRO
مه '22
+225
در 0 کانال‌ها
Get PRO
آوریل '22
+101
در 0 کانال‌ها
Get PRO
مارس '22
+132
در 0 کانال‌ها
Get PRO
فوریه '22
+233
در 0 کانال‌ها
Get PRO
ژانویه '22
+113
در 0 کانال‌ها
Get PRO
دسامبر '21
+248
در 0 کانال‌ها
Get PRO
نوامبر '21
+226
در 0 کانال‌ها
Get PRO
اکتبر '21
+69
در 0 کانال‌ها
Get PRO
سپتامبر '21
+92
در 0 کانال‌ها
Get PRO
اوت '21
+73
در 0 کانال‌ها
Get PRO
ژوئیه '21
+133
در 0 کانال‌ها
Get PRO
ژوئن '21
+174
در 0 کانال‌ها
Get PRO
مه '21
+75
در 0 کانال‌ها
Get PRO
آوریل '21
+84
در 0 کانال‌ها
Get PRO
مارس '21
+97
در 0 کانال‌ها
Get PRO
فوریه '21
+136
در 0 کانال‌ها
Get PRO
ژانویه '21
+170
در 0 کانال‌ها
Get PRO
دسامبر '20
+4 514
در 0 کانال‌ها
تاریخ
رشد مشترکین
اشارات
کانال‌ها
16 سپتامبر+3
15 سپتامبر+5
14 سپتامبر+5
13 سپتامبر+3
12 سپتامبر+6
11 سپتامبر+5
10 سپتامبر+14
09 سپتامبر+6
08 سپتامبر+6
07 سپتامبر+4
06 سپتامبر+3
05 سپتامبر+1
04 سپتامبر+8
03 سپتامبر+5
02 سپتامبر+5
01 سپتامبر+7
پست‌های کانال
2
بدون متن...
1 324
3
بدون متن...
1 286
4
بدون متن...
1 151
5
بدون متن...
1 040
6
В стане концептуальных моделей (самая известная, наверное, была LCM) пополнения, скейлим модели и делаем их более end-to-end. Хороший результат, практически вдвое более быстрое обучение по сравнению с LLM бейзлайном (OLMo). NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction Jiaqi Cao, Chiyu Chen, Shuang Cheng, Xu Cheng, Beiya Dai, Yufan Feng, Kewen Ge, Ruijun Ge, Jiayi Huang, Yang Jiao, Dahua Lin, Zhouhan Lin, Yifan Liu, Yuliang Liu, Biqing Qi, Mowen Ruan, Junzhe Shen, Yunchong Song, Hao Sun, Zhongbo Tian, Yixuan Wang, Rubin Wei, Jiaxin Xiong, Kangyu Yang, Qian Yao, Qi Zhang, Bowen Zhou (The Intern-NCP Team) Paper: https://arxiv.org/abs/2609.10715 Review: https://arxiviq.substack.com/p/ncp-archpreview-technical-report Code: https://github.com/InternLM/lmdeploy, https://github.com/LUMIA-Group/ncp_olmo_eval Model: https://huggingface.co/collections/ArchSpace-Collection/ncp-archpreview ЧТО сделали: Авторы представили NCP-ArchPreview — модель с латентным пространством на 8.94B параметров, предобученную на 5.73T токенов датасета Dolma-3. Архитектура модифицирует стандартный авторегрессионный процесс: между 16-слойным энкодером токенов и 16-слойным декодером токенов внедрён промежуточный 8-слойный модуль концептов (Concept Module). Вместо оптимизации исключительно под предсказание следующего токена, система объединяет скрытые состояния токенов в спаны, квантует их в дискретный кодбук с помощью Product Quantization и обучает модель end-to-end параллельно предсказывать будущие концепты и генерировать токены, связывая уровни динамическими иерархическими residual connections. ПОЧЕМУ это важно: Классические авторегрессионные языковые модели страдают от «близорукости» локальной оптимизации: семантическое планирование на уровне фраз возникает лишь как побочный эффект минимизации пословной кросс-энтропии. Превращая дискретные латентные репрезентации в полноценные таргеты обучения, NCP-ArchPreview достигает финального лосса бейзлайна OLMo-3-7B, расходуя лишь 51.3% вычислительных ресурсов (ускорение сходимости в 1.95× и выигрыш по Парето-эффективности вычислений в 1.74×). Кроме того, дискретное пространство концептов открывает возможность эффективного файнтюнинга через интерфейс кодбука размером всего 17M параметров и повышает долю принятых токенов в speculative decoding за счёт явной контекстной траектории. Для практиков: Современные LLM генерируют текст слово за словом — примерно как человек, который начинает говорить, совершенно не продумав фразу заранее. Такой прямолинейный подход требует триллионов токенов, чтобы сеть выучила абстрактные идеи и логические структуры. В этой работе модель учат параллельно планировать высокоуровневые концепты на несколько слов вперёд и выводить токены последовательно. В результате сеть обучается почти в два раза быстрее, увереннее справляется с математикой и задачами на рассуждение, а также получает модульный словарь идей, который можно адаптировать под специализированные домены без риска забывания базовых знаний или использовать для ускорения генерации практически без оверхеда по памяти. Обучать концепты тут: https://t.me/gonzo_ML_podcasts/4802
1 153
7
بدون متن...
1 983
8
بدون متن...
1 965
9
بدون متن...
1 830
10
بدون متن...
1 750
11
Прикольный заход на оптимизацию KV-кешей, когда модель сама может подсветить, куда собирается смотреть, пометить это тегами, а на инференсе vLLM быстро подстроится и не будет грузить лишнего. Language Models Can Control Their Own Attention Namgyu Ho, Huzama Ahmad, Woosung Koh, Se-Young Yun, Tal Schuster, Cicero Nogueira dos Santos Paper: https://arxiv.org/abs/2609.02737v1 Review: https://arxiviq.substack.com/p/language-models-can-control-their Code: N/A Model: N/A ЧТО сделали: Авторы представили Declarative Attention (DA) — универсальный zero-shot протокол для инференса, в котором стандартный авторегрессионный трансформер самостоятельно управляет доступом к собственному KV-кэшу. Генерируя структурированные текстовые теги прямо в процессе цепочки рассуждений (CoT), модель динамически переключается между тремя режимами: глобальным обзором всего контекста, точечной фокусировкой на конкретных смысловых фрагментах и локальным синтезом, изолированным в рамках недавних сгенерированных токенов. Конечный автомат рантайма перехватывает эти теги в момент генерации токенов и напрямую обновляет таблицу блоков в vLLM. Это позволяет отсекать неиспользуемые блоки памяти в FlashAttention без файнтюнинга модели, вспомогательных сетей маршрутизации или деструктивного удаления токенов. ПОЧЕМУ это важно: При генерации на сверхдлинных контекстах пропускная способность памяти, необходимая для постоянного вычитывания многогигабайтных KV-кэшей из HBM, начинает полностью доминировать над задержкой декодинга и операционными расходами. Существующие методы разреженного внимания пытаются бороться с этим через эвристический прунинг или легковесные обучаемые роутеры, однако на каждом шаге генерации они по-прежнему требуют прохода сложности O(N) по латентным состояниям или суррогатным проекциям. Declarative Attention доказывает, что современные фронтирные модели уже обладают метакогнитивной способностью предсказывать и формулировать свои информационные потребности на естественном языке. Это меняет подход: вместо неявного поиска сложности O(N) на каждом шаге мы получаем семантический протокол управления со сложностью O(1). Подход сокращает вычислительные затраты на внимание при декодинге на 31.1–52.0% практически без просадки в точности, открывая путь к прозрачному многоуровневому хранению и недеструктивному офлоадингу контекста. Для практиков: Когда языковая модель обрабатывает документы на сотни тысяч слов, вычислительное бутылочное горлышко смещается от мощности матричных процессоров к пропускной способности памяти: модель тратит львиную долю времени на повторное чтение огромного кэша предыдущего текста только ради того, чтобы найти пару релевантных фактов для очередного сгенерированного слова. Раньше для ускорения либо безвозвратно удаляли токены (что часто ломало сложные рассуждения), либо на каждом шаге сканировали сжатое представление всего документа, что остаётся накладным. В этой статье предлагают изящную альтернативу: научить модель прямо говорить, куда именно она хочет посмотреть. Модель сама объявляет, нужно ли ей просканировать весь документ, сфокусироваться на конкретной главе или просто поразмышлять во внутреннем черновике, а инфраструктура инференса на лету отключает доступ к ненужным блокам текста. На 15 бенчмарках длинного контекста без какого-либо дообучения метод сократил обращения к памяти до 52% при сохранении базовой точности, причём эффект только усиливается по мере роста размера и возможностей моделей. Контролировать внимание тут: https://t.me/gonzo_ML_podcasts/4801
1 718
12
بدون متن...
2 352
13
بدون متن...
2 303
14
Передавая когнитивные функции ллмкам, полезно представлять, как вы их заберёте обратно, если понадобится. Путь в обратную сторону может быть сильно дольше и сложнее, чем путь туда. С другой стороны, пару десятков тысяч лет назад размер мозга человека начал уменьшаться -- процентов на 10, кажется, с тех пор уменьшился. С ллм можем экспоненциально ускориться! Large-Language Models as a Cognitive Virus Ricard Solé, Giulio Ruffini, Francesca Castaldo, Marco Tuccio, Luis F. Seoane, Manlio de Domenico, Santiago F. Elena, David C. Krakauer, and Michael Levin Paper: https://arxiv.org/abs/2609.03344v1 Review: https://arxiviq.substack.com/p/large-language-models-as-a-cognitive ЧТО сделали: Авторы построили математическую популяционную компартментную модель (в духе классической эпидемиологии), которая рассматривает распространение больших языковых моделей (LLM) как процесс культурного и когнитивного заражения. Формализовав переходы между автономными людьми, умеренными пользователями и зависимыми агентами в условиях нелинейного социального подкрепления, исследователи показали возникновение седло-узловых и транскритических бифуркаций, бистабильности и гистерезиса когнитивных способностей. ПОЧЕМУ это важно: Работа подводит строгий фундамент нелинейной динамики под анализ когнитивной разгрузки (cognitive offloading) и технологического лок-ина (lock-in). Математически доказано, что плавный линейный рост популярности LLM способен приводить к катастрофическому скачкообразному сдвигу в сторону глубокой зависимости, а для возврата к автономному мышлению требуется несоизмеримо более сильное сокращение использования моделей, чем для предотвращения зависимости на раннем этапе. Для практиков: Для тимлидов, преподавателей и архитекторов корпоративного ИИ генеративные модели — это не просто инструмент ускорения работы, а инвазивная информационная среда, способная необратимо разрушить навыки решения задач. При бесконтрольном внедрении сотрудники и студенты быстро делегируют моделям базовые функции: письмо, аналитику и верификацию фактов. Поскольку культура независимого мышления держится на институциональных нормах, вымывание автономных специалистов ослабляет коллективный иммунитет к деградации. Перейдя критический порог, компания рискует намертво застрять в технологической зависимости. Решение состоит не в запретах, а во внедрении «когнитивной иммунизации»: искусственном добавлении барьеров верификации, регулярной автономной работе без ИИ и проверке базовых профессиональных навыков сотрудников. Интеллектуально деградировать тут: https://t.me/gonzo_ML_podcasts/4800
2 736
15
В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние несколько дней я видел десяток демо, где мозг+2
В твиттере новая мания - нейросети по схеме мозга настоящей мухи. За последние несколько дней я видел десяток демо, где мозг настоящей мухи заставляют играть в DOOM и сочинять музыку. В основе - коннектом MaleCNS - карта связей между более чем 166 тысячами нейронов мозга и нервной цепочки дрозофилы, примерно 125 миллионов синапсов, которую восстановили по снимкам электронного микроскопа. Разработчики копируют всю карту или отдельный фрагмент в программу, добавляют упрощённые правила работы нейронов. Картинку, звук или события игры превращают во входные сигналы, а активность сети - в команды персонажу или результат распознавания. Например: - Minecraft - сеть подключили к виртуальной мухе: она реагирует на еду, свет и игрока через запрограммированные движения. - Doom - кадры игры поступают в модель, активность нейронов управляет движением и стрельбой. Обучение играть пока не доказано. - Super Mario 64 - нейросеть управляет Марио. Может прыгать и упираться в стену, но проходить уровни её не научили. - Эмоции - на фрагменте из 499 нейронов сделали распознавание эмоциональной окраски голоса. Не добавили мухе чувства, а обучили выходной слой читать ответы сети. Beat Saber - показали муху со световыми мечами. Пока это воспроизведение выученной последовательности движений, не самостоятельная игра. В общем аплоад сознания в симуляцию начался. Но с мух.
3 761
16
А вот и продолжение темы про мух )
3 389
17
Привет вам от Тани и от Шмидхубера+1
Привет вам от Тани и от Шмидхубера
3 657
18
بدون متن...
3 530
19
بدون متن...
3 312
20
بدون متن...
3 325