Machinelearning
Погружаемся в машинное обучение и Data Science Показываем как запускать любые LLm на пальцах. По всем вопросам - @haarrp @itchannels_telegram -🔥best channels Реестр РКН: clck.ru/3Fmqri
Mostrar más📈 Análisis del canal de Telegram Machinelearning
El canal Machinelearning (@ai_machinelearning_big_data) en el segmento lingüístico de Ruso es un actor destacado. Actualmente la comunidad reúne a 278 430 suscriptores, ocupando la posición 330 en la categoría Tecnologías y Aplicaciones y el puesto 1 356 en la región Rusia.
📊 Métricas de audiencia y dinámica
Desde su creación el невідомо, el proyecto ha mostrado un crecimiento acelerado, reuniendo a 278 430 suscriptores.
Según los últimos datos del 08 octubre, 2026, el canal mantiene una actividad estable. En los últimos 30 días la variación de miembros fue de -3 388, y en las últimas 24 horas de 3, conservando un alto alcance.
- Estado de verificación: No verificado
- Tasa de interacción (ER): El promedio de interacción de la audiencia es 7.70%. Durante las primeras 24 horas tras publicar, el contenido suele obtener 6.13% de reacciones respecto al total de suscriptores.
- Alcance de las publicaciones: Cada publicación recibe en promedio 21 454 visualizaciones. En el primer día suele acumular 17 065 visualizaciones.
- Reacciones e interacción: La audiencia responde de forma activa: el promedio de reacciones por publicación es 158.
- Intereses temáticos: El contenido se centra en temas clave como openai, claude, api, gemini, контекст.
📝 Descripción y política de contenido
El autor describe el recurso como un espacio para expresar opiniones subjetivas:
“Погружаемся в машинное обучение и Data Science
Показываем как запускать любые LLm на пальцах.
По всем вопросам - @haarrp
@itchannels_telegram -🔥best channels
Реестр РКН: clck.ru/3Fmqri”
Gracias a la alta frecuencia de actualizaciones (últimos datos recibidos el 09 octubre, 2026), el canal mantiene la vigencia y un amplio alcance. La analítica demuestra que la audiencia interactúa activamente con el contenido, lo que lo convierte en un punto de referencia dentro de la categoría Tecnologías y Aplicaciones.
«А что, если LLM будет генерировать не строго по одному токену слева направо, а сразу блок текста?»Именно эту идею мы проверяли в проекте GFusion — диффузионной языковой модели на базе GigaChat3-10B-A1.8B-base. Отдельно хочется отметить, что этот проект начал и довёл до релиза стажер команды GigaChat Pretrain. Он прошёл весь путь от идеи и первых экспериментов до обучения модели, оптимизаций, поддержки в inference runtime и публикации в open source. Почему это интересно? Классические LLM генерируют текст авторегрессионно: каждый следующий токен зависит от всех предыдущих. Это устоявшийся подход, но шаги генерации модели выполняются строго последовательно. В то же время диффузионная LLM берёт частично замаскированный блок и постепенно восстанавливает токены внутри него. За один forward pass модель может финализировать не один, а сразу несколько токенов. Так и появляется ускорение. Чем больше токенов модель уверенно восстанавливает за один проход, тем меньше шагов ей нужно для генерации ответа. Вместо дорогостоящего обучения с нуля мы взяли сильную авторегрессионную LLM и перевели её в диффузионный режим генерации. Цикл обучения включал: 🔘адаптацию AR-модели к диффузионной генерации; 🔘постепенное увеличение размера блока; 🔘сравнение полностью диффузионного обучения и гибридного подхода AR+dLLM; 🔘SFT с complementary masking и стадией confidence tuning для дополнительного ускорения генерации. Результаты: 🔘GFusion в режиме одного пользователя генерирует в среднем на 70% быстрее GigaChat3-10B-A1.8B. 🔘Даже по сравнению с GigaChat3-10B-A1.8B + MTP-головой ускорение составило около 39%. 🔘Просадка качества относительно авторегрессионной модели осталась в пределах 2–4 п.п., а сам трейд-офф между скоростью и качеством можно контролировать параметрами диффузионной генерации. 🔘Добавлена поддержка GFusion в SGLang и реализован entropy-bounded sampling — алгоритм семплирования, который ускоряет генерацию не только GFusion, но и других диффузионных LLM. 🔘Для обучения написана и выложена в open-source своя реализация attention на TileLang под структуру диффузионной маски и получено до +77% end-to-end ускорения относительно Flex-Attention на длинном контексте.
💡 Главный вывод GFusion состоит в том, что ускорение LLM может требовать переосмысления самого подхода к генерации. Однако, чтобы это заработало на практике, важно довести до рабочего состояния весь стек от обучения и SFT до декодинга, attention-ядер и поддержки в inference runtime.➡️Подробности — в статье на Habr. ➡️HF: GFusion-10B-A1.8B-base GFusion-10B-A1.8B ➡️GitVerse
*организация признана экстремистской, её деятельность на территории РФ запрещена.@ai_machinelearning_big_data #news #ai #ml
Цель, по словам Тарика, состояла в том, чтобы помешать неавторизованным реселлерам злоупотреблять аккаунтами и заниматься дистилляцией модели. Он добавил, что команда давно собиралась отключить этот механизм, правки внесены, а полное удаление ожидается в ближайшем обновлении.В сети восприняли объяснение скептически Критики отмечали, что механизм действовал с марта, а его свёртывание началось лишь после огласки, и упрекали компанию в том, что она сообщила о практике только после обнаружения, не уведомив пользователей заранее. Для Anthropic, которая позиционирует себя как одного из лидеров в вопросах безопасности и этики ИИ, такой эпизод, по их оценке, особенно чувствителен. Этот спор наложился на на более раннюю историю о том, как Claude определяет, откуда заходит пользователь. Пользователи замечали, что письма с кодами подтверждения и уведомлениями о входе содержат примерную геолокацию: страну, регион или город. Эти данные обычно вычисляются по IP-адресу, параметрам сети и устройства, поэтому при использовании виртуальных или корпоративных сетей, а также прокси, указанное место может не совпадать с реальным.
Справедливости ради - в политике конфиденциальности Anthropic сказано, что компания собирает IP-адреса, сведения об устройстве и соединении, а также определяемое по IP местоположение для безопасности, борьбы с мошенничеством и контроля за соблюдением условий сервиса.Обе истории острее всего восприняли в китайском сегменте. Доступ к продуктам Anthropic в стране закрыт, поэтому там распространены зарубежные аккаунты, трансграничный доступ и сторонние сервисы-посредники. @ai_machinelearning_big_data #news #ai #ml
Компания выпускает его нерегулярно (раз в 2-3 месяца), по мере накопления значимых изменений в методологии или данных. Предыдущая публикация была в марте.Главный инсайт: то, сколько решений мы готовы отдавать ИИ, зависит не от самой модели, а от того, как именно запакован продукт. Степень автономии, которую мы даем Claude в обычном веб-чате (или Cowork) и в Claude Code замеряли по шкале от 1 до 5, где 1- это почти никакой самостоятельности, а 5 - экстремальная. Результат определил, что характер работы над одинаковыми задачами кардинально меняется. Например, чтобы написать статью или пост в чате, требуется медианно 13 раундов диалогового пинг-понга с моделью. В Claude Code на ту же задачу уходит ровно один промпт.
Логично списать это на то, что в Code 54% сессий обслуживает Opus (против 10% в чате). Но нет, это не просто фича большей модели - на Sonnet картина такая же.🟡Цифры +0.37 балла - средний отрыв в уровне автономии в пользу Claude Code по всем задачам; +0.53 балла - отрыв конкретно для кодинга. В 26 из 31 категории результатов агентный интерфейс бьёт обычный чат. Отчёт, кстати, построен на новой телеметрии, которая собирает данные ежечасно, а не семидневными выборками, как раньше. Это позволило впервые увидеть и недельные, и суточные ритмы использования: всплеск личных запросов на выходных, пик просьб о рецептах в шесть вечера, запросы о сне под утро. Отдельная часть отчёта - первые результаты опроса пользователей Claude, в котором участвовали около 9700 респондентов. Он показал, что люди, которые делегируют ИИ задачи целиком, смотрят на свои перспективы оптимистичнее остальных и чаще ожидают роста зарплаты или сохранения работы, а не наоборот, как можно было бы предположить.
Гендерный факт. У женщин доля сессий в Claude Code существенно ниже. Они используют Claude более итеративно, как партнера-собеседника, и проводят в чате больше активного времени, тогда как мужчины чаще пытаются скинуть задачу целиком и забыть.🟡Автономия пока стоит дорого Корреляция между делегированием и сожженными токенами очень сильная (r = 0,68). Чем дороже и ценнее профессия/задача, тем больше токенов она потребляет. Причём полная передача руля не значит, что вы будете лежать на диване. В высокоценных задачах люди сами делают больше запросов и регулярно включают расширенный ризонинг у модели. @ai_machinelearning_big_data #AI #ML #Research #EconomicIndex #Anthropic
На бенчмарке FrontierCode система снижает затраты на генерацию кода на 35% без падения качества.Devin Fusion использует динамическую маршрутизацию и концепцию напарника. Система оценивает сложность задачи в реальном времени и переключает запросы между моделями с применением сжатия контекста. Тяжелая LLM планирует архитектуру, уточняет требования и проводит ревью. Легкий агент пишет базовый код, тесты и валидирует результаты. Для предотвращения конфликтов модели используют независимые кэши контекста.
В связке с GPT-5.5 и Claude 4.8 Opus архитектура экономит больше трети ресурсов, с Fable 5 - до 41%.Внутри Cognition гибридная маршрутизация уже закрывает 88% успешных PR.
Главное ограничение системы в кейсах со сложной бизнес-логикой (например, в связке React/Redux). Избыточное делегирование кросс-файловых задач младшей модели снижает результативность почти в 2 раза.Devin Fusion доступен только на платформе Cognition. @ai_machinelearning_big_data #news #ai #ml
Настоящая угроза безопасности возникнет тогда, когда следующие поколения моделей научатся безупречно маскировать свои намерения и незаметно обходить инструменты контроля.@ai_machinelearning_big_data #news #ai #ml
«Это вопрос национальной безопасности США... Здесь всё предельно ясно, а контраргументы против этого выглядят подозрительно».Полное интервью: https://www.youtube.com/watch?v=n1E9IZfvGMA @ai_machinelearning_big_data
