en
Feedback
Анализ данных (Data analysis)

Анализ данных (Data analysis)

Open in Telegram

Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Show more

📈 Analytical overview of Telegram channel Анализ данных (Data analysis)

Channel Анализ данных (Data analysis) (@data_analysis_ml) in the Russian language segment is an active participant. Currently, the community unites 50 597 subscribers, ranking 2 564 in the Technologies & Applications category and 12 191 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 50 597 subscribers.

According to the latest data from 06 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 207 over the last 30 days and by 1 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 11.76%. Within the first 24 hours after publication, content typically collects 8.38% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 5 952 views. Within the first day, a publication typically gains 4 242 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 31.
  • Thematic interests: Content is focused on key topics such as llm, контекст, openai, архитектура, deepseek.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Thanks to the high frequency of updates (latest data received on 07 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

50 597
Subscribers
+124 hours
+657 days
+20730 days
Posts Archive
🔥 SmolVLM — маленький, но мощный мультимодальный прорыв. Сегодня вышел технический отчёт о SmolVLM — ультра-компактной VLM-м
🔥 SmolVLM — маленький, но мощный мультимодальный прорыв. Сегодня вышел технический отчёт о SmolVLM — ультра-компактной VLM-модели (всего 256M параметров), которая работает в менее чем 1 ГБ ОЗУ и обходит старые модели 80B, выпущенные полтора года назад! 📏 Контекст — это наше всё: Увеличение длины контекста с 2K до 16K дало +60% к качеству. Даже маленькие модели выигрывают от увелечения памяти. 🔬 SigLIP: меньше — лучше: Вместо классического 400M SigLIP авторы использовали базовую 80M версию — и получили тот же результат при 20% размера. 🧩 Pixel shuffling : Аggressive pixel shuffling помог сократить длину последовательностей в 16 раз без потери качества. 📍 Learnable positional tokens > raw tokens: В маленьких моделях обучаемые позиционные токены дали значительный прирост точности. 🎬 Спец-токены: Специальные "intro/outro" токены и системные промпты дали буст особенно для задач работы видео. 🧠 CoT — с умом: Слишком много Chain-of-Thought данных ухудшает результаты маленьких моделей. Меньше = умнее. 📽 Длиннее видео = лучше: Увеличение длины видео во время обучения улучшило понимание и изображений, и видео. 🚀 SmolVLM — это: Три версии: 256M, 500M, 2.2B — каждая задаёт новую планку для low-resource inference. Real-time inference на iPhone 15 — прямо с камеры, без серверов. В браузере? Да! 40–80 токенов/сек — напрямую в вебе, без ухищрений. 📄 Подробности в репорте #SmolVLM #EfficientAI #Multimodal #VLM #EdgeAI #SigLIP #AIonMobile

🔥 Вайб-кодинг — хайп или инструмент будущего? Программирование с помощью ИИ-агентов — главный тех-тренд последних месяцев. О
🔥 Вайб-кодинг — хайп или инструмент будущего? Программирование с помощью ИИ-агентов — главный тех-тренд последних месяцев. Одни говорят: «Это лучший опыт в моей жизни». Другие: «Я только и делаю, что дебажу то, чего сам не писал». Хочешь по-настоящему разобраться, как использовать ИИ ? 14 апреля в 17:00 — онлайн-лекция от Школы Высшей Математики. 📌 Спикеры: 👨‍🏫 Александр Лыков, к.ф.-м.н., руководитель ШВМ 🟡 Богдан Печёнкин, фаундер Vibe AI Расскажут и покажут: ➖ Как внедрять Copilot, ChatGPT, Cursor и других агентов в работу уже сейчас ➖ Что агенты реально умеют (и где они сыпятся) ➖ Как ускорить разработку в 10 раз, не потеряв контроль над кодом Не пропусти. Это будет 🔥 🗓 14 апреля, 17:00 📍 Онлайн 🟡 Регистрация Реклама: ООО «Школа высшей математики» ИНН: 9728100991 Erid: 2VtzqwE7sw7

Repost from Machinelearning
📌 SPCT: масштабируемость моделей вознаграждения в реальном времени. DeepSeek-AI и Университет Цинхуа опубликовали исследован
+1
📌 SPCT: масштабируемость моделей вознаграждения в реальном времени. DeepSeek-AI и Университет Цинхуа опубликовали исследование о методе Self-Principled Critique Tuning (SPCT), который значительно повышает эффективность генеративных моделей вознаграждения (GRM) для больших языковых моделей. SPCT решает ключевую проблему RL-обучения — получение точных сигналов вознаграждения в условиях разных и неоднозначных задач, где нет четких правил или эталонов. SPCT — это комбинация rejective fine-tuning и обучения с подкреплением на основе правил. Rejective fine-tuning учит модель генерировать принципы и критические оценки, адаптируясь к разным типам входных данных, а rule-based RL — оптимизирует процесс через систему поощрений, которая штрафует за ошибки в ранжировании ответов. Это позволяет GRM самостоятельно создавать критерии оценки и точнее определять лучшие ответы в сложных сценариях, например, при работе с математическими задачами или этическими дилеммами. Главное преимущество SPCT — масштабируемость инференса. Вместо увеличения размера модели авторы предлагают параллельно генерировать множество вариантов принципов и оценок, а затем агрегировать их через голосование. Чтобы фильтровать «шумные» варианты используется мета-модель вознаграждения, которая отбирает только качественные сэмплы. По результатам тестов, DeepSeek-GRM с 27 млрд. параметров при 32 параллельных сэмплах превзошла 671B модель, демонстрируя, что вычислительные ресурсы можно эффективно распределять во время инференса, а не обучения. Эксперименты на бенчмарках Reward Bench, PPE и RMB показали, что SPCT снижает предвзятость моделей. Например, в задачах на рассуждение точность выросла на 12%, а в оценке безопасности — на 9%. При этом метод сохраняет гибкость: одна и та же модель может оценивать одиночные ответы, пары или целые наборы, что критично для реальных приложений вроде чат-ботов или автономных систем. К сожалению, идеальных решений не бывает и у метода есть существенное ограничение - GRM требуют больше вычислительных ресурсов, чем классические скалярные модели, а в узкоспециализированных областях (например, верификация кода) их точность пока уступает конкурентам. 🟡Arxiv @ai_machinelearning_big_data #AI #ML #LLM #GRM #DeepSeekAI

🕊️ Namsor - это ИИ для анализа имен собственных с лингвистическим интеллектом. Причем это не просто классификатор, а инструм
🕊️ Namsor - это ИИ для анализа имен собственных с лингвистическим интеллектом. Причем это не просто классификатор, а инструмент с глубоким пониманием культурных и лингвистических контекстов. Проект удивляет точностью: он различает, является ли "Mercedes фамилией человека, названием города или автомобильным брендом, учитывая страну происхождения. Технология особенно востребована в CRM-системах, соцсетях и базах данных, где критична корректная интерпретация имен. 🔗 Ссылка - *клик*

📊Бесплатный вебинар: «Построение эффективных дашбордов с помощью Power BI» 💡На вебинаре вы узнаете: + Как загрузить данные
📊Бесплатный вебинар: «Построение эффективных дашбордов с помощью Power BI»  💡На вебинаре вы узнаете: + Как загрузить данные в Power BI Desktop из различных источников  + Построение наглядных дашбордов для анализа данных  + Интерактивные возможности в Power BI - взаимодействие с визуальными элементами  + Применение базовых визуальных элементов и их настройка для лучшего понимания данных  + На практике вместе построим дашборд в Power BI ❓Кому будет полезен вебинар: - Аналитикам данных - Маркетологам - Продуктовым менеджерам - Всем, кто хочет визуализировать данные для принятия решений ⏰16 апреля(среда) в 20:00 мск Вебинар в рамках курса «BI-аналитика» 🎁После вебинара для вас активен промо-код со скидкой 5% до 18 мая: BI_04 👉Регистрация на вебинар: OTUS.RU Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576 #реклама О рекламодателе

+2
🎥 Минутное видео по тексту? Новый подход к генерации от исследователей! Генерация длинных видео — всё ещё вызов для ИИ. Self-attention не тянет по скорости, Mamba — по сложности сюжета. Но тут на сцену выходят TTT-слои (Test-Time Training) — и делают шаг вперёд. 🧠 В чём суть: — TTT-слои умеют использовать выразительные скрытые состояния, которые сами являются нейросетями. — Их добавляют в уже обученный трансформер — и он начинает генерировать минутные видео по текстовому сценарию с плавным движением и логичной историей. — Проверяли на мультстиле Tom & Jerry — и получили +34 Elo-балла в человеческой оценке по сравнению с Mamba 2 и другими сильными базовыми методами. ИИ уже близок к тому, чтобы полностью воспроизводить стили старых мультфильмов или аниме. Это может кардинально изменить производство анимации — вместо создания вручную, студии смогут "дообучать" модель и просто писать сценарии. Прикрепленное видео, было создано с помощью промпта и обучено на сотнях часов Тома и Джерри. Вот его полный промпт. ⚠️ Да, пока есть артефакты и ограничения — модель на 5B параметров и только минутные ролики. Но подход уже выглядит перспективным. Следим за развитием. 📌Demos: http://test-time-training.github.io/video-dit/ 📌Paper: http://test-time-training.github.io/video-dit/assets/ttt_cvpr_2025.pdf 📌Github: https://github.com/test-time-training/ttt-video-dit

⚡️ Pydoll — это библиотека на Python, предназначенная для автоматизации браузеров на движке Chromium (Chrome и Microsoft Edge
⚡️ Pydoll — это библиотека на Python, предназначенная для автоматизации браузеров на движке Chromium (Chrome и Microsoft Edge) без использования WebDriver. Инструмент имитирует «реальные» действия пользователя и обеспечивает гибкость при работе с элементами интерфейса и сетевыми запросами. 🔗 Ключевые особенности - Асинхронная автоматизация без WebDriver - Позволяет обойтись без установки и настройки драйверов WebDriver, что упрощает процесс интеграции и обслуживания. - Реализована на базе asyncio, поэтому поддерживает запуск нескольких задач одновременно. - Обход Cloudflare Turnstile - Имеется встроенный механизм для автоматического прохождения CAPTCHA: - Синхронная блокировка (context manager), когда выполнение кода приостанавливается до момента решения задачи. - Фоновый режим (non-blocking), когда автоматизация продолжает работу, пока CAPTCHA решается в фоне. - Поддерживает «человеко-подобный» набор текста (имитация пауз, скорости). - Распознаёт специальные клавиши и сочетания клавиш (нажатия SHIFT, CTRL, ALT и т.д.). - Подключение к существующим сессиям - Можно подсоединяться к уже запущенным экземплярам Chrome или Edge, что удобно для отладки или интеграции с имеющимися сессиями пользователя. Благодаря отсутствию необходимости в WebDriver и возможности имитировать взаимодействие «как настоящий пользователь», Pydoll будет полезен в проектах, где требуется гибкая и реалистичная автоматизация. 📌 Github @data_analysis_ml

Когда потратил 3 часа на отладку сгенерированного кода, который написал бы за час. @data_analysis_ml
Когда потратил 3 часа на отладку сгенерированного кода, который написал бы за час. @data_analysis_ml

😈 ​AnimeGamer — это модель, разработанная лабораторией ARC компании Tencent, предназначенная для создания бесконечных симуляций жизни в аниме-стиле. Она использует мультимодальные большие модели (MLLMs) для генерации динамичных анимационных сцен, отображающих движения персонажей и изменения их состояний. Учитывая исторический визуальный контекст, AnimeGamer обеспечивает последовательность и увлекательность игрового процесса. Применяя мультимодальные представления, ориентированные на действия, и видеодиффузионную модель, AnimeGamer создает высококачественные видеоролики, формируя захватывающий и постоянно развивающийся игровой опыт. https://huggingface.co/TencentARC/AnimeGamer

+2
🎮 Microsoft представила нейро-версию Quake II на базе Muse и WHAMM. Microsoft Research представила WHAMM — новую систему или технологию, предназначенную для моделирования окружающего мира в реальном времени, с особым акцентом на интерактивные среды. Это означает, что WHAMM способна быстро создавать и постоянно обновлять цифровую 3D-модель физического пространства, учитывая изменения, которые происходят в нем, в том числе в результате взаимодействия пользователя или других динамических событий. ▪ ИИ генерирует кадры в реальном времени, анализируя действия игрока. ▪Старая WHAMM — 1 fps, новая — 10 fps при 640×360, почти играбельно. Модель помнит последние 0,9 секунды, что добавляет случайности. Ключевая особенность — система работает достаточно быстро, чтобы обновлять модель мира практически мгновенно по мере поступления новых данных от сенсоров (вероятно, камер, датчиков глубины и т.д.). Это критически важно для плавного взаимодействия. 🔗 Играть в ИИ-версию Quake II можно здесь. @vistehno #microsoft #ai #quake #muse

📌 Как быстро запустить Llama 4 за 10 минут Если вы хотите попробовать новую Llama 4 Scout (п вот краткое руководство: ▪ Вам
+2
📌 Как быстро запустить Llama 4 за 10 минут Если вы хотите попробовать новую Llama 4 Scout (п вот краткое руководство: ▪ Вам нужна машина с четырьмя H100 на сервисе (пример под hyperbolic, вы можете арендовать в другом месте https://app.hyperbolic.xyz/compute) ▪ Подключитесь по SSH к серверу и запустите в терминале:

>> sudo apt-get update && sudo apt-get install -y python3-pip
>> pip install -U vllm
>> pip install -U "huggingface_hub[cli]"
▪ Запустите Llama 4 с помощью vllm:

>> vllm serve meta-llama/Llama-4-Scout-17B-16E-Instruct --tensor-parallel-size 4 --max-model-len 10000
▪ Проверьте работу модели, открыв новый терминал и выполнив запрос:

>> curl http://localhost:8000/v1/chat/completions \
    -H "Content-Type: application/json" \
    -d '{
        "model": "meta-llama/Llama-4-Scout-17B-16E-Instruct",
        "messages": [
            {"role": "system", "content": "You are a helpful assistant."},
            {"role": "user", "content": "What can I do in SF?"}
        ]
    }
Всего несколько команд и вы получите локально развернутую модель Llama 4 Scout и сможете работать с ней.

Repost from Machinelearning
🦙 Встречайте, дамы и господа, LLaMA 4: мультимодальные MoE модели! Llama 4 Omni разработана для понимания и обработки информ
🦙 Встречайте, дамы и господа, LLaMA 4: мультимодальные MoE модели! Llama 4 Omni разработана для понимания и обработки информации модальностей, а не только текста. Доступна в 3х вариантах: Llama 4 Scout и Llama 4 Maverick, Llama 4 Behemoth. У Llama 4 Scout (109B) контекстное окно размером 10 М, 17B активных параметров, 16 экспертов, может быть запущена на 1ом GPU! Llama 4 Maverick (400B) окно в 1M, 128 экспертов, 17B активных параметров. У Бегемота окно в 2T!!!, 16 экспертов, 288B активных параметров. - Model Card - Веса - Релиз @ai_machinelearning_big_data

Repost from Machinelearning
🦙 Встречайте, дамы и господа, LLaMA 4: мультимодальные MoE модели! Llama 4 Omni разработана для понимания и обработки информ
🦙 Встречайте, дамы и господа, LLaMA 4: мультимодальные MoE модели! Llama 4 Omni разработана для понимания и обработки информации из различных модальностей, а не только текста. Доступна в двух вариантах: Llama 4 Scout и Llama 4 Maverick. У Llama 4 Scout Контекстное окно размером 10 М! Llama 4 Maverick 1M. - Model Card https://www.llama.com/llama4/ @ai_machinelearning_big_data

🔥 OpenThinker2-32B: превосходит DeepSeekR1-32B в математике и Кодинге. OpenThinker2-32B набирает 76,7 баллов на AIME24, 90,8
🔥 OpenThinker2-32B: превосходит DeepSeekR1-32B в математике и Кодинге. OpenThinker2-32B набирает 76,7 баллов на AIME24, 90,8 на MATH500 и 64,1 на GPQA-D. Он набрал 90,8 баллов по MATH500, обойдя R1-Distill-32B (90. 0) . Это новый лидер на бенчмарке GPQA-D лидирует с результатом 64,1 по сравнению с R1-Distill-32B с результатом 65,8. https://huggingface.co/bartowski/open-thoughts_OpenThinker2-32B-GGUF @data_analysis_ml

Время протестировать CodeFest'15 31 мая и 1 июня в Новосибирске пройдет юбилейный CodeFest’15 — масштабная конференция для ИТ
Время протестировать CodeFest'15 31 мая и 1 июня в Новосибирске пройдет юбилейный CodeFest’15 — масштабная конференция для ИТ-специалистов. Приглашают тимлидов, проджектов, тестировщиков, фронтенд- и бэкенд-разработчиков, аналитиков, дизайнеров, техлидов и руководителей направлений. На мероприятии можно обсудить тренды с другими профессионалами и перезагрузиться в неформальной обстановке. В программе: — 10 потоков и 150+ докладов от топовых спикеров по направлениям от Backend до Web3; — живые дискуссии в формате «квартирников»; — нетворкинг с экспертами из разных компаний; — кофе-брейки и грандиозная афтепати. Больше информации — по ссылке

📌 FastRAG — фреймворк, предлагающий разработчикам современные инструменты для создания оптимизированных RAG-пайплайнов. Этот
📌 FastRAG — фреймворк, предлагающий разработчикам современные инструменты для создания оптимизированных RAG-пайплайнов. Этот сервис, построенный на базе Haystack и Hugging Face, фокусируется на эффективном сочетании информационного поиска с генеративными возможностями LLM. Фреймворк предоставляет готовые компоненты для работы с современными методами семантического поиска, оптимизированные под современные аппаратные ускорители, включая процессоры Intel Xeon и AI-акселераторы Gaudi. При этом FastRAG активно развивается — от поддержки мультимодальности до примеров динамического синтеза промптов. 🤖 GitHub @data_analysis_ml

IT_ONE Cup. ML Challenge от IT_ONE и Sk FinTech Hub — создай AI-ассистента, который будет помогать в работе дизайнерам, систе
IT_ONE Cup. ML Challenge от IT_ONE и Sk FinTech Hub — создай AI-ассистента, который будет помогать в работе дизайнерам, системным и бизнес-аналитикам. Участвуй онлайн с 12 по 29 апреля и поборись за 1 500 000 рублей и мерч. Регистрация открыта до 11 апреля: https://cnrlink.com/itonecupmldataanalysisai Твоя формула победы: ✅ Умеешь работать с готовыми моделями машинного обучения и адаптировать их под специфические задачи. ✅ Знаешь, как реализовать сложные системы на базе LLM и генеративных моделей. ✅ Готов создавать комплексные решения для автоматизации процессов. Также приглашаем Backend и Frontend-разработчиков, системных и бизнес-аналитиков, UI/UX-дизайнеров. Участвуй онлайн соло или командой до 5 человек.  Задачи IT_ONE Cup. ML Challenge: 🔤 Динамические контекстные подсказки для системного аналитика. 🔤 AI-генератор дизайн-макетов по описанию требований. 🔤 Система визуализации BPMN-диаграмм. Создай AI-ассистента, который облегчит выполнение рабочих задач — регистрируйся на IT_ONE Cup. ML Challenge: https://cnrlink.com/itonecupmldataanalysisai Реклама. ООО «ГПБ-ИТ1». ИНН 9717102235. erid: 2W5zFHaR9vG

🔥 ​DiffSynth-Studio-Lora-Wan2.1-ComfyUI - дистиллированный WAN! Это LoRA для интеграции с ComfyUI, основанные на Wan2.1-T2V-
🔥 ​DiffSynth-Studio-Lora-Wan2.1-ComfyUI - дистиллированный WAN! Это LoRA для интеграции с ComfyUI, основанные на Wan2.1-T2V-1.3B. : Поддерживается 4, 5, 6, 8, 10 и более шагов, что позволяет балансировать между качеством и временем генерации.​ На тестах получаются потрясающие результаты всего за 5 шагов! 🟡HF 🟡Пример

Опубликованыцена на API Gemini 2.5 Pro по сравнению с OpenAI GPT-4.5/o1. - $1.25/1M input for <200K tokens - $10/1M output
+2
Опубликованыцена на API Gemini 2.5 Pro по сравнению с OpenAI GPT-4.5/o1. - $1.25/1M input for <200K tokens - $10/1M output for <200K tokens - $2.50/1M input for >200K tokens - $15/1M output for >200K tokens Как вы считаете OpenAI завышает цены или Google демпингует ... 🤣 📌 Цены @data_analysis_ml

Уже успели занять место на главном ИТ-событии этой весны? До Data Fusion 2025 осталось меньше 2-х недель 🔔 Хватит бороться с
Уже успели занять место на главном ИТ-событии этой весны? До Data Fusion 2025 осталось меньше 2-х недель 🔔 Хватит бороться с данными — пора ими управлять! Присоединяйтесь к конференции Data Fusion 2025, пока еще есть возможность. Обсудим все ключевые вызовы Big Data и то, как с ними справляются компании. Это не просто доклады, а новейшие исследования и реальные кейсы от бизнес-лидеров, ученых и практиков: 📌 DataOps и автоматизация управления данными: как избежать хаоса в процессах 📌 Big Data + ИИ: генеративные модели для анализа массивных данных 📌 Где синтетические данные заменяют реальные: производственные сценарии, медицина, финтех. 📌 Как выстроить надежную и предсказуемую вычислительную инфраструктуру для масштабных моделей Вас ждут жаркие дебаты и обсуждения на самые острые темы в сфере искусственного интеллекта и данных. Не пропустите! 📅 16–17 апреля | Москва, технопарк «Ломоносов» Бесплатная регистрация — https://data-fusion.ru/. Времени осталось совсем мало. 👀 — *DataOps — методология разработки и предоставления данных *Big Data — большие данные