en
Feedback
Анализ данных (Data analysis)

Анализ данных (Data analysis)

Open in Telegram

Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Show more

📈 Analytical overview of Telegram channel Анализ данных (Data analysis)

Channel Анализ данных (Data analysis) (@data_analysis_ml) in the Russian language segment is an active participant. Currently, the community unites 50 601 subscribers, ranking 2 563 in the Technologies & Applications category and 12 197 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 50 601 subscribers.

According to the latest data from 03 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by 197 over the last 30 days and by 8 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 13.32%. Within the first 24 hours after publication, content typically collects 7.83% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 6 742 views. Within the first day, a publication typically gains 3 963 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 32.
  • Thematic interests: Content is focused on key topics such as llm, контекст, openai, архитектура, deepseek.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp

Thanks to the high frequency of updates (latest data received on 04 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

50 601
Subscribers
+824 hours
+757 days
+19730 days
Posts Archive
🚨 Китай выкатил мощнейшую новинку в AI-редактировании изображений — и она обошла Google Nanobanana, став №1! 🔥 Bytedance Se
🚨 Китай выкатил мощнейшую новинку в AI-редактировании изображений — и она обошла Google Nanobanana, став №1! 🔥 Bytedance Seedream 4 впечатляет: - ⚡️ Генерация в 2K за <2 секунд, поддержка 4K (🍌 ограничен низким разрешением) - 🎨 Более свободная политика генераций - 🖼️ Можно создавать сразу несколько картинок в одном сете - 🎯 Намного стабильнее: 🍌 часто просто возвращает исходное изображение 💰 Цена — всего $0.03 за генерацию. Идеально подходит для сторибордов к фильмам и фотореалистичных сцен. Гонка в AI-генерации картинок выходит на новый уровень! 🚀 https://fal.ai/models/fal-ai/bytedance/seedream/v4/edit

⚡️ На чистом SQL запустили легендарный DOOM — прямо внутри базы данных CedarDB! Игра не просто работает, а поддерживает многопользовательский режим, отрисовывая всё с помощью ASCII-графики. Каждый компонент — от рендера до синхронизации игроков — написан исключительно на SQL-запросах. 🎮 GitHub для настоящих ценителей извращённого кода: https://github.com/cedardb/DOOMQL

💰Perplexity привлекла $200M при оценке в $20B. Это произошло всего через два месяца после предыдущего раунда в $100M при оце
💰Perplexity привлекла $200M при оценке в $20B. Это произошло всего через два месяца после предыдущего раунда в $100M при оценке $18B. Общий объём инвестиций приближается к $1.5B. 📊 Выручка (ARR) уже почти $200M (месяц назад была $150M). 💡 Оценка в $20B при $200M ARR даёт мультипликатор ~100x - это возможно только при очень быстром росте и низком уровне оттока пользователей. Perplexity выделяется тем, что отвечает на запросы с источниками и краткими сводками, заменяя «охоту за ссылками» на результат, сгенерированный моделью. Но такой дизайн требует больших вычислительных мощностей: каждый запрос запускает веб-поиск, инференс LLM и генерацию ответа в реальном времени. Источник: https://techcrunch.com/2025/09/10/perplexity-reportedly-raised-200m-at-20b-valuation/ #AI #Perplexity #Funding #Startups #LLM #Investments

😄 12 сентября смотрите онлайн-студию первой «Ночи музеев» в мире IT В Яндексе придумали «Ночь музеев» в мире IT, а Сбер, Т-банк, Х5 и Lamoda поддержали идею и присоединились. Если вы не успели зарегистрироваться как офлайн-участник – подключайтесь онлайн. 🙌 Студия big tech night online будет работать 12 сентября с 18:00 до 21:00 по московскому времени. Можно переключаться между двумя треками. 😛😝В софт-треке вас ждут: – шоу для разработчиков со стендап-комиком Севой Ловкачёвым; – обсуждение pet-проектов и изобретательства среди инженеров; – юмор в борьбе со стрессами: мемы как способ выжить в бигтехе. 😋😛 В хард-треке: – разберём, чем отличается бигтех в России и за рубежом: каких специалистов ищут компании, есть ли культурные отличия? – поговорим с Маратом Мавлютовым – руководителем подразделения из Яндекса, разрабатывающего роботов-доставщиков; – обсудим, как AI помогает разработчикам сейчас и как будет помогать в будущем. 😌 Регистрируйтесь и подключайтесь. Реклама. ООО "Яндекс". ИНН 7736207543

🤖 Прорыв в наноботах Учёные из Penn State сделали важный шаг к созданию настоящих наноботов. 🔬 С помощью нового микро-флюид
🤖 Прорыв в наноботах Учёные из Penn State сделали важный шаг к созданию настоящих наноботов. 🔬 С помощью нового микро-флюидного устройства они создали крошечные частицы, которые могут обмениваться сигналами и действовать вместе — как муравьи, оставляющие следы для других. - Одна группа частиц двигалась по химическому градиенту и оставляла «след». - Другая группа улавливала этот след и шла за ним. 👉 Это выглядит просто, но именно так закладывается основа программируемых роёв наноботов. 💡 Возможные применения: - наночастицы находят опухоль и зовут другие с лекарством, - мини-системы доставляют груз в нужную клетку, - наноботы очищают организм от токсинов или восстанавливают повреждённые ткани. Раньше учёные могли наблюдать за таким процессом всего несколько секунд. Теперь, с новым инструментом Penn State, поведение можно изучать минутами, что позволяет проводить более сложные эксперименты. 🌱 Вдохновение пришло из природы — у пчёл и муравьёв есть распределение ролей и совместная работа. Если частицы смогут делать то же самое, это приблизит нас к самоорганизующимся автономным наносистемам, которые могут изменить медицину и материалы. Это пока ранняя стадия, но именно такие шаги строят фундамент для будущих роёв наноботов. https://www.psu.edu/news/eberly-college-science/story/can-nanobots-play-follow-leader

⚡ Ускорение PyTorch-инференса на Apple-устройствах на 87% с помощью AI-сгенерированных Metal-ядр В новом исследовании показан
⚡ Ускорение PyTorch-инференса на Apple-устройствах на 87% с помощью AI-сгенерированных Metal-ядр В новом исследовании показано, как AI-модели автоматически генерируют оптимизированные GPU-ядра под Metal, которые ускоряют работу PyTorch на устройствах Apple. 📊 Результаты: - В среднем прирост скорости - 87% на 215 модулях. - Некоторые ядра работают в сотни раз быстрее базового уровня. 🟢 Как это работает: - Используется agentic swarm-подход - несколько агентов генерируют и тестируют варианты ядер. - В контекст добавляются CUDA-референсы и данные профилирования, что помогает создавать более эффективные ядра. - Такой метод превосходит одиночные модели, генерирующие код без дополнительного контекста. Fвтоматическая генерация GPU-ядер AI-моделями открывает путь к более быстрому и доступному инференсу прямо «из коробки» на Mac и iOS. 🔗 Подробности: https://gimletlabs.ai/blog/ai-generated-metal-kernels

📖 Новая работа ByteDance + Harvard: *Mycroft: Tracing Dependencies in Collective Communication Towards Reliable LLM Training
📖 Новая работа ByteDance + Harvard: *Mycroft: Tracing Dependencies in Collective Communication Towards Reliable LLM Training* Mycroft - система, которая помогает понять, почему обучение LLM на кластере GPU тормозит или падает. 🚧 Проблема При распределённом обучении сотни GPU постоянно обмениваются данными через библиотеку NCCL. Она работает как «чёрный ящик»: при сбое видно только таймауты или падение скорости, но непонятно, где именно сбой. 🛠 Решение — Mycroft - «Подглядывает» внутрь процесса обмена данными - Каждые 100 мс пишет лёгкие статусы: сколько данных подготовлено, отправлено и завершено - Если прогресс застопорился → сразу сигнал - Отслеживает зависимости между GPU и определяет: проблема в конкретной карте, сетевой карте или шине ⚡ Результаты - В тестах на 32 GPU и в проде у ByteDance - Находит сбой за ~**15 секунд** - Указывает точный компонент за <**20 секунд** - Нагрузка на обучение почти нулевая 🔗 https://arxiv.org/abs/2509.03018 #AI #LLM #GPU #DistributedTraining #ByteDance #Harvard

Ты: «Эх, вот бы кто-то научил анализировать данные, чтобы у меня было больше шансов поступить в вуз и начать карьеру…» Яндекс
Ты: «Эх, вот бы кто-то научил анализировать данные, чтобы у меня было больше шансов поступить в вуз и начать карьеру…» Яндекс Лицей: «Ок» Запускаем новый набор для учащихся школ и колледжей на инстивный, трёхмесячный курс по анализу данных. Научим работать с Python не в теории, а на практике: верно анализировать, точно делать выводы и красиво показывать результаты. Сделали такой онлайн-курс, чтобы мог пригодиться и в обучении, и в карьере. Поэтому: 1. Сделали упор на практику и только нужную теорию 2. Только те задачи, которые действительно решают в компаниях 3. Ввели командную разработку Ну и финальное: после обучения получите именной сертификат. Он может помочь получить дополнительные баллы при поступлении в некоторых вузах. Обучение в Яндекс Лицее бесплатно, но есть отбор. Он открыт до 23 сентября. Вся программа, подробности и регистрация на новый поток по ссылке.

🚀 NVIDIA представила Rubin CPX — новый класс GPU для inference с огромным контекстом 🔑 Что интересно - Rubin CPX — специали
🚀 NVIDIA представила Rubin CPX — новый класс GPU для inference с огромным контекстом 🔑 Что интересно - Rubin CPX — специализированный GPU для обработки контекста размером до миллиона токенов (код, видео, длинные последовательности). - Интеграция в платформу Vera Rubin NVL144 CPX: - До 8 экзафлопс вычислений ИИ - 100 ТБ быстрой памяти - 1,7 ПБ/с пропускной способности - Превосходит GB300 NVL72 по производительности на 7,5×. - Характеристики: - 30 PFLOPS вычислений в NVFP4 - 128 ГБ GDDR7 памяти - 3× ускоренные attention-механизмы для длинного контекста - Поддержка всего AI-стека NVIDIA: Dynamo, Nemotron, CUDA-X, AI Enterprise. - Выход ожидается в конце 2026 года. 📌 Зачем это важно - Масштаб контекста до миллиона токенов открывает новые горизонты в кодогенерации и видео-ИИ. - Уникальная комбинация памяти и вычислений делает возможным реальный SOTA-инференс для задач с длинной «памятью». - Уже интерес вызывает у таких игроков, как Cursor (AI-редактор кода), Runway (видео-генерация) и Magic (модели-агенты). 🧭 Итог Rubin CPX задаёт новый стандарт для аппаратной архитектуры в AI. Это фундамент для моделей, которые смогут полноценно работать с огромными контекстами, не теряя деталей и качества. https://nvidianews.nvidia.com/news/nvidia-unveils-rubin-cpx-a-new-class-of-gpu-designed-for-massive-context-inference

💾 Зачем нужен Delta Lake, если есть Parquet Обычный Parquet хранит только одно состояние таблицы. Если вы сохранили отфильтр
💾 Зачем нужен Delta Lake, если есть Parquet Обычный Parquet хранит только одно состояние таблицы. Если вы сохранили отфильтрованный DataFrame, то старые данные исчезли навсегда. ❌ Отката (rollback) нет → потеряли 10 000 строк, осталось только 3 500. ⚡ Delta Lake работает иначе: - каждый раз создаётся новая версия данных - можно вернуться к любой версии в прошлом - данные всегда под контролем и без потерь 📌 Пример: - Parquet → фильтр → оригинал стёрт - Delta Lake → версия 0 (10 000 строк) + версия 1 (3 500 строк) → всегда можно вернуться к версии 0 ✅ Итог: с Delta Lake данные становятся версионируемыми и надёжными. #datalake #parquet #bigdata #delta

⚡️ DeepCode — открытая AI-платформу для автоматической генерации кода. DeepCode превращает научные статьи и технические докум
⚡️ DeepCode — открытая AI-платформу для автоматической генерации кода. DeepCode превращает научные статьи и технические документы в готовые проекты, включая фронтенд, бэкенд и полноценные репозитории. 🔹 Основные возможности: • Paper2Code — реализация идей из исследований в рабочий код • Text2Web — генерация интерфейсов по описанию • Text2Backend — автоматическое создание масштабируемых серверов • Поддержка длинных документов и многофайловых проектов 🔜 В ближайшее время разработчики обещают: • Автоматическую проверку и валидацию кода • Повышение скорости генерации • Улучшенную работу с требованиями • Бенчмарки воспроизведения научных статей (PaperBench) Проект полностью open source: https://github.com/HKUDS/DeepCode #deepcode #AI #coding

🛢 В мире, где данные — новая нефть, растёт спрос на дата-инженеров. Ведь именно они знают, как такую нефть добывать, обрабат
🛢 В мире, где данные — новая нефть, растёт спрос на дата-инженеров. Ведь именно они знают, как такую нефть добывать, обрабатывать и хранить. И пока компании осознают потребность в этих специалистах, конкуренция на рынке низкая, а зарплаты — высокие. Освоить ключевые компетенции дата-инженера поможет онлайн-магистратура Нетологии и НИУ ВШЭ «Инженерия данных». За 2 года вы на практике изучите Python, Java, Scala, Kotlin и SQL, научитесь проектировать пайплайны и обрабатывать данные, работать с системами хранения данных и базами данных в облаке. Программа даёт широкий простор для переквалификации, поэтому после учёбы сможете перейти в MLOps, DevOps или менеджмент. Онлайн-формат позволяет учиться без отрыва от привычной жизни и совмещать занятия с работой. При этом у вас будет отсрочка от армии, льготы на проезд и все остальные бонусы очного обучения. Станьте магистром программной инженерии с дипломом одного из лучших вузов страны и получите веское преимущество при приёме на работу: https://netolo.gy 🎁 В этом году при поступлении на программу вы получаете курс по ещё одной IT-профессии в подарок — отличная возможность расширить свой профиль и усилить CV. Реклама. ООО "Нетология". ИНН 7726464125. Erid: 2VSb5wgUXnq

🔥 OpenAI объявила о перестройке команд ➡️ Команда Model Behavior (14 человек), которая занималась настройкой “личности” Chat
+1
🔥 OpenAI объявила о перестройке команд ➡️ Команда Model Behavior (14 человек), которая занималась настройкой “личности” ChatGPT, снижением угодничества и проработкой политической предвзятости, теперь войдёт в состав более широкой Post-Training org. 👩‍💻 Её основатель, Джоанн Джанг, запускает новый экспериментальный проект OAI Labs, где будут тестировать свежие форматы взаимодействия человека и ИИ. ⚡ Перемены показывают: управление личностью модели становится ключевым направлением разработки. Это ответ OpenAI на жалобы пользователей на “холодные” ответы GPT-5 и продолжающиеся дискуссии о безопасности чатботов.

📊 Неожиданная статистика по ИИ-ассистентам Сообщают, что Microsoft Copilot значительно опережает Gemini по числу пользовател
📊 Неожиданная статистика по ИИ-ассистентам Сообщают, что Microsoft Copilot значительно опережает Gemini по числу пользователей. На первый взгляд это выглядит странно. Возможное объяснение: речь идёт не о реальном использовании, а о количестве активированных аккаунтов и доступе по умолчанию (Copilot встроен в Windows и Office). Ещё более удивительно, что Claude якобы сильно отстаёт — и это тоже вызывает вопросы, ведь его активно используют в сообществе. ⚡️ Мораль: статистику по ИИ стоит читать внимательно — важно, что именно считают: доступ, активации или реальное использование. https://gs.statcounter.com/ai-chatbot-market-share#monthly-202508-202508-bar #ai #copilot #gemini #claude

📊 Неожиданная статистика по ИИ-ассистентам Сообщают, что Microsoft Copilot значительно опережает Gemini по числу пользовател
📊 Неожиданная статистика по ИИ-ассистентам Сообщают, что Microsoft Copilot значительно опережает Gemini по числу пользователей. На первый взгляд это выглядит странно. Возможное объяснение: речь идёт не о реальном использовании, а о количестве активированных аккаунтов и доступе по умолчанию (Copilot встроен в Windows и Office). Ещё более удивительно, что Claude якобы сильно отстаёт — и это тоже вызывает вопросы, ведь его активно используют в сообществе. ⚡️ Мораль: статистику по ИИ стоит читать внимательно — важно, что именно считают: доступ, активации или реальное использование. https://gs.statcounter.com/ai-chatbot-market-share#monthly-202508-202508-bar #ai #copilot #gemini #claude

Эксперты на South Hub объявили о третьей революции знаний: после письменности и интернета — эра ИИ Специалисты, включая топ-м
Эксперты на South Hub объявили о третьей революции знаний: после письменности и интернета — эра ИИ Специалисты, включая топ-менеджеров технологической платформы «Авито», убеждены: открытые языковые модели запустили новую «золотую лихорадку». Андрей Рыбинцев, управляющий директор по ИИ компании, отмечает: «Теперь каждый энтузиаст, исследователь в университете, стартап может экспериментировать с большими моделями». Одно из ключевых изменений — трансформация традиционных интерфейсов. Вместо схемы «запрос → изучение → клик» приходит естественный диалог: описал проблему — получил решение. Один ИИ-агент способен заменить тысячи узкоспециализированных приложений. “Конечно человек нужен ИИ, но нужен уже немножко в другом качестве – разработчик становится скорее системным архитектором. Больше руководит процессом как дирижер оркестра из многочисленных ИИ-помощников”, — отметил Олег Королев, руководитель разработки AI Lab Авито. Исчез технологический скептицизм. Даже консервативные эксперты говорят о революции с горящими глазами. Темп изменений таков, что прогнозы на 2-3 года уже кажутся наивными. Единственная уверенность — наши представления о будущем кардинально изменятся. Смотреть: Youtube | VK-видео | Rutube | Аудиоверсия Подпишитесь на полезные каналы Авито

🧩 Как GPT модели менялись от GPT-2 до gpt-oss Себастьян Рашка написал статью о том, какие архитектурные фишки появились в но
+3
🧩 Как GPT модели менялись от GPT-2 до gpt-oss Себастьян Рашка написал статью о том, какие архитектурные фишки появились в новых open-weight моделях OpenAI — gpt-oss. 📌 Что изменилось: • Добавили Mixture-of-Experts — модель выбирает только часть экспертов, что даёт больше мощности без взрыва по параметрам. • Ввели Grouped Query Attention — ускоряет работу с большими контекстами. • Появились sliding-window слои — можно обрабатывать длинные тексты эффективнее. • gpt-oss оптимизировали под reasoning, работу с инструментами и агентов. ✏️ Автор сравнивает gpt-oss с Qwen3 и другими моделями, показывая, как эволюция архитектуры влияет на скорость и качество. 👉 Полный разбор тут: https://magazine.sebastianraschka.com/p/from-gpt-2-to-gpt-oss-analyzing-the

📄 FinePDFs — крупнейший публично доступный корпус, собранный только из PDF-документов! - Объём: около 3 трлн токенов из 475
+2
📄 FinePDFs — крупнейший публично доступный корпус, собранный только из PDF-документов! - Объём: около 3 трлн токенов из 475 миллионов документов на 1733 языках - Данные извлечены из 105 снимков CommonCrawl (с 2013 по 2025 гг.) и дополнительно скачаны из интернета - Общий размер: ~20 ТБ, проведена дедупликация и фильтрация - Даже при минимальной фильтрации качество FinePDFs сравнимо с лучшими HTML-корпусами - При смешивании с веб-данными достигается новое SoTA по ряду бенчмарков - Полностью воспроизводим, лицензия ODC-By 1.0 - В ближайшее время появится код воспроизведения и эксперименты на GitHub 🔗 HF: https://huggingface.co/datasets/HuggingFaceFW/finepdfs @data_analysis_ml

🧩 ArcMemo — память для LLM, которая учит модель сохранять и переиспользовать концепты при решении задач. 📈 Результат: +7.5%
🧩 ArcMemo — память для LLM, которая учит модель сохранять и переиспользовать концепты при решении задач. 📈 Результат: +7.5% относительно базовой модели на бенчмарке ARC-AGI. ❓ Проблема: Обычно длинные цепочки рассуждений исчезают после каждого запроса, и модель «забывает» полезные паттерны. 💡 Решение — ArcMemo: - Сохраняет абстрактные модули в виде концептов на естественном языке или в виде параметрических мини-функций. - Концепты бывают двух типов: - Открытые: описание ситуации + подсказка. - Программные: псевдокод и функции с параметрами. - После решения задача конспектируется в набор таких концептов. - При новой задаче модель подбирает релевантные концепты и комбинирует их для решения. - С обратной связью на тестах память обновляется и расширяется. 📌 Вывод: память в виде модульных концептов повышает переносимость и делает решения более стабильными. 🔗 Paper: arxiv.org/abs/2509.04439 #AI #LLM #ARCAGI #Reasoning #Memory

⚡️ Важные выводы из судебного дела, где Anthropic согласилась выплатить минимум $1,5 млрд авторам и издателям: - Не всё обуче
+1
⚡️ Важные выводы из судебного дела, где Anthropic согласилась выплатить минимум $1,5 млрд авторам и издателям: - Не всё обучение на книгах незаконно. Проблема только в использовании пиратских копий из LibGen и PiLiMi. - Это будет самая крупная компенсация по авторскому праву в истории. - Авторы получат примерно $3,000 за каждую книгу (около 500,000 произведений). - Anthropic обязана в течение 30 дней после финального решения суда удалить все файлы LibGen и PiLiMi и их копии. - Деньги будут делиться между авторами и издателями по заявкам. - Суд уточнил: обучение на купленных и отсканированных книгах может считаться «fair use», но на пиратских книгах — нет. ⚖️ Решение задаёт новый прецедент для всей индустрии AI. deadline.com/wp-content/uploads/2025/09/anthropic3_Redacted.pdf