Анализ данных (Data analysis)
Data science, наука о данных. @haarrp - админ РКН: clck.ru/3FmyAp
Больше📈 Аналитический обзор Telegram-канала Анализ данных (Data analysis)
Канал Анализ данных (Data analysis) (@data_analysis_ml) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 50 599 подписчиков, занимая 2 550 место в категории Технологии и приложения и 12 134 место в регионе Россия.
📊 Показатели аудитории и динамика
С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 50 599 подписчиков.
Согласно последним данным от 15 сентября, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило 194, а за последние 24 часа — 1, при этом общий охват остаётся высоким.
- Статус верификации: Не верифицирован
- Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 10.74%. В первые 24 часа после публикации контент обычно набирает 7.91% реакций от общего числа подписчиков.
- Охват публикаций: В среднем каждый пост получает 5 434 просмотров. В течение первых суток публикация набирает 4 002 просмотров.
- Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 32.
- Тематические интересы: Контент сосредоточен на ключевых темах, таких как llm, контекст, openai, архитектура, deepseek.
📝 Описание и контентная политика
Автор описывает ресурс как площадку для выражения субъективного мнения:
“Data science, наука о данных.
@haarrp - админ
РКН: clck.ru/3FmyAp”
Благодаря высокой частоте обновлений (последние данные получены 16 сентября, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.
Загрузка данных...
| Дата | Привлечение подписчиков | Упоминания | Каналы | |
| 16 сентября | +10 | |||
| 15 сентября | +12 | |||
| 14 сентября | +14 | |||
| 13 сентября | +34 | |||
| 12 сентября | +12 | |||
| 11 сентября | +7 | |||
| 10 сентября | +13 | |||
| 09 сентября | +20 | |||
| 08 сентября | +12 | |||
| 07 сентября | +15 | |||
| 06 сентября | +11 | |||
| 05 сентября | +9 | |||
| 04 сентября | +11 | |||
| 03 сентября | +18 | |||
| 02 сентября | +16 | |||
| 01 сентября | +43 |
| 2 | 🔥 Один из создателей технологий, которые привели к ChatGPT, запустил модель, которая вообще не генерирует текст.
Диогу Алмейда после двух лет stealth представил TypeSafe AI и первую модель нового класса — Jev.
Идея радикально отличается от обычных LLM:
неструктурированные данные → типизированное решение → вероятность
Jev не пишет ответы словами. Вместо этого модель возвращает значения, которые программа может использовать напрямую: выбор варианта, оценку, вероятность события.
Для обучения TypeSafe разработала свой метод — RLCD (Reinforcement Learning for Calibrated Decisions).
По данным компании:
- отклик — 70–500 мс
- 20–200× быстрее frontier-моделей на таких задачах
- 40–400× дешевле
- input — $0,042 за 1 млн токенов
- output — бесплатно
Целевые сценарии: классификация, маршрутизация, scoring, extraction и автоматические решения внутри программ.
Важный нюанс: заявление «не галлюцинирует» означает прежде всего то, что модель не генерирует произвольный текст и работает в заданной типизированной схеме. Это не гарантия абсолютной правильности решения.
Jev уже доступен в early access. Цифры производительности пока в основном основаны на внутренних тестах TypeSafe.
https://x.com/Machinelearrn/status/2100178485641683200 | 1 825 |
| 3 | Команды нет — это не причина пропустить КосмоХакатон
18–20 сентября, Санкт-Петербург, Красноярск или онлайн из любой точки страны. На платформе есть подбор команды: регистрируетесь один, указываете, что умеете, и находите недостающих
К двум задачам, о которых писали раньше, добавились ещё две.
Санкт-Петербург - космонавт в открытом космосе. Солнечные вспышки, геомагнитные бури, радиация меняются по часам, решение о выходе принимают по прогнозу. Команде предстоит выделить ключевые угрозы и собрать техническое решение для их анализа. Данные, физика, инженерия.
Красноярск - зелёные финансы. Углеродные кредиты продаются под обещание, что где-то растёт лес, и проверить это обещание можно со спутника. Команде предстоит собрать платформу для токенизации и продажи кредитов, привязанных к реальному состоянию лесного массива. Данные, финансы, продукт.
Фонд площадок — 1,2 млн ₽ и 600 тыс. ₽. Лучшие забирают приз и билет в московский финал 25–27 сентября на 2,4 млн рублей.
Подробности и регистрация | 1 833 |
| 4 | 🚨 Дженсен Хуанг выступил против идеи замедлять развитие frontier AI и вводить новые законы для отрасли.
На Dreamforce глава NVIDIA заявил:
«Если вы не уверены в безопасности продукта - просто не выпускайте его».
По его мнению, безопасность и скорость разработки не противоречат друг другу. Компании должны тестировать системы, при необходимости делать паузу, но когда уверены в продукте, «бежать настолько быстро, насколько могут».
Хуанг прямо сказал:
**«Нам не нужны новые законы. Нам не нужны новые регуляции».**
Он называет безопасность прежде всего инженерной задачей и считает, что существующие рыночные механизмы уже заставляют компании не выпускать опасные продукты.
Это прямо расходится с позицией Дарио Амодея и других руководителей AI-лабораторий, которые в последние дни призывают сильнее координировать темпы развития и стандарты | 2 040 |
| 5 | 🔥 Google Research предложила способ ускорить сложный AI-поиск без длинного reasoning на каждом запросе
Новый подход называется Retrieve-for-Train.
Идея: вместо того чтобы каждый раз заставлять LLM долго думать и генерировать десятки sub-query, тяжёлую работу переносят в обучение.
Схема такая:
query → RL-обученный fan-out LM → синтетические target-наборы → компактный diffusion retriever
В итоге на inference уже не нужен большой chain-of-thought.
Google обучила компактный 53.9M diffusion retriever, который генерирует весь набор направлений поиска сразу, одним неавторегрессионным проходом.
Результат:
- 12–20× быстрее autoregressive-подходов
- latency остаётся от sub-second до нескольких секунд
- выше diversity, alignment и recall
- меньше дублирующихся sub-query
- не нужны human labels для supervision
Самое интересное: RL здесь используется не как дорогой online reasoning engine, а как одноразовый механизм, который «компилирует» сложное поведение в более дешёвую модель.
Для production-поиска это очень сильная идея: сложное reasoning делается заранее, а inference остаётся быстрым.
https://research.google/blog/bypassing-inference-bottlenecks-accelerating-complex-ai-search-with-retrieve-for-train/ | 2 685 |
| 6 | 🔥 Agentic coding уже ломает привычный CI: у Anthropic объём CI-задач вырос в 25 раз всего за 6 месяцев
Причина простая: инженеры выпускают примерно в 8 раз больше кода, около 80% которого пишет Claude, а количество тестов в кодовой базе выросло в 10 раз.
Старый test-selection сервис начал захлёбываться. Anthropic прошла три стадии:
больше CPU → sharding → ежедневные рестарты
Первая мера продержалась 70 дней, вторая — 29 дней, третья — меньше суток.
В итоге архитектуру переделали полностью: listener стал stateless, результаты CI складываются в общий журнал в in-memory store, а отдельный consumer агрегирует историю тестов. Это позволило горизонтально масштабировать обработку.
Новая система была собрана одним инженером примерно за 3 недели. По оценке Anthropic, год назад такая переделка заняла бы около квартала.
Главный совет команды на эпоху coding agents: проектируйте CI сразу под нагрузку в 10–25 раз выше текущей.
https://claude.com/blog/agentic-coding-is-straining-ci-heres-how-we-scaled-test-impact-analysis-at-anthropic | 3 998 |
| 7 | 🔥 Spark-X2.5-4B - компактная 4B-модель с нативным контекстом до 1M токенов
Модель заточена под локальный запуск и при небольшом размере умеет reasoning, coding, tool use и agentic workflows, а также заявляет поддержку 200+ языков.
По данным авторов:
- 44.4 — SWE-Bench Pro
- 40.9 — BrowseComp
- 90.7 — AIME 2026
- 54.6 — MCP-Atlas
Для локального запуска уже доступны BF16, INT8, GGUF-кванты от Q2 до Q8/IQ, MLX 4/8-bit и ONNX. Есть варианты для Apple Silicon, Linux CPU и NVIDIA GPU.
У свежего llama.cpp уже появилась поддержка архитектуры spark2_5, поэтому GGUF можно запускать через совместимые актуальные runtime. Полный контекст в 1M токенов, конечно, потребует намного больше памяти, чем обычный локальный сценарий.
Модель: https://huggingface.co/XHToken/Spark-X2.5-4B
GGUF: https://huggingface.co/XHToken/Spark-X2.5-4B-GGUF | 3 185 |
| 8 | Вопрос уже не в том, нужен ли ИИ, а в том, как его внедрять и масштабировать
Найдем ответ на бесплатной конференции 8 октября
Все об эффективном и безопасном внедрении ИИ в бизнес расскажут эксперты топовых технологических компаний на конференции Selectel ТехноДень в Москве.
На повестке:
🔺Как использовать генеративный ИИ в компании без хаоса и получать от этого измеримый эффект: от теории до реальных кейсов.
🔺Как ускорить внедрение ИИ в бизнес-процессы и минимизировать риски для бизнеса с помощью инструментов ИБ.
🔺Какую ИТ-инфраструктуру выбрать для инференса и обучения моделей.
Кроме 20 экспертных докладов и 20 интерактивных стендов, в финале вечера вас ждет живая запись подкаста Вселенная Плюс на главной сцене конференции.
Присоединяйтесь к Selectel ТехноДень, чтобы лично задать вопросы экспертам рынка и обменяться опытом. Количество мест ограничено, регистрируйтесь уже сейчас →
Реклама. АО "Селектел". erid:2W5zFK7dGWM | 2 964 |
| 9 | Tencent Hunyuan представила EvolveScaler - бенчмарк и датасет для проверки того, умеют ли LLM рассуждать в мире, где информация постоянно меняется.
Пример задачи: модель читает журнал RPG за 40 дней, после чего получает вопрос, если на 7-й день пропустить мини-босса, получится ли всё равно победить финального босса?
Прямого ответа в тексте нет. Нужно фактически «переиграть» цепочку событий с изменённым условием.
Авторы называют это Information Evolution: записи могут отменяться, исправляться и дополняться задним числом, поэтому простого поиска фактов в длинном контексте недостаточно.
EvolveScaler строится наоборот:
- сначала мир задаётся как исполняемая машина состояний
- логика и зависимости между событиями контролируются кодом
- затем эта история преобразуется в естественный язык
- модель должна восстановить состояние мира и просчитать последствия изменений
Масштаб:
- 117 прототипов сценариев
- 159 типов вопросов
- 5 уровней сложности
- до ~1200 событий в одном примере
Авторы протестировали 14 frontier-моделей. На самом сложном уровне медианный avg@5 падает до 11,3%.
При этом обучение на EvolveScaler дало в среднем +5,25 пункта на 8 внешних бенчмарках, которые не использовались при создании датасета.
Работа проверяет не только понимание длинного контекста, а способность модели поддерживать изменяющееся состояние мира, учитывать исправления и пересчитывать последствия контрфактических изменений.
Paper:
https://arxiv.org/abs/2609.08435
Project:
https://tencent-hunyuan.github.io/evolve-scaler/ | 3 090 |
| 10 | ⚡Трамп жёстко прошёлся по Дарио Амодею и фактически отверг идею замедления гонки ИИ.
После призывов главы Anthropic снизить темп разработки frontier-моделей ради безопасности Трамп написал, что ИИ не нужны новые «ограничители», кроме «сильного и умного президента». Он отдельно упомянул Амодеи, обвинил противников ускоренного развития ИИ в игре на руку Китаю и заявил, что США уже обладают достаточными уголовными и регуляторными полномочиями над ИИ-компаниями.
Самая жёсткая часть:
> «Treasonists, Traitors, and Leakers, BEWARE!»
На этом фоне предложение Амодея о «Pacing the Frontier» - дать индустрии ещё 1–2 года на усиление контроля и безопасности, выглядит всё сложнее реализуемым на уровне США.
Гонку, похоже, тормозить никто не собирается. | 3 929 |
| 11 | Хакатон на космических данных. Санкт-Петербург, Красноярск или онлайн из любой точки страны.
Стартуем 18 сентября.
За выходные участники доводят одну из задач до рабочего решения.
Санкт-Петербург. К 2035 году над Землёй должен работать топливный узел, у которого заправляются корабли, и откуда он будет получать топливо - с Земли, с Луны или из резерва - пока не решил никто. Команде предстоит собрать схему поставок, посчитать резервы и решить, во что вкладываться сразу. Призовой фонд 1,2 млн ₽.
Красноярск. Спутник видит горящий лес раньше любого наземного поста, но вместе с пожаром ловит нагретые крыши, факелы на месторождениях и блики на воде. Команде предстоит научить сервис отличать настоящий очаг от шума, обвести гарь и выдать площадь в гектарах. Призовой фонд 600 тыс. ₽.
Лучшие забирают приз на площадке и билет в московский финал 25–27 сентября, где разыграют ещё 2,4 млн рублей.
Команда 3–5 человек, недостающих можно найти на платформе.
Регистрация по ссылке космохакатон.рф | 3 493 |
| 12 | 🐠Sakana AI представила PC-ALM - метод обучения глубоких нейросетей без классического обратного распространения ошибки.
Главный результат: PC-ALM смог обучать нейросети глубиной до 1000 слоёв, используя только локальные взаимодействия между соседними слоями.
Обычное глубокое обучение почти полностью опирается на backpropagation: ошибка считается на выходе сети, после чего градиенты передаются назад через все слои.
PC-ALM работает иначе.
Каждый слой рассматривается как локальная динамическая система, которая пытается уменьшить собственную ошибку предсказания. Вместо глобального прохода градиента используются:
- локальные ошибки предсказания
- множители Лагранжа
- расширенный лагранжиан
- локальная динамика состояний
- PI-регуляция внутри каждого слоя
Метод вырос из predictive coding — подхода, популярного в NeuroAI. В predictive coding каждый слой постепенно корректирует своё состояние так, чтобы уменьшать рассогласование с соседними слоями.
Проблема в том, что в очень глубоких сетях такие сигналы плохо распространяются: информация об ошибке с выхода сети затухает раньше, чем достигает внутренних слоёв.
PC-ALM добавляет специальные двойственные переменные — по сути дополнительные нейроны, представляющие множители Лагранжа. Они помогают передавать сигнал ошибки через большое число слоёв.
Авторы связывают этот подход с классической работой Яна Лекуна 1988 года, где множители Лагранжа для многослойной сети можно связать с градиентами функции потерь.
В результате получается обучение, где глобальная задача оптимизации раскладывается на множество локальных динамических процессов.
Особенно хорошо PC-ALM показал себя на очень глубоких и узких сетях, где обычный predictive coding начинает ломаться.
Помимо NeuroAI, подход может быть интересен для нейроморфного железа: там локальные вычисления и физическая динамика потенциально дешевле классического backpropagation на GPU.
Блог: https://pub.sakana.ai/pc-alm/
Статья: https://arxiv.org/abs/2605.31022
Код: https://github.com/SakanaAI/pc-alm | 2 551 |
| 13 | Когда крупнейшие CEO в области ИИ начинают тормозить, приходится спросить: что они знают такого, чего не знаем мы? | 3 348 |
| 14 | 🔥 Qwen3.8-27B можно запускать локально на Mac с Apple Silicon - вышла 4-битная сборка для MLX.
Команда LM Studio подготовила версию модели на 27 млрд параметров, оптимизированную для чипов Apple. Она поддерживает текст и изображения, а файлы занимают около 16,1 ГБ.
Но 16,1 ГБ на диске не означает, что хватит Mac с 16 ГБ памяти. Дополнительная память нужна системе, вычислениям и кешу контекста.
В исходной публикации ориентир - 24 ГБ объединённой памяти, а для изображений и длинных рассуждений — 32 ГБ. В карточке сборки эти требования не подтверждены; расход памяти зависит от настроек и длины контекста.
https://huggingface.co/lmstudio-community/Qwen3.8-27B-MLX-4bit | 3 665 |
| 15 | Сильные аналитики давно делают для бизнеса больше, чем отчеты и дашборды.
Они помогают понять, что происходит, находят причины проблем, проверяют гипотезы и дают руководителям основу для решений.
Именно для таких специалистов мы сделали Cortex Challenge — соревнование, где можно показать весь масштаб своих навыков, подход к аналитике и умение превращать данные в бизнес-решения.
Вам достанется виртуальная компания с реальной бизнес-проблемой.
Ваша задача — разобраться в ситуации, найти настоящую проблему, сформировать решение и защитить его перед экспертами.
А для победителей — крупнейший призовой фонд в сфере BI-аналитики: 1 000 000 ₽. Шесть победителей разделят его между собой: три призовых места и три специальные профессиональные номинации.
Стартуем 25 сентября 🔥
Если для вас аналитика — это способ влиять на бизнес, присоединяйтесь к Cortex Challenge!
Будте в курсе новостей с @visiology_official | 3 242 |
| 16 | We Must Pace the Frontier | 3 453 |
| 17 | 🔥 DeepSeek-V4.1-Flash теперь можно запустить локально в UNCENSORED FP8-версии
Авторы утверждают, что отказный контур удалён прямо на уровне весов, поэтому модель практически перестаёт уходить в refusals.
База при этом остаётся очень мощной:
552B MoE, 8B/16B активных параметров, контекст до 1M, vision, DSpark, CSA2 и Engram.
На HarmBench-320 авторы заявляют рост ASR:
- с 42,8% до 100% при effort=off
- с 1,6% до 100% при effort=max
MMLU при этом снижается с 86,96% до 82,74%, а при удалении ethics-кластера падение около 1,1 п.п.
У исходной модели усиленное reasoning, наоборот, делало поведение безопаснее. Здесь этот путь вырезали непосредственно из весов.
https://huggingface.co/dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 | 3 707 |
| 18 | 🚨 Исследователь Chaofan Shou утверждает, что купил около 6 ТБ данных у одного из китайских AI-routing сервисов — и внутри якобы оказались чувствительные доступы к инфраструктуре крупных компаний и госструктур.
По его словам, среди данных были SSH-ключи, VPN-конфиги, облачные ключи и GitLab-токены, потенциально связанные с 7 государственными организациями и 19 крупными компаниями, включая Huawei, Xiaomi и NIO.
Если это подтвердится, история показывает довольно неприятную реальность: огромный объём чувствительных данных может утекать не через «кибервойну», а через обычную инфраструктуру вокруг AI-сервисов.
Пока это заявление самого исследователя, и независимого подтверждения масштаба утечки нет.
https://x.com/shoucccc/status/2042423713019412941 | 4 064 |
| 19 | 🔥 Хочешь расти в IT быстрее остальных? Перестань учиться в одиночку
Можно годами смотреть курсы, читать документацию и всё равно топтаться на месте.
А можно попасть в правильное окружение, где каждый день обсуждают новые инструменты, вакансии, реальные кейсы, ошибки и то, что уже завтра станет стандартом.
Здесь собраны папки и каналы по разным направлениям IT, чтобы ты быстрее находил нужных людей, идеи и полезный контент - без бесконечного поиска.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: https://t.me/+90Z5TAyfuNU5YmRi
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_ci
Java: t.me/javatg
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: https://t.me/+rKBQEMccAA01MTcy
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подпишись и сохрани, здесь регулярно появляются новые подборки, инструменты и материалы, которые реально помогают расти быстрее. | 2 995 |
| 20 | 🚨 Ларри Эллисон внезапно отменил продажу акций Oracle на сумму до $7,5 млрд
План предусматривал продажу до 50 млн акций Oracle до 24 октября. Но уже через день после его раскрытия Эллисон полностью его отменил.
Oracle отдельно уточнила:
- по этому плану не было продано ни одной акции
- у Эллисона сейчас нет других планов по продаже акций Oracle
- причину резкой отмены компания не назвала
Эллисон остаётся крупнейшим акционером Oracle, владея более чем 38% компании.
На фоне падения акций Oracle примерно на 23% с начала года такой разворот выглядит особенно интересно.
https://www.wsj.com/business/larry-ellison-scraps-plan-to-sell-up-to-7-5-billion-worth-of-oracle-stock-9f41edd2 | 3 471 |
