en
Feedback
Data Science | Machinelearning [ru]

Data Science | Machinelearning [ru]

Open in Telegram

Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Show more

📈 Analytical overview of Telegram channel Data Science | Machinelearning [ru]

Channel Data Science | Machinelearning [ru] (@devsp) in the Russian language segment is an active participant. Currently, the community unites 19 800 subscribers, ranking 6 513 in the Technologies & Applications category and 33 408 in the Russia region.

📊 Audience metrics and dynamics

Since its creation on невідомо, the project has demonstrated rapid growth, gathering an audience of 19 800 subscribers.

According to the latest data from 04 September, 2026, the channel demonstrates stable activity. Although there has been a change in the number of participants by -91 over the last 30 days and by -2 over the last 24 hours, overall reach remains high.

  • Verification status: Not verified
  • Engagement rate (ER): The average audience engagement rate is 8.05%. Within the first 24 hours after publication, content typically collects 4.91% reactions from the total number of subscribers.
  • Post reach: On average, each post receives 1 593 views. Within the first day, a publication typically gains 973 views.
  • Reactions and interaction: The audience actively supports content: the average number of reactions per post is 5.
  • Thematic interests: Content is focused on key topics such as llm, nvidia, контекст, openai, архитектура.

📝 Description and content policy

The author describes the resource as a platform for expressing subjective opinions:
Все о Data Science, машинном обучении и искусственном интеллекте: от базовой теории до cutting-edge исследований и LLM. Личный блог автора - @just_genych По вопросам рекламы или разработки - @g_abashkin РКН: https://vk.cc/cJPGXD

Thanks to the high frequency of updates (latest data received on 05 September, 2026), the channel maintains relevance and a high level of publication reach. Analytics show that the audience actively interacts with content, making it an important point of influence in the Technologies & Applications category.

19 800
Subscribers
-224 hours
+147 days
-9130 days
Posts Archive
➡️ Объяснимый ИИ в ML и DL Разбираемся, зачем нужен объяснимый ИИ, как подступиться к интерпретации моделей и что с этим делать на практике — от EDA до XAI на примере. Всё на русском, без магии. Читать...

⚙️ Что такое Feature Scaling в ML и зачем он нужен? Feature Scaling (масштабирование признаков) — это приведение всех признаков к одному масштабу, чтобы модель обучалась корректно. Некоторые алгоритмы (например, k-NN, SVM, градиентный спуск) чувствительны к разнице в диапазонах данных ➡️ Пример:
from sklearn.preprocessing import StandardScaler
import numpy as np

X = np.array([[1, 100], [2, 300], [3, 500]])

scaler = StandardScaler()
X_scaled = scaler.fit_transform(X)

print(X_scaled)
🗣️ В этом примере признаки приводятся к виду с нулевым средним и единичным стандартным отклонением.
Без масштабирования одна "большая" переменная может полностью доминировать над другими.. 🖥 Подробнее тут

🤔 На START, внимание, марш: как победить галлюцинации и научить LLM точным вычислениям START — опенсорсная LLM для точных вычислений и проверки кода. В START решены две главные проблемы большинства обычных моделей: галлюцинации и ошибки в многоэтапных расчетах. В статье разберемся, зачем и как именно эти проблемы решены.. Читать...

🤖📈 Папка Экспертов: ИИ, ИТ и Маркетинг https://t.me/addlist/f_e6mA-BQio3YmJi Ключевые инсайты, свежие новости и экспертные
🤖📈 Папка Экспертов: ИИ, ИТ и Маркетинг https://t.me/addlist/f_e6mA-BQio3YmJi Ключевые инсайты, свежие новости и экспертные комментарии этой недели Что внутри подборки: ✅ Актуальные тренды в мире ИИ и ИТ: от новых технологий до внедрения в бизнес ✅ Изменения в алгоритмах и платформах: Google, Meta, Яндекс, Telegram, SEO, таргетинг ✅ Разбор свежих кейсов: как используют ИИ в маркетинге и автоматизации ✅ Практические советы по интеграции AI-инструментов в маркетинговые процессы ✅ Наша экспертная аналитика: что эти новости значат для бизнеса и как адаптироваться https://t.me/addlist/f_e6mA-BQio3YmJi Почему это важно: Технологии развиваются стремительно — то, что работало вчера, сегодня устаревает. Мы отбираем действительно важное, чтобы вы не тратили время на фильтрацию потока информации, а получали только то, что помогает масштабировать бизнес и находить новые точки роста. Для кого: • Для предпринимателей, которые ищут новые возможности для развития • Для маркетологов, которые хотят быть на шаг впереди рынка • Для ИТ-специалистов, которые внедряют AI-решения в бизнес 📩 Подписывайтесь, чтобы быть в курсе ключевых изменений в ИИ, ИТ и маркетинге. https://t.me/addlist/f_e6mA-BQio3YmJi

🖥 Играемся с RTX 5090 (GB202) для инференса Автор тестирует RTX 5090 в хостинге, сравнивает с 3090 и A100, гоняет gpu-burn и инференс-сетку, проверяя, есть ли прирост для ML-задач. Без фанатизма, но с графиком. Читать...

👩‍💻 Предсказание уникальности пользователя У вас есть список действий пользователей на платформе. Каждое действие представлено словарём с полями "user_id", "action", и "timestamp". Нужно реализовать функцию, которая определит, является ли пользователь "уникальным". Уникальный пользователь — это тот, кто:
• совершал более 3 действий, • все действия происходили в разные дни, • не совершал одинаковые действия дважды.
Верните список user_id, соответствующих этому критерию. Решение задачи🔽
from collections import defaultdict from datetime import datetime def find_unique_users(logs): activity = defaultdict(lambda: {"actions": set(), "days": set(), "count": 0}) for log in logs: user = log["user_id"] action = log["action"] date = datetime.fromisoformat(log["timestamp"]).date() activity[user]["actions"].add(action) activity[user]["days"].add(date) activity[user]["count"] += 1 result = [] for user, data in activity.items(): if ( data["count"] > 3 and len(data["days"]) == data["count"] and len(data["actions"]) == data["count"] ): result.append(user) return result # Пример использования logs = [ {"user_id": 1, "action": "login", "timestamp": "2023-05-01T10:00:00"}, {"user_id": 1, "action": "view", "timestamp": "2023-05-02T11:00:00"}, {"user_id": 1, "action": "click", "timestamp": "2023-05-03T12:00:00"}, {"user_id": 1, "action": "logout", "timestamp": "2023-05-04T13:00:00"}, {"user_id": 2, "action": "login", "timestamp": "2023-05-01T10:00:00"}, {"user_id": 2, "action": "login", "timestamp": "2023-05-01T11:00:00"}, {"user_id": 2, "action": "click", "timestamp": "2023-05-01T12:00:00"}, ] print(find_unique_users(logs)) # Ожидаемый результат: [1]

🗣 Синтез речи 2025: топ-4 бесплатных нейросетей для озвучки текста Сравниваем 4 синтеза речи: интонации, паузы, эмоции. Кто из них справится с «Хоббитом» и сможет звучать как рассказчик, а не как робот? Проверим голосом, а не графиком. Читать...

⚙️ Как все рынки мира оказались уязвимы конкуренции с любым умным айтишником История о том, как в текущем моменте истории, по сути любой разработчик может в одиночку задизраптить любой вертикальный рынок и даже отрасль. Читать...

Где взять ресурсы для обучения ML-моделей и анализа больших данных? Все эти сложные задачи можно решить на серверах с GPU от
Где взять ресурсы для обучения ML-моделей и анализа больших данных? Все эти сложные задачи можно решить на серверах с GPU от Selectel — на покупку оборудования тратиться не придется, а все ресурсы GPU только ваши. Преимущества аренды сервера с GPU в Selectel: https://slc.tl/46jmk ☑️Оптимальный сервер под ваши задачи. Выбирайте из десятка готовых конфигураций или соберите собственную с нужной видеокартой под ваши запросы и бюджет; ☑️Более 20 моделей видеокарт в наличии: от базовой GTX 1080 до профессиональных H100 и А100; ☑️Безопасность хранения и обработки данных. Серверы соответствуют 152-ФЗ и «из коробки» имеют бесплатную защиту от DDoS-атак. Арендуйте серверы с GPU за пару минут: https://slc.tl/46jmk Реклама. АО «Селектел», ИНН 7810962785, ERID: 2Vtzqwia3qo

🧠 Что делает train_test_split в ML и зачем он нужен Функция train_test_split() из библиотеки sklearn разбивает данные на обучающую и тестовую выборки. Это важно, чтобы проверить, как хорошо модель работает на невидимых данных. ➡️ Пример:
from sklearn.model_selection import train_test_split

X = [[1], [2], [3], [4], [5]]
y = [0, 0, 1, 1, 1]

X_train, X_test, y_train, y_test = train_test_split(X, y, test_size=0.4, random_state=42)

print("Обучение:", X_train)
print("Тест:", X_test)
🗣️ Почему важно: • Модель не должна учиться на тех же данных, на которых её оценивают • test_size указывает, какой процент данных пойдёт на тест • random_state нужен для воспроизводимости Это один из самых базовых, но обязательных шагов в любом ML-проекте
🖥 Подробнее тут

⚙️ Где ИИ врёт и как с этим жить — мой гайд после фейлов Автор копает, почему ИИ фантазирует, как это мешает в работе и чем тут помогут промпты. В финале — гайд, как писать запросы без сюрпризов. Читать...

⚙️ Как алгоритм Recovering Difference Softmax (RDS) делает рекомендации и уведомления точнее и эффективнее RDS — это про то, как машинке выбрать лучший вариант уведомления или карточки, чтобы ты вернулся. Объясняем, как он усиливает ML-модели и растит вовлечённость пользователей. Читать...

Есть два типа обучения Data Science. 1️⃣ Смотреть лекции и повторять за ментором. 2️⃣ Сразу брать реальные задачи и учиться н
Есть два типа обучения Data Science. 1️⃣ Смотреть лекции и повторять за ментором. 2️⃣ Сразу брать реальные задачи и учиться на практике. Если вам ближе второй тип, симулятор Data Science от karpovꓸcourses — для вас. Этот курс для тех, кто не ищет легких путей, и знает: на одной теории мидлом не стать. Вас ждет интенсивное погружение в аналитику с первых дней. 🔹 Решите 80+ бизнес-задач — от простых и быстрых до заданий со звездочкой. 🔹 Поработаете над кейсами из разных сфер: Retail, E-commerce, FinTech, FoodTech, EdTech. 🔹 Создадите проект для портфолио под руководством опытным аналитиков. 🔹 Прокачаете самые нужные навыки и работу с инструментами: Python, SQL, ClickHouse, FastAPI, MLFlow, DVC, Spark, LLM, рекомендательные системы, прогнозирование, метрики, A/B-тесты. С 12 по 31 мая записываться на обучение еще выгоднее. Если купите доступ на 6 месяцев, получите 7-ой — в подарок. А если на 9 месяцев — два в подарок. Пора решать задачи, а не смотреть, как это делают другие. Записаться на курс Реклама. ООО «Карпов Курсы», ИНН: 7811764627, erid: 2VtzqufjPUg

👩‍💻 Разделите данные на группы с помощью алгоритма K-Means Создайте модель, которая группирует точки по признакам без использования меток. Это задача кластеризации, где мы не обучаемся на готовых ответах, а ищем структуру в данных.
Алгоритм K-Means автоматически делит данные на 3 группы на основе близости точек. Это полезно в задачах сегментации клиентов, поиска паттернов в данных, рекомендаций и др.
Решение задачи🔽
import numpy as np import matplotlib.pyplot as plt from sklearn.cluster import KMeans from sklearn.datasets import make_blobs # Генерация данных: 300 точек, 3 центра X, _ = make_blobs(n_samples=300, centers=3, random_state=42) # Модель кластеризации kmeans = KMeans(n_clusters=3, random_state=42) kmeans.fit(X) # Визуализация plt.scatter(X[:, 0], X[:, 1], c=kmeans.labels_, cmap='viridis') plt.scatter(kmeans.cluster_centers_[:, 0], kmeans.cluster_centers_[:, 1], s=200, c='red', marker='X', label='Центры кластеров') plt.legend() plt.show()

⚙️ Как обойти детекторы текста, сгенерированного ИИ Автор исследует, почему нейросети пока плохо отличают ИИ-тексты от человеческих, и делится, что реально работает (или не очень), если вы вдруг решите их «перехитрить». Читать...

Яндекс поднял максимальное вознаграждение в bug bounty до 3 млн рублей. За что? За критические уязвимости типа RCE и VM escape в Почте, Яндекс ID и Yandex Cloud. Плюс выросли выплаты за SQL-инъекции. Это хорошая возможность для этичных хакеров проверить себя, ведь речь идет о сервисах Яндекса, которым доверяют чувствительную информацию миллионы пользователей. Так компания хочет обеспечить всестороннюю оценку безопасности своих систем. Ну а для тех, кому этого недостаточно, в программе багбаунти Яндекса недавно появилось отдельное направление по нейросетям — там можно получить за уязвимость до 1 миллиона рублей.

👩‍💻 Обучите модель для классификации текста с помощью Naive Bayes Создайте простую модель машинного обучения, которая определяет, является ли текст позитивным или негативным. Используем sklearn и алгоритм Naive Bayes Решение задачи🔽
from sklearn.feature_extraction.text import CountVectorizer from sklearn.naive_bayes import MultinomialNB from sklearn.pipeline import make_pipeline # Обучающие данные texts = ["Это отличный фильм", "Ужасный опыт", "Мне понравилось", "Очень скучно", "Прекрасная история"] labels = ['positive', 'negative', 'positive', 'negative', 'positive'] # Модель model = make_pipeline(CountVectorizer(), MultinomialNB()) model.fit(texts, labels) # Прогноз print(model.predict(["Фильм был ужасен"])) # ['negative'] print(model.predict(["Обожаю это кино"])) # ['positive']

⚙️ Код, железо, стратегия: в чем секрет победителей ML-соревнований? Разбор отчёта о соревнованиях по ML за 2024 год: кто победил, как и почему. Без мотивационных цитат — только конкретные приёмы, модели и стратегии, которые реально приносят $22 млн. Читать...