ch
Feedback
Data Science. SQL hub

Data Science. SQL hub

前往频道在 Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

显示更多

📈 Telegram 频道 Data Science. SQL hub 的分析概览

频道 Data Science. SQL hub (@sqlhub) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 35 973 名订阅者,在 技术与应用 类别中位列第 3 610,并在 俄罗斯 地区排名第 17 707

📊 受众指标与增长动态

невідомо 创建以来,项目保持高速增长,吸引了 35 973 名订阅者。

根据 31 八月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 66,过去 24 小时变化为 19,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 6.43%。内容发布后 24 小时内通常能获得 3.46% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 2 311 次浏览,首日通常累积 1 243 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 10
  • 主题关注点: 内容集中在 sql, индекс, postgres, index, sqlite 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

凭借高频更新(最新数据采集于 01 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

35 973
订阅者
+1924 小时
+147 天
+6630 天
帖子存档
🌐 Можно ли научить нейросеть строить 3D-модель мира и предсказывать динамику объектов прямо по видео? Particle-Grid Neural Dynamics — симулятор для деформируемых объектов, который учится на реальных видео и моделирует физику без ручных скриптов. Это новый шаг к обучаемым 3D-симуляциям, где движение объектов и их взаимодействия “считываются” из обычных видеозаписей! Мир становится объёмнее — теперь нейросеть учится понимать и предсказывать физику, просто наблюдая за реальными сценами. Website: https://kywind.github.io/pgnd ArXiv: https://arxiv.org/abs/2506.15680 Code: https://github.com/kywind/pgnd Demo: https://huggingface.co/spaces/kaifz/pgnd

Что происходит на российском рынке СУБД? Интервью с Леонидом Савченковым (Yandex Cloud) — хороший повод заглянуть под капот того, как сейчас строятся платформы данных в России. Если коротко: — Фокус платформы Yandex Cloud — стабильность, масштабируемость и надёжность; — Запущена on-prem модель: некоторые решения Яндекса можно использовать не только в облаке, но и на своих серверах; — После закрытия Greenplum Яндекс делает ставку на Cloudberry — open source-проект в Apache Foundation, уже сравнялся Greenplum 7 по части функциональности; — В Cloudberry активно коммитят сами ребята из Яндекса — по сути, продолжают жизнь проекта; — На Data&ML2Business показали важные обновления: YTsaurus как управляемый сервис, улучшения в DataLens и новая сертификация аналитиков. Кому интересна эволюция отечественной инфраструктуры данных — читать стоит. Особенно если в поле зрения BI, ML или просто Postgres с шардированием.

🧩 От кода к сообществу: коллективный вклад в SQL Server 2025 Сегодня, 16 июня 2025, Microsoft анонсировала публичный превью
🧩 От кода к сообществу: коллективный вклад в SQL Server 2025 Сегодня, 16 июня 2025, Microsoft анонсировала публичный превью SQL Server 2025 — релиз, который они называют самым масштабным за последние 10 лет. ● 🔐 Безопасность и производительность Более 50 улучшений в движке: усиленная защита (интеграция с Entra), оптимизация tempdb и решение «Halloween problem». Партнёры вроде HPE демонстрируют отличную масштабируемость в продакшене. ● 🤖 Встроенный AI и векторный поиск Нативная поддержка векторных индексов и embeddings — можно запускать генеративные модели и семантический поиск прямо внутри SQL Server без ETL. Алгоритмы DiskANN позволяют делать это эффективно даже без GPU. ● 👨‍💻 Новый уровень для разработчиков Поддержка JSON‑типов, RegEx-функций, REST‑API и стриминга изменений (Change Event Streaming). Вышли SSMS 21 и новая редакция Standard Developer. ● ☁️ Гибрид и облако через Azure Фича Fabric mirroring позволяет делать live-зеркало в Microsoft Fabric для real-time аналитики. Расширенная поддержка Azure Arc позволяет управлять SQL Server в гибридной инфраструктуре (on-premises + облако). ● 🤝 Сообщество в центре внимания Над релизом работали MVP, инженеры Microsoft и партнёры. В блоге есть доклады с Build 2025, интервью и видео от Bob Ward, Muazma Zahid, Anthony Nocentino и других. SQL Server 2025 — это AI-оптимизированный движок нового поколения: безопасный, гибкий, ориентированный на разработчиков и тесно интегрированный с облаком. Подробнее @sqlhub

🗂️ Entity Framework Core — ORM нового поколения для работы с БД. Этот инструмент от Microsoft кардинально меняет подход к вз
🗂️ Entity Framework Core — ORM нового поколения для работы с БД. Этот инструмент от Microsoft кардинально меняет подход к взаимодействию с реляционными и NoSQL базами данных. Для работы инструмент предоставляет мощный слой абстракции, позволяя работать с данными как с объектами, автоматизируя CRUD-операции и миграции схемы. EF Core поддерживает широкий пласт СУБД: от классических SQL Server и PostgreSQL до документоориентированной Cosmos DB. Для SQLite-разработчиков есть отдельный оптимизированный провайдер Microsoft.Data.Sqlite. 🤖 GitHub @sqlhub

🎓 Магистратура по ИИ от МТС и НИУ ВШЭ «Исследования и предпринимательство в искусственном интеллекте» — очная программа для тех, кто хочет учиться на реальных кейсах и работать с большими языковыми моделями, видеоаналитикой, синтезом речи и ML в бизнесе. 📍 Где и как: • Кампус ВШЭ в Москве • 30 оплачиваемых мест от МТС • Обучение с доступом к MWS Cloud и GPU • 70% преподавателей — специалисты из MTS AI / MWS 🛠 Что в программе: • LLM под задачи бизнеса • ML на edge-устройствах • Распознавание и синтез речи • Технологическое предпринимательство 👨🏻‍🎓 Поступление: • Портфолио • Мотивационное письмо • Онлайн-экзамен • Собеседование • Конкурс на Kaggle Лучшие студенты получают офферы и стажировки уже в процессе обучения. Приём заявок стартует 20 июня. @sqlhub

Авито выпустил BAT — первую за 12 лет открытую платформу для тестирования алгоритмов ставок в рекламных аукционах. До этого и
Авито выпустил BAT — первую за 12 лет открытую платформу для тестирования алгоритмов ставок в рекламных аукционах. До этого индустрия использовала только iPinYou (2013), но за это время все изменилось: появились новые форматы рекламы, выросли объемы данных, а алгоритмы ставок стали сложнее. Что умеет BAT? ✔️ В 1000 раз больше данных, чем в iPinYou. ✔️ Работает с современными нагрузками (миллионы запросов в секунду). ✔️ Позволяет тестировать алгоритмы в условиях, максимально близких к реальным. Что это дает? ✔️ Разработчики могут быстрее и дешевле тестировать модели. ✔️ Рекламодатели получат до 20% больше кликов за те же деньги. ✔️ Пользователи увидят более релевантную рекламу. BAT — это новый стандарт для индустрии, и он уже доступен в опенсорсе.

🗂️ Entity Framework Core — ORM нового поколения для работы с БД. Этот инструмент от Microsoft кардинально меняет подход к вз
🗂️ Entity Framework Core — ORM нового поколения для работы с БД. Этот инструмент от Microsoft кардинально меняет подход к взаимодействию с реляционными и NoSQL базами данных. Для работы инструмент предоставляет мощный слой абстракции, позволяя работать с данными как с объектами, автоматизируя CRUD-операции и миграции схемы. EF Core поддерживает широкий пласт СУБД: от классических SQL Server и PostgreSQL до документоориентированной Cosmos DB. Для SQLite-разработчиков есть отдельный оптимизированный провайдер Microsoft.Data.Sqlite. 🤖 GitHub @sqlhub

🖥 PgAssistant — это бесплатное open-source решение для помощи разработчикам и DBA в понимании, анализе и оптимизации произво
🖥 PgAssistant — это бесплатное open-source решение для помощи разработчикам и DBA в понимании, анализе и оптимизации производительности PostgreSQL-баз данных 🔧 Основные функции - Анализ поведения БД: разбирает использование pg_stat_statements и выявляет «горячие» запросы - Оптимизация схемы: помогает исправлять проблемы структуры таблиц и индексов - Библиотека запросов: хранит часто используемые SQL-запросы в JSON‑файле (например myqueries.json) Linting SQL: встроенный Python‑Sqlfluff для проверки стиля и синтаксиса - OpenAI/LLM‑помощь: при наличии API-ключа к OpenAI, Ollama или другому LLM вы можете автоматически улучшать запросы и планы выполнения - Экспорт DDL: получает DDL через pg_dump для анализа через LLM - Автоматизация параметров: использует pgtune и Docker‑compose для настройки ALTER SYSTEM и генерации конфигураций github.com .- Запуск через Docker или Flask: легко стартовать локально или в контейнере . 💡 Как начать? - Убедитесь, что установлен модуль pg_stat_statements. - Вы можете сразу запустить готовым Docker-образом. - Вариант без Docker — через Python/Flask. - При наличии LLM‑ключа — подключите OpenAI, Ollama и т.д. - Настройте свою коллекцию запросов в myqueries.json. - Используйте анализ, lint, советы по индексам и конфигам! pgAssistant — мощный инструмент для анализа и оптимизации PostgreSQL. Он сочетает детерминированные проверки и интеллектуальные подсказки LLM, и отлично подойдёт как разработчикам, так и начинающим администраторам баз данных. Если нужно — могу помочь с примерами использования, настройкой LLM или запуском через Docker/Flask. Репозиторий на GitHub насчитывает более 1 300+ ⭐ и активно развивается . 📌 Github @sqlhub

🖥 Database Build — база данных в 1 клик Просто напиши: *«Создай базу для пиццерии»* — и получишь готовую структуру: таблицы, связи, ER-диаграмму. 🛠 Что можно дальше: • Редактировать таблицы • Сгенерировать тестовые данные • Экспортировать в SQL • Задеплоить в Supabase (AWS — скоро) https://database.build/ @sqlhub

🔥 Успех в IT = скорость + знания + окружение Здесь ты найдёшь всё это — коротко, по делу и без воды. Пока другие ищут, где “подглядеть решение”, ты уже используешь самые свежие инструменты! AI: t.me/ai_machinelearning_big_data Python: t.me/pythonl Linux: t.me/linuxacademiya Собеседования DS: t.me/machinelearning_interview C++ t.me/cpluspluc Docker: t.me/DevopsDocker Хакинг: t.me/linuxkalii Devops: t.me/DevOPSitsec Data Science: t.me/data_analysis_ml Javascript: t.me/javascriptv C#: t.me/csharp_ci Java: t.me/java_library Базы данных: t.me/sqlhub Python собеседования: t.me/python_job_interview Мобильная разработка: t.me/mobdevelop Golang: t.me/Golang_google React: t.me/react_tg Rust: t.me/rust_code ИИ: t.me/vistehno PHP: t.me/phpshka Android: t.me/android_its Frontend: t.me/front Big Data: t.me/bigdatai МАТЕМАТИКА: t.me/data_math Kubernets: t.me/kubernetc Разработка игр: https://t.me/gamedev Haskell: t.me/haskell_tg Физика: t.me/fizmat 💼 Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy Папка FRONTEND: https://t.me/addlist/mzMMG3RPZhY2M2Iy 😆ИТ-Мемы: t.me/memes_prog 🇬🇧Английский: t.me/english_forprogrammers 🧠ИИ: t.me/vistehno 🎓954ГБ ОПЕНСОРС КУРСОВ: @courses 📕Ит-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy Подпишись, если хочешь быть в числе тех, кого зовут в топовые проекты!

🌊 RisingWave — современная платформа для обработки потоковых данных с открытым исходным кодом. Проект сочетает возможности s
🌊 RisingWave — современная платформа для обработки потоковых данных с открытым исходным кодом. Проект сочетает возможности stream processing и хранения данных, предлагая PostgreSQL-совместимый интерфейс для работы с реальным временем. Проект имеет встроенную интеграцию с Apache Iceberg, позволяющая непрерывно обогащать данные и сохранять результаты в открытом формате. Платформа оптимизирована для работы с облачными хранилищами S3 и поддерживает эластичное масштабирование ресурсов. Доступны варианты развертывания через Docker и Kubernetes, а также управляемый сервис RisingWave Cloud. 🤖 GitHub @sqlhub

Авито открыл AI‑кухню на Data Fest 2025 Компания поделилась секретами работы над искусственным интеллектом. Особенно заинтере
Авито открыл AI‑кухню на Data Fest 2025 Компания поделилась секретами работы над искусственным интеллектом. Особенно заинтересовал их подход к обучению собственной языковой модели. Их секрет ー собственный токенизатор, который эффективнее других моделей обрабатывает русскоязычные тексты на 29%. Это, кстати, дает генерацию текста в два раза быстрее зарубежных LLM на русском языке. Для обучения использовались и открытые датасеты, и обезличенные данные Авито и даже олимпиадные задачи. Также в компании активно разрабатывают мультимодальную VLM A‑Vision с технологией автоматического распознавания символов в изображениях. В обучении использовали 200 тысячах реальных фото и миллион пар вопрос-ответ. При этом использовали большие языковые модели как «учителей» для автоматической генерации разметки. А еще Авито упаковал весь ML‑цикл на единой ML‑платформе. Теперь все фичи, разметки, инференсы и обучение в одном месте. Как рассказали в Авито, главная цель платформы ー реализация no-code интерфейса, позволяющий запускать модели без программирования. Кстати, над моделями 7B в Авито работают в том числе и стажеры, которые используют свежие научные данные и современные стеки, такие как LLM, LoRA, vLLM. Например, один стажерский проект по анализу звонков с помощью большой языковой модели сократил расходы на автоматическую проверку в 10 раз.

🔢 PGVector: векторный поиск прямо в PostgreSQL — гайд Если ты работаешь с embedding'ами (OpenAI, HuggingFace, LLMs) и хочешь делать семантический поиск в SQL — тебе нужен pgvector. Это расширение позволяет сохранять и сравнивать векторы прямо внутри PostgreSQL. 📦 Установка PGVector (Linux)

git clone --branch v0.8.0 https://github.com/pgvector/pgvector.git
cd pgvector
make
sudo make install
Или просто: • macOS: brew install pgvector • Docker: pgvector/pgvector:pg17 • PostgreSQL 13+ (через APT/YUM) 🔌 Подключение расширения в базе

CREATE EXTENSION vector;
После этого ты можешь использовать новый тип данных vector. 🧱 Пример использования Создаём таблицу:

CREATE TABLE items (
  id bigserial PRIMARY KEY,
  embedding vector(3)
);
Добавляем данные:

INSERT INTO items (embedding) VALUES ('[1,2,3]'), ('[4,5,6]');
Поиск ближайшего вектора:

SELECT * FROM items
ORDER BY embedding <-> '[3,1,2]'
LIMIT 5;
🧠 Операторы сравнения PGVector поддерживает несколько видов расстояний между векторами: - <-> — L2 (евклидово расстояние) - <#> — скалярное произведение - <=> — косинусное расстояние - <+> — Manhattan (L1) - <~> — Хэммингово расстояние (для битовых векторов) - <%> — Жаккар (для битовых векторов) Также можно усреднять вектора:

SELECT AVG(embedding) FROM items;
🚀 Индексация для быстрого поиска HNSW (лучшее качество):

CREATE INDEX ON items USING hnsw (embedding vector_l2_ops);
Параметры можно настраивать:

SET hnsw.ef_search = 40;
#### IVFFlat (быстрее создаётся, но чуть менее точный):

CREATE INDEX ON items USING ivfflat (embedding vector_l2_ops) WITH (lists = 100);
SET ivfflat.probes = 10;
🔍 Проверка версии и обновление

SELECT extversion FROM pg_extension WHERE extname='vector';
ALTER EXTENSION vector UPDATE;
📌 Особенности - Работает с PostgreSQL 13+ - Поддержка до 2000 измерений - Расширяемый синтаксис - Можно использовать DISTINCT, JOIN, GROUP BY, ORDER BY и агрегации - Подходит для RAG-пайплайнов, NLP и встраивания LLM-поиска в обычные SQL-приложения 🔗 Подробнее 💡 Храни embedding'и прямо в PostgreSQL — и делай семантический поиск без внешних векторных БД.

🚀 Solune — высокопроизводительная NoSQL-база данных на Go Solune — это быстрая и гибкая NoSQL-база данных, разработанная с у
🚀 Solune — высокопроизводительная NoSQL-база данных на Go Solune — это быстрая и гибкая NoSQL-база данных, разработанная с упором на масштабируемость, низкую задержку и производительность. Она использует приоритетную работу с данными в памяти, чтобы обеспечить молниеносный доступ и минимальную задержку при высоких нагрузках. 🧠 Почему Go? Solune построена на Go — и вот почему это важно: • Горутины и каналы — идеально для обработки тысяч запросов одновременно • Высокая скорость исполнения — Go отлично подходит для чувствительных к производительности систем • Простота и читаемость — легче поддерживать и развивать проект • Богатая экосистема — множество библиотек и инструментов для создания надёжных систем Фокус на хранении в памяти:Мгновенный доступ — чтение из памяти быстрее, чем с диска • Минимальные задержки — нет тяжёлых операций I/O • Гибкое масштабирование — просто увеличивайте объём RAM 💡 Подходит для: • Высоконагруженных API • Систем, где критична скорость доступа • Приложений с минимальной допустимой задержкой 📌 Solune — это выбор для тех, кто ищет быструю, масштабируемую и современную NoSQL-БД, идеально подходящую для in-memory архитектур. git clone https://github.com/thijsrijkers/solune.git cd solune 🔗 GitHub @sqlhub

🚀 Solune — высокопроизводительная NoSQL-база данных на Go Solune — это быстрая и гибкая NoSQL-база данных, разработанная с у
🚀 Solune — высокопроизводительная NoSQL-база данных на Go Solune — это быстрая и гибкая NoSQL-база данных, разработанная с упором на масштабируемость, низкую задержку и производительность. Она использует приоритетную работу с данными в памяти, чтобы обеспечить молниеносный доступ и минимальную задержку при высоких нагрузках. 🧠 Почему Go? Solune построена на Go — и вот почему это важно: • Горутины и каналы — идеально для обработки тысяч запросов одновременно • Высокая скорость исполнения — Go отлично подходит для чувствительных к производительности систем • Простота и читаемость — легче поддерживать и развивать проект • Богатая экосистема — множество библиотек и инструментов для создания надёжных систем Фокус на хранении в памяти:Мгновенный доступ — чтение из памяти быстрее, чем с диска • Минимальные задержки — нет тяжёлых операций I/O • Гибкое масштабирование — просто увеличивайте объём RAM 💡 Подходит для: • Высоконагруженных API • Систем, где критична скорость доступа • Приложений с минимальной допустимой задержкой 📌 Solune — это выбор для тех, кто ищет быструю, масштабируемую и современную NoSQL-БД, идеально подходящую для in-memory архитектур. git clone https://github.com/thijsrijkers/solune.git cd solune 🔗 GitHub @sqlhub

📦 Outbox — надёжная реализация outbox-паттерна на Go для микросервисов Если твои сервисы пишут в базу и одновременно публику
📦 Outbox — надёжная реализация outbox-паттерна на Go для микросервисов Если твои сервисы пишут в базу и одновременно публикуют события в Kafka, RabbitMQ или другие брокеры — знай: без outbox-паттерна ты рискуешь потерять данные. 🔧 Outbox — это лёгкая и удобная библиотека на Go, которая помогает сделать доставку сообщений атомарной и надёжной, без лишней сложности. 🧠 Что она делает: 1. Сохраняет событие в таблицу outbox в рамках транзакции 2. Отдельный воркер читает сообщения и отправляет их в брокер 3. После успешной доставки — сообщение помечается как доставленное 💡 Особенности: - Поддержка PostgreSQL - Готовые адаптеры для Kafka и RabbitMQ - Возможность использовать свой брокер (реализуй интерфейс) - Поддержка сериализации / форматирования событий - Использует sqlx и стандартную database/sql 🧩 Подходит для: - надёжной синхронизации БД ↔ событий - микросервисов, где важна консистентность - систем, где нужна повторная доставка без дублей 🔥 Отличный выбор, если ты хочешь atomic-публикацию событий без тяжёлых фреймворков и сервисов. #Go #OutboxPattern #Kafka #RabbitMQ #Microservices #EventDriven #PostgreSQL 🔗 https://github.com/oagudo/outbox @sqlhub

Redis и Valkey – изучите секреты самых популярных open source key-value СУБД В высоко-нагруженных сервисах Redis — не просто
Redis и Valkey изучите секреты самых популярных open source key-value СУБД В высоко-нагруженных сервисах Redis — не просто кэш, а важная подсистема, на которой строится значимая часть бизнес-логики. От его стабильности, масштабируемости и отказоустойчивости зависит производительность всего сервиса. Valkey - это современный производительный форк Redis с открытым исходным кодом, поддерживаемый сообществом и рядом крупных компаний. Valkey набирает популярность, поддержан крупными облачными провайдерами, и вполне возможно потеснит или вовсе заменит Redis со временем. Наш курс — для тех, кто хочет держать свой стэк и знания актуальными и глубоко разбираться, как устроен Redis и Valkey. 🌐 В программе курса: 🤩 Как эффективно использовать базовые и продвинутые структуры данных: HyperLogLog, Bitmaps и Bisields, Streams, Geospatial-индексы, Bloom Filters 🤩 Как проектировать in-memory системы, которые не разваливаются под нагрузкой, что влияет на отказоустойчивость и как её добиться 🤩 Как работает репликация и кластеризация на практике (режимы Sentinel и Cluster) 🤩 Как встроить Redis/Valkey в реальный прод с учётом безопасности, интеграций и современных практик мониторинга. 🥸 Кто мы: R&D-центр Devhands. Автор курса — Константин Ратвин — преподаватель МФТИ на кафедре БИТ (совместно со СберТех), эксперт по распределённым системам и банковским ИТ, автор курсов по СУБД и инфраструктуре, спикер HighLoad++ и PGConf. 🗓 Старт курса: 9 июня, 6 недель обучения. Изучить программу и записаться можно здесь. Ждем вас! Реклама. ИП Рыбак А.А. ИНН 771407709607 Erid: 2VtzqxNnFKA

🧠 SQL-задача с подвохом: "Невидимые дубликаты" В таблице users хранятся email-адреса пользователей. Некоторые юзеры регистрируются повторно, маскируя один и тот же email по-разному: | id | name | email | |----|----------|--------------------------| | 1 | Alice | alice@example.com | | 2 | Bob | ALICE@EXAMPLE.COM | | 3 | Charlie | alice@example.com | | 4 | Dave | alice+promo@example.com | | 5 | Eve | a.l.i.c.e@example.com | 🎯 Цель: Найти количество уникальных пользователей, если: - Регистр не учитывается (`alice` = `ALICE`) - Пробелы игнорируются - Для @gmail.com: — Убираются точки в имени — Всё после + отрезается ✅ SQL-решение:

SELECT COUNT(DISTINCT normalized_email) AS unique_users
FROM (
    SELECT
      CASE
        WHEN email ILIKE '%@gmail.com' THEN
          REGEXP_REPLACE(
            SPLIT_PART(SPLIT_PART(LOWER(TRIM(email)), '+', 1), '@', 1),
            '\.', '', 'g'
          ) || '@gmail.com'
        ELSE
          LOWER(REPLACE(TRIM(email), ' ', ''))
      END AS normalized_email
    FROM users
) AS cleaned;
🔍 Как это работает: LOWER(TRIM(email)) — убираем пробелы и регистр SPLIT_PART(..., '+', 1) — отрезаем всё после + REGEXP_REPLACE(..., '\.', '', 'g') — удаляем точки Считаем DISTINCT, чтобы получить число уникальных email'ов 🔥 Используй такие трюки для: • антифрода • чистки базы • аналитики поведения пользователей #SQL #PostgreSQL #Gmail #EmailNormalization #DevTools #AntiFraud #DataCleaning #Analytics

Диплом vs курсы: золотая середина для карьеры в IT Без профильного образования в IT можно расти, но для серьезных позиций часто нужен диплом. На помощь приходит магистратура и онлайн-курсы, но проблема в том, что обучение в вузе сложно совмещать с работой, а короткие онлайн-курсы дают лишь поверхностные знания. 6 июня в 18:00 (мск) Анатолий Карпов (автор онлайн-курсов по Data Science) и Евгений Соколов (научный руководитель ФКН НИУ ВШЭ) расскажут о совместной онлайн-магистратуре karpov courses и НИУ ВШЭ — «Аналитика больших данных» на бесплатном вебинаре. От ВШЭ — экспертиза и опыт одного из крупнейших вузов России, а от karpov courses — практические навыки в сфере анализа данных. На встрече вы узнаете: - преимущества высшего онлайн-образования и какие тренды есть на рынке; - какие этапы необходимо пройти, чтобы поступить в онлайн-магистратуру НИУ ВШЭ и karpov courses; - почему так популярна и востребована сфера аналитики данных в 2025 году. Присоединяйтесь ко дню открытых дверей онлайн-магистратуры «Аналитика больших данных» от НИУ ВШЭ и karpov courses: https://clc.to/erid_2W5zFHNZGxY  Реклама. ООО "КАРПОВ КУРСЫ". ИНН 7811764627. erid: 2W5zFHNZGxY.

🚀 Как построить ML-пайплайн в Apache Spark: пошаговый гайд В свежей статье на KDnuggets рассматривается, как с помощью Apach
🚀 Как построить ML-пайплайн в Apache Spark: пошаговый гайд В свежей статье на KDnuggets рассматривается, как с помощью Apache Spark и библиотеки MLlib можно построить масштабируемый пайплайн машинного обучения для задач, таких как прогноз оттока клиентов. 🔧 Компоненты пайплайна: - Transformers: преобразуют данные (например, StringIndexer, `StandardScaler`) - Estimators: обучают модели (например, `LogisticRegression`) - Pipeline: объединяет все шаги в единую последовательность 🧪 Пример: 1. Загрузка и очистка данных 2. Преобразование категориальных признаков 3. Сборка признаков в вектор 4. Масштабирование данных 5. Обучение модели логистической регрессии 6. Оценка качества модели (accuracy, precision, recall, F1) 📌 Ключевые преимущества: - Высокая скорость обработки больших объемов данных - Удобная интеграция с Python через PySpark - Гибкость и масштабируемость для промышленных задач Полный разбор с кодом и примерами: 👉 https://www.kdnuggets.com/implementing-machine-learning-pipelines-with-apache-spark