ch
Feedback
Data Science. SQL hub

Data Science. SQL hub

前往频道在 Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

显示更多

📈 Telegram 频道 Data Science. SQL hub 的分析概览

频道 Data Science. SQL hub (@sqlhub) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 35 960 名订阅者,在 技术与应用 类别中位列第 3 610,并在 俄罗斯 地区排名第 17 707

📊 受众指标与增长动态

невідомо 创建以来,项目保持高速增长,吸引了 35 960 名订阅者。

根据 31 八月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 66,过去 24 小时变化为 19,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 6.43%。内容发布后 24 小时内通常能获得 3.46% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 2 311 次浏览,首日通常累积 1 243 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 10
  • 主题关注点: 内容集中在 sql, индекс, postgres, index, sqlite 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

凭借高频更新(最新数据采集于 01 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

35 960
订阅者
+1924 小时
+147
+6630
帖子存档
💡 SQL: условные агрегаты через CASE !!! Хотите посчитать сумму только по условию прямо внутри агрегата? Для этого не нужен отдельный WHERE — используйте CASE WHEN.

SELECT 
    customer_id,
    SUM(CASE WHEN status = 'completed' THEN amount ELSE 0 END) AS completed_sum,
    SUM(CASE WHEN status = 'pending' THEN amount ELSE 0 END)   AS pending_sum
FROM orders
GROUP BY customer_id;
🔎 В одном запросе можно посчитать суммы по разным статусам — и не делать несколько JOIN или подзапросов. Работает также с COUNT(), AVG() и другими агрегатами. @sqlhub

⚡️В прошлый четверг команда VK собрала буквально всю RecSys-тусовку. Судя по ленте, на ивенте было стильно и глитчово Это пер
+3
⚡️В прошлый четверг команда VK собрала буквально всю RecSys-тусовку. Судя по ленте, на ивенте было стильно и глитчово Это первая встреча AI VK & Pro. На ней рассказали о будущем рекомендаций, о том, как строят единую Discovery-платформу для рекомендательных систем во всех продуктах VK и еще много всего полезного Успели всё: отыграть DJ-сеты, эффективно понетворкать, был даже турнир по су-е-фа

🗄 MySQL vs Postgres: как кэшируют страницы данных ⚡ Подходы разные: - MySQL (InnoDB) стремится всё держать под своим контрол
🗄 MySQL vs Postgres: как кэшируют страницы данных ⚡ Подходы разные: - MySQL (InnoDB) стремится всё держать под своим контролем - Postgres больше доверяет операционной системе MySQL / InnoDB - Своя память под кэш: innodb_buffer_pool_size обычно = 70%+ RAM на выделенном сервере - Обход кэша ОС: с innodb_flush_method='O_DIRECT' InnoDB работает напрямую с диском - Двухсекционный LRU: страницы сначала в old, только потом (через innodb_old_blocks_time`) в `young. Это спасает от «выметания» кэша при больших сканах Postgres - Внутренний кэш + page cache ОС: shared_buffers обычно около 30% RAM, остальное оставляют ОС - Clock-sweep: у страницы счётчик обращений, уменьшается при «прокрутке часов». Когда падает до нуля — страница освобождается Практические выводы - Bulk-операции: InnoDB устойчивее к «пробиванию» кэша, в Postgres часть нагрузки идёт в кэш файловой системы - Тюнинг памяти: в MySQL раздувают buffer pool, в Postgres shared_buffers умеренный, а остальное доверяют ОС Что стоит проверить в бенчмарках Postgres - Размер shared_buffers: 4% / 10% / 30% / 50% RAM - Сценарии: OLTP, последовательные сканы, смешанные нагрузки - Рабочий набор: меньше / равен / больше доступной RAM - Метрики: TPS/QPS, p95/p99 латентность, hit ratio, про https://github.com/postgres/postgres/blob/master/src/backend/storage/buffer/README

❌ Классический поиск по ключевым словам даёт ограниченные результаты. Нашёл только одно совпадение: "Machine Learning Overvie
❌ Классический поиск по ключевым словам даёт ограниченные результаты. Нашёл только одно совпадение: "Machine Learning Overview". ✅ А вот pgvector ищет по смыслу и находит связанные концепции. Пример запроса возвращает 5 релевантных документов: – Machine Learning Overview – Data Mining Basics – Introduction to AI – Deep Learning Guide Семантический поиск > ключевого 🔥

YTsaurus — инфраструктура хранения и обработки больших данных. Включает динамические таблицы, которые позволяют хранить и обр
YTsaurus — инфраструктура хранения и обработки больших данных. Включает динамические таблицы, которые позволяют хранить и обрабатывать большие данные для десятков тысяч пользователей в реальном времени.  Инструмент идеально подходит для высоконагруженных сценариев, где требуются горизонтальное масштабирование, exactly-once семантика и время отклика в миллисекунды. Может применяться в том числе и для создания системы поведенческого таргетинга. Поддерживает MapReduce и NVMe SSD.  Пример использования YTsaurus на Хабре

📚🎮 SQL + Покемоны = Querymon! Энтузиасты сделали игру, которая превращает изучение баз данных в настоящее приключение. ✨ С нуля — начнёте с простых таблиц и базовых запросов, сложность растёт постепенно. 🔎 Освоите SELECT, FROM, WHERE, фильтры LIKE, BETWEEN, IN и функции sum(), count(), avg(). 🎯 Геймплей — сотни миссий, где, чтобы пройти дальше, нужно правильно писать SQL-запросы. SQL ещё никогда не был таким весёлым: учиться теперь так же увлекательно, как ловить покемонов. И самое приятное — игра полностью бесплатная. 👉 Попробовать можно здесь.

🦆 Полезный интерактивный тренажёр по SQL Учитесь писать SQL-запросы через игру: - Пошаговые уроки с живым редактором — пишешь код и сразу видишь результат. - Задачи и мини-квесты, где вы помогаете Дакберту пробираться сквозь потоки данных. - Работает бесплатно, прямо в браузере или на телефоне. 🎮 Попробовать: https://dbquacks.com/

🚀 Jupyter Agent 2 Этот агент умеет: 📂 Загружать данные 💻 Запускать код 📊 Строить графики прямо в Jupyter — быстрее, чем вы успеете прокрутить экран! 🤖 Основан на движке Qwen3-Coder ⚡️ Работает на Cerebras ⚙️ Запускается в E2B ↕️ Поддерживает загрузку файлов 👉 Попробовать можно здесь: https://hf.co/spaces/lvwerra/jupyter-agent-2 @sqlhub

Как начать в Data Science, когда все вокруг уже сеньоры? До 15 сентября в Вышке продолжается набор на онлайн-магистратуру «Ма
Как начать в Data Science, когда все вокруг уже сеньоры? До 15 сентября в Вышке продолжается набор на онлайн-магистратуру «Магистр по наукам о данных». Поступить можно даже без технического бэкграунда, а учиться — в удобном формате. Вы научитесь: ⚪️ работать с данными ⚪️ применять классические модели ML ⚪️ решать бизнес-задачи из сфер DA и DS Вам подходит программа, если вы ⭐️ Из другой сферы деятельности, но хотите войти в IT ⭐️ Самоучка и хотите подтвердить знания дипломом ⭐️ Хотите стать IT-специалистом, но пока не понимаете, каким именно ⭐️ Хотите освоить инструменты Data Science для своих проектов в другой сфере Как проходит обучение ⚪️ Онлайн-занятия в прямом эфире с возможностью задавать вопросы ⚪️ Диплом НИУ ВШЭ с указанием очной формы обучения ⚪️ Поддержка в чате 24/7 Прием документов до 15 сентября, 17:00. Подробнее о программе можно узнать тут. А чтобы узнать, как подать документы, вступайте в чат абитуриентов — там найдете инструкции и сможете получить ответы на любые вопросы по поступлению.

🌲 Datahike — персистентная база данных на основе Datalog. Это локальная база данных с поддержкой временных запросов и истори
🌲 Datahike — персистентная база данных на основе Datalog. Это локальная база данных с поддержкой временных запросов и историчностью данных, совместимая с подмножеством API Datomic. Интрумент используется в проверенных решениях: ядра запросов из DataScript и устойчивой структуры данных hitchhiker-tree. Проект подходит для средних по размеру приложений, где важна простота развертывания и открытая лицензия. 🤖 GitHub @sqlhub

📉 На Уолл-стрит началась просадка AI-акций — и спусковым крючком оказался в отчёте MIT. В нём говорится, что 95% компаний не
📉 На Уолл-стрит началась просадка AI-акций — и спусковым крючком оказался в отчёте MIT. В нём говорится, что 95% компаний не получают прибыли от внедрения generative AI, а реальные результаты видят только 5%. Почему так: - Компании запускают до того, как готовы пайплайны данных, безопасность и обучение сотрудников - Деньги уходят на сервера и модели, а внедрение в процессы оказывается долгим и дорогим ⚠️ На фоне разговоров про «AI-пузырь» фонды начали выходить из популярных AI-акций, что вызвало обвал. 👉 Но это похоже не на крах, а на проверку реальностью. Дальнейший рост будет зависеть от реальной экономики ИИ: снижения стоимости инференса и доказанного роста продуктивности. 📌 Источник

Где вы окажетесь завтра, зависит от того, что вы изучаете сегодня. PostgreSQL — инструмент, который ищут компании, а грамотны
Где вы окажетесь завтра, зависит от того, что вы изучаете сегодня. PostgreSQL — инструмент, который ищут компании, а грамотных специалистов по нему все еще немного. Почему именно PostgreSQL? Потому что это не просто база данных, а сердце ваших проектов. Если вы администратор БД, разработчик, DevOps или администратор Linux, этот курс — ваш апгрейд. Мы научим настраивать кластеры, оптимизировать производительность, разбираться с блокировками и решать задачи работы с большими объемами данных. А также живые лекции, практические задания и диплом, который признают лидеры рынка. Учитесь у практиков, которые знают, как решать реальные задачи, и получите навыки, за которые платят топовые компании. Присоединяйтесь к курсу сейчас и начните свой путь к высокооплачиваемой карьере! Оставить заявку на курс и получить скидку: https://otus.pw/yEz4/?erid=2W5zFHAFsn8 Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

🎮 Учим SQL через захватывающую аркадную игру Разработчики замутили настоящий олдскульный шедевр, который сделает из вас МАСТ
🎮 Учим SQL через захватывающую аркадную игру Разработчики замутили настоящий олдскульный шедевр, который сделает из вас МАСТЕРА баз данных и точно не даст заскучать. • Проходим уровни, собираем пазлы вместе с уткой DuckDB и прокачиваем SQL на максимум. • Квесты, задачи, подсказки — всё как в настоящем приключении. • Работает прямо в браузере и даже на телефоне. Любые запросы к базам — щёлкаем как семечки 👉 https://dbquacks.com/.

🗿 Монолит на 930 эндпоинтов: лечим по шагам С монолитом и 4+ ТБ данных можно работать! Доказано Яндекс Едой. Ребята применил
🗿 Монолит на 930 эндпоинтов: лечим по шагам С монолитом и 4+ ТБ данных можно работать! Доказано Яндекс Едой. Ребята применили классические методы для оптимизации запросов и перераспределения нагрузки, добавив к этому свой TableSwitcher для миграции данных. Базовое + новое = улучшенная производительность. Реклама. ООО «ЯНДЕКС», ИНН 7736207543

🚀 Ускоряем работу с данными с помощью Delta Lake Когда нужно добавить новые данные к уже существующему набору, есть два подх
🚀 Ускоряем работу с данными с помощью Delta Lake Когда нужно добавить новые данные к уже существующему набору, есть два подхода: 🔴 Без Delta Lake - Сначала загружаешь все старые данные (например, 10 000 записей) из CSV. - Загружаешь новые данные (например, 50 записей). - Объединяешь их, что требует обработки всех 10 050 записей. - Это медленно, расходует память и ресурсы. 🟢 С Delta Lake - Хранишь данные в формате Delta Lake. - Загружаешь только новые записи (например, 50 штук). - Добавляешь их напрямую в существующую таблицу с помощью append, обрабатывая только новые данные. - Экономия времени, памяти и ресурсов. 💡 Преимущества Delta Lake: - Инкрементальная загрузка данных. - Работа с большими объёмами без полной перезагрузки. - Поддержка транзакций (ACID). - Совместимость с большими дата-платформами (Spark, Pandas и др.). 📊 Если у тебя миллионы строк — выигрыш в скорости будет колоссальным. @sqlhub

📊 Из PDF в DataFrame за пару строк кода Работаете с финансовыми отчётами или любыми табличными данными в PDF? С библиотекой
📊 Из PDF в DataFrame за пару строк кода Работаете с финансовыми отчётами или любыми табличными данными в PDF? С библиотекой docling это становится максимально просто. Большинство инструментов для работы с PDF заставляют собирать пайплайн вручную: одна библиотека для извлечения текста, другая для парсинга, третья для чанкинга. Docling закрывает весь процесс — от сырых PDF до структурированных и готовых к поиску данных — в одном решении. 📌 Преимущество Docling 🔹 Поддержка PDF, DOCX, PPTX, HTML и изображений 🔹 AI-модель TableFormer для понимания сложных таблиц 🔹 Vision-модели для OCR и image-to-text 🔹 Простой экспорт в pandas DataFrame, JSON и Markdown Пример: конвертируем PDF с отчётом о доходах и сразу получаем pandas DataFrame 👇

from docling.document_converter import DocumentConverter

converter = DocumentConverter()
result = converter.convert("financial_report.pdf")

for table in result.document.tables:
    df = table.export_to_dataframe()
📌 Github @sqlhub #AI #RAG #Docling #DataEngineering #PDF

🐘 Tarantool — необычная платформа, сочетающая in-memory базу данных с полноценным сервером приложений на Lua. Проект имеет д
🐘 Tarantool — необычная платформа, сочетающая in-memory базу данных с полноценным сервером приложений на Lua. Проект имеет два движка хранения: in-memory с WAL и LSM-дерево, поддерживает ANSI SQL и асинхронную репликацию. Инструмент имеет встроенный JIT-компилятор LuaJIT, позволяющий исполнять бизнес-логику прямо рядом с данными. При этом сохраняется совместимость с внешними СУБД вроде PostgreSQL через коннекторы. Проект полезен для высоконагруженных веб-сервисов, кэширующих слоёв и систем обработки очередей сообщений. 🤖 GitHub @sqlhub

💡 Полезный хинт для Oracle SQL — использование TRUNC с датами для фильтрации и агрегации В Oracle функция `TRUNC(date, 'fmt')` обрезает дату до заданного формата, обнуляя менее значимые части (часы, минуты, секунды и т.д.). Это помогает: - фильтровать данные по дням, месяцам, годам, неделям, кварталам, - делать группировки без сложных выражений, - избавляться от ошибок, когда время мешает сравнению дат. 📌 Форматы: - 'DD' — начало дня (по умолчанию) - 'MM' — первый день месяца - 'YYYY' — первый день года - 'IW' — начало ISO-недели - 'Q' — первый день квартала 📍 Примеры: - Все сделки за сегодня

select * 
from trades
where trunc(ts) = trunc(sysdate);
- Группировка по месяцам

select trunc(ts, 'MM') as month_start, sum(price) as total
from trades
group by trunc(ts, 'MM')
order by month_start;

-- Данные за текущий квартал
select * 
from trades
where trunc(ts, 'Q') = trunc(sysdate, 'Q');
⚡ Плюсы: - Удобно в чтении и написании - Убирает проблемы с «лишними» часами и минутами в датах - Работает напрямую с типом DATE без лишних кастов @sqlhub

Разбираем тестовое задание в Яндекс на позицию Junior аналитика данных Тестовое задание — важная часть трудоустройства аналит
Разбираем тестовое задание в Яндекс на позицию Junior аналитика данных Тестовое задание — важная часть трудоустройства аналитика. Это шанс показать свои навыки на практике и получить оффер мечты. Приглашаем на бесплатный вебинар, где Андрон Алексанян — эксперт в области аналитики и CEO школы аналитики Simulative — в прямом эфире разберет тестовое задание в Яндекс на позицию Junior аналитика данных. ⚡️На вебинаре вы:
🟠узнаете, какие навыки и знания необходимы для успешного выполнения заданий; 🟠поймёте, что хочет увидеть работодатель; 🟠получите советы и лайфхаки; 🟠вместе с Андроном разберете в прямом эфире реальный пример тестового 🔥
Чему именно научимся на вебинаре:
🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла; 🟠Найдем закономерности и отличия использования сервиса на мобильных устройствах и компьютерах; 🟠Разберем фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др.
🕗 Настоятельно рекомендуем не пропускать — для зрителей у нас есть особый бонус, который обеспечит вам уверенный старт в вашей карьере. 😶Зарегистрироваться на бесплатный вебинар

🧩 Продвинутая задача по SQL (Oracle): найти «бычьи серии» продаж и момент разворота Задача Есть таблица продаж по дням: sales(day_date DATE, customer_id NUMBER, amount NUMBER) Нужно для каждого клиента найти интервалы из не меньше 3 подряд идущих дней, где сумма amount строго возрастает каждый день, а на следующий день после интервала происходит разворот вниз (т.е. amount меньше, чем в последний день серии). Для каждого такого интервала вернуть: - customer_id - start_date, end_date серии - length (длина серии в днях) - last_amount (сумма в последний день серии) - drop_amount (сумма в день разворота) - drop_pct (процент падения относительно last_amount) Решение (Oracle 12c+): используем MATCH_RECOGNIZE

SELECT *
FROM sales
MATCH_RECOGNIZE (
  PARTITION BY customer_id
  ORDER BY day_date
  MEASURES
    FIRST(day_date)       AS start_date,
    LAST(day_date)        AS end_date,
    COUNT(A.*)            AS length,
    LAST(amount)          AS last_amount,
    NEXT(amount)          AS drop_amount,
    ROUND( (LAST(amount) - NEXT(amount)) / NULLIF(LAST(amount),0) * 100, 2 ) AS drop_pct
  ONE ROW PER MATCH
  AFTER MATCH SKIP PAST LAST ROW
  PATTERN (A{3,} D)
  DEFINE
    A AS ( PREV(amount) IS NULL OR amount > PREV(amount) ),
    D AS amount < PREV(amount)
);

Пояснение - PATTERN (A{3,} D) — ищем подпоследовательность из минимум трёх строго возрастающих дней A, за которой сразу идёт день падения D. - DEFINE A — рост относительно предыдущего дня в группе клиента. - DEFINE D — падение относительно предыдущего дня (последнего A). - MEASURES — извлекаем границы серии и метрики, NEXT(amount) берёт сумму в день разворота. - AFTER MATCH SKIP PAST LAST ROW — не пересекаем серии. Бонус: защита от «лестниц» с пропусками дат Если в данных бывают пропуски дней, а вам нужны подряд идущие даты, добавьте проверку календарной последовательности:

DEFINE
  A AS ( (PREV(amount) IS NULL OR amount > PREV(amount))
         AND (PREV(day_date) IS NULL OR day_date = PREV(day_date) + 1) ),
  D AS ( amount < PREV(amount) AND day_date = PREV(day_date) + 1 )
Зачем так делать MATCH_RECOGNIZE — мощный инструмент Oracle для поиска сложных паттернов по времени (распознавание трендов, разрывов, «голова-плечи», аномалий). Он заменяет громоздкие CTE с аналитиками и делает запрос короче, быстрее и точнее при работе с последовательностями. @sqlhub