ar
Feedback
Data Science. SQL hub

Data Science. SQL hub

الذهاب إلى القناة على Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

إظهار المزيد

📈 نظرة تحليلية على قناة تيليجرام Data Science. SQL hub

تُعد قناة Data Science. SQL hub (@sqlhub) في القطاع اللغوي الروسية لاعباً نشطاً. يضم المجتمع حالياً 35 960 مشتركاً، محتلاً المرتبة 3 610 في فئة التكنولوجيات والتطبيقات والمرتبة 17 707 في منطقة روسيا.

📊 مؤشرات الجمهور والحراك

منذ تأسيسه في невідомо، حقق المشروع نمواً سريعاً وجمع 35 960 مشتركاً.

بحسب آخر البيانات بتاريخ 31 أغسطس, 2026، تحافظ القناة على نشاط مستقر. خلال آخر 30 يوماً تغيّر عدد الأعضاء بمقدار 66، وفي آخر 24 ساعة بمقدار 19، مع بقاء الوصول العام مرتفعاً.

  • حالة التحقق: غير موثّقة
  • معدل التفاعل (ER): يبلغ متوسط تفاعل الجمهور 6.43‎%. وخلال أول 24 ساعة من النشر يحصد المحتوى عادةً 3.46‎% من ردود الفعل نسبةً إلى إجمالي المشتركين.
  • وصول المنشورات: يحصل كل منشور على متوسط 2 311 مشاهدة. وخلال اليوم الأول يجمع عادةً 1 243 مشاهدة.
  • التفاعلات والاستجابة: يتفاعل الجمهور بانتظام؛ متوسط التفاعلات لكل منشور يبلغ 10.
  • الاهتمامات الموضوعية: يركز المحتوى على مواضيع رئيسية مثل sql, индекс, postgres, index, sqlite.

📝 الوصف وسياسة المحتوى

يصف المؤلف القناة بأنها مساحة للتعبير عن الآراء الذاتية:
По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

بفضل وتيرة التحديث المرتفعة (أحدث البيانات بتاريخ 01 سبتمبر, 2026) تحافظ القناة على حداثتها ومستوى وصول مرتفع. وتُظهر التحليلات تفاعلاً نشطاً من الجمهور، ما يجعلها نقطة تأثير مهمة ضمن فئة التكنولوجيات والتطبيقات.

35 960
المشتركون
+1924 ساعات
+147 أيام
+6630 أيام
أرشيف المشاركات
💡 SQL: условные агрегаты через CASE !!! Хотите посчитать сумму только по условию прямо внутри агрегата? Для этого не нужен отдельный WHERE — используйте CASE WHEN.

SELECT 
    customer_id,
    SUM(CASE WHEN status = 'completed' THEN amount ELSE 0 END) AS completed_sum,
    SUM(CASE WHEN status = 'pending' THEN amount ELSE 0 END)   AS pending_sum
FROM orders
GROUP BY customer_id;
🔎 В одном запросе можно посчитать суммы по разным статусам — и не делать несколько JOIN или подзапросов. Работает также с COUNT(), AVG() и другими агрегатами. @sqlhub

⚡️В прошлый четверг команда VK собрала буквально всю RecSys-тусовку. Судя по ленте, на ивенте было стильно и глитчово Это пер
+3
⚡️В прошлый четверг команда VK собрала буквально всю RecSys-тусовку. Судя по ленте, на ивенте было стильно и глитчово Это первая встреча AI VK & Pro. На ней рассказали о будущем рекомендаций, о том, как строят единую Discovery-платформу для рекомендательных систем во всех продуктах VK и еще много всего полезного Успели всё: отыграть DJ-сеты, эффективно понетворкать, был даже турнир по су-е-фа

🗄 MySQL vs Postgres: как кэшируют страницы данных ⚡ Подходы разные: - MySQL (InnoDB) стремится всё держать под своим контрол
🗄 MySQL vs Postgres: как кэшируют страницы данных ⚡ Подходы разные: - MySQL (InnoDB) стремится всё держать под своим контролем - Postgres больше доверяет операционной системе MySQL / InnoDB - Своя память под кэш: innodb_buffer_pool_size обычно = 70%+ RAM на выделенном сервере - Обход кэша ОС: с innodb_flush_method='O_DIRECT' InnoDB работает напрямую с диском - Двухсекционный LRU: страницы сначала в old, только потом (через innodb_old_blocks_time`) в `young. Это спасает от «выметания» кэша при больших сканах Postgres - Внутренний кэш + page cache ОС: shared_buffers обычно около 30% RAM, остальное оставляют ОС - Clock-sweep: у страницы счётчик обращений, уменьшается при «прокрутке часов». Когда падает до нуля — страница освобождается Практические выводы - Bulk-операции: InnoDB устойчивее к «пробиванию» кэша, в Postgres часть нагрузки идёт в кэш файловой системы - Тюнинг памяти: в MySQL раздувают buffer pool, в Postgres shared_buffers умеренный, а остальное доверяют ОС Что стоит проверить в бенчмарках Postgres - Размер shared_buffers: 4% / 10% / 30% / 50% RAM - Сценарии: OLTP, последовательные сканы, смешанные нагрузки - Рабочий набор: меньше / равен / больше доступной RAM - Метрики: TPS/QPS, p95/p99 латентность, hit ratio, про https://github.com/postgres/postgres/blob/master/src/backend/storage/buffer/README

❌ Классический поиск по ключевым словам даёт ограниченные результаты. Нашёл только одно совпадение: "Machine Learning Overvie
❌ Классический поиск по ключевым словам даёт ограниченные результаты. Нашёл только одно совпадение: "Machine Learning Overview". ✅ А вот pgvector ищет по смыслу и находит связанные концепции. Пример запроса возвращает 5 релевантных документов: – Machine Learning Overview – Data Mining Basics – Introduction to AI – Deep Learning Guide Семантический поиск > ключевого 🔥

YTsaurus — инфраструктура хранения и обработки больших данных. Включает динамические таблицы, которые позволяют хранить и обр
YTsaurus — инфраструктура хранения и обработки больших данных. Включает динамические таблицы, которые позволяют хранить и обрабатывать большие данные для десятков тысяч пользователей в реальном времени.  Инструмент идеально подходит для высоконагруженных сценариев, где требуются горизонтальное масштабирование, exactly-once семантика и время отклика в миллисекунды. Может применяться в том числе и для создания системы поведенческого таргетинга. Поддерживает MapReduce и NVMe SSD.  Пример использования YTsaurus на Хабре

📚🎮 SQL + Покемоны = Querymon! Энтузиасты сделали игру, которая превращает изучение баз данных в настоящее приключение. ✨ С нуля — начнёте с простых таблиц и базовых запросов, сложность растёт постепенно. 🔎 Освоите SELECT, FROM, WHERE, фильтры LIKE, BETWEEN, IN и функции sum(), count(), avg(). 🎯 Геймплей — сотни миссий, где, чтобы пройти дальше, нужно правильно писать SQL-запросы. SQL ещё никогда не был таким весёлым: учиться теперь так же увлекательно, как ловить покемонов. И самое приятное — игра полностью бесплатная. 👉 Попробовать можно здесь.

🦆 Полезный интерактивный тренажёр по SQL Учитесь писать SQL-запросы через игру: - Пошаговые уроки с живым редактором — пишешь код и сразу видишь результат. - Задачи и мини-квесты, где вы помогаете Дакберту пробираться сквозь потоки данных. - Работает бесплатно, прямо в браузере или на телефоне. 🎮 Попробовать: https://dbquacks.com/

🚀 Jupyter Agent 2 Этот агент умеет: 📂 Загружать данные 💻 Запускать код 📊 Строить графики прямо в Jupyter — быстрее, чем вы успеете прокрутить экран! 🤖 Основан на движке Qwen3-Coder ⚡️ Работает на Cerebras ⚙️ Запускается в E2B ↕️ Поддерживает загрузку файлов 👉 Попробовать можно здесь: https://hf.co/spaces/lvwerra/jupyter-agent-2 @sqlhub

Как начать в Data Science, когда все вокруг уже сеньоры? До 15 сентября в Вышке продолжается набор на онлайн-магистратуру «Ма
Как начать в Data Science, когда все вокруг уже сеньоры? До 15 сентября в Вышке продолжается набор на онлайн-магистратуру «Магистр по наукам о данных». Поступить можно даже без технического бэкграунда, а учиться — в удобном формате. Вы научитесь: ⚪️ работать с данными ⚪️ применять классические модели ML ⚪️ решать бизнес-задачи из сфер DA и DS Вам подходит программа, если вы ⭐️ Из другой сферы деятельности, но хотите войти в IT ⭐️ Самоучка и хотите подтвердить знания дипломом ⭐️ Хотите стать IT-специалистом, но пока не понимаете, каким именно ⭐️ Хотите освоить инструменты Data Science для своих проектов в другой сфере Как проходит обучение ⚪️ Онлайн-занятия в прямом эфире с возможностью задавать вопросы ⚪️ Диплом НИУ ВШЭ с указанием очной формы обучения ⚪️ Поддержка в чате 24/7 Прием документов до 15 сентября, 17:00. Подробнее о программе можно узнать тут. А чтобы узнать, как подать документы, вступайте в чат абитуриентов — там найдете инструкции и сможете получить ответы на любые вопросы по поступлению.

🌲 Datahike — персистентная база данных на основе Datalog. Это локальная база данных с поддержкой временных запросов и истори
🌲 Datahike — персистентная база данных на основе Datalog. Это локальная база данных с поддержкой временных запросов и историчностью данных, совместимая с подмножеством API Datomic. Интрумент используется в проверенных решениях: ядра запросов из DataScript и устойчивой структуры данных hitchhiker-tree. Проект подходит для средних по размеру приложений, где важна простота развертывания и открытая лицензия. 🤖 GitHub @sqlhub

📉 На Уолл-стрит началась просадка AI-акций — и спусковым крючком оказался в отчёте MIT. В нём говорится, что 95% компаний не
📉 На Уолл-стрит началась просадка AI-акций — и спусковым крючком оказался в отчёте MIT. В нём говорится, что 95% компаний не получают прибыли от внедрения generative AI, а реальные результаты видят только 5%. Почему так: - Компании запускают до того, как готовы пайплайны данных, безопасность и обучение сотрудников - Деньги уходят на сервера и модели, а внедрение в процессы оказывается долгим и дорогим ⚠️ На фоне разговоров про «AI-пузырь» фонды начали выходить из популярных AI-акций, что вызвало обвал. 👉 Но это похоже не на крах, а на проверку реальностью. Дальнейший рост будет зависеть от реальной экономики ИИ: снижения стоимости инференса и доказанного роста продуктивности. 📌 Источник

Где вы окажетесь завтра, зависит от того, что вы изучаете сегодня. PostgreSQL — инструмент, который ищут компании, а грамотны
Где вы окажетесь завтра, зависит от того, что вы изучаете сегодня. PostgreSQL — инструмент, который ищут компании, а грамотных специалистов по нему все еще немного. Почему именно PostgreSQL? Потому что это не просто база данных, а сердце ваших проектов. Если вы администратор БД, разработчик, DevOps или администратор Linux, этот курс — ваш апгрейд. Мы научим настраивать кластеры, оптимизировать производительность, разбираться с блокировками и решать задачи работы с большими объемами данных. А также живые лекции, практические задания и диплом, который признают лидеры рынка. Учитесь у практиков, которые знают, как решать реальные задачи, и получите навыки, за которые платят топовые компании. Присоединяйтесь к курсу сейчас и начните свой путь к высокооплачиваемой карьере! Оставить заявку на курс и получить скидку: https://otus.pw/yEz4/?erid=2W5zFHAFsn8 Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

🎮 Учим SQL через захватывающую аркадную игру Разработчики замутили настоящий олдскульный шедевр, который сделает из вас МАСТ
🎮 Учим SQL через захватывающую аркадную игру Разработчики замутили настоящий олдскульный шедевр, который сделает из вас МАСТЕРА баз данных и точно не даст заскучать. • Проходим уровни, собираем пазлы вместе с уткой DuckDB и прокачиваем SQL на максимум. • Квесты, задачи, подсказки — всё как в настоящем приключении. • Работает прямо в браузере и даже на телефоне. Любые запросы к базам — щёлкаем как семечки 👉 https://dbquacks.com/.

🗿 Монолит на 930 эндпоинтов: лечим по шагам С монолитом и 4+ ТБ данных можно работать! Доказано Яндекс Едой. Ребята применил
🗿 Монолит на 930 эндпоинтов: лечим по шагам С монолитом и 4+ ТБ данных можно работать! Доказано Яндекс Едой. Ребята применили классические методы для оптимизации запросов и перераспределения нагрузки, добавив к этому свой TableSwitcher для миграции данных. Базовое + новое = улучшенная производительность. Реклама. ООО «ЯНДЕКС», ИНН 7736207543

🚀 Ускоряем работу с данными с помощью Delta Lake Когда нужно добавить новые данные к уже существующему набору, есть два подх
🚀 Ускоряем работу с данными с помощью Delta Lake Когда нужно добавить новые данные к уже существующему набору, есть два подхода: 🔴 Без Delta Lake - Сначала загружаешь все старые данные (например, 10 000 записей) из CSV. - Загружаешь новые данные (например, 50 записей). - Объединяешь их, что требует обработки всех 10 050 записей. - Это медленно, расходует память и ресурсы. 🟢 С Delta Lake - Хранишь данные в формате Delta Lake. - Загружаешь только новые записи (например, 50 штук). - Добавляешь их напрямую в существующую таблицу с помощью append, обрабатывая только новые данные. - Экономия времени, памяти и ресурсов. 💡 Преимущества Delta Lake: - Инкрементальная загрузка данных. - Работа с большими объёмами без полной перезагрузки. - Поддержка транзакций (ACID). - Совместимость с большими дата-платформами (Spark, Pandas и др.). 📊 Если у тебя миллионы строк — выигрыш в скорости будет колоссальным. @sqlhub

📊 Из PDF в DataFrame за пару строк кода Работаете с финансовыми отчётами или любыми табличными данными в PDF? С библиотекой
📊 Из PDF в DataFrame за пару строк кода Работаете с финансовыми отчётами или любыми табличными данными в PDF? С библиотекой docling это становится максимально просто. Большинство инструментов для работы с PDF заставляют собирать пайплайн вручную: одна библиотека для извлечения текста, другая для парсинга, третья для чанкинга. Docling закрывает весь процесс — от сырых PDF до структурированных и готовых к поиску данных — в одном решении. 📌 Преимущество Docling 🔹 Поддержка PDF, DOCX, PPTX, HTML и изображений 🔹 AI-модель TableFormer для понимания сложных таблиц 🔹 Vision-модели для OCR и image-to-text 🔹 Простой экспорт в pandas DataFrame, JSON и Markdown Пример: конвертируем PDF с отчётом о доходах и сразу получаем pandas DataFrame 👇

from docling.document_converter import DocumentConverter

converter = DocumentConverter()
result = converter.convert("financial_report.pdf")

for table in result.document.tables:
    df = table.export_to_dataframe()
📌 Github @sqlhub #AI #RAG #Docling #DataEngineering #PDF

🐘 Tarantool — необычная платформа, сочетающая in-memory базу данных с полноценным сервером приложений на Lua. Проект имеет д
🐘 Tarantool — необычная платформа, сочетающая in-memory базу данных с полноценным сервером приложений на Lua. Проект имеет два движка хранения: in-memory с WAL и LSM-дерево, поддерживает ANSI SQL и асинхронную репликацию. Инструмент имеет встроенный JIT-компилятор LuaJIT, позволяющий исполнять бизнес-логику прямо рядом с данными. При этом сохраняется совместимость с внешними СУБД вроде PostgreSQL через коннекторы. Проект полезен для высоконагруженных веб-сервисов, кэширующих слоёв и систем обработки очередей сообщений. 🤖 GitHub @sqlhub

💡 Полезный хинт для Oracle SQL — использование TRUNC с датами для фильтрации и агрегации В Oracle функция `TRUNC(date, 'fmt')` обрезает дату до заданного формата, обнуляя менее значимые части (часы, минуты, секунды и т.д.). Это помогает: - фильтровать данные по дням, месяцам, годам, неделям, кварталам, - делать группировки без сложных выражений, - избавляться от ошибок, когда время мешает сравнению дат. 📌 Форматы: - 'DD' — начало дня (по умолчанию) - 'MM' — первый день месяца - 'YYYY' — первый день года - 'IW' — начало ISO-недели - 'Q' — первый день квартала 📍 Примеры: - Все сделки за сегодня

select * 
from trades
where trunc(ts) = trunc(sysdate);
- Группировка по месяцам

select trunc(ts, 'MM') as month_start, sum(price) as total
from trades
group by trunc(ts, 'MM')
order by month_start;

-- Данные за текущий квартал
select * 
from trades
where trunc(ts, 'Q') = trunc(sysdate, 'Q');
⚡ Плюсы: - Удобно в чтении и написании - Убирает проблемы с «лишними» часами и минутами в датах - Работает напрямую с типом DATE без лишних кастов @sqlhub

Разбираем тестовое задание в Яндекс на позицию Junior аналитика данных Тестовое задание — важная часть трудоустройства аналит
Разбираем тестовое задание в Яндекс на позицию Junior аналитика данных Тестовое задание — важная часть трудоустройства аналитика. Это шанс показать свои навыки на практике и получить оффер мечты. Приглашаем на бесплатный вебинар, где Андрон Алексанян — эксперт в области аналитики и CEO школы аналитики Simulative — в прямом эфире разберет тестовое задание в Яндекс на позицию Junior аналитика данных. ⚡️На вебинаре вы:
🟠узнаете, какие навыки и знания необходимы для успешного выполнения заданий; 🟠поймёте, что хочет увидеть работодатель; 🟠получите советы и лайфхаки; 🟠вместе с Андроном разберете в прямом эфире реальный пример тестового 🔥
Чему именно научимся на вебинаре:
🟠С помощью Pandas проанализируем Яндекс-запросы за несколько недель, загрузив их из json-файла; 🟠Найдем закономерности и отличия использования сервиса на мобильных устройствах и компьютерах; 🟠Разберем фишки Pandas: сложную агрегацию, маппинг, конкатенацию, чейнинг и др.
🕗 Настоятельно рекомендуем не пропускать — для зрителей у нас есть особый бонус, который обеспечит вам уверенный старт в вашей карьере. 😶Зарегистрироваться на бесплатный вебинар

🧩 Продвинутая задача по SQL (Oracle): найти «бычьи серии» продаж и момент разворота Задача Есть таблица продаж по дням: sales(day_date DATE, customer_id NUMBER, amount NUMBER) Нужно для каждого клиента найти интервалы из не меньше 3 подряд идущих дней, где сумма amount строго возрастает каждый день, а на следующий день после интервала происходит разворот вниз (т.е. amount меньше, чем в последний день серии). Для каждого такого интервала вернуть: - customer_id - start_date, end_date серии - length (длина серии в днях) - last_amount (сумма в последний день серии) - drop_amount (сумма в день разворота) - drop_pct (процент падения относительно last_amount) Решение (Oracle 12c+): используем MATCH_RECOGNIZE

SELECT *
FROM sales
MATCH_RECOGNIZE (
  PARTITION BY customer_id
  ORDER BY day_date
  MEASURES
    FIRST(day_date)       AS start_date,
    LAST(day_date)        AS end_date,
    COUNT(A.*)            AS length,
    LAST(amount)          AS last_amount,
    NEXT(amount)          AS drop_amount,
    ROUND( (LAST(amount) - NEXT(amount)) / NULLIF(LAST(amount),0) * 100, 2 ) AS drop_pct
  ONE ROW PER MATCH
  AFTER MATCH SKIP PAST LAST ROW
  PATTERN (A{3,} D)
  DEFINE
    A AS ( PREV(amount) IS NULL OR amount > PREV(amount) ),
    D AS amount < PREV(amount)
);

Пояснение - PATTERN (A{3,} D) — ищем подпоследовательность из минимум трёх строго возрастающих дней A, за которой сразу идёт день падения D. - DEFINE A — рост относительно предыдущего дня в группе клиента. - DEFINE D — падение относительно предыдущего дня (последнего A). - MEASURES — извлекаем границы серии и метрики, NEXT(amount) берёт сумму в день разворота. - AFTER MATCH SKIP PAST LAST ROW — не пересекаем серии. Бонус: защита от «лестниц» с пропусками дат Если в данных бывают пропуски дней, а вам нужны подряд идущие даты, добавьте проверку календарной последовательности:

DEFINE
  A AS ( (PREV(amount) IS NULL OR amount > PREV(amount))
         AND (PREV(day_date) IS NULL OR day_date = PREV(day_date) + 1) ),
  D AS ( amount < PREV(amount) AND day_date = PREV(day_date) + 1 )
Зачем так делать MATCH_RECOGNIZE — мощный инструмент Oracle для поиска сложных паттернов по времени (распознавание трендов, разрывов, «голова-плечи», аномалий). Он заменяет громоздкие CTE с аналитиками и делает запрос короче, быстрее и точнее при работе с последовательностями. @sqlhub