ru
Feedback
Data Science. SQL hub

Data Science. SQL hub

Открыть в Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

Больше

📈 Аналитический обзор Telegram-канала Data Science. SQL hub

Канал Data Science. SQL hub (@sqlhub) языкового сегмента Русский является активным участником. Сейчас сообщество объединяет 35 970 подписчиков, занимая 3 638 место в категории Технологии и приложения и 17 609 место в регионе Россия.

📊 Показатели аудитории и динамика

С момента создания невідомо проект демонстрирует стремительный рост, собрав аудиторию из 35 970 подписчиков.

Согласно последним данным от 05 октября, 2026, канал показывает стабильную активность. За последние 30 дней изменение числа участников составило -14, а за последние 24 часа — 5, при этом общий охват остаётся высоким.

  • Статус верификации: Не верифицирован
  • Уровень вовлечённости (ER): Средний показатель вовлечённости аудитории составляет 7.31%. В первые 24 часа после публикации контент обычно набирает 3.80% реакций от общего числа подписчиков.
  • Охват публикаций: В среднем каждый пост получает 2 628 просмотров. В течение первых суток публикация набирает 1 366 просмотров.
  • Реакции и взаимодействия: Аудитория активно поддерживает контент: среднее количество реакций на один пост — 9.
  • Тематические интересы: Контент сосредоточен на ключевых темах, таких как sql, индекс, postgres, index, sqlite.

📝 Описание и контентная политика

Автор описывает ресурс как площадку для выражения субъективного мнения:
“По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ”

Благодаря высокой частоте обновлений (последние данные получены 06 октября, 2026) канал поддерживает актуальность и высокий уровень охвата публикаций. Аналитика показывает, что аудитория активно взаимодействует с контентом, что делает его важной точкой влияния в категории Технологии и приложения.

35 970
Подписчики
+524 часа
+307 дней
-1430 дней
Архив постов
⚡️ SQL с подвохом: NULL в пустом списке Что выведет PostgreSQL?

SELECT
  NULL IN (SELECT 1 WHERE FALSE)     AS a,
  NULL NOT IN (SELECT 1 WHERE FALSE) AS b;
Ответ: `a = false`, `b = true`. Подзапрос возвращает **ноль строк**. Совпадений нет, поэтому `IN` возвращает `false`, а `NOT IN` возвращает `true`, даже если проверяемое значение равно `NULL`. Для сравнения: `NULL IN (1)` вернёт NULL. Пустой набор меняет результат.

DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендери
DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендеринг оригинального DOOM работают внутри CedarDB. Карты, монстры, оружие и состояние игры хранятся в таблицах. SQL рассчитывает движение, атаки и столкновения, а затем собирает картинку: • около 1300 строк SQL и 89 CTE отвечают за рендеринг; • ещё 5900 строк SQL реализуют игровую логику; • кадры 320×200 генерируются примерно с 60 FPS на ноутбуке с Ryzen 7 PRO 7840U. В тяжёлых сценах частота падает до 35 FPS. Python обрабатывает ввод, задаёт тайминг и выводит готовые кадры. Работает даже мультиплеер. Теперь оптимизировать SQL нужно ещё и для того, чтобы монстры не лагали ☕️ Код: https://github.com/cedardb/sqldoom Онлайн-демка: https://demo.cedardb.cloud/projects/38c0ee59-327d-495e-ad40-735521bba941

Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более пр
Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более привлекательной, но в то же время страшной. С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲 И получается ситуация, когда хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать. Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных». Курс разделен на 2 этапа: за первые 10 недель вы осваиваете базу и доходите до уровня junior-специалиста. А на втором этапе — углубленное изучение ключевых инструментов, где вы дорастаете до мидла. Что вас ждет на курсе: ➖SQL, Python, пайплайны сбора и обновления данных, хранение и обработка, DWH; ➖Живые занятия с ментором каждую неделю — не записи, а разборы вживую; ➖Подготовка к собеседованиям с первых недель, а не в самом конце; ➖ИИ-инструменты как часть программы — учите работать с ними, а не избегать; ➖Гостевые лекции от практикующих дата-инженеров из Яндекса, Т-Банка, Авито, Сбера, OZON; ➖Официальный диплом о профессиональной переподготовке. Кому подойдёт: 1. Тем, кто хочет войти в дата-инженерию с нуля или перейти из аналитики; 2. Тем, кто пробовал учиться самостоятельно, но теряет темп без структуры; 3. Тем, кому интереснее не просто считать метрики, а выстраивать систему, на которой держатся данные. Почему сейчас: специалистов, которые управляют данными как системой, на рынке меньше, чем нужно, — а спрос растёт, потому что без инженерии любые данные быстро превращаются в хаос. 🔥ВАЖНО: Симулейтив дают возможность получить грант обучение и гарантируют трудоустройство своих студентов. Количество грантов ограничено! Оставляйте заявку до завтра включительно, чтобы занять одно из 5 оставшихся мест нового потока! 🔗 ЗАБРОНИРОВАТЬ МЕСТО

🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → о
🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → остаток и повторяем снова. SQLite идёт хитрее. В исходниках есть строка на 200 символов, содержащая все пары от 00 до 99: 000102030405...979899 При преобразовании числа SQLite обрабатывает его по две цифры за раз и просто берёт нужную пару символов по индексу. То есть вместо множества операций /10 и %10: делим на 100 → получаем две цифры → копируем готовую пару. Маленькая оптимизация, но именно из таких деталей и состоит быстрый системный код. Исходник: sqlite/src/util.c

GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая:
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая: больше сгенерированного кода ещё не означает больше пользы. GitHub предлагает строить работу вокруг трёх вещей: - Governance — что агентам можно делегировать и где нужен человек - Shared Knowledge — код, документация, решения, телеметрия и контекст - Customer Value — приносит ли ускорение реальную пользу пользователям Сам процесс делится на цикл Define → Deliver → Detect, а человек и AI могут выступать как director, performer или assessor. Главная метрика: скорость должна расти без роста дефектов и потери качества. https://github.com/resources/insights/agentic-engineering-system

ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные
ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные сценарии работы агентов — проблемы, которые проще предупредить на этапе проектирования, чем исправлять после запуска. На открытом уроке разберём, как создавать ИИ-системы с учетом требований безопасности с самого начала. Вы узнаете, какие угрозы характерны для LLM, как применять принципы Security by Design и какие архитектурные решения помогают защитить данные и компоненты системы. Разберём практический кейс: усилим архитектуру ИИ-агента с помощью механизмов защиты, проверки данных и управления доступом. Урок пройдет в преддверие старта курса «ИИ-архитектор». Он будет полезен архитекторам ПО, разработчикам, специалистам по инфраструктуре и безопасности, которые проектируют или внедряют ИИ-решения: https://otus.pw/newu/?erid=2W5zFGJGC8R Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Orac
+1
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Oracle около 100 000 передовых ИИ-чипов на 5 лет. Сумма сделки около 7 млрд долларов, то есть примерно 14 000 долларов за чип в год. Сами чипы в Китай не попадают. Они стоят в нескольких дата-центрах Oracle в Юго-Восточной Азии, а Tencent получает к ним доступ удалённо. Формально это законно. Экспортный контроль США регулирует, куда физически уезжают чипы, а аренда вычислительных мощностей из-за рубежа под ограничения не попадает. Получается, что ограничения на поставки чипов для китайских компаний во многом работают только на бумаге: железо остаётся за пределами Китая, а модели на нём обучает китайский бигтех. Так что регуляторам, скорее всего, придётся заняться и облачной арендой. https://www.ft.com/content/8799b33d-f07c-4a03-82f0-bf5d3d1d29e9

Полезный совет для MySQL 8: используй LATERAL, когда для каждой строки нужно получить «лучшие N связанных записей». Например, взять последние 3 заказа каждого пользователя:

SELECT
    u.id,
    u.name,
    o.id AS order_id,
    o.created_at
FROM users u
JOIN LATERAL (
    SELECT id, created_at
    FROM orders
    WHERE orders.user_id = u.id
    ORDER BY created_at DESC
    LIMIT 3
) o ON TRUE;
Без LATERAL такую задачу часто решают через оконные функции и сначала ранжируют всю таблицу orders. С LATERAL база может для каждого пользователя сразу сходить по индексу:

CREATE INDEX idx_orders_user_created
ON orders (user_id, created_at DESC);
Особенно полезно для задач вида: «последние N», «самая дорогая запись», «ближайшее событие», «лучший результат для каждой строки». Главное: всегда проверяй EXPLAIN ANALYZE — на больших таблицах правильный составной индекс здесь решает всё.

🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитек
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитектуру ИИ-агента над корпоративными данными. В том числе поговорят о поиске, метаданных и фильтрах, а главное — о том, как наследовать права доступа исходных систем. Также Даниил Смирнов, руководитель разработки ИИ-платформы Яндекс 360, расскажет, как изолировать данные пользователей и организаций и не допускать утечек через индекс или кэш.. 🗓 6 октября, 17:00 МСК 💻 Онлайн, бесплатно → Зарегистрироваться на эфир

🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLit
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLite через компактное расширение. Что это даёт: - без Pinecone - без Weaviate - без Qdrant - без отдельного vector DB сервера - всё хранится рядом с обычными данными в SQLite Расширение маленькое, open source и запускается везде, где работает SQLite. Для локальных AI-приложений, RAG, embedded-сценариев и небольших сервисов это особенно интересно: одна база, один файл, обычный SQL + поиск по эмбеддингам. https://github.com/asg017/sqlite-vec

Для чего используется команда ANALYZE в PostgreSQL?
Anonymous voting

🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недост
🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недостаточно. Нужна связка инструментов, которая закрывает весь путь данных: от загрузки и хранения до обработки, аналитики и визуализации. Такой сценарий можно реализовать в Stackland - платформе, которая разворачивается локально в контуре компании. В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу: 🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL - хранение и обработка данных. 🔹 Yandex Managed Service for Trino + Yandex Object Storage - основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним. 🔹 Managed Service for Apache Airflow® - управление оркестратором потоков операций по обработке данных. 🔹 Yandex DataLens - BI-система для визуализации данных. При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании. Для data engineering-команд такой подход интересен прежде всего тем, что можно собрать под одной платформой основные компоненты современного data stack: Storage → SQL → ETL/ELT → DWH/аналитика → BI И не тратить время на самостоятельную сборку и поддержку каждого компонента с нуля.

⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует порт на всех сетевых интерфейсах хоста. На Linux правило UFW, закрывающее порт, может не помочь: Docker направляет трафик к контейнеру до обработки правил UFW. Если доступ нужен только с самого сервера, укажите адрес явно:

docker run -p 127.0.0.1:5432:5432 ...
Для всех контейнеров можно изменить адрес привязки по умолчанию в настройках Docker. Но самый простой способ избежать сюрприза - всегда проверять, на каком адресе опубликован порт. Документация Docker - https://docs.docker.com/engine/network/port-publishing/

💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент я
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент якобы удалил 48 218 файлов рабочего проекта и уничтожил часть Git-репозитория. Что произошло: - агенту поручили пересобрать mirror проекта; - он написал Python-скрипт для удаления старой копии; - в Windows-каталоге находились directory junctions, ведущие обратно в рабочее дерево; - проверка ссылок сработала не так, как ожидалось; - скрипт начал удалять уже реальные файлы проекта. В результате были очищены .git/objects, refs и logs, поэтому восстановление через обычный Git оказалось невозможно. Checkpoint Claude Code здесь не обязательно спасает, потому что изменения, сделанные через Bash/PowerShell, могут не попадать в механизм rewind. Источник: https://cybersecuritynews.com/claude-code-agent-file-deletion/

Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в AlloyDB. Когда нагрузка растёт, система за секунды запускает изолированные экземпляры базы для агентов. Они получают доступ на чтение к актуальным данным, но не конкурируют за вычислительные ресурсы с основной базой. После работы экземпляры масштабируются до нуля. Агентам доступны SQL, индексы, векторный и полнотекстовый поиск. Идея в том, чтобы они могли исследовать свежие данные и выполнять множество запросов, не замедляя транзакции пользователей. Статус: Preview, доступ предоставляется по запросу. Анонс Google Cloud - https://cloud.google.com/blog/products/databases/announcing-postgresql-for-agents-in-alloydb

Softmax простыми словами: что значат 66,5% в ответе нейросети? Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятности следующих токенов, и 66,5% означают только то, что такое продолжение текста самое вероятное. Модель может звучать уверенно и при этом ошибаться, потому что вероятность токена это не вероятность правды. Разбираем на деле Киры, как проверять ответы ИИ через источники и контекст.

🔥Один слой данных вместо цепочки копий между системами В традиционной аналитической инфраструктуре результаты обработки приходится переносить между хранилищем, SQL-системой и BI. Вместе с каждой копией появляется новая задача: ее нужно обновлять, сверять с исходными данными и учитывать в правилах доступа. В DataLens Platform разные инструменты работают с общей основой данных. Lakehouse построен на S3 и Apache Iceberg. Trino используется для интерактивных SQL-запросов, Spark — для ресурсоемкой обработки, Airflow — для управления процессами. Единый каталог метаданных показывает происхождение данных и их использование. Общая модель доступа действует на уровне всей платформы. Так компания сокращает количество переносов между системами, а результаты подготовки данных можно повторно использовать в SQL-запросах, отчетах и ИИ-сценариях. 📎 Подробнее о DataLens Platform — в материале СМИ.

⚡️ SQL-задача с опасным подвохом Какой баланс получит аккаунт после выполнения запроса в PostgreSQL?

CREATE TABLE accounts (
    id      int PRIMARY KEY,
    balance int
);

CREATE TABLE operations (
    account_id int,
    amount     int
);

INSERT INTO accounts VALUES (1, 100);
INSERT INTO operations VALUES
    (1, 10),
    (1, 20);

UPDATE accounts a
SET balance = a.balance + o.amount
FROM operations o
WHERE o.account_id = a.id;
Многие ответят 130, но PostgreSQL обновит строку только один раз. Результатом может стать 110 или 120. Если целевая строка соединяется с несколькими строками из FROM, PostgreSQL использует одну из них, но какую именно, не гарантируется. Правильный вариант:

UPDATE accounts a
SET balance = a.balance + x.total
FROM (
    SELECT account_id, SUM(amount) AS total
    FROM operations
    GROUP BY account_id
) x
WHERE x.account_id = a.id;
Теперь каждой строке accounts соответствует ровно одна строка источника, а баланс станет 130. #SQL #PostgreSQL #Database

Repost from Machinelearning
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязык
+1
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M.
Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее.
Модели принимают один или несколько аудиофрагментов вместе с текстовым запросом и отвечают текстом: описывают звук, отвечают на вопросы о записи, сравнивают клипы между собой. Заявлено понимание речи, музыки и звуки окружения. Отвечают модели только по-английски и строчными буквами - ради экономии параметров оставили в обучающих текстах только строчные символы ASCII и вычистили из словаря редкие токены. Авторы предупреждают, что после дообучения на аудиовопросах модели теряют общие языковые навыки, так что это точечный инструмент, а не полноценный собеседник. 🟡Архитектура Аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор в пространство текстовых эмбеддингов и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров. Каждый клип усредняется до 50 аудиотокенов, а разделитель SEP отделяет клипы друг от друга и от текста, поэтому аудио можно вставлять в любое место запроса. 🟡Тесты На MMAU (10 тысяч вопросов о звуках, музыке и речи) Samsone-134M набирает 61,33% против 53,34% у прежнего лидера среди малых моделей Mellow на 167 млн параметров.
Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%).
На речевой части результаты хуже. В более сложном MMAU-Pro расзница с Mellow составляет 10 пп (37,57% против 27,5%), здесь впереди Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%). На Galaxy S25 Ultra без аппаратных оптимизаций Samsone-99M генерирует 125 токенов в секунду, Samsone-134M - 87, Samsone-356M - 39. Обработка аудио перед генерацией занимает от 0,7 до 1,1 секунды. Веса для PyTorch, код обучения и экспорта, а также Android-приложение под Android 12 и новее выложены в репозитории проекта. 🟡Веса 🟡Arxiv 🖥GitHub @ai_machinelearning_big_data #AI #ML #SALM #Samsone #Samsung

Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже
Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже не хватает для задач ИИ и аналитики. Большие объёмы данных нужно не только хранить, но и быстро записывать и читать. В MWS Cloud Platform мы построили объектное хранилище не только на привычных HDD-дисках, но и на NVMe. На вебинаре покажем, какие сценарии работы это открывает и как меняет привычные подходы. Подключайтесь! Обсудим: ✅ Чем классы хранения MWS Object Storage отличаются от привычных ✅ В каких сценариях новый тёплый класс проявляет себя лучше всего ✅ Преимущества и слабые места в разных сценариях работы 📆 7 октября в 14:00 (мск) Зарегистрироваться