ch
Feedback
Data Science. SQL hub

Data Science. SQL hub

前往频道在 Telegram

По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ

显示更多

📈 Telegram 频道 Data Science. SQL hub 的分析概览

频道 Data Science. SQL hub (@sqlhub) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 35 970 名订阅者,在 技术与应用 类别中位列第 3 638,并在 俄罗斯 地区排名第 17 609 位。

📊 受众指标与增长动态

自 невідомо 创建以来,项目保持高速增长,吸引了 35 970 名订阅者。

根据 05 十月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -14,过去 24 小时变化为 5,整体触达仍然可观。

  • 认证状态: 未认证
  • 互动率 (ER): 平均受众互动率为 7.31%。内容发布后 24 小时内通常能获得 3.80% 的反应,占订阅者总量。
  • 帖子覆盖: 每篇帖子平均可获得 2 628 次浏览,首日通常累积 1 366 次浏览。
  • 互动与反馈: 受众积极参与,单帖平均反应数为 9。
  • 主题关注点: 内容集中在 sql, индекс, postgres, index, sqlite 等核心主题上。

📝 描述与内容策略

作者将该频道定位为表达主观观点的平台:
“По всем вопросам- @workakkk @itchannels_telegram - 🔥лучшие ит-каналы @ai_machinelearning_big_data - Machine learning @pythonl - Python @pythonlbooks- python книги📚 @datascienceiot - ml книги📚 РКН: https://vk.cc/cIi9vo #VRHSZ”

凭借高频更新(最新数据采集于 06 十月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。

35 970
订阅者
+524 小时
+307 天
-1430 天
帖子存档
⚡️ SQL с подвохом: NULL в пустом списке Что выведет PostgreSQL?

SELECT
  NULL IN (SELECT 1 WHERE FALSE)     AS a,
  NULL NOT IN (SELECT 1 WHERE FALSE) AS b;
Ответ: `a = false`, `b = true`. Подзапрос возвращает **ноль строк**. Совпадений нет, поэтому `IN` возвращает `false`, а `NOT IN` возвращает `true`, даже если проверяемое значение равно `NULL`. Для сравнения: `NULL IN (1)` вернёт NULL. Пустой набор меняет результат.

DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендери
DOOM запустили внутри SQL-базы. Каждый кадр теперь результат запроса 🤯 Лукас Фогель собрал SQLDoom: игровая логика и рендеринг оригинального DOOM работают внутри CedarDB. Карты, монстры, оружие и состояние игры хранятся в таблицах. SQL рассчитывает движение, атаки и столкновения, а затем собирает картинку: • около 1300 строк SQL и 89 CTE отвечают за рендеринг; • ещё 5900 строк SQL реализуют игровую логику; • кадры 320×200 генерируются примерно с 60 FPS на ноутбуке с Ryzen 7 PRO 7840U. В тяжёлых сценах частота падает до 35 FPS. Python обрабатывает ввод, задаёт тайминг и выводит готовые кадры. Работает даже мультиплеер. Теперь оптимизировать SQL нужно ещё и для того, чтобы монстры не лагали ☕️ Код: https://github.com/cedardb/sqldoom Онлайн-демка: https://demo.cedardb.cloud/projects/38c0ee59-327d-495e-ad40-735521bba941

Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более пр
Из аналитика в дата-инженеры: переход реален? 🤔 В последнее время все чаще дата-инженерия для аналитиков становится более привлекательной, но в то же время страшной. С одной стороны, хочется понимать не только то, что происходит с данными, но и как эти данные вообще доезжают до нас. Откуда берутся, где хранятся, как обновляются, почему сегодня в витрине 10 млн строк, а завтра 8 млн и кто опять сломал загрузку🥲 И получается ситуация, когда хочется попробовать, но непонятно, с чего начинать и сколько лет на это закладывать. Поэтому мне понравилось, как Симулейтив пересобрали свой буткемп «Инженер данных». Курс разделен на 2 этапа: за первые 10 недель вы осваиваете базу и доходите до уровня junior-специалиста. А на втором этапе — углубленное изучение ключевых инструментов, где вы дорастаете до мидла. Что вас ждет на курсе: ➖SQL, Python, пайплайны сбора и обновления данных, хранение и обработка, DWH; ➖Живые занятия с ментором каждую неделю — не записи, а разборы вживую; ➖Подготовка к собеседованиям с первых недель, а не в самом конце; ➖ИИ-инструменты как часть программы — учите работать с ними, а не избегать; ➖Гостевые лекции от практикующих дата-инженеров из Яндекса, Т-Банка, Авито, Сбера, OZON; ➖Официальный диплом о профессиональной переподготовке. Кому подойдёт: 1. Тем, кто хочет войти в дата-инженерию с нуля или перейти из аналитики; 2. Тем, кто пробовал учиться самостоятельно, но теряет темп без структуры; 3. Тем, кому интереснее не просто считать метрики, а выстраивать систему, на которой держатся данные. Почему сейчас: специалистов, которые управляют данными как системой, на рынке меньше, чем нужно, — а спрос растёт, потому что без инженерии любые данные быстро превращаются в хаос. 🔥ВАЖНО: Симулейтив дают возможность получить грант обучение и гарантируют трудоустройство своих студентов. Количество грантов ограничено! Оставляйте заявку до завтра включительно, чтобы занять одно из 5 оставшихся мест нового потока! 🔗 ЗАБРОНИРОВАТЬ МЕСТО

🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → о
🧠 TIL: SQLite превращает числа в текст сразу по две цифры Обычно integer → string делают циклом: / 10 → берём цифру % 10 → остаток и повторяем снова. SQLite идёт хитрее. В исходниках есть строка на 200 символов, содержащая все пары от 00 до 99: 000102030405...979899 При преобразовании числа SQLite обрабатывает его по две цифры за раз и просто берёт нужную пару символов по индексу. То есть вместо множества операций /10 и %10: делим на 100 → получаем две цифры → копируем готовую пару. Маленькая оптимизация, но именно из таких деталей и состоит быстрый системный код. Исходник: sqlite/src/util.c

GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая:
GitHub представил Agentic Engineering System - фреймворк для команд, которые внедряют AI-агентов в разработку. Идея простая: больше сгенерированного кода ещё не означает больше пользы. GitHub предлагает строить работу вокруг трёх вещей: - Governance — что агентам можно делегировать и где нужен человек - Shared Knowledge — код, документация, решения, телеметрия и контекст - Customer Value — приносит ли ускорение реальную пользу пользователям Сам процесс делится на цикл Define → Deliver → Detect, а человек и AI могут выступать как director, performer или assessor. Главная метрика: скорость должна расти без роста дефектов и потери качества. https://github.com/resources/insights/agentic-engineering-system

ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные
ИИ-система может отлично решать задачи бизнеса, но при этом оставаться уязвимой. Утечки данных, атаки на модели, небезопасные сценарии работы агентов — проблемы, которые проще предупредить на этапе проектирования, чем исправлять после запуска. На открытом уроке разберём, как создавать ИИ-системы с учетом требований безопасности с самого начала. Вы узнаете, какие угрозы характерны для LLM, как применять принципы Security by Design и какие архитектурные решения помогают защитить данные и компоненты системы. Разберём практический кейс: усилим архитектуру ИИ-агента с помощью механизмов защиты, проверки данных и управления доступом. Урок пройдет в преддверие старта курса «ИИ-архитектор». Он будет полезен архитекторам ПО, разработчикам, специалистам по инфраструктуре и безопасности, которые проектируют или внедряют ИИ-решения: https://otus.pw/newu/?erid=2W5zFGJGC8R Реклама. ООО "ОТУС ОНЛАЙН-ОБРАЗОВАНИЕ". ИНН 9705100963.

Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Orac
+1
Tencent обошла экспортный запрет США: 100 000 ИИ-чипов в аренду у Oracle По данным Financial Times, Tencent арендовала у Oracle около 100 000 передовых ИИ-чипов на 5 лет. Сумма сделки около 7 млрд долларов, то есть примерно 14 000 долларов за чип в год. Сами чипы в Китай не попадают. Они стоят в нескольких дата-центрах Oracle в Юго-Восточной Азии, а Tencent получает к ним доступ удалённо. Формально это законно. Экспортный контроль США регулирует, куда физически уезжают чипы, а аренда вычислительных мощностей из-за рубежа под ограничения не попадает. Получается, что ограничения на поставки чипов для китайских компаний во многом работают только на бумаге: железо остаётся за пределами Китая, а модели на нём обучает китайский бигтех. Так что регуляторам, скорее всего, придётся заняться и облачной арендой. https://www.ft.com/content/8799b33d-f07c-4a03-82f0-bf5d3d1d29e9

Полезный совет для MySQL 8: используй LATERAL, когда для каждой строки нужно получить «лучшие N связанных записей». Например, взять последние 3 заказа каждого пользователя:

SELECT
    u.id,
    u.name,
    o.id AS order_id,
    o.created_at
FROM users u
JOIN LATERAL (
    SELECT id, created_at
    FROM orders
    WHERE orders.user_id = u.id
    ORDER BY created_at DESC
    LIMIT 3
) o ON TRUE;
Без LATERAL такую задачу часто решают через оконные функции и сначала ранжируют всю таблицу orders. С LATERAL база может для каждого пользователя сразу сходить по индексу:

CREATE INDEX idx_orders_user_created
ON orders (user_id, created_at DESC);
Особенно полезно для задач вида: «последние N», «самая дорогая запись», «ближайшее событие», «лучший результат для каждой строки». Главное: всегда проверяй EXPLAIN ANALYZE — на больших таблицах правильный составной индекс здесь решает всё.

🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитек
🗄 ИИ-агент работает с базой, но как не дать ему показать лишнее? 6 октября в Архитектурном клубе Яндекс 360 разберут архитектуру ИИ-агента над корпоративными данными. В том числе поговорят о поиске, метаданных и фильтрах, а главное — о том, как наследовать права доступа исходных систем. Также Даниил Смирнов, руководитель разработки ИИ-платформы Яндекс 360, расскажет, как изолировать данные пользователей и организаций и не допускать утечек через индекс или кэш.. 🗓 6 октября, 17:00 МСК 💻 Онлайн, бесплатно → Зарегистрироваться на эфир

🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLit
🖥 Vector-базы не умерли, но для многих задач отдельный сервер уже не нужен. sqlite-vec добавляет vector search прямо в SQLite через компактное расширение. Что это даёт: - без Pinecone - без Weaviate - без Qdrant - без отдельного vector DB сервера - всё хранится рядом с обычными данными в SQLite Расширение маленькое, open source и запускается везде, где работает SQLite. Для локальных AI-приложений, RAG, embedded-сценариев и небольших сервисов это особенно интересно: одна база, один файл, обычный SQL + поиск по эмбеддингам. https://github.com/asg017/sqlite-vec

Для чего используется команда ANALYZE в PostgreSQL?
Anonymous voting

🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недост
🔥Полноценный data stack внутри своего контура Когда данных становится много, одного SQL-движка или отдельной СУБД уже недостаточно. Нужна связка инструментов, которая закрывает весь путь данных: от загрузки и хранения до обработки, аналитики и визуализации. Такой сценарий можно реализовать в Stackland - платформе, которая разворачивается локально в контуре компании. В обновлении появились PaaS-компоненты Yandex Cloud, из которых можно собрать полноценную data-платформу: 🔹 Managed Service for ClickHouse® и Managed Service for PostgreSQL - хранение и обработка данных. 🔹 Yandex Managed Service for Trino + Yandex Object Storage - основа аналитического слоя: S3 обеспечивает масштабируемое хранение данных, а Managed Service for Trino — быстрый SQL-доступ к ним. 🔹 Managed Service for Apache Airflow® - управление оркестратором потоков операций по обработке данных. 🔹 Yandex DataLens - BI-система для визуализации данных. При этом все основные компоненты платформы разворачиваются внутри инфраструктуры компании. Для data engineering-команд такой подход интересен прежде всего тем, что можно собрать под одной платформой основные компоненты современного data stack: Storage → SQL → ETL/ELT → DWH/аналитика → BI И не тратить время на самостоятельную сборку и поддержку каждого компонента с нуля.

⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует
⚡️ Запустили PostgreSQL в Docker и случайно открыли его всей сети? Команда docker run -p 5432:5432 ... по умолчанию публикует порт на всех сетевых интерфейсах хоста. На Linux правило UFW, закрывающее порт, может не помочь: Docker направляет трафик к контейнеру до обработки правил UFW. Если доступ нужен только с самого сервера, укажите адрес явно:

docker run -p 127.0.0.1:5432:5432 ...
Для всех контейнеров можно изменить адрес привязки по умолчанию в настройках Docker. Но самый простой способ избежать сюрприза - всегда проверять, на каком адресе опубликован порт. Документация Docker - https://docs.docker.com/engine/network/port-publishing/

💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент я
💀 Claude Code за 103 секунды удалил более 48 тысяч файлов Пользователь Claude Code сообщил о серьёзном инциденте: AI-агент якобы удалил 48 218 файлов рабочего проекта и уничтожил часть Git-репозитория. Что произошло: - агенту поручили пересобрать mirror проекта; - он написал Python-скрипт для удаления старой копии; - в Windows-каталоге находились directory junctions, ведущие обратно в рабочее дерево; - проверка ссылок сработала не так, как ожидалось; - скрипт начал удалять уже реальные файлы проекта. В результате были очищены .git/objects, refs и logs, поэтому восстановление через обычный Git оказалось невозможно. Checkpoint Claude Code здесь не обязательно спасает, потому что изменения, сделанные через Bash/PowerShell, могут не попадать в механизм rewind. Источник: https://cybersecuritynews.com/claude-code-agent-file-deletion/

Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в
Тысячи ИИ-агентов одновременно читают продакшен-базу. Что происходит с PostgreSQL? Google представила PostgreSQL for agents в AlloyDB. Когда нагрузка растёт, система за секунды запускает изолированные экземпляры базы для агентов. Они получают доступ на чтение к актуальным данным, но не конкурируют за вычислительные ресурсы с основной базой. После работы экземпляры масштабируются до нуля. Агентам доступны SQL, индексы, векторный и полнотекстовый поиск. Идея в том, чтобы они могли исследовать свежие данные и выполнять множество запросов, не замедляя транзакции пользователей. Статус: Preview, доступ предоставляется по запросу. Анонс Google Cloud - https://cloud.google.com/blog/products/databases/announcing-postgresql-for-agents-in-alloydb

Softmax простыми словами: что значат 66,5% в ответе нейросети? Softmax простыми словами: ChatGPT выдаёт не ответы, а вероятности следующих токенов, и 66,5% означают только то, что такое продолжение текста самое вероятное. Модель может звучать уверенно и при этом ошибаться, потому что вероятность токена это не вероятность правды. Разбираем на деле Киры, как проверять ответы ИИ через источники и контекст.

🔥Один слой данных вместо цепочки копий между системами В традиционной аналитической инфраструктуре результаты обработки приходится переносить между хранилищем, SQL-системой и BI. Вместе с каждой копией появляется новая задача: ее нужно обновлять, сверять с исходными данными и учитывать в правилах доступа. В DataLens Platform разные инструменты работают с общей основой данных. Lakehouse построен на S3 и Apache Iceberg. Trino используется для интерактивных SQL-запросов, Spark — для ресурсоемкой обработки, Airflow — для управления процессами. Единый каталог метаданных показывает происхождение данных и их использование. Общая модель доступа действует на уровне всей платформы. Так компания сокращает количество переносов между системами, а результаты подготовки данных можно повторно использовать в SQL-запросах, отчетах и ИИ-сценариях. 📎 Подробнее о DataLens Platform — в материале СМИ.

⚡️ SQL-задача с опасным подвохом Какой баланс получит аккаунт после выполнения запроса в PostgreSQL?

CREATE TABLE accounts (
    id      int PRIMARY KEY,
    balance int
);

CREATE TABLE operations (
    account_id int,
    amount     int
);

INSERT INTO accounts VALUES (1, 100);
INSERT INTO operations VALUES
    (1, 10),
    (1, 20);

UPDATE accounts a
SET balance = a.balance + o.amount
FROM operations o
WHERE o.account_id = a.id;
Многие ответят 130, но PostgreSQL обновит строку только один раз. Результатом может стать 110 или 120. Если целевая строка соединяется с несколькими строками из FROM, PostgreSQL использует одну из них, но какую именно, не гарантируется. Правильный вариант:

UPDATE accounts a
SET balance = a.balance + x.total
FROM (
    SELECT account_id, SUM(amount) AS total
    FROM operations
    GROUP BY account_id
) x
WHERE x.account_id = a.id;
Теперь каждой строке accounts соответствует ровно одна строка источника, а баланс станет 130. #SQL #PostgreSQL #Database

Repost from Machinelearning
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязык
+1
🌟 Samsone: открытые аудиоязыковые модели для смартфонов Samsung опубликовали Samsone - семейство из трёх небольших аудиоязыковых моделей для работы на мобильных устройствах: Samsone-99M, Samsone-134M и Samsone-356M.
Проект будет участвовать в конференции Interspeech 2026, которая пройдет с 27 сентября по 1 октября в Сиднее.
Модели принимают один или несколько аудиофрагментов вместе с текстовым запросом и отвечают текстом: описывают звук, отвечают на вопросы о записи, сравнивают клипы между собой. Заявлено понимание речи, музыки и звуки окружения. Отвечают модели только по-английски и строчными буквами - ради экономии параметров оставили в обучающих текстах только строчные символы ASCII и вычистили из словаря редкие токены. Авторы предупреждают, что после дообучения на аудиовопросах модели теряют общие языковые навыки, так что это точечный инструмент, а не полноценный собеседник. 🟡Архитектура Аудиоэнкодер Whisper-Tiny на 9 млн параметров, нелинейный проектор в пространство текстовых эмбеддингов и языковая модель SmolLM2 от Hugging Face на 135 или 360 млн параметров. Каждый клип усредняется до 50 аудиотокенов, а разделитель SEP отделяет клипы друг от друга и от текста, поэтому аудио можно вставлять в любое место запроса. 🟡Тесты На MMAU (10 тысяч вопросов о звуках, музыке и речи) Samsone-134M набирает 61,33% против 53,34% у прежнего лидера среди малых моделей Mellow на 167 млн параметров.
Это выше Qwen2-Audio-Instruct на 8,4 млрд параметров (57,4%) и на уровне Audio Flamingo 2 на 3 млрд (61,06%).
На речевой части результаты хуже. В более сложном MMAU-Pro расзница с Mellow составляет 10 пп (37,57% против 27,5%), здесь впереди Qwen2-Audio (45,41%) и GPT-4o Audio (52,5%). На Galaxy S25 Ultra без аппаратных оптимизаций Samsone-99M генерирует 125 токенов в секунду, Samsone-134M - 87, Samsone-356M - 39. Обработка аудио перед генерацией занимает от 0,7 до 1,1 секунды. Веса для PyTorch, код обучения и экспорта, а также Android-приложение под Android 12 и новее выложены в репозитории проекта. 🟡Веса 🟡Arxiv 🖥GitHub @ai_machinelearning_big_data #AI #ML #SALM #Samsone #Samsung

Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже
Объектное хранилище в эпоху быстрых данных Объём данных, с которыми нужно работать, растёт ежедневно. Стандартных решений уже не хватает для задач ИИ и аналитики. Большие объёмы данных нужно не только хранить, но и быстро записывать и читать. В MWS Cloud Platform мы построили объектное хранилище не только на привычных HDD-дисках, но и на NVMe. На вебинаре покажем, какие сценарии работы это открывает и как меняет привычные подходы. Подключайтесь! Обсудим: ✅ Чем классы хранения MWS Object Storage отличаются от привычных ✅ В каких сценариях новый тёплый класс проявляет себя лучше всего ✅ Преимущества и слабые места в разных сценариях работы 📆 7 октября в 14:00 (мск) Зарегистрироваться