SQL и Анализ данных
前往频道在 Telegram
Базы данных и всё, что с ними связано! Сотрудничество: @haarrp РКН № 6766085482
显示更多📈 Telegram 频道 SQL и Анализ данных 的分析概览
频道 SQL и Анализ данных (@databases_tg) 俄语 语言赛道中的 是活跃参与者。目前社区聚集了 12 534 名订阅者,在 技术与应用 类别中位列第 9 771,并在 俄罗斯 地区排名第 51 716 位。
📊 受众指标与增长动态
自 невідомо 创建以来,项目保持高速增长,吸引了 12 534 名订阅者。
根据 02 九月, 2026 的最新数据,频道保持稳定运转。过去 30 天订阅人数变化为 -20,过去 24 小时变化为 -1,整体触达仍然可观。
- 认证状态: 未认证
- 互动率 (ER): 平均受众互动率为 13.25%。内容发布后 24 小时内通常能获得 6.21% 的反应,占订阅者总量。
- 帖子覆盖: 每篇帖子平均可获得 1 661 次浏览,首日通常累积 779 次浏览。
- 互动与反馈: 受众积极参与,单帖平均反应数为 8。
- 主题关注点: 内容集中在 sql, индекс, user_id, строка, субд 等核心主题上。
📝 描述与内容策略
作者将该频道定位为表达主观观点的平台:
“Базы данных и всё, что с ними связано!
Сотрудничество: @haarrp
РКН № 6766085482”
凭借高频更新(最新数据采集于 03 九月, 2026),频道始终保持新鲜度与高覆盖。分析显示受众积极互动,使其成为 技术与应用 类别中的关键影响点。
12 534
订阅者
-124 小时
+117 天
-2030 天
帖子存档
12 534
Repost from Machinelearning
📌Cursor переписал SQLite на Rust по документации
Anysphere опубликовала отчёт об эксперименте, в котором группе агентов поручили реализовать на языке Rust всё содержимое 835-страничного руководства SQLite.
Исходный код СУБД, её готовые сборки, тестовые наборы и доступ в интернет агентам, по словам Cursor, были закрыты.🟡Конфигураций было четыре В двух одна и та же модель и планировала, и выполняла работу - это были GPT-5.5 и Grok 4.5. В остальных планированием занимались Opus 4.8 или Fable 5, а исполнение отдавали собственной Composer 2.5.
Все конфигурации в итоге прошли тестовый набор целиком.Качество измеряли по набору sqllogictest из проекта SQLite, который сверяет ответы разных движков на одинаковые запросы. Агентам о существовании этого набора не сообщали. Cursor после каждого прогона вручную проверяли код на подгонку под тесты и на то, равномерно ли построена система. Код соло-запуска Opus 4.8 выложен на GitHub. 🟡Разброс по деньгам Дешевле всего вышла связка Opus 4.8 с Composer 2.5 - $1339, дороже всего работа на одной GPT-5.5 - $10 565. Две оставшиеся конфигурации стоили $1,9 тыс. (Grok 4.5) и $2,2 тыс. (гибрид с Fable 5). Дополнительно Cursor прогнала Opus 4.8 и Fable 5 поодиночке - за $5153 и $20 057, но эти запуски оценивались неформально и в сравнение по качеству не включались.
Из эксперимента Cursor делает вывод, что топовая модель нужна на отдельных этапах - при первичной декомпозиции задачи и принятии проектных решений, а дальше инструкции может выполнять модель подешевле.🟡Фан-факт В качестве одной из конфигураций рассчитывали использовать GPT-5.6 Sol, но модель оказалась чувствительной к буквальным формулировкам и уходила в неконтролируемые циклы. От нее отказались - не было времени на переписывание промптов. @ai_machinelearning_big_data #AI #ML #Agents #Cursor #Research
12 534
GeoSQL превращает Claude, Codex и Copilot в агента для геоаналитики
Инструмент подключается к PostGIS, BigQuery, Snowflake и Wherobots. Агент сам изучает схему данных, пишет spatial SQL, проверяет стоимость запроса и валидирует геометрию.
Результат можно вывести на карту через Dekart. Модель анализирует визуализацию и исправляет ошибки с полигонами, пересечениями и системами координат. По бенчмарку авторов, map-in-the-loop повышает качество выполнения геопространственных задач в четыре раза.
Работает локально или на своём сервере. Лицензия MIT.
https://github.com/dekart-xyz/geosql
12 534
Какой тип данных в PostgreSQL лучше всего подходит для хранения денежных сумм с фиксированной точностью без ошибок округления?
12 534
🔥 Хочешь быстрее расти в IT? Хватит учиться в одиночку
В IT прокачивается тот, кто каждый день видит сильные идеи, новые инструменты, реальные задачи, вакансии и разборы.
Окружение решает больше, чем кажется.
Собрал папки и каналы, где можно быстрее влиться в нужное направление, следить за трендами и не вариться в своём пузыре.
AI: t.me/ai_machinelearning_big_data
Python: t.me/pythonl
Linux: t.me/linuxacademiya
Хакинг: t.me/linuxkalii
DevOps: t.me/DevOPSitsec
Docker: t.me/DevopsDocker
Golang: t.me/Golang_google
Rust: t.me/rust_code
C++: t.me/cpluspluc
C#: t.me/csharp_1001_notes
Java: t.me/java_library
JavaScript: t.me/javascriptv
React: t.me/react_tg
Frontend: t.me/front
PHP: t.me/phpshka
Android: t.me/android_its
Мобильная разработка: t.me/mobdevelop
Базы данных: t.me/sqlhub
Data Science: t.me/data_analysis_ml
Big Data: t.me/bigdatai
Математика: t.me/data_math
Физика: t.me/fizmat
Kubernetes: t.me/kubernetc
GameDev: https://t.me/gamedev
Haskell: t.me/haskell_tg
Собеседования и карьера:
DS собеседования: t.me/machinelearning_interview
Python собеседования: t.me/python_job_interview
Папка с вакансиями: t.me/addlist/_zyy_jQ_QUsyM2Vi
Папка Go разработчика: t.me/addlist/MUtJEeJSxeY2YTFi
Папка Python разработчика: t.me/addlist/eEPya-HF6mkxMGIy
Папка ML: https://t.me/addlist/2Ls-snqEeytkMDgy
Папка Frontend: https://t.me/addlist/mzMMG3RPZhY2M2Iy
Полезное сверху:
ИТ-мемы: t.me/memes_prog
Английский для программистов: t.me/english_forprogrammers
ИИ и технологии: t.me/vistehno
954 ГБ open-source курсов: @courses
ИТ-книги бесплатно: https://t.me/addlist/BkskQciUW_FhNjEy
Max Ai: https://max.ru/ai_machinelearning_big_data
Max python: https://max.ru/pythonl
ТЕХНО: https://max.ru/vistehno
Max Go: https://max.ru/Golang_google
Max Linux: https://max.ru/linuxkalii
Devops: https://max.ru/DevOPSitsec
C#: https://max.ru/csharp_ci
C++: https://max.ru/cpluspluc
SQL: https://max.ru/sqlhub
Java: https://max.ru/javatg
Подписывайся на нужные направления и собирай себе ленту, которая реально двигает вперёд.
Пока кто-то листает шум, ты будешь видеть инструменты, задачи и идеи, которые помогают расти в профессии.
12 534
Repost from Machinelearning
✔️ Anthropic переработала команду code-review в Claude Code
Команда получила уровни Low, Medium, High, X-high и Ultra.
И это не один и тот же промпт с разным временем на ризонинг - на каждом уровне процесс построен по-своему.Уровень подхватывается из настроек сессии автоматически, но его можно задать руками командой
/code-review high.
🟢Low делает один быстрый проход по диффу.
🟢Medium читает изменённый код в контексте проекта, прогоняет несколько поисковых проходов под разными углами и перепроверяет находки перед выдачей.
🟢High выносит поиск и верификацию в субагентов с чистым контекстом, чтобы проверяющие не были заякорены на рассуждениях агента, который этот код только что писал.
🟢X-high дополнительно ищет, как изменения влияют на код за пределами самого диффа.
🟠Ultra - верхняя ступень, где ревью выполняется в облачной песочнице, куда Claude Code выгружает состояние репозитория или клонирует PR с GitHub. Там запускается целый парк агентов, и каждая находка независимо воспроизводится и верифицируется.
Ultra находится в статусе research preview и оплачивается отдельно от подписки - Pro и Max подписчикам дают 3 бесплатных запуска, дальше каждый прогон списывается из кредитов на дополнительное использование стоит примерно от 5 до 20 долларов в зависимости от размера изменений.
Качество новой системы подкрепляют замерами Opus 4.8 на открытом датасете с ручной разметкой ошибок. Уровень Low нашёл 17% размеченных багов, Medium - 22%, High - 24%, X-high - 25%.
У "конкурента" (компания его не называет) - те же уровни дали от 8 до 12%.
Anthropic утверждает, что использует Ultra-режим на каждом пулл-реквесте в собственной разработке.@ai_machinelearning_big_data #news #ai #ml
12 534
Unsloth выкатили Gemma 4 NVFP4 quants.
Заявка простая: быстрее 4-bit inference на Blackwell GPU без обычного компромисса “сжали, но стало заметно тупее”.
Главные цифры:
* Gemma-4-12B NVFP4 запускается на 11 GB VRAM
* Gemma-4-26B-A4B доходит до 13K tok/s на B200
* NVFP4 даёт до 1.5× ускорения на GPU
NVFP4 - это не просто “ещё один 4-bit формат”. Он заточен под Blackwell и позволяет делать inference быстрее, сохраняя точность лучше, чем грубая квантизация.
Для локального и self-hosted inference это важный сдвиг: больше моделей помещается в память, throughput растёт, стоимость токена падает.
Особенно полезно для тех, кто гоняет много коротких запросов, агентные пайплайны или batch-инференс, где скорость и VRAM решают всё.
Blog: https://unsloth.ai/docs/basics/nvfp4
Gemma NVFP4: https://huggingface.co/collections/unsloth/nvfp4
12 534
SQL-задача с подвохом посложнее
Нужно найти пользователей, у которых последний заказ был оплачен.
Есть таблица:
orders
id | user_id | status | created_at
1 | 10 | paid | 2026-01-01
2 | 10 | cancelled | 2026-01-05
3 | 20 | paid | 2026-01-03
4 | 30 | failed | 2026-01-02
Кто-то пишет так:
WITH ranked AS (
SELECT *,
ROW_NUMBER() OVER (
PARTITION BY user_id
ORDER BY created_at DESC
) AS rn
FROM orders
WHERE status = 'paid'
)
SELECT *
FROM ranked
WHERE rn = 1;
На вид логично. Но запрос неверный.
Подвох: фильтр WHERE status = 'paid' срабатывает до ROW_NUMBER().
То есть SQL сначала выбрасывает все неоплаченные заказы, а потом ищет последний среди оставшихся оплаченных.
Пользователь 10 попадёт в результат, хотя его реальный последний заказ — cancelled.
Правильно так:
WITH ranked AS (
SELECT *,
ROW_NUMBER() OVER (
PARTITION BY user_id
ORDER BY created_at DESC, id DESC
) AS rn
FROM orders
)
SELECT *
FROM ranked
WHERE rn = 1
AND status = 'paid';
Сначала находим последний заказ вообще, и только потом проверяем его статус.
Вот почему порядок фильтрации в SQL может полностью менять смысл запроса.12 534
Algebra, Topology, Differential Calculus, and Optimization Theory For Computer Science and Machine Learning
Недавно был обновлен огромный PDF-учебник по математике на 2204 страницы:
Внутри - алгебра, топология, дифференциальное исчисление и теория оптимизации для Computer Science и Machine Learning.
Найти можно здесь:
https://cis.upenn.edu/~jean/gbooks/geomath.html
12 534
Repost from Machinelearning
🌟 TabFM: модель для работы с табличными данными от Google
Google Research опубликовала модель машинного обучения для классификации и регрессии на табличных данных. TabFM делает прогнозы на ранее не встречавшихся таблицах без отдельной тренировки под каждый набор данных.
Табличные данные лежат в основе множества прикладных задач - от прогноза оттока клиентов до выявления финансового мошенничества. Десятилетиями здесь доминировали алгоритмы на основе деревьев решений, которые требуют долгого подбора параметров и выстраивания признаков под каждую новую задачу.TabFM использует подход, заимствованный у LLM - обучение в контексте. Модель получает всю таблицу целиком как единый запрос и определяет связи между столбцами и строками прямо в момент прогноза, не меняя своих внутренних параметров. Эту архитектуру Гугл описывает как гибрид двух ранее опубликованных решений TabPFN и TabICL. TabFM обучалась на сотнях миллионов сгенерированных таблиц, построенных с помощью структурных причинных моделей. Разработку проверили на бенчмарке TabArena, который ранжирует системы по итогам прямых сравнений между собой. Тестирование включало 38 наборов для классификации и 13 для регрессии, размером от 700 до 150 000 строк. По результатам TabFM обошла тщательно настроенные отраслевые решения TabPFN-3, AutoGluon и RealMLP. В ближайшие недели TabFM будет встроена в сервис Google BigQuery, там классификацию и регрессию можно будет запускать одной SQL-командой, без специальных знаний в области ML. 📌Лицензирование: Tabfm Non-commercial 🟡Блогпост 🟡Модель 🖥GitHub @ai_machinelearning_big_data #AI #ML #TabFM #Google
12 534
`O_DIRECT`: когда база данных обходит page cache
В Linux флаг
O_DIRECT позволяет читать и писать файл почти напрямую, минуя page cache ядра.
Зачем это нужно базам данных?
У PostgreSQL, MySQL, RocksDB и других систем часто уже есть свой buffer pool.
Если ещё и ядро будет кэшировать те же страницы, получится двойное кэширование и лишняя трата памяти.
Но у O_DIRECT есть неприятное условие: всё должно быть выровнено по блоку.
• buffer
• file offset
• размер чтения / записи
Например, под 4 KB блоки нельзя просто так прочитать 123 байта в любой `malloc`-буфер.
Промахнулся с alignment — read() вернёт EINVAL.
Именно поэтому низкоуровневый I/O в базах выглядит таким странным: там важны не только данные, но и то, как они лежат в памяти.12 534
Как называется специальная схема в PostgreSQL, где хранятся временные таблицы, созданные в рамках текущей сессии?
12 534
Мы годами строили предсказуемые монолиты и микросервисы, но AI превратил PDLC в Дикий Запад, где старые паттерны проектирования больше не работают. Хватит делать вид, что ты контролируешь ситуацию, просто прикрываясь новой версией TOGAF.
Приходи 1 июля на Arch.Meetup, где мы поговорим про архитектурный подход AI disrupt PDLC, и вместе со спикерами из Сбера, Вебпрактик и Газпром нефти будем учиться управлять этим хаосом, пока нейросети не начали проектировать системы вместо нас.
🔗Выбирай удобный формат и регистрируйся по ссылке
📍Встречаемся очно на Кутузовском 32, а ссылку для онлайн пришлем накануне.
12 534
Repost from Data Science. SQL hub
SQL-инъекция за 40 секунд: Лайт против L
Разбираем SQL-инъекцию на пальцах в формате Лайт против L. Что это такое, как обычная строка ввода меняет логику запроса, к чему это приводит и какими способами реально закрыть дыру. Коротко, по делу и так, чтобы запомнилось.
Больше таких видео: https://www.youtube.com/shorts/c4gBi094jkU
@sqlhub
12 534
Какая системная переменная в функции PL/pgSQL позволяет узнать, была ли команда (например, UPDATE) выполнена успешно и затронула ли она строки?
12 534
🚀XSQUARE 6.6 — большой релиз уже скоро!
🎨 Новая дизайн-система
— три уровня кастомизации, настройки layout и расширенные CSS-переменные и анонс «Менеджера визуальных тем». Обновленный подход к созданию сайтов и личных кабинетов на XSQUARE.
⚙️ Что ещё в релизе
— Обновлённая компонентно-ориентированная архитектура jsAPI
— Kanban-доски в библиотеке UI-компонентов
— Работа с 4 типами СУБД на уровне ядра + дорожная карта до конца 2026
— Объявляем о поддерxжке MS SQL Server/РЕД БД на уровне ядра!
📦 XDAC 6.0
— Database Reverse Proxy Server
— Поддержка DML и выгрузка больших объёмов данных
— Уже 5 типов БД на уровне ядра
☁️ Развёртывание
— VK Cloud, Yandex Cloud, Selectel, TimeWeb, Docker, архитектуры x86/ARM/e2k/LoongArch.
🔥 И главное — идём в массы! Анонсируем тарифы для малого и среднего бизнеса, условия для физлиц и бесплатные тарифы.
25 июня в 11:00 МСК
🎯 Зарегистрироваться на вебинар
Реклама. ООО "ХИ-КВАДРАТ". ИНН 7718990614. erid: 2W5zFHBrDcV
12 534
Repost from Machinelearning
🌟 MolmoMotion: модель прогнозирования движения объектов в трёхмерном пространстве
Институт Аллена (Ai2) выпустил MolmoMotion - модель, которая предсказывает, как отмеченный в кадре объект будет двигаться в ближайшие секунды.
На вход подаётся кадр или короткая видеоистория, на видимом в сцене предмете отмечаются опорные точки, и добавляется текстовая инструкция (например, "подвинь и поверни деревянную миску с фруктами").
На выходе модель строит траекторию этих точек в трёхмерном пространстве, в метрах относительно камеры.
Под капотом - модель Molmo 2 на 4 млрд параметров. Институт обучил 2 версии:
🟢Авторегрессионный вариант, который достраивает траекторию по шагам;
🟠Версию на основе flow-matching для случаев, когда у действия есть несколько вероятных продолжений.
🟡В открытый релиз вошли только 2 AR-чекпойнта
🟢H3-F30 для типичного видео: 3 кадра истории и прогноз примерно на 2 секунды при 15 FPS;
🟢H1-F32 - когда доступен лишь один кадр.
🟡Помимо моделей опубликованы датасет и бенчмарк
MolmoMotion-1M - набор из 1,16 млн видео, который охватывает 736 типов движения и около 5,6 тыс. объектов.
PointMotionBench состоит из 2,7 тыс. размеченных людьми видеоклипов из сетов DAVIS, HOT3D и WorldTrack.
По замерам Ai2, на этом бенче MolmoMotion точнее всех методов, с которыми его сравнивали, включая генераторы видео и более простые базовые модели.
В симуляции система управления на базе MolmoMotion успешно выполняла 76,3% операций "взять и переставить" против 56,0% у аналога на Molmo 2, а при генерации видео модель улучшила движение по всем пяти измеряемым показателям.Среди ограничений авторы называют использование лишь 8 точек на объект при обучении. Этого достаточно для общей траектории, но мало для точного описания сложных деформаций. 📌Лицензирование: Apache 2.0 License 🟡Блогпост 🟡Релиз на HuggingFace 🟡Техотчёт 🖥Github @ai_machinelearning_big_data #AI #ML # #MolmoMotion #Ai2
12 534
⚡️AI-системы давно вышли за пределы экспериментов и прототипов.
Но между обученной моделью и решением, которое стабильно работает в продакшене, остается много инженерных задач.
На конференции SmartData 2026 разберут, как строить надежные data-платформы, проектировать ML-инфраструктуру и работать с современными AI-сценариями.
🗓23–24 сентября, Москва + online
Первые доклады уже появились в программе:
— LLM и современные подходы к AI;
— проектирование data-платформ и хранилищ;
— потоковая обработка данных;
— ML-пайплайны и запуск моделей в продакшене.
SmartData — конференция про инженерию данных для backend-разработчиков, аналитиков и ML-инженеров.
🖥В программе — практический опыт, архитектурные решения и разбор технологий изнутри.
Программа будет пополняться, а следить за новыми темами можно на сайте и через email-рассылку конференции.
До встречи на SmartData 2026!
12 534
⚡️AI-системы давно вышли за пределы экспериментов и прототипов.
Но между обученной моделью и решением, которое стабильно работает в продакшене, остается много инженерных задач.
На конференции SmartData 2026 разберут, как строить надежные data-платформы, проектировать ML-инфраструктуру и работать с современными AI-сценариями.
🗓23–24 сентября, Москва + online
Первые доклады уже появились в программе:
— LLM и современные подходы к AI;
— проектирование data-платформ и хранилищ;
— потоковая обработка данных;
— ML-пайплайны и запуск моделей в продакшене.
SmartData — конференция про инженерию данных для backend-разработчиков, аналитиков и ML-инженеров.
🖥В программе — практический опыт, архитектурные решения и разбор технологий изнутри.
Программа будет пополняться, а следить за новыми темами можно на сайте и через email-рассылку конференции.
До встречи на SmartData 2026!
12 534
Тест прошёл. А PostgreSQL вообще в курсе?
Интеграционные тесты часто выглядят надёжно ровно до того момента, пока приложение не встречается с настоящей базой.
На локалке всё зелёное. В CI всё зелёное. Моки довольны. In-memory база тоже не против. А потом в проде внезапно выясняется, что реальный PostgreSQL иначе обрабатывает запрос, constraint не даёт сохранить данные, транзакция ведёт себя не так, как ожидалось, а Redis показывает проблему, которую тесты вообще не могли поймать.
Именно поэтому Testcontainers в .NET так хорошо заходят для интеграционных тестов. Вместо имитации базы вы поднимаете настоящий PostgreSQL, Redis или другой сервис в Docker-контейнере, прогоняете приложение против реальной зависимости и удаляете контейнер после тестов.
Это даёт намного больше уверенности, чем тесты против подмены. При этом не нужен общий тестовый сервер, который кто-то сломал, не почистил или настроил иначе.
В хорошей схеме контейнеры запускаются через fixture, приложение получает connection string динамически, версии образов фиксируются, а настройка прячется за небольшими helper-классами. Сам тест при этом остаётся читаемым: он проверяет бизнес-сценарий, а не превращается в простыню из настройки базы и очистки состояния.
Есть важный нюанс. Общие fixtures ускоряют тесты, но требуют дисциплины со shared state. Когда изоляция важнее скорости, лучше использовать отдельные fixtures и не ловить фантомные падения из-за данных, оставшихся от соседнего теста.
Мне нравится этот подход именно за баланс. Вы тестируете не идеальную игрушечную модель приложения, а поведение, максимально близкое к реальному окружению. Но без боли ручной инфраструктуры.
Поэтому в следующий раз, когда интеграционный тест прошёл против in-memory базы, стоит задать неприятный вопрос: а настоящая база с ним согласится?
