Данные на стероидах
Open in Telegram
Команда Дата сервисов VK Tech о практиках и подходах для извлечения максимальной пользы из работы с данными. Мы в MAX: https://max.ru/stereodata
Show more3 245
Subscribers
+324 hours
-77 days
+2630 days
Posts Archive
3 246
Для небольшой базы, миграции или восстановления отдельной таблицы pg_dump подходит хорошо. Он создает логический дамп и позволяет переносить данные между мажорными версиями PostgreSQL.
Но у этой простоты есть цена: каждый дамп — полная копия, а восстановиться можно только на момент его создания. Если между ночным бэкапом и аварией прошло несколько часов, этих изменений в копии уже нет. Для продакшена с более жестким RPO используют WAL-G. Он делает физический бэкап кластера и непрерывно сохраняет WAL-сегменты. Благодаря этому PostgreSQL можно восстановить до конкретного момента времени через PITR.Дальше возникает вопрос хранения. Бэкапы и WAL можно отправлять в VK Object Storage: так они не занимают локальный диск базы, а ротацию можно автоматизировать через Lifecycle Policies. Например, удалять старые WAL и переводить неактуальные базовые копии из Hotbox в Icebox. Получается два разных сценария: 1️⃣pg_dump — небольшие базы, миграции, отдельные таблицы и схемы 2️⃣WAL-G + S3 — production, непрерывная архивация WAL и восстановление на нужную точку времени. И в обоих случаях остается главное: бэкап нужно не только создать, но и регулярно проверять восстановлением. Иначе время реального restore может сильно отличаться от расчетного. 🚩 Обе схемы, настройку WAL-G с VK Object Storage, PITR, lifecycle, Object Lock можно найти здесь 📎 Мы в МАХ
3 246
⚕️ Снимки, анализы, исследования, согласия: где и как хранить медицинские данные
Внутри медицинской системы данные используются по-разному. Записи о приемах, назначениях и результатах анализов нужны постоянно — их логично оставлять в рабочей базе данных. Снимки КТ и МРТ, электронные документы, согласия и резервные копии со временем запрашиваются все реже и подходят для объектного хранения.
Для таких данных можно выстроить несколько уровней:
🔹 свежие документы и исследования — хранить с быстрым доступом
🔹 редко используемые — переводить в более дешевый холодный класс
🔹 многолетний архив — отправлять в глубокое хранение.
В VK Object Storage этому соответствуют Hotbox, Icebox и Glacier, а Lifecycle Policies позволяют автоматически переводить объекты между классами.
При этом срок перехода лучше задавать по реальной статистике обращений: если снимки шестимесячной давности врачи регулярно открывают при повторных визитах, слишком ранний перенос в холодный класс может увеличить расходы на извлечение.
В итоге архитектура строится вокруг жизненного цикла данных: что должно быть доступно быстро, что можно отправить в архив, сколько это хранить и когда удалить.
🔜 Подробнее о том, как устроено хранение медицинских данных на S3, читайте по ссылке.
📬 Мы в МАХ
3 246
Три модели хранения — и у каждой сильная сторона
Block, File и Object по-разному организуют хранение и доступ к данным. Поэтому при выборе важен не только объем: нужно учитывать задержку, способ доступа, характер изменений и требования к масштабированию.
🔹 Block дает системе том, разбитый на блоки. СУБД или ОС может перезаписывать отдельные участки данных на месте — без замены всего файла. Отсюда самая низкая задержка и типичные задачи: транзакционные БД и диски виртуальных машин.
🔹 File добавляет файловую систему: реальные каталоги, вложенность, права и доступ по NFS или SMB. Это нужно, если несколько приложений работают с общими файлами или ПО изначально рассчитано на привычное дерево директорий. Но с ростом числа файлов сама иерархия становится ограничением для масштабирования.
🔹 Object отказывается от этой иерархии. Данные хранятся отдельными объектами с идентификаторами и метаданными, а доступ идет по S3 API. Отдельный фрагмент объекта не перезапишешь так же, как блок на диске. Зато объем не привязан к размеру одного тома, а к данным могут параллельно обращаться множество сервисов.
Поэтому объектная модель хорошо подходит для бэкапов, логов, медиа, статики и ML-датасетов — больших объемов данных, которые чаще записываются и читаются целиком, чем постоянно меняются по частям.
В Object Storage VK Tech сегодня хранится более 400 ПБ данных и 95 млрд объектов в шести ЦОД. Сервис совместим с S3 REST API, а для больших объемов доступны классы хранения, Lifecycle Policies, Versioning и Object Lock.
➡️ В статье сравнили три модели по восьми критериям и разобрали выбор для БД, ВМ, бэкапов, логов, медиа и Big Data.
📬 Мы в МАХ
3 246
🔀 Как перенести S3-хранилище, не останавливая работу бизнеса
При миграции многотерабайтного или петабайтного хранилища скопировать данные — только половина задачи. Сложнее переключить продакшен так, чтобы приложения продолжали читать и записывать данные.
3 сентября на вебинаре VK Tech разберем миграцию из MinIO в другое S3-совместимое хранилище на примере VK Object Storage.
🛠 На демо покажем:
🔹 как перенести объекты, версии, ACL, bucket policy, lifecycle, теги и ссылки
🔹 как приложения могут работать с двумя хранилищами во время миграции
🔹 как проходит переключение endpoint с минимальным окном
🔹 что происходит при разрыве синхронизации и как продолжить перенос с точки остановки.
Также разберем, от чего зависит стоимость миграции и какие данные нельзя перенести автоматически. Например, незавершенные multipart-загрузки.
📆 3 сентября, 16:00
💻 Онлайн
:➡️ Регистрируйтесь по ссылке.
📬 Мы в МАХ
3 246
Хватит переплачивать за хранение данных в S3
Свежий бэкап может понадобиться в любой момент, а копия годичной давности — только при редком восстановлении. Хранить их на одинаковых условиях невыгодно.
В S3 для этого используют разные классы хранения:
🔹 Горячий — для данных, к которым часто обращаются: актуальные бэкапы, логи, контент приложений.
🔹 Холодный — для объектов, которые нужны редко, но должны оставаться доступными: старые копии, логи и завершенные проекты.
🔹 Архивный — для длительного хранения данных, которые почти не читают. Он дешевле, но получение объекта может занимать больше времени.
При этом вручную переносить каждый файл не нужно. Lifecycle Policies позволяют задать правила жизненного цикла объектов.
Если все 10 ТБ держать в горячем классе, компания платит за быстрый доступ ко всему объему. Холодное хранение зачастую вдвое дешевле, перенос 8 ТБ в другой класс снижает стоимость примерно на 40%, то есть почти в полтора раза.
Lifecycle Policies также помогают очищать старые версии объектов при включенном версионировании и незавершенные multipart-загрузки, которые тоже занимают место.
🧮В итоге экономия на S3 зависит не только от цены за гигабайт данных. Важно учитывать, как часто данные читают, насколько быстро их нужно получить и как долго их вообще требуется хранить.
📬 Мы в МАХ
3 246
🫠 Когда база данных начинает хуже справляться с нагрузкой, сначала нужно определить причину снижения производительности, а затем выбирать способ масштабирования.
1️⃣ Сначала измеряйте, потом масштабируйте
База обычно деградирует постепенно: растут задержки, время выполнения запросов и очередь. Поэтому важно следить за загрузкой CPU и памяти, дисковой подсистемой, активными соединениями и replication lag.
О проблеме может говорить устойчивый рост нагрузки или приближение числа активных соединений к установленному лимиту.
2️⃣ Масштабируйте от простого к сложному
Начните с запросов и индексов: корректно подобранный индекс может существенно сократить время выполнения запроса. Дальше — пул соединений и кеширование. Если этого недостаточно, можно увеличить ресурсы сервера и вынести чтение на реплики.
🦾 Шардинг стоит подключать, когда более простые способы исчерпаны: он требует изменения архитектуры и усложняет выполнения JOIN и транзакции между разными шардами.
Управляемая база данных может взять на себя развертывание, резервное копирование, мониторинг, репликацию и автоматическое переключение при сбоях. Оптимизация запросов, схема данных и логика приложения остаются на стороне команды.
Подробнее о масштабировании баз данных 👉 в блоге VK Cloud.
📬 Мы в МАХ
3 246
🤖ИИ-агенты в VK AI Space научились следовать корпоративным регламентам
Добавили в платформу VK AI Space хуки — механизм обязательных проверок, который гарантирует соблюдение корпоративных правил на уровне кода, а не промптов. Например, можно настроить правило, по которому агент никогда не передаст персональные данные внешнему пользователю или не предложит скидку выше допустимого лимита.
❓ Как работают хуки
В жизненном цикле агента есть контрольные точки — до или после действия модели. В этот момент автономный режим прерывается, и платформа передает полный контекст в механизм хуков: кто спрашивает, что агент собирается сделать, с какими данными работает. Механизм принимает решение: пропустить, изменить или отменить действие.
Хуки помогают подстраховаться на случай, если агент решит действовать не по плану. На инструкцию в промпте модель может отреагировать по-разному, а хук срабатывает независимо от ее решения. Это устраняет риски непредсказуемого поведения, которые часто выступают главным препятствием для масштабирования автономных агентов в бизнесе.
🔜 Реальный кейс: в 2026 году немецкая клиника проиграла суд из-за чат-бота, который выдумал несуществующую услугу. Суд постановил: «Чат-бот на вашем сайте — часть вашей организации, вы отвечаете за все, что он говорит». Хук на сверку с актуальным прайсом перед отправкой ответа спас бы от иска.
Подробнее про реализацию хуков в VK AI Space читайте 👉 по ссылке.
Мы в МАХ
3 246
👌 Подключить дополнительные инструменты к VK Data Platform стало проще.
Теперь вы можете добавить к уже настроенному контуру собственные СУБД, вычислительные движки, сервисы обработки данных и ML/LLMOps-инструменты. Пересобирать для этого базовую архитектуру не нужно.
🪄После подключения новый сервис сразу работает по общим правилам платформы: для него действуют единые настройки доступов, мониторинга, логирования, аудита, отказоустойчивости и масштабирования. Интеграция занимает несколько часов.
😎 Кому это пригодится?
В первую очередь, системным интеграторам и крупным компаниям со сложным или специфичным data-стеком. Обновление позволяет подключать нужные инструменты без создания для каждого из них отдельного контура управления и дополнительной нагрузки на ИТ- и data-команды.
Подробности 👉 по ссылке.
🔗 Мы в МАХ
3 246
⏰ Совсем скоро начинаем Data Meetup VK Tech #1
Сегодня вместе с экспертами VK Tech, Авито и RWB поговорим о платформах данных, S3, AI-агентах, self-service, data backend и доступе к данным.
А еще обсудим, какие инженерные задачи уже можно отдавать ИИ и что потребуется от платформы, когда ее пользователем станет ИИ-агент.
💬 Вопросы спикерам оставляйте в комментариях под этим постом. Будем собирать их по ходу встречи и передавать экспертам.
Если ваш вопрос не озвучили, эксперты ответят на него в чате.
🕐 Начало в 18:00
➡️ Подключайтесь к трансляции 👉 по ссылке
3 246
💰Не шутка. Два миллиона рублей за ИИ, который соберет красивую презентацию по теме без вашего участия.
Это задание предложили выполнить эксперты VK AI Space на хакатоне «Лидеры цифровой трансформации 2026».
🎨 Участникам нужно разработать сервис «Цифровой дизайнер презентаций». Решение должно по текстовому описанию собирать качественную презентацию в заданном шаблоне. Модель нужно будет научить улавливать логику, которую дизайнер закладывает в шаблон, и воспроизводить ее корректно.
«Мы намеренно выбрали задачу, у которой нет очевидного решения. Именно на таких задачах видно инженерную зрелость команды. Это умение довести идею до сервиса, который работает за пределами демонстрации», — говорит Роман Стятюгин, директор по ИИ-продуктам VK Tech.➡️ Подать заявку на участие в хакатоне можно до 17 сентября. Подробности и регистрация 👉 по ссылке. 📬 Мы в МАХ
3 246
🧠 Память агентов на VK AI Space превращает знания сотрудников в масштабируемый актив компании.
Корпоративный ИИ делает профессиональный опыт многократно используемым: при запуске продукта или внедрении системы агент фиксирует не только итоговый результат, но и контекст, принятые решения и аргументацию. Эти данные сохраняются как применимый кейс для будущих задач.
О том, как она работает и в каких сценариях будет полезна, директор по ИИ-продуктам VK Tech Роман Стятюгин рассказал РБК.
Читайте 👉 по ссылке.
📬 Мы в МАХ
3 246
Repost from VK Tech
Ассоциация больших данных объединяет ведущих участников российского рынка и занимается отраслевыми инициативами в сфере данных и ИИ — от исследований и стандартов до диалога бизнеса, государства и научного сообщества.
Роман Стятюгин, директор по ИИ-продуктам VK Tech и член Стратегического комитета АБД:
«Важную роль играет обмен практикой между компаниями: он помогает быстрее вырабатывать общие стандарты и подходы для реальной бизнес-среды. Экспертный совет как раз дает такую площадку — он делает накопленную экспертизу участников рынка доступной для всей отрасли».Подробнее про Ассоциацию больших данных и Экспертный совет читайте 👉 по ссылке. 🔗 Мы в MAX
3 246
🤔 Как совместимость VK Object Storage и SIEM поможет сэкономить на инфраструктуре?
VK Tech и «Лаборатория Касперского» подтвердили совместимость Kaspersky Unified Monitoring and Analysis Platform (KUMA) и VK Object Storage, протестировав ее на промышленной нагрузке.
Суть решения — не хранить весь объем логов внутри SIEM на дорогих быстрых SSD. Такая схема позволяет разделить данные по классам:
🔹 горячие логи для оперативной работы остаются на локальных SSD
🔹 холодные и архивные данные уходят по S3 в VK Object Storage на HDD.
При этом KUMA продолжает обрабатывать, коррелировать и агрегировать события в реальном времени, а емкость холодного слоя можно наращивать горизонтально без остановки сервисов и перестройки архитектуры SIEM.
Связку проверили на 3 ПБ данных, ежедневном приросте 10 ТБ и нагрузке более 6 000 RPS. В тестовой конфигурации было свыше 30 серверов и две независимые инсталляции в разных ЦОД.
🚀 По оценке VK Tech, такая схема снижает общие расходы на инфраструктуру примерно на 25% без падения скорости обработки событий.
Увеличьте глубину хранения логов, не масштабируя вместе с ней дорогой SSD-слой.
📬 Мы в МАХ
3 246
📣 Приглашаем на наш первый Data Meetup с кейсами крупных компаний!
18 августа эксперты VK Tech, Авито и RWB разберут архитектурные задачи, с которыми сталкиваются инженерные команды при развитии современных платформ данных.
В программе два технических доклада:
🔹 Павел Кутаков, эксперт-архитектор VK Tech, покажет, как устроена гиперконвергентная VK Data Platform на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.
🔹 Дмитрий Листвин, Big Data Engineer Авито, расскажет, что делать, когда узким местом Lakehouse становится объектное хранилище.
Также пройдет круглый стол с экспертами RWB и VK Tech. Разберем подготовку кастомных сегментов для таргетинга на Trino и DataFusion и обсудим, как меняется сама архитектура платформ данных — какую роль в ней играет Kubernetes и что меняют ИИ-агенты.
Завершится митап пиццей и приятным нетворкингом.
📆 18 августа, сбор гостей в 17:30
📍 Москва, БЦ «Скайлайт»
💻 Офлайн и онлайн
🔜 Посмотреть программу и зарегистрироваться
Мы в МАХ
3 246
От пилота к прибыли: как ИИ перестает быть экспериментом
ИИ в бизнесе часто выглядит эффектно на старте, но далеко не каждый пилот доходит до продакшена. В интервью «Эксперту» Роман Стятюгин, директор по ИИ-продуктам VK Tech, объяснил, на каких этапах компании теряют результат и что важно заложить еще до запуска.
1️⃣Сначала — цель, потом — пилот
Если не задать сроки, бюджет и метрики, пилот легко превращается в бесконечные доработки. Проект нужно сразу переводить из R&D в инженерную задачу с понятным бизнес-результатом.
2️⃣ Пилот и реальная эксплуатация — не одно и то же
Сильный результат в тесте не гарантирует успеха в реальной эксплуатации: там появляются сырые данные, сложные сценарии и нагрузка. Нужны зрелая инфраструктура, контроль качества данных и готовность к нестандартным кейсам.
3️⃣ Модель — это не вся система
Языковая модель сама по себе не автоматизирует предприятие. Решает вся обвязка: интеграции, инструменты, безопасность, наблюдаемость и доступы.
4️⃣ Безопасность — не финальный этап, а основа проекта
Чем выше автономность агента, тем важнее контроль его действий. Агенту нужно предоставлять доступ только к тем системам, интеграциям и функциям, которые необходимы для конкретной задачи.
5️⃣ Экономика проекта
Агент может работать эффективнее сотрудника, но обходиться дороже. Поэтому перед внедрением нужно сопоставить стоимость решения с тем, как оно влияет на скорость, качество и объем работы.
🔜 Полный текст интервью Романа читайте здесь.
📬 Мы в МАХ
3 246
📋 Как проверить данные, на которых основаны ответы и действия ИИ?
Чем сильнее результаты работы модели влияют на действия бизнеса, тем важнее понимать, откуда они взялись.
Несмотря на то, что больше половины руководителей используют ИИ для принятия решения, 61% отмечают растущую проблему с качеством и достоверностью данных о рабочих процессах и сотрудниках. Только 5% сообщают, что их компании предпринимают значимые меры для ее решения.
Если нельзя восстановить путь от источника данных до ответа ИИ, невозможно понять, отражает он реальную закономерность или ошибку, возникшую при сборе и обработке информации.
Что делать?
🔹 Отслеживать происхождение данных: фиксировать источник, время и способ сбора, охват, а также все фильтры и преобразования.
🔹 Сверять выводы: сопоставлять их с независимыми источниками, а новые данные — с историческими показателями.
🔹 Закреплять ответственность: определять владельцев данных, критерии их пригодности для конкретных задач и порядок действий при обнаружении ошибок.
Бизнес может полагаться на результат работы ИИ только при сквозной проверяемости: когда можно установить, какие данные использовала система, что с ними сделала и как получила результат. Также важно проводить аудит действий агента с данными и контролировать доступы ИИ.
О том, как качество данных связано с их бизнес-смыслом, читайте в статье VK Tech на Хабре 🔹
📬 Мы в МАХ
3 246
🤔 Все хотят надежную базу данных. Но что именно делает систему устойчивой?
Наши эксперты объяснили, как измерить фактическую надежность своей системы, какие угрозы чаще всего приводят к потере данных и почему тестовое восстановление важнее самого факта наличия бэкапа.
🔏Защита базы данных строится в несколько слоев:
🔹 RPO и RTO определяют, сколько данных можно потерять и как долго сервис может быть недоступен. От них зависят частота бэкапов, тип репликации и сценарий восстановления.
🔹 Бэкапы и PITR позволяют восстановить PostgreSQL на нужный момент, например за секунду до ошибочного DROP TABLE.
🔹 Репликация и автоматический failover сокращают простой при отказе сервера. Синхронная репликация защищает подтвержденные транзакции, а размещение реплики в другой зоне — от аварии целого ЦОД.
🔹 Внешняя неизменяемая копия сохраняет данные, даже если основная инфраструктура скомпрометирована.
🔹 Тестовое восстановление показывает, пригоден ли бэкап и укладывается ли команда в заданный RTO. Без такой проверки наличие копии ничего не гарантирует.
👉 Подробный разбор каждого уровня, сравнение self-hosted PostgreSQL с DBaaS VK Cloud и чек-лист для проверки безопасности своих баз данных смотрите по ссылке.
📬 Мы в МАХ
3 246
🤖 ИИ-агенты научились пользоваться базами данных не хуже людей
До сих пор базы данных проектировали прежде всего для аналитиков и инженеров. Но что, если доступ к базам получат ИИ-агенты — причем не как интерфейсы для text-to-SQL, а как самостоятельные пользователи платформы?
Хорошие новости: это уже выяснили. Исследователи из C3 AI представили систему для работы с базами данных Data Intelligence Agents. Она состоит из трех агентов — Data Interpreter, Schema Creator и Query Generator.
Модуль протестировали на 4 187 заданиях на четырех диалектах SQL — в семи бенчмарках он сравнялся с лучшими опубликованными решениями или превзошел их.
Какие проблемы остались
Большинство ошибок, которые допустила модель, были смысловыми. SQL выполнялся, но агент мог неправильно выбрать связь между таблицами, фильтр или способ расчета показателя. Технически корректный запрос не всегда давал правильный ответ.
Что это значит для бизнеса?
Если подобные решения получат распространение, проектировать дата-платформы придется так, чтобы они были удобными для агентов, то есть добавлять:
✅ машиночитаемые схемы и каталог данных
✅ определения метрик и бизнес-правил
✅ явно заданные ключи, связи и ограничения
✅ доступ к безопасному выполнению пробных запросов
✅ проверки качества, логи и возможность восстановить ход работы.
🗂 Важная деталь: дата-каталог теперь нужен не просто для галочки. Без него корпоративных AI-агентов будет невозможно масштабировать, так как это основа семантического слоя.
Как выстроить слой данных, на который смогут опираться и модели, и AI-агенты, разобрали в статье VK Tech о роли дата-платформ в развитии ИИ.
📬 Мы в МАХ
3 246
Repost from VK Cloud
🤓 Воркшоп 6 августа: разворачиваем локальную LLM и подключаем агента на OpenClaw
За 90 минут онлайн-кодинга развернем языковую модель на облачной GPU и настроим агента, который будет работать с вашими документами внутри периметра.
Что нужно для создания LLM на воркшопе:
🔹аккаунт VK Cloud с Cloud GPU,
🔹 SSH-клиент,
🔹 базовый Linux.
🔐 Актуально для команд, у которых внешние API закрыты политикой ИБ или документы под NDA нельзя загружать в сторонние сервисы.
✍️ Будет полезно ML/MLOps-инженерам, дата-инженерам, ИБ-командам, платформенным командам, техлидам и всем, кто хочет создать свою LLM.
Когда: 6 августа, 16:00
Зарегистрироваться →
🔗 Мы в MAX
