en
Feedback
KazDevOps

KazDevOps

Open in Telegram

Канал о DevOps во всех проявлениях: K8s, CI/CD, HighLoad, AI/ML, Cloud, Linux Возьмем на поддержку DevOps: https://core247.kz/ По рекламе @UlKonovalova

Show more
6 872
Subscribers
+324 hours
-267 days
+22030 days
Posts Archive
🔥 Новости мира DevOps, которые вы могли пропустить ⚪️ Cloud Native Buildpacks получил статус Graduated-проекта в CNCF Технол
🔥 Новости мира DevOps, которые вы могли пропустить ⚪️ Cloud Native Buildpacks получил статус Graduated-проекта в CNCF Технология, созданная Pivotal и Heroku еще в 2018 году, официально завершила инкубационный период. Инструмент, позволяющий трансформировать исходный код приложений в готовые OCI-контейнеры без написания Dockerfile, уже давно стал стандартом де-факто для таких гигантов, как Google, Microsoft, Bloomberg и VMware. ⚪️ Google проектирует серверный ИИ-чип Frozen v2 под архитектуру Gemini. Компания планирует «зашить» ключевые элементы своей LLM прямо в кремний. Ожидается, что аппаратная фиксация архитектуры даст рост энергоэффективности в 6–10 раз по сравнению с текущими TPU. Главная плата за такой буст — потеря гибкости: любое радикальное изменение в будущих версиях Gemini потребует проектирования нового чипа. Развертывание ожидается с 2028 года. ⚪️ Kelos — фреймворк для запуска AI-агентов как нативных ресурсов Kubernetes Проект предлагает уйти от локального запуска кодинг-агентов в терминале и превратить их в часть control plane. Kelos добавляет в K8s набор CRD (Task, Session, TaskSpawner), позволяя описывать воркфлоу агентов декларативно, изолировать их в подах с лимитами ресурсов, подключать MCP-серверы и автоматически генерировать PR прямо из GitHub Issues или Jira по принципам GitOps. ⚪️ Containerlab — фокус на тестировании сетевых топологий в контейнерах Полезный опенсорсный инструмент для сетевых инженеров и DevOps-специалистов. Проект позволяет быстро разворачивать и оркестровать контейнеризированные сетевые операционные системы (Network OS) для проверки фич, валидации дизайнов и проведения интеграционных тестов инфраструктуры прямо на локальной машине или в CI/CD. @DevOpsKaz 😛

⚡️ Развилка для тимлида: проверьте себя за 30 секунд Ситуация: единственный человек, который знает платежный модуль, увольняе
⚡️ Развилка для тимлида: проверьте себя за 30 секунд
Ситуация: единственный человек, который знает платежный модуль, увольняется через две недели. Прод-диск зашифрован по требованию HIPAA, пароль только у него в голове.
Ваш ход: a) Посадить дублера в пару и сразу перенести доступы в общее хранилище b) Заказать подробную документацию по модулю c) Заморозить вопрос: сейчас релиз, потом разберемся Прежде чем читать дальше, выберите вариант. Как ответило сообщество тимлидов Казахстана: 58% за a, 30% за b, 12% за c. Аргумент против документации, который там прозвучал: док опишет «что», но не «почему». А пароль в документ не запишешь, он все еще в чужой голове. Это один из 25 сценариев тимлид-симулятора на teamleads.kz. Кейсы собраны из реальных споров в чате, поэтому проценты под каждым вариантом — реальные ответы людей. Каждый сценарий заканчивается ссылкой на обсуждение, из которого он вырос. Что там есть на наши темы: ⚪️ Джун впервые уронил прод и стоит рядом с трясущимися руками. Чинить самому или дать чинить ему под присмотром ⚪️ Автономные development loops: инженер хочет попробовать, один прогон большой задачи жжет 100+ долларов за вечер, заказчик смотрит на бюджеты ⚪️ Ваншот-утилита, написанная с LLM за вечер, потихоньку стала нагруженной и от нее зависят другие ⚪️ Систем-дизайн интервью, где на вопрос про нагрузку и SLA отвечают «жестких требований нет, лимитов нет» ⚪️ Новая модель обошла вашего фаворита в публичных лидербордах, команда просит перевести на нее агентские пайплайны 👈 Запустить в браузере (регистрация не нужна) Чат сообщества: @teamleads_kz @DevOpsKaz 😛

🔥 HAMi: виртуализация ускорителей (GPU, NPU) вошла в CNCF Incubator Проблема, которую закрывает проект, знакома всем, кто вы
🔥 HAMi: виртуализация ускорителей (GPU, NPU) вошла в CNCF Incubator Проблема, которую закрывает проект, знакома всем, кто выкатывал ML-нагрузки в k8s: один под забирает целый ускоритель, утилизация 10-20%, а очередь на GPU растёт. HAMi позволяет «нарезать» физический GPU или NPU на доли с жёсткой изоляцией по вычислениям и памяти, размещая несколько контейнеров на одной карте. HAMi — это инструмент, который позволяет выжать максимум из железа без переписывания кода приложений и изменения манифестов Kubernetes. Архитектурно это device plugin плюс несколько компонентов. Mutating Webhook перехватывает создание подов и переписывает запросы ресурсов. Scheduler Extender фильтрует ноды и раскладывает поды по политикам размещения. Device Plugins регистрируют ускорители и выдают их доли контейнерам. HAMi-Core — слой виртуализации, который держит жёсткие лимиты. HAMi-WebUI даёт интерфейс управления и метрики в Prometheus и Grafana.
Для платформенной команды это перевод дорогого железа из режима «одна карта - одна задача» в нормальный SLO по утилизации, без переписывания приложений и без vendor lock-in на конкретный стек.
В планах команды : продвинутый шедулинг, поддержка DRA и расширение списка ускорителей. Для тех, кто выбирает базу под inference-платформу на 2026-2027, это уже кандидат для PoC рядом с NVIDIA GPU Operator и MIG. @DevOpsKaz 😛

🔥 Работа для DevOps в Европе и США Запросы на работу заграницей актуальны всегда, ведь при том же уровне знаний можно претен
🔥 Работа для DevOps в Европе и США Запросы на работу заграницей актуальны всегда, ведь при том же уровне знаний можно претендовать на рост ЗП x2 и даже х3. При этом работать можно удалённо и не переезжать вовсе. Международный рынок открыт, но нужны правильный стек, понятное резюме, хороший английский и умение проходить технические интервью по западным стандартам. Хорошая новость: всё это можно освоить. Подготовили для вас 2 статьи, которые можно смело забирать в закладки и использовать как руководства к действию. 1. Как найти работу в Европе в 2026 году: полный пошаговый гайд 2. Как IT-специалисту перейти в международную компанию Узнаете: ⚪️ личный опыт рекрутера по поиску работы для DevOps ⚪️ кого сейчас ищут международные работодатели ⚪️ где искать вакансии и стажировки ⚪️ как готовиться к собеседованиям ⚪️ какие навыки стоит подтянуть ⚪️ где учиться навыкам, которых пока не хватает @DevOpsKaz 😛

⚡️ Каналы для вашего развития в IT и DevOps Рекомендуем качественный контент знакомого ИТ-сообщества с 15-летним стажем: ⚪️ I
⚡️ Каналы для вашего развития в IT и DevOps Рекомендуем качественный контент знакомого ИТ-сообщества с 15-летним стажем: ⚪️ ITKB_channel (в MAX 📲 IT-KB) — бесплатное обучение по Windows, Linux, DevOps, Security, Network, программированию. ⚪️ ITKB_Archive — цифровая библиотека (книги, курсы, ИТ литература по Windows, Linux, сети, программирование, Project, DevOps)

⚡️ Блог Ибэшника, который ведёт человек с 15-ти летним стажем работы В канале он рассказывает: 🟢Какими инструментами он поль
⚡️ Блог Ибэшника, который ведёт человек с 15-ти летним стажем работы В канале он рассказывает: 🟢Какими инструментами он пользуется при работе 🟢Какими законными и подзаконными актами он руководствуется 🟢Как правильно делать обращения в ФСТЭК 🟢Так же рассказывает о инцидентах, с которыми встречается при работе 👈 Карманный хакер — ваш путеводитель в мир ИБ

🔥 Jira метит в центр управления AI-агентами Похоже, Atlassian решила кардинально изменить правила игры. Пока создатели IDE и
🔥 Jira метит в центр управления AI-агентами Похоже, Atlassian решила кардинально изменить правила игры. Пока создатели IDE и AI-ассистентов спорят, где должен жить искусственный интеллект, Jira делает сильный ход. Компания превращает привычный таск-трекер в полноценную платформу для управления, оркестрации и аудита AI-агентов. Что меняется в инженерных воркфлоу: ⚪️ Нативная интеграция с топ-агентами В Jira теперь можно напрямую подключать Claude Code, Cursor и GitHub Copilot (поддержка OpenAI Codex на подходе). Задачи можно делегировать AI-инструментам прямо из интерфейса трекера ⚪️ Встроенный Jira Coding Agent В платные тарифы внедряют агента-разработчика. Он берет контекст из тикета и генерирует готовый к ревью Pull Request. Разработчику вообще не нужно разворачивать и настраивать под эту задачу локальное окружение — агент всё сделает сам. ⚪️ Jira Planner: спеки на автопилоте Инструмент умеет сканировать кодовую базу, историю тикетов в Jira и документацию в Confluence, чтобы автоматически собирать структурированные технические спецификации. По ним потом могут работать как люди, так и сторонние AI-инструменты. ⚪️ Контроль за бюджетом (DX AI Cost Management) Больше никаких внезапных счетов за токены от команды. Появился дашборд для контроля затрат на сторонние AI-сервисы (Claude, Cursor, Copilot) в разрезе конкретных проектов Jira. ⚪️ Видео-инструкции для AI через Loom Обновленный Loom теперь умеет записывать экран, ваши клики и голос, а затем превращать это в структурированный action-plan, который понятен AI-агентам, или сразу конвертировать запись в готовые таски Jira.
💡 Atlassian делает ставку на то, что координация и комплаенс AI-разработки должны происходить там, где проект реально живет (не внутри редакторов кода). Для команд уже завезли шаблон проекта Agentic Engineering и визард для быстрой настройки.
@DevOpsKaz 😛

🔥 Ecosystem Meetup — третий митап сезона Halyk Tech Sprints: Level Up! Расскажут, как развивается цифровая экосистема Halyk:
+5
🔥 Ecosystem Meetup — третий митап сезона Halyk Tech Sprints: Level Up! Расскажут, как развивается цифровая экосистема Halyk: как команды работают с данными, принимают продуктовые решения и создают сервисы, которыми ежедневно пользуются миллионы пользователей. ⚪️Как данные помогают создавать востребованные продукты ⚪️Как анализ поведения пользователей влияет на развитие сервисов ⚪️Как команды развивают цифровые продукты внутри единой экосистемы
Алматы, ТРЦ Forum, зал Event Space 22 июля | 🕖 19:00
Участие бесплатное после регистрации. 👈 Регистрируйтесь @DevOpsKaz 😛

🔥 Спикеры #3 и #4 на Cloud Native Community Day в Алматы Перед вами все еще открыта возможность выступить на 100-150 человек
🔥 Спикеры #3 и #4 на Cloud Native Community Day в Алматы Перед вами все еще открыта возможность выступить на 100-150 человек, чтобы укрепить личный бренд, завести полезные знакомства и завоевать очки для своей карьеры. ⚪️ Эмиль Аминов, Cloud Tech Lead, Salmon: «За пределами одного кластера: Istio Multi-Cluster между AWS-аккаунтами»
Как построить Istio Multi-Cluster между несколькими AWS-аккаунтами, связать распределённые сервисы и какие архитектурные решения помогают масштабировать облачную платформу.
⚪️ Валерий Окшин, DevOps Team Lead, Freedom Cloud: «Longhorn: когда Ceph слишком тяжёл, а local storage уже не хватает»
Когда Longhorn становится оптимальным выбором для Kubernetes, какие задачи он решает и какие компромиссы стоит учитывать при эксплуатации.
Если у вас есть история, которой не хватает в этой программе, расскажите её. Не идеальный проект. Не идеальная архитектура. Возможно, именно ваш production-кейс поможет кому-то избежать бессонной ночи. 👈 Подайте заявку как спикер 👈 Зарегистрироваться как участник @DevOpsKaz 😛

Как создавать ИИ-агентов, которым можно доверять Онлайн-интенсив AI Agents Security Week от Школы анализа данных Yandex (ШАД)
Как создавать ИИ-агентов, которым можно доверять   Онлайн-интенсив AI Agents Security Week от Школы анализа данных Yandex (ШАД) раскроет эту тему с 27 по 31 июля. Эксперты Yandex поделятся, с какими угрозами сталкиваются ИИ-агенты и как защитить свои проекты уже на этапе проектирования.   В программе: — Чем ИИ-агенты отличаются от больших языковых моделей — Как защищать системы от взломов, утечек данных, ошибок конфигурации и других угроз — Какие ошибки встречались в ИИ-системах DeepSeek, Microsoft Bing и Amazon
Интенсив подойдет тем, кто активно вайбкодит и хочет получать безопасные продукты на выходе. Для старта достаточно знать, как писать промпты и запускать получившийся код.
Регистрируйтесь на 5 дней видеотрансляций с возможностью задать вопросы [Зарегистрироваться]

🔥 Пятница безопасности Сегодня в программе: критическое состояние экосистемы MCP-серверов, влияние контейнеризации на ИБ и а
🔥 Пятница безопасности Сегодня в программе: критическое состояние экосистемы MCP-серверов, влияние контейнеризации на ИБ и автоматический мониторинг инфраструктуры на государственном уровне. Только самое важное из мира безопасности. ⚪️ State of MCP Security 2026 Команда Canopii просканировала более 11 000 публично доступных MCP-серверов. Результаты оказались крайне тревожными. Серверы с 1000+ звёзд в 5 раз чаще оказываются в зоне высокого риска (категории D или F). - 232 сервера содержат подтверждённые опасные «синки» (eval, shell-инъекции, десериализация непроверенных данных). - 78% серверов не используют dependency pinning (фиксацию версий зависимостей), что делает их уязвимыми к скрытым обновлениям. - 1617 серверов прямо сейчас поставляются с известными опубликованными уязвимостями (в топе устаревших пакетов — библиотеки JWT и криптографии). - 260 серверов запускают install-скрипты прямо на рабочем месте пользователя ещё до старта самого сервера. - в 31% случаев (24 из 77 серверов, декларирующих авторизацию) эндпоинты отдавали полный список инструментов анонимным пользователям без проверки учётных данных. ⚪️ Запись эфира: «Как развитие контейнеров влияет на информационную безопасность» Специфика безопасности контейнеров тесно связана с эволюцией контейнерных технологий. Ландшафт ИБ меняется, и перед инженерами встают новые вызовы. Несет ли Kubernetes оверхед, насколько он безопасен по умолчанию и нужно ли для безопасности контейнеров отдельное направление в ИБ? На эти и другие вопросы смотрите ответы в записи. Спикеры: – Александр Лысенко, ведущий эксперт по безопасности разработки и ИИ К2 Кибербезопасность; – Дмитрий Евдокимов, основатель и технический директор Luntry. ⚪️ ИБ на уровне страны: опыт польского CSIRT Интереснейший доклад от инженера, как устроен государственный мониторинг безопасности «снаружи». Спикер рассказывает, как они автоматически сканируют всю доступную им инфраструктуру (а иногда и ту, куда их особо не приглашали, ради общего блага). Команда всего из 6 инженеров держит всю систему на понятных и привычных Kubernetes и PostgreSQL. При этом уязвимости они детектируют вагонами, подтверждая эффективность простого и прагматичного подхода.
Берегите свои серверы, пиньте зависимости в MCP и отличных безопасных выходных
@DevOpsKaz 😛

🔥 Platform Engineering 2.0: как IDPs эволюционируют для AI-native workloads IDP версии 1.0 снижали когнитивную нагрузку на л
🔥 Platform Engineering 2.0: как IDPs эволюционируют для AI-native workloads
IDP версии 1.0 снижали когнитивную нагрузку на людей, но не проектировались под агентов, которым нужны GPU/TPU, управление жизненным циклом моделей, валидация контекста через MCP и контроль доступа к данным. Если платформа не даёт агентам управляемого доступа к ресурсам, они либо упираются в квоты, либо разъезжаются по shadow-инфраструктуре.
В блоге CNCF описали переход от Golden Paths к адаптивным платформам, где AI-агенты становятся first-class citizens наравне с разработчиками. CNCF выделяет пять сдвигов: ⚪️ AI-Native Platform — управление ускорителями и моделями встроено в контрольную плоскость.  ⚪️ Multi-Persona Experience — интерфейсы для ML-инженеров, аналитиков и агентов, а не только для сервисных команд.  ⚪️ Embedded FinOps — стоимость инференса и обучения видна в момент принятия решения, а не в отчёте через месяц.  ⚪️ Security Shifts Down — защита от prompt injection, model poisoning и утечек через inference переезжает в платформенный слой.  ⚪️ Composable by Design — компоненты заменяемы, чтобы успевать за экосистемой. Ключевая мысль в том, что выдержат нагрузку без структурного долга те платформы, которые изначально строились композируемыми. @DevOpsKaz 😛

⚡️ Как построить отказоустойчивую сеть Kubernetes в on-prem На онлайн-лекции 16 июля разберут, как построить надежную и предс
⚡️ Как построить отказоустойчивую сеть Kubernetes в on-prem На онлайн-лекции 16 июля разберут, как построить надежную и предсказуемую сеть Kubernetes в on-prem кластере. Спикер — Сергей Сперанский, Senior Infrastructure Platform Engineer. Узнаете:  ⚪️ как организовать Kubernetes-сеть с понятной маршрутизацией, BGP и удобным troubleshooting ⚪️ какие инструменты помогают обеспечить отказоустойчивость сети  ⚪️ как кластер реагирует на отказ node, ToR-коммутатора или control plane ⚪️ какие архитектурные решения позволяют создавать практичную Kubernetes-инфраструктуру
Когда: 16 июля, 19:00 Формат: онлайн
👈 Зарегистрироваться @DevOpsKaz 😛

🔥 «Под перезапустился!» Фраза, которую на дежурствах произносят по абсолютно разным поводам. Но понимаем ли мы, что произошл
🔥 «Под перезапустился!» Фраза, которую на дежурствах произносят по абсолютно разным поводам. Но понимаем ли мы, что произошло на самом деле? Путаница между банальным рестартом процесса в контейнере, полной заменой объекта пода или горячей перезагрузкой конфигов часто приводит к неверным решениям в 2 часа ночи. В новой статье детально разбираем внутренние механизмы Kubernetes и то, как на самом деле принимаются решения о перезапуске. 👈 Читать статью Что внутри: ⚪️Kubelet под микроскопом: почему он следит только за pod spec и игнорирует изменения ConfigMap/Secrets в переменных окружения. ⚪️Магия симлинков: как работает монтирование томов и почему классический inotify часто пропускает обновления конфигурации. ⚪️Фичи K8s 1.35 GA: как работает in-place resize ресурсов без пересоздания пода и смены IP/UID, и почему JVM может тихо проигнорировать добавление памяти. ⚪️ Ловушка Hot-Reload: почему «громкое» падение контейнера при ошибке в конфиге часто безопаснее, чем тихая работа со сломанной логикой на живую. Разбираем теорию на практических схемах и командах для отладки. @DevOpsKaz 😛

⚡️ Cilium Cluster Mesh для объединения Kubernetes-кластеров в разных облаках Приложения в нескольких кластерах развёртывают п
⚡️ Cilium Cluster Mesh для объединения Kubernetes-кластеров в разных облаках Приложения в нескольких кластерах развёртывают по нескольким причинам: ⚪️ Запуск реплик в разных зонах доступности, регионах или у разных провайдеров для защиты от глобальных сбоев. ⚪️ Приближение бэкенда к пользователям по всему миру. ⚪️ Изоляция критических сред. В отличие от логической изоляции через Namespaces, разделение по кластерам защищает от сбоев на уровне Control-Plane. ⚪️ Вынос мониторинга или логирования в отдельный служебный кластер, который должны видеть все остальные. Самый очевидный способ связать два сервиса в разных кластерах — выставить сервис в кластере-2 наружу через LoadBalancer и стучаться в него из кластера-1 по внешнему IP. Но есть и минусы: ⚪️ Облачные балансировщики стоят дорого, а в On-Prem средах внешние IP-адреса ограничены. ⚪️ Для удаленного кластера этот трафик выглядит как обычный внешний запрос. Теряются метаданные Kubernetes и сквозная авторизация. Cluster Mesh работает иначе: создает единую виртуальную оверлейную сеть между кластерами. Для приложений это выглядит так, будто они находятся в одной сети с единым пространством имен и идентичностей.
Чтобы узнать, как объединить Kubernetes-кластеры в разных облаках через Cluster Mesh на примере Cilium, Amazon EKS (AWS) и Google GKE (GCP), рекомендуем статью. Узнаете про архитектуру сетевого взаимодействия, режимы маршрутизации CNI, посмотрите практический сценарий и сможете реализовать у себя. 👈 Читать статью
@DevOpsKaz 😛

🔥 Образовательный дайджест июля ⚪️ Вечерняя школа ИИ для инженеров Слёрм запускает бесплатную серию онлайн-занятий «ИИ для и
🔥 Образовательный дайджест июля ⚪️ Вечерняя школа ИИ для инженеров Слёрм запускает бесплатную серию онлайн-занятий «ИИ для инженеров: польза и риски», где разбирают реальные сценарии: — как ИИ помогает DevOps-, SRE- и infrastructure-командам — как использовать LLM для алёртов, инцидентов, логов, тикетов и документации — где ИИ реально экономит время, а где создаёт новые риски — как проверять результат модели и не ловить галлюцинации в проде — что делать с безопасностью, данными, compliance и юридическими ограничениями — как встроить ИИ в рабочий процесс, а не просто иногда спрашивать у него команды. 👈 Зарегистрироваться в боте ⚪️ Администрирование ОС Linux За 30 минут вы защитите Linux-сервер по пошаговой инструкции: создадите безопасного пользователя, настроите SSH, UFW, fail2ban, автообновления, проверите открытые порты и cron, а также получите рекомендации для дальнейшей безопасной эксплуатации. 👈 Забирайте бесплатную инструкцию «Безопасность Linux-сервера за 30 минут» ⚪️ Автоматизация инфраструктуры с Ansible Не тратьте время на поиск нужных модулей Ansible — держите под рукой шпаргалку с 30 самыми востребованными модулями и готовыми примерами. 👈 Заберите материал и ускорьте создание плейбуков ⚪️ Почему большинство AI-агентов не доходят до продакшена? В новой статье разобрали 5 ключевых проблем — от недетерминированности и контекста до тестирования и мониторинга — с примерами кода и практическим роадмапом внедрения 👈 Читать статью ⚪️ Бесплатный мини-курс по Apache Kafka Понимание архитектуры Kafka — это must-have для IT-специалистов, которые хотят избежать множества ошибок в работе с данными. Курс поможет быстро разобраться с ключевыми понятиями и терминами мира Kafka. Внутри: видеоурок + презентация, глоссарий в PDF-формате с основными терминами, тестирование для проверки себя. 👈 Забрать курс ⚪️ Система распределённых очередей Apache Kafka — набор до 20 июля Научитесь строить отказоустойчивый кластер без тонны документации. Разберётесь, как Kafka работает изнутри, чтобы предотвращать инциденты и держать систему стабильной под нагрузкой 👈 Посмотреть программу @DevOpsKaz 😛

🔥 Спикеры #1 и #2 на Cloud Native Community Day в Алматы Начинаем анонсировать первых спикеров — и показываем, какие доклады
🔥 Спикеры #1 и #2 на Cloud Native Community Day в Алматы Начинаем анонсировать первых спикеров — и показываем, какие доклады уже есть. Перед вами все еще открыта возможность выступить на 100-150 человек, чтобы укрепить личный бренд, завести полезные знакомства и завоевать очки для своей карьеры. ⚪️ Иван Екимов, SUSE: «Как скрыть control plane k8s и что это дает»
Традиционно пользователи Kubernetes напрямую взаимодействуют с control plane, что усложняет эксплуатацию кластеров. Скрытие раскрывает возможности Kubernetes as a Service, передав управление инфраструктурой платформенной команде. Managed-платформа должна автоматически создавать, масштабировать, обновлять и сопровождать кластеры на протяжении всего жизненного цикла. Для реализации такого подхода наиболее подходит Cluster API — благодаря декларативной модели управления и поддержке различных инфраструктур.
⚪️ Максат Акбанов, Magnum Cash&Carry: «Защита Kubernetes-кластера с помощью Kubescape»
Обзор возможностей DevSecOps-инструмента Kubescape (CNCF) и опыт внедрения в релизные циклы. Узнаете про статический и динамический режимы работы, генерацию отчетов безопасности, интеграцию с ArgoCD, настройку Alertmanager и мониторинг безопасности через Prometheus exporter.
Ждем вашей заявки на доклад о реальном опыте. Требования к докладу очень простые. 👈 Подайте заявку как спикер 👈 Зарегистрироваться как участник @DevOpsKaz 😛

💙 Минорный релиз etcd v3.7.0 для Kubernetes Поскольку etcd является критически важным «сердцем» Kubernetes (хранилищем состо
💙 Минорный релиз etcd v3.7.0 для Kubernetes Поскольку etcd является критически важным «сердцем» Kubernetes (хранилищем состояния кластера), это обновление напрямую влияет на производительность и стабильность будущих версий. Разбираем самое важное из релиза. 1️⃣ Киллер-фича: RangeStream Раньше, если клиент запрашивал огромный объем данных, etcd полностью собирал весь результат в буфер памяти, а затем отправлял его целиком. Это вызывало непредсказуемые скачки памяти и задержки как на сервере, так и на клиенте. Что изменилось: добавлен метод RangeStream RPC. Теперь большие выборки данных отправляются клиенту частями (чанками/стримом). Это сделает работу тяжелых контроллеров в больших кластерах гораздо более стабильной. 2️⃣ Серьезные улучшения производительности Команда заявляет о заметном снижении потребления CPU процессами etcd по сравнению с версией 3.6. При запросах ключей без их значений (например, etcdctl get --keys-only), etcd теперь читает данные только из своей инкрементальной памяти. Больше нет нужды читать и десериализовать тяжелые значения из дискового хранилища bbolt (за исключением случаев сортировки по значению). Работа с механизмами аренды ключей стала быстрее и надежнее. 3️⃣ Чистка легаси etcd теперь загружается полностью из v3store. Из кодовой базы убрали последние остатки старого движка хранения V2 API, что сильно очистило архитектуру. Завершен масштабный оверхол библиотек Protobuf, устаревшие зависимости заменены на современные и полностью поддерживаемые. 4️⃣ Другие полезные фичи - Поддержка Unix-сокетов - Управление AuthStatus. Теперь можно запрашивать статус аутентификации кластера без предварительной авторизации - Новые метрики для Watch
etcd v3.7 принесет долгожданное облегчение для master-нод. Кластеры с огромным количеством объектов станут потреблять меньше процессора, а API-сервер будет тратить меньше памяти.
@DevOpsKaz 😛

🔥 Расследование «невидимого» бага от Cloudflare После того как Cloudflare изменила внутреннюю архитектуру сервиса Cloudflare
🔥 Расследование «невидимого» бага от Cloudflare
После того как Cloudflare изменила внутреннюю архитектуру сервиса Cloudflare Images (переведя его с сетевых сокетов на локальные Unix-сокеты для ускорения работы), клиенты начали жаловаться, получая битые или недозагруженные картинки.
Обычные инструменты логирования на уровне приложения ничего не показывали — для них все выглядело идеально. Попытки воспроизвести баг локально через curl тоже провалились. Команда инженеров искала баг 6 недель, а исправила всего четырьмя строчками кода. Прорыв случился, когда инженеры подключили низкоуровневую утилиту ядра strace, чтобы отследить системные вызовы к сокетам. Оказалось, что при отправке больших файлов процесс делал один системный вызов записи в буфер сокета (sendto), а следующим шагом сразу же закрывал соединение на запись (shutdown), хотя большая часть данных еще оставалась во внутреннем буфере библиотеки. Виновником оказалась hyper — популярная open-source библиотека на Rust для работы с HTTP. Баг сидел в ней годами во множестве версий. В цикле обработки соединений (dispatch.rs) библиотека вызывала функцию сброса данных из буфера в сокет (poll_flush). Однако результат этого вызова просто игнорировался с помощью конструкции let _ = self.poll_flush(cx)?;. Если сокет на стороне получателя на пару миллисекунд заполнялся, функция возвращала статус «ожидания» (Poll::Pending), сообщая, что данные еще не ушли. Но из-за let _ библиотека игнорировала это, считала, что всё успешно отправлено, и преждевременно вызывала закрытие сокета, обрубая хвост файла. 👈 Узнать детали в источнике
Когда вы проектируете межсервисное взаимодействие на сверхвысоких скоростях (особенно в K8s через sidecar-контейнеры, mesh-сети или локальные сокеты), всегда закладывайте тесты на переполнение буферов и симулируйте медленных клиентов.
@DevOpsKaz 😛

🔥 Приходите на Cloud Native Community Day в Алматы Традиционный митап под эгидой CNCF состоится уже 13 августа. Это бесплатн
🔥 Приходите на Cloud Native Community Day в Алматы
Традиционный митап под эгидой CNCF состоится уже 13 августа. Это бесплатный митап, где знакомятся, находят помощь в сложных задачах, договариваются о коллаборациях и проектах. В одном зале соберутся SRE, DevOps, платформенные инженеры, архитекторы. На этот раз людей будет больше — по вашим просьбам увеличили кол-во участников до 100-150 человек, но места быстро заканчиваются.
👈 Забронировать место Мероприятия пройдет в Almaty Hub. Что вас ждет: ⚪️ Кейсы от инженеров, которые каждый день держат кластеры в бою. ⚪️ Реальный опыт, который помогает закрывать задачи без магии и боли. ⚪️ Решения, которые можно попробовать уже завтра. ⚪️ Нетворкинг, где можно обсудить и «как вы это дебажили», и «что у вас с логами», и просто пообщаться. ⚪️ Фуршет, подарки и afterparty. Скоро начнем объявлять спикеров и знакомить вас с конкретными докладами. 👈 Забронировать место Если слышите о мероприятии впервые, посмотрите, как это было раньше. @DevOpsKaz 😛