Непрерывность. Устойчивость. Антихрупкость.
Open in Telegram
О рисках, непрерывности бизнеса и операционной надежности. Автор: Алексей Чеканов, CEO Алмитек, доцент РАНХиГС TG: @achekanov https://almitech.ru
Show moreRussia514 913The category is not specified
313
Subscribers
No data24 hours
+17 days
+230 days
Posts Archive
Сегодня вашему вниманию предлагается новая рубрика #ПонедельниCheck. Раз в неделю мы будем разбирать один актуальный риск, влияющий на устойчивость организации. Разбирать будем ситуации, которые встречались "в дикой природе", а значит теоретически могут существовать и у вас. Будем смотреть на #it, #security, #hr и многие другие области, где что-то может пойти не так.
Посты будут чётко структурированы: описание риска, возможные последствия, примеры реализации, актуальность, стратегия.
Выходить рубрика будет утром понедельника, чтобы вы могли для тех рисков, которые отзовутся в вашей душе, сразу запланировать корректирующие мероприятия (и нагрузить ими своих коллег).
Буду признателен за вашу оценку рубрики:
👍 - да, пиши ещё.
👎 - нет, утро понедельника и так тяжёлое.
Итак, #ПонедельниCheck #1.
Риск: архитектура HA/DR из нескольких площадок не рассчитана на длительную недоступность одной из них.
Последствия: постепенная деградация отдельных сервисов, некорректная отработка потери ноды в кластере, нехватка производительности, риск множественного отказа.
Примеры:
1. С целью снижения нагрузки на основной контур резервное копирование выполнялось со standby ноды кластера на резервной площадке. После потери резервной площадки это задание перестало выполняться. Ситуация требует как минимум перенастройки задания, но может осложниться недостаточной производительностью инфраструктуры.
2. При разрыве связи между площадками на основной площадке начали накапливаться логи несинхронизированных транзакций, через какое-то время заняв все доступное место на диске. Ситуация требует отработки данной ошибки, специфичной для используемого стека решений.
3. Резервная нода кластера БД использовалась для подготовки регулярной отчётности.
Актуальность: на фоне целевых атак БПЛА на объекты инфраструктуры риск физической потери одного или нескольких ЦОДов представляется существенным.
Стратегия: обеспечение полноценного автономного функционирования инфраструктуры на N-1 площадке. В зависимости от степени критичности и количества площадок — N-2 и так далее...
Wildberries: too big to fail?
После очередной атаки на логистические центры Wildberries невольно начинаешь задумываться, где предел прочности компании?
У WB 98 тысяч ПВЗ - это около 200 тысяч рабочих мест. Порядка 85% ПВЗ - партнерские, т.е. они кормят еще и владельцев. Итого, ПВЗ обеспечивают работой/доходом 230-240 тысяч человек.
Еще 75-100 тысяч человек работают на логистических центрах компании
Плюс минимум 10 тысяч "белых воротничков" в офисе, ИТ и т.п.
В сумме имеем 315 - 350 тысяч человек, которые зарабатывают на поддержании инфраструктуры WB.
А еще есть продавцы. На платформе зарегистрировано около 1 млн. селлеров, из которых "живых" - порядка половины, а активных - около 200 тысяч.
Итого, империя Wildberries "кормит" более 500 тысяч человек. В рейтинге работодателей, если считать его не по формальным признакам, вполне тянет на вхождение в TOP-5.
Даже не принимая в расчёт лоббистских возможностей владельцев бизнеса, очевидно, что государство компанию в беде не оставит.
На практике это означает, что как минимум комфортное кредитование WB получит в необходимом объеме. Это позволит, среди прочего, финансово поддержать селлеров, и WB это уже делает.
Однако, основные проблемы сейчас будут в другом.
1️⃣ Резкое падение пропускной способности сети. Быстро новые логистические центры не строятся, поэтому, скорее всего, движение будет в двух направлениях
👉 Организация временных логоцентров на арендованных мощностях/3PL. Это будет не так эффективно, но работать будет. При условии того, что такие доступные мощности удастся найти. Есть, конечно, и совсем жёсткие варианты "военного времени" с разворачиванием в чистом поле шатров/быстровозводимых конструкций.
👉 Перенос части нагрузки на селлеров. Меньше FBO (Fulfillment by Operator, продавцы держат запасы на складе, заказы обрабатывают сотрудники платформы), больше FBS (Fulfillment by Seller, все заказы обрабатывают продавцы, а платформа отвечает только за их логистику). Не так быстро для покупателя, не так удобно для селлеров, но ниже нагрузка на склады, и ниже риск потери товара. Озон (да, это не опечатка) в пятницу уже объявил о снижении тарифов для селлеров, работающих по модели FBS.
Конечно, это не все, что будет делаться, и компания сейчас активно работает над новой логистической моделью. Здесь ключевой фактор - время, насколько оперативно удастся перестроить эту огромную машину.
❓Важный вопрос, о котором стоит задуматься всем компаниям: а каков предел прочности? Потерю какого количества объектов компания при всех своих стараниях не сможет пережить?
2⃣ Отток покупателей и продавцов к пока ещё целому Озону. Здесь временное снижение скорости и комфорта работы на платформе можно компенсировать только деньгами (ценами для покупателей и тарифами для селлеров), и эта битва способна сжечь любое наперёд заданное количество денег. Опять возвращаемся к запасу прочности...
И всем совет: извлекайте уроки из всего, что происходит вокруг. Примеряйте реализовавшиеся сценарии на себя, анализируйте, придумывайте, что вы можете сделать заранее, чтобы быть более подготовленными к новым рискам.
Уже через неделю — очный курс на площадке Сетевой Академии ЛАНИТ.
Кроме стандартных тем будем обсуждать, как эффективно реагировать на злободневные сценарии: атаки на логистические объекты, топливный кризис и т.д.
Регистрация - на сайте Сетевой или по тел. +7 (495) 967-66-70
Сегодня ночью Wildberries & Russ потеряли два крупных логистических объекта. К сожалению, при этом пострадали люди (на момент написания этих строк известно о 8 погибших).
Немного цифр для понимания масштаба бедствия.
1️⃣ Электросталь — самый крупный объект Wildberries с площадью порядка 250 тысяч кв.м. Это очень много. Он выполнял функции национального распределительного центра, кроме того, там размещался один из трех ЦОДов компании мощностью 5 МВт, введенный в эксплуатацию в 2023 г. По ЦОДу пока нет информации, но если он сгорел вместе с логистическим центром, то это будет первая в РФ потеря ЦОДа подобного размера на моей памяти.
2️⃣ Котовск — поменьше, но все равно очень крупный: 108 тыс. кв.м. Это новый логистический комплекс, вторая очередь была запущена совсем недавно, в 2025 г. Он также входит в число крупнейших объектов первого уровня.
Итого, мы имеем потерю двух логистических центров. Объектов такого масштаба у Wildberries не больше 20.
Давайте посмотрим, какие уроки можно извлечь из случившейся ситуации.
👉 Вероятность одновременной потери нескольких объектов - ненулевая, пренебрегать этим нельзя. Особенно с учетом потенциально адресного характера атаки. Проверьте свои планы непрерывности бизнеса на готовность к одновременной реализации нескольких сценариев, в т.ч. на нескольких объектах. Поймите для себя, каков ваш запас прочности, и устраивает ли он вас с учетом текущих реалий.
👉 Социальный фактор. На примере Wildberries мы видим как минимум две категории людей, которые сильно пострадали от сложившейся ситуации: работники логистических центров и селлеры. Раз уж мы начинаем говорить про операционную устойчивость, не забывайте, что это подразумевает недопущение воздействия рисков, реализовавшихся у вас, на общество в целом. В той степени, в которой вы можете его обеспечить. По истории с WB пока рано говорить, получат ли компенсацию селлеры, будет ли какое-то возмещение работникам, потерявшим свою работу — к этому моменту мы вернемся позже.
А пока — проверяйте свои планы, старайтесь быть готовыми к реализации жестких сценариев, проводите учения. Жизнь показывает, что это оказывается востребованным все чаще и чаще...
Материалы вебинара:
Презентация: https://disk.360.yandex.ru/i/wIPCLWaarEgLsQ
Запись: https://rutube.ru/video/5ab97432d3b0ea7dfe0eee8c8ed6d89f/
Repost from N/a
1️⃣ Куча информ-агентств пытается налить воды по поводу "t.me получил статус serverHold", но я, @tonchikru , копнул немного глубже:
➕ https://ofac.treasury.gov/recent-actions/20260713 - OFAC санкции от 13го числа внесли в список персон под санкциями владельцев одного из VPN сервисов со ссылкой на их страничку через t.me/... .
⚡️Как это работает там: Во многих крупных конторах есть прям юридические отделы и информационные системы, которые занимаются санкционными списками. Одно неверное движение с персоной или ресурсом под санкциями США (OFAC их творение) и ты моментально сам попадаешь под вторичные санкции США. Надо оно тебе? 🖕. Поэтому из двух зол выбирается меньшее: прилетела санкция на страничку где-то — заблокировать к черту один домен с этой страничкой из нескольких тысяч или миллиона доменов зарегистрированных в зоне .me и разбираться уже после. Практика для инета. где в договорах в среднем всегда прописано "мы ни за что не отвечаем. все на ваш страх и риск", нормальная, 99% ожидаемая.
👍 Что делать дальше?
🎄Самым правильным путем тут будет Телеграмму пойти в OFAC, показать. что странички больше нет. ее выкинут из списка санкций. После этого пойти в регистратор .me показать. что их домена больше нельзя найти в OFAC и разблокировать. Время? ну неделя... 🍈
🌴Админы крупных провайдеров в принципе могут создать правильную запись на своих DNS серверах, указав. что t.me резолвится через name-servers из whois по домену t.me, они там еще есть и отдают все корректно. Они будут знать напрямую о t.me и не ходить к отключившем это дело серверам регистратора в .me
2️⃣ Копнуть — элементарно, заняло у меня 5..10 минут поиска и чтения: почему СМИ массово не могут заняться простым факт-чекингом и залезть на сайт с новостями от OFAC я понять не могу. Уровень 🥳 🤣
3️⃣ Сижу читаю "оригинальный" источник про OFAC, откуда взят скрин выше... ржака конечно: данные о причине есть в публичном доступе, но "мы не можем их разглашать 3м сторонам" 😆
❓: а почему. интересно. телега не следит за OFAC листом, или после прецедента этого начнет?..
По поводу всеобщей печали из-за блокировки t.me.
"Просто о сложном", как он это умеет, Антон поясняет в чем корень зла, почему это ненадолго, и почему от глупости человеческой не застрахован никто
Напоминаю, что уже послезавтра (в среду, в 11:00) мы будем разбирать новые рекомендации Банка России про операционную устойчивость кредитных организаций.
Регистрация здесь. Всем буду рад.
Нет, это не продакт плейсмент. Это яркий пример несогласованности действий различных подразделений в момент кризиса.
В то время, как на АЗС или нет бензина, или стоит огромная очередь, посетителей приглашают на чашечку ароматного кофе. Обратите внимание, что здесь нет элемента извинения, хотя можно было бы ситуацию немного отыграть: "Пока вы ждёте в очереди, выпейте чашку бодрящего кофе". Нет, это просто KPI по продажам сопутствующих товаров, который никто не отменял. И люди, которые за это отвечают, продолжают играть в маркетинг мирного времени. Просто потому, что в процессе реагирования на кризис про это забыли. И таких примеров много.
👉 Чтобы не оказаться в подобной ситуации, добавьте себе ещё один пункт в плейбук кризисного реагирования.
🏦 4-МР: насыщенное лето для банкиров.
Банк России выпустил методические рекомендации по управлению риском нарушения непрерывности деятельности в кредитной организации и банковской группе (4-МР от 29.06.2026).
👉 Первое впечатление от документа - его писали с целью гармонизировать требования, предъявляемые к кредитным организациям в области непрерывности деятельности и опернадежности: от старичка 242-П (которому в декабре исполнится 23 года) до 716-П, 850-П и ГОСТов 57580.х. Это можно только приветствовать, потому что зачастую эти требования разбегаются по разным подразделениям, и в их взаимодействии, мягко говоря, есть большое пространство для улучшений.
👉 Документ рекомендует разработать политику обеспечения операционной устойчивости и определить должностное лицо, ответственное за обеспечение операционной устойчивости. Во избежание конфликта интересов этот человек не может отвечать за операции, финансы, ИБ, ИТ. Судя по всему, остается только подразделение рисков, ну или (вот сейчас прямо смело будет) выделенное подразделение прямого подчинения кому-нибудь из зампредов.
👉 Документ определяет свой подход к проведению BIA (здесь он называется "оценка влияния на процессы"). Выглядит вполне гибко и бизнес-ориентированно.
👉 Еще одно новая сущность: планы обеспечения (восстановления) операционной устойчивости, операционной надежности для каждого сценария нарушения операционной устойчивости и (или) сценария нарушения операционной надежности соответственно. Подразумевается, что эти планы будут модулями уже существующего Плана ОНиВД. Тоже логичный переход - события опернадежности банки должны не только считать, но и планировать/тестировать свои действия в случае их наступления.
👉 Рекомендации получились довольно объемными, и не забыт ни один из элементов жизненного цикла - есть тестирование, осведомленность, отчетность и многое другое. В один пост все не поместится.
❗️И поэтому через 2 недели (15 июля в 11:00 МСК) мы проведем полноценный вебинар с разбором рекомендаций 4-МР. Записаться на вебинар можно уже сейчас, бесплатно, без регистрации и SMS.
⛽️ Хотите поговорить о проблемах с бензином?
🧠 О рисках искусственного интеллекта?
Приходите. Новые риски, новые кейсы, и как их интегрировать в общую систему.
🗓 В июле - очно, на площадке Сетевой Академии ЛАНИТ, в старом добром здании на Доброслободской.
C 9 июня восстанавливается от кибератаки компания Астрал - оператор ЭДО, ОФД и многое другое.
Классический кейс - долгое восстановление, недовольные клиенты и т.п. Сфокусируемся сейчас только на одном моменте - смена клиентами провайдера в момент его восстановления.
1️⃣ Операторов фискальных данных - много, целых 15. Казалось бы, в случае продолжающейся недоступности сервиса можно взять, и перейти к другому. Есть понятная процедура подключения кассы к новому ОФД, она не требует смены фискального накопителя, и как бы должна работать даже при наличии неотправленных чеков.
Но судя по тем проблемам, которые подсвечивают клиенты Астрала в ТГ-канале, на практике все не так просто. То ли виной наличие неотправленной информации о продажах маркированного товара, то ли что-то еще, но получается не у всех.
2️⃣ Еще один пример - смена КЭП при потере токена. Перевыпустить КЭП при наличии действующей - легко и быстро. Выпустить новую КЭП при отсутствии действующей - гораздо более сложная процедура, требующая оффлайн аутентификации владельца, что не всегда может быть оперативно выполнено.
3️⃣ Третий пример - хостинг в Нидерландах. Какое-то количество наших соотечественников пользовалось услугами VPS-хостинга для различных своих нужд 😉. В результате, когда владельцы нидерландского ЦОД отключили российских хостинг-провайдеров, сделали они это решительно, отключив от России вместе с серверами и бэкапы этих серверов. Тут, конечно, большой вопрос к провайдеру на тему отсутствия кросс-сайт бэкапов, но такая ситуация - совсем не редкость.
❗️Поэтому, даже если у вас есть план действий на случай недоступности вашего поставщика услуг, убедитесь в том, что он сработает при его неработоспособности в момент перехода к новому.
Банк России включил риски искусственного интеллекта в контур операционной надежности финансовых организаций.
Опубликованные вчера рекомендации по информационной безопасности при разработке и применении ИИ (3-МР от 16.06.2026) показывают, что регулятор рассматривает такие риски не только как вопрос технологий или этики, но и как фактор устойчивости бизнеса.
Организациям рекомендуется:
✅ Выявлять и оценивать риски ИИ
✅ Включать системы ИИ в контуры управления рисками и информационной безопасности
✅ Контролировать весь жизненный цикл моделей ИИ
✅ Обеспечивать мониторинг, аудит и управление изменениями
✅ Сохранять возможность контроля и вмешательства человека в критически важных процессах.
Хорошая новость: уволить всех кожаных не дадут.
... когда риски информационной безопасности ИИ оценены организацией как высокие, организации рекомендуется реализовать валидацию результатов операций, выполненных ИИ в автоматическом режиме, человеком с возможностью изменения таких результатов.Но придется поработать над их интеграцией в процессы. Перечень угроз, перечисленных в методичке, достаточно большой. На мой взгляд, его бы органично дополнили угрозы, связанные с технологией использования ИИ-агентов. Это, увы, неизбежная история запаздывания норм регулирования по отношению к быстро развивающимся технологиям. Но вам никто не мешает учесть это в своей модели угроз и применяемых мерах - список же открытый. Из конкретных шагов: 1️⃣ Разработка политики информационной безопасности при разработке и применении ИИ (про требования к политике - целое приложение №5) 2️⃣ Оценка рисков безопасности ИИ 3️⃣ Разработка модели угроз, специфических для работы с ИИ 4️⃣ Разработка методик оценки доверия (при работе с внешними организациями или open source моделями) 5️⃣ Выработка и реализация соответствующих мер защиты Что это означает на практике? Управление рисками искусственного интеллекта постепенно становится частью обеспечения операционной надежности. Для финансовых организаций это четкий сигнал: использование ИИ требует такого же системного управления рисками, как и любые другие критически важные процессы.
Любопытный факт. Если вы спросите ваш любимый ИИ, какой уровень доступности обеспечивает тот или иной Tier вашего ЦОДа, вы получите четкий ответ. От 99.671% для Tier I до 99.995% для Tier IV. Подтверждение этих значений вы найдете на множестве профильных сайтов.
При этом первоисточник этих цифр - whitepaper Uptime Institute от 2001 г., но официальная позиция Uptime Institute уже много лет - не существует конкретных показателей доступности, основанных только на базе Tier вашего ЦОДа.
Просто как пример того, как легко неправильные, но красивые "факты" ложатся в основу решений, принимаемых ИИ.
PS. Если кто-то хочет освежить свои знания по различиям уровней ЦОД, то это сюда.
Если вам не хватает вдохновения для продвижения инициатив по операционной надежности внутри организации - статья из Harvard Business Review вам в помощь. Новое слово на букву "C" - CResO, Chief Resilience officer.
Написано необычной группой авторов с разным опытом. Много примеров из крупного бизнеса.
И хороший посыл (соглашусь на 100%): Disruption is no longer an exceptional event. It is a feature of how modern organizations operate.
https://hbr.org/2026/05/the-case-for-hiring-a-chief-resilience-officer
В мае 2026 вышла новая версия стандарта ISO 19001:2026 "Guidelines for auditing management systems".
Это уже четвертое обновление стандарта, предыдущее выходило в 2018 году. Революционных изменений в стандарте нет, но пандемия и любовь к удаленке сделали свое дело — основные изменения коснулись проведения удаленных аудитов. Термин "удаленный аудит" был легализован, тема была раскрыта.
В 2024 году появился документ PD ISO/IEC TS 17012:2024 "Conformity assessment — Guidelines for the use of remote auditing methods in auditing management systems" (у него есть свежий русский двойник ГОСТ Р 72611-2026 "Оценка соответствия. Руководящие указания по использованию методов дистанционного аудита при аудите систем менеджмента"). Как раз с выравниванием с этим документом и связаны основные изменения в стандарте.
Кстати, сам стандарт PD ISO/IEC TS 17012:2024 достаточно любопытен — и про использование ИИ, и про дроны, и про суррогатных замещающих аудиторов. Если задача проведения удаленных аудитов вам близка — рекомендую.
Материалы вебинара:
Презентация: https://disk.360.yandex.ru/i/SNWLwGR1Vnp8PQ
Запись: https://rutube.ru/video/103d1336312bfef453fdd3083f464f95/
Напоминаю, вебинар - уже завтра.
Погода располагает устроиться за камином рабочим столом и провести час в хорошей компании.
28 мая в 11:00 МСК поговорим про резервное копирование. Обсудим разнообразные грабли, на которые уже наступали наши коллеги по цеху, и как их аккуратно обойти.
Три основных области:
1️⃣ Как ничего не забыть забэкапить
👉 BIA и целевые показатели восстановления
👉 Интеграция между процессами резервного копирования и управления изменениями
👉 Облачные сервисы и сервисы внешних подрядчиков
2️⃣ Как сделать бэкапы рабочими
👉 Согласованность резервного копирования
👉 Тестирование восстановления из резервных копий
👉 Верификация восстановленных данных
👉 Интеграция восстановления в планы DR
👉 Восстановление из альтернативных источников
3️⃣ Как минимизировать затраты на резервное копирование
👉 Эффективные политики хранения (глубина, периодичность)
👉 Регулярная уборка "мусора"
👉 Многоуровневое (tiered) хранение резервных копий
Приходите, буду рад всех видеть.
Регистрация здесь
