Непрерывность бизнеса — понятие многогранное: оно включает в себя и доступность критичных сервисов, и готовность к восстановлению инфраструктуры, и способность компании выполнять свои обязательства в нештатной ситуации. Но какие же процессы действительно нельзя останавливать? И насколько длительным может быть простой, с которым бизнес готов смириться?
Мы обратились с вопросом «Что для вас означает непрерывность бизнеса?» к представителям программного комитета конференции IT Elements и попросили их обсудить эту тему с учетом отраслевого профессионального опыта.
Эксперты рассказали о возможных последствиях сбоев, о том, насколько важно иметь протестированные планы по обеспечению непрерывности бизнеса (BCP) и аварийного восстановления (DRP), а также о балансе инвестиций в защиту ИТ-инфраструктуры и в ее восстановление после киберинцидентов. Результаты этого обсуждения мы представили в новом выпуске специальной рубрики JetInfo.
Специалисты из разных сфер: банковского сектора, авиации, промышленности и ИТ — рассмотрели непрерывность бизнеса с учетом своей отраслевой специфики, поэтому за одним понятием оказываются разные риски и приоритеты.
Для меня непрерывность бизнеса — это способность компании сохранять работу ключевых сервисов независимо от технологических сбоев, киберинцидентов, отказов оборудования или изменений ИТ-ландшафта. Сегодня уже недостаточно иметь только резервное оборудование или запасную площадку: устойчивость должна закладываться на этапе проектирования архитектуры данных и информационных систем.
Для банка это особенно важно, поскольку от доступности ИТ зависят платежи, дистанционное обслуживание, операции по счетам и кредитные процессы. К критичным также относятся системы обработки данных и формирования отчетности, платформы аналитики, управления рисками и решения на базе ИИ. Из-за высокой связанности инфраструктуры сбой одного компонента может затронуть сразу несколько процессов.
Поэтому при развитии платформы больших данных мы уделяем внимание распределенной архитектуре, резервированию критичных компонентов, импортонезависимому технологическому стеку и возможности проводить обновления без остановки бизнеса. Сегодня зрелость инфраструктуры определяется не отсутствием изменений, а способностью проводить их безопасно, сохраняя доступность сервисов.
BCP и DRP должны быть не формальными документами, а рабочими инструментами, которые отражают реальную архитектуру и взаимосвязи систем. Их необходимо регулярно актуализировать и проверять на практике — только так можно выявить ограничения и подтвердить готовность к восстановлению в установленные сроки. Защиту и восстановление при этом нельзя противопоставлять — это части единой стратегии устойчивости.

Александр Сабуров,
директор департамента больших данных «Россельхозбанка»
Для меня непрерывность бизнеса — это способность компании пережить «черный вторник» без потери клиентов и денег. На практике она начинается с RTO и RPO, согласованных с бизнесом, а не придуманных ИТ-службой. Для нашей платформы виртуализации это 15 минут для RTO и 5 минут для RPO.
Однако цифры в документах сами по себе ничего не гарантируют. Мы не верим бумажкам: регулярно моделируем отказ отдельного узла или целого ЦОД. Если не уложились в заданные сроки, идем разбираться, а не ждем, пока «жареный петух клюнет». А кроме того, непрерывность неотделима от безопасности: нужно встраивать защиту на этапе проектирования, а не латать дыры постфактум.
Критичнымм мы считаем систему управления виртуализацией, CI/CD и репозитории, где хранятся более 6000 пакетов. Остановка конвейера сборки означает, что мы не можем выпускать обновления, а значит, рискуем безопасностью клиентов. Техническая поддержка также должна быть доступна постоянно. DNS, AD, VPN, NTP и DHCP мы дублируем, резервируем SAN и сетевую связность на уровнях L2 и L3.
План без проверок — макулатура. Раз в квартал мы проводим tabletop-учения, ежемесячно используем Chaos Engineering, а раз в полгода устраиваем внезапные проверки: «Через пять минут сервис упадет — восстанавливайте». После каждого сценария планы корректируются. Такой же баланс мы стараемся сохранять и между предотвращением инцидентов и готовностью к восстановлению. Около 70% инвестиций направляется на защиту (Secure SDLC, пентесты и собственные средства защиты), еще 30% — на восстановление (резервные ЦОД, бэкапы по схеме 3-2-1 и обучение). Для нас это обязательный «страховой полис».

Антон Клочков,
руководитель направления отдела разработки архитектурных решений компании «Базис»
Для нас непрерывность бизнеса — это синоним операционной устойчивости. В авиации нет понятия «временно остановились на профилактику»: рейс либо выполняется, либо нет. Его отмена влечет серьезные последствия для авиакомпании, аэропорта и пассажиров. Поэтому непрерывность — это прежде всего способность ключевых цифровых систем сохранять функциональность при кибератаке, отказе оборудования или человеческой ошибке.
В первую очередь это касается процессов, от которых зависят безопасность пассажиров и организация полетов: регистрация, обработка багажа, управление аэропортом, контроль доступа в защищенные зоны, обмен данными между аэропортом, перевозчиками и государственными информационными системами, а также аэронавигационное обслуживание. Остановка любого из них может запустить цепочку трудно прогнозируемых последствий.
Именно поэтому BCP и DRP необходимы не как согласованные документы в папке на полке, а как отработанные сценарии действий. Мы проводим командно-штабные учения для руководства, чтобы отработать процесс принятия решений, и технические — чтобы протестировать переключение на резервные системы и реагирование на инциденты ИБ. Периодичность зависит от конкретной критичной системы, но принцип один: план, который ни разу не проверяли «в бою», остается документом, а не рабочим инструментом.
По той же причине нельзя ограничиваться только превентивной защитой. Основные вложения действительно направляются на привлечение квалифицированных специалистов, организацию защиты и мониторинг, но резервирование и восстановление остаются обязательной частью устойчивости. Атакующие постоянно совершенствуют свои методы, поэтому минимизировать потери позволяет только комплексный подход.

Сергей Левашов,
заместитель генерального директора по ИТ и цифровой трансформации Государственного научно-исследовательского института гражданской авиации
Для меня непрерывность бизнеса — это способность компании продолжать выполнять основные функции и предоставлять услуги во время возможных инцидентов и после их завершения. Главная цель всех мероприятий в этой области — минимизировать влияние инцидентов и сократить время восстановления систем.
Мы разделяем информационные системы по уровню критичности — от Office Productivity до Mission Critical. К категориям Mission Critical относятся основные системы, которые обеспечивают работу базовых процессов продаж. Именно для них особенно важно заранее определить порядок действий в случае сбоя и в сценарии восстановления.
Поэтому BCP и DRP должны быть обязательно разработаны и внедрены. Они позволяют быстрее и с минимальными потерями восстановить работоспособность компании. При этом планы необходимо проверять на практике по основным и критичным сценариям отказов. Все выявленные во время тестирования недочеты должны фиксироваться, а затем последовательно устраняться.

Дмитрий Деев,
руководитель отдела ИТ-инфраструктуры и сервисов компании «Ви.Тех»
Для нас непрерывность бизнеса начинается со способности сохранять доверие клиентов и выполнять обязательства в любой ситуации — даже когда системы испытывают повышенную нагрузку или сталкиваются со сбоями. В банковской отрасли это напрямую зависит от доступности платежных систем, автоматизированной банковской системы и каналов дистанционного обслуживания: простой core banking исчисляется минутами.
Чтобы сократить влияние таких инцидентов, необходимо иметь адаптивную инфраструктуру, способную самостоятельно подстраиваться под изменяющиеся условия. Часть рутинных операций уже берет на себя автоматизация на базе ИИ, а самовосстанавливающиеся системы устраняют отдельные сбои без участия человека. Однако идеальной защиты не существует, поэтому не менее важно заранее подготовиться к восстановлению.
Именно для этого нужны BCP и DRP. Критичные системы проходят DR-тестирование от одного до трех раз в год с реальным переключением, когда боевая и резервная среды меняются ролями. Кроме того, ежегодно мы проводим имитационные учения по потере ЦОД.

Александр Тоцкий,
руководитель департамента инфраструктуры и сопровождения систем «Совкомбанка»
Непрерывность бизнеса я понимаю как способность организации сохранять работу критически важных функций без недопустимых пауз. Компания обязана продолжать предоставлять клиентам продукты и услуги на заранее согласованном уровне, в соответствии с определенными качественными и количественными показателями, даже если произошла кибератака, обнаружен отказ ИТ-компонентов, случился природный катаклизм или другой серьезный сбой.
При этом непрерывность бизнеса нельзя сводить только к информационной безопасности. ИБ создает условия для безопасной работы и защищает цифровые активы, но конечной целью остается не сама защита, а выполнение бизнесом своих обязательств. В отдельных случаях критически важные функции могут временно поддерживаться и без ИТ — с помощью бумажного документооборота, телефонной связи или ручных расчетов. Более того, необходимые меры защиты: изоляция сети, блокировка учетных записей, отключение систем и пр. — сами способны на время ограничить работу. Поэтому при инциденте в центре внимания должно оставаться восстановление бизнес-функций, а не отдельных ИТ- или ИБ-сервисов.
Отсюда следует и необходимость более широкого взгляда на риски. Чтобы обеспечить непрерывность бизнеса, нужно не только учитывать киберугрозы, но и предусмотреть проблемы с персоналом, оборудованием, помещениями, электроснабжением, а также трудности в коммуникации с партнерами или поставщиками. Полноценная система управления непрерывностью бизнеса охватывает все критические ресурсы и предусматривает альтернативные способы выполнения процессов. В первую очередь это относится к функциям, остановка которых может привести к человеческим жертвам, экологическим последствиям или существенным финансовым потерям.

Андрей Абашев,
директор по развитию функции ИБ, департамент защиты информации и ИТ-инфраструктуры компании «Норильский никель»