# Обеспечение непрерывности бизнеса: как подготовить организацию к сбою

Редакция SGI24. Материал основан на практике SGI24 по связанным системам, инфраструктуре и восстановлению, а также на рекомендациях NIST. [О бюро](/company).

Непрерывность бизнеса — это способность сохранить критичную работу, когда привычная система недоступна. Не обязательно обещать, что ничего никогда не сломается. Нужно заранее решить, что продолжает работать, кто принимает решение и как организация возвращается к нормальному режиму.

План, составленный только ИТ-отделом, часто начинается с серверов. Рабочий план начинается с обязательств: подтвердить запись пациента, ответить родителю по поступлению, выдать участнику конференции документы и передать бухгалтерии сведения об оплатах.

Составить план непрерывности

Выберите действительно критичные процессы

Попытка объявить критичным всё делает приоритет бессмысленным. Руководители подразделений вместе составляют короткий список действий, остановка которых быстро приводит к финансовым, правовым или репутационным последствиям.

Для каждого процесса фиксируются:

  • минимальный результат во время сбоя;
  • допустимое время простоя;
  • допустимая потеря новых данных;
  • ответственный за решение;
  • внешние обязательства и сроки;
  • ручной или резервный способ работы.

Для клиники критичен доступ к расписанию и контактам пациентов на ближайший день. Частной школе в период приёмной кампании нужны обращения семей и документы абитуриентов. Организатору конференции важно сохранить регистрацию, оплаты и выдачу подтверждений.

Постройте цепочку зависимостей

Процесс почти никогда не живёт в одной программе. Онлайн-запись зависит от сайта, домена, сети, интерфейса медицинской системы, базы и уведомлений. Если резервировать только сервер сайта, цепочка всё равно не заработает.

Карта показывает людей, помещения, поставщиков, данные и технические узлы. Для каждой связи задаётся вопрос: что произойдёт при недоступности и как это обнаружится?

Особое внимание получают единичные точки отказа: один администратор, одна учётная запись, один канал связи, один подрядчик или единственный файл с инструкцией на недоступном компьютере.

Что включает аудит ИТ-инфраструктуры

Определите допустимый простой обычными словами

Фразы «как можно быстрее» недостаточно. Разные процессы требуют разной скорости и бюджета. Систему расчёта зарплаты можно вернуть к определённой дате, а очередь обращений — через несколько минут или часов.

Руководитель утверждает конкретную границу. Техническая команда затем проверяет, достижима ли она текущими средствами. Если нет, заказчик видит разрыв и стоимость вариантов: ускорить восстановление, организовать ручной режим или принять риск.

Так бюджет привязывается к последствию для бизнеса, а не к абстрактной максимальной надёжности.

Подготовьте ограниченный ручной режим

Ручной режим не означает вернуться к хаосу в бумаге и мессенджерах. Это заранее подготовленная минимальная процедура: где фиксируется новое обращение, как проверить человека, кто выдаёт номер и как данные потом возвращаются в основную систему.

Нужен контроль дублей. После восстановления нельзя дважды провести оплату или создать две записи из одного временного списка. Для обратного переноса задаются идентификатор, ответственный и сверка.

Резервный канал не должен нарушать правила доступа к персональным данным. Выгрузка контактов на личный телефон сотрудника может сохранить связь на час, но создать более серьёзный риск.

Роли во время инцидента

В плане есть не только технический исполнитель. Нужны владелец решения, координатор, ответственный за сообщения сотрудникам и клиентам, а также человек, который фиксирует события.

Для каждой роли указывается замена. Контакты доступны вне основной системы. Порог эскалации понятен: когда локальную проблему объявляют инцидентом, кто разрешает переключение и кто принимает решение о возврате.

Сотрудник не должен в момент сбоя искать директора в общем чате и объяснять ситуацию с нуля.

Связь без ложных обещаний

Молчание заставляет клиентов многократно звонить и увеличивает нагрузку. Но обещать точный срок до диагностики тоже опасно.

Готовятся короткие шаблоны: что затронуто, какой временный порядок действует, когда будет следующая информация. Внешнее сообщение не раскрывает технические детали и чувствительные сведения.

Для сотрудников дополнительно указывается, какие действия запрещены: повторно запускать операцию, менять настройки или использовать неутверждённую копию данных.

Резервные копии — часть, но не весь план

Копия помогает вернуть данные. Она не возвращает людей, канал связи, доступ к поставщику и порядок принятия решений. Поэтому резервирование проверяется вместе со сценарием процесса.

Как проверить резервное копирование данных

Во время теста измеряют время развёртывания базы, момент возвращения сотрудника к контрольному действию и безопасную загрузку накопившихся операций.

План без учений остаётся предположением

Проверка может быть настольной: участники получают сценарий и пошагово объясняют свои действия. Более зрелый вариант включает безопасное переключение тестового контура и восстановление данных.

Учение показывает забытые телефоны, устаревшие инструкции, недоступные права и конфликт ролей. После него план исправляется, а не убирается в архив до следующего года.

Критерии записываются заранее: время обнаружения, время решения, возврат контрольного процесса, полнота данных и качество связи.

Из чего состоит рабочий план

SGI24 может выполнить только разбор непрерывности, не меняя весь ИТ-контур. Заказчик получает перечень критичных процессов, карту зависимостей, цели восстановления, роли, временные процедуры и сценарий проверки.

Настройка резервных копий, мониторинга, интеграций или дашборда оформляется отдельными блоками. Их можно заказать у SGI24, передать своей команде или текущему подрядчику.

Комплексная программа нужна только там, где несколько разрывов мешают достигнуть утверждённого времени восстановления.

С чего начать руководителю

Выберите один процесс, потеря которого заметна уже в первый рабочий день. Соберите владельца процесса, ИТ-специалиста и человека, который работает в системе ежедневно. За два-три часа можно восстановить цепочку и увидеть главные неизвестные.

Первый результат — не толстый регламент, а проверяемое решение: кто и что делает в первые пятнадцать минут, первый час и до полного восстановления.

Что можно гарантировать планом непрерывности

План снижает время неопределённости, но не исключает аварии. Сроки зависят от подтверждённых ресурсов, доступов и проведённых проверок. Непроверенная процедура отмечается как допущение, а не как готовая защита.

Составить план непрерывности

Источники