Отказоустойчивые кластеры и высокая доступность

Строим инфраструктуру, которая продолжает работать при отказе оборудования: резервирование узлов, хранилища, питания и каналов связи, кластеризация баз данных и приложений. Отработку отказа проверяем на практике до передачи в эксплуатацию, а не оставляем на первую аварию. Мы построили и обслуживаем кластер, на котором работают системы круглосуточного режима.

Коротко о задаче

Разговор о высокой доступности начинается с одной цифры: сколько стоит час простоя. Пока её нет, обсуждение схемы резервирования беспредметно.

Когда цифру посчитали, картина обычно меняется. Для интернет-магазина в сезон час простоя — это упущенные заказы и ушедшие к конкуренту клиенты. Для производства — остановленная линия. Для организации, которая принимает сообщения о нежелательных реакциях на лекарства, недоступность системы означает не только потерянное время, но и нарушение сроков, установленных регулятором.

Дальше выясняется, где именно спрятаны точки отказа. Часто резервирование сделано наполовину: серверов два, а хранилище одно; узлы дублированы, а питание идёт от одного ввода; кластер собран, а база данных живёт на единственном экземпляре. Одна нерезервированная деталь обнуляет всю схему.

И третье: кластер собран, но никто не проверял, что будет при реальном отказе. Автоматическое переключение либо не срабатывает, либо срабатывает, но приложение его не переживает.

Мы проектируем схему без дыр и проверяем её отключением.

Что входит в услугу

  • Анализ критичности и целевых показателей

Определяем для каждой системы допустимое время простоя и допустимую потерю данных. Эти показатели задают архитектуру и бюджет. Смотрите {{ссылка: Планы обеспечения непрерывности и восстановления (BCP, DRP)}}.

  • Поиск точек отказа

Разбираем существующую схему по слоям: питание, охлаждение, сеть, серверы, хранилище, база данных, приложение, внешние каналы. Резервирование имеет смысл только на всех слоях сразу.

  • Проектирование кластера

Количество и размещение узлов, схема кворума, общее или реплицируемое хранилище, сетевое резервирование, распределение нагрузки, поведение при отказе.

  • Резервирование хранилища

Дублирование дисковой подсистемы, контроллеров и путей доступа, репликация между площадками при повышенных требованиях.

  • Кластеризация баз данных и приложений

Настройка репликации и автоматического переключения на уровне СУБД, балансировка запросов, обеспечение корректной работы приложения при смене узла.

  • Резервирование питания и каналов

Два ввода питания, источники бесперебойного питания, независимые каналы связи с автоматическим переключением.

  • Проверка отработки отказа

Отключаем узел, канал, диск, питание и наблюдаем поведение системы. Замеряем фактическое время переключения и потери. Результаты оформляем протоколом.

  • Регламенты и учения

Порядок действий при отказе, роли, оповещение, периодические повторные испытания. Схема, которую не проверяют, деградирует незаметно.

Что это даёт заказчику

  • Отказ железа перестаёт быть аварией. Работа продолжается на резерве, а замена делается в рабочем порядке.
  • Обслуживание без простоя. Обновления и профилактику можно делать днём, выводя узлы по одному.
  • Проверенное поведение. Вы знаете, что произойдёт при отказе, потому что это отключали и замеряли.
  • Схема без слепых пятен. Разбор по слоям находит нерезервированные детали, которые обесценивали всё остальное.
  • Обоснованный бюджет. Стоимость каждого уровня надёжности видна отдельно, и можно осознанно выбрать нужный.

Как мы работаем

Полное резервирование нужно не всем и не везде. Часто правильное решение — защитить два-три критичных сервиса, а для остальных обойтись быстрым восстановлением из резервной копии. Мы предлагаем схему по уровням с ценой каждого, а выбор остаётся за вами.

Проверку отказом проводим обязательно, до передачи в эксплуатацию. Если по каким-то причинам испытание на боевом контуре невозможно, делаем его на идентичном тестовом.

Смежные направления: {{ссылка: Системы виртуализации}}, {{ссылка: Системы резервного копирования и восстановления}}, {{ссылка: Мониторинг IT-инфраструктуры 24/7}}.

Наш опыт

Серверный кластер. Построили кластер с резервированием узлов и хранилища для работы систем, где простой недопустим. На этой инфраструктуре работает платформа фармаконадзора с круглосуточным приёмом сообщений: через неё прошло более сорока тысяч обращений, ежедневно в ней работают более ста девяноста человек.

Для регулируемых отраслей отказоустойчивость подтверждается документально, а испытания входят в пакет квалификации: {{ссылка: Квалификация IT-инфраструктуры: DQ, IQ, OQ, PQ}}.

Мы сопровождаем более десяти инфраструктурных проектов и отвечаем за их доступность по договорам.

Расскажите, какие системы у вас критичны и сколько стоит час их простоя. С этой цифры начнём.

Давайте создавать вместе!

Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке

Контакты

Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78