Мониторинг IT-инфраструктуры 24/7

Разворачиваем мониторинг серверов, сети, сервисов, резервного копирования и условий в серверном помещении, настраиваем оповещения и берём на себя круглосуточное наблюдение. Настраиваем так, чтобы уведомления приходили по делу: система, которая шлёт двести писем в день, не работает так же, как система, которая молчит.

Коротко о задаче

Есть два одинаково плохих состояния, и компании обычно ходят между ними.

Первое: мониторинга нет. О недоступности сервиса узнают от пользователей или от клиента, то есть в момент, когда ущерб уже нанесён. Диск заполняется постепенно, и об этом никто не знает до остановки базы данных. Резервное копирование падает три месяца, и это обнаруживается в день, когда понадобилось восстановление.

Второе: мониторинг есть, но настроен без разбора. Уведомления идут потоком, большая часть о несущественном. Через месяц их перестают читать, потом заводят правило в почте, потом отключают вовсе. Формально контроль есть, фактически его нет, и это опаснее первого варианта: возникает ложное чувство защищённости.

Разница между работающим и неработающим мониторингом не в количестве собираемых показателей, а в том, приводит ли уведомление к действию. Каждое сообщение должно означать, что нужно что-то сделать. Всё остальное идёт в отчёты, а не в оповещения.

Что входит в услугу

  • Определение контролируемых параметров

Разбираем, что критично для бизнеса, и от этого идём вниз к техническим показателям. Доступность сервиса важнее загрузки процессора, и следить нужно за обоими, но реагировать по-разному.

  • Развёртывание системы мониторинга

Установка и настройка платформы, подключение серверов, сетевого оборудования, виртуальной среды, баз данных, приложений и внешних сервисов.

  • Контроль бизнес-сервисов

Проверка не только того, что сервер отвечает, но и того, что сайт открывается, форма отправляется, база принимает запросы, обмен с внешней системой проходит. Работающий сервер и работающий сервис — разные вещи.

  • Пороги и оповещения

Настройка порогов по фактическому поведению системы, разделение уведомлений по критичности, разные каналы для разных уровней, тихие часы для несрочного.

  • Борьба с шумом

Группировка связанных событий, подавление повторов, исключение известных колебаний. Задача — свести поток к сообщениям, каждое из которых требует действия.

  • Контроль резервного копирования

Отдельная проверка успешности заданий и оповещение при отсутствии успешной копии за период. Смотрите {{ссылка: Системы резервного копирования и восстановления}}.

  • Мониторинг серверного помещения

Температура, влажность, питание, состояние источников бесперебойного питания, датчики протечки и открытия двери.

  • Дежурство и эскалация

Круглосуточное наблюдение с нашей стороны, порядок реагирования, уровни эскалации, регистрация инцидентов. Смотрите {{ссылка: Служба поддержки пользователей (Service Desk) с SLA}}.

  • Отчётность

Регулярные отчёты о доступности, инцидентах, тенденциях по нагрузке и свободным ресурсам. Отчёты показывают, что заканчивается место или упирается канал, за месяцы до аварии.

Что это даёт заказчику

  • О проблеме узнаёте первыми. Не от пользователей и не от клиента.
  • Уведомления по делу. Каждое сообщение требует действия, поэтому их читают.
  • Предупреждение вместо реакции. Заканчивающееся место и растущее время отклика видны заранее.
  • Проверенное копирование. Отсутствие успешной копии перестаёт быть незамеченным.
  • Объективная картина. Отчёты о доступности снимают споры о том, сколько на самом деле система была недоступна.
  • Основа для планирования. По тенденциям видно, когда потребуется расширение.

Как мы работаем

Начинаем с перечня сервисов и того, что для бизнеса означает их недоступность. Технические показатели подбираются под это, а не наоборот.

Первые недели после запуска настраиваем пороги по фактическим данным: значения, взятые из рекомендаций, дают либо ложные срабатывания, либо пропуски. Это нормальная часть внедрения, и её нельзя пропустить.

Мониторинг обычно берут вместе с обслуживанием: {{ссылка: Абонентское обслуживание серверов и сети}}. Наблюдение без тех, кто устраняет, даёт только более раннее знание о проблеме.

Наш опыт

Мы отвечаем за доступность систем, которые обслуживаем по договорам сопровождения, включая платформы с круглосуточным режимом работы и объекты, работающие без выходных. Более десяти инфраструктурных проектов находятся у нас на постоянном обслуживании.

Для регулируемых отраслей данные мониторинга становятся доказательной базой: подтверждение условий в серверной и показателей доступности входит в пакет квалификации. Смотрите {{ссылка: Квалификация IT-инфраструктуры: DQ, IQ, OQ, PQ}}.

Расскажите, что у вас работает и как вы сейчас узнаёте о сбоях. Начнём с перечня сервисов и схемы контроля.

Давайте создавать вместе!

Свяжитесь с нами и мы проконсультируем по вопросам реализации IT-решений и найдем лучший подход к разработке

Контакты

Офис: г. Казань, ул. Островского, 57Б, оф. 110
Почта: info@nabla-lab.ru
Телефон: +7 (965) 595-62-78