Мы ищем Специалиста по мониторингу ИТ-инфраструктуры, который будет обеспечивать круглосуточный контроль доступности, производительности и стабильной работы ИТ-инфраструктуры и критически важных бизнес-сервисов компании в нерабочее время.
Основная задача роли — оперативно выявлять инциденты, проводить первичную техническую диагностику, выполнять стандартные действия по восстановлению сервисов в соответствии с утвержденными инструкциями и своевременно эскалировать сложные или критические инциденты профильным ИТ-командам.
Мониторинг ИТ-инфраструктуры и выявление инцидентов:
-
Осуществлять непрерывный мониторинг ИТ-инфраструктуры, приложений и критически важных бизнес-сервисов с использованием централизованных систем мониторинга.
-
Контролировать доступность и производительность серверов, виртуальных машин, сетевого оборудования, баз данных, приложений, каналов связи и других ИТ-сервисов.
-
Отслеживать алерты, события, дашборды, уведомления и показатели состояния сервисов.
-
Выявлять деградацию сервисов, отказы, нестандартное поведение систем и инфраструктурные сбои.
-
Проверять поступающие уведомления системы мониторинга, отделять реальные инциденты от ложных срабатываний и информационных событий.
-
Выполнять базовую проверку доступности сервисов после получения уведомлений мониторинга.
Первичная диагностика и устранение типовых инцидентов:
-
Проводить первичный технический анализ обнаруженных инцидентов.
-
Самостоятельно устранять типовые и заранее определенные технические проблемы по утвержденным инструкциям, runbook'ам и стандартным операционным процедурам (SOP).
-
Выполнять разрешенные действия по восстановлению сервисов: перезапуск служб, проверку состояния сервисов, сетевой доступности, свободного места на дисках, выполнения плановых заданий и другие регламентированные операции.
-
Собирать диагностическую информацию: данные мониторинга, логи, временные метки, сообщения об ошибках, скриншоты и сведения о затронутых системах.
-
Проверять корректность восстановления сервиса после выполнения действий.
-
Документировать все выполненные действия в процессе расследования и устранения инцидента.
Эскалация инцидентов:
-
Эскалировать инциденты, которые невозможно устранить в рамках инструкций первой линии, профильным командам L2/L3.
-
При необходимости взаимодействовать с дежурными системными администраторами, сетевыми администраторами, администраторами баз данных, инженерами поддержки приложений и другими ответственными специалистами.
-
Немедленно эскалировать критические инциденты, влияющие на работу ключевых бизнес-сервисов.
-
Передавать командам сопровождения полную диагностическую информацию и перечень уже выполненных действий.
-
Контролировать статус эскалированных инцидентов до полного восстановления сервиса либо официальной передачи ответственности.
-
Соблюдать утвержденные процедуры классификации, приоритизации и эскалации инцидентов.
Работа с инцидентами и заявками (ITSM):
-
Создавать и сопровождать инциденты в системе управления ИТ-сервисами (ITSM / Service Desk).
-
Корректно классифицировать инциденты по сервису, категории, влиянию, срочности и приоритету.
-
Вести хронологию инцидентов и технические комментарии.
-
Обеспечивать регистрацию всех инцидентов, повлиявших на доступность сервисов.
-
Соблюдать требования SLA и регламенты эскалации.
-
Подготавливать информацию для передачи незавершенных инцидентов следующей смене.
Работа в сменном режиме:
-
Выполнять задачи по мониторингу ИТ-инфраструктуры в вечерние, ночные смены, выходные и праздничные дни согласно графику дежурств.
-
Проверять состояние критически важных систем в начале и в конце смены.
-
Поддерживать взаимодействие с дежурными техническими командами во время крупных инцидентов.
-
Выполнять плановые проверки инфраструктуры по утвержденным чек-листам.
-
Передавать следующей смене информацию об активных инцидентах, предупреждениях и выявленных рисках.
В рамках роли осуществляется мониторинг следующих компонентов инфраструктуры:
-
серверы Windows и Linux;
-
виртуальная инфраструктура VMware;
-
сетевое оборудование и каналы связи;
-
системы хранения данных (Storage);
-
базы данных;
-
инфраструктура Microsoft Active Directory;
-
сервисы Microsoft 365 / Exchange;
-
системы резервного копирования и репликации;
-
бизнес-приложения;
-
веб-сервисы и API;
-
интернет-каналы и внешние коммуникации;
-
инфраструктура центров обработки данных (Data Center);
-
облачные сервисы;
-
системы мониторинга безопасности и ИТ-инфраструктуры.
-
Базовое понимание принципов работы ИТ-инфраструктуры и процессов IT Operations.
-
Базовые знания операционных систем Windows и/или Linux.
-
Понимание сетевых технологий TCP/IP, включая IP-адресацию, DNS, маршрутизацию, сетевые порты и диагностику сетевой связности.
-
Навыки базовой диагностики с использованием утилит ping, tracert/traceroute, nslookup, Test-NetConnection и аналогичных инструментов.
-
Понимание основных компонентов ИТ-инфраструктуры: серверов, виртуализации, сетей, систем хранения данных, баз данных и прикладных сервисов.
-
Умение читать и анализировать алерты систем мониторинга, системные события и базовые журналы (logs).
-
Понимание принципов управления инцидентами и процесса эскалации.
-
Умение строго соблюдать технические инструкции, SOP, чек-листы и регламенты.
-
Способность самостоятельно работать в вечерние и ночные смены.
-
Хорошие навыки коммуникации и ведения технической документации.
-
Умение сохранять организованность и правильно расставлять приоритеты во время инцидентов и аварийных ситуаций.
Опыт работы с одним или несколькими из следующих решений:
-
PRTG, Zabbix, Grafana, Prometheus или другими системами мониторинга.
-
VMware vSphere / vCenter.
-
Windows Server.
-
Linux.
-
Microsoft 365.
-
Active Directory.
-
Jira Service Management или другими ITSM-платформами.
-
Инструментами мониторинга и диагностики сетевой инфраструктуры.
-
Системами резервного копирования и восстановления данных (Backup Systems).
Мы предлагаем
- Работу в финансовой, технологической компании с современными инструментами, технологиями и решения и возможности для роста и расширения профессионального опыта
- Сотрудничество по ИП/ГПХ
- Полная удаленка
- Конкурентный и стабильный доход
Ключевые навыки
- Windows Server
- Linux
- Zabbix
- Grafana
- Prometheus
- Atlassian Jira
- VMware vSphere / vCenter
- Английский — B1 — Средний