Senior Reliability Engineer

Уровень дохода не указан

Опыт работы: 3–6 лет

Полная занятость
Оформление: Трудовой договор

График: 5/2

Рабочие часы: Вечерние или ночные смены, 8

Формат работы: на месте работодателя или гибрид

Напишите телефон, чтобы работодатель мог связаться с вами
Нажимая «Продолжить», вы подтверждаете, что ознакомлены, полностью согласны и принимаете условия «соглашения»
Будьте частью чего-то нового

TradingView – это аналитическая платформа и социальная сеть, которую используют миллионы инвесторов и трейдеров из более чем 100 стран. Мы предоставляем доступ к данным со 100+ торговых площадок по всему миру.

#1 Самый популярный сайт в мире в сфере инвестирования*

Мы ищем Reliability Engineer, который поможет повысить надёжность, наблюдаемость и операционную стабильность наших сервисов.

На этой позиции вы будете тесно взаимодействовать с инженерными командами: расследовать инциденты в продакшене, внедрять улучшения, направленные на повышение надёжности, развивать практики мониторинга и наблюдаемости, а также снижать операционные риски на уровне всей платформы.

Задачи:

  • Расследовать инциденты в продакшене и сопровождать их до полного устранения всех последствий.
  • Проводить анализ первопричин (RCA) и участвовать в разборе инцидентов вместе с инженерными и продуктовыми командами.
  • Контролировать выполнение корректирующих действий по итогам инцидентов и постмортемов.
  • Развивать и улучшать мониторинг, алертинг и наблюдаемость закреплённых сервисов.
  • Определять и поддерживать SLI/SLO, анализировать метрики надёжности и контролировать целевые показатели состояния сервисов.
  • Отвечать за соблюдение SLA закреплённых frontend- и backend-сервисов.
  • Совместно с инженерными командами и владельцами продуктов определять и внедрять требования к доступности на уровне сервисов.
  • Выявлять пробелы в мониторинге и наблюдаемости и внедрять улучшения, сокращающие время обнаружения и устранения проблем.
  • Разрабатывать и поддерживать runbook’и, инструкции по диагностике и процедуры восстановления сервисов.
  • Участвовать в проверке инцидентов и разборе эскалаций.
  • Анализировать производительность сервисов, использование ресурсов и риски, связанные с нехваткой мощностей.
  • Автоматизировать диагностику, реагирование на инциденты и операционные процессы.

Требования:

  • Опыт работы в роли SRE/Reliability Engineer.
  • Практический опыт расследования инцидентов в продакшене и проведения анализа первопричин.
  • Глубокое понимание принципов мониторинга, алертинга и наблюдаемости.
  • Опыт работы с метриками, логами и системами распределённой трассировки.
  • Знание концепций SLA, SLI, SLO и бюджетов ошибок.
  • Опыт создания и поддержки операционной документации и runbook’ов.
  • Сильные аналитические навыки и умение доводить расследования до конкретных практических результатов.
  • Понимание принципов работы распределённых и высоконагруженных систем.
  • Опыт автоматизации операционных и повторяющихся задач.

Будет плюсом:

  • Сертификация CKA (Certified Kubernetes Administrator) и/или CKAD (Certified Kubernetes Application Developer).
  • Опыт работы с Prometheus, Grafana, OpenTelemetry или аналогичными платформами наблюдаемости.
  • Опыт внедрения практик надёжности в инженерных организациях.
  • Опыт работы с процессами управления инцидентами и проблемами.
  • Понимание концепции Google Four Golden Signals.

Мы готовы предложить:

  • Гибридный формат работы.
  • Помощь с релокацией в Грузию.
  • Возможность работать с масштабными высоконагруженными системами, которыми пользуются миллионы пользователей по всему миру.
  • Возможности профессионального развития в области reliability engineering и эксплуатации продакшен-систем.
  • Конкурентная зарплата, оформление по ТК Грузии.
  • ДМС, компенсация больничного 100%.
  • Гибкий график и сбалансированная нагрузка.
  • Компенсация питания, кофе и снеки в офисе.
  • Командные мероприятия, корпоративы, спорт и тимбилдинги за счёт компании.
2 500 000
одновременных клиентских сессий
Сотни серверов в 20+ дата-центрах
21
локальная версия
Более 100 миллионов активных пользователей

Наши технологии используют более 60 000 компаний по всему миру.

Среди них – Investing.com, SeekingAlpha, Лента, Тинькофф, Чикагская и Бразильская биржи.

* по данным SimilarWeb

Ключевые навыки

  • Kubernetes
  • Ansible
  • Terraform
  • Bash
  • Python
  • Linux
  • DevOps

Задайте вопрос работодателю

Он получит его с откликом на вакансию

Где предстоит работать

Тбилиси, улица Жиули Шартава, 31/33
Вакансия опубликована 1 сентября 2026 в Тбилиси