TradingView – это аналитическая платформа и социальная сеть, которую используют миллионы инвесторов и трейдеров из более чем 100 стран. Мы предоставляем доступ к данным со 100+ торговых площадок по всему миру.
#1 Самый популярный сайт в мире в сфере инвестирования*
Мы ищем Reliability Engineer, который поможет повысить надёжность, наблюдаемость и операционную стабильность наших сервисов.
На этой позиции вы будете тесно взаимодействовать с инженерными командами: расследовать инциденты в продакшене, внедрять улучшения, направленные на повышение надёжности, развивать практики мониторинга и наблюдаемости, а также снижать операционные риски на уровне всей платформы.
Задачи:
- Расследовать инциденты в продакшене и сопровождать их до полного устранения всех последствий.
- Проводить анализ первопричин (RCA) и участвовать в разборе инцидентов вместе с инженерными и продуктовыми командами.
- Контролировать выполнение корректирующих действий по итогам инцидентов и постмортемов.
- Развивать и улучшать мониторинг, алертинг и наблюдаемость закреплённых сервисов.
- Определять и поддерживать SLI/SLO, анализировать метрики надёжности и контролировать целевые показатели состояния сервисов.
- Отвечать за соблюдение SLA закреплённых frontend- и backend-сервисов.
- Совместно с инженерными командами и владельцами продуктов определять и внедрять требования к доступности на уровне сервисов.
- Выявлять пробелы в мониторинге и наблюдаемости и внедрять улучшения, сокращающие время обнаружения и устранения проблем.
- Разрабатывать и поддерживать runbook’и, инструкции по диагностике и процедуры восстановления сервисов.
- Участвовать в проверке инцидентов и разборе эскалаций.
- Анализировать производительность сервисов, использование ресурсов и риски, связанные с нехваткой мощностей.
- Автоматизировать диагностику, реагирование на инциденты и операционные процессы.
Требования:
- Опыт работы в роли SRE/Reliability Engineer.
- Практический опыт расследования инцидентов в продакшене и проведения анализа первопричин.
- Глубокое понимание принципов мониторинга, алертинга и наблюдаемости.
- Опыт работы с метриками, логами и системами распределённой трассировки.
- Знание концепций SLA, SLI, SLO и бюджетов ошибок.
- Опыт создания и поддержки операционной документации и runbook’ов.
- Сильные аналитические навыки и умение доводить расследования до конкретных практических результатов.
- Понимание принципов работы распределённых и высоконагруженных систем.
- Опыт автоматизации операционных и повторяющихся задач.
Будет плюсом:
- Сертификация CKA (Certified Kubernetes Administrator) и/или CKAD (Certified Kubernetes Application Developer).
- Опыт работы с Prometheus, Grafana, OpenTelemetry или аналогичными платформами наблюдаемости.
- Опыт внедрения практик надёжности в инженерных организациях.
- Опыт работы с процессами управления инцидентами и проблемами.
- Понимание концепции Google Four Golden Signals.
Мы готовы предложить:
- Гибридный формат работы.
- Помощь с релокацией в Грузию.
- Возможность работать с масштабными высоконагруженными системами, которыми пользуются миллионы пользователей по всему миру.
- Возможности профессионального развития в области reliability engineering и эксплуатации продакшен-систем.
- Конкурентная зарплата, оформление по ТК Грузии.
- ДМС, компенсация больничного 100%.
- Гибкий график и сбалансированная нагрузка.
- Компенсация питания, кофе и снеки в офисе.
- Командные мероприятия, корпоративы, спорт и тимбилдинги за счёт компании.
одновременных клиентских сессий
локальная версия
Наши технологии используют более 60 000 компаний по всему миру.
Среди них – Investing.com, SeekingAlpha, Лента, Тинькофф, Чикагская и Бразильская биржи.
Ключевые навыки
- Kubernetes
- Ansible
- Terraform
- Bash
- Python
- Linux
- DevOps