Вакансия из официального источника
Senior инженер-разработчик по надёжности и эксплуатации (SRE-инженер)
2ГИС · Удалённо / удалённо
Описание вакансии
2ГИС — технологическая компания и часть экосистемы Сбера. Нашими сервисами ежедневно пользуются миллионы людей.
Мы активно растём, а ИТ-ландшафт становится всё более масштабным и сложным. Поэтому создаём выделенную SRE-команду — центр экспертизы по надёжности сервисов. Она поможет перейти от реагирования на инциденты к системному управлению доступностью, снизить операционные риски и сделать разработку более предсказуемой.
Ищем инженера, который поможет выстроить процессы и инструменты обеспечения надёжности, будет влиять на стандарты компании и работать в тесной связке с продуктовыми и инфраструктурными командами.
Чем предстоит заниматься
Развивать Incident & Problem Management
- внедрять и развивать единый процесс управления инцидентами;
- формировать культуру postmortem-разборов без поиска виноватых;
- контролировать выполнение action items, направленных на предотвращение повторных сбоев;
- улучшать матрицу эскалаций и устранять неоднозначности в процессе реагирования.
Развивать observability
- стандартизировать внедрение OpenTelemetry: трассировок, метрик и логов;
- участвовать в создании единой платформы мониторинга и визуализации;
- разрабатывать стандарты логирования;
- контролировать объём и качество данных, поступающих в системы телеметрии.
Трансформировать подход к алертингу
- проводить аудит существующих алертов и снижать число ложных срабатываний;
- формировать единые принципы приоритизации алертов с учётом критичности сервисов;
- помогать командам настраивать полезные, своевременные и понятные уведомления.
Внедрять SRE-практики и повышать зрелость команд
- участвовать в классификации сервисов по уровням критичности: MC, BC, BO, OP;
- помогать командам определять и внедрять SLO/SLA;
- создавать дашборды для контроля Error Budget;
- разрабатывать и поддерживать runbooks, которые сокращают время восстановления сервисов;
- консультировать продуктовые команды по вопросам стабильности и надёжности.
Автоматизировать процессы
- формировать требования к развитию платформы дежурств и интеллектуальной эскалации;
- внедрять практики безопасных релизов: canary deployment, автоматический откат изменений и другие подходы к снижению рисков.
Мы ожидаем, что ты
- Работаешь в SRE или DevOps от 3 лет.
- Хорошо понимаешь принципы SRE: SLO, SLA, Error Budget, Incident Management и Observability.
- Имеешь практический опыт работы с системами мониторинга и алертинга — например, Prometheus и Grafana.
- Работал с OpenTelemetry или аналогичными инструментами.
- Автоматизируешь процессы на Python, Go, Bash или другом языке.
- Понимаешь принципы работы on-call-ротаций и систем управления инцидентами.
- Умеешь анализировать метрики производительности, находить первопричины сбоев и предлагать устойчивые решения.
- Знаком с CI/CD, Kubernetes и контейнеризацией.
Будет плюсом, если ты
- Внедрял SRE-практики с нуля или участвовал в их масштабировании в растущей компании.
- Проводил воркшопы, обучал или менторил продуктовые команды по вопросам надёжности.
Что предлагаем
- Возможность стать одним из первых участников нового стратегического направления и напрямую влиять на его развитие.
- Масштабные технические задачи: ты будешь работать над стабильностью сервисов, которыми пользуются миллионы людей.
- Реальное влияние на процессы: поможешь снизить уровень хаоса, сделать реагирование на инциденты и релизы более предсказуемыми.
- Пространство для инженерных решений: команда формируется сейчас, поэтому можно участвовать в выборе подходов, стандартов и инструментов.
- ИТ-акредитацию
- Удаленную работу по РФ или гибрид в городах, где есть офис (Новосибирск, Москва, Санкт-Петербург).
Откликнуться на сайте компании
Источник: официальный сайт 2ГИС. Актуальность проверена 28.09.2026 16:30 (Екатеринбург).
