Вакансия из официального источника
Tech Lead SRE в Яндекс ID
Яндекс · Москва
Описание вакансии
Система ID построена на нескольких критически важных инфраструктурных компонентах — среди них Паспорт, Blackbox, TVM и прокси. Уровень надёжности таких систем должен быть очень высоким: мы стремимся довести доступность до 99,99–99,999% там, где это возможно технически. А в тех случаях, когда это неосуществимо, — разобраться в фундаментальных ограничениях и сделать реальную надёжность как можно выше.
Мы ищем опытного технического лидера. Вместе с CTO Яндекс ID вам предстоит работать над повышением надёжности платформы. Роль сочетает в себе глубокую инженерную работу, практику SRE и задачи технического лидерства. Вам нужно будет участвовать в формировании архитектуры систем, совершенствовать инженерные практики команды и развивать подходы к обеспечению надёжности критичных сервисов ID.
Какие задачи вас ждут
Обеспечение надёжности Паспорта
Вы будете техническим партнёром CTO по вопросам надёжности. Вам предстоит помогать принимать архитектурные решения, выявлять системные риски, разбирать сложные инциденты и оценивать, какие инвестиции в надёжность принесут наибольший эффект. Также вы станете ментором и дополнительным экспертом для команд, которые отвечают за критически важные компоненты ID.
Надёжность компонентов Яндекс ID
Вы будете детально изучать работу Blackbox, TVM, Паспорта и прокси. Вам нужно будет выявить основные причины сбоев и ограничения текущей архитектуры, а затем разработать программу, которая повысит их надёжность. Цель — добиться доступности критичных компонентов на уровне 99,99–99,999% там, где это возможно технически. При этом главное — не просто достичь высоких показателей, а обеспечить реальную надёжность: чтобы система устойчиво работала при сбоях инфраструктуры и зависимостей, позволяла локализовать аварии, продолжала функционировать при частичных отказах и автоматически восстанавливала работу.
Развитие SRE‑подхода
Вы будете вместе с командой развивать подходы к обеспечению надёжности критичных сервисов Яндекс ID: автоматизировать эксплуатационные задачи, улучшать инструменты и процессы, развивать инфраструктурную разработку. Важно помогать команде находить системные решения проблем надёжности, сокращать объём ручной работы и постепенно наращивать инженерные практики и экспертизу внутри службы.
Больше о бэкенде в Яндексе — в канале Yandex for Backend
Мы ждём, что вы
- Работали с SRE-практиками
- Обладаете сильным инженерным бэкграундом и работали с высоконагруженными распределёнными системами
- Глубоко понимаете принципы построения отказоустойчивых систем и умеете находить не только отдельные проблемы, но и системные ограничения надёжности
- Можете самостоятельно погрузиться в большую существующую систему и разобраться в её архитектуре, зависимостях и классах отказов
- Знаете, что такое техническое лидерство, и можете влиять на несколько команд без необходимости напрямую управлять каждым инженером
- Умеете превращать большие и плохо определённые проблемы в конкретную инженерную программу
- Можете одновременно работать на уровне архитектуры системы и погружаться в детали конкретного инцидента или компонента
- Умеете аргументировать технические решения и договариваться с сильными инженерами и руководителями
Будет плюсом, если вы
- Отвечали за надёжность критичных инфраструктурных систем
- Строили системы с требованиями доступности 99,99% и выше
- Работали над разработкой инфраструктурных систем и хорошо пишете код
Узнать больше
-
Яндекс ID
-
Офисы в Москве
-
Как в Яндексе проходят алгоритмические секции собеседований
-
Как мы нанимаем бэкенд-разработчиков
-
Задачи для подготовки к собеседованиям
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 29.09.2026 22:41 (Екатеринбург).
