9837 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9837 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Ведущий инженер доступности

VK · Москва / удалённо

Описание вакансии

Мы разрабатываем крупнейший мессенджер в России, чтобы соединять людей, сервисы и компании. Создаём простые и удобные инструменты коммуникации.

Задачи

- Развивать и сопровождать инфраструктуру highload-системы, повышать надёжность, доступность и производительность

- Внедрять и поддерживать SLO/SLI и практики error budget, выстраивать алертинг на основе пользовательских метрик и приоритизации

- Развивать observability (Prometheus/Alertmanager, Grafana, централизованные логи): делать эксплуатационные дашборды, настраивать алерты, снижать alert noise, улучшать MTTD/MTTR

- Автоматизировать рутинные операции и эксплуатационные процессы, снижать toil, развивать self-service подходы для команд разработки

- Участвовать в on-call , оперативно реагировать и устранять инциденты, координировать восстановление, проводить postmortem и доводить улучшения до продакшена

- Взаимодействовать с командами разработки и смежными инфраструктурными командами: участвовать в архитектурных обсуждениях, ревью изменений, согласовании требований к production readiness

- Вести и развивать эксплуатационную документацию : писать и актуализировать runbooks/playbooks для типовых инцидентов и деградаций, инструкции по релизам/роллбэкам и аварийным процедурам (в том числе DR), документировать дашборды/алерты и схемы зависимостей/эскалаций

Требования

- Опыт 5+ лет в SRE/DevOps/Platform/System Engineering, опыт эксплуатации highload -систем

- Глубокие знания Linux : администрирование, диагностика производительности (CPU/mem/io), анализ деградаций, systemd, файловые системы, лимиты/квоты, troubleshooting на production

- Сетевые основы для диагностики : TCP/IP, DNS, HTTP/HTTPS, TLS, L4/L7 балансировка, keepalive; умение находить и устранять сетевые причины деградаций

- Опыт эксплуатации распределённых систем : понимание partial failures, timeouts/retries, backpressure, graceful degradation

- Облака: опыт эксплуатации инфраструктуры в

публичном облаке — сети и балансировщики, autoscaling, IAM/роль‑модель; построение

отказоустойчивости по зонам/регионам, базовые DR-подходы

- Контейнеры и Kubernetes:

понимание контейнеризации и практический опыт работы с Kubernetes на

уровне эксплуатации (деплой, конфигурации, диагностика проблем

приложений/окружения)

- Infrastructure as Code : Terraform (или аналог) + Ansible; Git‑workflow, code review, версионирование инфраструктуры

- CI/CD и управление изменениями : безопасные релизы (canary/blue‑green), rollback стратегии, снижение рисков изменений

- Код и автоматизация: чтение чужого кода (Go/Java/Python) для диагностики;

написание автоматизации (Python/Go/Bash), создание утилит/джоб для

эксплуатации

- Observability: Prometheus/Alertmanager, Grafana,

централизованные логи (Graylog/ELK) — дашборды под эксплуатацию, алерты с учётом

снижения шума и приоритизации

- SRE-практики : SLI/SLO, error budget, incident response, postmortem без поиска виноватых

- Готовность к on-call и участие в разборе и устранении инцидентов

- Навыки создания и поддержки эксплуатационной документации : runbooks/playbooks, инструкции по деплою/роллбэку, схемы архитектуры, описания SLO/алертов; умение писать кратко и так, чтобы документ работал в инциденте

Будет плюсом

- Опыт с БД/кешами/очередями: PostgreSQL/Redis/Cassandra/Kafka/ClickHouse и так далее

- Сопровождение Java: JVM/GC, heap/thread dumps, профилирование, диагностика latency

- Security basics: secrets management, least privilege

Откликнуться на сайте компании

Источник: официальный сайт VK. Актуальность проверена 19.09.2026 13:51 (Екатеринбург).