Вакансия из официального источника
Site Reliability Engineer(SRE)
Сбер · г Москва / удалённо
Описание вакансии
AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.
Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.
**Технологический стек:**
· PostgreSQL — основное хранилище данных
· Kubernetes — оркестрация
· Kafka — обмен событиями
· Redis — кэширование
· S3 (совместимое объектное хранилище) — данные и бэкапы
· Qdrant — векторная база знаний
· Prometheus + Grafana — мониторинг
· OpenSearch — логи
Обязанности
### Твои задачи:
* обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem
* разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)
* управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг
* диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса
* настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды
* управление секретами и доступом, выполнение требований безопасности
* работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы
* участие в архитектурных решениях для новых сервисов платформы.
Требования
### Мы ожидаем, что у тебя есть:
* 3+ года опыта в SRE / DevOps / платформенной инфраструктуре
* глубокий опыт работы с Kubernetes в промышленной эксплуатации
* PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление
* Kafka, Redis, S3-совместимые объектные хранилища
* CI/CD, Linux, Bash
* мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг
* понимание принципов SLO / SLI / Error Budgets
* опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS
* опыт создания AI-агентов и использования их в работе будет преимуществом.
**Будет плюсом:**
* опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU
* опыт работы с векторными БД (Qdrant, Milvus, pgvector)
* знание IaC (Terraform, Ansible)
* опыт участия в RAG / AI-платформенных проектах
* навыки написания postmortem и улучшения процессов эксплуатации.
Условия
### Работа в СберТехе - это:
* гибридный формат работы
* годовой бонус и ежегодный пересмотр зарплаты
* статус аккредитованной ИТ-компании
* расширенный ДМС с первого дня и льготное страхование для семьи
* корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях
* 90 дней удаленной работы из любого региона РФ
* льготная ипотека в Сбере
* бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.
Откликнуться на сайте компании
Источник: официальный сайт Сбер. Актуальность проверена 07.10.2026 20:00 (Екатеринбург).
