9398 вакансий из первоисточников от 65 компаний

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9398 вакансий 65 компаний

Загружаем каталог...

Вакансия из официального источника

Site Reliability Engineer(SRE)

Сбер · г Москва / удалённо

Описание вакансии

AI-платформа корпоративного уровня — аналог AI Hub. Реализован чат-интерфейс (аналог ChatGPT) и сценарии сбора аналитики по собственным базам знаний (RAG на базе Qdrant) и по открытым источникам в интернете. В качестве LLM используются современные модели, задействован LLM-шлюз с маршрутизацией запросов.

Проект введён в промышленную эксплуатацию: работают реальные пользователи, нагрузка стабилизирована, требования к доступности согласованы.

**Технологический стек:**

·       PostgreSQL — основное хранилище данных

·       Kubernetes — оркестрация

·       Kafka — обмен событиями

·       Redis — кэширование

·       S3 (совместимое объектное хранилище) — данные и бэкапы

·       Qdrant — векторная база знаний

·       Prometheus + Grafana — мониторинг

·       OpenSearch — логи

Обязанности

### Твои задачи:

* обеспечение доступности и отказоустойчивости платформы в проде: определение и контроль SLO/SLI, дежурства, разбор инцидентов, проведение postmortem

* разработка и сопровождение CI/CD-конвейеров, инфраструктуры как кода (IaC)

* управление Kubernetes: кластеры и версии, admission-контроллеры, network policies, resource limits/requests, HPA, автоскейлинг

* диагностика и оптимизация производительности (CPU / memory / I/O), профилирование нагрузки LLM-инференса

* настройка и развитие наблюдаемости: метрики, логи, трассировки, алертинг, дашборды

* управление секретами и доступом, выполнение требований безопасности

* работа с Kafka, Redis, PostgreSQL и S3: настройка, тюнинг, резервное копирование и восстановление, DR-планы

* участие в архитектурных решениях для новых сервисов платформы.

Требования

### Мы ожидаем, что у тебя есть:

* 3+ года опыта в SRE / DevOps / платформенной инфраструктуре

* глубокий опыт работы с Kubernetes в промышленной эксплуатации

* PostgreSQL: планирование запросов, индексы, репликация, бэкапы и восстановление

* Kafka, Redis, S3-совместимые объектные хранилища

* CI/CD, Linux, Bash

* мониторинг и логирование: Prometheus / Grafana, OpenSearch, алертинг

* понимание принципов SLO / SLI / Error Budgets

* опыт работы с облачной и on-premise инфраструктурой, сетевой уровень, TLS

* опыт создания AI-агентов и использования их в работе будет преимуществом.

**Будет плюсом:**

* опыт эксплуатации ML/LLM-инференса (vLLM, Triton, KServe), понимание нагрузочных профилей GPU

* опыт работы с векторными БД (Qdrant, Milvus, pgvector)

* знание IaC (Terraform, Ansible)

* опыт участия в RAG / AI-платформенных проектах

* навыки написания postmortem и улучшения процессов эксплуатации.

Условия

### Работа в СберТехе - это:

* гибридный формат работы

* годовой бонус и ежегодный пересмотр зарплаты

* статус аккредитованной ИТ-компании

* расширенный ДМС с первого дня и льготное страхование для семьи

* корпоративный университет Сбера, внутренняя образовательная платформа, участие в IT-конференциях

* 90 дней удаленной работы из любого региона РФ

* льготная ипотека в Сбере

* бесплатная подписка СберПрайм, которой можно поделиться с 3 близкими.

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 07.10.2026 20:00 (Екатеринбург).