Вакансия из официального источника
DevOps-инженер платформы запуска моделей
Cloud.ru · Место работы уточняется у работодателя
Описание вакансии
ОБЯЗАННОСТИ
- участвовать в проектировании, развертывании и сопровождении сервисов платформы запуска моделей;
- развивать и эксплуатировать Kubernetes-кластеры и базовые платформенные компоненты;
- оценивать возможность применения готовых коммерческих и Open Source-решений;
- формировать DevOps-подходы, выбирать инструменты и автоматизировать типовые операции;
- разрабатывать и внедрять CI/CD-процессы для сборки, тестирования и развертывания сервисов;
- интегрировать платформу с GitLab, реестрами образов, системами управления секретами и другими внутренними сервисами;
- настраивать мониторинг, логирование, трассировку, алертинг и дашборды;
- определять SLI/SLO сервисов и участвовать в повышении надежности платформы;
- находить и устранять причины инцидентов, производительных деградаций и нестабильности;
- проектировать высокодоступные решения, сценарии обновления, отката и аварийного восстановления;
- автоматизировать проверку инфраструктурного кода, конфигураций и релизов;
- адаптировать платформенные компоненты для поставки и эксплуатации в on-premise и изолированных средах;
- готовить эксплуатационную документацию, runbook-сценарии и инструкции по диагностике;
- согласовывать архитектурные и эксплуатационные решения с разработчиками, SRE, информационной безопасностью и командой частных инсталляций.
ТРЕБОВАНИЯ
- глубокое знание Kubernetes и опыт эксплуатации production-кластеров;
- хорошее понимание сетевой модели OSI, стека TCP/IP, DNS, балансировки и сетевого взаимодействия в Kubernetes;
- опыт администрирования Unix-подобных операционных систем;
- опыт автоматизации с использованием Bash и Python или Go;
- понимание HTTP/HTTPS и опыт настройки web/reverse proxy-серверов;
- практический опыт проектирования и внедрения CI/CD; - уверенное владение GitLab CI/CD или аналогичными инструментами;
- опыт автоматизации инфраструктуры с помощью Ansible, Terraform и Helm;
- опыт настройки систем мониторинга и логирования, например Prometheus, Grafana, Alertmanager, Loki или OpenSearch;
- опыт работы с системами управления секретами, например HashiCorp Vault;
- уверенное владение Git;
- понимание принципов высокой доступности, отказоустойчивости и disaster recovery;
-
умение диагностировать проблемы распределенных систем на уровне приложения, Kubernetes, ОС и сети.
Дополнительно:
- опыт построения или эксплуатации GPU/HPC-кластеров;
- знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;
- опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;
- опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;
- опыт работы с OpenStack, KVM, VMware или аналогичными платформами;
- опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;
- понимание профиля нагрузки LLM inference и обучения моделей.
Откликнуться на сайте компании
Источник: официальный сайт Cloud.ru. Актуальность проверена 25.09.2026 13:51 (Екатеринбург).
