9726 вакансий из первоисточников от 66 компаний

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9726 вакансий 66 компаний

Загружаем каталог...

Вакансия из официального источника

DevOps-инженер платформы запуска моделей

Cloud.ru · Место работы уточняется у работодателя

Описание вакансии

ОБЯЗАННОСТИ

- участвовать в проектировании, развертывании и сопровождении сервисов платформы запуска моделей;

- развивать и эксплуатировать Kubernetes-кластеры и базовые платформенные компоненты;

- оценивать возможность применения готовых коммерческих и Open Source-решений;

- формировать DevOps-подходы, выбирать инструменты и автоматизировать типовые операции;

- разрабатывать и внедрять CI/CD-процессы для сборки, тестирования и развертывания сервисов;

- интегрировать платформу с GitLab, реестрами образов, системами управления секретами и другими внутренними сервисами;

- настраивать мониторинг, логирование, трассировку, алертинг и дашборды;

- определять SLI/SLO сервисов и участвовать в повышении надежности платформы;

- находить и устранять причины инцидентов, производительных деградаций и нестабильности;

- проектировать высокодоступные решения, сценарии обновления, отката и аварийного восстановления;

- автоматизировать проверку инфраструктурного кода, конфигураций и релизов;

- адаптировать платформенные компоненты для поставки и эксплуатации в on-premise и изолированных средах;

- готовить эксплуатационную документацию, runbook-сценарии и инструкции по диагностике;

- согласовывать архитектурные и эксплуатационные решения с разработчиками, SRE, информационной безопасностью и командой частных инсталляций.

ТРЕБОВАНИЯ

- глубокое знание Kubernetes и опыт эксплуатации production-кластеров;

- хорошее понимание сетевой модели OSI, стека TCP/IP, DNS, балансировки и сетевого взаимодействия в Kubernetes;

- опыт администрирования Unix-подобных операционных систем;

- опыт автоматизации с использованием Bash и Python или Go;

- понимание HTTP/HTTPS и опыт настройки web/reverse proxy-серверов;

- практический опыт проектирования и внедрения CI/CD; - уверенное владение GitLab CI/CD или аналогичными инструментами;

- опыт автоматизации инфраструктуры с помощью Ansible, Terraform и Helm;

- опыт настройки систем мониторинга и логирования, например Prometheus, Grafana, Alertmanager, Loki или OpenSearch;

- опыт работы с системами управления секретами, например HashiCorp Vault;

- уверенное владение Git;

- понимание принципов высокой доступности, отказоустойчивости и disaster recovery;

-

умение диагностировать проблемы распределенных систем на уровне приложения, Kubernetes, ОС и сети.

Дополнительно:

- опыт построения или эксплуатации GPU/HPC-кластеров;

- знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;

- опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;

- опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;

- опыт работы с OpenStack, KVM, VMware или аналогичными платформами;

- опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;

- понимание профиля нагрузки LLM inference и обучения моделей.

Откликнуться на сайте компании

Источник: официальный сайт Cloud.ru. Актуальность проверена 25.09.2026 13:51 (Екатеринбург).