Вакансия из официального источника
DevOps-инженер вычислительной инфраструктуры
Cloud.ru · Место работы уточняется у работодателя
Описание вакансии
ОБЯЗАННОСТИ
- участвовать в проектировании архитектуры вычислительных кластеров для AI-нагрузок;
- автоматизировать подготовку, конфигурацию и жизненный цикл bare-metal-серверов;
- развивать инфраструктуру виртуализации и процессы предоставления виртуальных машин;
- развертывать и сопровождать Kubernetes-кластеры на физических и виртуальных узлах;
- настраивать сетевую связность, сегментацию, маршрутизацию, балансировку и доступ к инфраструктурным сервисам;
- интегрировать GPU и другие ускорители: драйверы, device plugins, операторы и средства мониторинга;
- участвовать в проектировании и эксплуатации хранилищ для весов моделей, датасетов и кешей;
- развивать Infrastructure as Code, GitOps и автоматизированные процессы изменения инфраструктуры;
- создавать CI/CD-процессы для инфраструктурного кода, образов ОС и базовых компонентов кластеров;
- настраивать мониторинг оборудования, сети, ОС, виртуализации, Kubernetes и ускорителей;
- проводить capacity planning, анализировать утилизацию и находить инфраструктурные узкие места;
- проектировать отказоустойчивость, резервирование и восстановление после сбоев;
- стабилизировать платформу, участвовать в расследовании инцидентов и устранять их первопричины;
- готовить типовые инфраструктурные конфигурации для облака и on-premise-инсталляций;
- оценивать и внедрять подходящие Open Source и коммерческие инфраструктурные решения;
- координировать изменения с владельцами дата-центров, сетей, информационной безопасности и продуктовыми командами.
ТРЕБОВАНИЯ
- опыт эксплуатации Linux-инфраструктуры в production; - глубокое понимание модели OSI, TCP/IP, DNS, VLAN, маршрутизации и балансировки;
- опыт работы с bare-metal-серверами и автоматизацией их подготовки;
- опыт эксплуатации одной или нескольких платформ виртуализации;
- уверенное знание Kubernetes и принципов устройства контейнерной инфраструктуры;
- опыт написания скриптов и инструментов автоматизации на Bash, Python или Go;
- опыт применения Ansible и Terraform либо аналогичных средств Infrastructure as Code;
- практический опыт построения CI/CD для инфраструктурных изменений;
- опыт настройки мониторинга оборудования, ОС и сетевых компонентов;
- понимание принципов работы распределенных хранилищ и требований к производительности ввода-вывода;
- опыт работы с Git и code review;
- знание принципов высокой доступности, резервирования и disaster recovery;
-
системный подход к диагностике сложных инфраструктурных проблем.
Дополнительно:
- опыт построения или эксплуатации GPU/HPC-кластеров;
- знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;
- опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;
- опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;
- опыт работы с OpenStack, KVM, VMware или аналогичными платформами;
- опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;
- понимание профиля нагрузки LLM inference и обучения моделей.
Откликнуться на сайте компании
Источник: официальный сайт Cloud.ru. Актуальность проверена 25.09.2026 13:51 (Екатеринбург).
