9726 вакансий из первоисточников от 66 компаний

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9726 вакансий 66 компаний

Загружаем каталог...

Вакансия из официального источника

DevOps-инженер вычислительной инфраструктуры

Cloud.ru · Место работы уточняется у работодателя

Описание вакансии

ОБЯЗАННОСТИ

- участвовать в проектировании архитектуры вычислительных кластеров для AI-нагрузок;

- автоматизировать подготовку, конфигурацию и жизненный цикл bare-metal-серверов;

- развивать инфраструктуру виртуализации и процессы предоставления виртуальных машин;

- развертывать и сопровождать Kubernetes-кластеры на физических и виртуальных узлах;

- настраивать сетевую связность, сегментацию, маршрутизацию, балансировку и доступ к инфраструктурным сервисам;

- интегрировать GPU и другие ускорители: драйверы, device plugins, операторы и средства мониторинга;

- участвовать в проектировании и эксплуатации хранилищ для весов моделей, датасетов и кешей;

- развивать Infrastructure as Code, GitOps и автоматизированные процессы изменения инфраструктуры;

- создавать CI/CD-процессы для инфраструктурного кода, образов ОС и базовых компонентов кластеров;

- настраивать мониторинг оборудования, сети, ОС, виртуализации, Kubernetes и ускорителей;

- проводить capacity planning, анализировать утилизацию и находить инфраструктурные узкие места;

- проектировать отказоустойчивость, резервирование и восстановление после сбоев;

- стабилизировать платформу, участвовать в расследовании инцидентов и устранять их первопричины;

- готовить типовые инфраструктурные конфигурации для облака и on-premise-инсталляций;

- оценивать и внедрять подходящие Open Source и коммерческие инфраструктурные решения;

- координировать изменения с владельцами дата-центров, сетей, информационной безопасности и продуктовыми командами.

ТРЕБОВАНИЯ

- опыт эксплуатации Linux-инфраструктуры в production; - глубокое понимание модели OSI, TCP/IP, DNS, VLAN, маршрутизации и балансировки;

- опыт работы с bare-metal-серверами и автоматизацией их подготовки;

- опыт эксплуатации одной или нескольких платформ виртуализации;

- уверенное знание Kubernetes и принципов устройства контейнерной инфраструктуры;

- опыт написания скриптов и инструментов автоматизации на Bash, Python или Go;

- опыт применения Ansible и Terraform либо аналогичных средств Infrastructure as Code;

- практический опыт построения CI/CD для инфраструктурных изменений;

- опыт настройки мониторинга оборудования, ОС и сетевых компонентов;

- понимание принципов работы распределенных хранилищ и требований к производительности ввода-вывода;

- опыт работы с Git и code review;

- знание принципов высокой доступности, резервирования и disaster recovery;

-

системный подход к диагностике сложных инфраструктурных проблем.

Дополнительно:

- опыт построения или эксплуатации GPU/HPC-кластеров;

- знание RDMA, InfiniBand, RoCE или других высокоскоростных сетевых технологий;

- опыт работы с NVIDIA GPU Operator, DCGM, MIG и драйверами ускорителей;

- опыт эксплуатации Ceph, S3-совместимых или параллельных файловых систем;

- опыт работы с OpenStack, KVM, VMware или аналогичными платформами;

- опыт эксплуатации инфраструктуры в изолированных on-premise-контурах;

- понимание профиля нагрузки LLM inference и обучения моделей.

Откликнуться на сайте компании

Источник: официальный сайт Cloud.ru. Актуальность проверена 25.09.2026 13:51 (Екатеринбург).