9955 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9955 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

LlmOps

Cloud.ru · Удалённая работа по России

Описание вакансии

ОБЯЗАННОСТИ

- Готовить LLM и другие генеративные модели к промышленному запуску;

- Выбирать inference-движок с учетом архитектуры модели, оборудования и требований продукта;

- Создавать воспроизводимые контейнерные образы и конфигурации model serving;

- Настраивать tensor parallelism, pipeline parallelism, batching, KV cache, длину контекста и управление памятью;

- Подбирать методы квантизации и оптимизации с контролем влияния на качество модели;

- Определять оптимальное количество и тип GPU для целевых latency, throughput и нагрузки;

- Проводить профилирование, функциональные и нагрузочные тесты моделей;

- Находить узкие места на уровне модели, inference-движка, CUDA, GPU, сети и хранилища;

- Автоматизировать развертывание, обновление, откат и масштабирование моделей в Kubernetes;

- Настраивать метрики, логи и трассировку model-serving-сервисов;

- Формировать эталонные конфигурации и таблицы производительности поддерживаемых моделей;

- Контролировать потребление GPU, утилизацию памяти и стоимость inference;

- Участвовать в настройке маршрутизации, балансировки и отказоустойчивости сервисов моделей;

- Адаптировать конфигурации моделей для облачной и on-premise-инфраструктуры;

- Оценивать новые модели, inference-фреймворки, методы оптимизации и аппаратные платформы;

- Консультировать продуктовые команды по возможностям, ограничениям и инфраструктурным требованиям моделей;

- Взаимодействовать с командами разработки моделей, DevOps/SRE, Agents Space и частных инсталляций.

ТРЕБОВАНИЯ

- Практический опыт запуска LLM или других крупных генеративных моделей в production либо на высоконагруженных стендах;

- Хорошее понимание архитектуры Transformer и жизненного цикла inference-запроса;

- Опыт работы хотя бы с одним современным inference-движком: vLLM, NVIDIA TensorRT-LLM, Triton Inference Server, Hugging Face TGI или аналогичным;

- Понимание tensor/pipeline parallelism, continuous batching, KV cache и методов управления памятью;

- Знание методов квантизации и их влияния на качество и производительность;

- Практический опыт работы с GPU, CUDA и инструментами диагностики;

- Уверенное владение Python;

- Опыт контейнеризации с Docker и развертывания сервисов в Kubernetes;

- Опыт проведения нагрузочных тестов и анализа latency, throughput, time to first token и inter-token latency;

- Опыт настройки мониторинга и профилирования inference-сервисов;

- Знание Linux, Git и основных принципов CI/CD;

- Умение документировать эксперименты и принимать решения на основании измеримых результатов.

Будет преимуществом

- Опыт работы с NVIDIA GPU Operator, DCGM, MIG, NCCL и multi-node inference;

- Знание PyTorch и Hugging Face Transformers;

- Опыт оптимизации моделей с помощью TensorRT, ONNX или custom kernels;

- Опыт работы с Ray Serve, KServe, Seldon или аналогичными системами;

- Понимание особенностей MoE-моделей, speculative decoding и prefix caching;

- Опыт построения автоматизированного контура оценки качества LLM;

- Опыт эксплуатации моделей в on-premise или изолированных средах;

- Опыт расчета и оптимизации unit-экономики inference.

УСЛОВИЯ

- Оформление в соответствии с трудовым законодательством РФ;

- Конкурентный уровень дохода (оклад + годовой бонус);

- ДМС со стоматологией и возможностью подключения к программе своих детей и родственников;

- Прозрачную систему мотивации, которая позволяет влиять на уровень дохода;

- Работу в команде профессионалов;

- Участие в создании инновационных продуктов;

- Гибкое начало рабочего дня, пятница - сокращенный рабочий день;

- Возможность работать удаленно;

- Офис в центре Москвы;

- Корпоративную мобильную связь;

- Льготную программу ипотечного и потребительского кредитования.

Еще у нас:

- Возможность вертикального и горизонтального роста;

- Бонусные программы от компаний партнеров;

- Возможность получения бонуса за закрытие вакансии по вашей рекомендации;

- Материальная помощь при рождении детей и др. семейных обстоятельствах;

- Обучение в Корпоративном университете за счёт компании;

- Участие в профильных конференциях в качестве спикера или слушателя;

- Корпоративная жизнь: спортивные комьюнити, клубы по интересам (настолки, интеллектуальные игры).

Откликнуться на сайте компании

Источник: официальный сайт Cloud.ru. Актуальность проверена 16.09.2026 13:31 (Екатеринбург).