Вакансия из официального источника
Системный аналитик (ML Inference)
Cloud.ru · Место работы уточняется у работодателя
Описание вакансии
ОБЯЗАННОСТИ
Позиция предполагает сочетание продуктового и системного анализа с технической экспертизой в области ML/LLM-инференса.
Evolution ML Inference — платформа для автоматизированного развёртывания и эксплуатации ML-моделей в облаке, позволяющая запускать модели на GPU-инфраструктуре, управлять их конфигурацией, масштабированием и жизненным циклом.
Работа ориентирована на взаимодействие с кросс-командами, клиентами и разработчиками моделей, с глубоким погружением в то, как устроены развёртывание моделей, GPU-ресурсы, runtime, квоты, биллинг и эксплуатация inference-сервисов.
- Глубокое погружение в продукт и сценарии клиентов: анализ запросов, проработка и оптимизация решений совместно с продуктом и смежными командами (моделирование AS IS / TO BE);
- Управление полным циклом задачи: от сбора требований и постановки разработчикам до выкатки решения в ПРОД;
- Проектирование архитектурных и интеграционных решений: написание дизайн-документов, описание взаимодействия сервисов, создание и согласование спецификаций API (REST/gRPC);
- Проработка жизненного цикла inference-сервиса: создание, конфигурирование, запуск, остановка, изменение конфигурации, масштабирование, обновление и удаление;
- Проработка сценариев вывода новых моделей в каталог: сбор характеристик модели, требований к runtime и ресурсам, параметров запуска и ограничений, необходимых для её развёртывания и эксплуатации;
- Проработка конфигурации inference-сервисов: требования к GPU/CPU/RAM, количеству реплик, параметрам runtime, endpoint и другим параметрам, влияющим на производительность и стоимость;
- Проработка механизмов масштабирования и управления ресурсами: требования к autoscaling, лимитам, квотам, concurrency, RPS и другим ограничениям на использование inference-сервисов;
- Проработка учёта потребления и тарификации: требования к учёту использования GPU/CPU/RAM и других ресурсов, анализ корректности расчёта потребления и взаимодействия с биллинговыми системами;
- Анализ производительности и эксплуатационных характеристик моделей: latency, throughput, cold start, GPU utilization, потребление памяти и другие параметры, влияющие на качество работы и стоимость inference-сервисов;
- Анализ инцидентов и событий в кластере: разбор логов, метрик и событий Kubernetes, диагностика проблем с запуском, доступностью, масштабированием и производительностью inference-сервисов;
- Визуализация и документирование: построение процессных, архитектурных и sequence-диаграмм, использование нотаций UML и BPMN, поддержка внутренней документации по сервисам команды;
- Работа со смежными командами (биллинг, IAM, консоль) для построения E2E-сценариев и интеграций, координация зависимостей;
- Анализ данных и верификация гипотез с помощью SQL-запросов к базам данных, разбор инцидентов и обращений клиентов по логам и метрикам.
ТРЕБОВАНИЯ
- Опыт работы в роли Senior System Analyst / Senior Business Analyst с практическим опытом системного анализа, интеграционного проектирования и сопровождения задач полного цикла;
- Сильные коммуникативные навыки: умение работать с большим количеством стейкхолдеров и кросс-функциональных команд, собирать и согласовывать требования, находить компромиссы и аргументированно отстаивать технические решения;
- Опыт сбора, анализа и формализации требований: умение декомпозировать бизнес-потребности до уровня функциональных и нефункциональных требований, системных взаимодействий, API-контрактов и критериев приемки;
- Уверенное владение SQL: опыт написания сложных запросов к БД для самостоятельного анализа данных, проверки гипотез, поиска аномалий и разбора инцидентов;
- Практический опыт работы с API: понимание принципов REST и gRPC, опыт проектирования или интеграции API, работы с API-контрактами и спецификациями, использование Postman или аналогичных инструментов;
- Навыки системного и архитектурного проектирования: умение описывать взаимодействие компонентов, проектировать интеграционные сценарии, готовить дизайн-документы и технические спецификации;
- Навыки моделирования: уверенное владение UML и BPMN, опыт построения sequence-диаграмм, процессных и интеграционных схем, а также документирования технических решений;
- Практический опыт работы с ML/LLM-моделями: понимание основных этапов работы модели в inference-сценарии, способов её развёртывания и ограничений, влияющих на запуск и эксплуатацию;
- Понимание специфики ML/LLM inference: представление о latency, throughput, concurrency, batch size, cold start, GPU utilization, потреблении GPU memory, autoscaling и других параметрах, влияющих на производительность и стоимость inference-сервисов;
- Понимание принципов работы Kubernetes на уровне, достаточном для системного анализа: знание основных сущностей и принципов работы кластера (Pods, Deployments, Services, Ingress, Resources, Namespaces, Events, Logs) и умение использовать эту информацию при анализе работы сервисов и инцидентов;
- Понимание принципов работы GPU-инфраструктуры: базовое представление о GPU/CPU/RAM, GPU memory, ресурсных ограничениях и влиянии конфигурации ресурсов на производительность и стоимость запуска моделей.
- Опыт анализа production-инцидентов: способность самостоятельно исследовать логи, метрики, события и данные, локализовать проблему на уровне взаимодействия сервисов и инфраструктуры и формировать требования на устранение первопричины;
- Понимание принципов облачных платформ: представление о квотах, лимитах, учёте потребления вычислительных ресурсов, тарификации, IAM, управлении доступом и изоляции ресурсов;
- Способность работать с E2E-сценариями и межсервисными зависимостями: понимание того, как изменения в конфигурации модели, runtime, API, инфраструктуре, биллинге или IAM влияют на полный клиентский сценарий запуска и эксплуатации модели;
- Ownership: готовность самостоятельно вести задачу от формирования требований и проектирования решения до координации разработки, приемки и внедрения в PROD;
-
Техническая любознательность и готовность глубоко погружаться в ML/LLM-инфраструктуру, разбираться в новых моделях, runtime, способах развёртывания и ограничениях платформы.
Будет плюсом:
- Опыт работы с ML/LLM inference-платформами, ML serving или MLOps-продуктами;
- Практический опыт работы с Kubernetes и понимание принципов эксплуатации приложений в Kubernetes-кластере;
- Опыт работы с GPU-инфраструктурой и понимание особенностей распределения и потребления GPU-ресурсов;
- Опыт работы с ML serving/runtime-инструментами, например vLLM, Triton Inference Server, TGI, Ollama, KServe, Transformers, Diffusers или аналогичными решениями;
- Опыт работы с Docker и понимание принципов запуска ML-моделей в контейнерах;
- Опыт проектирования или анализа систем autoscaling, resource management, quotas и rate limiting;
- Опыт работы с системами мониторинга и observability: логи, метрики, трассировка, анализ производительности и диагностика распределённых систем;
- Опыт работы с биллингом и metering: учёт потребления вычислительных ресурсов, расчёт стоимости, сверка данных между системами;
- Опыт работы с PostgreSQL, ClickHouse или другими аналитическими БД;
- Опыт работы с Kafka или другими брокерами сообщений и понимание event-driven интеграций;
- Опыт работы с OpenAPI/Swagger, Protobuf/Proto3, Git и инструментами разработки и тестирования API;
- Опыт автоматизации аналитических и операционных процессов с использованием Python или другого языка программирования;
- Опыт работы с облачными платформами и продуктами, связанными с вычислительными ресурсами, контейнерами, ML-моделями или GPU;
- Опыт взаимодействия с командами разработки ML-моделей и инфраструктурными командами, понимание особенностей вывода моделей в production.
УСЛОВИЯ
- Оформление в соответствии с трудовым законодательством РФ;
- Конкурентный уровень дохода (оклад + годовой бонус);
- ДМС со стоматологией и возможностью подключения к программе своих детей и родственников;
- Прозрачную систему мотивации, которая позволяет влиять на уровень дохода;
- Работу в команде профессионалов;
- Участие в создании инновационных продуктов;
- Гибкое начало рабочего дня, пятница - сокращённый рабочий день;
- Возможность работать удаленно;
- Офис в центре Москвы;
- Корпоративную мобильную связь;
- Льготную программу ипотечного и потребительского кредитования.
ЕЩЁ У НАС:
- Возможность вертикального и горизонтального роста;
- Бонусные программы от компаний партнёров;
- Возможность получения бонуса за закрытие вакансии по вашей рекомендации;
- Материальная помощь при рождении детей и др. семейных обстоятельствах;
- Обучение в Корпоративном университете за счёт компании;
- Участие в профильных конференциях в качестве спикера или слушателя;
- Корпоративная жизнь: спортивные комьюнити, клубы по интересам (настолки, интеллектуальные игры).
Откликнуться на сайте компании
Источник: официальный сайт Cloud.ru. Актуальность проверена 09.10.2026 14:01 (Екатеринбург).
