Вакансия из официального источника
Team Lead в команду ML-инфраструктуры R&D
Яндекс · Место работы уточняется у работодателя
Описание вакансии
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Эти модели используют в Алисе, Поиске, Рекламе и других сервисах Яндекса. Для обучения таких моделей нужны десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снизить риски сбоев.
Чем сложнее система, тем больше точек отказа. Чем больше ресурсов требуется для обучения, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры. Мы должны разбираться и в особенностях аппаратного обеспечения (GPU, сети, шины данных, диски, память), и в нюансах процесса обучения — например, понимать составные части, взаимодействие компонентов и узкие места.
Один из популярных подходов к обучению LLM — обучение с подкреплением (Reinforcement Learning, RL). Метод становится всё более востребованным, вместе с этим усложняются подходы, растёт потребность в вычислительных ресурсах — появляется необходимость строить специализированную инфраструктуру.
Какие задачи вас ждут
Оптимизация инфраструктуры RL-обучения
Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков.
Развитие инструментов диагностики
Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.
Обеспечение отказоустойчивости инфраструктуры
Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям.
Исследование решений
Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты.
Больше об ML в Яндексе — в канале Yandex for ML
Мы ждём, что вы
- Знаете Python и работали в системном программировании, разработке библиотек или фреймворков
- Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed
- Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения
- Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене
- Можете эффективно работать в команде и делиться знаниями
Будет плюсом, если вы
- Участвовали в создании инфраструктуры обучения ML-моделей
- Внедряли и оптимизировали RL-решения
- Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM)
- Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton
- Владеете C++ и работали с низкоуровневым программированием и оптимизацией
Узнать больше
-
Yandex R&D
-
Как в Яндексе проходят алгоритмические секции собеседований
-
Как мы нанимаем бэкенд-разработчиков
-
Задачи для подготовки к собеседованиям
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).
