9897 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9897 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Team Lead в команду ML-инфраструктуры R&D

Яндекс · Место работы уточняется у работодателя

Описание вакансии

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Эти модели используют в Алисе, Поиске, Рекламе и других сервисах Яндекса. Для обучения таких моделей нужны десятки тысяч серверов, миллионы вычислительных ядер и многоуровневые соединения между ними. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снизить риски сбоев.

Чем сложнее система, тем больше точек отказа. Чем больше ресурсов требуется для обучения, тем выше накладные расходы на запуск. Наша команда работает на стыке ML-математики и «железной» инфраструктуры. Мы должны разбираться и в особенностях аппаратного обеспечения (GPU, сети, шины данных, диски, память), и в нюансах процесса обучения — например, понимать составные части, взаимодействие компонентов и узкие места.

Один из популярных подходов к обучению LLM — обучение с подкреплением (Reinforcement Learning, RL). Метод становится всё более востребованным, вместе с этим усложняются подходы, растёт потребность в вычислительных ресурсах — появляется необходимость строить специализированную инфраструктуру.

Какие задачи вас ждут

Оптимизация инфраструктуры RL-обучения

Вы будете улучшать ключевые компоненты: оптимизировать доставку и сохранение данных, а также коммуникации между блоками обучения; повышать эффективность работы внутри блоков.

Развитие инструментов диагностики

Вы будете создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.

Обеспечение отказоустойчивости инфраструктуры

Вы будете реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к разным ошибкам и сбоям.

Исследование решений

Вы будете изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать, насколько они эффективны, и внедрять их в реальные проекты.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

- Знаете Python и работали в системном программировании, разработке библиотек или фреймворков

- Умеете работать с фреймворком PyTorch и распределённым обучением через torch.distributed

- Владеете подходами параллелизации: понимаете Data Parallelism, Tensor Parallelism, Pipeline Parallelism, Expert Parallelism для распределённого инференса или обучения

- Интересуетесь LLM и MLOps: понимаете задачи и вызовы, которые связаны с эксплуатацией больших моделей в продакшене

- Можете эффективно работать в команде и делиться знаниями

Будет плюсом, если вы

- Участвовали в создании инфраструктуры обучения ML-моделей

- Внедряли и оптимизировали RL-решения

- Использовали библиотеки RL-обучения для LLM (veRL, slime, NeMo-RL, SkyRL) и библиотеки инференса (vLLM, SGLang и TRT-LLM)

- Работали с GPU NVIDIA: понимаете архитектуру GPU, разрабатывали или оптимизировали алгоритмы с использованием CUDA или Triton

- Владеете C++ и работали с низкоуровневым программированием и оптимизацией

Узнать больше

-

Yandex R&D

-

Как в Яндексе проходят алгоритмические секции собеседований

-

Как мы нанимаем бэкенд-разработчиков

-

Задачи для подготовки к собеседованиям

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).