9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

ML-разработчик в команду гуманоидных роботов

Яндекс · Место работы уточняется у работодателя

Описание вакансии

Команда робототехники занимается всем, что связано с автономными роботами и роботизированными системами: от исследований, прототипирования и разработки первых образцов до интеграции ML-моделей в реальные устройства и подготовки решений к серийному производству.

Мы создаём нейросетевые компоненты для роботов: восприятие, принятие решений, управление поведением, обучение в симуляции и на реальных данных, пайплайны дообучения и инфраструктуру для экспериментов. В команде работают специалисты по machine learning, reinforcement learning, computer vision, vision-language-action-моделям, MLOps и робототехнике.

Сейчас мы ищем ML Engineer, который будет развивать методы post-training и fine-tuning для VLA- и других robot policy. Вам предстоит применять reinforcement learning, imitation learning и recovery-oriented-подходы, чтобы улучшать качество выполнения задач, устойчивость к OOD-состояниям, способность к восстановлению после ошибок и обобщение на реальные робототехнические сценарии.

Это роль для человека, которому интересно работать на границе современных foundation models, RL и робототехники: брать базовую VLA-policy, обученную на демонстрациях, и доводить её до надёжного поведения с помощью offline и online RL, recovery-сценариев и систематических экспериментов.

Какие задачи вас ждут

Разработка post-training-пайплайнов для VLA

Вы будете развивать пайплайны дообучения VLA на данных реальных роботов, симуляции и демонстрациях. В фокусе — повышение success rate, стабильности и обобщающей способности моделей, адаптация к конкретным робототехническим платформам, задачам, сенсорам и интерфейсам управления.

Вам предстоит работать с behavior cloning и его вариантами, представлением действий, мультимодальными входами, temporal context и другими компонентами, которые определяют качество policy на заключительном этапе обучения.

Offline и online reinforcement learning

Вы будете исследовать и внедрять RL-подходы для улучшения VLA-политик после предобучения и supervised fine-tuning. В зоне ответственности — offline RL на логах взаимодействий и демонстрациях, offline-to-online RL, RL fine-tuning и residual RL. Будет уделяться внимание тому, как безопасно использовать данные реальных rollout’ов, строить reward’ы и success-сигналы, улучшать политики без потери исходных навыков и находить баланс между качеством, устойчивостью и sample efficiency.

Обучение на corrective data и recovery trajectories

Вам предстоит развивать ML-часть обучения роботов на их собственных ошибках. Робот может попасть в OOD-состояние, начать неуспешно выполнять навык или потерять уверенность; в таких случаях оператор или другой механизм восстановления формирует корректирующую траекторию. Эти эпизоды становятся данными для следующей итерации обучения. Вы будете работать с подходами уровня DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и dataset aggregation. Основная задача — превращать всё это в улучшение VLA-policy. Сбор данных, teleoperation и операционные процессы находятся на стороне других команд; с вашей стороны — требования к данным, методы обучения, оценка качества и интеграция результатов в training pipeline.

OOD robustness и final-mile quality

Вы будете улучшать качество моделей в сложных, редких и нештатных сценариях: при распределительном сдвиге, изменении условий сцены, ошибках восприятия, накоплении ошибок управления и неполных или шумных наблюдениях. В фокусе — анализ failure modes, OOD robustness, uncertainty-aware и recovery-oriented learning, работа с hard examples и long-tail-данными. Важно строить понятные метрики качества: success rate, recovery rate, intervention rate, устойчивость к возмущениям и безопасность выполнения задач.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

- Уверенно программируете на Python и работали с PyTorch

- Имеете сильную базу в deep learning и reinforcement learning

- Понимаете основные подходы в RL: policy optimization, actor-critic, value learning, off-policy learning и offline RL

- Понимаете, что такое behavior cloning, covariate shift и dataset aggregation

- Умеете ставить эксперименты, проводить абляции, работать с метриками и анализировать причины деградации моделей

- Умеете читать исследовательские статьи и превращать исследовательские идеи в устойчивые ML-пайплайны

Будет плюсом, если вы

- Работали с гуманоидными роботами или другими физическими робототехническими платформами

- Знакомы с DAgger, Human-Gated DAgger, Learning from Human Interventions, corrective demonstrations и recovery learning

- Работали с online RL, offline-to-online RL, safe RL, constrained RL или residual RL

- Знакомы с Isaac Lab, Isaac Sim, MuJoCo, ManiSkill или другими симуляторами

Узнать больше

-

Автономный транспорт

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).