9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Reinforcement Learning Engineer

Сбер · г Москва

Описание вакансии

В Центре Робототехники Сбера мы строим антропоморфного робота общего назначения. Наш робот вышел из стадии первых демонстраций — и мы переходим к надёжной автономной работе в реальных задачах. Локомоция и управление всем телом (Whole Body Control) — основа этой работы: именно от них зависит, насколько устойчиво и предсказуемо робот движется в реальном мире.

Мы ищем инженера, который разрабатывает, обучает и доводит до робота RL-политики управления всем телом — от постановки задачи в симуляторе до стабильной работы контроллера на железе. Это роль для того, кто хочет видеть результат своих алгоритмов не в метриках на графике, а в том, как робот уверенно идёт, поворачивает и держит равновесие.

Наша команда действительно работает над уникальным проектом в России, а у Вас будет прямой доступ к железу, Вы будете видеть результат своей работы в физическом мире.

**Ключевые технологии:**

Python, PyTorch, RL (PPO/SAC), MuJoCo/Isaac Sim, ONNX, C++, ROS2.

Обязанности

* разрабатывать, обучать и деплоить RL-политики локомоции и whole body control

* подбирать observations, actions и типы моделей, которые дают максимальную производительность

* находить и закрывать ключевые факторы в sim-to-real gap — добиваться, чтобы политика, обученная в симуляторе, работала на реальном роботе

* определять, измерять и интерпретировать метрики качества обученных политик

* доводить control stack до стабильной и предсказуемой работы в реальных условиях

* настраивать reward-функции, domain randomization и curriculum под конкретные двигательные задачи

* работать в связке с командами интеграции и middleware — доводить политику до надежного исполнения на железе.

Требования

* уверенное владение Python; знание C++ как плюс для интеграции на робота

* опыт применения RL-алгоритмов для робототехники или управления (PPO, SAC и подобные)

* понимание динамики и управления, в идеале — шагающих роботов

* опыт подбора гиперпараметров и cost/reward-функций для RL

* знакомство с типовыми техниками RL: domain randomization, curriculum learning, reward shaping

* опыт работы с симуляторами (MuJoCo, Isaac Sim или аналоги)

* способность самостоятельно разбираться в незнакомых системах и находить корневые причины проблем

* желание брать ответственность за то, что политика работает на роботе, а не только в симуляторе.

**Будет плюсом:**

* опыт деплоя обученных политик на реальное железо

* опыт с behavior cloning и дистилляцией политик

* понимание основ теории управления, кинематики и динамики шагающих роботов

* опыт работы с middleware робота (ROS2, DDS)

* опыт использования GigaChat, Kandinsky и аналогов в продуктах, навыки создания и использования AI-агентов.

Условия

* комфортный современный офис г. Москва, МЦК ЗИЛ

* **формат работы - лаборатория робототехники**

* ежегодный пересмотр зарплаты, годовая премия

* корпоративный спортзал и зоны отдыха

* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

* программа адаптации и помощь руководителя на старте (для вакансий уровня Junior)

* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

* подписка Прайм с возможностью совместного использования на трёх близких

* вознаграждение за рекомендацию друзей в команду Сбера.

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 16.09.2026 14:20 (Екатеринбург).