9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Руководитель направления Online RL (STEM) / Post-Training LLM в команду GigaChat

Сбер · г Москва

Описание вакансии

Мы развиваем GigaChat и ищем сильного ML-инженера в команду online RL. Это роль для человека, который умеет доводить исследовательские идеи до работающих решений: проектировать и запускать эксперименты, строить надёжные пайплайны обучения и добиваться реального роста качества модели.

Нам нужен не просто исполнитель задач, а инженер с сильным исследовательским мышлением, который способен самостоятельно разбираться в сложных проблемах, предлагать новые идеи и решения и нести ответственность за результат.

Обязанности

* разрабатывать и улучшать методы online RL

* реализовывать и дорабатывать подходы post-training и online RL

* проектировать и проводить эксперименты: формулировать гипотезы, подбирать конфигурации, анализировать результаты не только на уровне метрик, но и на уровне причин

* разбираться, почему модель стала лучше или хуже, насколько устойчив результат и можно ли его масштабировать на другие домены и типы задач

* следить за state-of-the-art: читать статьи, воспроизводить результаты, адаптировать лучшие подходы под наши задачи и инфраструктуру

* строить и развивать инфраструктуру обучения

* разрабатывать и поддерживать пайплайны online RL: от генерации rollout'ов и сбора reward-сигналов до обновления весов модели

* обеспечивать воспроизводимость экспериментов: версионирование данных, конфигов, чекпоинтов, контроль деградаций

* оптимизировать throughput и эффективность использования GPU: distributed training, параллелизм, профилирование узких мест

* выстраивать связку между моделью, средами исполнения, верификаторами и reward-моделями так, чтобы новые идеи можно было быстро проверять

* работать с данными и системой оценки качества

* участвовать в проектировании и реализации reward-сигналов: rule-based верификаторы, reward-модели, LLM-as-a-judge, execution-based проверки

* строить и улучшать пайплайны подготовки данных: фильтрация, дедупликация, балансировка, контроль утечек

* анализировать ошибки модели, выявлять систематические слабые места и формировать целевые обучающие выборки для их устранения

* тесно взаимодействовать с исследователями, другими инженерами, командами данных и инфраструктуры

* брать на себя ответственность за целые куски системы: от идеи до результата в проде

* делиться знаниями, участвовать в код-ревью, помогать поднимать общую планку качества.

*

Требования

* отличное владение Python и PyTorch

* практический опыт в LLM post-training: RLHF, online RL, DPO или смежных направлениях

* опыт проведения ML-экспериментов от начала до конца: постановка гипотезы → реализация → анализ → выводы

* понимание distributed training: Data Parallel, FSDP, DeepSpeed или аналоги.

* Умение писать чистый, надёжный, production-ready код

* способность разбираться в сложных системах и самостоятельно находить и устранять узкие места.

Условия

* возможность выбрать удобный формат работы: гибрид или офис

* ежегодный пересмотр зарплаты, годовая премия

* корпоративный спортзал и зоны отдыха

* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

* ипотека выгоднее до 7% для каждого сотрудника

* бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

* вознаграждение за рекомендацию друзей в команду Сбера.

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 16.09.2026 14:20 (Екатеринбург).