9857 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9857 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

ML-разработчик в команду алайнмента Alice AI

Яндекс · Удалённая работа по России

Описание вакансии

Мы занимаемся алайнментом Alice AI: учим модель вести диалог, рассуждать, следовать инструкциям и пользоваться поиском и другими инструментами.

Ищем ML-разработчиков в команду алайнмента. Внутри команды есть три направления с общей целью — улучшать качество модели после базового обучения. Конкретное направление выбираем вместе с кандидатом с учётом его опыта и интересов.

Во всех направлениях работа строится как непрерывный цикл: мы формулируем гипотезы, проводим эксперименты, оцениваем изменения в поведении модели и используем выводы в следующей итерации.

Какие задачи вас ждут

RL-алгоритмы и устойчивость обучения

Направление занимается RL-методами для обучения LLM. Мы работаем над ростом качества, стабильностью обучения и инструментами, которые помогают понимать состояние модели во время эксперимента.

Задачи могут быть связаны, например, с новыми способами использовать reward-сигнал, оценивать действия модели или регулировать её обновление. Интересные идеи из исследований проверяем на наших моделях, а работающие решения переносим в основной обучающий контур.

Интеграция моделей и сборка релиза

Разные эксперименты развивают разные способности модели. Это направление отвечает за то, чтобы объединить изменения в одной версии и сохранить их вклад в итоговое качество.

Мы исследуем способы объединения стадий обучения — например, единое обучение, последовательные стадии или On-Policy Distillation. В каждой итерации собираем модель-кандидата, проводим комплексную оценку и уточняем способ интеграции. В рамках направления также поддерживаем актуальный стенд для быстрых экспериментов и приёмки изменений.

Системные промпты и управляемость модели

Системный промпт задаёт поведение модели: например, роль, стиль, формат ответа или порядок работы с инструментами. В этом направлении мы учим модель гибко следовать новым системным инструкциям, сохраняя точность, полезность и остальные важные свойства.

Мы развиваем методы обучения, данные и оценку поведения модели. Для проверки качества используем, например, экспертную разметку, reward-модели и LLM-as-a-Judge. Отдельное внимание уделяем reasoning, tool calling и переносу качества на новые сценарии.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

- Хорошо знаете классический ML и DL

- Понимаете устройство современных LLM и методы их обучения

- Умеете переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и метрики

- Способны интерпретировать результаты и находить причины изменений качества

- Интересуетесь моделями с reasoning и tool calling

Будет плюсом, если вы

- Имеете опыт в одной из близких областей: online RL для LLM, многостадийное обучение, distillation, instruction following, reward modeling или оценка поведения языковых моделей

Узнать больше

-

Yandex R&D

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).