9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Аналитик качества продуктовых агентских сценариев

Яндекс · Москва / удалённо

Описание вакансии

Наша команда развивает Alice AI LLM — технологию, которая лежит в основе разных продуктов Яндекса. Главный из этих продуктов — чат с Алисой.

Мы фокусируемся на продуктовых агентских сценариях: задачах, где пользователь с помощью Алисы взаимодействует с экосистемой Яндекса. Наша цель — научить базовую модель идеально ориентироваться в этих сценариях, выступая умным и надёжным помощником-агентом (например, чтобы Алиса могла сама заказать продукты в Лавке, выбрать лучший смартфон на Маркете или спланировать сложный отпуск в Путешествиях).

Почему у нас классно:

- Мы учимся решать задачи, которые пока никто не умеет решать. Оценка агентских способностей в реальных продуктах сейчас активно развивается во всём мире, и здесь много пространства для собственных идей

- Alice AI — быстро растущий проект, у нас можно проявить себя и поработать с опытными ML-специалистами

- Можно гонять самые современные модельки Яндекса на мощных GPU-кластерах

- Данные, которые вы собираете, и бенчмарки, которые вы строите, напрямую обеспечивают процесс обучения (в том числе RL) базовой модели

- Наша работа напрямую влияет на то, как миллионы людей будут взаимодействовать с сервисами Яндекса в ближайшем будущем

Какие задачи вас ждут

Создание продуктовых бенчмарков

Наша главная задача — придумать критерии и построить надёжные бенчмарки, на которых можно честно сравнивать разные модели между собой в реальных продуктовых сценариях. Вам предстоит формулировать метрики оценки для задач, где модель взаимодействует с сервисами Яндекса (и не только!), и делать эти метрики стабильными.

Разработка сред для агентов

Вам предстоит много кодить на Python: оборачивать API сервисов (Маркета, Яндекс Еды и других) в виртуальные среды, в которых будут тестироваться, работать и обучаться наши агенты.

Сбор данных и генерация эталонных траекторий для RL

Современные модели учатся через взаимодействие со средой. Вам предстоит формулировать сложные задания и собирать эталонные траектории действий (golden trajectories). Вы будете управлять пайплайнами сбора данных, комбинируя разные подходы: работу с внутренними редакторами, краудсорс и автоматическую разметку через LLM-as-a-judge.

Анализ точек роста и погружение в данные

Всё ещё остаются сложные продуктовые сценарии, с которыми модель пока не справляется. Вы будете находить эти узкие места, разбирать проблемы и адаптировать под них бенчмарки. Для этой задачи крайне важна ваша личная насмотренность в текстах и логах моделей: способность «руками» прочувствовать данные и понять, как максимизировать рост качества.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

Мы ждём, что вы

- Отлично знаете Python: умеете писать сложный, чистый код (это необходимо для создания виртуальных сред)

- Уверенно владеете SQL, любите и умеете анализировать сложные структуры данных с его помощью

- Знаете теорию вероятностей и математическую статистику

- Понимаете, как устроены агентские системы, или участвовали в их построении

- Интересуетесь развитием LLM и хотели бы глубоко погрузиться в эту тему

- Очень самостоятельны и готовы браться за SOTA-задачи, для которых нет готовых решений

Будет плюсом, если вы

- Взаимодействовали в кросс-сервисных командах

- Понимаете, как работает RL (Reinforcement Learning) в контексте языковых моделей

- Работали с метриками в NLP или строили синтетические пайплайны генерации данных

- Свободно читаете на английском

Узнать больше

-

Yandex R&D

-

Офисы в Москве

-

Рабочие задачи и этапы найма для аналитиков

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).