Вакансия из официального источника
Аналитик-разработчик по оценке качества LLM в Генеративные технологии
Яндекс · Москва
Описание вакансии
Алиса — один из самых популярных ассистентов в России, которым ежедневно пользуются миллионы людей. Наша команда развивает качество ключевой LLM-технологии компании: мы измеряем, как модели отвечают на реальные пользовательские запросы, и на основании этих замеров команда принимает решение о релизе.
Приёмка — момент, когда решается судьба выкатки. Перед каждым релизом нужно понять, как изменилось качество модели: на каких сценариях она выросла, где просела и достаточно ли этого качества для пользователей. Мы измеряем модель по нескольким независимым аспектам силами профессиональных разметчиков, доменных экспертов и автоматических оценщиков, а затем собираем из этих сигналов одно заключение. Заключение приёмки — основание, по которому модель уезжает в прод или не уезжает; решение принимается вместе с ML-разработчиками и продуктовой командой.
Мы расширяем команду. Ищем аналитика, который возьмёт на себя контур замеров: запуск приёмок, контроль прохождения разметки и анализ результатов.
Вы увидите изнутри всю кухню оценки качества LLM — от состава оценочных наборов до критериев, по которым релиз останавливают. Процесс активно автоматизируется: рутина будет уходить, а ваша роль — расти в сторону анализа и методологии. Вы будете работать бок о бок с ML-инженерами качества, доменными экспертами и командой краудсорса.
Какие задачи вас ждут
Организация приёмок новых версий моделей
В ваши обязанности войдёт подготовка оценочных наборов, постановка задач по всем аспектам качества, настройка и запуск пайплайнов оценки.
Приёмки проходят несколько раз в неделю, они идут параллельно и зависят от дат релизов, поэтому очень важно их все контролировать.
Контроль разметки
Замер действует неделю и проходит через несколько команд и пулов. Вам предстоит следить за его статусом, выявлять и устранять сбои, а также отслеживать недоставленные или потерянные данные. Нужно будет разбираться в причинах и доводить модель до работающего результата вместе с командой краудсорса и соседними командами. Это та часть работы, где аккуратность и въедливость дают больше всего.
Сбор и анализ результатов
Вы будете сводить результаты всех аспектов в одну картину: считать значимость, отличать настоящее изменение от шума, объяснять расхождения между аспектами и между людьми и автоматическими оценщиками.
По каждому релизу должно быть заключение с разбором сценариев и конкретными примерами; раз в неделю — сводка по всем замерам для ML-команд и продукта.
Развитие процесса
Параллельно мы автоматизируем приёмку и строим под неё инструменты. Вы будете главным заказчиком и первым пользователем этой автоматизации: приносить требования, обкатывать новое и забирать себе те задачи, которые она освобождает.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Мы ждём, что вы
- Уверенно работаете с Python и SQL
- Знаете математическую статистику и теорию вероятностей
- Доводите до конца многошаговые процессы с внешними зависимостями: чужие пайплайны, пулы разметки, сроки соседних команд
- Умеете формулировать обоснованное заключение по данным и защищать его перед заказчиками
- Самостоятельны и готовы браться за новые задачи, для которых нет готового решения
- Интересуетесь развитием LLM и хотите глубоко погрузиться в тему
Будет плюсом, если вы
- Проводили оценку качества LLM с использованием голден-сетов, LLM-as-a-Judge и контроля разметки
- Работали на стыке офлайн-оценки и онлайн-экспериментов
- Занимались оценкой агентских сценариев и мультимодальных моделей
- Применяли NLP, краудсорсинговые разметки и ML
Узнать больше
-
Yandex R&D
-
Офисы в Москве
-
Рабочие задачи и этапы найма для аналитиков
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 23.09.2026 14:01 (Екатеринбург).
