Вакансия из официального источника
Аналитик-разработчик в команду LLM-судей для Alice AI
Яндекс · Москва / удалённо
Описание вакансии
Наша команда развивает систему оценки Alice AI LLM — технологии, которая лежит в основе Алисы и других продуктов Яндекса. Нам важно понимать не только фактическую корректность ответов модели, но и то, насколько они полезны, естественны, уместно проявляют инициативу и учитывают контекст пользователя. Для оценки таких свойств мы создаём LLM-судей — модели, которые воспроизводят человеческие критерии качества.
Наши LLM-судьи уже используются для сбора обучающих данных и валидационных сравнений моделей. Сейчас мы строим единую систему их разработки и поддержки: следим за качеством существующих метрик, улучшаем их и добавляем новые аспекты оценки.
Почему у нас классно:
- LLM-as-a-Judge — быстро развивающаяся область, в которой пока нет общепринятых решений и много пространства для собственных идей
- Можно работать с самыми современными внутренними и внешними LLM, экспериментировать с разными схемами и ансамблями моделей
- Вам предстоит читать свежие исследования, воспроизводить интересные подходы и проверять их на реальных задачах
- Результаты работы напрямую влияют на развитие Alice AI: по нашим метрикам принимают эксперименты, а размеченные LLM-судьями данные используются для обучения моделей
- Здесь сочетаются исследования, анализ данных и разработка инструментов для регулярного использования
- Мы работаем не только с текстом: LLM-судьи также учитывают изображения и знания о пользователе
Какие задачи вас ждут
Создание и развитие LLM-судей
Вам предстоит проектировать схемы LLM-судей, экспериментировать с моделями и архитектурами, сравнивать подходы и проверять, насколько хорошо они воспроизводят человеческие критерии оценки.
Оценка и мониторинг качества
Вы будете проводить регулярные замеры на новых моделях и типах запросов, находить слабые места и систематические смещения, разбирать регрессии и проверять качество новых версий.
Развитие системы оценки
Вы начнёте добавлять новые аспекты и возможности оценки, превращать экспериментальные решения в воспроизводимые вычислительные графы для других команд.
Работа с исследованиями
Ждём, что вы будете следить за свежими статьями, разбираться в новых подходах к LLM-оценке и проверять их пользу на реальных задачах.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Мы ждём, что вы
- Уверенно владеете Python и SQL
- Умеете анализировать данные и строить воспроизводимые процессы их обработки
- Знаете теорию вероятностей и математическую статистику
- Умеете проектировать метрики и интерпретировать результаты экспериментов
- Понимаете, как устроены современные LLM, и уже экспериментировали с ними
- Готовы разбираться в задачах, для которых нет готового решения
- Самостоятельны и аккуратны в выводах
Будет плюсом, если вы
- Разрабатывали LLM-судей или другие системы автоматической оценки моделей
- Работали с метриками в NLP
- Проектировали многошаговые LLM-пайплайны
- Работали с агентными или мультимодальными системами
- Свободно читаете технические статьи на английском
Узнать больше
-
Yandex R&D
-
Офисы в Москве
-
Рабочие задачи и этапы найма для аналитиков
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 28.09.2026 16:01 (Екатеринбург).
