9575 вакансий из первоисточников от 66 компаний

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9575 вакансий 66 компаний

Загружаем каталог...

Вакансия из официального источника

Аналитик-разработчик в команду LLM-судей для Alice AI

Яндекс · Москва / удалённо

Описание вакансии

Наша команда развивает систему оценки Alice AI LLM — технологии, которая лежит в основе Алисы и других продуктов Яндекса. Нам важно понимать не только фактическую корректность ответов модели, но и то, насколько они полезны, естественны, уместно проявляют инициативу и учитывают контекст пользователя. Для оценки таких свойств мы создаём LLM-судей — модели, которые воспроизводят человеческие критерии качества.

Наши LLM-судьи уже используются для сбора обучающих данных и валидационных сравнений моделей. Сейчас мы строим единую систему их разработки и поддержки: следим за качеством существующих метрик, улучшаем их и добавляем новые аспекты оценки.

Почему у нас классно:

- LLM-as-a-Judge — быстро развивающаяся область, в которой пока нет общепринятых решений и много пространства для собственных идей

- Можно работать с самыми современными внутренними и внешними LLM, экспериментировать с разными схемами и ансамблями моделей

- Вам предстоит читать свежие исследования, воспроизводить интересные подходы и проверять их на реальных задачах

- Результаты работы напрямую влияют на развитие Alice AI: по нашим метрикам принимают эксперименты, а размеченные LLM-судьями данные используются для обучения моделей

- Здесь сочетаются исследования, анализ данных и разработка инструментов для регулярного использования

- Мы работаем не только с текстом: LLM-судьи также учитывают изображения и знания о пользователе

Какие задачи вас ждут

Создание и развитие LLM-судей

Вам предстоит проектировать схемы LLM-судей, экспериментировать с моделями и архитектурами, сравнивать подходы и проверять, насколько хорошо они воспроизводят человеческие критерии оценки.

Оценка и мониторинг качества

Вы будете проводить регулярные замеры на новых моделях и типах запросов, находить слабые места и систематические смещения, разбирать регрессии и проверять качество новых версий.

Развитие системы оценки

Вы начнёте добавлять новые аспекты и возможности оценки, превращать экспериментальные решения в воспроизводимые вычислительные графы для других команд.

Работа с исследованиями

Ждём, что вы будете следить за свежими статьями, разбираться в новых подходах к LLM-оценке и проверять их пользу на реальных задачах.

Больше об аналитике в Яндексе — в канале Yandex for Analytics

Мы ждём, что вы

- Уверенно владеете Python и SQL

- Умеете анализировать данные и строить воспроизводимые процессы их обработки

- Знаете теорию вероятностей и математическую статистику

- Умеете проектировать метрики и интерпретировать результаты экспериментов

- Понимаете, как устроены современные LLM, и уже экспериментировали с ними

- Готовы разбираться в задачах, для которых нет готового решения

- Самостоятельны и аккуратны в выводах

Будет плюсом, если вы

- Разрабатывали LLM-судей или другие системы автоматической оценки моделей

- Работали с метриками в NLP

- Проектировали многошаговые LLM-пайплайны

- Работали с агентными или мультимодальными системами

- Свободно читаете технические статьи на английском

Узнать больше

-

Yandex R&D

-

Офисы в Москве

-

Рабочие задачи и этапы найма для аналитиков

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 28.09.2026 16:01 (Екатеринбург).