Вакансия из официального источника
Лид аналитики в Агентский Поиск
Яндекс · Место работы уточняется у работодателя
Описание вакансии
Привет! Меня зовут Рома. Я отвечаю за офлайн-метрики Поиска в Яндексе. Наши ключевые сервисы — Поиск с Алисой, Картинки, Видео — оценивают полезность и обучают модели с учётом метрик, которые мы разрабатываем на основе LLM вместе с экспертами и редакторами. Присоединяйтесь к нам — вместе создадим Поиск будущего! :)
Роман Бойкий
Руководитель службы офлайн-метрик Поиска
AI-агент не может ограничиться просто списком ссылок. Ему необходимо искать сведения для решения конкретной задачи, проверять источники и собирать информацию для ответа — порой в несколько шагов. Мы совершенствуем поиск, который помогает Алисе отвечать на вопросы в чате и Поиске, а также развиваем Yandex Search API для внешних AI-продуктов.
Вам предстоит работать в небольшой команде аналитиков-разработчиков над аналитическим направлением Агентского Поиска. Нужно будет определять систему оценки качества, выбирать приоритеты исследований и совместно с ML-командами внедрять подтверждённые улучшения в релиз.
Ваша работа будет проходить на стыке трёх направлений: анализа данных, поисковых технологий и языковых моделей. Задачи разнообразны — от разбора ошибок и работы с исследовательским кодом до оценки изменений в продукте вместе с ML-инженерами и разработчиками.
Какие задачи вас ждут
Развитие системы оценки качества
Вам предстоит создавать метрики качества Агентского Поиска — их рост приведёт к улучшению качества ответов Алисы. Нужно будет проверять метрики на экспертных бенчмарках и наладить регулярную оценку качества в продакшене.
Анализ потерь в обработке запросов
Вы будете разбирать сложные запросы и цепочки поисковых действий агента. Ваша задача — выяснить, почему нужная информация не попала в ответ: например, страница отсутствует в поисковой базе, документ потерян при ранжировании или ключевой факт не включён в контекст. На основе анализа нужно предлагать эксперименты и помогать другим командам определять приоритеты.
Исследование методов поиска и ранжирования
Вам нужно будет изучать новые способы отбора документов для AI-агентов, создавать прототипы, сравнивать разные варианты и вместе с командой доводить перспективные решения до релиза.
Баланс контекста
Вы будете оценивать фрагменты документов, которые получает языковая модель, и искать способ сохранить нужные факты, уменьшить объём текста и не исказить смысл.
Улучшение качества Yandex Search API
Вам предстоит сравнивать Yandex Search API с другими поисковыми API — использовать открытые бенчмарки и сценарии команды, чтобы результаты были воспроизводимыми. Нужно выяснять, почему качество отличается, формулировать на этой основе проверяемые гипотезы и оценивать, как можно улучшить внешние AI-продукты. При этом важно учитывать условия эксперимента: используемые модели, доступный контекст, количество поисковых вызовов и время ответа.
Больше об аналитике в Яндексе — в канале Yandex for Analytics
Мы ждём, что вы
- Самостоятельно выстраивали оценку качества ML-системы или продукта
- Уверенно пишете на Python: можете самостоятельно собрать эксперимент, обработать результаты и сделать расчёты воспроизводимыми
- Владеете SQL для получения и анализа данных
- Знаете теорию вероятностей и математическую статистику
- Умеете спланировать эксперимент, оценить неопределённость результата и интерпретировать результаты A/B-теста
- Понимаете основы оценки ML-моделей: зачем разделять данные, как возникают утечки и почему улучшение на тестовой выборке может не повториться в продукте
- Умеете разбираться в задаче без готовой постановки: выделить проблему, сформулировать проверяемую гипотезу, выбрать метрики и реализовать проверку
- Можете объяснить команде выводы и ограничения исследования, предложить следующий шаг и довести работу до решения, даже если первая гипотеза не подтвердилась
Будет плюсом, если вы
- Работали с информационным поиском, ранжированием, семантическим поиском или RAG-системами, которые формируют ответ на основе найденных источников
- Создавали бенчмарки и разметку, анализировали действия AI-агентов или использовали языковые модели для оценки качества с проверкой по человеческим оценкам
- Работали с большими данными и превращали исследовательские прототипы в инструменты, которыми регулярно пользуется команда
- Знакомы с агентными бенчмарками, например BrowseComp или NEEDLE, либо с оценкой полноты и достоверности контекста
Узнать больше
-
Поиск с Алисой AI
-
Как в Яндексе проходят собеседования для аналитиков
-
Рабочие задачи и этапы найма для аналитиков
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 29.09.2026 16:31 (Екатеринбург).
