Вакансия из официального источника
ML Engineer / Research Engineer (агентские навыки в претрейне LLM)
Яндекс · Удалённая работа по России
Описание вакансии
Weekend Offer ML 12-13 сентября
Вакансия участвует в серии быстрых наймовых мероприятий. Регистрируйтесь, пройдите все этапы собеседований и получите офер за несколько дней.
Регистрация до 9 сентября.
Зарегистрироваться
Привет! Меня зовут Екатерина Редина, я руковожу командой исследования знаний, которая обучает с нуля базовые модели Alice AI LLM.
У нас вы сможете формировать агентские способности внутри базовой модели, а не только собирать оркестрацию поверх готовой LLM, сможете доводить идеи от небольшого эксперимента до полноценного претрейна, искать решения в области, где у индустрии ещё нет устоявшихся подходов. А также результаты вашей работы войдут в следующие поколения Alice AI LLM и продукты Яндекса. Таким образом, в одной роли соединяются исследования, обучение моделей с нуля и разработка масштабных ML-систем.
Если вам интересно не только собирать агентов из готовых компонентов, но и учить саму модель действовать, создавая новые возможности для реальных продуктов, — приходите к нам.
Екатерина Редина
Руководитель команды исследования знаний
Можно ли научить модель пользоваться калькулятором, если до этого ей триллионы раз показывали, что всё нужно считать самой? Можно — но ценой больших усилий и вычислительных ресурсов. Сначала придётся преодолеть сильный prior, сформированный во время претрейна: «Увидел задачу — сразу сгенерируй ответ». А за пределами знакомых сценариев модель будет снова и снова возвращаться к привычной стратегии — пытаться угадать результат вместо обращения к инструменту. То же самое происходит с кодом, поиском, браузером и другими инструментами, которым пользователи хотят поручать всё больше работы.
Мы закладываем другой фундамент: уже во время претрейна учим модель понимать границы собственных знаний, обращаться к внешней среде и учитывать полученный результат. На масштабе триллионов токенов формируется не навык работы с конкретным API, а общий подход: ответ не всегда нужно угадывать — часто для него нужно совершить действие.
Для продукта разница принципиальна. Пользователю нужен не собеседник, который правдоподобно расскажет, как решить задачу, а агент, который действительно её решит: найдёт актуальную информацию, проверит расчёты, напишет и запустит код или выполнит действие в сервисе. Одна способность, заложенная в базовую модель, масштабируется на Алису и другие продукты Яндекса с миллионами пользователей.
Агентские возможности уже стали частью гонки претрейнов. Например, команды Kimi и Qwen целенаправленно развивают их в своих базовых моделях. Наша задача — определить, какие данные, среды и методы обучения позволят Alice AI LLM сделать следующий шаг.
Какие задачи вас ждут
Данные для будущих агентов
Главный исследовательский вопрос — какой опыт должна получить базовая модель, чтобы уверенно справляться не только со знакомыми сценариями, но и с новыми задачами и инструментами.
Предстоит:
- создавать траектории взаимодействия с цифровой средой;
- работать с search-, CRUD-, SWE-, computer-use- и другими многошаговыми сценариями;
- включать в датасеты как успешные решения, так и ошибки с последующим исправлением;
- находить форматы данных, которые развивают способность к обобщению;
- изучать, как результат меняется с размером модели и объёмом обучения.
Готовых рецептов здесь почти нет. Нужно будет предлагать свои гипотезы и проверять их в реальном обучении LLM.
Интерактивные среды
Для обучения и объективной оценки нужны среды, где агент может совершать действия, видеть их последствия и получать обратную связь.
Вы будете:
- создавать автоматически проверяемые задачи и масштабировать их до больших объёмов;
- воспроизводить взаимодействие с сайтами, API, кодом и приложениями;
- регулировать сложность и разнообразие сценариев;
- развивать инфраструктуру для параллельного запуска множества агентов;
- проверять, переносятся ли результаты из симуляций в реальные условия.
Генерация синтетики
Реальных траекторий недостаточно, поэтому большую часть обучающего материала приходится создавать автоматически. Вам предстоит строить системы, в которых агенты:
- придумывают новые задания и сценарии;
- решают их и проверяют друг друга;
- взаимодействуют через self-play и мультиагентные пайплайны;
- находят ошибки и улучшают неудачные траектории;
- выбирают наиболее ценные примеры для следующего цикла обучения.
Отдельный вызов — сохранить разнообразие и качество синтетики, не позволив ошибкам и шаблонам накапливаться от поколения к поколению.
Эксперименты и оценка
Высокий результат на одном бенчмарке ещё не делает LLM хорошим агентом. Нам важно понимать, действительно ли она стала надёжнее в реальных сценариях. Мы оцениваем:
- успешность в длинных многошаговых задачах;
- устойчивость к ошибкам и неожиданным изменениям;
- умение выбирать и сочетать инструменты;
- обобщение на незнакомые условия;
- зависимость результата от состава корпуса, размера LLM и вычислительного бюджета.
Вы пройдёте весь экспериментальный цикл: подготовите выборку, проведёте быстрые запуски на небольшом масштабе, разберёте результаты и перенесёте лучшие решения в претрейн крупных моделей.
Мы ждём, что вы
- Уверенно пишете на Python
- Работали с ML, NLP, LLM или другими направлениями deep learning
- Понимаете, как устроены и обучаются трансформеры
- Умеете превращать идею в проверяемую гипотезу и корректный эксперимент
- Не ограничиваетесь метриками, а ищете причины полученного результата
- Способны довести исследовательский прототип до работающей системы
- Следите за исследованиями и умеете оценивать, какие идеи стоит проверять на практике
Особенно пригодится опыт в одном или нескольких направлениях:
- AI agents и tool use
- претрейн или посттрейн LLM
- synthetic data
- reinforcement learning или imitation learning
- SWE-, browser- или computer-use-агенты
- интерактивные среды и симуляторы
- автоматическая проверка решений
- оценка агентских систем
- распределённые ML-пайплайны
Необязательно подходить по всем пунктам. Нам важнее сильная база, исследовательское мышление и готовность разбираться в новых задачах.
Узнать больше
-
Yandex R&D
Откликнуться на сайте компании
Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).
