9857 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9857 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

NLP-разработчик в команду качества претрейна Alice LLM

Яндекс · Удалённая работа по России

Описание вакансии

Привет! Меня зовут Дмитрий Лунин, я руковожу командой данных, которая отвечает за претрейн LLM в Алисе. Претрейн — это самый масштабный этап обучения LLM, именно на нём закладывается фундамент возможностей модели. Конечный продукт нашей команды — мультимодальные претрейн-модели, которые после этапа элайнмента становятся основой для Alice AI, а также используются в 25+ других сервисах Яндекса. Если вам интересно узнать подробнее про вызовы, которые есть на этапе претрейна сейчас, — буду рад познакомиться.

Дмитрий Лунин

Руководитель команды данных

Наша цель — создавать модели, которые смогут конкурировать с лучшими LLM на рынке, такими как Claude или Gemini. Нам необходимо поддерживать превосходство над моделями, доступными на рынке РФ, и добиваться паритета с лучшими моделями на запросах, распространённых среди наших пользователей. Таким образом мы предоставляем российским пользователям доступ к LLM хорошего качества. Вместе с этим стремимся к тому, чтобы по ключевым направлениям стать лучшими в мире, добиться в них уровня SOTA.

Приблизительно раз в полгода у нас происходят запуски релизных обучений, результаты которых используются в Алисе, а раз в один-два месяца — большие обучения, сопоставимые с ними по размеру или длине обучения. Конечным результатом вашей работы станет изменение корпуса данных или процесса обучения в таких запусках, которое позволит нам улучшить один или несколько срезов, то есть направлений развития наших LLM. Например, срезами могут быть код, математика, юриспруденция, медицина, физика, инженерия и многие другие направления.

Сейчас наша основная цель — научить модель решать сложные задачи, которые требуют ризонинга или агентских сценариев. Мы много работаем над кодовыми срезами: нам удалось добиться хороших результатов в олимпиадном коде, и их нужно масштабировать и на промышленное программирование. Также работаем над STEM и смежными дисциплинами: здесь мы учим модель решать разнообразные научные и технические задачи университетского и PhD-уровня. В первые месяцы работы вам предстоит подключиться к одному из этих двух больших направлений.

Какие задачи вас ждут

Сбор данных

Один из способов сбора датасета — найти хорошие источники данных и путём их обработки и фильтрации составить качественный датасет. Яндекс — это поисковая компания, и у нас, как правило, есть готовые инструменты для скачивания и обхода веб-страниц. В таком подходе основная часть работы состоит в том, чтобы придумать, как из большого массива данных выделить именно то, что нужно для решения задачи.

Генерация синтетических данных

Сейчас для нас это основной способ получения сложных датасетов — например, для кода или математики. В этом подходе важно найти способ составления большого количества разнообразных интересных задач, а затем — разработать эффективный пайплайн их решения при помощи LLM. Иногда для этого нужно обучить специализированную модель для решения тех или иных задач.

Разработка экспериментальных сетапов

В работе над претрейном важно правильно выбрать схему проведения экспериментов — так, чтобы их результаты отражали картину на больших обучениях. Поэтому нужно работать над подбором параметров сетапа, исследовать scaling laws, взаимодействовать с аналитиками по вопросам составления бенчмарков.

Работа над релизными обучениями

Здесь бывает нужно выбрать правильную схему, этапы обучения и его параметры. Есть также ряд задач, связанных с автоматизацией процесса постановки релизов и их контролем.

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

- Хорошо знаете Python — для разработки мы применяем в первую очередь его. Будет плюсом знание C++: некоторые инструменты в Яндексе написаны на нём

- Хорошо ориентируетесь в ML, можете применять научный подход к постановке экспериментов и интерпретации результатов

- Хорошо понимаете устройство LLM, ориентируетесь в процессе обучения, прочитали техрепорты ключевых опенсорс-моделей, таких как DeepSeek и Qwen

- Применяли LLM для решения каких-либо задач, понимаете, как собрать пайплайн на основе LLM для решения той или иной практической задачи

Мы понимаем, что на рынке совсем немного компаний, в которых можно заниматься полномасштабными обучениями LLM, поэтому не требуем такого опыта. Тем не менее будет плюсом коммерческий опыт обучения, файнтюнинга, или алайна LLM.

Узнать больше

-

Yandex R&D

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).