9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Техлид / старший ML-разработчик в команду качества Alice AI LLM

Яндекс · Удалённая работа по России

Описание вакансии

Наша команда занимается улучшением генеративных моделей Alice AI LLM для пользователей Алисы. Сейчас наша главная цель — сделать LLM-модель Alice AI ещё более умной, человечной и полезной для многомиллионной аудитории пользователей чата с Alice AI . Мы хотим, чтобы модель не только правильно решала задачи, но и общалась естественно: понимала контекст и настроение человека, подстраивалась под его стиль и избегала сухих и шаблонных ответов.

Кроме того, модель должна персонализировать ответы с учётом того, что она знает о пользователе, его интересах и предпочтениях. Для этого мы работаем с передовыми техниками alignment-а, например RL и мультиаспектными reward-функциями, дополняя и развивая LLM-модель новыми свойствами.

В июне 2026 года мы выпустили большое обновление Alice AI : сделали её общение более естественным и человечным, научили подстраиваться под стиль собеседника и персонализировать ответы. Теперь модель может запоминать важные факты из предыдущих диалогов и учитывать их в новых разговорах.

Чтобы делать продукт ещё круче, мы ищем ML-инженера, заинтересованного в прикладной работе с LLM-моделями и техниками RL. Кроме того, в нашей команде много пространства для роста: можно предлагать новые направления, доводить инициативы до продуктового результата и развиваться в сторону технического или командного лидерства.

Почему это круто?

- Вы будете на передовой AI — работать с технологиями, которые определят будущее ИИ

- Реальное влияние — ваши решения увидят и оценят миллионы пользователей

- Сильнейшая команда — коллеги, с которыми можно свернуть горы

- Постоянное развитие — доступ к самым свежим исследованиям и вычислительным ресурсам

Это шанс не просто работать с LLM, а создавать ИИ, который изменит правила игры. Присоединяйтесь!

Какие задачи вас ждут

Исследование подходов RL и борьба с reward hacking

Хороший ответ LLM обладает различными свойствами: полезностью, человечностью, фактологичностью, безопасностью, уместной структурой и другими. Для улучшения каждого из свойств мы используем методы RL, например GRPO, в основе которых лежат reward-модели, обученные оценивать отдельные аспекты ответа. При этом важно находить tradeoff-ы между аспектами и учитывать корреляцию и антикорреляцию разных reward-функций.

Одна из самых интересных задач здесь — борьба с reward hacking. В ходе обучения модель может найти «дешёвую» стратегию повышения reward-а: злоупотреблять определённой структурой, повторять одни и те же обороты или использовать формулировки, которые нравятся reward-модели, но делают ответы менее естественными. Так возникают узнаваемые паттерны, из-за которых разные ответы начинают выглядеть одинаково. Отдельное направление нашей работы — дешаблонизация: поиск таких паттернов, создание диагностик и срезов, улучшение reward-моделей и методов обучения так, чтобы рост метрик действительно означал рост качества.

Развитие человечности модели

Мы хотим, чтобы Alice AI была не просто системой, которая выдаёт правильный текст, а внимательным и естественным собеседником. Модель должна понимать, когда нужен короткий ответ, когда подробное объяснение, а когда — поддержка или участие. Здесь предстоит исследовать человечность как отдельный аспект качества и учить модель адаптироваться к собеседнику, не теряя полезности и точности.

Персонализация

Мы учим модель работать с долгосрочными фактами о пользователе, чтобы общение с Alice AI становилось более личным и последовательным. Здесь есть несколько сложных задач: находить релевантные воспоминания в истории диалогов, использовать их только тогда, когда они действительно помогают ответу, и выбирать, какая информация достаточно важна для сохранения в долгосрочной памяти.

При этом модель не должна запоминать случайный шум или навязчиво упоминать всё, что знает о человеке. Нужно находить баланс между персонализацией, естественностью и полезностью.

Обучение на пользовательском сигнале (RLUF)

Ещё одно направление — RLUF, или Reinforcement Learning from User Feedback. Мы учимся улучшать модель непосредственно по сигналам от пользователей, например отметкам «Нравится» и «Не нравится». Такой сигнал максимально близок к реальному продуктовому качеству, но при этом он шумный и неоднородный: одна и та же оценка может отражать полезность, стиль, фактологическую ошибку или просто несовпадение с ожиданиями конкретного человека.

Здесь предстоит исследовать, как очищать и интерпретировать пользовательский сигнал, превращать его в устойчивый обучающий reward и проверять, что модель становится действительно полезнее и человечнее, а не учится эксплуатировать поверхностные закономерности обратной связи.

Модели с tool calling и reasoning

Мы разрабатываем рассуждающие модели, умеющие делать tool calling в ходе рассуждений. Учим их раскладывать сложную задачу на шаги, выбирать подходящий инструмент, корректно формировать вызовы, анализировать результаты и восстанавливаться после ошибок. Важно научить модель понимать, когда инструмент действительно нужен, а когда лучше ответить самостоятельно, и фокусироваться не просто на генерации убедительного текста, а на достижении результата, которого ожидает пользователь.

Подробнее про Alice AI

Больше об ML в Яндексе — в канале Yandex for ML

Мы ждём, что вы

- Работали с NLP и LLM — понимаете, как устроены современные языковые модели

- Имеете глубокий интерес к прикладным ML-исследованиям и страсть к созданию умных моделей

Будет плюсом, если вы

- Работали с Reinforcement Learning (RL) — знаете, как заставить модели учиться на своих действиях

- Работали с reward-моделями, LLM-агентами и tool calling

Узнать больше

-

Yandex R&D

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).