9922 вакансии из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9922 вакансии 62 компании

Загружаем каталог...

Вакансия из официального источника

Инженер по оценке качества ГенИИ-моделей (GenAI Evaluation Engineer)

Сбер · г Новосибирск, Новосибирская область / удалённо

Описание вакансии

Наша команда отвечает за независимую оценку и контроль качества генеративных моделей Банка.

Наша основная задача оценить флагманские генеративные модели Сбера – GigaChat, Kandinsky, GigaCode и PhysicalAI решений. Мы первыми видим, на что способна новая модель и проводим оценку новых возможностей прежде чем она выйдет к пользователям.

Мы не просто «проверяем метрики», а:

* глубоко разбираемся в подходах команд-разработчиков и в бизнес-процессах, где работают модели

* критически рассматриваем архитектурные и методологические решения и предлагаем улучшения

* разрабатываем собственные проверки, метрики и бенчмарки и фреймворки для их запуска

* проводим оценку логов пользователей для построения наиболее релевантного тестирования

Отдельный фокус – R&D деятельность:

* создание новых методологий оценки качества

* участие в разработке и развитии передовых банковских и российских бенчмарков (MERA, POLLUX и др.)

* адаптация передовых мировых бенчмарков под специфику банковских кейсов

* и многое другое

Эта роль про независимое измерение фундаментального качества модели: не про их обучение – этим занимается отдельная команда.

Обязанности

### **Что предстоит делать**

* придумывать, как вообще измерить модель

ИИ стремительно развивается в мире и выходят новые модели и их виды, однако не всегда любая новая модель стала лучше предыдущей. Вам будет необходимо создать план по её проверке: что именно измерять, на какой выборке, с чем сравнивать, какая разница вообще будет считаться разницей в реальном качестве.

* отвечать за достоверность измерений

Полученные метрики не всегда отражают только лишь качество модели. Нужно уметь отделять реальный прирост качества от прочих факторов: ловить утечки данных в обучение, отличать дефект модели от дефекта замера, промпта или обвязки и проявлять тот же скепсис к собственной методологии: измеряем ли мы то, что заявили.

* разбираться в причинах ошибок

«Модель ошиблась» – это не вывод, а начало работы. Найденная вами причина той или иной проблемы модели превращается в рекомендацию команде разработки, а рекомендация – в следующую версию модели, которая этой ошибки уже не делает.

* строить автоматическую оценку

Разрабатывать LLM- и VLM-судей под конкретные задачи, разрабатывать с нуля собственные или дорабатывать существующие библиотеки валидации полного цикла и следим за фронтиром AI-исследований в области оценки моделей

* строить то, чем пользуются другие

Фреймворки оценки, который вы развиваете – общие для команд по всему Банку. Бенчмарки, которые вы делаете, являются достоверной базой реального качества для разработчиков Банка и вне.

Требования

* умение проводить технический и научный ресерч: находить и критически разбирать актуальные статьи, бенчмарки, модели и реализации; переводить ресерч в конкретные идеи для тестирования и развития внутренних подходов

* статистика и дизайн эксперимента: доверительные интервалы, размер выборки, проверка гипотез, поправки на множественные сравнения

* понимание современных AI-агентов и агентных систем: понимать, чем агент отличается от обычного вызова LLM; знать основные компоненты агентной системы: роли, инструменты, контекст, память и оркестрация

* понимаете, как устроены генеративным модели изнутри: трансформер и механизм внимания, диффузии, токенизация, параметры генерации, этапы обучения

* опыт с генеративными моделями и понимание, как их оценивают: метрики, бенчмарки, human evaluation, Model-as-a-judge и его ограничения

* продуктовое мышление: связывать тестирование с реальными пользовательскими сценариями и понимать, какие ошибки критичны для продукта, понимать влияние результатов на релиз и дальнейшее развитие модели

* Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой

* будет плюсом: R&D-опыт или участие в создании бенчмарков; мультимодальные модели (изображения, видео, аудио); evaluation-фреймворки и harness; RAG; работа с асессорами; coding-агенты (Claude Code, Codex, Cursor); опыт работы с оркестрацией: LangGraph, OpenClaw, навыки вайбкодинга и AI-assisted coding.

Условия

* годовая премия до 6 окладов и регулярный пересмотр зарплат

* гибкий формат удаленной работы на территории г. Новосибирска

* расширенный ДМС, льготное страхование для семьи

* более 400 образовательных программ СберУниверситета

* DS&AI community (600+ специалистов, митапы, мастер-классы)

* корпоративный спортзал

* гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ

* подписка Прайм с возможностью совместного использования на трёх близких.

* реферальная программа для сотрудников: можно пригласить в команду знакомых профессионалов и получить вознаграждение

* современный офис и гибридный формат, спортзал, снэки и кофе.

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 17.09.2026 14:31 (Екатеринбург).