9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

CV engineer (Gigachat)

Сбер · г Москва / удалённо

Описание вакансии

**GigaChat увидит мир через данные, которые соберёте вы.**

За GigaChat стоит одна из крупнейших ML-команд в России, которая обучает LLM и VLM полным циклом — от претрейна до релиза. Наша команда отвечает за то, с чего начинается любая сильная модель, — за данные: мы собираем визуальный корпус претрейна — ищем источники, фильтруем и дедуплицируем сырьё, ставим эксперименты и меряем влияние на бенчмарки. Именно состав и качество претрейн-данных определяют, каким получится финальный результат, и у вас будет возможность влиять на него напрямую.

Обязанности

* ставить эксперименты: формулировать гипотезы, какие данные и в каких пропорциях улучшат модель, и проверять их: продумывать сетап и бейзлайны, запускать обучающие прогоны, по замерам решать, что попадёт в финальную смесь

* автоматизировать подготовку данных: выстраивать очистку, дедупликацию и валидацию так, чтобы любой новый датасет без ручной доводки приходил в готовый к обучению вид

* добывать редкие и дефицитные домены: обучать классификаторы и кластеризаторы, которые вылавливают ценные сэмплы из сырых данных, и нарезать корпус на чистые датасеты по таксономиям

* собирать данные разных форматов: генерация VQA, синтетические задачи, interleaved-данные — каждый формат устроен по-своему и требует своего подхода

* обрабатывать миллиарды изображений: писать распределённый код, который прогоняет пайплайны на всём корпусе быстро и стабильно

* находить слабые места в данных: разбираться, где модель проседает из-за корпуса — чего не хватает, что зашумлено или разбалансировано, — и исправлять это

* развивать контур оценки: подключать свежие бенчмарки, следить за чистотой методики и не пускать тестовые данные в обучающий корпус

Требования

**Кто нам подходит:**

Человек, который сможет провести данные от поиска источников до состава финальной смеси. Главное — умение ставить эксперименты и делать из них честные выводы. Опыт именно с VLM или LLM не обязателен: специфика осваивается быстрее, чем культура эксперимента

**Что мы хотели бы видеть:**

* хорошая база ML, твёрдое знание CV и NLP

* понимание, как данные влияют на качество модели, и привычка при странностях в метриках первым делом смотреть в данные

* уверенный Python и опыт обучения моделей на PyTorch

* умение спланировать эксперимент и довести его до вывода, которому можно верить

* самостоятельность и проактивность: берёте тему, разбираетесь, доводите до результата

**Плюсом будут:**

* опыт построения дата-пайплайнов и процессов контроля качества данных

* опыт с распределённой обработкой (Spark, Dask, Airflow, YTsaurus)

* опыт проведения ML-экспериментов на больших объёмах

* публикации на профильных конференциях.

Мы открыты к кандидатам разного уровня, и попадать во все пункты не обязательно. Если задачи откликаются — напишите нам, остальное обсудим.

Условия

**Что мы предлагаем:**

* опыт претрейна из первых рук. Команд, обучающих VLM полным циклом, в стране единицы — вы пройдёте весь путь от сырых данных до готовой модели

* вычислительные ресурсы под ваши эксперименты. Один из самых больших GPU-кластеров в России: проверка гипотезы о данных стоит обучающего прогона, и на такие прогоны вычислений у нас хватает

* инфраструктура, которая уже работает. S3, YTsaurus, Airflow, DataLens, GitLab CI, wandb — всё для данных и экспериментов на месте, время уходит на исследования, а не на обвязку

* задачи, на которые ещё нет ответа. Как собрать лучшие визуальные данные для претрейна, пока не знает почти никто в мире — разбираться предстоит в том числе вам

* короткий путь от гипотезы до модели. Данные, которые вы отберёте, и гипотезы, которые подтвердятся, уходят в обучение следующей модели — а ей пользуются миллионы людей

* комфортный современный офис рядом с м. Кутузовская

* возможность выбрать удобный график – офис/гибрид/удаленка (в РФ)

* годовая премия

* корпоративный спортзал и зоны отдыха

* более 400 образовательных программ СберУниверситета для профессионального и карьерного развития

* расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа

* ипотека для сотрудников по дисконтной прогамме

* бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров

* вознаграждение за рекомендацию друзей в команду Сбера.

Откликнуться на сайте компании

Источник: официальный сайт Сбер. Актуальность проверена 16.09.2026 14:20 (Екатеринбург).