9946 вакансий из первоисточников от 62 компании

Свежие вакансии с официальных сайтов компаний. Полные описания и прямой отклик работодателю.

В выдаче: 9946 вакансий 62 компании

Загружаем каталог...

Вакансия из официального источника

Руководитель команды CUDA-инференса в Автономный транспорт

Яндекс · Санкт-Петербург, Москва

Описание вакансии

Мы ускоряем инференс нейронных сетей для задач автономного вождения — моделей восприятия сцены и планирования, которые работают непосредственно на бортовом железе автомобиля. ML-команды отвечают за обучение и качество моделей. Наша задача — обеспечить эффективное выполнение моделей на целевых платформах с минимальной потерей точности.

Основной стек: PyTorch → ONNX → TensorRT, а также внутренняя инфраструктура профилирования, экспериментов и performance-аналитики. Фокус направления — то, как именно выполняются вычисления на GPU и других ускорителях, и достижение измеримого ускорения в end-to-end сценариях. Роль предполагает руководство направлением низкоуровневой оптимизации инференса, формирование технического вектора команды и участие в ключевых performance-решениях.

Какие задачи вас ждут

Руководство командой CUDA-оптимизации инференса

People management, формирование технических планов и приоритетов, контроль исполнения проектов и ответственность за достижение измеримых результатов по latency, throughput и эффективности использования памяти на целевом железе.

Проектирование и оптимизация вычислительных ядер

Разработка и оптимизация CUDA-kernel и fusion операций для ключевых блоков моделей (matmul, conv, attention и др.), снижая memory traffic и launch overhead. Стремление к устойчивому ускорению в end-to-end сценариях.

Работа с архитектурой GPU

Эффективное использование memory hierarchy, layout данных, tiling-подходы, tensor cores и механизмы повышения occupancy. Системный анализ bottleneck с помощью Nsight и других профилировщиков и формирование вариантов оптимизаций с учётом ограничений железа.

Больше о разработке в Яндексе — в канале Yandex for Developers

Мы ждём, что вы

- Имеете сильный опыт CUDA performance engineering

- Работали с kernel для matmul/conv/attention

- Хорошо знаете C++

- Понимаете memory hierarchy GPU и cost model вычислительных операций

- Умеете находить bottleneck через профилирование и доводить оптимизации до измеримого ускорения

- Способны на техническое лидерство или управление командой

- Умеете аргументировать performance-решения и работать в кросс-командной среде

Будет плюсом, если вы

- Работали с CUTLASS / Triton / кастомными inference-движками

- Оптимизировали модели под конкретные GPU-архитектуры

- Работали с quantization / mixed precision

- Строили roofline-модели или latency/bandwidth-оценки

- Знаете о fusion-подходах и graph-level оптимизациях

Узнать больше

-

Автономный транспорт

-

Офисы в Санкт-Петербурге

-

Офисы в Москве

-

Как мы нанимаем hardware-инженеров

Откликнуться на сайте компании

Источник: официальный сайт Яндекс. Актуальность проверена 14.09.2026 13:31 (Екатеринбург).