MLOps Engineer в команду Disrupt

Company: 당근마켓
Location: г Москва
Type:
Posted: Aug 20, 2026
Views: 0

Мы - команда Disrupt в Сбере, часть блока ГенИИ. Отвечаем за все новые воплощения Гиги на рынках и работаем в формате фабрики гипотез: ищем перспективные сценарии, запускаем MVP, масштабируем лучшие продукты.

Ищем ML-инженера, который будет запускать в продакшен и ускорять большие языковые модели на инфраструктуре NVIDIA.* Запускать и поддерживать распределённый инференс LLM на кластере GPU.

  • Тюнить движки (vLLM, SGLang, TensorRT-LLM или аналоги) для максимальной скорости и утилизации железа.
  • Снижать задержки генерации, повышать пропускную способность и эффективно работать с длинным контекстом в MoE-моделях.
  • Применять квантизацию (FP8/INT8), speculative decoding и другие оптимизации без потери качества ответов.
  • Находить узкие места по памяти (VRAM/HBM) и сети (NVLink/InfiniBand), устранять OOM и сбои узлов.
  • Упаковывать сервисы в Kubernetes/Docker, настраивать автоскейлинг, выкаты и откаты.
  • Строить мониторинг метрик вывода (задержки, токены/сек, стоимость за 1М токенов).
  • Проводить нагрузочное тестирование и планировать мощности.* От двух лет опыта в ML Engineering, MLOps или высоконагруженном бэкенде. Обязательно хотя бы один свой GPU-сервис, доведенный до продакшена.
  • Уверенное владение Python и Linux. Знание Docker, Git, CI/CD и базовая работа с Kubernetes.
  • Практический опыт запуска моделей на PyTorch под NVIDIA GPU.
  • Опыт работы минимум с одним production-стеком для инференса (vLLM, Triton, TensorRT-LLM, SGLang, TGI или аналоги).
  • Понимание того, как устроена память GPU, что такое mixed precision, батчинг, KV-кэш и параллелизм моделей.
  • Умение замерять производительность, читать профилировщики (PyTorch Profiler, Nsight, DCGM) и находить баланс между скоростью, качеством ответов и стоимостью вывода.
  • Базовое понимание распределенных систем: таймауты, повторы запросов, отказоустойчивость при падении узла и выкат без простоев.

Будет плюсом:

  • Умение писать CUDA/Triton kernels, работать с NCCL и быстрой связкой узлов (NVLink/InfiniBand, GPUDirect/RDMA).
  • Опыт запуска MoE-моделей с экспертным параллелизмом и очень длинным контекстом.
  • Знакомство с KServe или Ray Serve; сбор метрик через Prometheus/Grafana, GPU Operator или DCGM Exporter.
  • Навыки конвертации весов моделей, проведения quantization-aware evaluation и сравнения разных движков инференса.
  • Базовый C++ или Go для написания быстрых компонентов control/data plane.* комфортный современный офис рядом с м. Кутузовская
  • ежегодный пересмотр зарплаты, годовая премия
  • корпоративный спортзал и зоны отдыха
  • система обучения для профессионального и карьерного развития
  • расширенный полис ДМС с первого дня работы и страхование для семьи
  • льготная программа ипотеки для сотрудников
  • бесплатная подписка СберПрайм+, скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.

About the Company

Name: 당근마켓

당근은 동네의 숨은 가치에 주목합니다. 근처 이웃과의 중고 직거래를 시작으로, 전에 없던 지역 생활 커뮤니티를 만들어 나가고 있어요. 이웃들은 진짜 우리 동네 이야기를 나누고, 가게 사장님들은 이웃의 목소리를 가장 가까이서 들을 수 있지요. 거래부터 모임, 홍보, 결제까지, 로컬에서 일어나는 모든 경험을 당근이 하나로 연결하고 있습니다.

More jobs at 당근마켓