Инженер по обеспечению надежности машинного обучения (Senior MLOps)
- Разрабатывать и поддерживать инфраструктуру для экспериментов, обучения и деплоя ML-моделей в batch и online режимах на CPU/GPU
- Автоматизировать жизненный цикл модели от регистрации до промышленного сервинга: сборка образов, проверки, публикация артефактов, деплой, канареечные релизы, A/B-тесты и откаты
- Проектировать и развивать платформу инференса для batch- и online-сценариев на CPU/GPU
- Развивать ML-инфраструктуру на базе Kubernetes: кластеры, GPU-ресурсы, операторы, изоляция окружений, автоскейлинг, маршрутизация трафика и управление ресурсами
- Развивать и поддерживать платформенные компоненты для работы с признаками, моделями и ML-артефактами
- Развивать мониторинг ML-систем: инфраструктурные метрики, метрики сервинга, качество моделей, распределения входных данных, дрейф данных и деградация поведения моделей
- Обеспечивать воспроизводимость и управляемость ML-процессов: версионирование кода, данных и моделей, история экспериментов, изоляция сред обучения и инференса, аудит изменений
- Оптимизировать использование вычислительных ресурсов, включая GPU, с учетом надежности, производительности и стоимости
- Исследовать новые инструменты и подходы в MLOps, оценивать их применимость и внедрять там, где это повышает надежность, скорость разработки или эффективность платформы
- Опыт внедрения и сопровождения Kubernetes-кластеров для сервинга ML-моделей на GPU и CPU
- Практический опыт эксплуатации инструментов для деплоя и обслуживания моделей: Triton Inference Server, BentoML или аналогичных решений
- Опыт запуска и поддержки инференс-движков в Kubernetes
- Понимание подходов к автоскейлингу, балансировке нагрузки и маршрутизации запросов для ML-сервисов
- Понимание принципов мониторинга качества, поведения и эксплуатационных параметров ML-моделей
- Опыт настройки GPU-инфраструктуры: драйверы, CUDA Toolkit, MIG, GPU-enabled Docker, nvidia-container-toolkit
- Понимание жизненного цикла ML-экспериментов и инструментов их трекинга: MLflow, ClearML или аналогов
- Уверенное владение Python для автоматизации, разработки внутренних инструментов и интеграций
- Уверенный опыт работы с Kubernetes в production: workloads, операторы, Helm, HPA, ingress, storage, observability, диагностика и устранение проблем
- Опыт описания и автоматизации инфраструктуры на базе IaC: Terraform, Ansible, GitOps-подходы
- Опыт работы с системами контроля версий и организации CI/CD (GitLab, Bitbucket, Bamboo)
- Опыт работы с Docker и OCI-образами: сборка, оптимизация, публикация и эксплуатация
- Уверенное владение Linux: настройка, мониторинг, диагностика сетевых, файловых, ресурсных и производительных проблем
- Опыт настройки мониторинга и алертинга: Prometheus Stack
- Опыт безопасной работы с секретами, токенами, сертификатами и чувствительными данными
About the Company
Lamoda — это маркетплейс, ритейл, розничная сеть, собственные бренды и единый сток. Мы даем селлерам возможность продавать, хранить и доставлять свои фешен-товары, закупаем и продаем фешен и бьюти-товары сами, продаем трендовую спортивную одежду и обувь в розничных магазинах Lamoda Sport, создаем и развиваем бренд товаров для дома Lamoda Home, женской одежды Nume, мужской одежды Mademan, обуви Founds, минималистичной одежды Uset, спортивной одежды и обуви Loom и Sonu, помогаем селлерам продавать на Lamoda и в своем интернет-магазине. Более 10 тысяч человек по всей России и СНГ работают над тем, чтобы люди могли не просто покупать, а осознанно формировать свой стиль.
More jobs at Lamoda
-
Java developer
Москва · · Aug 19, 2026
-
QA engineer (manual)
Москва · · Aug 19, 2026
-
Senior fullstack QA engineer (web+backend)
Москва · · Aug 19, 2026
-
Senior Android developer
Москва · · Aug 19, 2026
-
Senior Data Scientist (LLM / Agents)
Москва · Hybrid · Aug 19, 2026