ML Engineer / Research Engineer — обучение LLM с нуля
Наша команда обучает с нуля базовые модели Alice AI LLM. Мы работаем с претрейном — первым и самым масштабным этапом обучения. Отвечаем за полный цикл создания претрейн-моделей: от формирования обучающего корпуса и проверки гипотез до масштабных запусков на GPU-кластерах и анализа модели.Исследование данных для претрейна
Современные LLM обучаются на триллионах токенов, но объём корпуса сам по себе не гарантирует качество. Важно понять, какие данные действительно развивают способности модели.
Вы будете исследовать:
- какие источники дают наибольший прирост качества;
- как данные влияют на знания, reasoning, coding и другие способности;
- как сочетать веб-данные, специализированные корпуса и синтетику;
- как выбирать оптимальное соотношение доменов и языков;
- как менять состав обучающей смеси по ходу претрейна;
- как масштабировать выводы небольших экспериментов на крупные модели.
Обучение моделей с нуля
Вы пройдёте полный цикл создания новой LLM:
- сформулируете гипотезу;
- подготовите экспериментальный датасет;
- запустите обучение proxy-моделей;
- проведёте абляции и проанализируете результаты;
- определите, как подход ведёт себя при масштабировании;
- перенесёте успешные изменения в обучение большой модели.
Предстоит работать не только с финальными метриками, но и с динамикой обучения: исследовать, как разные способности возникают и развиваются по мере претрейна.
Scaling laws и раннее прогнозирование качества
Обучение большой модели требует значительных вычислительных ресурсов, поэтому особенно важно заранее понимать, какие решения стоит масштабировать.
Вы будете:
- строить scaling laws для данных и моделей;
- разрабатывать proxy-эксперименты;
- прогнозировать качество большой модели по малым запускам;
- искать ранние сигналы будущих способностей;
- выбирать оптимальные конфигурации обучения при заданном вычислительном бюджете.
Работа с данными большого масштаба
Исследовательские идеи необходимо превращать в надёжные процессы, способные работать на web-scale.
Вам предстоит развивать обработку веб-корпусов, фильтрацию и ранжирование документов, дедупликацию, балансировку языков и доменов, автоматическое обновление датасетов, распределённые пайплайны обработки данных.
Роль сочетает research и engineering: нужно уметь как придумать и проверить гипотезу, так и довести успешный метод до масштаба реального претрейна.
Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете Python
- Имеете опыт в ML, NLP, LLM или других областях deep learning
- Понимаете принципы работы и обучения трансформеров
- Умеете формулировать гипотезы и ставить контролируемые эксперименты
- Способны анализировать результаты и находить причины изменений качества
- Умеете читать исследовательские статьи и оценивать применимость идей на практике
- Готовы работать с задачами, для которых ещё нет готовых решений
Необязательно соответствовать всем пунктам: сильного опыта в нескольких из них уже достаточно.* Знакомы с любыми из этих областей: претрейн или посттрейн LLM, PyTorch и распределённое обучение, обработка больших данных, подготовка обучающих корпусов, scaling laws, evaluation LLM, synthetic data, обучение моделей на GPU-кластерах
About the Company
More jobs at Yandex
-
Data Scientist в команду платформы роста и ценообразования Яндекс Еды
Москва · · Aug 19, 2026
-
Инженер дежурной смены SRE в Финтех
· · Aug 19, 2026
-
SRE в Поиск
Москва · · Aug 19, 2026
-
Data Scientist в Лавку (геоаналитика)
· · Aug 19, 2026
-
Data Scientist в Лавку (геоаналитика)
Москва · · Aug 19, 2026