LLM Data Scientist — оценка качества GigaChat (модельные риски генеративных моделей)

Company: 당근마켓
Location: г Москва
Type:
Posted: Sep 16, 2026
Views: 1

Наша команда отвечает за оценку модельного риска и независимый контроль генеративных моделей Банка. В нашей зоне ответственности GigaChat — текстовые и мультимодальные LLM — и open-source модели: команда первой видит, на что способна новая версия, прежде чем она выйдет к пользователям.

Нам нужен специалист, который возьмет на себя измерение качества GigaChat:

  • разработку бенчмарков и измерение на них качества модели — на собственных данных, а не по публичным лидербордам
  • развитие собственной библиотеки валидации LLM полного цикла: от сбора данных и разметки до финальных метрик и отчетов
  • вынесение заключения по модельному риску: при каких условиях версию можно выпускать и что осталось непроверенным.

Эта роль про независимое измерение фундаментального качества модели: не про обучение GigaChat — этим занимается отдельная команда — и не про продуктовые метрики вроде DAU и retention.Развивать собственный фреймворк оценки LLM

  • писать чистый код фреймворка и проверять чужой: регулярные код-ревью, PR, поддержка растущей кодовой базы
  • настраивать автоматизацию и CI под растущую аудиторию и вести регулярную валидацию версий GigaChat и open-source альтернатив по единой методике — фреймворком пользуются команды по всему Банку.

Разрабатывать бенчмарки и проектировать проверку

  • разрабатывать и актуализировать собственные бенчмарки под ключевые сценарии Банка: подбор задач, редкие и намеренно трудные случаи, эталонные ответы
  • превращать запрос «модель стала лучше?» в план проверки: что измеряем, на какой выборке, с чем сравниваем.

Строить LLM-судей и автоматические метрики

  • делать судей под задачу, знать их перекосы (self-preference, position bias, length bias) и калибровать оценки против человеческих
  • понимать, где автоматическая оценка не годится и нужен другой подход, и снижать стоимость измерений без потери достоверности.

Давать заключение по модельному риску

  • оценивать автономность модели в сценарии и цену ее ошибки: что она делает без человека, что необратимого может произойти, какой худший реалистичный исход
  • формулировать условия выпуска — доля трафика, ограничения по сценариям, митигации, мониторинг — с явным перечнем непроверенного и защищать выводы перед командой разработки и руководством.

Следить за фронтиром

  • следить за новыми подходами в научном сообществе, читать статьи, писать собственные, внедрять лучшие практики оценки в процессы Банка
  • когда нужного инструмента не существует — создавать его самостоятельно.

Стек: Python, pandas, NumPy, PyTorch, HuggingFace (transformers, datasets), vLLM, SGLang, инференс-API, S3, Git, Docker, CI/CD, Linux, Bash.* Python на продакшн-уровне: чистый код по PEP 8, ООП и типовые паттерны проектирования, аннотации типов, привычка к линтерам и статическому анализу (ruff, mypy). Создаете и поддерживаете production-код eval-пайплайнов, читаете и ревьюите чужой

  • статистика и дизайн эксперимента: доверительные интервалы, оценка необходимого размера выборки, проверка гипотез, поправки на множественные сравнения, разница между статистической и практической значимостью
  • понимаете, как устроены LLM изнутри: как работает трансформер и механизм внимания, почему текст разбивается на токены и к чему это приводит, как параметры генерации влияют на ответ, чем отличаются этапы обучения — предобучение, дообучение на инструкциях и обучение на человеческих предпочтениях
  • опыт работы с LLM и понимание, как оценивают генеративные модели: метрики, human evaluation, LLM-as-a-judge и его ограничения
  • привычка выяснять цену ошибки до начала работы — не бросаться считать метрики, не поняв, что именно проверяете
  • Готовность работать без готовой методологии, проактивность, умение декомпозировать большие задачи на решаемые.

Будет плюсом:

  • опыт с open-source моделями и инференсом: vLLM, SGLang, inference API, prompt engineering
  • опыт работы с мультимодальными моделями: изображения, аудио
  • опыт построения evaluation-фреймворков и evaluation harness, встраивание оценок в CI/CD
  • работа с асессорами: постановка задачи разметчикам, контроль согласованности разметки
  • работа с coding-агентами (Claude Code, Codex, Cursor и аналоги)
  • представление о том, как удешевляют инференс: квантизация, дистилляция, PEFT/LoRA, спекулятивное декодирование
  • опыт с RAG: умеете оценивать поиск и генерацию по отдельности, понимаете, почему модель выдумывает факты и как на это влияют разбиение документов на фрагменты и их ранжирование; работали с векторным поиском и эмбеддингами.* комфортный современный офис рядом с м. Кутузовская
  • возможность выбрать удобный график — офис / гибрид
  • ежегодный пересмотр зарплаты и годовая премия по итогам работы 2–4 оклада
  • программа адаптации и помощь руководителя на старте
  • более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
  • корпоративный спортзал и зоны отдыха
  • расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
  • гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
  • подписка Прайм с возможностью совместного использования на трех близких
  • скидки на продукты компаний-партнеров
  • вознаграждение за рекомендацию друзей в команду Сбера.

About the Company

Name: 당근마켓

당근은 동네의 숨은 가치에 주목합니다. 근처 이웃과의 중고 직거래를 시작으로, 전에 없던 지역 생활 커뮤니티를 만들어 나가고 있어요. 이웃들은 진짜 우리 동네 이야기를 나누고, 가게 사장님들은 이웃의 목소리를 가장 가까이서 들을 수 있지요. 거래부터 모임, 홍보, 결제까지, 로컬에서 일어나는 모든 경험을 당근이 하나로 연결하고 있습니다.

More jobs at 당근마켓