Аналитик-разработчик в команду этики и безопасности Alice AI

location_onМоскваschedule3 часа назад

Описание должности

Alice AI — это LLM, которая помогает миллионам людей решать повседневные задачи. Ищем аналитика-разработчика, чтобы сделать ответы модели ещё более релевантными, достоверными и безопасными. Если вы уверенно владеете Python и SQL, знаете матстат и теорию вероятностей — откликайтесь на вакансию.Анализ данных и поиск проблемных сценариев

В логах Alice AI представлены самые разные сценарии: голосовые и текстовые запросы, генерация изображений, взаимодействие с несколькими моделями — от команды «включи будильник» до продолжительных ролевых диалогов.

Вам предстоит исследовать большие объёмы данных, выделять сложные срезы и находить потенциально проблемные паттерны. Мы анализируем реальные пользовательские взаимодействия, формулируем гипотезы о новых классах рисков и проектируем сценарии для red teaming.

Разработка LLM-джаджей и агентских пайплайнов

Чтобы научить модель корректно отвечать на сложные запросы, необходимо уметь измерять качество её поведения. Мы создаём автоматизированные системы оценки на основе подхода LLM-as-a-Judge, промптинга и агентских пайплайнов.

Вам предстоит разрабатывать критерии и рубрики оценки, собирать evaluation-пайплайны, валидировать автоматические оценки на человеческой разметке и исследовать качество джаджей: их устойчивость, согласованность, смещения, precision и recall.

Участие в обучении LLM Яндекса

Мы собираем и валидируем обучающие выборки для этапов SFT и RL, анализируем ошибки модели и определяем направления для её дальнейшего улучшения.

Задача команды — встроить требования к ответственному поведению в общий цикл разработки LLM и обеспечить измеримый рост качества на целевых категориях запросов.

Финальная приёмка моделей

Перед запуском новой версии необходимо убедиться, что она улучшает целевые метрики и не создаёт неприемлемых рисков.

Мы разрабатываем наборы тестов и офлайн-метрики, сравниваем релиз-кандидаты с текущей моделью, анализируем регрессии и статистическую значимость изменений. По результатам оценки команда принимает решение о готовности модели к запуску.

Больше об аналитике в Яндексе — в канале Yandex for Analytics* Уверенно владеете Python и SQL

  • Самостоятельно работаете с данными: исследуете логи, формулируете гипотезы
  • Знаете математическую статистику и теорию вероятностей, умеете корректно строить эксперименты и интерпретировать результаты
  • Умеете ясно излагать мысли, обсуждать решения и аргументированно отстаивать свою позицию* Работали с ML-моделями и понимаете основные этапы их обучения и оценки
  • Создавали LLM-джаджей, автоматизированные evaluation-пайплайны или проводили red teaming
  • Знакомы с SFT, RLHF/RLAIF и современными подходами к LLM evaluation
  • Понимаете типовые сценарии использования и уязвимости генеративных моделей

Упомянутые навыки

Откликнуться на вакансию

Use the application link supplied with this listing to apply to Yandex. Check the destination before entering personal information.