ML-разработчик в команду алайнмента Alice AI
Описание
Локация: гибридный формат — удалённая работа или офис
Компания
Разработка и улучшение Alice AI — диалоговой модели, способной рассуждать, следовать инструкциям, искать информацию и пользоваться инструментами.
Что делать
Разрабатывать и исследовать RL-методы для обучения LLM, повышая качество и устойчивость обучения.
Работать с reward-сигналами, оценкой действий модели и регулированием обновлений.
Объединять результаты разных экспериментов в единую версию модели и собирать релизных кандидатов.
Развивать методы многостадийного обучения, включая единое обучение, последовательные стадии и On-Policy Distillation.
Проектировать системные промпты, методы обучения и оценку управляемости модели.
Формулировать гипотезы, проводить эксперименты, анализировать метрики и причины изменений качества.
Требования
От 3 лет опыта.
Хорошее знание классического ML и DL.
Понимание устройства современных LLM и методов их обучения.
Умение переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и набор метрик.
Способность интерпретировать результаты и находить причины изменений качества моделей.
Интерес к моделям с reasoning и tool calling.
Хорошо, если есть
Опыт в online RL для LLM, многостадийном обучении, distillation, instruction following, reward modeling или оценке поведения языковых моделей.
Культура и преимущества
Возможность выбрать одно из трёх направлений с учётом опыта и интересов.
Непрерывный цикл постановки гипотез, экспериментов, оценки поведения модели и последующих итераций.
Работа с исследовательскими идеями и перенос работающих решений в основной обучающий контур.
Гибридный формат работы: удалённо или из офиса.