← К результатам

ML-разработчик в команду алайнмента Alice AI

з/п не указана
Yandex · Россия
Удаленная работа Постоянная занятость опыт от 1 года
Откликнуться на источнике →

Описание

Локация: гибридный формат — удалённая работа или офис
Компания
Разработка и улучшение Alice AI — диалоговой модели, способной рассуждать, следовать инструкциям, искать информацию и пользоваться инструментами.
Что делать

Разрабатывать и исследовать RL-методы для обучения LLM, повышая качество и устойчивость обучения.
Работать с reward-сигналами, оценкой действий модели и регулированием обновлений.
Объединять результаты разных экспериментов в единую версию модели и собирать релизных кандидатов.
Развивать методы многостадийного обучения, включая единое обучение, последовательные стадии и On-Policy Distillation.
Проектировать системные промпты, методы обучения и оценку управляемости модели.
Формулировать гипотезы, проводить эксперименты, анализировать метрики и причины изменений качества.

Требования

От 3 лет опыта.
Хорошее знание классического ML и DL.
Понимание устройства современных LLM и методов их обучения.
Умение переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и набор метрик.
Способность интерпретировать результаты и находить причины изменений качества моделей.
Интерес к моделям с reasoning и tool calling.

Хорошо, если есть

Опыт в online RL для LLM, многостадийном обучении, distillation, instruction following, reward modeling или оценке поведения языковых моделей.

Культура и преимущества

Возможность выбрать одно из трёх направлений с учётом опыта и интересов.
Непрерывный цикл постановки гипотез, экспериментов, оценки поведения модели и последующих итераций.
Работа с исследовательскими идеями и перенос работающих решений в основной обучающий контур.
Гибридный формат работы: удалённо или из офиса.

Источник: hirify · Опубликовано: 3 дня назад