ML-разработчик в команду алайнмента Alice AI

Наша команда занимается стадией алайнмента Alice AI. Мы превращаем LLM в диалогового агента, способного выполнить широкий спектр запросов пользователя. Приходите к нам, если знаете классические методы ML и NLP, понимаете, как устроены LLM, и хотите строить будущее вместе с нами!RL-алгоритмы и устойчивость обучения
Направление занимается RL-методами для обучения LLM. Мы работаем над ростом качества, стабильностью обучения и инструментами, которые помогают понимать состояние модели во время эксперимента. Задачи могут быть связаны, например, с новыми способами использовать reward-сигнал, оценивать действия модели или регулировать её обновление. Интересные идеи из исследований проверяем на наших моделях, а работающие решения переносим в основной обучающий контур. Интеграция моделей и сборка релиза
Разные эксперименты развивают разные способности модели. Это направление отвечает за то, чтобы объединить изменения в одной версии и сохранить их вклад в итоговое качество. Мы исследуем способы объединения стадий обучения — например, единое обучение, последовательные стадии или On-Policy Distillation. В каждой итерации собираем модель-кандидата, проводим комплексную оценку и уточняем способ интеграции. В рамках направления также поддерживаем актуальный стенд для быстрых экспериментов и приёмки изменений. Системные промпты и управляемость модели
Системный промпт задаёт поведение модели: например, роль, стиль, формат ответа или порядок работы с инструментами. В этом направлении мы учим модель гибко следовать новым системным инструкциям, сохраняя точность, полезность и остальные важные свойства. Мы развиваем методы обучения, данные и оценку поведения модели. Для проверки качества используем, например, экспертную разметку, reward-модели и LLM-as-a-Judge. Отдельное внимание уделяем reasoning, tool calling и переносу качества на новые сценарии. Больше об ML в Яндексе — в канале Yandex for ML* Хорошо знаете классический ML и DL * Понимаете устройство современных LLM и методы их обучения * Умеете переводить исследовательскую задачу в проверяемую гипотезу, эксперимент и метрики * Способны интерпретировать результаты и находить причины изменений качества * Интересуетесь моделями с reasoning и tool calling* Имеете опыт в одной из близких областей: online RL для LLM, многостадийное обучение, distillation, instruction following, reward modeling или оценка поведения языковых моделей

See also

要針對這個職缺調整履歷嗎?

目前無法檢查您與這個職缺的符合程度;請先將履歷加入個人檔案,下次即可查看。

A new version of freehire is available