Аналитик-разработчик в команду разметки и анализа данных Фантеха
Наша команда занимается добычей, систематизацией и улучшением существующих датасетов для всего отдела ML в развлекательных сервисах: Яндекс Музыка, Кинопоиск, Яндекс Книги и других. Ищем аналитика, который поможет нам добывать новые данные, а также систематизировать и улучшать текущие базы данных.Строить и улучшать автоматические процессы разметки данных
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы. Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше? Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг? Больше об аналитике в Яндексе — в канале Yandex for Analytics* Хорошо владеете теорией вероятностей и математической статистикой * Можете делать выводы на основе данных * Умеете программировать на Python и SQL * Понимаете, как работает интернет: DNS и CDN, IPv4 и IPv6, http и https* Работали с распределёнными системами хранения и обработки данных MapReduce * Имеете опыт работы с ML * Писали парсеры * Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.
Разметка будет содержательно описывать сущности, которые могут быть рекомендованы пользователю или показаны в продукте. На каком языке этот трек? Жив ли этот музыкальный исполнитель? Этот музыкальный клип — студийный, или это запись концерта? Можно ли включить этот сериал ребёнку? Какая книга является наилучшим ответом на этот поисковый запрос? На все эти и многие другие вопросы будет отвечать разметка, за которой будете стоять вы. Оценивать качество размеченных датасетов
Нередко получается так, что наша команда получает готовую разметку на десятки миллионов единиц контента: от правообладателей, внешнего мира, других команд и т. д. Вам нужно будет ответить, хороша ли эта разметка. Какие у неё проблемные места? Лучше ли она уже существующей? Можем ли мы сделать её лучше? Находить полезные данные за пределами Фантеха
Бывают случаи, когда нужных данных нет, а процесс их разметки строить намного дороже, нежели найти их где-то ещё. Вам предстоит выяснить, есть ли эти данные внутри Яндекса. Или, может быть, они есть в интернете? Как сопоставить эти данные с сущностями из базы данных Музыки/Кинопоиска/Книг? Больше об аналитике в Яндексе — в канале Yandex for Analytics* Хорошо владеете теорией вероятностей и математической статистикой * Можете делать выводы на основе данных * Умеете программировать на Python и SQL * Понимаете, как работает интернет: DNS и CDN, IPv4 и IPv6, http и https* Работали с распределёнными системами хранения и обработки данных MapReduce * Имеете опыт работы с ML * Писали парсеры * Работали с платформами для краудсорсинга: Label Studio, Toloka, Amazon Mechanical Turk и т. д.