Data Scientist в команду Horizontal ML Technologies
Summary
Build and ship OCR and computer vision ML solutions for Avito's marketplace platform, including document recognition pipelines, VLM-based services, and high-load production deployment. Stack: Python, PyTorch, OpenCV, transformer/CNN architectures.
О команде: Команда Horizontal ML Technologies создаёт и развивает горизонтальные ML-технологии для Авито. Одно из направлений — OCR: распознавание текста с изображений. Также команда решает задачи, связанные с визуальным качеством фотографий.OCR-модели помогают решать задачи модерации и антифрода, а также извлекать полезную информацию из текста на фотографиях. Отдельное направление — развитие OCR-платформы для распознавания документов: команда создаёт классические пайплайны с детектором и распознавателем, а также решения на базе VLM.В каждом проекте команда проводит полный цикл ML-разработки: от сбора и разметки данных до обучения моделей и выкатки в прод высоконагруженных сервисов.Мы ищем CV-инженера с опытом решения разных задач компьютерного зрения
Примеры будущих задач: — развивать OCR-платформу: улучшать качество распознавания текущих типов документов и разрабатывать решения для новых;— строить CV- и классические OCR-пайплайны: обучать детектор и распознаватель, работать с классификацией типа текста, качеством изображения, пре- и постпроцессингом;— разрабатывать VLM-решения: дообучать модели с помощью LoRA, работать с промптингом, проектировать архитектуру решения, оценивать и контролировать качество;— собирать и размечать данные вручную и автоматически, генерировать синтетические датасеты;— оптимизировать инференс моделей и внедрять их в прод высоконагруженных сервисов.
Мы ждем, что вы: — имеете от 3 лет практического опыта работы с ML-моделями в области компьютерного зрения, опыт в OCR будет преимуществом;— умеете самостоятельно вести CV-проекты от идеи до продакшена;— глубоко понимаете устройство CV-моделей: особенности CNN и трансформерных архитектур для классификации, детекции и сегментации;— понимаете, как устроены современные VLM, и решали с их помощью прикладные задачи;— обладаете широким кругозором в Data Science: классический ML, NLP, CV, LLM;— уверенно владеете Python и PyTorch, а также знакомы с методами классического компьютерного зрения в OpenCV;— имеете опыт оптимизации и вывода моделей в прод;— умеете общаться с бизнесом простым языком, объяснять метрики и результаты.
Будет здорово, если вы: — имеете опыт написания и чтения кода на Go;— участвовали в соревнованиях или хакатонах по ML, занимали призовые места;— окончили Академию Авито, ШАД или AI Masters.
Работа у нас — это: — возможность влиять на продукт: ваши решения будут улучшать опыт миллионов пользователей;— сложные технологические задачи на большом масштабе;— мощное железо: доступ к производительным GPU-кластерам для экспериментов;— сильное комьюнити: команда экспертов, с которой можно обсуждать идеи и подходы;— развитие: бюджет на обучение, курсы, конференции и профессиональную литературу;— забота о здоровье: ДМС со стоматологией с первого дня, в офисе принимают терапевт и массажист;— гибкость: возможность работать удалённо или из офисов в 4 городах России.