Data Engineer
Summary
Designs and maintains ETL/ELT pipelines, data warehouses, lakehouses, and feature stores; integrates heterogeneous sources (ERP, MES, PMIS) and prepares data for AI/ML/LLM workloads using Airflow, Spark, Kafka, ClickHouse, Greenplum, and PostgreSQL.
Обязанности:
- Разработка и поддержка ETL/ELT-процессов, пайплайнов и витрин данных.
- Интеграция разнородных источников: ERP, MES, PMIS, Excel, внешние системы.
- Работа с Apache Airflow, Spark, Kafka; при необходимости — другие инструменты оркестрации и потоковой обработки.
- Проектирование и оптимизация моделей данных для DWH, data lake/lakehouse, feature stores и витрин под аналитику и ML.
- Работа с СУБД: ClickHouse, Greenplum, PostgreSQL или аналогами.
- Подготовка данных для AI/ML/LLM: очистка, нормализация, разметка, векторизация, создание датасетов для обучения и дообучения моделей.
- Понимание сценариев использования LLM в data-инженерии: генерация и валидация кода, автодокументирование пайплайнов, извлечение сущностей из текстов, обогащение метаданных, классификация и тегирование данных.
- Обеспечение качества данных: валидация, контроль полноты, мониторинг загрузок, обработка инцидентов.
- Взаимодействие с аналитиками, архитекторами, разработчиками, ML-инженерами и владельцами данных.
- Документирование решений, регламентов обновления и правил контроля качества.
- Уверенное владение SQL и Python.
- Практический опыт с Airflow, Spark, Kafka или аналогичными инструментами оркестрации и потоковой обработки.
- Понимание принципов DWH, data lake/lakehouse, витрин данных, feature stores.
- Опыт работы с различными моделями данных: реляционная, колоночная, документоориентированная, графовая, key-value, векторная.
- Опыт работы с ClickHouse, Greenplum, PostgreSQL, векторными СУБД или аналогами.
- Понимание процессов ETL/ELT, качества данных, мониторинга и обработки ошибок.
- Желателен опыт подготовки данных для AI/ML/LLM или работы в команде с ML-инженерами.
- Понимание базовых принципов работы LLM и сценариев их применения в data-инженерии.
- Способность работать с разрозненными источниками и неполными данными
Преимуществом будет:
- Опыт работы в Kubernetes-контуре: контейнеризация пайплайнов, Helm, CI/CD, observability.
- Опыт в госкорпорации, промышленности, холдинге или регулируемой среде.
- Знание векторных баз данных, RAG-паттернов, эмбеддингов и работы с неструктурированными данными.
- Понимание требований ИБ, разграничения доступа и работы с чувствительными данными.
- Опыт настройки мониторинга (Grafana, Prometheus, ELK) и алертинга
- Оформление по ТК РФ;
- График 5/2;
- Отсутствие дресс кода;
- ДМС расширенный со стоматологией;
- Компенсация абонемента в фитнес-клуб;
- Льготные условия по ипотеке;
- Наставничество на испытательном сроке.