Data Engineer

Summary

Designs and maintains ETL/ELT pipelines, data warehouses, lakehouses, and feature stores; integrates heterogeneous sources (ERP, MES, PMIS) and prepares data for AI/ML/LLM workloads using Airflow, Spark, Kafka, ClickHouse, Greenplum, and PostgreSQL.

Обязанности:
  • Разработка и поддержка ETL/ELT-процессов, пайплайнов и витрин данных.
  • Интеграция разнородных источников: ERP, MES, PMIS, Excel, внешние системы.
  • Работа с Apache Airflow, Spark, Kafka; при необходимости — другие инструменты оркестрации и потоковой обработки.
  • Проектирование и оптимизация моделей данных для DWH, data lake/lakehouse, feature stores и витрин под аналитику и ML.
  • Работа с СУБД: ClickHouse, Greenplum, PostgreSQL или аналогами.
  • Подготовка данных для AI/ML/LLM: очистка, нормализация, разметка, векторизация, создание датасетов для обучения и дообучения моделей.
  • Понимание сценариев использования LLM в data-инженерии: генерация и валидация кода, автодокументирование пайплайнов, извлечение сущностей из текстов, обогащение метаданных, классификация и тегирование данных.
  • Обеспечение качества данных: валидация, контроль полноты, мониторинг загрузок, обработка инцидентов.
  • Взаимодействие с аналитиками, архитекторами, разработчиками, ML-инженерами и владельцами данных.
  • Документирование решений, регламентов обновления и правил контроля качества.
Требования:
  • Уверенное владение SQL и Python.
  • Практический опыт с Airflow, Spark, Kafka или аналогичными инструментами оркестрации и потоковой обработки.
  • Понимание принципов DWH, data lake/lakehouse, витрин данных, feature stores.
  • Опыт работы с различными моделями данных: реляционная, колоночная, документоориентированная, графовая, key-value, векторная.
  • Опыт работы с ClickHouse, Greenplum, PostgreSQL, векторными СУБД или аналогами.
  • Понимание процессов ETL/ELT, качества данных, мониторинга и обработки ошибок.
  • Желателен опыт подготовки данных для AI/ML/LLM или работы в команде с ML-инженерами.
  • Понимание базовых принципов работы LLM и сценариев их применения в data-инженерии.
  • Способность работать с разрозненными источниками и неполными данными

Преимуществом будет:

  • Опыт работы в Kubernetes-контуре: контейнеризация пайплайнов, Helm, CI/CD, observability.
  • Опыт в госкорпорации, промышленности, холдинге или регулируемой среде.
  • Знание векторных баз данных, RAG-паттернов, эмбеддингов и работы с неструктурированными данными.
  • Понимание требований ИБ, разграничения доступа и работы с чувствительными данными.
  • Опыт настройки мониторинга (Grafana, Prometheus, ELK) и алертинга
Условия:
  • Оформление по ТК РФ;
  • График 5/2;
  • Отсутствие дресс кода;
  • ДМС расширенный со стоматологией;
  • Компенсация абонемента в фитнес-клуб;
  • Льготные условия по ипотеке;
  • Наставничество на испытательном сроке.

See also

要針對這個職缺調整履歷嗎?

目前無法檢查您與這個職缺的符合程度;請先將履歷加入個人檔案,下次即可查看。

A new version of freehire is available