Principal Data Engineer
Шукаємо Principal Data Engineer
📍 Віддалено з України
💼 Повна зайнятість
🚀 Рівень: Principal / Staff
Про проєкт
Міжнародний технологічний проєкт поєднує OSINT та штучний інтелект, допомагаючи державним установам отримувати критично важливу інформацію про технологічні й економічні екосистеми недружніх країн.
Платформа перетворює відкриті дані на структуровану аналітику, яка підтримує ухвалення стратегічних рішень. Зараз команда суттєво розширює свій інженерний напрям.
Про роль
Ви приєднаєтеся до команди обробки даних, яка перетворює необроблену інформацію на чисті, структуровані та надійні набори даних.
Ви відповідатимете за весь життєвий цикл пайплайнів: від завантаження сирих даних у bronze-рівень, entity resolution та збагачення — до gold-датасетів, які використовуються у продукті, графі знань та комерційних експортних рішеннях.
Це роль із високим рівнем відповідальності та самостійності: ви проєктуватимете пайплайни й моделі даних, визначатимете технічні стандарти та впливатимете на розвиток команди.
Масштаб системи:
🔹 понад 1 млрд точок даних
🔹 граф знань із понад 50 млн сутностей
🔹 компанії, люди, закупівлі та зв’язки між ними
Ваші основні завдання:
- Побудова й підтримка end-to-end пайплайнів у medallion-архітектурі: bronze → silver → gold
- Розвиток моделей компаній, людей і зв’язків між ними
- Перехід від повного оновлення даних до інкрементальної обробки
- Оркестрація та трансформація даних за допомогою Dagster, dbt, Trino і Databricks
- Розвиток gold-рівня для продукту, метрик і комерційних експортів
- Співпраця з командами, які завантажують дані в Neo4j та Elasticsearch
- Розвиток аналітичного шару й датасетів для Metabase
- Забезпечення якості даних, надійності, спостережуваності та оптимальної вартості обробки
- Технічне менторство та участь у формуванні інженерних практик команди
Що важливо:
Досвід на рівні Principal або Staff у побудові та експлуатації production data pipelines великого масштабу. Також розглядаємо сильних Senior-інженерів, готових до наступного кроку
Впевнене володіння Python і SQL
Досвід із сучасним data stack: оркестрація, SQL-first трансформації та розподілена обробка даних
Глибоке розуміння data modelling, medallion/lakehouse-підходів, dimensional та incremental models, schema evolution, data quality і тестування
Досвід роботи з хмарними платформами та контейнеризованими середовищами. Поточний стек: Azure, Databricks та ADLS
AI-first підхід: використання Claude Code, Codex або інших агентних інструментів із відповідальністю за перевірку результатів
Самостійність, сильна письмова англійська та вміння посилювати команду
Буде перевагою:
- Досвід з entity resolution, record linkage або knowledge graph pipelines
- Проєктування онтологій чи семантичних моделей даних
- Знання Trino, Iceberg та lakehouse table formats
- Досвід із Neo4j і Cypher
- Analytics engineering, BI-інструменти, metrics layers і star schemas
- Data contracts та data-quality frameworks
- Робота з даними мовами недружніх країн або нормалізацією нелатинських систем письма
- Досвід у регульованих галузях, оборонному секторі, розвідці чи інших середовищах із високими вимогами до довіри й безпеки
AI є невіддільною частиною інженерного процесу. Команда активно використовує Claude Code та Codex, надає доступ до цих інструментів і очікує їх відповідального застосування в щоденній роботі.
Процес найму:
- 3-4 співбесіди: скринінг (30-45 хв), технічна (1-2 години), презентація тестового завдання (30 хв), знайомство з CEO (30 хв)
- є тестове завдання
- співбесіди проходять англійською мовою з включеною камерою