Skip to content
getdataengineeringjobs
Back to results

Data Engineer (ETL Migration)

Remote Contract Posted

Summary

Written in English from the original posting

A remote, project-based Data Engineer role focused on migrating an ETL system from Oracle and Informatica to an Apache-based stack. Responsibilities include writing and optimizing SQL, building Airflow DAGs and NiFi pipelines, developing PySpark jobs, integrating Kafka, and monitoring data loads. The position requires deep experience with ETL migration, high-load SQL, Spark, Airflow, NiFi, Kafka, and Hadoop/Hive.

Job description

Привет! Меня зовут Марина. 👋 Я представляю группу компаний Top Selection.
Мы занимаемся трудоустройством IT специалистов на проектную занятость.
На данный момент мы в поиске сильного Data Engineer (ETL-миграция) для участия в миграции ИС на Apache стек.

✅ Требования
● Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
● Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
● Оптимизация SQL для highload (партиционирование, индексы, explain plans)
● Oracle (PL/SQL) и PostgreSQL
● Greenplum и/или Clickhouse
● Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
● Hadoop (HDFS) и Hive
● Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
● Опыт работы с биллинговыми системами (желательно телеком-домен)

➕ Как преимущество
● Потоковая обработка: Kafka Streams / Spark Streaming
● Informatica PowerCenter (понимание мигрируемой системы)
● Бинарные форматы хранения в Hadoop
● Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
● Patroni для кластеризации PostgreSQL/Greenplum
● S3-хранилища
● КриптоПро или защищенные каналы передачи данных

📋 Задачи
● Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
● Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
● Написание и оптимизация SQL для витрин данных и ETL-процессов
● Разработка DAG-ов в Airflow
● Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
● Разработка Spark-джобов (PySpark) для больших объемов
● Интеграция с Kafka для потоковой передачи
● Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
● Разбор инцидентов по качеству данных и ошибкам загрузки
● Code review

Отклики по вакансии принимаются в боте:
https://t.me/topselection_hr_bot?start=v178_r1135594957

Навыки: Oracle PL/SQL, Высоконагруженные системы, PostgreSQL, Greenplum, ClickHouse, Apache Airflow, Apache Spark, Apache NiFi, Apache Kafka, Apache Hadoop

Зарплата: от 270 000 до 285 000 ₽

Similar jobs

Top Selection Apply