Skip to content
getdataengineeringjobs
Back to results

Data Engineer

Remote Contract Posted

Summary

Written in English from the original posting

Top Selection is hiring a Data Engineer for a project migrating a telecom operator's ETL infrastructure from Oracle and Informatica to an Apache open-source stack. Key responsibilities include creating DAGs in Airflow, building pipelines in NiFi, developing PySpark jobs, and tuning SQL queries for Greenplum and ClickHouse. The role is fully remote and project-based.

Job description

Привет! Меня зовут Марина. 👋 Я представляю группу компаний Top Selection.
Мы занимаемся трудоустройством IT специалистов на проектную занятость.
На данный момент мы в поиске сильного Data Engineer (ETL-миграция) для участия в миграции ИС на Apache стек.

✅ Требования
● Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
● Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
● Оптимизация SQL для highload (партиционирование, индексы, explain plans)
● Oracle (PL/SQL) и PostgreSQL
● Greenplum и/или Clickhouse
● Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
● Hadoop (HDFS) и Hive
● Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
● Опыт работы с биллинговыми системами (желательно телеком-домен)

➕ Как преимущество
● Потоковая обработка: Kafka Streams / Spark Streaming
● Informatica PowerCenter (понимание мигрируемой системы)
● Бинарные форматы хранения в Hadoop
● Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
● Patroni для кластеризации PostgreSQL/Greenplum
● S3-хранилища
● КриптоПро или защищенные каналы передачи данных

📋 Задачи
● Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
● Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
● Написание и оптимизация SQL для витрин данных и ETL-процессов
● Разработка DAG-ов в Airflow
● Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
● Разработка Spark-джобов (PySpark) для больших объемов
● Интеграция с Kafka для потоковой передачи
● Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
● Разбор инцидентов по качеству данных и ошибкам загрузки
● Code review

Отклики по вакансии принимаются в боте:
https://t.me/topselection_hr_bot?start=v178_r1135594957

Навыки: Oracle PL/SQL, Высоконагруженные системы, PostgreSQL, Greenplum, ClickHouse, Apache Airflow, Apache Spark, Apache NiFi, Apache Kafka, Apache Hadoop

Зарплата: от 270 000 до 285 000 ₽

Similar jobs

RUB 270k–285k / month Apply