Summary
Written in English from the original postingTop Selection is hiring a Data Engineer for a project migrating a telecom operator's ETL infrastructure from Oracle and Informatica to an Apache open-source stack. Key responsibilities include creating DAGs in Airflow, building pipelines in NiFi, developing PySpark jobs, and tuning SQL queries for Greenplum and ClickHouse. The role is fully remote and project-based.
Job description
Привет! Меня зовут Марина. 👋 Я представляю группу компаний Top Selection.
Мы занимаемся трудоустройством IT специалистов на проектную занятость.
На данный момент мы в поиске сильного Data Engineer (ETL-миграция) для участия в миграции ИС на Apache стек.
✅ Требования
● Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
● Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
● Оптимизация SQL для highload (партиционирование, индексы, explain plans)
● Oracle (PL/SQL) и PostgreSQL
● Greenplum и/или Clickhouse
● Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
● Hadoop (HDFS) и Hive
● Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
● Опыт работы с биллинговыми системами (желательно телеком-домен)
➕ Как преимущество
● Потоковая обработка: Kafka Streams / Spark Streaming
● Informatica PowerCenter (понимание мигрируемой системы)
● Бинарные форматы хранения в Hadoop
● Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
● Patroni для кластеризации PostgreSQL/Greenplum
● S3-хранилища
● КриптоПро или защищенные каналы передачи данных
📋 Задачи
● Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
● Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
● Написание и оптимизация SQL для витрин данных и ETL-процессов
● Разработка DAG-ов в Airflow
● Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
● Разработка Spark-джобов (PySpark) для больших объемов
● Интеграция с Kafka для потоковой передачи
● Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
● Разбор инцидентов по качеству данных и ошибкам загрузки
● Code review
Отклики по вакансии принимаются в боте:
https://t.me/topselection_hr_bot?start=v178_r1135594957
Навыки: Oracle PL/SQL, Высоконагруженные системы, PostgreSQL, Greenplum, ClickHouse, Apache Airflow, Apache Spark, Apache NiFi, Apache Kafka, Apache Hadoop
Зарплата: от 270 000 до 285 000 ₽