«Детмир Тех» развивает цифровую экосистему группы компаний «Детский мир». Мы создаём продукты для миллионов клиентов и сервисы, которые помогают бизнесу принимать решения на основе данных.
Ищем Data Engineer в команду Big Data Platform. Платформа построена на Hadoop 3 и Apache Spark и является основным источником данных для всей группы компаний.
Главная задача — развивать надёжную и производительную платформу обработки больших объёмов данных: проектировать пайплайны, оптимизировать Spark-приложения, развивать Data Lake и совершенствовать архитектуру Hadoop-кластера.
Чем предстоит заниматься:
- Разрабатывать и оптимизировать batch-процессы на Apache Spark.
- Проектировать ETL/ELT-пайплайны для обработки больших объёмов данных.
- Создавать и поддерживать витрины данных в Hadoop.
- Оптимизировать Spark jobs: partitioning, shuffle, data skew, использование памяти и ресурсов кластера.
- Развивать архитектуру Data Lake и подходы к организации и хранению данных.
- Организовывать загрузку и передачу данных через Kafka и S3 API (MinIO).
- Автоматизировать процессы с помощью Apache Airflow и Apache NiFi.
- Поддерживать трансформации данных в dbt Core.
- Развивать и поддерживать витрины данных в ClickHouse.
- Оптимизировать запросы и процессы загрузки данных в ClickHouse, разбираться с проблемами производительности.
- Поддерживать аналитическую платформу на Apache Superset, решать возникающие технические проблемы.
- Внедрять проверки качества данных и мониторинг пайплайнов.
- Исследовать причины сбоев и деградации производительности.
- Помогать аналитикам и дата-сайентистам эффективно работать с платформой.
- Участвовать в развитии внутренних инструментов и стандартов Data Engineering.
- Участвовать в развёртывании и эксплуатации компонентов платформы в Kubernetes.
Что для нас важно:
- От трёх лет опыта работы с Hadoop и Apache Spark.
- Знание основных компонентов Hadoop и принципов работы HDFS и Spark.
- Глубокое понимание архитектуры Spark и принципов распределённых вычислений.
- Опыт разработки и оптимизации Spark batch jobs.
- Уверенное владение SQL.
- Опыт проектирования DWH или Data Lake.
- Опыт построения ETL/ELT-процессов.
- Практический опыт работы с Apache Airflow.
- Знание форматов хранения данных.
- Понимание принципов партиционирования и организации данных в Data Lake.
- Умение диагностировать проблемы с shuffle, partitioning, data skew, памятью и использованием ресурсов кластера.
- Умение анализировать производительность распределённых приложений и находить узкие места.
- Умение писать чистый, тестируемый и поддерживаемый код.
- Готовность принимать технические решения и отвечать за результат.
Будет преимуществом:
- Опыт разработки на Scala.
- Знание Kafka и принципов потоковой обработки данных.
- Опыт работы с ClickHouse и оптимизации запросов.
- Опыт работы с Apache Superset.
- Знакомство с Apache NiFi и dbt Core.
- Опыт эксплуатации приложений в Kubernetes.
- Знание Docker, Helm и GitLab CI/CD.
- Опыт работы с DataHub или другими Data Catalog решениями.
- Опыт построения мониторинга data-платформ и пайплайнов.
- Знакомство с VictoriaMetrics, Grafana, Hue или Jupyter.
- Опыт работы с большими Hadoop-кластерами и высокими объёмами данных.
Наш стек:
Хранение и обработка: Hadoop 3, HDFS, Apache Spark
Доставка и обмен данными: Kafka, S3
Оркестрация и трансформации: Apache Airflow, Apache NiFi, dbt Core
Аналитические хранилища: ClickHouse
Ad-hoc аналитика: Hue, Jupyter
Каталог данных: DataHub
BI и визуализация: Apache Superset, Grafana
Мониторинг: VictoriaMetrics, Grafana
Инфраструктура: Kubernetes, Docker, Helm
CI/CD: GitLab CI/CD
Мы предлагаем:
- Официальное оформление в соответствии с ТК РФ в IT-аккредитованную компанию;
- Совокупный доход: оклад + годовой бонус;
- График работы: 5/2 (гибридный формат работы);
- Вакансия открыта для кандидатов, проживающих в РФ, удалённый формат работы из других стран не рассматривается;
- Техника для работы;
- Полис ДМС;
- Программа Best Benefits;
- Внутреннее обучение;
- Спортивные и развлекательные мероприятия, участие в корпоративной жизни компании.
Присоединяйтесь к нам и станьте частью истории бренда с историей!