Инженер данных (Data Lake)
Описание
Локация: Москва и Краснодар — гибридный или офисный формат; другие города — удаленно.
Компания
MagnitTech развивает внутреннюю Data-платформу и современное хранилище данных Data Lake для розничной компании Магнит.
Что делать
Разрабатывать и развивать платформы batch- и CDC-инжеста данных в Data Lake.
Проектировать платформенные компоненты и API для подключения источников, настраивать загрузки и управлять жизненным циклом данных.
Развивать интеграции с Iceberg, Spark, Trino, Impala, Kafka, Kafka Connect и Debezium.
Создавать механизмы контроля качества и полноты данных, обработки ошибок, повторных запусков и восстановления загрузок.
Анализировать и оптимизировать производительность, масштабируемость и потребление ресурсов платформы.
Участвовать в сопровождении потоков при сложных инцидентах.
Требования
2–3 года коммерческой разработки на Python; поддерживаемый и тестируемый код.
Уверенное знание SQL, принципов моделирования и хранения данных.
Понимание особенностей распределённых вычислений, архитектуры и эксплуатации распределённых систем.
Опыт работы с Apache Airflow и Apache Spark.
Культура и преимущества
Трудоустройство в аккредитованную IT-компанию.
ДМС со стоматологией и льготными условиями для членов семьи.
Возможность работать удалённо, гибридно или в офисе в зависимости от города.
Обучение, участие в конференциях и митапах, а также программа Leadership Club.
IT-комьюнити для обмена практиками, поиска решений и профессионального роста.
Социально-психологическая поддержка специалистов по юридическим, психологическим, медицинским, финансовым и lifestyle-направлениям.