Data engineer (Senior)
Описание
Привет! Мы - аккредитованная IT компания Maxim Technology. Занимаемся разработкой платформы для пассажирских и грузовых поездок. Самый крупный из наших заказчиков - сервис maxim. Мы первыми начали менять рынок поездок, создав для maxim цифровую платформу для связи пассажира и водителя раньше Uber и Gett. Сегодня наша команда работает над высоконагруженными сервисами: в сутки платформа обрабатывает более миллиона заказов. Наше ПО - лидер рынка в регионах России, и мы не собираемся останавливаться на достигнутом! Компания растёт быстрыми темпами и сейчас в штате более 500 IT-специалистов. Офисы располагаются в Кургане, Челябинске, Тюмени, Набережных Челнах, Казани, Екатеринбурге и Санкт-Петербурге, но у нас можно работать и удалённо. Сейчас мы расширяем команду и находимся в поисках Senior Data-инженера. Что нужно будет делать: Проектировать и развивать ETL-фреймворк на Python/Airflow; Развивать core-библиотеки команды; Строить Data Quality подсистему: проверки качества данных, интеграция с OpenMetadata, алертинг и управление инцидентами; Участвовать в модернизации DWH: переход DDS на Data Vault, развитие Metric Store и слоя витрин, развитие ODS слоя, стандартизация потоков данных; Внедрять мониторинг, CI/CD, тестирование. Мы ожидаем от кандидата: Понимание и опыт применения методологий моделирования данных: Dimensional Modeling, концепции SCD (Slowly Changing Dimensions), базовые принципы Data Vault 2.0; Умение анализировать источники данных (SQL-запросы, API, логи, сырые файлы), выявлять бизнес-сущности, связи, аномалии и правила трансформации; Уверенный Python 3.9+ (разработка модульного кода, а не только скриптов); Опыт проектирования ETL/ELT в стеке Airflow + PostgreSQL/Greenplum/ClickHouse; Глубокое понимание архитектуры Greenplum/PostgreSQL: дистрибуция данных, партиционирование, оптимизация запросов, настройка производительности, работа с блокировками и транзакциями; Уверенное владение ClickHouse: семейство движков MergeTree, шардирование и репликация, материализованные представления, словари, оптимизация запросов к большим объёмам данных; Опыт работы с Docker, Git, CI/CD; Умение писать тесты (pytest), работать с линтерами и форматерами; Продвинутый SQL (оконные функции, CTE, сложные JOIN). Опыт работы с PostgreSQL (как основой для Greenplum) обязателен. Будет плюсом: Опыт с каталогами метаданных (OpenMetadata, DataHub, Amundsen); Опыт разработки DQ-фреймворков (собственных или на базе существующих); Опыт разработки библиотек/SDK для внутреннего использования; Опыт с Spark; Опыт работы с Data Lake \ Data Lake House. Что дальше? У нас простой процесс подбора. Тебя ждет интервью с HR и руководителем команды и после этого мы выходим с оффером. Отправляй свой отклик! Мы тебя ждем.