Инженер данных
Описание
Чем ты будешь заниматься: Проектировать и разработать ETL-процессы (batch). Создавать backend-сервисы на Python для обработки данных и интеграции с внешними системами. Инжиниренно оптимизировать ML-проекты: рефакторить и оборачивать в продакшен пайплайны обучения и инференса, обеспечивая стабильность, воспроизводимость и наблюдаемость. Участвовать в проектировании хранилищ данных и оптимизации существующих решений. Стек технологий: Язык и фреймворки: Python 3, PySpark, Pandas, FastAPI, Pydantic Хранилища и вычисления: PostgreSQL, ClickHouse, Greenplum, Trino, S3 Оркестрация и ML: Apache Airflow, MLflow Инфраструктура: Docker, Kubernetes, Git, GitLab CI/C Мы ожидаем Опыт коммерческой разработки на Python не менее 2 лет; владение стандартной библиотекой и экосистемой data-разработки. Понимание принципов построения ETL/ELT-процессов. Опыт работы с распределёнными СУБД (Greenplum, ClickHouse) и вычислительными движками (Apache Spark, Trino). Оркестрация пайплайнов в Airflow. Верхнеуровневое понимание жизненного цикла ML-моделей. Основы CI/CD и DevOps: сборка, тестирование, деплой. Навыки работы в командной строке Linux. Контейнеризация (Docker). Использование ИИ-ассистентов в разработке (opencode или аналоги) для ускорения написания и ревью кода.