Инженер данных в DWH Лавки (RT/NRT и AI-агенты)
Описание
Локация: Москва, офис
Компания
Яндекс развивает DWH Лавки, которое поддерживает аналитику и ключевые операционные процессы бизнеса.
Что делать
Проектировать и развивать RT/NRT-поставки данных для заказов, складских операций, сотрудников и доступности товаров.
Объединять оперативный и batch-контуры, выбирая архитектуру с нужными скоростью, полнотой, стоимостью и надёжностью.
Совместно с системными аналитиками и продуктовыми командами определять источники, модели событий, контракты, требования к свежести и качеству данных.
Исследовать источники и процессы, запускать решения в промышленную эксплуатацию и безопасно развивать DWH с большим графом зависимостей.
Развивать AI-агентов для автономного DWH: предоставлять контекст и инструменты, задавать проверки и ограничения, оценивать результаты и превращать инциденты в новые сценарии автоматизации.
Требования
От одного года опыта проектирования и поддержки промышленных RT/NRT-пайплайнов.
Опыт разработки в крупном DWH или распределённой платформе.
Знание Python, SQL, принципов моделирования данных, качества, наблюдаемости и надёжной эксплуатации.
Умение проектировать обработку событийных данных с учётом задержек, повторной обработки и изменений источников.
Умение превращать неформализованные бизнес-задачи в модели данных и технические решения, сравнивать архитектурные варианты и согласовывать компромиссы.
Практическое использование AI-агентов в инженерной работе и готовность отвечать за результат поставки данных.
Хорошо, если есть
Глубокий практический опыт работы с Apache Flink.
Опыт построения lambda- или kappa-архитектуры и объединения оперативного и batch-контуров.
Опыт запуска платформенных направлений или развития внутренних data-продуктов.
Практика проектирования data contracts, интеграции продуктовых систем и разработки evaluation-процессов для инженерных AI-агентов.
Культура и преимущества
Работа в инженерной роли с полной ответственностью за результат.
Возможность самостоятельно выбирать задачи и развивать решения вместе с продуктовыми командами.
Стек включает Python, SQL, YQL, DMP Suite, YT, Greenplum, ClickHouse, Apache Flink, Flink Flow и LogBroker.
Используются встроенные инструменты Data Quality, мониторинга и управления ETL-процессами.