Инженер данных / Data Engineer
Описание
ФАУ НИА — оператор ФГИС Росаккредитации, занимающийся разработкой информационных систем, обработкой данных, научными исследованиями, издательской деятельностью и продвижением стандартов оценки соответствия.Мы развиваем экосистему работы с данными и ищем эксперта, который умеет превращать хаос legacy-структур в стройную архитектуру. Нам нужен человек, готовый погрузиться в недра ФГИС, восстановить скрытые связи и построить эффективные витрины данных для аналитиков и бизнеса. Чем предстоит заниматься: 1. Анализ и документирование текущих структур данных Проведение реверс-инжиниринга баз данных ФГИС и корпоративного аналитического хранилища данных (DWH). Описание логических и физических моделей: таблиц, полей, типов данных, первичных и внешних ключей, существующих взаимосвязей. Выявление недокументированных полей и скрытых зависимостей между сущностями. Разработка и поддержка наглядных ER-диаграмм в нотациях Crow’s Foot, IDEF1X или UML с помощью draw.io, DBeaver, DataGrip или аналогичных инструментов. Создание карты источника (Source-to-Target Mapping): от сырых слоёв ФГИС до витрин аналитического хранилища. 2. Анализ и документирование потоков и механизмов движения данных Инвентаризация существующих скриптов загрузки: SQL, Python, bash, хранимые процедуры. Инвентаризация средств оркестрации и смежных инструментов: Apache Airflow, Yandex DataLens, MS SSIS, Cron, проприетарные системы ФГИС. Построение схем движения данных (Data Flow Diagrams, DFD): источники, этапы трансформаций — staging, ODS, DM, — конечные витрины и отчёты. Фиксация SLA потоков: периодичности, длительности и зависимостей между задачами. Формирование реестра и каталога данных с указанием бизнес-наименований, технических полей и восстановленных правил расчёта. 3. Проектирование и создание представлений и витрин данных Анализ требований аналитиков данных и бизнес-заказчиков к отчётности. Проектирование логических и физических моделей витрин данных: выбор гранулярности, состава полей и типов агрегаций. Реализация материализованных представлений и витрин данных на SQL с использованием DDL/DML с учётом производительности и стратегии обновления: инкрементальная загрузка, полная перезагрузка (full refresh). Документирование витрин: источники, правила расчёта и периодичность обновления. Оптимизация витрин: индексы, партиционирование, вакуумирование, анализ статистики. 4. Проектирование и разработка средств построения потоков данных Разработка, рефакторинг и поддержка скриптов загрузки: SQL-пайплайны, Python, bash, Spark-задания. Проектирование графов оркестрации (DAG) в Airflow или аналогичных инструментах: определение зависимостей, политик повторных попыток и алертов. Реализация пайплайнов для последовательной загрузки и очистки данных между слоями staging, ODS, DDS и DM. Внедрение SCD (Slowly Changing Dimensions) типов 1 и 2 при необходимости. Написание воспроизводимых и тестируемых скриптов с логированием и обработкой ошибок. Мы ожидаем от тебя: Опыт и технические навыки Опыт работы с реляционными базами данных: PostgreSQL, Oracle, MS SQL, MySQL. Глубокое знание системных каталогов и информационных схем, включая information_schema. Навыки профилирования запросов. Продвинутый уровень владения SQL: MERGE, оконные функции, CTE, сложные JOIN, написание запросов для анализа связей и генерации документации. Знание инструментов моделирования и визуализации: draw.io, DBeaver (ERD), DataGrip, dbdiagram.io, ER/Studio или PowerDesigner. Понимание принципов проектирования витрин данных и dimensional modeling по Кимбаллу, нормализации и денормализации, схем «звезда» и «снежинка». Умение переводить требования аналитиков в физическую схему витрины. Опыт разработки ETL/ELT-процессов на SQL, Python и bash. Понимание паттернов инкрементальной загрузки и SCD. Опыт работы с Apache Airflow или аналогичными инструментами: Prefect, Dagster, SSIS. Умение писать DAG и задачи, использовать операторы и настраивать сенсоры. Опыт создания качественной технической документации с примерами SQL и кода. Личные качества Педантичность и системное мышление, необходимые для описания хаотичных legacy-структур. Умение превращать сотни таблиц в одну понятную схему. Коммуникабельность и готовность выяснять требования у аналитиков и разработчиков ФГИС. Будет преимуществом Опыт работы со спецификой ФГИС: системами ФНС, ФТС, ЕГАИС, «Честный ЗНАК», ГИС ЖКХ или другими государственными информационными системами. Знание типовых особенностей обмена данными в государственных информационных системах. Навыки написания Python-скриптов для автоматизации сбора метаданных и выгрузки схем в Confluence или Excel. Опыт использования Data Catalog: DataHub, OpenMetaData, Collibra, Amundsen. Опыт работы с dbt (data build tool), трансформациями и управлением витринами через dbt. Понимание Data Vault 2.0 или Anchor Modeling, а также продвинутых моделей для промежуточных слоёв. Навыки тестирования пайплайнов: написание unit-тестов для проверки количества записей, уникальности ключей и отсутствия дублей. Навыки профилирования производительности и поиска узких мест в загрузке на стороне источника или хранилища. Опыт работы с Jupyter или Zeppelin для демонстрации аналитикам примеров связей между таблицами. Мы предлагаем: Работу в офисе класса "А" БЦ Павелецкая плаза (в шаговой доступности от метро) Официальное трудоустройство и полностью белая заработная плата График работы 5/2 с 09.00 до 18.00 (в пятницу до 17.30) Комфортный формат работы (офис на испытательном сроке, гибрид на основном) Конкурентный уровень дохода (обсуждается с успешным кандидатом по итогам интервью) Премии (ежемесячные, квартальные, годовые) Социальные и иные гарантии, предусмотренные ТК РФ Возможность самореализации в надежной и стабильной компании Будем очень рады видеть в своей команде активного, открытого, честного, ответственного и позитивного будущего коллегу. С нетерпением ждем отклик!