DevOps-инженер
Описание
Привет! Строим гибкую cloud‑first инфраструктуру для обучения и инференса больших моделей, а также для сопутствующих микросервисов. Наша среда — это гибрид частных облаков OpenStack и современных инструментов оркестрации. Мы ищем инженера, который не просто поддерживает, а разрабатывает инфраструктуру как продукт, делает её предсказуемой, масштабируемой и безопасной — от железа до пода. Чем предстоит заниматься: Проектированием и развитием cloud‑first инфраструктуры, которая одинаково надёжно работает как для ML‑задач (GPU‑кластеры, инференс), так и для микросервисного окружения. Построением и оптимизацией CI/CD пайплайнов в GitLab CI — кэширование, управление артефактами, параллелизация, сокращение времени сборки. Деплоем, отладкой и масштабированием кластеров Kubernetes (kubeadm/k0s), включая настройку Ingress, HPA/VPA, Network Policies, работу с Helm-чартами. Управлением частными облаками на базе OpenStack — развёртывание, конфигурация, мониторинг ресурсов, работа с проектами и квотами. Настройкой систем мониторинга и наблюдаемости: Prometheus + Grafana (дашборды, алертинг), Loki для логов, внедрение SLO/SLI и отслеживание их выполнения. Реализацией инфраструктуры как кода (IaC) с помощью Terraform/Terragrunt — разработка модулей, управление состоянием (state), удалённые бэкенды, интеграция с Ansible для конфигурации. Обеспечением безопасности на всех уровнях: управление секретами (Vault / Sealed Secrets), настройка RBAC, сетевых политик, hardening ОС и кластера. Администрированием Linux-серверов, диагностикой производительности, написанием скриптов на Bash и Python для автоматизации рутинных задач. Чего ожидаем от тебя: Опыт коммерческой работы от 5 лет в роли DevOps / SRE / Platform Engineer. Глубокое знание GitLab CI: построение сложных пайплайнов, стратегии кэширования, работа с артефактами и зависимостями. Экспертное владение Kubernetes: установка и конфигурация кластеров (kubeadm/k0s), отладка подов, горизонтальное и вертикальное масштабирование, работа с Ingress-контроллерами, сетевыми политиками. Опыт работы с OpenStack: управление проектами, инстансами, сетями, хранилищами. Настройка мониторинга на базе Prometheus + Grafana: разработка дашбордов, настройка алертов, работа с Loki, понимание SLO/SLI. Практика с Terraform/Terragrunt: модульная структура, управление state, использование remote backends, и Ansible для конфигурации серверов. Знание инструментов безопасности: Vault / Sealed Secrets для секретов, тонкая настройка RBAC, Network Policies, hardening Linux и Kubernetes. Уверенное администрирование Linux, умение диагностировать проблемы (нагрузка, сеть, диски), писать скрипты на Bash и Python. Самостоятельность в постановке задач, проактивный поиск узких мест, отличная коммуникация с разработчиками и коллегами. Готовность к on‑call поддержке инфраструктуры (on-call не полноценное, а если алерт пришел). Будет плюсом: Опыт с GitOps (ArgoCD / FluxCD) — управление декларативными состояниями. Углублённые навыки в безопасности: работа с Vault, SOPS, политики OPA/Gatekeeper. Мультипроектность — умение вести инфраструктуру для нескольких продуктов одновременно. Опыт в MLOps: инференс-серверов, оптимизация моделей, оркестрация и мониторинг GPU; работа с S3-совместимыми хранилищами (MinIO, AWS) и Model Registry (например, ClearML). Что готовы предложить: Реальные задачи на стыке DevOps и MLOps — редкое сочетание для профессионального роста. Вклад в развитие сложного высоконагруженного продукта: все решения принимаются командой, ты можешь на них влиять и будешь видеть результаты своего труда. Развитие и обучение: предсказуемый онбординг, помощь наставника; оплата тренингов, семинаров и конференций, корпоративная библиотека. Стабильность и прозрачность: оформление по ТК, пересмотры зарплаты по итогам performance review. Неформальная рабочая атмосфера: отсутствие бюрократии, гибкость процессов. ДМС после испытательного; другие "плюшки" в виде классного мерча, заботы о сотрудниках и т.д. Возможность посетить Владивосток, лично познакомиться с коллегами, а также насладиться красотой региона :)