← К результатам

DevOps-инженер (Observability / GPU & AI Infrastructure) / Middle–Senior

з/п не указана
Центр информационных технологий Республики Татарстан · Россия, Казань, Спартаковская улица, 2
Полный день Постоянная занятость опыт от 3 лет
Откликнуться на источнике →

Описание

Обязанности: Развитие стека observability: Prometheus/VictoriaMetrics (long-term storage, vmagent/vminsert/vmselect), Loki + Promtail, Grafana Alloy, OpenTelemetry Collector, Tempo, Alertmanager. – Настройка алертинга: SLO/SLI, разумные пороги, эскалации (без «шумных» алертов), интеграция с on-call (PagerDuty/Opsgenie/Telegram). – Разворачивание и оптимизация vLLM на серверах с GPU A100/H100/B200 — NVLink, multi-GPU inference, батчинг, KV-cache tuning. – Работа с AI-агентами: мониторинг их работы, логирование вызовов, трейсинг через OTel/Tempo, изоляция workload'ов через gVisor/runc RuntimeClass (безопасное исполнение недоверенного/агентского кода). – Поддержка сетевого слоя: Cilium (CNI, Hubble, network policies), Traefik + Gateway API, желательно знание Istio (service mesh, mTLS, traffic shaping). – Автоматизация через Ansible, управление Proxmox-виртуализацией (VM lifecycle, GPU passthrough, NUMA-тюнинг, шаблоны, HA). – Диагностика инцидентов на всех уровнях стека: от control-plane Kubernetes до python/node.js-приложений. Требования: Опыт работы в DevOps/SRE от 3 лет. – Опыт с Kubernetes в production, развёртывание кластеров на bare-metal серверах. – Глубокое знание Prometheus/VictoriaMetrics/Grafana/Loki, умение писать PromQL/LogQL. – Опыт настройки алертинга без «alert fatigue» — приоритизация, дедупликация, роутинг. – Понимание GPU-инфраструктуры: драйверы NVIDIA, GPU Operator, MIG/passthrough. – Опыт деплоя LLM inference серверов (vLLM, TGI, Triton). – Ansible на уровне идемпотентных playbook'ов, Proxmox API. – Понимание Cilium/eBPF, Gateway API; Istio Service Mesh. – Уверенный Linux (systemd, cgroups, iptables/nftables, дисковая и сетевая подсистема). – Docker/containerd: сборка образов, дебаг контейнеров, работа с runtime-классами (runc, gVisor, kata). – Умение дебажить Python-приложения (трейсбеки, py-spy, cProfile, asyncio/GIL-специфика). – Умение дебажить Node.js-приложения (heap dump, CPU profile, event loop lag, memory leaks). – Навыки низкоуровневой диагностики: strace/ltrace/tcpdump/perf. – Понимание сетевых протоколов и инструментов для отладки проблем в кластерах. Будет плюсом: – Опыт с AI-агентами (LangChain, LlamaIndex, кастомные оркестраторы) в контексте инфраструктуры – Опыт troubleshooting reliability проблем в etcd/control-plane – Опыт миграции с чистого Prometheus на VictoriaMetrics – Опыт работы с песочницами/sandbox- исполнением кода (gVisor, Firecracker, Kata Containers) Условия: Официальное трудоустройство в соответствии с ТК РФ; Стабильная «белая» заработная плата, выплаты два раза в месяц (5 и 20 число), уровень зарплаты обсуждается по итогам интервью; Комфортный офис в центре города (новый айти-парк); График работы, 5/2; Поддержка профессионального развития; Участие в конференциях и обучающих мероприятиях за счет компании; Демократичный, молодой коллектив. Неформальные встречи и корпоративные мероприятия. Бронирование через военкомат при наличии военного билета (для военнообязанных) и айти-отсрочка. Дресс-код casual

Источник: hh · Опубликовано: 3 дня назад