DevOps Engineer / SRE (Middle+ / Senior)
Мы развиваем платформу складской логистики и интеграций с маркетплейсами, интернет-магазинами и внешними сервисами. Наши системы обрабатывают заказы, складские операции, статусы, этикетки и обмен данными между клиентами, маркетплейсами и WMS.
Ищем DevOps-инженера, который возьмёт на себя развитие, безопасность и надёжность инфраструктуры.
С чем предстоит работать
-
Yandex Cloud;
-
Managed Kubernetes;
-
виртуальные машины Linux;
-
GitLab CI/CD и Container Registry;
-
PostgreSQL, MySQL, MongoDB;
-
Kafka;
-
Redis/Valkey;
-
Object Storage;
-
Yandex Lockbox;
-
nginx и ingress-nginx;
-
Grafana, Prometheus и Loki;
-
VPN, security groups и внутренние облачные сети.
В инфраструктуре работают интеграции с Wildberries, CDEK, Tilda, InSales, Dostavista, Metaship, Kaspi, Bitrix24, Диадок, WMS/WMS и другими внешними системами.
Основные задачи
-
Поддерживать и развивать инфраструктуру в Yandex Cloud.
-
Администрировать Managed Kubernetes и виртуальные машины.
-
Обеспечивать стабильную работу интеграционных сервисов, API и webhook.
-
Развивать GitLab CI/CD: сборку, тестирование, доставку и откат приложений.
-
Сопоставить Kubernetes workloads с GitLab-репозиториями, секретами и владельцами сервисов.
-
Поддерживать nginx, ingress, балансировщики нагрузки, DNS и TLS-сертификаты.
-
Настраивать безопасный административный доступ через VPN и OS Login.
-
Проводить аудит IAM, сервисных аккаунтов, SSH-доступов и групп безопасности.
-
Закрывать избыточные публичные порты и настраивать доступ по принципу минимальных привилегий.
-
Поддерживать PostgreSQL, MySQL, MongoDB, Kafka и Redis/Valkey.
-
Контролировать резервное копирование баз данных, виртуальных машин и Object Storage.
-
Регулярно проверять восстановление из резервных копий.
-
Развивать мониторинг и журналирование в Grafana, Prometheus и Loki.
-
Настраивать технические и бизнес-алерты: ошибки webhook, необработанные заказы, задержки интеграций, Kafka lag, недоступность WMS и внешних API.
-
Участвовать в разборе инцидентов и поиске причин ошибок интеграций.
-
Подготавливать runbook, схемы взаимодействия, инструкции по восстановлению и эксплуатационную документацию.
-
Контролировать использование облачных ресурсов и предлагать варианты оптимизации затрат.
Первые задачи после выхода
-
Провести инвентаризацию Kubernetes: namespaces, deployments, StatefulSets, CronJobs, Services, Ingresses и ConfigMaps.
-
Составить карту «сервис → репозиторий → CI/CD → секреты → базы данных → внешние системы».
-
Проверить публичные IP, открытые порты, security groups и временные SSH-доступы.
-
Настроить полноценное резервное копирование критичных виртуальных машин.
-
Проверить защищённость публичных Object Storage бакетов.
-
Проверить TLS, аудит и журналирование Managed MySQL.
-
Проверить отказоустойчивость Kubernetes и отдельных интеграционных VM.
-
Разделить или дополнительно изолировать production и development workloads.
-
Настроить мониторинг критичных потоков заказов и интеграций.
-
Формализовать RPO, RTO и порядок действий при аварии.
Обязательные требования
-
Опыт работы DevOps/SRE-инженером от 3 лет.
-
Уверенное администрирование Linux.
-
Практический опыт работы с Kubernetes в production.
-
Понимание Deployments, StatefulSets, Services, Ingress, ConfigMaps, Secrets, requests/limits, probes и PodDisruptionBudgets.
-
Опыт построения и сопровождения CI/CD в GitLab.
-
Опыт работы с Docker и контейнерными реестрами.
-
Опыт работы с одним из крупных облачных провайдеров. Опыт Yandex Cloud будет преимуществом.
-
Понимание облачных сетей: подсети, маршруты, NAT, VPN, security groups, load balancers и DNS.
-
Опыт настройки nginx или ingress-nginx.
-
Умение работать с PostgreSQL или MySQL: резервное копирование, репликация, мониторинг и восстановление.
-
Опыт эксплуатации систем мониторинга и журналирования.
-
Понимание принципов IAM, управления секретами и минимальных привилегий.
-
Опыт автоматизации инфраструктуры и повторяющихся операций.
-
Умение диагностировать проблемы распределённых систем по логам, метрикам и сетевым трассировкам.
-
Готовность документировать изменения и создавать понятные инструкции.
Будет преимуществом
-
Опыт работы с Yandex Cloud и его CLI/API.
-
Опыт эксплуатации Managed Kubernetes в Yandex Cloud.
-
Знание Terraform.
-
Опыт работы с Helm, Argo CD или аналогичными GitOps-инструментами.
-
Опыт эксплуатации Kafka и контроля consumer lag.
-
Практический опыт работы с MongoDB и Redis/Valkey.
-
Опыт настройки Loki, Prometheus и Grafana.
-
Опыт сопровождения webhook и интеграций с маркетплейсами.
-
Опыт построения отказоустойчивой инфраструктуры в нескольких зонах доступности.
-
Опыт проведения security-аудита облачной инфраструктуры.
-
Знание Python, Bash или другого языка автоматизации.
-
Опыт работы с высоконагруженными системами обработки заказов и складской логистикой.
Что мы ожидаем от подхода к работе
-
Сначала разобраться в существующей системе, а затем предлагать изменения.
-
Не вносить изменения в production без понятного плана и возможности отката.
-
Не хранить пароли, токены и ключи в исходном коде и CI/CD-конфигурациях.
-
Проверять восстановление из резервных копий на практике.
-
Устранять первопричины инцидентов, а не только их последствия.
-
Объяснять технические решения понятным языком.
-
Фиксировать архитектуру, зависимости и порядок действий при авариях.
Ожидаемый результат работы
-
Понятная и актуальная документация по инфраструктуре.
-
Управляемые и воспроизводимые процессы доставки приложений.
-
Минимально необходимые права доступа.
-
Контролируемые публичные точки входа.
-
Проверенные резервные копии и инструкции по восстановлению.
-
Мониторинг технических и бизнес-показателей.
-
Снижение количества аварий и времени восстановления.
-
Прозрачное использование ресурсов Yandex Cloud.
Ключевые навыки
- Python
- Git
- DevOps
- Gitlab
- MySQL
- PHP