Манифест №RCU–1507–DEVOPS
ИмяRoman Chuprikov
РольHead of DevOps / Platform Engineering
СтатусУдалённо
Контактroman@chup.ccБлогblog.chup.cc

Строю платформы, на которых команды выпускают продукт быстрее — и спят спокойнее.

Руковожу Platform Engineering, разрабатываю сервисы на Python и использую AI в инженерной работе.

ИзменениеDeliveryProduction
1+ млн / месаудитория платформы1 в неделю → несколько в часчастота релизовчасы → минутыtime to market

Изменения, которые видны в метриках

Не считаю внедрённый инструмент результатом. Результат — когда команды выпускают изменения быстрее, а система остаётся управляемой.

Частота релизов

Deployment frequency
Было
1 в неделю
Стало
несколько в час

Продуктовые команды доставляют изменения без недельной очереди на релиз.

Скорость изменений

Time to market
Было
часы
Стало
минуты

Изменение проходит путь до продакшена быстрее и предсказуемее.

Управляемость

IaC coverage
Подтверждённый охват
100% серверной инфраструктуры

Вся серверная инфраструктура описана как код и воспроизводима.

1+ млн / месаудитория платформысотнисерверов в нескольких ЦОДнесколькоKubernetes-кластеровсотнисервисов в эксплуатации

Как строю платформу

Начинаю не с Kubernetes, а с узкого места в потоке изменений. Затем стандартизирую путь, автоматизирую его и замыкаю обратную связь.

Стандартизировать

Golden path, единые шаблоны и self-service вместо уникального процесса для каждого сервиса.

Контрольные показателиДоля инфраструктуры в IaC · доля типовых пайплайнов

Автоматизировать

Пайплайны, GitOps и инфраструктура как код сокращают путь изменения до продакшена.

Контрольные показателиЧастота релизов · время до продакшена

Наблюдать

SLO, метрики, логи и алерты показывают влияние на пользователей, а не только состояние серверов.

Контрольные показателиДоля сервисов с SLO · доля полезных алертов

Улучшать систему

Инциденты заканчиваются постмортемом, владельцами действий и изменением платформы.

Контрольные показателиВыполнение действий после инцидентов · повторные инциденты

Как управляю командой

Руководил DevOps/SRE-командой из 12 инженеров. Даю контекст и автономию, но ответственность за результат, архитектуру и инциденты оставляю явной.

Связать работу с продуктом

Перевожу технические инициативы в влияние на скорость поставки, надёжность и стоимость изменений.

Контрольные показателиЧастота релизов · время до продакшена · незапланированная работа

Закрепить ответственность

У каждого сервиса, решения и postmortem-действия есть владелец и понятный критерий готовности.

Контрольные показателиСервисы с владельцем · выполнение договорённостей

Сделать риски видимыми

Команда заранее видит ограничения, цену решений и компромиссы между скоростью и надёжностью.

Контрольные показателиОткрытые риски · просроченные действия

Умножать самостоятельность

Делюсь контекстом, выращиваю лидеров и уменьшаю зависимость системы от отдельных людей.

Контрольные показателиЗадачи без эскалации · покрытие зон ответственности

Три контура ответственности

20 лет в инфраструктуре: от системного администрирования до руководства DevOps-функцией. В каждом контуре важны не технологии сами по себе, а изменение способа работы.

Travel-tech

Head of DevOps
Зона ответственности
DevOps-функция и процессы поставки для продуктовых команд.
Что изменил
Собрал единый подход к CI/CD и закрепил ответственность за delivery.
Результат
Единый стандарт CI/CD для продуктовых команд.

Маркетплейс услуг

Delivery transformation
Зона ответственности
Скорость и предсказуемость пути изменения до продакшена.
Что изменил
Перестроил пайплайны и релизный процесс вокруг автоматизации и обратной связи.
Результат
Релизы: от одного в неделю до нескольких в час. Time to market: от часов до минут.

High-load e-commerce

DevOps / Platform
Зона ответственности
Платформа для high-load-продукта и инфраструктура в нескольких ЦОД.
Что изменил
Развивал Kubernetes-платформу и перенёс управление серверной инфраструктурой в код.
Результат
1+ млн посетителей в месяц, сотни сервисов и 100% серверной инфраструктуры в IaC.

Код и инструменты

Подбираю стек под ограничение и метрику. Один и тот же инструмент не заменяет архитектуру, процесс и владельца результата.

AI в инженерной работе

Использую AI как рабочий инструмент в повседневных инженерных задачах.

Сервисы на Python

Разрабатываю сервисы на Python для автоматизации и задач платформы.

Платформа

Kubernetes · Helm · Terraform · Terragrunt · Ansible

Воспроизводимая инфраструктура и self-service для продуктовых команд.

Контрольные показателиДоля инфраструктуры в IaC · применение типовых шаблонов

Поставка изменений

Argo CD · GitLab CI · Jenkins

Короткий и контролируемый путь от коммита до продакшена.

Контрольные показателиЧастота релизов · время до продакшена

Наблюдаемость

Prometheus · VictoriaMetrics · ELK · Grafana

Сигналы о влиянии системы на пользователя и быстрый поиск причин.

Контрольные показателиСервисы с SLO · полезные алерты · повторные инциденты

Облака и ЦОД

AWS · Yandex Cloud · on-premises

Архитектура без привязки к одному способу размещения.

Контрольные показателиЗапас ресурсов · доля инфраструктуры в IaC · стоимость