Никита П.
- Внедрил стек наблюдаемости (Prometheus, Loki, Grafana) с нуля для low-code платформы, сократив шум от алертов на 50% за счет рефакторинга правил и настройки дедупликации - Автоматизировал управление конфигурацией парка из 30+ Linux-серверов с помощью Ansible, устранив целый класс инцидентов, связанных с ручными ошибками при обновлениях - Обеспечивал надежность микросервисной архитектуры (500+ подов) в Yandex Cloud Managed Kubernetes, отвечая за развертывание, масштабирование и отказоустойчивость. - Разработал Prometheus Exporter на Go для сбора кастомных метрик с внутренних сервисов, обеспечив полную прозрачность их работы для команды - Администрировал кластеры Apache Kafka (on-prem KRaft & Managed в Yandex Cloud), отвечая за ACL, управление топиками и решение инцидентов - Инициировал и провел оценку Dify (LLM) и Nuclio (Serverless), предоставив команде анализ их применимости для ускорения продуктовых гипотез
- Развивал и совершенствовал GitOps-процесс развертывания на базе ArgoCD и Helm для большого количества команд разработки, автоматизируя и унифицируя процессы доставки сервисов и сокращая время их выкатки с дней до часов. - Автоматизировал создание и конфигурацию окружений с помощью Terraform и Ansible, что исключило ошибки ручной настройки и ускорило внедрение новых продуктов - Внедрил систему обратного прокси (HAProxy, Nginx), снизив задержку API на 20% и уменьшив нагрузку на backend-сервисы за счет эффективного кэширования - Разработал утилиту на Python для автоматизации миграции нескольких тысяч секретов в HashiCorp Vault при слиянии инфраструктур, сэкономив десятки часов ручной работы - Диагностировал и устранял узкие места в производительности Linux-сервисов с помощью eBPF и perf, что позволило стабилизировать работу критически важных компонентов под высокой нагрузкой - Участвовал в снижении MTTR за счёт проведения post-mortem анализа инцидентов, подготовки runbook'ов и настройки целевых алертов
- Возглавил техническую часть проекта по импортозамещению сотен рабочих мест на РедОС, разработав kickstart-образ и Ansible-плейбуки для автоматической настройки, что сократило время развертывания одного АРМ с 4 часов до 30 минут - Автоматизировал рутинные задачи (управление пользователями, ротация логов, бэкапы) с помощью Bash и Ansible, высвободив до 20% времени команды для решения более сложных проблем. - Администрировал гетерогенную серверную инфраструктуру (Linux, Windows Server, Docker) и обеспечивал ее мониторинг через Zabbix и Prometheus
Понравился профиль? Создайте себе такой же