
Артур А.
Проект: АХД для HR-платформы. B2E и B2B, архитектура хранилища предполагает полный жизненный цикл данных: сырые источники, CDC, доменные события, срезы данных, миграция данных в NRT, data marts как семантический слой для b2e агента и BI-отчетности. Стек: Clickhouse, Airflow, Trino, DBT, Superset, S3, Iceberg, Postgres, Kafka, Python, SQL, Jenkins, Grafana, Bitbucket, Kibana, API, NRT, Data Lake, Data Marts, Semantyc layer, Data Mesh, LLM, AI-agent, CLI, Data Lineage, Data Catalog, Data Governance, Data Quality, Jira, Confluence, SDD Обязанности: - Руководство командой DWH: найм, менторство, развитие, code review, планирование - Развитие и стабилизация АХД Clickhouse. Формирование и реализация архитектуры по стандартам NRT. CDC, domain events→raw → stable → marts → semantic layer. Переход batch → streaming/micro-batch - Миграция на новый кластер ClickHouse с разделением pipelines без остановки старой архитектуры (2 кластера, multi-DC), избавление от legacy решений в интеграциях с Kafka и Airflow. - Data Governance: Data Catalog (OpenMetadata), Data Lineage, DQ по слоям, SDD-стандарты - Внедрение AI-практик - Кросс-функциональное взаимодействие: DBA, SRE, DevOps, QA, MLE, кибербез, CDO Достижения: - Сократил data latency с 24ч до 15мин для wide marts и до ~1 мин для агрегатов - Ускорил приземление CDC-поставок одним разработчиком с 3-5 до 200 в день, включая тестирование и готовность к ПРОМ - Создал semantic layer для B2E-агента и BI; ~20 витрин, сотни pipelines, десятки источников - Обеспечил стабильную параллельную работу старой и новой архитектуры при миграции на новый кластер - Снизил количество инцидентов за счёт DQ-проверок по слоям и стабилизации pipelines - Внедрил OpenMetadata: Data Catalog, Lineage, Governance-дашборды, SDD-документация - Внедрил AI-практики: harness для агента, авторские skills, sub-agents: * автозаполнение Confluence/Data Catalog * сборка feature store по документации MLE * skill по срезу данных и описанию из источника предлагает кастомные dq-проверки для разных слоев ХД * совместно с QA и delievery разработал обвязку из инструментов саб-агента для сборки, раскатки, тестирование и валидации релиза - Ввёл SDD-стандарты в своей и смежных командах - Обеспечил доступ к обезличенным пром-срезам через деперсонализацию и ролевую модель с кибербезом и CDO - Развил команду: нанял DE и BA; вырастил 1 DE с мидла до сеньора, 2 стажёров до мидлов, аналитика с джуна до мидл+
Проект: АХД Clickhouse + Postgres, B2E сервис дэшбордов, ad-hoc аналитики и витрин для ML featurestore Стек: Clickhouse, Airflow, Postgres, Redis, Grafana, k8s, Jenkins, Python, IPC Обязанности: - Разработка и поддержка самописных ETL-сервисов и парсеров на Python - Написание, оптимизация (чтение плана запроса) и код-ревью сложных SQL-запросов - Эксплуатация сервисов в Kubernetes: деплой, поды, деплойменты, сервисы, конфигурации; взаимодействие - Поддержка переливок данных, разбор ошибок и инцидентов - Валидация запросов DA и BA для выгрузок данных, помощь с отладкой, администрирование Git-репозитория - Администрирование метрик и дашбордов в Grafana Достижения: - Разработал парсеры и ETL python pipelines - Увеличил стабильность ETL/ELT процессов в IPC, Airflow - Ввёл правила и best-practies для DA в написании Clickhouse запросов, настроил алертинг по их доработкам в Grafana
Проект: Oracle DWH для SGI Росбанк, BI Publisher для отчётов Стек: Oracle, Postgres, IPC, BI Publisher, Excel, Powershell, Greenplum Pivotal Обязанности: - Разработка ETL в IPC - Развитие DWH Oracle - Написание SQL-скриптов в Oracle, Postgres, PL/SQL, PLPG/SQL - Оптимизация сложных запросов - Интеграция витрин с Oracle BI Publisher - Написание процедур для реализации ролевой модели в Greenplum Pivotal Достижения: - Разработал фреймворк на PowerShell для генерации представлений отчетов, затем перенес его в Jupyter-тетрадку - Закрыл в рамках SLA все активности по отчетности от загрузки данных из источников, до формирование витрин и BI слоя - Составил и защитил план работ по миграции ETL с IPC на Airflow совместно с CA
Понравился профиль? Создайте себе такой же