Владимир В.
DBs and Storages: ClickHouse, PostgreSQL - ETL: Airflow (Python), Kafka Engine, Debezium (CDC) - Tableau/ SuperSet, Kafka, Python3 Проект по разработке ДВХ для real-time отчетов. Занимались переносом старых батчевых отчетов на real-time, выбор архитектуры, ETL-загрузки, подключение новых источников, написание витрин. Команда на разных этапах состояла из: 5-6 Bi-разработчиков 1 head of data 1 руководитель проекта 2-5 инженеров данных · Разработал и внедрил архитектуру near real-time отчетности для транзакционной системы криптоплатежей, обеспечив задержку обработки данных < 1 минуты. · Провел R&D стриминговых решений: сравнил подходы на базе Apache Flink и нативной связки ClickHouse (Materialized Views) + Kafka Engine, в результате чего выбрал второе решение для снижения инфраструктурных затрат и упрощения пайплайнов. · Организовал ETL/ELT-процессы в Apache Airflow (Python): настроил DAG-и для оркестрации, мониторинга и обработки сбоев при построении витрин данных. · Разработал Materialized Views (MV) и агрегационные движки в ClickHouse для моментальной агрегации транзакций, исключив необходимость в тяжелых ad-hoc запросах. · Разработал ролевую модель (RBAC) и систему ограничения доступа на уровне строк (Row-Level Security). Оптимизировал затраты на лицензирование BI-инструментов, сократив количество необходимых платных пользовательских лицензий на 70% за счет внедрения ролевой консолидации и shared-аккаунтов, при этом четко разграничив доступ к чувствительным платежным данным через RBAC.
Стек: - DBs and Storages: PostgreSQL (managed by Yandex), ClickHouse, S3, Spark, Trino, Oracle, API, Files, Iceberg/Parquet format - ETL: Dagster (Python), FDW, DBT, NiFi, Debezium (CDC) - Docker, Kafka, Jira, Confluence, Gitlab, Python3, DataHub Проект по построению ДВХ с нуля. Проект и задачи были обширные, проработка архитектуры, модели данных, интеграции с источниками, ETL-загрузки, написание витрин. Весь перечень работ инженера данных. Команда состояла на разных этапах следующим образом: От 2 до 4 аналитиков/Bi-разработчиков От 2 до 4 инженеров данных 1 руководитель команды Ключевые достижения: - Спроектировал и разработал полнофункциональную ETL/ELT-систему на Dagster и DBT для интеграции 10+ источников (PostgreSQL, MySQL, Oracle, API, файлы) в единый DWH, уложившись в строгий ETL-окно ≤3 часов, включая трансформации и DQ-проверки. - Разрабатывал Spark-джобы (pySpark/Spark в dbt) для обработки и трансформации больших обьемов данных в ETL-пайплайнах - Внедрил near real-time отчётность с использованием Debezium (Change Data Capture) и потоковой передачи в ClickHouse, что позволило бизнесу сократить лаг данных и повысить скорость принятия решений аналитиками. - Оптимизировал критичные SQL-запросы и архитектуру DWH (добавил индексы, стратегию партиционирования, денормализацию для витрин), сократив время построения аналитических витрин в 2 раза и значительно снизив нагрузку на базы данных. - Разработал и внедрил систему комплексного мониторинга и алертинга ETL-процессов (интеграция Dagster с логированием, метриками и уведомлениями), что исключило появление незамеченных сбоев и сократило время реакции на инциденты с нескольких часов до 5–15 минут. - Реализовал фреймворк Data Quality с метриками, SLA, автоматическими проверками и уведомлениями, что повысило надёжность данных, уменьшив количество критичных ошибок в отчётности на 70%. - Внедрил Data Hub как централизованный каталог данных с полным Data Lineage от источников до BI-отчётов, что сократило время поиска данных аналитиками и ускорило онбординг новых сотрудников в 3 раза. - Разработал стратегию развития DWH, включая стандарты именования и структурирования таблиц, правила документирования, CI/CD-процесс для ETL и подход к тестированию пайплайнов. - Разработал и внедрил кастомное решение для маскирования персональных данных в тестовых средах, что сэкономило компании ~50 000 USD на лицензиях коробочных решений (Delphix) и обеспечило 100% покрытие тестовых баз данных. - Проводил собеседования, участвовал в формировании состава команды Data Engineer и проведении технических интервью.
Стек: - DBs and Storages: Greenplum (Arenadata), HDFS, Oracle - ETL: Airflow (Python), PXF - Docker, Kibana, TeamCity(CI/CD), Jira, Confluence, Gitlab/Bitbucket Проект по развитию корпоративного хранилища данных. Работал в двух командах - загрузки данных с источников, core команда, где занимались разработкой ETL-фреймворка второй версии. Состав команды: Руководитель 3-5 Инженеров 3-5 Аналитиков Ключевые достижения: - В составе core-team участвовал в разработке внутренних ETL-инструментов и фреймворков, включая генерацию пайплайнов, переиспользуемые шаблоны DAG'ов и стандартные операторы, что сократило time-to-market новых загрузок данных. - Написал и оптимизировал многочисленные ETL/ELT-процессы на Airflow для загрузки данных из различных источников в Greenplum, обеспечивая соответствие SLA и качество данных. - Оптимизировал критичные хранимые SQL-процедуры и запросы в Greenplum/Oracle, снизив риск нарушения SLA. - Участвовал в минорной миграции Apache Airflow, включая планирование, тестирование существующих пайплайнов на новой версии и координацию релиза без downtime критичных процессов. - Участвовал в онбординге новых сотрудников, помогал в разработке внутренней документации и стандартов.
Проект: Разработка стартапов и web-приложений для подбора товаров в сфере закупок и объектов недвижимости Стек: Python, PostgreSQL, MySQL, Git Ключевые достижения: - Разрабатывал MVP и прототипы веб-сервисов на базе математических алгоритмов нечёткой логики в сотрудничестве с профессором Воронежского государственного университета. - Занимался парсингом, обработкой и валидацией данных, написанием DDL/DML-запросов, интеграцией с PostgreSQL и MySQL. - Имею опыт общения с заказчиками, понимания бизнес-требований, написания технической документации и построения моделей данных.
Понравился профиль? Создайте себе такой же