• TopKursy - РЕДКИЕ Удаленные КУРСЫ!

    Эксклюзивные материалы, недоступные на других источниках.

    Откройте доступ к уникальным знаниям прямо сейчас!

    Подробнее

Скоро! Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Тариф Основательный подход] [Д. Володин, Б. Житников, И. Матвеев]

Статус
В этой теме нельзя размещать новые ответы.
EGround

EGround

Редактор
Сообщения
68.317
Реакции
287

Складчина: Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Тариф Основательный подход] [Д. Володин, Б. Житников, И. Матвеев]​


Screenshot_20.png


Научитесь строить:


  • надежные ETL-пайплайны на базе Dagster и Apache NiFi,
  • применяя Software Defined Assets и кастомные IOManager для сбора и записи данных в PostgreSQL.

Вы освоите автоматизацию обработки информации через внешние API и развертывание оркестратора в контейнерах Docker.

Спойлер: Программа Модуль 1
Dagster

ETL, оркестрация и активы данных

От теории ETL до production-деплоя Dagster: учимся проектировать пайплайны, работать с Software Defined Assets, ресурсами, партициями, расписаниями и интеграцией с dbt.

0 Теория ETL — доступно в бесплатной части

Теоретический фундамент инженерии данных: как сырая информация превращается в бизнес-ценность через ETL-процессы. Разбираем OLTP и OLAP, batch и stream обработку.

Чему вы научитесь:

  • Выбирать ETL, ELT или EtLT под требования бизнеса к скорости и качеству данных.
  • Извлекать и нормализовать данные на Python.
  • Готовить первый пайплайн к загрузке в аналитическое хранилище.

1 Введение в Dagster — доступно в бесплатной части

Погружаемся в экосистему Dagster и переход от выполнения задач к управлению активами данных через Software Defined Assets. Разбираем декларативный подход, ресурсы и проверки качества.

Чему вы научитесь:

  • Проектировать устойчивые пайплайны данных.
  • Разделять бизнес-логику и инфраструктуру через IOManagers и Resources.
  • Запускать локальный проект Dagster и настраивать Asset Checks.

2 SDA в Dagster — доступно в бесплатной части

Практика работы с Software Defined Assets: пишем первый ассет, настраиваем зависимости, добавляем метаданные и смотрим граф данных в UI.

Чему вы научитесь:

  • Проектировать связанные цепочки ассетов.
  • Управлять контекстом выполнения и логированием.
  • Внедрять Asset Checks, которые блокируют обработку данных при ошибках.

3 Configurable Resource

Цель урока: Научиться создавать собственные ресурсы для работы с внешними системами.
Практика на уроке: Создадим подключение к внешнему API.
4 IOManager

Цель урока: Научиться создавать инструменты для сохранения и последующего использования данных из SDA.
Практика на уроке: Создадим IOManager для записи сырых данных в PostgreSQL.
5 Partitions

Цель урока: Научиться разбивать SDA на более мелкие логические и физические части.
Практика на уроке: Разделим данные по дате, напишем методы для ресурса и менеджера.
6 Автоматизация

Цель урока: Научиться создавать правила для автоматического получения и обработки данных.
Практика на уроке: Напишем несколько расписаний и зададим правила для автоматической материализации ассета.
7 Ops, Jobs, Hooks

Цель урока: Научиться управлять задачами, которые не связаны напрямую с данными.
Практика на уроке: Создадим утилитарные задачи для запуска из UI, добавим алертинг и юнит-тесты.
8 Интеграция с dbt

Цель урока: Запустить dbt-проект в Dagster.
Практика на уроке: Познакомимся с подходами к интеграции, добавим расписание и настройку партиционирования.
9 Деплой

Цель урока: Запустить Dagster в Docker.
Практика на уроке: Запустим все, что сделали ранее, отдельно, и подготовим к релизу в production.
Модуль 2 NiFi
Потоки данных и визуальная обработка

Учимся собирать data flow: получать данные из внешних источников, обрабатывать, разделять, маршрутизировать и сохранять их в PostgreSQL.

10 Введение в NiFi

Получите понимание, какие задачи может решать NiFi, а для каких лучше выбрать другой инструмент.

11 Получение и обработка данных

Цель урока: Научиться создавать потоки NiFi, получать данные и выполнять простейшие операции обработки.
Практика на уроке: Создадим подключение к внешнему API.

12 Сохранение данных

Цель урока: Научиться обрабатывать структурированные данные и сохранять их в системы.
Практика на уроке: Создадим поток для записи сырых данных в PostgreSQL.
13 Сложная обработка

Цель урока: Разобраться со сложными механизмами обработки и управления данными.
Практика на уроке: Будем делить данные, управлять обработкой и распределением данных в кластере.

Модуль 3 DLT
Пайплайны, API, файлы и end-to-end проект

Собираем практический стек DLT: ресурсы и источники, REST API, файловые источники, S3, интеграцию с Dagster и финальный пайплайн.

14 Знакомство с DLT и создание первого пайплайна

  • Установка DLT и настройка рабочего окружения.
  • Работа с демонстрационными данными о шахматных партиях.
  • Загрузка данных в DuckDB и анализ через SQL-клиент.

15 Ресурсы и источники данных в DLT

  • Понятия @dlt.resource и @dlt.source, их назначение и различия.
  • Создание ресурсов для работы с CSV-файлами.
  • Подключение к ClickHouse как источнику данных.

16 Работа с REST API и конфигурацией

  • Подключение к GitHub API для получения issues и данных о контрибьюторах.
  • Использование встроенного источника rest_api_source.
  • Настройка пагинации для обработки больших объемов данных.

17 Загрузка файлов из различных источников

  • Работа с локальными и облачными файлами.
  • Обработка Parquet-файлов на примере данных о поездках самокатов.
  • Подключение и загрузка данных из Amazon S3.
  • Анализ загруженных данных: подсчет записей в таблице events.

18 Интеграция с Dagster

  • Создание проекта Dagster с помощью scaffold.
  • Работа с @dlt_assets для управления активами данных.
  • Кастомизация пайплайнов через DagsterDltTranslator.
  • Безопасное хранение токенов и конфигурации через .env файлы.

19 Практический проект: end-to-end пайплайн

  • Создание единого пайплайна с интеграцией API, ClickHouse и файловых источников.
  • Настройка ассетов и мониторинг через интерфейс Dagster.
  • Валидация результатов: консолидация всех данных в едином хранилище.

Стек, который вы освоите на курсе: Dagster, SDA (Software Defined Asset), IOManager, dbt, Docker, PostgreSQL, API Integration, NiFi, DLT

Почему на базе Dagster и NiFi?

Dagster – ключевой инструмент Modern Data Stack. Он дает инженерам гибкость и контроль, недоступные в старых решениях, позволяя строить сложные и надежные пайплайны.

Как проходит обучение?
Наш подход к обучению стирает границы между теорией и практикой, предлагая вам немедленное применение знаний в реальных условиях. Забудьте о скучных видеолекциях и бесконечном запоминании правил.

Вас ждет более 60 задач из разных бизнес-сфер, которые вы возьмете в портфолио

Тариф Основательный подход

Цена 39000 руб.


Материал «Курс по ETL-разработке и оркестрации на Dagster и Apache Nifi, DLT [Тариф Основательный подход] [Д. Володин, Б. Житников, И. Матвеев]», возможно, скоро появится на EGROUND.
Воспользуйтесь поиском, может быть, он уже опубликован.
 
Статус
В этой теме нельзя размещать новые ответы.

Похожие темы

Сверху Снизу