bart
PRO
- Сообщения
- 52.801
- Реакции
- 29.009
Apache Spark для дата-инженеров
Spark for Data EngineersАвтор: Joseph Machado
Язык: английский
Apache Spark занял центральное место в стеке современного дата-инженера — без него сложно говорить о промышленной обработке больших объёмов данных. Если вы хотите научиться строить надёжные и быстрые пайплайны, понимать узкие места кластерных вычислений и принимать взвешенные архитектурные решения, этот курс даст именно ту базу, которой не хватает большинству практиков.
Курс устроен как плотный практический воркшоп: минимум абстрактных концепций, максимум работы с реальными датасетами и задачами из продакшн-окружений. Вы пройдёте путь от нуля — настройки локальной инфраструктуры — до полноценного дипломного проекта на 50 ГБ данных StackOverflow с дашбордами и KPI.
Курс построен как практический воркшоп, в котором каждая тема закрепляется через задания и работу с реальными датасетами. Вы пройдёте путь от настройки окружения до разработки полноценного end-to-end конвейера обработки данных.
Программа курса:
- 1. Введение, цели и подготовка окружения
Знакомство с тематикой курса и ожидаемыми результатами. Пошаговая настройка локальной среды и инфраструктуры для выполнения практических заданий, что позволяет сразу перейти к работе со Spark-кластерами. - 2. Обработка данных в Apache Spark
Подробное изучение внутренней архитектуры Spark и ключевых инструментов для распределённой обработки данных:
— Spark I/O: особенности чтения и записи данных из разных систем и форматов.
— DataFrame API: эффективное написание аналитического кода на базе Spark SQL.
— Архитектура приложений: взаимодействие Driver и Executors, распределение задач.
— Трансформации: различия между Narrow и Wide преобразованиями и их влияние на производительность.
— Query Plan: разбор физических и логических планов выполнения запросов.
— Spark UI: анализ джоб, стадий и поиск узких мест в производительности. - 3. Паттерны хранения данных для оптимизации пайплайнов
Как правильно организовывать данные для ускорения аналитики и уменьшения нагрузки на кластеры:
— Колоночный формат: преимущества современных форматов хранения (Parquet, ORC).
— Партиционирование: оптимизация структуры папок с учётом частых запросов.
— Бакетирование: эффективное разбиение высококардинальных колонок. - 4. Оптимизация процессов в Apache Spark
Рабочие техники ускорения Spark-приложений и улучшения их стабильности:
— Оптимизация кода: практики написания производительных трансформаций.
— Конфигурации Spark: параметры, влияющие на распределение ресурсов и скорость выполнения задач. - 5. Финальный дипломный проект (Capstone Project)
Полный конвейер обработки данных от загрузки до визуализации результатов:
— Реальный датасет: работа со структурированными данными StackOverflow объёмом около 50 ГБ.
— End-to-end решение: постановка целей, проектирование архитектуры, обработка, оптимизация и создание финальных дашбордов с KPI.
- Дата-инженерам, которые хотят уверенно работать с Apache Spark в продакшн-среде
- Аналитикам данных, стремящимся перейти к распределённой обработке больших объёмов
- Backend-разработчикам, осваивающим Big Data-стек и пайплайны данных
- Всем, кто хочет разобраться во внутренней архитектуре Spark и научиться оптимизировать запросы
- Специалистам, желающим добавить в портфолио реальный end-to-end проект на 50 ГБ данных
- Уверенное владение Apache Spark и DataFrame API
- Навыки оптимизации запросов, пайплайнов и архитектуры данных
- Понимание внутренних механизмов распределённой обработки: Driver, Executors, Query Plan
- Практику работы с форматами Parquet/ORC, партиционированием и бакетированием
- Готовый дипломный проект для портфолио на реальном Big Data-датасете StackOverflow
Продажник:
Для просмотра вы должны войти или зарегистрироваться.
Скачать:
Скрытое содержимое могут видеть только пользователь группы: PRO
Качать без ограничений Купить доступ к 1 теме
Качать без ограничений Купить доступ к 1 теме
Скрытое содержимое для пользователей: Ferr