Экосистема Hadoop, Spark, Hive
Программа охватывает ключевые компоненты экосистемы, включая архитектуры HDFS и YARN, работу с потоковыми данными и интеграцию CI/CD-процессов
от 49 500₽
Для физ. лиц - 49 500₽
Для организаций - 59 500₽
Ближайшая группа
13.07.2026-17.07.2026
Формат
Гибридный
Длительность
40 часов
Часы занятий
10:00–17:00
Целевая аудитория
Курс рассчитан на Data инженеров, желающих глубже изучить Spark, а попутно также Hadoop и Hive
Необходимая предварительная подготовка
- Опыт написания кода хотя бы на одном из следующих языков: Python, Java, Scala
- Базовое знание SQL и опыт работы с любой реляционной базой данных
Получаемые знания и навыки
По окончании курса слушатели научатся- Использовать Hadoop для обработки данных
- Взаимодействовать с его компонентами через консольные клиенты и API
- Работать со слабоструктурированными данными в Hive
- Писать и оптимизировать приложения на Spark
- Писать тесты для Spark-приложений
- Использовать Spark для обработки табличных, потоковых, гео-данных и даже графов
- Настраивать CI и мониторинг Spark-приложений
от 49 500₽
Для физ. лиц - 49 500₽
Для организаций - 59 500₽
Программа курса
- Основы Scala
- Сборка проектов на Scala
- Hadoop
- HDFS
- YARN
- Форматы данных
- Архитектура приложения Spark
- RDD/Dataframe/Dataset
- Методы оптимизации приложений Spark
- Написание коннекторов для Spark
- Тестирование приложений Spark
- Spark ML
- Kafka
- Spark Streaming
- Structured Streaming
- Flink — часть 1
- Flink — часть 2
- Обзор Hive
- HiveQL
- Оркестрация процессов обработки данных
- Мониторинг и логирование для Sparkприложений
- CI/CD для Spark и Hive
- Выбор темы и организация проектной работы
- Консультация по проектам и домашним заданиям
- Защита проектных работ
Стоимость и условия оплаты
от 49 500₽
Для физ. лиц - 49 500₽
Для организаций - 59 500₽