Основы работы с Apache Spark в экосистеме Arenadata Hyperwave
Курс «Основы работы с Apache Spark в экосистеме Arenadata Hyperwave» поможет получить актуальные знания по основам работы с Apache Spark и успешно применять их на практике
21 сентября 2026
4 дня
32 часа
Доступные даты

О курсе
«Основы работы с Apache Spark в экосистеме Arenadata Hyperwave» — четырёхдневный практический курс по основам Apache Spark.
Продукты
Технологии
Чему научится участник
В рамках курса участники:
- ознакомятся с основами языка Scala и инструментами разработки;
- начнут разбираться в архитектуре Apache Spark и её базовых возможностях — RDD, DataFrame, DataSet;
- смогут настраивать производительность и управлять памятью;
- получат знания по обработке данных из различных источников (файлы, СУБД, потоки);
- изучат дополнительные возможности обработки и алгоритмы Spark GraphX и Spark MLlib.
Аудитория курса
Курс будет интересен разработчикам, аналитикам и архитекторам в области Data Sciencе, которые хотят получить знания и опыт по основам разработки Apache Spark на языке Scala в экосистеме продуктов Arenadata.
Сертификация
Все курсы заканчиваются экзаменом, при успешной сдаче которого слушателю выдается вендорский сертификат с названием курса и Ф. И. О. обучающегося.
Выпускнику центра присваивается статус Arenadata Certified Specialist.
В случае изучения нескольких курсов специалисту присваивается дополнительный грейд.

Программа обучения
Модуль 1. Обзор экосистемы Arenadata Enterprise Data Platform (EDP)
- Экосистема Arenadata Hyperwave (HDFS, MR, YARN, Hive, Tez, HBase, Phoenix, Solr, Spark, ZooKeeper, Airflow, Zeppelin).
- Экосистема EDP: Arenadata Streaming, Arenadata DB, Arenadata QuickMarts, Arenadata Postgres, Arenadata Cluster Manager.
Модуль 2. Apache Spark: работа с большими данными
- Введение в Apache Spark. Архитектура и рабочий процесс. Абстракции. Компоненты. RDD, DataFrame, DataSet
- Настройка окружения и запуск приложений: инструменты разработки и сборки (PyCharm, IntelliJ Idea, Maven, sbt); среды исполнения (IDE, Livy, Zeppelin, spark-shell, spark-submit (Python, Java, Scala); способы запуска программ (client/cluster).
- инструменты разработки и сборки (PyCharm, IntelliJ Idea, Maven, sbt);
- среды исполнения (IDE, Livy, Zeppelin, spark-shell, spark-submit (Python, Java, Scala);
- способы запуска программ (client/cluster).
- Основы Scala: синтаксис, классы и объекты, иерархия классов, основные конструкции.
- Потребление данных из файлов: CSV, XML, JSON, Avro, ORC и Parquet. API абстракций. Схемы данных.
- Потребление данных из СУБД (MySQL, PostgreSQL). Apache Spark SQL. Потребление данных из экосистемы Arenadata EDP.
- Управление памятью и производительностью в Apache Spark. DataFrame API: SparkSession. Кеширование и копирование данных.
- Преобразование структурированных данных. Выполнение соединений. Использование пользовательских функций (UDF, UDAF).
- Apache Spark Streaming. Работа с потоками. Структуры. Примеры.
- MLlib: использование Apache Spark для ML. Модели. Pipelines. Примеры.
- GraphX: работа с графами в Apache Spark. Объекты и операции. Примеры.
Учебный материал и обратная связь
Во время обучения слушатели могут общаться с преподавателем как голосом, так и в рабочем чате, расположенном на той же платформе, что и вебинар.
Лабораторные стенды доступны во время занятий, а также вечером и в выходные дни при необходимости.
При желании можно дополнительно приобрести учебную лицензию продуктов Arenadata для повторения материала и тренировки.
Часто задаваемые вопросы
Собрали ответы на самые популярные вопросы.
Хотите записаться на курс?
Или задайте свой вопрос, чтобы узнать подробнее о наших курсах.


