К содержимому
learnspaceYOUR NEXT CHAPTER
ПРОСТРАНСТВО ОБУЧЕНИЯ
ГлавнаяКаталог курсовМоё обучениеCoursera

Знания без границ

Учитесь у лучших университетов и компаний мира.

Открыть Coursera
Интеграция
Пространство университета
Моё пространствоСтраница курса
↵
ЯЛичный кабинетСтудент
© 2026 LearnSpaceКаждый день — возможность узнать больше.Помощь
Optimize Spark Performance & Throughput · LearnSpace
Назад в каталог
courseraIT и технологии

Optimize Spark Performance & Throughput

Курс от Coursera
Средний≈ 4.9 чАнглийский
О курсеНавыкиПрограммаПреподаватели

О курсе

In large-scale data engineering environments, performance issues such as slow transformations, excessive shuffle operations, and unbalanced workloads can impact analytics, reporting, and SLA commitments. This course teaches you how to analyze, diagnose, and optimize Apache Spark applications so they run faster, more efficiently, and more reliably. In this course, you’ll start by learning the fundamentals of Spark job execution, including how stages, tasks, shuffle operations, and execution plans reveal where bottlenecks occur. You’ll explore Spark’s built-in monitoring tools to interpret job behavior. From there, you’ll apply practical optimization techniques, including improving data partitioning, mitigating data skew, optimizing joins, configuring caching strategies, and choosing efficient file formats. You’ll also learn how to tune executors, memory, cores, and dynamic allocation to balance cost and performance across workloads. Learners should be familiar with basic knowledge of Python and Spark DataFrames; familiarity with JSON and SQL. This course is designed for data engineers and developers who need to diagnose and optimize Spark jobs running on large-scale distributed data pipelines. By the end, you’ll have the skills to confidently apply advanced tuning strategies, improve throughput, reduce shuffle overhead, and optimize resource usage.

Навыки, которые вы освоите

Performance TuningApache SparkProcess OptimizationPerformance AnalysisService LevelScalabilityMemory ManagementResource AllocationSystem ConfigurationPySparkJob AnalysisDebugging

Программа курса

3 модулей · 23 учебных материалов

01Analyzing Spark Job Execution & Metrics8 материалов
Diagnosing a Slow Spark JobDIALOGUEWelcome to the Course: Course OverviewЧтениеWelcome & What You Will LearnВидеоUnderstanding Spark Job ExecutionВидео

Учитесь у экспертов

Merna Elzahaby

Big Data Architect

Optimize Spark Performance & Throughput
В каталоге вашей программы

Инвестируйте в себя

Новые знания — в удобное для вас время.

Начать на Coursera

Обучение откроется на Coursera
в новой вкладке

Обучение на Coursera

≈ 4.9 ч

3 модулей

Язык: Английский

Субтитры: Арабский, Французский, Итальянский, Бразильский португальский, Корейский, Немецкий, Испанский, Японский

Часть программы вашего университета
Interpreting the Spark UIЧтение
Key Metrics for Diagnosing BottlenecksВидео
Case Demo: Using Spark UI to Spot IssuesВидео
Hands-On-Learning: Analyze a Spark Job Using the Spark UIВзаимная проверка
02Fixing Data Skew, Shuffle Issues & Inefficient Joins6 материалов
Choosing the Right Optimization StrategyDIALOGUEUnderstanding Data Skew & ShuffleВидеоTechniques to Reduce Shuffle OverheadЧтениеPartitioning Strategies for Balanced WorkloadsВидеоAQE in Action: Auto-Optimizing Query PlansВидеоHands-On-Learning: Fix a Spark Job with Data SkewВзаимная проверка
03Tuning Executors, Memory & Parallelism to Meet SLAs9 материалов
Meeting SLA DeadlinesDIALOGUEUnderstanding Executors, Cores & MemoryВидеоDynamic Allocation & Parallelism TuningВидеоBest Practices for SLA-Focused OptimizationЧтениеCase Demo: Tuning a Job to Meet SLAВидеоHands-On-Learning: Tune a Spark Job to Meet a Given SLAВзаимная проверкаCourse Wrap-Up & Next StepsВидеоProject: End-to-End Spark Job OptimizationВзаимная проверкаOptimize Spark Performance & ThroughputЗадание