К содержимому
learnspaceYOUR NEXT CHAPTER
ПРОСТРАНСТВО ОБУЧЕНИЯ
ГлавнаяКаталог курсовМоё обучениеCoursera

Знания без границ

Учитесь у лучших университетов и компаний мира.

Открыть Coursera
Интеграция
Пространство университета
Моё пространствоСтраница курса
↵
ЯЛичный кабинетСтудент
© 2026 LearnSpaceКаждый день — возможность узнать больше.Помощь
Engineer, Validate, and Govern ML Data · LearnSpace
Назад в каталог
courseraАнализ данных

Engineer, Validate, and Govern ML Data

Курс от Coursera
Средний≈ 3 чАнглийский
О курсеНавыкиПрограммаПреподаватели

О курсе

This short course helps you build and validate ML-ready data pipelines with confidence. You’ll start by learning how to design ETL workflows that ingest, clean, and partition large datasets using tools like Airflow and Spark. You’ll see how real teams manage click-stream logs, handle nulls, and prepare partitioned training data at scale. Next, you’ll evaluate data quality, governance, and lineage so your pipelines remain trustworthy and reproducible. You’ll work with practical techniques like schema drift checks, expectations suites, and audit-ready lineage records. Through short videos, applied readings, hands-on practice, and a final graded assessment, you’ll walk away knowing how to engineer reliable pipelines and validate them for production use.

Навыки, которые вы освоите

Data GovernanceApache AirflowData ManagementRecord KeepingPySparkDatabricksApache Spark

Программа курса

1 модулей · 15 учебных материалов

01Engineer, Validate, and Govern ML Data15 материалов

Designing ETL Pipelines That Produce ML-Ready Data

Welcome and What You'll LearnВидеоGetting Oriented: Your Data Engineering BaselineDIALOGUEWhy ETL Matters for Machine LearningВидеоFoundations of Scalable ETL for MLЧтение

Учитесь у экспертов

Professionals in the Industry

ansrsource instructors

Engineer, Validate, and Govern ML Data
В каталоге вашей программы

Инвестируйте в себя

Новые знания — в удобное для вас время.

Начать на Coursera

Обучение откроется на Coursera
в новой вкладке

Обучение на Coursera

≈ 3 ч

1 модулей

Язык: Английский

Субтитры: Арабский, Французский, Итальянский, Бразильский португальский, Корейский, Немецкий, Пушту, Индонезийский, Испанский, Дари, Японский

Часть программы вашего университета
Ingestion + Cleaning: From S3 Logs to Partitioned ML DataВидео
Hands-on Activity: Build and Debug an Airflow + Spark ETL PipelineЗадание

Ensuring Data Quality, Lineage, and Governance Across ML Pipelines

Why Data Quality and Governance Matter for MLВидеоWhere Does Data Drift Show Up in Your Work?DIALOGUEWhat to Check: Dimensions of Data Quality and LineageЧтениеDetecting Drift and Preparing for AuditВидеоHands-on Activity: Validate Quality and Update Lineage After Schema DriftЗаданиеChoosing Effective Lineage Documentation PatternsЧтениеEnd-to-End Pipeline Validation LabЛабораторнаяCongratulations and Continuous Learning JourneyВидеоGraded Quiz: Final Mastery CheckЗадание