К содержимому
learnspaceYOUR NEXT CHAPTER
ПРОСТРАНСТВО ОБУЧЕНИЯ
ГлавнаяКаталог курсовМоё обучениеCoursera

Знания без границ

Учитесь у лучших университетов и компаний мира.

Открыть Coursera
Интеграция
Пространство университета
Моё пространствоСтраница курса
↵
ЯЛичный кабинетСтудент
© 2026 LearnSpaceКаждый день — возможность узнать больше.Помощь
Preparing Text for AI Models · LearnSpace
Назад в каталог
courseraАнализ данных

Preparing Text for AI Models

Курс от Coursera
Средний≈ 7.4 чАнглийский
О курсеНавыкиПрограммаПреподаватели

О курсе

The Preparing Text for AI Models course is designed for developers, engineers, and technical product builders who are new to Generative AI but already possess intermediate machine learning knowledge, basic Python proficiency, and familiarity with development environments such as VS Code, and who want to engineer, customize, and deploy open generative AI solutions while avoiding vendor lock-in. The course equips learners with practical skills in dataset sourcing, preprocessing, and formatting for training large language models. Starting with the discovery of text datasets from repositories like Hugging Face, Kaggle, and Common Crawl, learners evaluate quality, relevance, and licensing considerations. The course then covers preprocessing pipelines, including text cleaning, normalization, deduplication, and tokenization strategies, ensuring efficiency and compatibility with model training. Learners also design annotation schemas, apply semi-automated labeling techniques, and build validation workflows to maintain quality. The final module guides learners in constructing structured datasets for instruction tuning, fine-tuning, and benchmarking, supported by best practices in train-test splits and stratification. By the end of the course, learners will have created production-ready text datasets suitable for generative AI applications.

Навыки, которые вы освоите

Data PreprocessingData CollectionFine-tuningData CleansingUnstructured DataData QualityData EthicsLarge Language ModelingData TransformationGenerative AIModel EvaluationData WranglingToken OptimizationHugging FacePrompt EngineeringData ValidationData Pipelines

Программа курса

3 модулей · 20 учебных материалов

01Dataset Discovery and Acquisition for Text8 материалов
Podcast: Behind Every Great Model: Better Text DataВидеоCode Demonstration TranscriptsЧтениеText Dataset Repositories and Quality ChecksЧтениеImporting and Converting Text DatasetsВидео

Учитесь у экспертов

Professionals from the Industry

Преподаватель курса

Preparing Text for AI Models
В каталоге вашей программы

Инвестируйте в себя

Новые знания — в удобное для вас время.

Начать на Coursera

Обучение откроется на Coursera
в новой вкладке

Обучение на Coursera

≈ 7.4 ч

3 модулей

Язык: Английский

Субтитры: Арабский, Французский, Итальянский, Бразильский португальский, Корейский, Немецкий, Пушту, Испанский, Дари, Японский

Часть программы вашего университета
Preparing Text Datasets for LLM Training PipelinesВидео
When and How to Use Web ScrapingЧтение
Find and Load Your First DatasetЛабораторная
Evaluating and Preparing Your First DatasetЗадание
02Text Data Processing and Formatting7 материалов
When Your Model FailsDIALOGUEEssential Preprocessing for Text DataЧтениеFormatting for Instruction TuningВидеоBuilding a Preprocessing PipelineВидеоAdvanced Formatting Patterns for Instruction-Tuned LLMsВидеоClean and Format a Text CorpusЛабораторнаяPreparing Text for LLMsЗадание
03Advanced Annotation and Tagging5 материалов

Advanced Annotation and Tagging

Podcast: The Human Touch in AI: Why Annotation MattersВидеоAnnotation and QA Best PracticesЧтениеCreating Splits for Model GeneralizationВидеоAnnotate and Split a Sample DatasetЛабораторнаяPreparing Text for AI Models in PracticeЗадание