К содержимому
learnspaceYOUR NEXT CHAPTER
ПРОСТРАНСТВО ОБУЧЕНИЯ
ГлавнаяКаталог курсовМоё обучениеCoursera

Знания без границ

Учитесь у лучших университетов и компаний мира.

Открыть Coursera
Интеграция
Пространство университета
Моё пространствоСтраница курса
↵
ЯЛичный кабинетСтудент
© 2026 LearnSpaceКаждый день — возможность узнать больше.Помощь
Optimizing Models for Production · LearnSpace
Назад в каталог
courseraАнализ данных

Optimizing Models for Production

Курс от Coursera
Средний≈ 8.7 чАнглийский
О курсеНавыкиПрограммаПреподаватели

О курсе

The Optimizing Models for Production course is designed for developers, engineers, and technical product builders who are new to Generative AI but already have intermediate machine learning knowledge, basic Python proficiency, and familiarity with development environments such as VS Code, and who want to engineer, customize, and deploy open generative AI solutions while avoiding vendor lock-in. The course prepares learners to make generative AI models more efficient, scalable, and cost-effective for real-world deployment. Learners begin with quantization, applying INT8 and INT4 precision reduction using tools like bitsandbytes while balancing accuracy and efficiency. Next, they explore inference optimization strategies, including batching, KV-cache management, and token-level computation scheduling to reduce latency in interactive applications. The course also covers memory footprint reduction and adaptive batch sizing for dynamic workloads. In the final module, learners apply practical hardware optimization techniques such as GPU memory tuning, mixed precision inference, and profiling tools like nvidia-smi and PyTorch Profiler to identify bottlenecks. By the end, learners will be able to deliver optimized models across diverse hardware environments, supported by performance benchmarks and reproducible deployment pipelines.

Навыки, которые вы освоите

Cross Platform DevelopmentMemory ManagementModel OptimizationDevelopment EnvironmentGenerative AIModel DeploymentModel EvaluationScalabilityHardware ArchitecturePerformance TestingToken OptimizationPyTorch (Machine Learning Library)Performance Tuning

Программа курса

4 модулей · 24 учебных материалов

01Quantization Techniques (INT8/INT4)7 материалов
Podcast: Why We Shrink Big Models: The Power of QuantizationВидеоCode Demonstration TranscriptsЧтениеThe Must-Know Basics of QuantizationЧтениеEfficient Inference: Baseline FP16 vs. INT8 QuantizationВидео

Учитесь у экспертов

Professionals from the Industry

Преподаватель курса

Optimizing Models for Production
В каталоге вашей программы

Инвестируйте в себя

Новые знания — в удобное для вас время.

Начать на Coursera

Обучение откроется на Coursera
в новой вкладке

Обучение на Coursera

≈ 8.7 ч

4 модулей

Язык: Английский

Субтитры: Арабский, Французский, Итальянский, Бразильский португальский, Корейский, Немецкий, Пушту, Индонезийский, Испанский, Дари, Японский

Часть программы вашего университета
Extreme Compression: Pushing Limits with INT4 & NF4Видео
Shrink a Model with QuantizationЛабораторная
Model Quantization Techniques QuizЗадание
02Inference Optimization Strategies6 материалов
Podcast: The Everyday Value of Optimizing InferenceВидеоHow to Optimize Inference Without Breaking Your WorkflowЧтениеHow to Make Inference Run Faster in PracticeВидеоOptimize Inference for Real WorkflowsЛабораторнаяOther Memory-Saving Strategies Beyond Quantization ВидеоInference Optimization in ActionЗадание
03Practical Hardware Optimization5 материалов
Podcast: Turning Hardware Limits into OpportunitiesВидеоThe Essentials of GPU OptimizationЧтениеGPU Optimization in ActionВидеоTest and Tune GPU EfficiencyЛабораторнаяMaking the Most of Your GPUЗадание
04Deployment & Benchmarking6 материалов
Podcast: Why Portability Makes Models Production-ReadyВидеоFrom Conversion to Benchmarking with ONNXВидеоBenchmarking ONNX Inference: CPU vs. GPUВидеоConvert and Benchmark Your ModelЛабораторнаяEnd-to-End Production Optimization CheckЗаданиеPodcast: From Research to Production-Ready ModelsВидео