Основы больших данных с Python и PySpark
Этот курс учит начинающих основных навыков для эффективной обработки и анализа крупномасштабных наборов данных с использованием Python и Apache Spark.
-
💬
ИИ инструктор
Задавайте вопросы по любому уроку — понятный ответ придёт мгновенно, в любой момент. -
🕐
Начните в любое время
Без расписаний и дедлайнов — учитесь в своём темпе, когда удобно. -
🌐
На русском языке
Уроки, задания и сертификат — всё полностью на вашем языке.
О курсе
Большие данные требуют специализированных инструментов для обработки огромных объемов информации, которые стандартное программное обеспечение не может обрабатывать. PySpark обеспечивает важную связь между знакомыми инструментами Python для обработки данных и мощностью распределенных вычислений.
К концу этого курса вы овладеете настройкой среды обработки данных, манипулированием большими наборами данных с помощью библиотек анализа данных Python и применением PySpark для выполнения масштабируемых преобразований, анализа и основных задач машинного обучения на распределенных кластерах.
Что вы узнаете:
* Понять основные концепции распределенных вычислений и архитектуры Apache Spark.
* Освоить основные структуры данных Python и использовать библиотеку pandas для эффективного манипулирования локальными данными.
* Примените PySpark DataFrames и Spark SQL для чтения, очистки и преобразования массивных структурированных наборов данных.
* Настройка базовых виртуальных сред и управление зависимостями для масштабируемых проектов науки данных.
* Практика общих преобразований данных, агрегаций, соединений и методов оптимизации запросов в PySpark.
* Узнайте, как выполнять базовое поглощение потоковых данных и применять модели машинного обучения с помощью MLlib.
Курс начинается с прочной основы в работе с данными Python и настройки среды перед введением основных концепций распределенной обработки. Затем мы переходим к практическому применению с использованием PySpark DataFrames, сосредоточившись на масштабируемом манипулировании данными и анализе, завершающемся введением в потоковые и машинные инструменты обучения.
Этот курс предназначен для абсолютно начинающих, заинтересованных в инженерии данных, науке данных или анализе данной, которым нужно работать с большими наборами данных. Не требуется предыдущий опыт работы со Spark или распределенными системами.
Начните накапливать опыт в области масштабируемой обработки данных уже сегодня.
Что вы получите
-
📜
Сертификат об окончании
Добавьте в профиль LinkedIn -
💬
Личный AI-наставник
Застрял на уроке? Спроси встроенного наставника о чём угодно, в любой момент. -
🎧
Аудиоверсия включена
Учитесь в дороге — экран не нужен -
♾️
Пожизненный доступ
Возвращайтесь в любое время, без срока -
📱
Телефон или компьютер
Работает везде и на любом устройстве -
💸
Возврат в течение 14 дней
Без вопросов -
⚡
Кратко и по делу
2 ч 42 мин практического материала
Отзывы
Отзывов пока нет — поделитесь своим первым.
Часто спрашивают
Что нужно для прохождения курса? +
Только смартфон или компьютер с доступом в интернет. Никаких установок и оборудования.
Как оплатить? +
Банковской картой через Stripe. Данные карты обрабатывает Stripe — мы их не храним.
Можно ли вернуть деньги? +
Да — полный возврат в течение 14 дней, без вопросов.
Как долго будут доступны материалы? +
Навсегда. После покупки курс остаётся с вами — возвращайтесь в любое время.
Получу ли я сертификат? +
Да. По окончании выдаётся сертификат, который можно добавить в профиль LinkedIn.
Подходит для специалистов в
IT
Дизайн
Финансы
Маркетинг
Медицина
Образование
HoReCa
Производство