<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Sskrivosheev</id>
	<title>Wiki - Факультет компьютерных наук - Вклад [ru]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Sskrivosheev"/>
	<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%92%D0%BA%D0%BB%D0%B0%D0%B4/Sskrivosheev"/>
	<updated>2026-09-21T13:29:16Z</updated>
	<subtitle>Вклад</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87529</id>
		<title>МОВС Обработка и анализ больших массивов данных, BigData (ММОВС23, 5-6 модули)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87529"/>
		<updated>2024-10-25T05:51:48Z</updated>

		<summary type="html">&lt;p&gt;Sskrivosheev: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==О курсе==&lt;br /&gt;
Курс читается в 1-2 модулях 2024/2025 учебного года.&lt;br /&gt;
&lt;br /&gt;
Для чего нужны платформы данных? Как бы это очевидно ни звучало, они нужны для принятия решений на основе данных. У бизнеса может быть бесконечное количество запросов: как изменить цену товаров, в каком месте разместить магазин, кому показать рекламу, куда сдвинуть кнопку на сайте и т.д. Эти задачи могут решаться с помощью аналитики, построения дашбордов, сбора метрик, построения ML-моделей и т.д. Само по себе решение таких задач нетривиально, однако, это лишь верхушка айсберга.&lt;br /&gt;
&lt;br /&gt;
Прежде, чем проводить какую-либо аналитику, данные нужно найти, загрузить в хранилище, проверить их качество, агрегировать, и на любом из этапов может возникнуть огромное количество проблем. Здесь и появляются платформы данных, которые предоставляют инфраструктуру и инструменты для загрузки, обработки, проверки и анализа данных, что в конечном счете значительно упрощает и ускоряет решение любых задач, связанных с данными.&lt;br /&gt;
&lt;br /&gt;
В рамках курса вы познакомитесь с основными концепциями платформ данных, посмотрите из чего они состоят, какие бывают реализации, и запустите собственную платформу данных. Кроме того, на собранной платформе попрактикуетесь с организацией полного цикла работы с данными: от загрузки из источника до работы аналитика с этими данными. Вы узнаете, что такое Big Data, Data Warehouse, Data Lake, Data Governance, а также познакомитесь с технологиями, которые позволяют реализовать эти методологии и концепции. Особое внимание в курсе будет уделено таким технологиям, как Hadoop и Spark. Вы изучите компоненты Hadoop, архитектуру кластера и HDFS, научитесь развертывать Hadoop и выполнять базовые операции. Также вы изучите архитектуру и назначение Spark и научитесь работать с Spark DataFrame API и Spark SQL API.&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
&lt;br /&gt;
Преподаватели:     &lt;br /&gt;
* Саттар Гюльмамедов — PO DataOps ETL      &lt;br /&gt;
* Максим Бартенев — СТО DataOps Platform Центра Big Data МТС&lt;br /&gt;
&lt;br /&gt;
==Материалы курса==&lt;br /&gt;
&lt;br /&gt;
Ссылка на курс на [https://my.mts-link.ru/course-info/827093 MTS Link]&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Занятие !! Тема !! Практическое задание&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;1&#039;&#039;&#039;  ||  Причины появления инструментов обработки больших данных. Какие задачи они решают ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;2&#039;&#039;&#039; || Компоненты Hadoop и архитектура кластера ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;3&#039;&#039;&#039; || HDFS (Hadoop Distributed Filesystem) ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;4&#039;&#039;&#039; ||  Развертывание Hadoop и базовые операции ФС || Развертывание Hadoop&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;5&#039;&#039;&#039; || Парадигма MapReduce ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;6&#039;&#039;&#039; ||  YARN || Развертывание кластера YARN и выполнение распределенного MapReduce&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;7&#039;&#039;&#039; ||  Форматы файлов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;8&#039;&#039;&#039; ||  Другие проекты экосистемы Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;9&#039;&#039;&#039; ||  Hive: назначение, структура, компоненты ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;10&#039;&#039;&#039; ||  Развертывание Hive и операции с ним || Развертывание Hive&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;11&#039;&#039;&#039; ||  HiveQL и организация данных ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;12&#039;&#039;&#039; ||  Сравнение с традиционными RDBMS ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;13&#039;&#039;&#039; ||  Spark, архитектура и назначение ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;14&#039;&#039;&#039; ||  Развертывание кластера Spark || Развертывание кластера Spark&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;15&#039;&#039;&#039; ||  Spark DataFrame API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;16&#039;&#039;&#039; ||  Spark SQL API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;17&#039;&#039;&#039; ||  Взаимодействие между компонентами Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;18&#039;&#039;&#039; ||  Средства организации ETL-процессов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;19&#039;&#039;&#039; ||  DBT, Prefect, NiFi || Развертывание Airflow, реализация ETL процесса с его применением&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;20&#039;&#039;&#039; ||  Сравнение различных инструментов ETL ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;21&#039;&#039;&#039; ||  Способы организации хранилищ: DataLake DataWarehouse, Lakehouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;22&#039;&#039;&#039; ||  Greenplum || Работа с Greenplum &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;23&#039;&#039;&#039; ||  Clickhouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;24&#039;&#039;&#039; ||  Kafka ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;25&#039;&#039;&#039; ||  DQ || Работа с DQ &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;26&#039;&#039;&#039; ||  DataGov ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;27&#039;&#039;&#039; ||  BI || Работа с BI &lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
==Формула оценивания==&lt;br /&gt;
&lt;br /&gt;
Оценка = Средний балл по всем практическим заданиям&lt;br /&gt;
&lt;br /&gt;
== Литература ==&lt;br /&gt;
* «Большие данные. Революция, которая изменит то, как мы живем, работаем и мыслим», Виктор Майер-Шенбергер, Кеннет Кукьер&lt;br /&gt;
* «Работа с данными в любой сфере. Как выйти на новый уровень, используя аналитику», Кирилл Еременко&lt;br /&gt;
* «Data Science for Business: What You Need to Know about Data Mining and Data-Analytic Thinking» by Foster Provost and Tom Fawcett&lt;br /&gt;
* «Data Virtualization for Business Intelligence Systems: Revolutionizing Data Integration for Data Warehouses» by Rick van der Lans&lt;br /&gt;
* «Большие данные в действии», Мартин Клеппманн&lt;br /&gt;
* «Мастерство визуализации данных», Ольга Базалева&lt;br /&gt;
* «The Data Warehouse Toolkit: The Definitive Guide to Dimensional Modeling» by Ralph Kimball and Margy Ross&lt;br /&gt;
* «Information Dashboard Design: Displaying Data for At-a-Glance Monitoring» by Stephen Few&lt;/div&gt;</summary>
		<author><name>Sskrivosheev</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87528</id>
		<title>МОВС Обработка и анализ больших массивов данных, BigData (ММОВС23, 5-6 модули)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87528"/>
		<updated>2024-10-25T05:51:00Z</updated>

		<summary type="html">&lt;p&gt;Sskrivosheev: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==О курсе==&lt;br /&gt;
Курс читается в 1-2 модулях 2024/2025 учебного года.&lt;br /&gt;
&lt;br /&gt;
Для чего нужны платформы данных? Как бы это очевидно ни звучало, они нужны для принятия решений на основе данных. У бизнеса может быть бесконечное количество запросов: как изменить цену товаров, в каком месте разместить магазин, кому показать рекламу, куда сдвинуть кнопку на сайте и т.д. Эти задачи могут решаться с помощью аналитики, построения дашбордов, сбора метрик, построения ML-моделей и т.д. Само по себе решение таких задач нетривиально, однако, это лишь верхушка айсберга.&lt;br /&gt;
&lt;br /&gt;
Прежде, чем проводить какую-либо аналитику, данные нужно найти, загрузить в хранилище, проверить их качество, агрегировать, и на любом из этапов может возникнуть огромное количество проблем. Здесь и появляются платформы данных, которые предоставляют инфраструктуру и инструменты для загрузки, обработки, проверки и анализа данных, что в конечном счете значительно упрощает и ускоряет решение любых задач, связанных с данными.&lt;br /&gt;
&lt;br /&gt;
В рамках курса вы познакомитесь с основными концепциями платформ данных, посмотрите из чего они состоят, какие бывают реализации, и запустите собственную платформу данных. Кроме того, на собранной платформе попрактикуетесь с организацией полного цикла работы с данными: от загрузки из источника до работы аналитика с этими данными. Вы узнаете, что такое Big Data, Data Warehouse, Data Lake, Data Governance, а также познакомитесь с технологиями, которые позволяют реализовать эти методологии и концепции. Особое внимание в курсе будет уделено таким технологиям, как Hadoop и Spark. Вы изучите компоненты Hadoop, архитектуру кластера и HDFS, научитесь развертывать Hadoop и выполнять базовые операции. Также вы изучите архитектуру и назначение Spark и научитесь работать с Spark DataFrame API и Spark SQL API.&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
&lt;br /&gt;
Преподаватели:     &lt;br /&gt;
&lt;br /&gt;
Саттар Гюльмамедов — PO DataOps ETL      &lt;br /&gt;
&lt;br /&gt;
Максим Бартенев — СТО DataOps Platform Центра Big Data МТС&lt;br /&gt;
&lt;br /&gt;
==Материалы курса==&lt;br /&gt;
&lt;br /&gt;
Ссылка на курс на [https://my.mts-link.ru/course-info/827093 MTS Link]&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Занятие !! Тема !! Практическое задание&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;1&#039;&#039;&#039;  ||  Причины появления инструментов обработки больших данных. Какие задачи они решают ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;2&#039;&#039;&#039; || Компоненты Hadoop и архитектура кластера ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;3&#039;&#039;&#039; || HDFS (Hadoop Distributed Filesystem) ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;4&#039;&#039;&#039; ||  Развертывание Hadoop и базовые операции ФС || Развертывание Hadoop&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;5&#039;&#039;&#039; || Парадигма MapReduce ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;6&#039;&#039;&#039; ||  YARN || Развертывание кластера YARN и выполнение распределенного MapReduce&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;7&#039;&#039;&#039; ||  Форматы файлов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;8&#039;&#039;&#039; ||  Другие проекты экосистемы Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;9&#039;&#039;&#039; ||  Hive: назначение, структура, компоненты ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;10&#039;&#039;&#039; ||  Развертывание Hive и операции с ним || Развертывание Hive&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;11&#039;&#039;&#039; ||  HiveQL и организация данных ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;12&#039;&#039;&#039; ||  Сравнение с традиционными RDBMS ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;13&#039;&#039;&#039; ||  Spark, архитектура и назначение ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;14&#039;&#039;&#039; ||  Развертывание кластера Spark || Развертывание кластера Spark&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;15&#039;&#039;&#039; ||  Spark DataFrame API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;16&#039;&#039;&#039; ||  Spark SQL API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;17&#039;&#039;&#039; ||  Взаимодействие между компонентами Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;18&#039;&#039;&#039; ||  Средства организации ETL-процессов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;19&#039;&#039;&#039; ||  DBT, Prefect, NiFi || Развертывание Airflow, реализация ETL процесса с его применением&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;20&#039;&#039;&#039; ||  Сравнение различных инструментов ETL ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;21&#039;&#039;&#039; ||  Способы организации хранилищ: DataLake DataWarehouse, Lakehouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;22&#039;&#039;&#039; ||  Greenplum || Работа с Greenplum &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;23&#039;&#039;&#039; ||  Clickhouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;24&#039;&#039;&#039; ||  Kafka ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;25&#039;&#039;&#039; ||  DQ || Работа с DQ &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;26&#039;&#039;&#039; ||  DataGov ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;27&#039;&#039;&#039; ||  BI || Работа с BI &lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
==Формула оценивания==&lt;br /&gt;
&lt;br /&gt;
Оценка = Средний балл по всем практическим заданиям&lt;br /&gt;
&lt;br /&gt;
== Литература ==&lt;br /&gt;
* «Большие данные. Революция, которая изменит то, как мы живем, работаем и мыслим», Виктор Майер-Шенбергер, Кеннет Кукьер&lt;br /&gt;
* «Работа с данными в любой сфере. Как выйти на новый уровень, используя аналитику», Кирилл Еременко&lt;br /&gt;
* «Data Science for Business: What You Need to Know about Data Mining and Data-Analytic Thinking» by Foster Provost and Tom Fawcett&lt;br /&gt;
* «Data Virtualization for Business Intelligence Systems: Revolutionizing Data Integration for Data Warehouses» by Rick van der Lans&lt;br /&gt;
* «Большие данные в действии», Мартин Клеппманн&lt;br /&gt;
* «Мастерство визуализации данных», Ольга Базалева&lt;br /&gt;
* «The Data Warehouse Toolkit: The Definitive Guide to Dimensional Modeling» by Ralph Kimball and Margy Ross&lt;br /&gt;
* «Information Dashboard Design: Displaying Data for At-a-Glance Monitoring» by Stephen Few&lt;/div&gt;</summary>
		<author><name>Sskrivosheev</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87527</id>
		<title>МОВС Обработка и анализ больших массивов данных, BigData (ММОВС23, 5-6 модули)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87527"/>
		<updated>2024-10-25T05:48:40Z</updated>

		<summary type="html">&lt;p&gt;Sskrivosheev: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==О курсе==&lt;br /&gt;
Курс читается в 1-2 модулях 2024/2025 учебного года.&lt;br /&gt;
&lt;br /&gt;
Для чего нужны платформы данных? Как бы это очевидно ни звучало, они нужны для принятия решений на основе данных. У бизнеса может быть бесконечное количество запросов: как изменить цену товаров, в каком месте разместить магазин, кому показать рекламу, куда сдвинуть кнопку на сайте и т.д. Эти задачи могут решаться с помощью аналитики, построения дашбордов, сбора метрик, построения ML-моделей и т.д. Само по себе решение таких задач нетривиально, однако, это лишь верхушка айсберга.&lt;br /&gt;
&lt;br /&gt;
Прежде, чем проводить какую-либо аналитику, данные нужно найти, загрузить в хранилище, проверить их качество, агрегировать, и на любом из этапов может возникнуть огромное количество проблем. Здесь и появляются платформы данных, которые предоставляют инфраструктуру и инструменты для загрузки, обработки, проверки и анализа данных, что в конечном счете значительно упрощает и ускоряет решение любых задач, связанных с данными.&lt;br /&gt;
&lt;br /&gt;
В рамках курса вы познакомитесь с основными концепциями платформ данных, посмотрите из чего они состоят, какие бывают реализации, и запустите собственную платформу данных. Кроме того, на собранной платформе попрактикуетесь с организацией полного цикла работы с данными: от загрузки из источника до работы аналитика с этими данными. Вы узнаете, что такое Big Data, Data Warehouse, Data Lake, Data Governance, а также познакомитесь с технологиями, которые позволяют реализовать эти методологии и концепции. Особое внимание в курсе будет уделено таким технологиям, как Hadoop и Spark. Вы изучите компоненты Hadoop, архитектуру кластера и HDFS, научитесь развертывать Hadoop и выполнять базовые операции. Также вы изучите архитектуру и назначение Spark и научитесь работать с Spark DataFrame API и Spark SQL API.&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
&lt;br /&gt;
Преподаватели:     &lt;br /&gt;
&lt;br /&gt;
Саттар Гюльмамедов — PO DataOps ETL      &lt;br /&gt;
&lt;br /&gt;
Максим Бартенев — СТО DataOps Platform Центра Big Data МТС&lt;br /&gt;
&lt;br /&gt;
==Материалы курса==&lt;br /&gt;
&lt;br /&gt;
Ссылка на курс на [https://my.mts-link.ru/course-info/827093 MTS Link]&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Занятие !! Тема !! Практическое задание&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;1&#039;&#039;&#039;  ||  Причины появления инструментов обработки больших данных. Какие задачи они решают ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;2&#039;&#039;&#039; || Компоненты Hadoop и архитектура кластера ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;3&#039;&#039;&#039; || HDFS (Hadoop Distributed Filesystem) ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;4&#039;&#039;&#039; ||  Развертывание Hadoop и базовые операции ФС || Развертывание Hadoop&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;5&#039;&#039;&#039; || Парадигма MapReduce ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;6&#039;&#039;&#039; ||  YARN || Развертывание кластера YARN и выполнение распределенного MapReduce&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;7&#039;&#039;&#039; ||  Форматы файлов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;8&#039;&#039;&#039; ||  Другие проекты экосистемы Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;9&#039;&#039;&#039; ||  Hive: назначение, структура, компоненты ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;10&#039;&#039;&#039; ||  Развертывание Hive и операции с ним || Развертывание Hive&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;11&#039;&#039;&#039; ||  HiveQL и организация данных ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;12&#039;&#039;&#039; ||  Сравнение с традиционными RDBMS ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;13&#039;&#039;&#039; ||  Spark, архитектура и назначение ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;14&#039;&#039;&#039; ||  Развертывание кластера Spark || Развертывание кластера Spark&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;15&#039;&#039;&#039; ||  Spark DataFrame API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;16&#039;&#039;&#039; ||  Spark SQL API ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;17&#039;&#039;&#039; ||  Взаимодействие между компонентами Hadoop ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;18&#039;&#039;&#039; ||  Средства организации ETL-процессов ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;19&#039;&#039;&#039; ||  DBT, Prefect, NiFi || Развертывание Airflow, реализация ETL процесса с его применением&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;20&#039;&#039;&#039; ||  Сравнение различных инструментов ETL ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;21&#039;&#039;&#039; ||  Способы организации хранилищ: DataLake DataWarehouse, Lakehouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;22&#039;&#039;&#039; ||  Greenplum || Работа с Greenplum &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;23&#039;&#039;&#039; ||  Clickhouse ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;24&#039;&#039;&#039; ||  Kafka ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;25&#039;&#039;&#039; ||  DQ || Работа с DQ &lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;26&#039;&#039;&#039; ||  DataGov ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;27&#039;&#039;&#039; ||  BI || Работа с BI &lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
==Формула оценивания==&lt;br /&gt;
&lt;br /&gt;
Оценка = Средний балл по всем практическим заданиям&lt;br /&gt;
&lt;br /&gt;
== Литература ==&lt;/div&gt;</summary>
		<author><name>Sskrivosheev</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87526</id>
		<title>МОВС Обработка и анализ больших массивов данных, BigData (ММОВС23, 5-6 модули)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87526"/>
		<updated>2024-10-25T05:44:02Z</updated>

		<summary type="html">&lt;p&gt;Sskrivosheev: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==О курсе==&lt;br /&gt;
Курс читается в 1-2 модулях 2024/2025 учебного года.&lt;br /&gt;
&lt;br /&gt;
Для чего нужны платформы данных? Как бы это очевидно ни звучало, они нужны для принятия решений на основе данных. У бизнеса может быть бесконечное количество запросов: как изменить цену товаров, в каком месте разместить магазин, кому показать рекламу, куда сдвинуть кнопку на сайте и т.д. Эти задачи могут решаться с помощью аналитики, построения дашбордов, сбора метрик, построения ML-моделей и т.д. Само по себе решение таких задач нетривиально, однако, это лишь верхушка айсберга.&lt;br /&gt;
&lt;br /&gt;
Прежде, чем проводить какую-либо аналитику, данные нужно найти, загрузить в хранилище, проверить их качество, агрегировать, и на любом из этапов может возникнуть огромное количество проблем. Здесь и появляются платформы данных, которые предоставляют инфраструктуру и инструменты для загрузки, обработки, проверки и анализа данных, что в конечном счете значительно упрощает и ускоряет решение любых задач, связанных с данными.&lt;br /&gt;
&lt;br /&gt;
В рамках курса вы познакомитесь с основными концепциями платформ данных, посмотрите из чего они состоят, какие бывают реализации, и запустите собственную платформу данных. Кроме того, на собранной платформе попрактикуетесь с организацией полного цикла работы с данными: от загрузки из источника до работы аналитика с этими данными. Вы узнаете, что такое Big Data, Data Warehouse, Data Lake, Data Governance, а также познакомитесь с технологиями, которые позволяют реализовать эти методологии и концепции. Особое внимание в курсе будет уделено таким технологиям, как Hadoop и Spark. Вы изучите компоненты Hadoop, архитектуру кластера и HDFS, научитесь развертывать Hadoop и выполнять базовые операции. Также вы изучите архитектуру и назначение Spark и научитесь работать с Spark DataFrame API и Spark SQL API.&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
&lt;br /&gt;
Преподаватели:     &lt;br /&gt;
&lt;br /&gt;
Саттар Гюльмамедов — PO DataOps ETL      &lt;br /&gt;
&lt;br /&gt;
Максим Бартенев — СТО DataOps Platform Центра Big Data МТС&lt;br /&gt;
&lt;br /&gt;
==Материалы курса==&lt;br /&gt;
&lt;br /&gt;
Ссылка на курс на [https://my.mts-link.ru/course-info/827093 MTS Link]&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Занятие !! Тема !! Практическое задание&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;1&#039;&#039;&#039;  ||  Причины появления инструментов обработки больших данных. Какие задачи они решают ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;2&#039;&#039;&#039; || Компоненты Hadoop и архитектура кластера ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;3&#039;&#039;&#039; || HDFS (Hadoop Distributed Filesystem) ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;4&#039;&#039;&#039; ||  Развертывание Hadoop и базовые операции ФС ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;5&#039;&#039;&#039; || Парадигма MapReduce ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;6&#039;&#039;&#039; ||  Web-service ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;7&#039;&#039;&#039; ||  YARN ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;8&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;9&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;10&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;11&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;12&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;13&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;14&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;15&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;16&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;17&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;18&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;19&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;20&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;21&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;22&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;23&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;24&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;25&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;26&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
| style=&amp;quot;background:#eaecf0;&amp;quot; | &#039;&#039;&#039;27&#039;&#039;&#039; ||  Yandex ||&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;/div&gt;</summary>
		<author><name>Sskrivosheev</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87525</id>
		<title>МОВС Обработка и анализ больших массивов данных, BigData (ММОВС23, 5-6 модули)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9C%D0%9E%D0%92%D0%A1_%D0%9E%D0%B1%D1%80%D0%B0%D0%B1%D0%BE%D1%82%D0%BA%D0%B0_%D0%B8_%D0%B0%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B1%D0%BE%D0%BB%D1%8C%D1%88%D0%B8%D1%85_%D0%BC%D0%B0%D1%81%D1%81%D0%B8%D0%B2%D0%BE%D0%B2_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85,_BigData_(%D0%9C%D0%9C%D0%9E%D0%92%D0%A123,_5-6_%D0%BC%D0%BE%D0%B4%D1%83%D0%BB%D0%B8)&amp;diff=87525"/>
		<updated>2024-10-25T05:32:50Z</updated>

		<summary type="html">&lt;p&gt;Sskrivosheev: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;==О курсе==&lt;br /&gt;
&lt;br /&gt;
Для чего нужны платформы данных? Как бы это очевидно ни звучало, они нужны для принятия решений на основе данных. У бизнеса может быть бесконечное количество запросов: как изменить цену товаров, в каком месте разместить магазин, кому показать рекламу, куда сдвинуть кнопку на сайте и т.д. Эти задачи могут решаться с помощью аналитики, построения дашбордов, сбора метрик, построения ML-моделей и т.д. Само по себе решение таких задач нетривиально, однако, это лишь верхушка айсберга.&lt;br /&gt;
&lt;br /&gt;
Прежде, чем проводить какую-либо аналитику, данные нужно найти, загрузить в хранилище, проверить их качество, агрегировать, и на любом из этапов может возникнуть огромное количество проблем. Здесь и появляются платформы данных, которые предоставляют инфраструктуру и инструменты для загрузки, обработки, проверки и анализа данных, что в конечном счете значительно упрощает и ускоряет решение любых задач, связанных с данными.&lt;br /&gt;
&lt;br /&gt;
В рамках курса вы познакомитесь с основными концепциями платформ данных, посмотрите из чего они состоят, какие бывают реализации, и запустите собственную платформу данных. Кроме того, на собранной платформе попрактикуетесь с организацией полного цикла работы с данными: от загрузки из источника до работы аналитика с этими данными. Вы узнаете, что такое Big Data, Data Warehouse, Data Lake, Data Governance, а также познакомитесь с технологиями, которые позволяют реализовать эти методологии и концепции. Особое внимание в курсе будет уделено таким технологиям, как Hadoop и Spark. Вы изучите компоненты Hadoop, архитектуру кластера и HDFS, научитесь развертывать Hadoop и выполнять базовые операции. Также вы изучите архитектуру и назначение Spark и научитесь работать с Spark DataFrame API и Spark SQL API.&lt;/div&gt;</summary>
		<author><name>Sskrivosheev</name></author>
	</entry>
</feed>