<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Arbabenko</id>
	<title>Wiki - Факультет компьютерных наук - Вклад [ru]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Arbabenko"/>
	<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%92%D0%BA%D0%BB%D0%B0%D0%B4/Arbabenko"/>
	<updated>2026-09-21T14:27:38Z</updated>
	<subtitle>Вклад</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23210</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23210"/>
		<updated>2017-05-12T10:18:07Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/IT2V7Dfe3J4Qxh Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 15. xgBoost.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/PfnWMyJU3J4R7K Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles, bagging&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZVjk1c2dIWmVSUkk/view?usp=sharing Practical task 11], Deadline: May 18&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 12. Ensembles, boosting&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZTFJGZ2VmcURVZDg/view?usp=sharing Theoretical task 12], Deadline: May 18&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23209</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23209"/>
		<updated>2017-05-12T10:17:24Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/IT2V7Dfe3J4Qxh Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 15. xgBoost.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/PfnWMyJU3J4R7K Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZVjk1c2dIWmVSUkk/view?usp=sharing Practical task 11], Deadline: May 18&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZTFJGZ2VmcURVZDg/view?usp=sharing Theoretical task 12], Deadline: May 18&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23179</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23179"/>
		<updated>2017-05-05T14:16:17Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/-RwlAWj53HRbFi Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZVjk1c2dIWmVSUkk/view?usp=sharing Practical task 11], Deadline: May 18&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23163</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23163"/>
		<updated>2017-04-28T12:09:42Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/-RwlAWj53HRbFi Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23162</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23162"/>
		<updated>2017-04-28T10:46:26Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/-RwlAWj53HRbFi Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZVGQwUmdNNWpzT1E/view?usp=sharing Theoretical task 11], Deadline: May 4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23161</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23161"/>
		<updated>2017-04-28T10:45:55Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Follow this link to [https://kaggle.com/join/HSE_Competition participate].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 13. Ensemble methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/5K8fg85Q3HRbEF Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 14. Boosting.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/-RwlAWj53HRbFi Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 11. Ensembles&#039;&#039;&#039;&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZVGQwUmdNNWpzT1E/view?usp=sharing Theoretical task 11], Deadline: May 4&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23135</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23135"/>
		<updated>2017-04-21T09:55:04Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Kaggle competition ==&lt;br /&gt;
Full data and rules will be availbale on kaggle platform in several days. &lt;br /&gt;
Link to [https://yadi.sk/d/kJass7GR3HBXct train set].&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 11. Feature selection.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/lyx3mLCc3HBwML Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 12. Working with text.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/NmoN6-I43HBwN5 Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 10. Feature selection + text mining&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZdHk1MmFxUlVwNm8/view?usp=sharing Theoretical task 10], Deadline: April 27&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23076</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=23076"/>
		<updated>2017-04-14T10:06:16Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Colloquium ==&lt;br /&gt;
Colloquium will be held on April 7th during lecture &amp;amp; seminars time slot. &lt;br /&gt;
&lt;br /&gt;
You may not use any materials during colloquium except single A4 prepared before the exam and handwritten personally by you (from two sides). You will have 2 questions from the [https://yadi.sk/i/myp4_88l3GJDwe questions list] with 25 minutes for preparation and may receive additional questions or tasks.&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 8. SVM and kernel trick.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/f35uPeOe3FzvKg Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 9. Principal component analysis.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/dfImvp3O3Gwoaw Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 10. Singular value decomposition.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/znlevSwu3Gwobb Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing first dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 8. SVM and kernel trick&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstazFWSXVSREJzSGc/view?usp=sharing Theoretical task 8], Deadline: March 23&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstOVotNEhnYUJYdGs/view?usp=sharing Practical task 8], [https://drive.google.com/file/d/0B7TWwiIrcJstU0gxeDhYX1hHN1E/view?usp=sharing data]. Deadline: March 30&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 9. PCA&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZT1U0aUhjQmphZDA/view?usp=sharing Theoretical task 9], Deadline: April 20&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [https://github.com/esokolov/ml-course-hse Machine learning course from Evgeny Sokolov on Github]&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22798</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22798"/>
		<updated>2017-03-10T09:59:09Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 7. Classifier evaluation.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/r3tYJwZ73FNNWk Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification: loss functions &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 6. Linear classification: optimization &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaHFVRFV2Z0F0ZWs/view?usp=sharing Theoretical task 6], Deadline: March 2&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstRjNSbXhxWDZfRzA/view?usp=sharing Practical task 6], [https://drive.google.com/file/d/0B7TWwiIrcJstbGZZTDNjazg5Mmc/view?usp=sharing firat dataset], [https://drive.google.com/file/d/0B7TWwiIrcJstZ1M3NmhXU0EwSlE/view?usp=sharing diabetes dataset]. Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 7. Classifier evaluation&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B4DmUfeAdxyZUF9FMlVWYUVmQUE/view?usp=sharing Theoretical task 7], Deadline: March 16&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22644</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22644"/>
		<updated>2017-02-15T12:44:11Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 4. Regression methods.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/mvozzv_s3CReQQ Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 5. Properties of convex functions.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/zCcyHHCz3DhLTx Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 6. Linear methods of classification.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/CsWN0nwW3DhDJp Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theoretical task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2], [https://drive.google.com/open?id=0B7TWwiIrcJstSEZOZzBoQUo3bk0 data]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theoretical task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 4. Regression methods &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJsta29CeXdfcXFwWFU/view?usp=sharing Theoretical task 4], Deadline: February 9&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 5. Linear classification &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUzQxWndJaTB1cGM/view?usp=sharing Theoretical task 5], Deadline: February 16&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
If you solve the theoretical problem in class you obtain 1.5 points (if you solve it at home you obtain 1 point).&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22487</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22487"/>
		<updated>2017-01-27T10:47:36Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theory task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theory task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22486</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22486"/>
		<updated>2017-01-27T10:47:18Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 3. Decision trees.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/sUJamzb83Ao4xL Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theory task 2], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 3. Decision trees &#039;&#039;&#039;&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstelVRUVBXNktKenc/view?usp=sharing Theory task 3], Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22388</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22388"/>
		<updated>2017-01-20T09:12:58Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;This page isn&#039;t finished yet!!!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theory task 1], Deadline: January 26&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2]. Deadline: February 2&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22387</id>
		<title>Data analysis (Software Engineering) 2017</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=Data_analysis_(Software_Engineering)_2017&amp;diff=22387"/>
		<updated>2017-01-20T09:12:22Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;This page isn&#039;t finished yet!!!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Class email:&#039;&#039;&#039; cshse.ml@gmail.com&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Anonymous feedback form:&#039;&#039;&#039; [https://docs.google.com/forms/d/e/1FAIpQLSdxP-U47SLedjTvF0CyxHSIYy8eTUnzcDOc9DIl4gFSD2-ixA/viewform here]&amp;lt;br /&amp;gt;&lt;br /&gt;
&#039;&#039;&#039;Scores: [https://docs.google.com/spreadsheets/d/124qVkoSpftuRhYCEcY7KC-ALPiLn47_guyqAQIZJUYk/edit?usp=sharing here]&#039;&#039;&#039; &amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Course description ==&lt;br /&gt;
In this class we consider the main problems of data mining and machine learning: classification, clustering, regression, dimensionality reduction, ranking, collaborative filtering. We will also study mathematical methods and concepts which data analysis is based on as well as formal assumptions behind them and various aspects of their implementation.&lt;br /&gt;
&lt;br /&gt;
A significant attention is given to practical skills of data analysis that will be developed on seminars by studying the Python programming language and relevant libraries for scientific computing.&lt;br /&gt;
&lt;br /&gt;
The knowledge of linear algebra, real analysis and probability theory is required.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;The class consists of:&#039;&#039;&#039;&lt;br /&gt;
# Lectures and seminars&lt;br /&gt;
# Practical and theoretical homework assignments&lt;br /&gt;
# A machine learning competition (more information will be available later)&lt;br /&gt;
# Midterm theoretical colloquium&lt;br /&gt;
# Final exam&lt;br /&gt;
&lt;br /&gt;
== Syllabus ==&lt;br /&gt;
&lt;br /&gt;
# Introduction to machine learning.&lt;br /&gt;
# K-nearest neighbours classification and regression. Extensions. Optimization techniques.&lt;br /&gt;
# Decision tree methods.&lt;br /&gt;
# Bayesian decision theory. Model evaluation: &lt;br /&gt;
# Linear classification methods. Adding regularization to linear methods.&lt;br /&gt;
# Regression.&lt;br /&gt;
# Kernel generalization of standard methods.&lt;br /&gt;
# Neural networks.&lt;br /&gt;
# Ensemble methods: bagging, boosting, etc.&lt;br /&gt;
# Feature selection.&lt;br /&gt;
# Feature extraction&lt;br /&gt;
# EM algorithm. Density estimation using mixtures.&lt;br /&gt;
# Clustering&lt;br /&gt;
# Collaborative filtering&lt;br /&gt;
# Ranking&lt;br /&gt;
&lt;br /&gt;
== Lecture materials ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 1. Introduction to data science and machine learning. &#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/TKVKjQMi38fUFm Download]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Lecture 2. Metric methods of classification &amp;amp; regression.&#039;&#039;&#039;&lt;br /&gt;
[https://yadi.sk/i/D4YvGVx739oAZ8 Download]&lt;br /&gt;
&lt;br /&gt;
== Seminars ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 1. Introduction to Data Analysis in Python &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Additional materials: [https://github.com/esokolov/ml-course-hse/blob/master/2016-fall/seminars/sem01-tools.ipynb 1], [https://drive.google.com/open?id=0B7TWwiIrcJstRzVRSlRFcEl3VGM 2]&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstaVo4b0FQYTZpejg/view?usp=sharing Practical task 1], [https://drive.google.com/file/d/0B7TWwiIrcJstazJRLVFRZ3dHM1k/view?usp=sharing data]. Deadline: January 19.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Seminar 2. Metric Classifiers &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstVmJ5NnNBY3YwV2c/view?usp=sharing Theory task 1], Deadline: January 26&lt;br /&gt;
[https://drive.google.com/file/d/0B7TWwiIrcJstUTg0czdlVkpMaWc/view?usp=sharing Practical task 2]. Deadline: February 2.&lt;br /&gt;
&lt;br /&gt;
== Evaluation criteria ==&lt;br /&gt;
The course lasts during the 3rd and 4th modules. Knowledge of students is assessed by evaluation of their home assignments and exams. Home assignments divide into theoretical tasks and practical tasks. There are two exams during the course – after the 3rd module and after the 4th module respectively. Each of the exams evaluates theoretical knowledge and understanding of the material studied during the respective module.&lt;br /&gt;
&lt;br /&gt;
Grade takes values 4,5,…10. Grades, corresponding to 1,2,3 are assumed unsatisfactory. Exact grades are calculated using the following rule:&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 35% =&amp;gt; 4,&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 45% =&amp;gt; 5,&lt;br /&gt;
* ...&lt;br /&gt;
* &#039;&#039;&#039;score&#039;&#039;&#039; ≥ 95% =&amp;gt; 10,&lt;br /&gt;
&lt;br /&gt;
where &#039;&#039;&#039;score&#039;&#039;&#039; is calculated  using the following rule:&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;score&#039;&#039;&#039; = 0.6 * S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; + 0.2 * S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
* S&amp;lt;sub&amp;gt;homework&amp;lt;/sub&amp;gt; – proportion of correctly solved homework,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam1&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 3,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;exam2&amp;lt;/sub&amp;gt; – proportion of successfully answered theoretical questions during exam after module 4,&lt;br /&gt;
* S&amp;lt;sub&amp;gt;competition&amp;lt;/sub&amp;gt; – score for the competition in machine learning (it&#039;s also from 0 to 1).&lt;br /&gt;
&lt;br /&gt;
Participation in machine learning competition is optional and can give students extra points.&lt;br /&gt;
&lt;br /&gt;
== Plagiarism ==&lt;br /&gt;
In case of discovered plagiarism zero points will be set for the home assignemets - for both works, which were found to be identical. In case of repeated plagiarism by one and the same person a report to the dean will be made.&lt;br /&gt;
&lt;br /&gt;
== Deadlines ==&lt;br /&gt;
&lt;br /&gt;
Standard period for working on a homework assignment is 2 weeks for practical assignments and 1 week for theoretical ones. The first practical assignment is an exception. Assignments sent after late deadlines will not be scored (assigned with zero score) in the absence of legitimate reasons for late submission which do not include high load on other classes. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Deadline time:&#039;&#039;&#039; 23:59 of the day before seminar (Thursday).&lt;br /&gt;
&lt;br /&gt;
== Structure of emails and homework submissions ==&lt;br /&gt;
All the questions and submissions must be addressed to &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
The following subjects must be used:&lt;br /&gt;
* For &#039;&#039;questions&#039;&#039; (general, regarding assignments, etc): &amp;quot;Question - Surname Name - Group&amp;quot;&lt;br /&gt;
* For &#039;&#039;homework submissions&#039;&#039;: &amp;quot;Practice/Theory {Lab number} - Surname Name - Group&amp;quot;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Example&#039;&#039;: Practice 1 - Ivanov Ivan - 141&lt;br /&gt;
&lt;br /&gt;
Please do not mix two different topics in a single email such as theoretical and practical assignments etc. When replying, please use the  &#039;&#039;&#039;same&#039;&#039;&#039; thread (i.e. reply to the same email).&lt;br /&gt;
&lt;br /&gt;
Practical assignments must be implemented in jupyter notebook format, theoretical ones in pdf. Practical assignments must use &#039;&#039;&#039;Python 3&#039;&#039;&#039;. Use your surname as a filename for assignments (e.g. Ivanov.ipynb). Do not archive your assignments.&lt;br /&gt;
&lt;br /&gt;
Assignments can be performed in either Russian or English.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Assignments can be submitted only once!&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Useful links ==&lt;br /&gt;
=== Machine learning ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* [https://yandexdataschool.ru/edu-process/courses/machine-learning Video-lectures of K. Vorontsov on machine learning]&lt;br /&gt;
* On of the classic ML books. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Official website]&lt;br /&gt;
* Libraries: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* A little example for the begginers: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Python from scratch: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Lectures [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* A book: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Python installation and configuration ===&lt;br /&gt;
&lt;br /&gt;
[https://www.continuum.io/downloads anaconda]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=16637</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=16637"/>
		<updated>2015-05-30T07:31:56Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 15. Нейронные сети.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/dfu7ykkj8psourh/slides-NeuralNets.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 16. Ранжирование.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/4jz8k9ch10vuiyl/slides-Ranking.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 17. Коллаборативная фильтрация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/gc6umd44g86whn7/slides-Collaborative.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Семинар 15. Нейронные сети ===&lt;br /&gt;
[https://www.dropbox.com/s/fh2frujzaz0gz9w/lab15.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/bcfthzhghnnglvy/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 16. Ранжирование ===&lt;br /&gt;
[https://www.dropbox.com/s/x2nulcih02l32qf/sem16.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 17. Коллаборативная фильтрация ===&lt;br /&gt;
[https://www.dropbox.com/s/sfyby2r9kugwhiv/lab17.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/5as2k79dhajtw7n/data.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=14679</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=14679"/>
		<updated>2015-05-23T07:37:13Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 15. Нейронные сети.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/dfu7ykkj8psourh/slides-NeuralNets.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 16. Ранжирование.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/4jz8k9ch10vuiyl/slides-Ranking.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Семинар 15. Нейронные сети ===&lt;br /&gt;
[https://www.dropbox.com/s/fh2frujzaz0gz9w/lab15.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/bcfthzhghnnglvy/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 16. Ранжирование ===&lt;br /&gt;
[https://www.dropbox.com/s/x2nulcih02l32qf/sem16.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12583</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12583"/>
		<updated>2015-05-16T08:08:34Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 15. Нейронные сети.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/dfu7ykkj8psourh/slides-NeuralNets.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 15. Нейронные сети ===&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/fh2frujzaz0gz9w/lab15.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/bcfthzhghnnglvy/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12572</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12572"/>
		<updated>2015-05-16T07:39:11Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Нейронные сети.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 15. Нейронные сети ===&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/fh2frujzaz0gz9w/lab15.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/bcfthzhghnnglvy/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12570</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=12570"/>
		<updated>2015-05-16T07:35:06Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 15. Нейронные сети ===&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/fh2frujzaz0gz9w/lab15.pdf?dl=0, Лабораторная]&lt;br /&gt;
[https://www.dropbox.com/s/bcfthzhghnnglvy/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=8707</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=8707"/>
		<updated>2015-04-25T07:33:08Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 14. Композиции алгоритмов.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/8cy5pfgz1gg1na6/lec14.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
Дедлайны:&lt;br /&gt;
&lt;br /&gt;
Группы Артема и Ани: теория 25.04 09:00, практика 2.05 09:00.&lt;br /&gt;
&lt;br /&gt;
Группы Сергея: теория 30.04 09:00, практика 7.05 09:00.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 14. Композиции классификаторов ===&lt;br /&gt;
[https://www.dropbox.com/s/y0von4yb7iamxuf/sem14.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=7563</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=7563"/>
		<updated>2015-04-18T07:57:03Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 13. Кластеризация.&#039;&#039;&#039;&lt;br /&gt;
[https://www.dropbox.com/s/3t3vvyvlk0eihoo/slides-Clustering.pdf?dl=0, Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=7562</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=7562"/>
		<updated>2015-04-18T07:37:29Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 13. Кластеризация ===&lt;br /&gt;
[https://www.dropbox.com/s/zgq88loq09bzbbm/lab13.pdf?dl=0 Задание], [https://www.dropbox.com/s/4snv7gpc1l5je9q/parrots.jpg?dl=0 parrots.jpg], [https://www.dropbox.com/s/9ilrbbdz74pvne0/grass.jpg?dl=0 grass.jpg].&lt;br /&gt;
[https://www.dropbox.com/s/fiy2u04o3g0eea2/problems_hse.pdf?dl=0, Теоретические задачи]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=6542</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=6542"/>
		<updated>2015-04-11T07:30:33Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет устный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за устный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Меры при обнаружении плагиата&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для лабораторных 1-7:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* По умолчанию всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. &lt;br /&gt;
* Из каждого онаруженного нами кластера людей, сдавших одинаковую работу, первый сдавший предполагается первоисточником работы и может получить за нее положительную оценку. Для этого он должен устно зачесть работу у преподавателя. Желательно обращаться именно к тому преподавателю, который проверял работу. При успешной защите своей работы со студента снимается отметка о плагиате.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Для всех последующих лабораторных:&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
* Всем, у кого обнаружен плагиат ставится 0 баллов и отметка о плагиате. И тем, кто списал, и тем, у кого списали. Мы не будем искать первоисточник работы.&lt;br /&gt;
Также Вы должны понимать, что плагиат будет иметь и другие последствия. При обнаружении плагиата у одного и того же человека более одного раза на него будет оформляться докладная на имя декана.&lt;br /&gt;
&lt;br /&gt;
Если у человека есть хоть одна отметка о плагиате, он не может получить автомат.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 12. Выбор моделей и отбор признаков.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/7qchphf7ka7va2u/lec12.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 12. Оценивание моделей ===&lt;br /&gt;
[https://www.dropbox.com/s/oy8c32jnv8oo3si/sem12.pdf?dl=0, Задачи с семинара]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
&lt;br /&gt;
Большая просьба ко всем сдавать свои работы в ipython notebook, это очень упростит нам проверку. В качестве названия для файла с работой используйте свою фамилию на английском языке. Не нужно архивировать файлы перед отправкой.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=2547</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=2547"/>
		<updated>2015-03-21T07:31:38Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за письменный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 10. Разделение смеси распределений ===&lt;br /&gt;
[https://www.dropbox.com/s/fcelgz2vicnddsf/lab10.pdf?dl=0, Задание], [https://www.dropbox.com/s/c6z8xexubmbixi8/mnist.zip?dl=0, Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1792</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1792"/>
		<updated>2015-03-14T07:32:51Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
&#039;&#039;&#039;Оценка за курс.&#039;&#039;&#039; После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории. Также в середине семестра будет проведен устный коллоквиум по теории. Итоговая оценка за курс складывается из оценок за практические задания, оценки за коллоквиум и оценки за экзамен. &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Формальные критерии:&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Оценки за различные активности:&lt;br /&gt;
* O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; - суммарная оценка за теоретические части лабораторных работ (max = 3 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; - суммарная оценка за практические части лабораторных работ (max = 5 за одну лабораторную)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt; - оценка за устный коллоквиум (max = 5)&lt;br /&gt;
* O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; - оценка за письменный экзамен (max = 50)&lt;br /&gt;
&lt;br /&gt;
Общее число баллов:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; = 0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt; + 0.2 * O&amp;lt;sub&amp;gt;exam&amp;lt;/sub&amp;gt; + O&amp;lt;sub&amp;gt;colloquium&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Критерии оценки:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; = max_possible_value_of(O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
При подсчете O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt; не учитываются дополнительные баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 5&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.8 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 4&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.6 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Оценка 3&#039;&#039;&#039;: O&amp;lt;sub&amp;gt;all&amp;lt;/sub&amp;gt; &amp;gt;= 0.45 * O&amp;lt;sub&amp;gt;max&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;Критерии в 10-бальной шкале будут вывешены позднее. &#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
За курс можно получить автомат без сдачи итогового экзамена. Для этого нужно получить максимальный балл за коллоквиум, а также суммарная оценка за лабораторные должна быть хорошей:&lt;br /&gt;
&lt;br /&gt;
(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;) &amp;gt;= 0.9 * max_possible_value_of(0.2 * O&amp;lt;sub&amp;gt;theory&amp;lt;/sub&amp;gt; + 0.4 * O&amp;lt;sub&amp;gt;practice&amp;lt;/sub&amp;gt;)&lt;br /&gt;
&lt;br /&gt;
Здесь при подсчете максимального значения опять же не учитываются баллы за задания со звездочкой.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Дедлайны.&#039;&#039;&#039; Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекции 8-9. Байесовская классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/rc5d97y7wttx7a0/slides-Bayes.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по четвергам дедлайн 9:00 следующего четверга. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 9. Параметрическая Байесовская классификация ===&lt;br /&gt;
[https://www.dropbox.com/s/8u1cyn0fdbdrtdp/lab9.pdf?dl=0 Задание], [https://www.dropbox.com/s/r13rvv047j6lthl/2d.zip?dl=0 Данные1], [https://www.dropbox.com/s/9sh0rn0v74jep0m/200d.zip?dl=0 Данные2]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1700</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1700"/>
		<updated>2015-02-28T07:36:31Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/dsgfrs0jo3grbci/slides-Regression.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 7. PCA + регрессия ===&lt;br /&gt;
[https://www.dropbox.com/s/d63lww92hdtf35z/lab7.pdf?dl=0 Задание], [https://www.dropbox.com/s/ngxt79hdgqtqet8/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1699</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1699"/>
		<updated>2015-02-28T07:34:34Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Темы лекций */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 6. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 7. Линейная регрессия и PCA.&#039;&#039;&#039;&lt;br /&gt;
Методы восстановления регрессии. Задача восстановления регрессии, метод наименьших квадратов. Многомерная линейная регрессия. Сингулярное разложение. Регуляризация: гребневая регрессия и лассо Тибширани. Метод главных компонент и декоррелирующее преобразование.&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1678</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1678"/>
		<updated>2015-02-25T18:07:25Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 12 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1677</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1677"/>
		<updated>2015-02-25T18:06:00Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Коллоквиум ==&lt;br /&gt;
&lt;br /&gt;
На семинарах 7 и 14 марта пройдет коллоквиум. Каждый студент должен будет лично ответить преподавателю на несколько вопросов из списка ниже.&lt;br /&gt;
[https://www.dropbox.com/s/r4d2o4wtjydwo5e/questions.pdf?dl=0 Список вопросов] &lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1642</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1642"/>
		<updated>2015-02-21T07:29:58Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Темы лекций */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Линейный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. Ядерный SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1641</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1641"/>
		<updated>2015-02-21T07:29:23Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Семинары */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. Линейный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 6. Ядерный SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/bspfulrpj180da8/lab6.pdf?dl=0 Задание]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1601</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1601"/>
		<updated>2015-02-14T07:30:22Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 5. SVM.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/xvdaoilxu71bz65/lec5.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
=== Семинар 5. SVM ===&lt;br /&gt;
[https://www.dropbox.com/s/kbkhk4z5pagsrne/lab5.pdf?dl=0 Задание], [https://www.dropbox.com/s/5ro58pbpdf2iwoq/data.zip?dl=0 Данные]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1548</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1548"/>
		<updated>2015-02-07T07:29:57Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Темы лекций */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Логические закономерности и решающие деревья. Понятие логической закономерности. Определение информативности. Разновидности закономерностей: шары, гиперплоскости, гиперпараллелепипеды (конъюнкции). Бинаризация признаков, алгоритм выделения информативных зон. «Градиентный» алгоритм синтеза конъюнкций, частные случаи: жадный алгоритм, стохастический локальный поиск, стабилизация, редукция. Решающее дерево. Псевдокод: жадный алгоритм ID3. Недостатки алгоритма и способы их устранения. Проблема переобучения. Редукция решающих деревьев: предредукция и постредукция.&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 4. Линейные методы классификации.&#039;&#039;&#039;&lt;br /&gt;
Линейные алгоритмы классификации. Квадратичная функция потерь, метод наименьших квадратов. Метод стохастического градиента и частные случаи: перcептрон Розенблатта, правило Хэбба. Недостатки метода стохастического градиента и способы их устранения. Ускорение сходимости, «выбивание» из локальных минимумов. Проблема переобучения, редукция весов (weight decay).&lt;br /&gt;
[https://www.dropbox.com/s/hj0ao16hh7n2bso/lec4.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
=== Семинар 4. Линейные методы классификации ===&lt;br /&gt;
[https://www.dropbox.com/s/8aopczz722klmya/lab4.pdf?dl=0 Задание], [https://www.dropbox.com/s/vn6g2dceepropd5/train.csv?dl=0 train.csv] и [https://www.dropbox.com/s/qtiu368pq2c33ea/test.csv?dl=0 test.csv].&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1500</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1500"/>
		<updated>2015-01-31T08:35:09Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Темы лекций */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Контакты: &#039;&#039;&#039; cshse.ml@gmail.com&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 3. Логическая классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/9qfmw95wlw26jvb/slides-Logic1_ml_hse.pdf?dl=0 Слайды]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
=== Семинар 3. Решающие деревья ===&lt;br /&gt;
[https://www.dropbox.com/s/4qxzfmzko3k01fq/lab3.pdf?dl=0 Задание], [https://www.dropbox.com/s/8ronkxqj087mxbe/adult.data?dl=0 данные], [https://www.dropbox.com/s/42a5gb3tw4dc3mi/adult.names?dl=0 названия признаков].&lt;br /&gt;
&lt;br /&gt;
[http://ogrisel.github.io/scikit-learn.org/sklearn-tutorial/auto_examples/tutorial/plot_knn_iris.html Туториал по визуализации]&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Небольшой пример для начинающих: [http://nbviewer.ipython.org/gist/voron13e02/83a86f2e0fc5e7f8424d краткое руководство с примерами по Python 2]&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1425</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1425"/>
		<updated>2015-01-24T08:51:39Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Темы лекций */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/p7kfijkrhq0kdwv/intro.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/me0q1njwonyrt06/instruments.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
Метрические алгоритмы классификации. Метод ближайших соседей (kNN) и его обобщения. Подбор числа k по критерию скользящего контроля. Обобщённый метрический классификатор, понятие отступа. Проклятие размерности. Методы быстрого поиска ближайших соседей.&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1424</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1424"/>
		<updated>2015-01-24T07:45:14Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&#039;&#039;&#039;Таблица результатов [https://docs.google.com/spreadsheets/d/1m6xUNu7Hq7-wi_G2527d4HAE_N03F74ryNKIs3zgEbQ/edit#gid=0 здесь]&#039;&#039;&#039; &lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;br /&amp;gt;&lt;br /&gt;
== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 2. Метрическая классификация.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/vlmifieu79liq1p/metric.pdf?dl=0 Слайды, часть 1]&lt;br /&gt;
[https://www.dropbox.com/s/g9g6ib8icygik2j/metric2.pdf?dl=0 Слайды, часть 2]&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
=== Семинар 2. Проклятие размерности. Метод ближайшего соседа  ===&lt;br /&gt;
[https://www.dropbox.com/s/fc2kd7pp3no0s0t/practice.pdf?dl=0 Задание], [https://www.dropbox.com/s/xuse7r13f5cls6a/new_york.txt?dl=0 данные о ресторанах] ([https://www.dropbox.com/s/yejtu3y4ixt3tzl/features.txt?dl=0 название признаков]).&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1410</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1410"/>
		<updated>2015-01-23T16:05:46Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
* Оценка за курс. После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
* Дедлайны. Решения присланные после дедлайнов не принимаются, кроме случаев наличия уважительных причин у студента (завалы на учебе или работе уважительными причинами не считаются).&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
=== Правила сдачи заданий cеминаров === &lt;br /&gt;
* На семинарах выдаются практические лабораторные работы, которые можно сдавать на семинаре, либо по почте до дедлайна.&lt;br /&gt;
* Для групп, у который семинары проходят по субботам, дедлайн 9:00 следующей субботы. У групп с семинарами по понедельникам дедлайн 9:00 следующего понедельника. &lt;br /&gt;
* Решения следует отправлять на почту курса с соответствующей темой письма (см. раздел Оформление писем). &lt;br /&gt;
* Решения принимаются в виде одного аккуратно оформленного ipython-notebook&#039;а (.ipynb-файл), либо в виде аккуратного pdf-файла + скриптов.&lt;br /&gt;
* Для теоретических заданий предполагается развернутый ответ (с доказательством при необходимости).&lt;br /&gt;
* По каждому практическому заданию помимо формального ответа на вопрос и соответствующего кода необходимо так же дать комментарии/построить графики при необходимости и сделать выводы.&lt;br /&gt;
=== Семинар 1. Инструментарий ===  &lt;br /&gt;
Знакомство с языком Python. &lt;br /&gt;
[https://www.dropbox.com/s/bx6hrz7pb61l9ab/ML_HSE_Lab1.pdf?dl=0 Лабораторная 1], [https://www.dropbox.com/s/y1kfgpiwbgjeisl/train.csv?dl=0 данные].&lt;br /&gt;
&lt;br /&gt;
[http://nbviewer.ipython.org/gist/anonymous/fba8bf7f1ad379df9d63 Материал] в помощь.&lt;br /&gt;
&lt;br /&gt;
== Оформление писем ==&lt;br /&gt;
Вопросы и домашние задания присылайте на почтовый адрес &#039;&#039;&#039;cshse.ml@gmail.com&#039;&#039;&#039;.&lt;br /&gt;
На почту присылайте письма со следующими темами:&lt;br /&gt;
* Для &#039;&#039;вопросов&#039;&#039; (общих, по лабораторным, по теории и т. д.): &amp;quot;Вопрос - Фамилия Имя Отчество - Группа&amp;quot;&lt;br /&gt;
* Для &#039;&#039;лабораторных&#039;&#039;: &amp;quot;Лабораторная {Номер лабораторной работы} - Фамилия Имя Отчество - Группа (Семинарист)&amp;quot;&lt;br /&gt;
Когда отвечаете на наши письма или досылаете какие-то решения, пишите письма в &#039;&#039;&#039;тот же&#039;&#039;&#039; тред.&lt;br /&gt;
== Полезные ссылки ==&lt;br /&gt;
=== Машинное обучение ===&lt;br /&gt;
* [http://www.machinelearning.ru/wiki/index.php?title=Заглавная_страница machinelearning.ru]&lt;br /&gt;
* Одна из классических и наиболее полных книг по машинному обучению. [http://web.stanford.edu/~hastie/local.ftp/Springer/ESLII_print10.pdf Elements of Statistical Learning (Trevor Hastie, Robert Tibshirani, Jerome Friedman)]&lt;br /&gt;
=== Python ===&lt;br /&gt;
* [http://python.org Официальный сайт]&lt;br /&gt;
* Библиотеки: [http://www.numpy.org/ NumPy], [http://pandas.pydata.org/ Pandas], [http://scikit-learn.org/stable/ SciKit-Learn], [http://matplotlib.org/ Matplotlib].&lt;br /&gt;
* Питон с нуля: [http://nbviewer.ipython.org/gist/rpmuller/5920182 A Crash Course in Python for Scientists]&lt;br /&gt;
* Лекции [https://github.com/jrjohansson/scientific-python-lectures#online-read-only-versions Scientific Python]&lt;br /&gt;
* Книга: [http://www.cin.ufpe.br/~embat/Python%20for%20Data%20Analysis.pdf Wes McKinney «Python for Data Analysis»]&lt;br /&gt;
* [https://github.com/ipython/ipython/wiki/A-gallery-of-interesting-IPython-Notebooks Коллекция интересных IPython ноутбуков]&lt;br /&gt;
=== Установка и настройка Python ===&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Windows|Windows]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Mac_OS|Mac OS]]&lt;br /&gt;
* [[Анализ данных (Программная инженерия)/Установка и настройка Python#Linux | Linux]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1255</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1255"/>
		<updated>2015-01-16T18:14:14Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;br /&gt;
&lt;br /&gt;
== Семинары ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Полезные ссылки ==&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1254</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1254"/>
		<updated>2015-01-16T18:13:10Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки и фреймворки для анализа данных на различных языках программирования.&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1253</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1253"/>
		<updated>2015-01-16T18:12:51Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач. Существующие инструменты анализа данных.&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач. Популярные библиотеки для анализа данных на различных языках программирования.&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1252</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1252"/>
		<updated>2015-01-16T18:11:42Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач&#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач.&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1251</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1251"/>
		<updated>2015-01-16T18:10:50Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Краткое описание ==&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
== Отчётность по курсу и критерии оценки ==&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
== Темы лекций ==&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач&#039;&#039;&#039;&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач.&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1250</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1250"/>
		<updated>2015-01-16T18:10:15Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Анализ данных ==&lt;br /&gt;
&lt;br /&gt;
=== Краткое описание ===&lt;br /&gt;
В курсе рассматриваются основные задачи анализа данных и обучения по прецедентам: классификация, кластеризация, регрессия, понижение размерности. Изучаются методы их решения, как классические, так и новые, созданные за последние 10–15 лет. Упор делается на практические аспекты применения изучаемых алгоритмов. Большое внимание уделяется практическим лабораторным работам на языке Python.&lt;br /&gt;
&lt;br /&gt;
=== Отчётность по курсу и критерии оценки ===&lt;br /&gt;
После каждой лекции студентам предлагается выполнить практическое задание на Python. В конце модуля пройдет письменный экзамен по теории.&lt;br /&gt;
Итоговая оценка за курс складывается из оценок за практические задания и оценки за экзамен.&lt;br /&gt;
&lt;br /&gt;
=== Темы лекций ===&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция 1. Основные понятия и примеры прикладных задач&#039;&#039;&#039;&lt;br /&gt;
Постановка задач обучения по прецедентам. Объекты и признаки. Типы шкал: бинарные, номинальные, порядковые, количественные. Типы задач: классификация, регрессия, прогнозирование, кластеризация.&lt;br /&gt;
Основные понятия: модель алгоритмов, метод обучения, функция потерь и функционал качества, принцип минимизации эмпирического риска, обобщающая способность, скользящий контроль.&lt;br /&gt;
Примеры прикладных задач.&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1214</id>
		<title>Анализ данных (Программная инженерия)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_(%D0%9F%D1%80%D0%BE%D0%B3%D1%80%D0%B0%D0%BC%D0%BC%D0%BD%D0%B0%D1%8F_%D0%B8%D0%BD%D0%B6%D0%B5%D0%BD%D0%B5%D1%80%D0%B8%D1%8F)&amp;diff=1214"/>
		<updated>2015-01-14T17:47:56Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: Новая страница: «== Анализ данных ==  Темы лекций»&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== [[Анализ данных]] ==&lt;br /&gt;
&lt;br /&gt;
[[Темы лекций]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9E_%D1%84%D0%B0%D0%BA%D1%83%D0%BB%D1%8C%D1%82%D0%B5%D1%82%D0%B5&amp;diff=1213</id>
		<title>О факультете</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9E_%D1%84%D0%B0%D0%BA%D1%83%D0%BB%D1%8C%D1%82%D0%B5%D1%82%D0%B5&amp;diff=1213"/>
		<updated>2015-01-14T17:46:37Z</updated>

		<summary type="html">&lt;p&gt;Arbabenko: /* Курсы за 2014/15 учебный год */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Факультет компьютерных наук НИУ ВШЭ ==&lt;br /&gt;
&lt;br /&gt;
== Курсы за 2014/15 учебный год ==&lt;br /&gt;
[[Основы и методологии программирования]]&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Алгоритмы и структуры данных]]&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Анализ данных (Программная инженерия)]]&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
== Проектная работа, 2015 год ==&lt;br /&gt;
[[Проектная работа]]&lt;/div&gt;</summary>
		<author><name>Arbabenko</name></author>
	</entry>
</feed>