<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Jubbon</id>
	<title>Wiki - Факультет компьютерных наук - Вклад [ru]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Jubbon"/>
	<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%92%D0%BA%D0%BB%D0%B0%D0%B4/Jubbon"/>
	<updated>2026-09-20T23:02:40Z</updated>
	<subtitle>Вклад</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=861</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=861"/>
		<updated>2014-12-11T15:20:45Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, pyspider, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* IaaS платформа Amazon Web Services (в рамках программы бесплатного использования одного экземпляра виртуальной машины на 1 год)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=860</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=860"/>
		<updated>2014-12-10T18:50:45Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* IaaS платформа Amazon Web Services (в рамках программы бесплатного использования одного экземпляра виртуальной машины на 1 год)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=859</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=859"/>
		<updated>2014-12-10T18:47:42Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=858</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=858"/>
		<updated>2014-12-10T18:44:41Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=857</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=857"/>
		<updated>2014-12-10T18:43:20Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub (или BitBucket) в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=856</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=856"/>
		<updated>2014-12-10T18:42:36Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=off&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub (или BitBucket) в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=855</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=855"/>
		<updated>2014-12-10T18:42:06Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=0&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub (или BitBucket) в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=854</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=854"/>
		<updated>2014-12-10T18:40:49Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub (или BitBucket) в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=853</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=853"/>
		<updated>2014-12-10T18:39:37Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Профессиональные интересы */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:DmitryKulikov.jpg|400px|мини]]&lt;br /&gt;
&lt;br /&gt;
==Дмитрий Куликов==&lt;br /&gt;
* В 2002 году закончил радиофизический факультет Нижегородского Государственного Университета им. Лобачевского&lt;br /&gt;
* С 2002 по 2014 год - сотрудник Института Теоретической и Математической Физики РФЯЦ-ВНИИЭФ (г. Саров)&lt;br /&gt;
* С 2014 года - разработчик в Яндексе&lt;br /&gt;
&lt;br /&gt;
==Профессиональные интересы==&lt;br /&gt;
* Языки программирования: C++, Python&lt;br /&gt;
* Алгоритмы машинного обучения&lt;br /&gt;
* Большие Данные&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
* Электронная почта: jubbon@yandex.ru&lt;br /&gt;
* Мобильный телефон: +7(925)126-94-85&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=851</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=851"/>
		<updated>2014-12-10T18:38:32Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Дмитрий Куликов */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:DmitryKulikov.jpg|400px|мини]]&lt;br /&gt;
&lt;br /&gt;
==Дмитрий Куликов==&lt;br /&gt;
* В 2002 году закончил радиофизический факультет Нижегородского Государственного Университета им. Лобачевского&lt;br /&gt;
* С 2002 по 2014 год - сотрудник Института Теоретической и Математической Физики РФЯЦ-ВНИИЭФ (г. Саров)&lt;br /&gt;
* С 2014 года - разработчик в Яндексе&lt;br /&gt;
&lt;br /&gt;
==Профессиональные интересы==&lt;br /&gt;
* Языки программирования: C++, Python&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
* Электронная почта: jubbon@yandex.ru&lt;br /&gt;
* Мобильный телефон: +7(925)126-94-85&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=849</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=849"/>
		<updated>2014-12-10T18:37:03Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Контакты */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:DmitryKulikov.jpg|400px|мини]]&lt;br /&gt;
&lt;br /&gt;
==Дмитрий Куликов==&lt;br /&gt;
* Окончил в 2002 году Нижегородский Государственный Университет им. Лобачевского (радиофизический факультет)&lt;br /&gt;
* С 2002 по 2014 год - сотрудник Института Теоретической и Математической Физики РФЯЦ-ВНИИЭФ (г. Саров)&lt;br /&gt;
&lt;br /&gt;
==Профессиональные интересы==&lt;br /&gt;
* Языки программирования: C++, Python&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
* Электронная почта: jubbon@yandex.ru&lt;br /&gt;
* Мобильный телефон: +7(925)126-94-85&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=848</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=848"/>
		<updated>2014-12-10T18:36:45Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:DmitryKulikov.jpg|400px|мини]]&lt;br /&gt;
&lt;br /&gt;
==Дмитрий Куликов==&lt;br /&gt;
* Окончил в 2002 году Нижегородский Государственный Университет им. Лобачевского (радиофизический факультет)&lt;br /&gt;
* С 2002 по 2014 год - сотрудник Института Теоретической и Математической Физики РФЯЦ-ВНИИЭФ (г. Саров)&lt;br /&gt;
&lt;br /&gt;
==Профессиональные интересы==&lt;br /&gt;
* Языки программирования: C++, Python&lt;br /&gt;
&lt;br /&gt;
==Контакты==&lt;br /&gt;
* электронная почта: jubbon@yandex.ru&lt;br /&gt;
* мобильный телефон: +7(925)126-94-85&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=847</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=847"/>
		<updated>2014-12-10T18:25:19Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: Добавил свою фотографию&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Добро пожаловать!&lt;br /&gt;
&lt;br /&gt;
Меня зовут Дмитрий Куликов, и я работаю разработчиком в Яндексе.&lt;br /&gt;
&lt;br /&gt;
[[Файл:DmitryKulikov.jpg||right]]&lt;br /&gt;
Со мной можно связаться по электронной почте jubbon@yandex.ru или мобильному телефону +7 (925) 126-94-85.&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:DmitryKulikov.jpg&amp;diff=846</id>
		<title>Файл:DmitryKulikov.jpg</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:DmitryKulikov.jpg&amp;diff=846"/>
		<updated>2014-12-10T18:23:31Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=429</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=429"/>
		<updated>2014-11-19T15:45:08Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* Система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub (или BitBucket) в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* IaaS платформа Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=428</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=428"/>
		<updated>2014-11-19T15:43:52Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие начальные требования? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовых навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=427</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=427"/>
		<updated>2014-11-19T15:42:28Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Что это за проект? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
* Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
* Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
* Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
* Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
* Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
* Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
* Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=426</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=426"/>
		<updated>2014-11-19T15:41:49Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
Оценки &#039;&#039;&#039;4-5&#039;&#039;&#039;:&lt;br /&gt;
* утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
* повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;6-7&#039;&#039;&#039;:&lt;br /&gt;
* утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
* повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
* утилита позволяет задавать различные опции командной строки&lt;br /&gt;
* разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
* реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
Оценки &#039;&#039;&#039;8-10&#039;&#039;&#039;:&lt;br /&gt;
* применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
* упаковка утилиты в Debian-пакет&lt;br /&gt;
* написана небольшая документация в формате Markdown&lt;br /&gt;
* настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=425</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=425"/>
		<updated>2014-11-19T15:40:32Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие начальные требования? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
* желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&amp;quot;4-5&amp;quot;:&lt;br /&gt;
 - утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
 - повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
&amp;quot;6-7&amp;quot;:&lt;br /&gt;
 - утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
 - повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
 - утилита позволяет задавать различные опции командной строки&lt;br /&gt;
 - разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
 - реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
&amp;quot;8-10&amp;quot;:&lt;br /&gt;
 - применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
 - упаковка утилиты в Debian-пакет&lt;br /&gt;
 - написана небольшая документация в формате Markdown&lt;br /&gt;
 - настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=424</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=424"/>
		<updated>2014-11-19T15:40:21Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Чему вы научитесь? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
* основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
* извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
* разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
* корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
- желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&amp;quot;4-5&amp;quot;:&lt;br /&gt;
 - утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
 - повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
&amp;quot;6-7&amp;quot;:&lt;br /&gt;
 - утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
 - повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
 - утилита позволяет задавать различные опции командной строки&lt;br /&gt;
 - разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
 - реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
&amp;quot;8-10&amp;quot;:&lt;br /&gt;
 - применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
 - упаковка утилиты в Debian-пакет&lt;br /&gt;
 - написана небольшая документация в формате Markdown&lt;br /&gt;
 - настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=423</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=423"/>
		<updated>2014-11-19T15:40:00Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
- основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
 - извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
 - разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
 - корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
- желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
* Язык программирования Python версии 2.7&lt;br /&gt;
* Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
* Язык запросов XPath&lt;br /&gt;
* система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
* GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
* Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&amp;quot;4-5&amp;quot;:&lt;br /&gt;
 - утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
 - повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
&amp;quot;6-7&amp;quot;:&lt;br /&gt;
 - утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
 - повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
 - утилита позволяет задавать различные опции командной строки&lt;br /&gt;
 - разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
 - реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
&amp;quot;8-10&amp;quot;:&lt;br /&gt;
 - применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
 - упаковка утилиты в Debian-пакет&lt;br /&gt;
 - написана небольшая документация в формате Markdown&lt;br /&gt;
 - настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=422</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=422"/>
		<updated>2014-11-19T15:39:39Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
- основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
 - извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
 - разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
 - корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
- желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
 * Язык программирования Python версии 2.7&lt;br /&gt;
 * Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
 * Язык запросов XPath&lt;br /&gt;
 * система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
 * GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
 * Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&amp;quot;4-5&amp;quot;:&lt;br /&gt;
 - утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
 - повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
&amp;quot;6-7&amp;quot;:&lt;br /&gt;
 - утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
 - повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
 - утилита позволяет задавать различные опции командной строки&lt;br /&gt;
 - разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
 - реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
&amp;quot;8-10&amp;quot;:&lt;br /&gt;
 - применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
 - упаковка утилиты в Debian-пакет&lt;br /&gt;
 - написана небольшая документация в формате Markdown&lt;br /&gt;
 - настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=421</id>
		<title>DataSpider (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=DataSpider_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=421"/>
		<updated>2014-11-19T15:38:53Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: Новая страница, с помощью формы Новый_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=DataSpider&lt;br /&gt;
|mentor=Куликов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Задачей проекта DataSpider является реализация консольной утилиты, предназначенной&lt;br /&gt;
для обхода тематических сайтов в сети Интернет и извлечения &amp;quot;полезных&amp;quot; данных. Результатом обхода будет являться текстовый файл в формате CSV или TSV, содержащий извлеченные данные. Подобная программа необходима для получения открытых данных в случае, когда на сайте отсутствует возможность использовать API.&lt;br /&gt;
На выбор будут предложены сайты по следующим тематикам:&lt;br /&gt;
 - Прогноз погоды (gismeteo.ru, meteoinfo.ru, hmn.ru, meteoservice.ru, foreca.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги банков (banki.ru, bankir.ru, 101bank.net, raexpert.ru, sravni.ru, banks-rating.ru, сайт ЦБ РФ)&lt;br /&gt;
 - Финансовые показатели и рейтинги страховых компаний (raexpert.ru, insuru.ru, ic-ratings.ru, inguru.ru, sravni.ru)&lt;br /&gt;
 - Финансовые показатели и рейтинги туристических фирм (firms.turizm.ru, turreestr.ru, tursvodka.ru,tour-info.ru)&lt;br /&gt;
 - Продажа и аренда недвижимости (cian.ru, realty.dmir.ru, irr.ru, egsnk.ru, gdeetotdom.ru) &lt;br /&gt;
 - Спортивные соревнования и спортивная аналитика (myscore.ru, news.sportbox.ru, sports.ru, championat.com)&lt;br /&gt;
 - Экскурсионные предложения (автобусные экскурсии, речные круизы)&lt;br /&gt;
 - Интернет-магазины (mvideo.ru, mediamarkt.ru, eldorado.ru, 003.ru, enter.ru)&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
- основным принципам межсетевого взаимодействия по протоколу HTTP&lt;br /&gt;
 - извлекать различные данные из HTML-страниц с помощью языка запросов XPath и регулярных выражений&lt;br /&gt;
 - разрабатывать алгоритмы для эффективного обхода множества страниц сайта&lt;br /&gt;
 - корректно использовать аргументы командной строки, переменные окружения, стандартные потоки ввода и вывода при создании консольных утилит&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
- желательно наличие базовые навыков программирования на языке Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
- Язык программирования Python версии 2.7&lt;br /&gt;
 - Python-пакеты Grab, ScraPy, Selenium Web Driver и другие&lt;br /&gt;
 - Язык запросов XPath&lt;br /&gt;
 - система контроля версий Git (или Mercurial по желанию студента)&lt;br /&gt;
 - GitHub в качестве система управления проектом (хранение исходного кода, отслеживание тикетов, управление релизами, ревью) &lt;br /&gt;
 - Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
Каждая подобная утилита может рассматриваться как источник данных для проведения статистических исследований и различного рода аналитики. Собранные данные могут использоваться методами машинного обучения для построения различных описательных или предсказательных моделей.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&amp;quot;4-5&amp;quot;:&lt;br /&gt;
 - утилита обходит только один сайт из выбранной тематики&lt;br /&gt;
 - повторный запуск приводит к перезатиранию предыдущих результатов&lt;br /&gt;
&lt;br /&gt;
&amp;quot;6-7&amp;quot;:&lt;br /&gt;
 - утилита позволяет обходить два или более тематических сайта&lt;br /&gt;
 - повторный запуск приводит к накоплению данных в результирующих файлах&lt;br /&gt;
 - утилита позволяет задавать различные опции командной строки&lt;br /&gt;
 - разработаны и проходят модульные тесты для большей части кода&lt;br /&gt;
 - реализовано корректное разграничение стандартных потоков ввода и вывода&lt;br /&gt;
&lt;br /&gt;
&amp;quot;8-10&amp;quot;:&lt;br /&gt;
 - применение mock-объектов для функционального тестирования (???)&lt;br /&gt;
 - упаковка утилиты в Debian-пакет&lt;br /&gt;
 - написана небольшая документация в формате Markdown&lt;br /&gt;
 - настройка cron-задания для периодического запуска утилиты&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=332</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=332"/>
		<updated>2014-11-11T09:55:25Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: Указал свою должность&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Добро пожаловать!&lt;br /&gt;
&lt;br /&gt;
Меня зовут Дмитрий Куликов и я работаю разработчиком в Яндексе.&lt;br /&gt;
&lt;br /&gt;
Со мной можно связаться по электронной почте jubbon@yandex.ru или мобильному телефону (925)126-94-85.&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=331</id>
		<title>Участник:Jubbon</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Jubbon&amp;diff=331"/>
		<updated>2014-11-11T09:54:36Z</updated>

		<summary type="html">&lt;p&gt;Jubbon: Начальное заполнение моей личной страницы&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Добро пожаловать!&lt;br /&gt;
&lt;br /&gt;
Меня зовут Дмитрий Куликов и я работаю в Яндексе.&lt;br /&gt;
&lt;br /&gt;
Со мной можно связаться по электронной почте jubbon@yandex.ru или мобильному телефону (925)126-94-85.&lt;/div&gt;</summary>
		<author><name>Jubbon</name></author>
	</entry>
</feed>