<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Ilya+Kuzminov</id>
	<title>Wiki - Факультет компьютерных наук - Вклад [ru]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Ilya+Kuzminov"/>
	<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%92%D0%BA%D0%BB%D0%B0%D0%B4/Ilya_Kuzminov"/>
	<updated>2026-09-22T19:53:46Z</updated>
	<subtitle>Вклад</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=25308</id>
		<title>Систематизация и реформирование базы извлеченных знаний (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=25308"/>
		<updated>2017-10-16T20:04:26Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Систематизация и реформирование базы извлеченных знаний&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=2-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единой структуры базы извлеченных знаний, с помощью которой можно будет проследить наследуемость, схожесть (близость) данных, обнаружить новые связи и на основании их получить новые знания.&lt;br /&gt;
Извлеченные данные уже автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Необходимо таблицы разного формата, например такие (фактические данные будут отличаться, но принцип оформления буквально тот же):&lt;br /&gt;
----&lt;br /&gt;
:1. Продукция совхоза имени Ленина&lt;br /&gt;
::a. Фрукты&lt;br /&gt;
:::i. Яблоки&lt;br /&gt;
::::ii. Сорт «Грени»&lt;br /&gt;
----&lt;br /&gt;
&lt;br /&gt;
1.Фермерское хозяйство ООО «Солнышко» -&amp;gt; 2. Продукты -&amp;gt; 2.1. Голден-Смит, Яблоки;  2. 2. Сезонные, Яблоки; 2.3. Сезонные, Помидоры; 2.4. Сезонные, Груши; 2.5. Подмосковные, Огурцы.&lt;br /&gt;
----&lt;br /&gt;
 &lt;br /&gt;
привести к единому формату, причем так, чтобы с помощью sql-запроса можно было, например, получить всех «детей» какого-то элемента [в данном случае сорта] определенного вида продукции (тех же яблок или груш). &lt;br /&gt;
 &lt;br /&gt;
В ходе работы над этим проектом придется решить множество задач по извлечению и очистке данных от шума и мусора, а также выработать наиболее оптимальный алгоритм по нахождению близости между одноуровневыми элементами разных списков, возможно даже, между элементами разных уровней.&lt;br /&gt;
 &lt;br /&gt;
Алгоритм нахождения близости должен быть подобран студентами на основании проведенного ими анализа и сравнения (экспериментально) точности существующих средств по приведению формы слова к нормальной (мн. ч. к ед. ч. [data &amp;lt;=&amp;gt; datum], избавление от окончаний родов\падежей и т.п.) в контексте решаемой задачи; по приведению словарной базы к единому знаменателю: векторному\численному представлению, например, с помощью word2vec, sense2vec и подобных. &lt;br /&gt;
&lt;br /&gt;
Для проведения такого анализа в частности потребуется использование либо обученной модели данных, либо модифицированной самими студентами для нужд данной задачи имеющейся модели, либо же создание студентами собственной.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получиться набор sql-запросов и таблиц, позволяющих обращаться напрямую к любым элементам структуры, извлекать их, и применять к ним ко всем без дополнительной подготовки со стороны пользователя аналитические инструменты.&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Работать с базами данных, разрабатывать сложные алгоритмы извлечения, обработки, стандартизации и сравнения данных.&lt;br /&gt;
Применять и дорабатывать для практических нужд теоретические алгоритмы компьютерной лингвистики.&lt;br /&gt;
Работать с инструментами машинного обучения на уровне, позволяющем решать реальные задачи. Модифицировать\обучать собственные модели данных.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами); работе в крупном проекте, где каждый завершенный этап является важным элементом всего проекта и можно наглядно наблюдать практическую значимость проделанной работы.&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с имеющимися в базе знаний данными, ознакомление со структурой этих данных;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* База извлеченных знаний, располагающаяся на облачном сервисе (с которой студентам предстоит работать);&lt;br /&gt;
* Описание разработанной унифицированной структуры базы данных (небольшой технический отчет о том, какие функции используются для обработки первичных данных, для приведения их к стандартизированному виду, для разбиения на элементы структуры; краткое описание формата итоговых таблиц)&lt;br /&gt;
* Описание работы с моделью и инструментами машинного обучения&lt;br /&gt;
* Таблицы, полученные в результате обработки первичных данных&lt;br /&gt;
* Таблицы с обработанными данными и проработанной структурой&lt;br /&gt;
* Выполненные в ходе работы над проектом sql-запросы (с комментариями)&lt;br /&gt;
* Полученные результаты машинного обучения&lt;br /&gt;
* Дополнительные отчеты\листинги\пояснительные записки по проекту (если возникнет такая производственная необходимость)&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
PostgreSQL, REGEXP, алгоритмы нахождения близости (Jaccard Similarity, Sorensen–Dice coefficient), алгоритмы машинного обучения (посредством библиотек SpaCy/NLTK и т.п.)&lt;br /&gt;
&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание SQL на уровне, достаточном для быстрого освоения более специфичных для наших задач возможностей PostgreSQL (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
Желательно знание R (возможно, пригодится для понимания или написания некоторых функций). &lt;br /&gt;
Знание Python (в идеале – опыт работы с машинным обучением)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности работы с нашими хранилищами данных.&lt;br /&gt;
* Особенности работы с имеющимися у нас структурами данных.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Не написаны запросы по обработке и\или структуризации данных. Данные обработаны крайне плохо. Нет возможности «достать» наследующие элементы структуры.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные загружаются в правильном формате. По необъективным причинам в данных присутствует большое количество шума, мусора, и\или некоторая часть данных, доступная для структуризации, не была извлечена, обработана и структурирована. А также работа с данными производилась на локальных устройствах. Проект не имеет отчетности, код запросов представлен без комментариев.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные приведены к единой структуре, есть возможность извлечения элементов-детей и родителей по детям. Небольшая часть данных, доступная для очистки и обработки, не была обработана и структуризирована. В коде запросов присутствуют комментарии, достаточные для их понимания. Предоставлена отчетность по структуре заполнения таблиц и функционалу разработанных алгоритмов, позволяющая получить достаточное представление о том, как создавался и из чего состоит финальный результат проекта.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные запросы работают, извлекая все доступные данные из БД, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Данные очищены от мусора и шума, обработаны и структуризированы в полном объеме. Код запросов полностью закомментирован (опуская комментирование встроенных функций и пр. очевидные вещи). Предоставлен достаточно детализированный отчет о полученной структуре данных, разработанных функциях и алгоритмах.&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7 (495) 772-9590 доб. 12022&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Технические\организационные и пр. вопросы: &#039;&#039;Юлия Исаева&#039;&#039; &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;yisaeva@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Тел.: +7 (495) 772 9590 доб. 22543&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=25307</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=25307"/>
		<updated>2017-10-16T20:03:44Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: /* Контактная информация */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсено как минимум 90% сайтов. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7 (495) 772-9590 доб. 12022&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Технические\организационные и пр. вопросы: &#039;&#039;Юлия Исаева&#039;&#039; &#039;&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;yisaeva@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Тел.: +7 (495) 772 9590 доб. 22543&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=24996</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=24996"/>
		<updated>2017-10-07T18:40:10Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсено как минимум 90% сайтов. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23639</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23639"/>
		<updated>2017-09-01T10:51:54Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:Ifkuzminov.png|мини|справа|Илья Кузьминов]]&lt;br /&gt;
Проекты:&lt;br /&gt;
* [[Репозиторий_автоматизированного_парсинга_(командный_проект)|Репозиторий автоматизированного парсинга (командный проект)]]&lt;br /&gt;
* [[Систематизация_и_реформирование_базы_извлеченных_знаний_(командный_проект)|Систематизация и реформирование базы извлеченных знаний (командный проект)]]&lt;br /&gt;
==  О менторе ==&lt;br /&gt;
Илья Кузьминов, заместитель заведующего отделом научно-технологического прогнозирования Международного научно-&lt;br /&gt;
образовательного Форсайт-центра Института статистических исследований и экономики знаний Национального исследовательского университета «Высшая школа экономики».&lt;br /&gt;
&lt;br /&gt;
Специалист по прогнозированию научно-технологического развития, в том числе по методам анализа больших данных для целей форсайта&lt;br /&gt;
(интеллектуальный анализ текстов, семантический анализ, машинное обучение и др.).&lt;br /&gt;
&lt;br /&gt;
== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
Является координатором исследовательских проектов в области прогнозирования развития науки, технологий и техники по таким направлениям как сельское хозяйство, рациональное природопользование.&lt;br /&gt;
Участвовал в разработке ряда российских отраслевых прогнозов, включая Прогноз научно-технологического развития агропромышленного комплекса на период до 2030 г. (утверждён Премьер-министром РФ), Прогноз научно-технологического развития топливно-энергетического комплекса на период до 2035 г., принимал участие в проектах по подготовке предложений по актуализации приоритетных направлений развития науки, технологий и техники и перечня критических технологий РФ, развитию сети отраслевых центров научно-технологического прогнозирования и др.&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:Ifkuzminov.png&amp;diff=23638</id>
		<title>Файл:Ifkuzminov.png</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:Ifkuzminov.png&amp;diff=23638"/>
		<updated>2017-09-01T10:50:40Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23612</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23612"/>
		<updated>2017-08-31T16:50:03Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Проекты:&lt;br /&gt;
* [[Репозиторий_автоматизированного_парсинга_(командный_проект)|Репозиторий автоматизированного парсинга (командный проект)]]&lt;br /&gt;
* [[Систематизация_и_реформирование_базы_извлеченных_знаний_(командный_проект)|Систематизация и реформирование базы извлеченных знаний (командный проект)]]&lt;br /&gt;
==  О менторе ==&lt;br /&gt;
Илья Кузьминов, заместитель заведующего отделом научно-технологического прогнозирования Международного научно-&lt;br /&gt;
образовательного Форсайт-центра Института статистических исследований и экономики знаний Национального исследовательского университета «Высшая школа экономики».&lt;br /&gt;
&lt;br /&gt;
Специалист по прогнозированию научно-технологического развития, в том числе по методам анализа больших данных для целей форсайта&lt;br /&gt;
(интеллектуальный анализ текстов, семантический анализ, машинное обучение и др.).&lt;br /&gt;
&lt;br /&gt;
== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
Является координатором исследовательских проектов в области прогнозирования развития науки, технологий и техники по таким направлениям как сельское хозяйство, рациональное природопользование.&lt;br /&gt;
Участвовал в разработке ряда российских отраслевых прогнозов, включая Прогноз научно-технологического развития агропромышленного комплекса на период до 2030 г. (утверждён Премьер-министром РФ), Прогноз научно-технологического развития топливно-энергетического комплекса на период до 2035 г., принимал участие в проектах по подготовке предложений по актуализации приоритетных направлений развития науки, технологий и техники и перечня критических технологий РФ, развитию сети отраслевых центров научно-технологического прогнозирования и др.&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23611</id>
		<title>Систематизация и реформирование базы извлеченных знаний (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23611"/>
		<updated>2017-08-31T16:48:22Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: /* Что это за проект? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Систематизация и реформирование базы извлеченных знаний&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=2-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единой структуры базы извлеченных знаний, с помощью которой можно будет проследить наследуемость, схожесть (близость) данных, обнаружить новые связи и на основании их получить новые знания.&lt;br /&gt;
Извлеченные данные уже автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Необходимо таблицы разного формата, например такие (фактические данные будут отличаться, но принцип оформления буквально тот же):&lt;br /&gt;
----&lt;br /&gt;
:1. Продукция совхоза имени Ленина&lt;br /&gt;
::a. Фрукты&lt;br /&gt;
:::i. Яблоки&lt;br /&gt;
::::ii. Сорт «Грени»&lt;br /&gt;
----&lt;br /&gt;
&lt;br /&gt;
1.Фермерское хозяйство ООО «Солнышко» -&amp;gt; 2. Продукты -&amp;gt; 2.1. Голден-Смит, Яблоки;  2. 2. Сезонные, Яблоки; 2.3. Сезонные, Помидоры; 2.4. Сезонные, Груши; 2.5. Подмосковные, Огурцы.&lt;br /&gt;
----&lt;br /&gt;
 &lt;br /&gt;
привести к единому формату, причем так, чтобы с помощью sql-запроса можно было, например, получить всех «детей» какого-то элемента [в данном случае сорта] определенного вида продукции (тех же яблок или груш). &lt;br /&gt;
 &lt;br /&gt;
В ходе работы над этим проектом придется решить множество задач по извлечению и очистке данных от шума и мусора, а также выработать наиболее оптимальный алгоритм по нахождению близости между одноуровневыми элементами разных списков, возможно даже, между элементами разных уровней.&lt;br /&gt;
 &lt;br /&gt;
Алгоритм нахождения близости должен быть подобран студентами на основании проведенного ими анализа и сравнения (экспериментально) точности существующих средств по приведению формы слова к нормальной (мн. ч. к ед. ч. [data &amp;lt;=&amp;gt; datum], избавление от окончаний родов\падежей и т.п.) в контексте решаемой задачи; по приведению словарной базы к единому знаменателю: векторному\численному представлению, например, с помощью word2vec, sense2vec и подобных. &lt;br /&gt;
&lt;br /&gt;
Для проведения такого анализа в частности потребуется использование либо обученной модели данных, либо модифицированной самими студентами для нужд данной задачи имеющейся модели, либо же создание студентами собственной.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получиться набор sql-запросов и таблиц, позволяющих обращаться напрямую к любым элементам структуры, извлекать их, и применять к ним ко всем без дополнительной подготовки со стороны пользователя аналитические инструменты.&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Работать с базами данных, разрабатывать сложные алгоритмы извлечения, обработки, стандартизации и сравнения данных.&lt;br /&gt;
Применять и дорабатывать для практических нужд теоретические алгоритмы компьютерной лингвистики.&lt;br /&gt;
Работать с инструментами машинного обучения на уровне, позволяющем решать реальные задачи. Модифицировать\обучать собственные модели данных.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами); работе в крупном проекте, где каждый завершенный этап является важным элементом всего проекта и можно наглядно наблюдать практическую значимость проделанной работы.&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с имеющимися в базе знаний данными, ознакомление со структурой этих данных;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* База извлеченных знаний, располагающаяся на облачном сервисе (с которой студентам предстоит работать);&lt;br /&gt;
* Описание разработанной унифицированной структуры базы данных (небольшой технический отчет о том, какие функции используются для обработки первичных данных, для приведения их к стандартизированному виду, для разбиения на элементы структуры; краткое описание формата итоговых таблиц)&lt;br /&gt;
* Описание работы с моделью и инструментами машинного обучения&lt;br /&gt;
* Таблицы, полученные в результате обработки первичных данных&lt;br /&gt;
* Таблицы с обработанными данными и проработанной структурой&lt;br /&gt;
* Выполненные в ходе работы над проектом sql-запросы (с комментариями)&lt;br /&gt;
* Полученные результаты машинного обучения&lt;br /&gt;
* Дополнительные отчеты\листинги\пояснительные записки по проекту (если возникнет такая производственная необходимость)&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
PostgreSQL, REGEXP, алгоритмы нахождения близости (Jaccard Similarity, Sorensen–Dice coefficient), алгоритмы машинного обучения (посредством библиотек SpaCy/NLTK и т.п.)&lt;br /&gt;
&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание SQL на уровне, достаточном для быстрого освоения более специфичных для наших задач возможностей PostgreSQL (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
Желательно знание R (возможно, пригодится для понимания или написания некоторых функций). &lt;br /&gt;
Знание Python (в идеале – опыт работы с машинным обучением)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности работы с нашими хранилищами данных.&lt;br /&gt;
* Особенности работы с имеющимися у нас структурами данных.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Не написаны запросы по обработке и\или структуризации данных. Данные обработаны крайне плохо. Нет возможности «достать» наследующие элементы структуры.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные загружаются в правильном формате. По необъективным причинам в данных присутствует большое количество шума, мусора, и\или некоторая часть данных, доступная для структуризации, не была извлечена, обработана и структурирована. А также работа с данными производилась на локальных устройствах. Проект не имеет отчетности, код запросов представлен без комментариев.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные приведены к единой структуре, есть возможность извлечения элементов-детей и родителей по детям. Небольшая часть данных, доступная для очистки и обработки, не была обработана и структуризирована. В коде запросов присутствуют комментарии, достаточные для их понимания. Предоставлена отчетность по структуре заполнения таблиц и функционалу разработанных алгоритмов, позволяющая получить достаточное представление о том, как создавался и из чего состоит финальный результат проекта.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные запросы работают, извлекая все доступные данные из БД, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Данные очищены от мусора и шума, обработаны и структуризированы в полном объеме. Код запросов полностью закомментирован (опуская комментирование встроенных функций и пр. очевидные вещи). Предоставлен достаточно детализированный отчет о полученной структуре данных, разработанных функциях и алгоритмах.&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
 &lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23610</id>
		<title>Систематизация и реформирование базы извлеченных знаний (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A1%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B0%D1%86%D0%B8%D1%8F_%D0%B8_%D1%80%D0%B5%D1%84%D0%BE%D1%80%D0%BC%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%B8%D0%B5_%D0%B1%D0%B0%D0%B7%D1%8B_%D0%B8%D0%B7%D0%B2%D0%BB%D0%B5%D1%87%D0%B5%D0%BD%D0%BD%D1%8B%D1%85_%D0%B7%D0%BD%D0%B0%D0%BD%D0%B8%D0%B9_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23610"/>
		<updated>2017-08-31T16:41:50Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: Новая страница, с помощью формы Новый_командный_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Систематизация и реформирование базы извлеченных знаний&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=2-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единой структуры базы извлеченных знаний, с помощью которой можно будет проследить наследуемость, схожесть (близость) данных, обнаружить новые связи и на основании их получить новые знания.&lt;br /&gt;
Извлеченные данные уже автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Необходимо таблицы разного формата, например такие (фактические данные будут отличаться, но принцип тот же),:&lt;br /&gt;
________&lt;br /&gt;
1.       Продукция совхоза имени Ленина&lt;br /&gt;
a.       Фрукты&lt;br /&gt;
                                                               i.      Яблоки&lt;br /&gt;
                                                             ii.      Сорт «Грени»&lt;br /&gt;
________&lt;br /&gt;
1.Фермерское хозяйство ООО «Солнышко» -&amp;gt; 2. Продукты -&amp;gt; 2.1. Голден-Смит, Яблоки;  2. 2. Сезонные, Яблоки; 2.3. Сезонные, Помидоры; 2.4. Сезонные, Груши; 2.5. Подмосковные, Огурцы.&lt;br /&gt;
________&lt;br /&gt;
 &lt;br /&gt;
привести к единому формату, причем так, чтобы с помощью sql-запроса можно было, например, получить всех «детей» какого-то элемента [в данном случае сорта] определенного вида продукции (тех же яблок или груш). &lt;br /&gt;
 &lt;br /&gt;
В ходе работы над этим проектом придется решить множество задач по извлечению и очистке данных от шума и мусора, а также выработать наиболее оптимальный алгоритм по нахождению близости между одноуровневыми элементами разных списков, возможно даже, между элементами разных уровней.&lt;br /&gt;
 &lt;br /&gt;
Алгоритм нахождения близости должен быть подобран студентами на основании проведенного ими анализа и сравнения (экспериментально) точности существующих средств по приведению формы слова к нормальной (мн. ч. к ед. ч. [data  datum], избавление от окончаний родов\падежей и т.п.) в контексте решаемой задачи; по приведению словарной базы к единому знаменателю: векторному\численному представлению, например, с помощью word2vec, sense2vec и подобных. &lt;br /&gt;
&lt;br /&gt;
Для проведения такого анализа в частности потребуется использование либо обученной модели данных, либо модифицированной самими студентами для нужд данной задачи имеющейся модели, либо же создание студентами собственной.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получиться набор sql-запросов и таблиц, позволяющих обращаться напрямую к любым элементам структуры, извлекать их, и применять к ним ко всем без дополнительной подготовки со стороны пользователя аналитические инструменты.&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Работать с базами данных, разрабатывать сложные алгоритмы извлечения, обработки, стандартизации и сравнения данных.&lt;br /&gt;
Применять и дорабатывать для практических нужд теоретические алгоритмы компьютерной лингвистики.&lt;br /&gt;
Работать с инструментами машинного обучения на уровне, позволяющем решать реальные задачи. Модифицировать\обучать собственные модели данных.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами); работе в крупном проекте, где каждый завершенный этап является важным элементом всего проекта и можно наглядно наблюдать практическую значимость проделанной работы.&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с имеющимися в базе знаний данными, ознакомление со структурой этих данных;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* База извлеченных знаний, располагающаяся на облачном сервисе (с которой студентам предстоит работать);&lt;br /&gt;
* Описание разработанной унифицированной структуры базы данных (небольшой технический отчет о том, какие функции используются для обработки первичных данных, для приведения их к стандартизированному виду, для разбиения на элементы структуры; краткое описание формата итоговых таблиц)&lt;br /&gt;
* Описание работы с моделью и инструментами машинного обучения&lt;br /&gt;
* Таблицы, полученные в результате обработки первичных данных&lt;br /&gt;
* Таблицы с обработанными данными и проработанной структурой&lt;br /&gt;
* Выполненные в ходе работы над проектом sql-запросы (с комментариями)&lt;br /&gt;
* Полученные результаты машинного обучения&lt;br /&gt;
* Дополнительные отчеты\листинги\пояснительные записки по проекту (если возникнет такая производственная необходимость)&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
PostgreSQL, REGEXP, алгоритмы нахождения близости (Jaccard Similarity, Sorensen–Dice coefficient), алгоритмы машинного обучения (посредством библиотек SpaCy/NLTK и т.п.)&lt;br /&gt;
&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание SQL на уровне, достаточном для быстрого освоения более специфичных для наших задач возможностей PostgreSQL (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
Желательно знание R (возможно, пригодится для понимания или написания некоторых функций). &lt;br /&gt;
Знание Python (в идеале – опыт работы с машинным обучением)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности работы с нашими хранилищами данных.&lt;br /&gt;
* Особенности работы с имеющимися у нас структурами данных.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Не написаны запросы по обработке и\или структуризации данных. Данные обработаны крайне плохо. Нет возможности «достать» наследующие элементы структуры.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные загружаются в правильном формате. По необъективным причинам в данных присутствует большое количество шума, мусора, и\или некоторая часть данных, доступная для структуризации, не была извлечена, обработана и структурирована. А также работа с данными производилась на локальных устройствах. Проект не имеет отчетности, код запросов представлен без комментариев.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные запросы работают, обрабатывая все или большую часть доступных данных, данные приведены к единой структуре, есть возможность извлечения элементов-детей и родителей по детям. Небольшая часть данных, доступная для очистки и обработки, не была обработана и структуризирована. В коде запросов присутствуют комментарии, достаточные для их понимания. Предоставлена отчетность по структуре заполнения таблиц и функционалу разработанных алгоритмов, позволяющая получить достаточное представление о том, как создавался и из чего состоит финальный результат проекта.&lt;br /&gt;
 &lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные запросы работают, извлекая все доступные данные из БД, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Данные очищены от мусора и шума, обработаны и структуризированы в полном объеме. Код запросов полностью закомментирован (опуская комментирование встроенных функций и пр. очевидные вещи). Предоставлен достаточно детализированный отчет о полученной структуре данных, разработанных функциях и алгоритмах.&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
 &lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
 &lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23564</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23564"/>
		<updated>2017-08-24T12:47:11Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Проекты:&lt;br /&gt;
* [[Репозиторий_автоматизированного_парсинга_(командный_проект)|Репозиторий автоматизированного парсинга (командный проект)]]&lt;br /&gt;
==  О менторе ==&lt;br /&gt;
Илья Кузьминов, заместитель заведующего отделом научно-технологического прогнозирования Международного научно-&lt;br /&gt;
образовательного Форсайт-центра Института статистических исследований и экономики знаний Национального исследовательского университета «Высшая школа экономики».&lt;br /&gt;
&lt;br /&gt;
Специалист по прогнозированию научно-технологического развития, в том числе по методам анализа больших данных для целей форсайта&lt;br /&gt;
(интеллектуальный анализ текстов, семантический анализ, машинное обучение и др.).&lt;br /&gt;
&lt;br /&gt;
== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
Является координатором исследовательских проектов в области прогнозирования развития науки, технологий и техники по таким направлениям как сельское хозяйство, рациональное природопользование.&lt;br /&gt;
Участвовал в разработке ряда российских отраслевых прогнозов, включая Прогноз научно-технологического развития агропромышленного комплекса на период до 2030 г. (утверждён Премьер-министром РФ), Прогноз научно-технологического развития топливно-энергетического комплекса на период до 2035 г., принимал участие в проектах по подготовке предложений по актуализации приоритетных направлений развития науки, технологий и техники и перечня критических технологий РФ, развитию сети отраслевых центров научно-технологического прогнозирования и др.&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23563</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23563"/>
		<updated>2017-08-23T15:09:34Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены в унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены все сайты. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23560</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23560"/>
		<updated>2017-08-23T13:02:30Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Проекты:&lt;br /&gt;
* [[Репозиторий_автоматизированного_парсинга_(командный_проект)|Репозиторий автоматизированного парсинга (командный проект)]]&lt;br /&gt;
&lt;br /&gt;
== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
== Интересы ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23559</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23559"/>
		<updated>2017-08-23T13:01:08Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: /* Что это за проект? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены все сайты. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23558</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23558"/>
		<updated>2017-08-23T13:00:43Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&#039;&#039;0-3&#039;&#039;: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;4-5&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;6-7&#039;&#039;: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;8-10&#039;&#039;: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены все сайты. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23557</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23557"/>
		<updated>2017-08-23T13:00:13Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: /* Контактная информация */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
0-3: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
4-5: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
6-7: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
8-10: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены все сайты. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
&lt;br /&gt;
Ментор: [[Участник:Ilya Kuzminov|Кузьминов Илья Филиппович]]&lt;br /&gt;
&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23556</id>
		<title>Репозиторий автоматизированного парсинга (командный проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%BF%D0%BE%D0%B7%D0%B8%D1%82%D0%BE%D1%80%D0%B8%D0%B9_%D0%B0%D0%B2%D1%82%D0%BE%D0%BC%D0%B0%D1%82%D0%B8%D0%B7%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D0%BE%D0%B3%D0%BE_%D0%BF%D0%B0%D1%80%D1%81%D0%B8%D0%BD%D0%B3%D0%B0_(%D0%BA%D0%BE%D0%BC%D0%B0%D0%BD%D0%B4%D0%BD%D1%8B%D0%B9_%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=23556"/>
		<updated>2017-08-23T12:59:02Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: Новая страница, с помощью формы Новый_командный_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_командного_проекта&lt;br /&gt;
|name=Репозиторий автоматизированного парсинга&lt;br /&gt;
|company=ИСИЭЗ НИУ ВШЭ&lt;br /&gt;
|semester=Осень 2017&lt;br /&gt;
|course=3&lt;br /&gt;
|number_of_students=3-5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Это проект по созданию единого репозитория для автоматизированного парсинга сайтов одной тематики, с целью дальнейшего использования извлеченной информации в аналитике и прогнозах.&lt;br /&gt;
С сайтов должны быть извлечены все максимально полезные метаданные о публикациях, статьях, грантах и т.п., например, время создания, авторство, категория, теги и т.п. параметры. Извлеченные данные должны будут автоматически загружены унифицированном для всех их источников формате в облачное хранилище в виде таблиц баз данных (мы используем PostgreSQL).&lt;br /&gt;
Задача по извлечению изначально может показаться достаточно простой, но на практике это далеко не так. В случаях с некоторыми сайтами можно будет применить инструменты разработанного у нас фреймворка на базе Scrapy для извлечения данных. Однако, скорее всего, придется работать также с такими инструментами как Selenium.&lt;br /&gt;
&lt;br /&gt;
В итоге у команды, работающей над этим проектом, должен будет получится набор скриптов-парсеров, осуществляющих задачи, собственно, парсинга, а также загрузки данных в БД, запускаемых в рамках единого проекта (т.е. так, чтобы обработка группы сайтов могла быть запущена единой командой управления, без ручного вмешательства разработчиков).&lt;br /&gt;
&lt;br /&gt;
=== Чему научатся студенты? Что самое интересное в проекте? ===&lt;br /&gt;
Анализировать и приводить к стандартному виду большие объемы совершенно разрозненных данных.&lt;br /&gt;
Разрабатывать и дорабатывать платформенные механизмы (фреймворки) автоматизированного сбора данных с веб-сайтов.&lt;br /&gt;
Работать с базами данных, разрабатывать алгоритмы автоматизированного их пополнения, изменения и пр.&lt;br /&gt;
Работать с облачными сервисами БД (например, AWS).&lt;br /&gt;
Командной работе (не только с программистами, но и с аналитиками и пр. специалистами).&lt;br /&gt;
Гибкости ума и прочим навыкам парсинга (т. к. для извлечения некоторых данных приходится использовать весьма нетривиальные пути).&lt;br /&gt;
&lt;br /&gt;
=== Организация работы (Как студенты будут работать в команде?) ===&lt;br /&gt;
Работа над проектом будет состоять из следующих этапов:&lt;br /&gt;
* Самостоятельное ознакомление с базовыми возможностями основных инструментами и библиотек, используемых для разработки проекта;&lt;br /&gt;
* Ознакомление с разработанным у нас фреймворком; обсуждение возможности использования определенных инструментов на каждой группе сайтов в отдельности;&lt;br /&gt;
* Распределение обязанностей и начало разработки над проектом (тестовое)&lt;br /&gt;
* Консультирование по первому (пробному) этапу работы над проектом, обсуждение проблем (технических, командных и пр.), установка плана работ над проектом (milestones и пр.)&lt;br /&gt;
* Периодическая проверка на соответствие текущего состояния проработанности проекта обозначенному плану.&lt;br /&gt;
* Финальная проверка реализации проекта.&lt;br /&gt;
&lt;br /&gt;
=== Компоненеты (Из каких частей состоит проект?) ===&lt;br /&gt;
* Разработанный в ИСИЭЗ фреймворк для извлечения данных (база для создания репозитория);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании фреймворка (в случае возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Разработанные самими студентами скрипты-парсеры на основании других библиотек парсинга (в случае &#039;&#039;&#039;не&#039;&#039;&#039; возможности применения фреймворка для назначенных сайтов);&lt;br /&gt;
* Дополнения к фреймворку для обработки неформатных данных, упрощения процесса загрузки в БД и пр., написанные самими студентами, в случае необходимости создания таковых.&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
Python 3, Scrapy, Selenium, PostgreSQL, lxml, Pandas, собственный фреймворк организации на Python + Scrapy для парсинга сайтов&lt;br /&gt;
Amazon Web Services&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
Знание Python на уровне, достаточном для быстрого освоения новых библиотек (для парсинга и пр.).&lt;br /&gt;
Желательно знание Selenium, lxml, Scrapy или прочих библиотек.&lt;br /&gt;
Наличие как минимум минимальных компетенций в работе с базами данных (в идеале — опыт работы с PostgreSQL)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
* Особенности парсинга на Python (в случае, если будут студенты, которые никогда не занимались решением подобного рода задач).&lt;br /&gt;
* Особенности парсинга с помощью библиотеки Scrapy.&lt;br /&gt;
* Особенности нашего фреймворка.&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
0-3: Написанные парсеры не работают или не извлекают большую часть доступных для извлечения данных, или данных извлекаются плохо и не в нужном формате, или распарсено по необъективным причинам менее 50% обозначенных сайтов, а также не организован доступ данных на общее хранилище (сбор данных производился на локальные устройства). Нет возможности проверить код, полностью отсутствуют комментарии и пояснения по проекту.&lt;br /&gt;
4-5: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате. По необъективным причинам распарсены не все сайты (до 65%) и некоторая часть данных, доступная для извлечения, не была извлечена или была извлечена неправильно. А также сбор данных производился на локальные устройства или проект написан на плохо читабельном коде, без комментариев.&lt;br /&gt;
6-7: Написанные парсеры работают, извлекая все или большую часть доступных данных с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены не все сайты или некоторая часть данных, доступная для извлечения, не была извлечена. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. В коде присутствуют комментарии, достаточные для его понимания.&lt;br /&gt;
8-10: Написанные парсеры работают, извлекая все доступные данные с сайтов, данные загружаются в правильном формате на единое общедоступное облачное хранилище. Распарсены все сайты. В части кода проекта, опирающейся на одни и те же инструменты, присутствует консистентность. Код проекта полностью закомментирован (опуская комментирование встроенных функций, подключение библиотек и пр. очевидные вещи).&lt;br /&gt;
&lt;br /&gt;
=== Похожие проекты ===&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Контактная информация ===&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23554</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23554"/>
		<updated>2017-08-22T09:14:54Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Проекты:&lt;br /&gt;
* &lt;br /&gt;
&lt;br /&gt;
== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
== Интересы ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23553</id>
		<title>Участник:Ilya Kuzminov</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Ilya_Kuzminov&amp;diff=23553"/>
		<updated>2017-08-22T09:14:10Z</updated>

		<summary type="html">&lt;p&gt;Ilya Kuzminov: Новая страница: «== Образование ==  * &amp;#039;&amp;#039;&amp;#039;Аспирантура&amp;#039;&amp;#039;&amp;#039; Институт географии РАН, специальность 25.00.24 «Экономиче…»&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== Образование ==&lt;br /&gt;
&lt;br /&gt;
* &#039;&#039;&#039;Аспирантура&#039;&#039;&#039;&lt;br /&gt;
Институт географии РАН, специальность 25.00.24 «Экономическая, социальная, политическая и рекреационная география». Кандидат наук.&lt;br /&gt;
* &#039;&#039;&#039;Специалитет&#039;&#039;&#039;&lt;br /&gt;
Московский государственный университет им. М.В. Ломоносова, Москва. Кафедра экономической географии, Экономическая география / Региональная экономика.&lt;br /&gt;
&lt;br /&gt;
== Интересы ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Деятельность ==&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
== Контакты ==&lt;br /&gt;
Email: &#039;&#039;ikuzminov@hse.ru&#039;&#039;&lt;br /&gt;
&lt;br /&gt;
Рабочий телефон: +7(495) 772-9590 доб. 12022&lt;/div&gt;</summary>
		<author><name>Ilya Kuzminov</name></author>
	</entry>
</feed>