<?xml version="1.0"?>
<feed xmlns="http://www.w3.org/2005/Atom" xml:lang="ru">
	<id>https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Dmitry</id>
	<title>Wiki - Факультет компьютерных наук - Вклад [ru]</title>
	<link rel="self" type="application/atom+xml" href="https://wiki.cs.hse.ru/api.php?action=feedcontributions&amp;feedformat=atom&amp;user=Dmitry"/>
	<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/%D0%A1%D0%BB%D1%83%D0%B6%D0%B5%D0%B1%D0%BD%D0%B0%D1%8F:%D0%92%D0%BA%D0%BB%D0%B0%D0%B4/Dmitry"/>
	<updated>2026-09-21T14:27:49Z</updated>
	<subtitle>Вклад</subtitle>
	<generator>MediaWiki 1.43.9</generator>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26140</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26140"/>
		<updated>2017-12-05T16:13:41Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи проектных заданий ===&lt;br /&gt;
 &lt;br /&gt;
&lt;br /&gt;
# Проект 1, часть 1 до 23:59 10.10.2017 [https://www.dropbox.com/s/czzb0meu45l5tvj/NLP_project1.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 1, часть 2 до 23:59 26.11.2017 [https://www.dropbox.com/s/h8oqt082v6ac68f/NLP_project2.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 2, до 23:59 20.12.2017 [https://drive.google.com/open?id=1jLPAIUt5Eb_9ORFnD-XFAVHCyLj00jZQ (ссылка)]&lt;br /&gt;
&lt;br /&gt;
=== Как писать отчёт ===&lt;br /&gt;
&lt;br /&gt;
1) Содержание отчёта. Вне зависимости от того, пишете ли вы отчёт в latex, или в jupyter notebook или ещё где-то, нормальный отчёт должен включать в себя:&lt;br /&gt;
&lt;br /&gt;
— Краткую постановку задачи и формулировку задания&lt;br /&gt;
&lt;br /&gt;
— Описание минимума необходимой теории и/или описание используемых инструментов&lt;br /&gt;
&lt;br /&gt;
— Подробное пошаговый рассказ о проделанной работе&lt;br /&gt;
&lt;br /&gt;
— Аккуратно оформленные результаты&lt;br /&gt;
&lt;br /&gt;
— Внятные выводы&lt;br /&gt;
&lt;br /&gt;
Все эти пункты долны быть чётко отмечены заголовками, если они слишком велики, то можно использовать подзаголовки. Словом, читатель не должен тратить время на навигацию.&lt;br /&gt;
&lt;br /&gt;
2) Стилистика. Отчёт —- это несколько формальный текст. Он не пишется от первого лица. В нём не надо рассказывать про свою криворукость, про то, как красиво поют птички за окном и т.п. Не надо обращаться к читателю (особенно на &amp;quot;ты&amp;quot;, среди вас уже есть такие &amp;quot;отличившиеся&amp;quot;), ни в тексте, ни в комментах к коду (если это ноутбук). Комментарии к коду, кстати, лучше писать на английском.&lt;br /&gt;
&lt;br /&gt;
Текст не должен содержать миллиарда опечаток и должен удовлетворять хоть каким-то минимальным стилистическим требованиям. Русский язык богат синонимами, и этим нужно пользоваться. Вот такие вещи писать НЕ надо:&lt;br /&gt;
&lt;br /&gt;
&amp;quot;Самое важное улучшение было в улучшении Prior Model (путь улучшения тоже взят из Word Alignment Models&amp;quot;).&amp;quot;&lt;br /&gt;
&lt;br /&gt;
Слова в предложениях должны быть согласованными.&lt;br /&gt;
&lt;br /&gt;
3) Если в отчёте (презентации) фигурируют картинки из сети, они должны быть в тему. И к ним надо обязательно ставить маленькую подпись с указанием источника, или же прописать его явно в тексте.&lt;br /&gt;
&lt;br /&gt;
Подсказка (просто на всякий случай): задание делается гораздо качественнее и аккуратнее, если его не откладывать на последний вечер;)&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * О&amp;lt;sub&amp;gt;дз+cем&lt;br /&gt;
&lt;br /&gt;
[https://docs.google.com/spreadsheets/d/1T_1LqhQ4fWJGh3s-lA0MsNoMTYIXIH9iUY3bu-Vpcrg/edit?usp=sharing, (ведомость)]&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 3 (18-24 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)], слайды семинара 19.09  [http://dmitryfrolov.com/pdf/sem3_new.pdf (ссылка)]. Задание для БПМИ142 МОП [http://wiki.cs.hse.ru/images/7/7c/Task.png (ссылка)]. (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).   [https://www.dropbox.com/s/hvojoqp7zb3p4sk/sem3__Copy_.pdf?dl=0 (слайды с семинара вместе с заданием)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 4 (25 сентября – 1 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашённый лектор Иван Смуров):&#039;&#039;&#039; Синтаксический анализ (syntactic parsing) - одна из классических задач NLP, заключающейся в построении по последовательности текста соответствующего ей синтаксического разбора. Задача имеет продолжительную и богатую историю и решалась с помощью различных методов - от вероятностных контекстно-свободных грамматик до нейросетей с использованием sequence-to-sequence архитектур. На лекции будет рассказано о популярном в литературе подходе  - использованию transition-based парсеров. Этод подход, восходящий к shift-reduce анализаторам классических логик, был впервые использован в применении к задаче синтаксического анализа Й. Нивре в 2003 году. В 2014 году метод был адаптирован для использования нейросетей Д. Ченом и К. Маннингом из Стенфордского университета и, наконец, в 2016 он послужил основой для популярного парсера SynaxNet, разработанного в  Google. [https://www.dropbox.com/s/yceqgugsc6tdcxs/transition-based_%D0%BF%D0%B0%D1%80%D1%81%D0%B5%D1%80%D1%8B.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
О лекторе:&lt;br /&gt;
Иван Смуров – сотрудник кафедр Алгоритмов и Технологий Программирования и Компьютерной Лингвистики МФТИ, разрабатчик научно-исследовательского отдела компании ABBYY. Является специалистом  по машинному обучению, компьютерной и вычислительной лингвистике, математической логике. Область основных интересов – обработка текстов на естественных языках.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; SyntaxNet, cинтаксические парсеры, универсальные зависимости [https://yadi.sk/d/OddFv-y33NBshk (слайды)]&lt;br /&gt;
&lt;br /&gt;
[http://dmitryfrolov.com/pdf/task4.jpg (дз для 3 курса)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 5 (2 октября – 8 октября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк):&#039;&#039;&#039; Статистический анализ текстов. Законы Ципфа и Хипса. Методы извлечения ключевых слов и словосочетаний.  Векторная модель. [https://www.dropbox.com/s/fzqcvqb7qu4d27j/4_StatAnalysis.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; Ключевые слова, n-граммы, коллокации [https://www.dropbox.com/s/98grun1bl2pqy2p/sem5.pdf?dl=0 (слайды и дз)], [https://yadi.sk/i/BND6d9P73NZLCE (слайды для группы 142)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 6 (9 октября – 15 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Анна Потапенко):&#039;&#039;&#039; Дистрибутивная семантика. В курсе вы уже поговорили о морфологии и синтаксисе, в этой лекции мы поднимемся на следующий уровень анализа языка и поговорим о семантике - о том, как из текстов извлекать смысл отдельных слов и целых предложений. Смысл будем кодировать векторами - обычными векторами вещественных чисел.  Мы начнем с классических моделей - подсчета PMI слов и применения SVD для понижения размерности матриц. Затем поговорим о том, как в эту картину укладывается нашумевший word2vec. Разберемся, почему это не deep learning, и почему король - мужчина + женщина != королева. Затем поговорим о других популярных и более новых подходах обучения векторных представлений слов: GloVe, FastText, StarSpace. Во второй части лекции перейдем к предложениям и поговорим о 3 типах нейронных сетей, позволяющих строить их векторные представления: это конволюционные, рекуррентные и рекурсивные нейронные сети. Здесь мы увидим, что модели синтаксиса и другие лингвистические знания хорошо помогают собрать из отдельных слов смысл всего предложения. [https://www.dropbox.com/s/f3hklz6yko4ohqs/Potapenko_lecture_distr.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Анна занимается построением векторных представлений текста в аспирантуре у К.В. Воронцова. За время аспирантуры Анна дважды стажировалась в компании Google, где оба раза занималась исследованиями в области NLP - дистрибутивной семантикой и диалоговыми системами. Анна закончила ВМК МГУ и Школу Анализа Данных Яндекса, теперь она ведет там семинары, а также готовит онлайн-курс по NLP на платформе Coursera.&lt;br /&gt;
&lt;br /&gt;
==== Неделя 7 (16 октября – 22 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (М. Апишев):&#039;&#039;&#039; Тематическое моделирование. Определения. PLSA, LDA, аддитивная регуляризация [https://www.dropbox.com/s/4mjxzjk6njvzzrl/MelLain_HSE_nlp_TM_lection%20%283%29.pdf?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия [https://www.dropbox.com/s/tcj33fdgvetdvg3/classification.slides.html?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; [https://yadi.sk/i/zct5pith3PYAmz Тематическое моделирование]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 8 (30 октября – 5 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия, сверточные нейронные сети, Fast Text. [https://www.dropbox.com/s/kdcs4mvpb7o9cte/classification.slides%202.html?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039;  Классификация и анализ тональности. [https://www.dropbox.com/s/sid2nto8gmjys2y/sem8.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 9 (6 ноября – 12 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Алексей Шаграев):&#039;&#039;&#039; Информационный поиск. &lt;br /&gt;
&lt;br /&gt;
В лекции будут обсуждаться различные прикладные задачи машинного обучения в информационном поиске, возникающие при разработке поисковых систем. Среди них:&lt;br /&gt;
- кластеризация новостных сообщений&lt;br /&gt;
- построение метрик качества для поисковых систем и оптимизация под них&lt;br /&gt;
- классическое ранжирование и обучение ранжированию по пользовательским данным&lt;br /&gt;
- разнообразие и свежесть в поисковой выдаче&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/0btntom44qve5q5/ML%20-%20%D0%B4%D0%BB%D1%8F%20%D0%BA%D1%80%D1%83%D1%82%D1%8B%D1%85%20%D1%81%D1%82%D1%83%D0%B4%D0%B5%D0%BD%D1%82%D0%BE%D0%B2.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Алексей Шаграев, к.т.н., руководитель службы разработки свеже-социального поиска Яндекса&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Информационный поиск [https://www.dropbox.com/s/h2u3f26jjpbgd9u/sem9___final.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 10 (13 ноября – 19 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Языковые модели. Счетные модели и нейронные модели. Реккурентные нейронные сети. LSTM.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Автоматическая генерация текстов [https://www.dropbox.com/s/7p7l0azbj948cnk/sem10.pdf?dl=0 (слайды)] [https://yadi.sk/i/jTNrjF283PzYz8 (слайды группы 142)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 11 (20 ноября – 25 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Извлечение информации: именованные сущности, отношения, факты и события. Использование методов классификации и методов классификации последовательностей. MEMM, CRF, BiLSTM-CRF.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; [http://dmitryfrolov.com/pdf/sem11.pdf (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 12 (27 ноября – 1 декабря)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039; Генерация текстов. Обучение с подкреплением (reinforcment learning) в задачах генерации текстов (обзор). [https://www.dropbox.com/s/god4t70rwe1zlwm/1_NLG.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Вопросно-ответные системы [http://dmitryfrolov.com/pdf/sem12.pdf (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 13 (4 декабря– 12 декабря)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Сергей Губанов):&#039;&#039;&#039; Исправление опечаток&lt;br /&gt;
&lt;br /&gt;
Начиная с самых основ и заканчивая машинным обучением, будет рассказано о том, как устроен современный спеллчекер, способный обрабатывать поток поисковых запросов Яндекса.&lt;br /&gt;
&lt;br /&gt;
О лекторе: Сергей Губанов, руководитель группы ядра машинного перевода, работаю над исправлением опечаток и над нейросетевым машинным переводом.&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
* Курс в Стенфорде по DL для AOT [http://cs224d.stanford.edu (link)]&lt;br /&gt;
* Материалы по обучению с подкреплением (Reinforcment Learning) [https://github.com/jiyfeng/rl4nlp (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
* Text Visualisation browser: [http://textvis.lnu.se (link)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
* [http://eprints.lse.ac.uk/62548/1/Schonhardt-Bailey_text%20mining%20handbook.pdf/] Text mining for central banks&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;br /&gt;
# readability  [https://github.com/buriy/python-readability (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26139</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26139"/>
		<updated>2017-12-05T16:10:26Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи проектных заданий ===&lt;br /&gt;
 &lt;br /&gt;
&lt;br /&gt;
# Проект 1, часть 1 до 23:59 10.10.2017 [https://www.dropbox.com/s/czzb0meu45l5tvj/NLP_project1.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 1, часть 2 до 23:59 26.11.2017 [https://www.dropbox.com/s/h8oqt082v6ac68f/NLP_project2.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 2, до 23:59 20.12.2017 [https://drive.google.com/open?id=1jLPAIUt5Eb_9ORFnD-XFAVHCyLj00jZQ (ссылка)]&lt;br /&gt;
&lt;br /&gt;
=== Как писать отчёт ===&lt;br /&gt;
&lt;br /&gt;
1) Содержание отчёта. Вне зависимости от того, пишете ли вы отчёт в latex, или в jupyter notebook или ещё где-то, нормальный отчёт должен включать в себя:&lt;br /&gt;
&lt;br /&gt;
— Краткую постановку задачи и формулировку задания&lt;br /&gt;
&lt;br /&gt;
— Описание минимума необходимой теории и/или описание используемых инструментов&lt;br /&gt;
&lt;br /&gt;
— Подробное пошаговый рассказ о проделанной работе&lt;br /&gt;
&lt;br /&gt;
— Аккуратно оформленные результаты&lt;br /&gt;
&lt;br /&gt;
— Внятные выводы&lt;br /&gt;
&lt;br /&gt;
Все эти пункты долны быть чётко отмечены заголовками, если они слишком велики, то можно использовать подзаголовки. Словом, читатель не должен тратить время на навигацию.&lt;br /&gt;
&lt;br /&gt;
2) Стилистика. Отчёт —- это несколько формальный текст. Он не пишется от первого лица. В нём не надо рассказывать про свою криворукость, про то, как красиво поют птички за окном и т.п. Не надо обращаться к читателю (особенно на &amp;quot;ты&amp;quot;, среди вас уже есть такие &amp;quot;отличившиеся&amp;quot;), ни в тексте, ни в комментах к коду (если это ноутбук). Комментарии к коду, кстати, лучше писать на английском.&lt;br /&gt;
&lt;br /&gt;
Текст не должен содержать миллиарда опечаток и должен удовлетворять хоть каким-то минимальным стилистическим требованиям. Русский язык богат синонимами, и этим нужно пользоваться. Вот такие вещи писать НЕ надо:&lt;br /&gt;
&lt;br /&gt;
&amp;quot;Самое важное улучшение было в улучшении Prior Model (путь улучшения тоже взят из Word Alignment Models&amp;quot;).&amp;quot;&lt;br /&gt;
&lt;br /&gt;
Слова в предложениях должны быть согласованными.&lt;br /&gt;
&lt;br /&gt;
3) Если в отчёте (презентации) фигурируют картинки из сети, они должны быть в тему. И к ним надо обязательно ставить маленькую подпись с указанием источника, или же прописать его явно в тексте.&lt;br /&gt;
&lt;br /&gt;
Подсказка (просто на всякий случай): задание делается гораздо качественнее и аккуратнее, если его не откладывать на последний вечер;)&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * О&amp;lt;sub&amp;gt;дз+cем&lt;br /&gt;
&lt;br /&gt;
[https://docs.google.com/spreadsheets/d/1T_1LqhQ4fWJGh3s-lA0MsNoMTYIXIH9iUY3bu-Vpcrg/edit?usp=sharing, (ведомость)]&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 3 (18-24 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)], слайды семинара 19.09  [http://dmitryfrolov.com/pdf/sem3_new.pdf (ссылка)]. Задание для БПМИ142 МОП [http://wiki.cs.hse.ru/images/7/7c/Task.png (ссылка)]. (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).   [https://www.dropbox.com/s/hvojoqp7zb3p4sk/sem3__Copy_.pdf?dl=0 (слайды с семинара вместе с заданием)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 4 (25 сентября – 1 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашённый лектор Иван Смуров):&#039;&#039;&#039; Синтаксический анализ (syntactic parsing) - одна из классических задач NLP, заключающейся в построении по последовательности текста соответствующего ей синтаксического разбора. Задача имеет продолжительную и богатую историю и решалась с помощью различных методов - от вероятностных контекстно-свободных грамматик до нейросетей с использованием sequence-to-sequence архитектур. На лекции будет рассказано о популярном в литературе подходе  - использованию transition-based парсеров. Этод подход, восходящий к shift-reduce анализаторам классических логик, был впервые использован в применении к задаче синтаксического анализа Й. Нивре в 2003 году. В 2014 году метод был адаптирован для использования нейросетей Д. Ченом и К. Маннингом из Стенфордского университета и, наконец, в 2016 он послужил основой для популярного парсера SynaxNet, разработанного в  Google. [https://www.dropbox.com/s/yceqgugsc6tdcxs/transition-based_%D0%BF%D0%B0%D1%80%D1%81%D0%B5%D1%80%D1%8B.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
О лекторе:&lt;br /&gt;
Иван Смуров – сотрудник кафедр Алгоритмов и Технологий Программирования и Компьютерной Лингвистики МФТИ, разрабатчик научно-исследовательского отдела компании ABBYY. Является специалистом  по машинному обучению, компьютерной и вычислительной лингвистике, математической логике. Область основных интересов – обработка текстов на естественных языках.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; SyntaxNet, cинтаксические парсеры, универсальные зависимости [https://yadi.sk/d/OddFv-y33NBshk (слайды)]&lt;br /&gt;
&lt;br /&gt;
[http://dmitryfrolov.com/pdf/task4.jpg (дз для 3 курса)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 5 (2 октября – 8 октября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк):&#039;&#039;&#039; Статистический анализ текстов. Законы Ципфа и Хипса. Методы извлечения ключевых слов и словосочетаний.  Векторная модель. [https://www.dropbox.com/s/fzqcvqb7qu4d27j/4_StatAnalysis.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; Ключевые слова, n-граммы, коллокации [https://www.dropbox.com/s/98grun1bl2pqy2p/sem5.pdf?dl=0 (слайды и дз)], [https://yadi.sk/i/BND6d9P73NZLCE (слайды для группы 142)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 6 (9 октября – 15 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Анна Потапенко):&#039;&#039;&#039; Дистрибутивная семантика. В курсе вы уже поговорили о морфологии и синтаксисе, в этой лекции мы поднимемся на следующий уровень анализа языка и поговорим о семантике - о том, как из текстов извлекать смысл отдельных слов и целых предложений. Смысл будем кодировать векторами - обычными векторами вещественных чисел.  Мы начнем с классических моделей - подсчета PMI слов и применения SVD для понижения размерности матриц. Затем поговорим о том, как в эту картину укладывается нашумевший word2vec. Разберемся, почему это не deep learning, и почему король - мужчина + женщина != королева. Затем поговорим о других популярных и более новых подходах обучения векторных представлений слов: GloVe, FastText, StarSpace. Во второй части лекции перейдем к предложениям и поговорим о 3 типах нейронных сетей, позволяющих строить их векторные представления: это конволюционные, рекуррентные и рекурсивные нейронные сети. Здесь мы увидим, что модели синтаксиса и другие лингвистические знания хорошо помогают собрать из отдельных слов смысл всего предложения. [https://www.dropbox.com/s/f3hklz6yko4ohqs/Potapenko_lecture_distr.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Анна занимается построением векторных представлений текста в аспирантуре у К.В. Воронцова. За время аспирантуры Анна дважды стажировалась в компании Google, где оба раза занималась исследованиями в области NLP - дистрибутивной семантикой и диалоговыми системами. Анна закончила ВМК МГУ и Школу Анализа Данных Яндекса, теперь она ведет там семинары, а также готовит онлайн-курс по NLP на платформе Coursera.&lt;br /&gt;
&lt;br /&gt;
==== Неделя 7 (16 октября – 22 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (М. Апишев):&#039;&#039;&#039; Тематическое моделирование. Определения. PLSA, LDA, аддитивная регуляризация [https://www.dropbox.com/s/4mjxzjk6njvzzrl/MelLain_HSE_nlp_TM_lection%20%283%29.pdf?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия [https://www.dropbox.com/s/tcj33fdgvetdvg3/classification.slides.html?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; [https://yadi.sk/i/zct5pith3PYAmz Тематическое моделирование]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 8 (30 октября – 5 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия, сверточные нейронные сети, Fast Text. [https://www.dropbox.com/s/kdcs4mvpb7o9cte/classification.slides%202.html?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039;  Классификация и анализ тональности. [https://www.dropbox.com/s/sid2nto8gmjys2y/sem8.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 9 (6 ноября – 12 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Алексей Шаграев):&#039;&#039;&#039; Информационный поиск. &lt;br /&gt;
&lt;br /&gt;
В лекции будут обсуждаться различные прикладные задачи машинного обучения в информационном поиске, возникающие при разработке поисковых систем. Среди них:&lt;br /&gt;
- кластеризация новостных сообщений&lt;br /&gt;
- построение метрик качества для поисковых систем и оптимизация под них&lt;br /&gt;
- классическое ранжирование и обучение ранжированию по пользовательским данным&lt;br /&gt;
- разнообразие и свежесть в поисковой выдаче&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/0btntom44qve5q5/ML%20-%20%D0%B4%D0%BB%D1%8F%20%D0%BA%D1%80%D1%83%D1%82%D1%8B%D1%85%20%D1%81%D1%82%D1%83%D0%B4%D0%B5%D0%BD%D1%82%D0%BE%D0%B2.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Алексей Шаграев, к.т.н., руководитель службы разработки свеже-социального поиска Яндекса&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Информационный поиск [https://www.dropbox.com/s/h2u3f26jjpbgd9u/sem9___final.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 10 (13 ноября – 19 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Языковые модели. Счетные модели и нейронные модели. Реккурентные нейронные сети. LSTM.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Автоматическая генерация текстов [https://www.dropbox.com/s/7p7l0azbj948cnk/sem10.pdf?dl=0 (слайды)] [https://yadi.sk/i/jTNrjF283PzYz8 (слайды группы 142)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 11 (20 ноября – 25 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Извлечение информации: именованные сущности, отношения, факты и события. Использование методов классификации и методов классификации последовательностей. MEMM, CRF, BiLSTM-CRF.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; [https://www.dropbox.com/s/h2u3f26jjpbgd9u/sem9___final.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 12 (27 ноября – 1 декабря)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039; Генерация текстов. Обучение с подкреплением (reinforcment learning) в задачах генерации текстов (обзор). [https://www.dropbox.com/s/god4t70rwe1zlwm/1_NLG.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Вопросно-ответные системы [http://dmitryfrolov.com/pdf/sem11.pdf (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 13 (4 декабря– 12 декабря)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Сергей Губанов):&#039;&#039;&#039; Исправление опечаток&lt;br /&gt;
&lt;br /&gt;
Начиная с самых основ и заканчивая машинным обучением, будет рассказано о том, как устроен современный спеллчекер, способный обрабатывать поток поисковых запросов Яндекса.&lt;br /&gt;
&lt;br /&gt;
О лекторе: Сергей Губанов, руководитель группы ядра машинного перевода, работаю над исправлением опечаток и над нейросетевым машинным переводом.&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
* Курс в Стенфорде по DL для AOT [http://cs224d.stanford.edu (link)]&lt;br /&gt;
* Материалы по обучению с подкреплением (Reinforcment Learning) [https://github.com/jiyfeng/rl4nlp (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
* Text Visualisation browser: [http://textvis.lnu.se (link)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
* [http://eprints.lse.ac.uk/62548/1/Schonhardt-Bailey_text%20mining%20handbook.pdf/] Text mining for central banks&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;br /&gt;
# readability  [https://github.com/buriy/python-readability (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26090</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=26090"/>
		<updated>2017-11-30T16:18:24Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Дата выдачи/сдачи проектных заданий */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи проектных заданий ===&lt;br /&gt;
 &lt;br /&gt;
&lt;br /&gt;
# Проект 1, часть 1 до 23:59 10.10.2017 [https://www.dropbox.com/s/czzb0meu45l5tvj/NLP_project1.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 1, часть 2 до 23:59 26.11.2017 [https://www.dropbox.com/s/h8oqt082v6ac68f/NLP_project2.pdf?dl=0 (ссылка)]&lt;br /&gt;
# Проект 2, до 23:59 20.12.2017 [https://drive.google.com/open?id=1jLPAIUt5Eb_9ORFnD-XFAVHCyLj00jZQ (ссылка)]&lt;br /&gt;
&lt;br /&gt;
=== Как писать отчёт ===&lt;br /&gt;
&lt;br /&gt;
1) Содержание отчёта. Вне зависимости от того, пишете ли вы отчёт в latex, или в jupyter notebook или ещё где-то, нормальный отчёт должен включать в себя:&lt;br /&gt;
&lt;br /&gt;
— Краткую постановку задачи и формулировку задания&lt;br /&gt;
&lt;br /&gt;
— Описание минимума необходимой теории и/или описание используемых инструментов&lt;br /&gt;
&lt;br /&gt;
— Подробное пошаговый рассказ о проделанной работе&lt;br /&gt;
&lt;br /&gt;
— Аккуратно оформленные результаты&lt;br /&gt;
&lt;br /&gt;
— Внятные выводы&lt;br /&gt;
&lt;br /&gt;
Все эти пункты долны быть чётко отмечены заголовками, если они слишком велики, то можно использовать подзаголовки. Словом, читатель не должен тратить время на навигацию.&lt;br /&gt;
&lt;br /&gt;
2) Стилистика. Отчёт —- это несколько формальный текст. Он не пишется от первого лица. В нём не надо рассказывать про свою криворукость, про то, как красиво поют птички за окном и т.п. Не надо обращаться к читателю (особенно на &amp;quot;ты&amp;quot;, среди вас уже есть такие &amp;quot;отличившиеся&amp;quot;), ни в тексте, ни в комментах к коду (если это ноутбук). Комментарии к коду, кстати, лучше писать на английском.&lt;br /&gt;
&lt;br /&gt;
Текст не должен содержать миллиарда опечаток и должен удовлетворять хоть каким-то минимальным стилистическим требованиям. Русский язык богат синонимами, и этим нужно пользоваться. Вот такие вещи писать НЕ надо:&lt;br /&gt;
&lt;br /&gt;
&amp;quot;Самое важное улучшение было в улучшении Prior Model (путь улучшения тоже взят из Word Alignment Models&amp;quot;).&amp;quot;&lt;br /&gt;
&lt;br /&gt;
Слова в предложениях должны быть согласованными.&lt;br /&gt;
&lt;br /&gt;
3) Если в отчёте (презентации) фигурируют картинки из сети, они должны быть в тему. И к ним надо обязательно ставить маленькую подпись с указанием источника, или же прописать его явно в тексте.&lt;br /&gt;
&lt;br /&gt;
Подсказка (просто на всякий случай): задание делается гораздо качественнее и аккуратнее, если его не откладывать на последний вечер;)&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * О&amp;lt;sub&amp;gt;дз+cем&lt;br /&gt;
&lt;br /&gt;
[https://docs.google.com/spreadsheets/d/1T_1LqhQ4fWJGh3s-lA0MsNoMTYIXIH9iUY3bu-Vpcrg/edit?usp=sharing, (ведомость)]&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 3 (18-24 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)], слайды семинара 19.09  [http://dmitryfrolov.com/pdf/sem3_new.pdf (ссылка)]. Задание для БПМИ142 МОП [http://wiki.cs.hse.ru/images/7/7c/Task.png (ссылка)]. (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).   [https://www.dropbox.com/s/hvojoqp7zb3p4sk/sem3__Copy_.pdf?dl=0 (слайды с семинара вместе с заданием)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 4 (25 сентября – 1 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашённый лектор Иван Смуров):&#039;&#039;&#039; Синтаксический анализ (syntactic parsing) - одна из классических задач NLP, заключающейся в построении по последовательности текста соответствующего ей синтаксического разбора. Задача имеет продолжительную и богатую историю и решалась с помощью различных методов - от вероятностных контекстно-свободных грамматик до нейросетей с использованием sequence-to-sequence архитектур. На лекции будет рассказано о популярном в литературе подходе  - использованию transition-based парсеров. Этод подход, восходящий к shift-reduce анализаторам классических логик, был впервые использован в применении к задаче синтаксического анализа Й. Нивре в 2003 году. В 2014 году метод был адаптирован для использования нейросетей Д. Ченом и К. Маннингом из Стенфордского университета и, наконец, в 2016 он послужил основой для популярного парсера SynaxNet, разработанного в  Google. [https://www.dropbox.com/s/yceqgugsc6tdcxs/transition-based_%D0%BF%D0%B0%D1%80%D1%81%D0%B5%D1%80%D1%8B.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
О лекторе:&lt;br /&gt;
Иван Смуров – сотрудник кафедр Алгоритмов и Технологий Программирования и Компьютерной Лингвистики МФТИ, разрабатчик научно-исследовательского отдела компании ABBYY. Является специалистом  по машинному обучению, компьютерной и вычислительной лингвистике, математической логике. Область основных интересов – обработка текстов на естественных языках.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; SyntaxNet, cинтаксические парсеры, универсальные зависимости [https://yadi.sk/d/OddFv-y33NBshk (слайды)]&lt;br /&gt;
&lt;br /&gt;
[http://dmitryfrolov.com/pdf/task4.jpg (дз для 3 курса)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 5 (2 октября – 8 октября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк):&#039;&#039;&#039; Статистический анализ текстов. Законы Ципфа и Хипса. Методы извлечения ключевых слов и словосочетаний.  Векторная модель. [https://www.dropbox.com/s/fzqcvqb7qu4d27j/4_StatAnalysis.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; Ключевые слова, n-граммы, коллокации [https://www.dropbox.com/s/98grun1bl2pqy2p/sem5.pdf?dl=0 (слайды и дз)], [https://yadi.sk/i/BND6d9P73NZLCE (слайды для группы 142)]&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
==== Неделя 6 (9 октября – 15 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Анна Потапенко):&#039;&#039;&#039; Дистрибутивная семантика. В курсе вы уже поговорили о морфологии и синтаксисе, в этой лекции мы поднимемся на следующий уровень анализа языка и поговорим о семантике - о том, как из текстов извлекать смысл отдельных слов и целых предложений. Смысл будем кодировать векторами - обычными векторами вещественных чисел.  Мы начнем с классических моделей - подсчета PMI слов и применения SVD для понижения размерности матриц. Затем поговорим о том, как в эту картину укладывается нашумевший word2vec. Разберемся, почему это не deep learning, и почему король - мужчина + женщина != королева. Затем поговорим о других популярных и более новых подходах обучения векторных представлений слов: GloVe, FastText, StarSpace. Во второй части лекции перейдем к предложениям и поговорим о 3 типах нейронных сетей, позволяющих строить их векторные представления: это конволюционные, рекуррентные и рекурсивные нейронные сети. Здесь мы увидим, что модели синтаксиса и другие лингвистические знания хорошо помогают собрать из отдельных слов смысл всего предложения. [https://www.dropbox.com/s/f3hklz6yko4ohqs/Potapenko_lecture_distr.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Анна занимается построением векторных представлений текста в аспирантуре у К.В. Воронцова. За время аспирантуры Анна дважды стажировалась в компании Google, где оба раза занималась исследованиями в области NLP - дистрибутивной семантикой и диалоговыми системами. Анна закончила ВМК МГУ и Школу Анализа Данных Яндекса, теперь она ведет там семинары, а также готовит онлайн-курс по NLP на платформе Coursera.&lt;br /&gt;
&lt;br /&gt;
==== Неделя 7 (16 октября – 22 октября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (М. Апишев):&#039;&#039;&#039; Тематическое моделирование. Определения. PLSA, LDA, аддитивная регуляризация [https://www.dropbox.com/s/4mjxzjk6njvzzrl/MelLain_HSE_nlp_TM_lection%20%283%29.pdf?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия [https://www.dropbox.com/s/tcj33fdgvetdvg3/classification.slides.html?dl=0 (слайды)].&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039; [https://yadi.sk/i/zct5pith3PYAmz Тематическое моделирование]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 8 (30 октября – 5 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция у журналистов данных (Е. Черняк):&#039;&#039;&#039;  Классификация текстов, метод наивного Байеса, логистическая регрессия, сверточные нейронные сети, Fast Text. [https://www.dropbox.com/s/kdcs4mvpb7o9cte/classification.slides%202.html?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар:&#039;&#039;&#039;  Классификация и анализ тональности. [https://www.dropbox.com/s/sid2nto8gmjys2y/sem8.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 9 (6 ноября – 12 ноября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (приглашенный лектор Алексей Шаграев):&#039;&#039;&#039; Информационный поиск. &lt;br /&gt;
&lt;br /&gt;
В лекции будут обсуждаться различные прикладные задачи машинного обучения в информационном поиске, возникающие при разработке поисковых систем. Среди них:&lt;br /&gt;
- кластеризация новостных сообщений&lt;br /&gt;
- построение метрик качества для поисковых систем и оптимизация под них&lt;br /&gt;
- классическое ранжирование и обучение ранжированию по пользовательским данным&lt;br /&gt;
- разнообразие и свежесть в поисковой выдаче&lt;br /&gt;
&lt;br /&gt;
[https://www.dropbox.com/s/0btntom44qve5q5/ML%20-%20%D0%B4%D0%BB%D1%8F%20%D0%BA%D1%80%D1%83%D1%82%D1%8B%D1%85%20%D1%81%D1%82%D1%83%D0%B4%D0%B5%D0%BD%D1%82%D0%BE%D0%B2.pptx?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
О лекторе: Алексей Шаграев, к.т.н., руководитель службы разработки свеже-социального поиска Яндекса&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Информационный поиск [https://www.dropbox.com/s/h2u3f26jjpbgd9u/sem9___final.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 10 (13 ноября – 19 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Языковые модели. Счетные модели и нейронные модели. Реккурентные нейронные сети. LSTM.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039; Автоматическая генерация текстов [https://www.dropbox.com/s/7p7l0azbj948cnk/sem10.pdf?dl=0 (слайды)] [https://yadi.sk/i/jTNrjF283PzYz8 (слайды группы 142)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 11 (20 ноября – 25 ноября)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;  Извлечение информации: именованные сущности, отношения, факты и события. Использование методов классификации и методов классификации последовательностей. MEMM, CRF, BiLSTM-CRF.&lt;br /&gt;
&lt;br /&gt;
==== Неделя 12 (27 ноября – 1 декабя)  ====&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039; Генерация текстов. Обучение с подкреплением (reinforcment learning) в задачах генерации текстов (обзор). [https://www.dropbox.com/s/god4t70rwe1zlwm/1_NLG.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
* Курс в Стенфорде по DL для AOT [http://cs224d.stanford.edu (link)]&lt;br /&gt;
* Материалы по обучению с подкреплением (Reinforcment Learning) [https://github.com/jiyfeng/rl4nlp (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
* Text Visualisation browser: [http://textvis.lnu.se (link)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
* [http://eprints.lse.ac.uk/62548/1/Schonhardt-Bailey_text%20mining%20handbook.pdf/] Text mining for central banks&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;br /&gt;
# readability  [https://github.com/buriy/python-readability (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24437</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24437"/>
		<updated>2017-09-21T16:34:36Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Неделя 3 (18-26 сентября) */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи дз ===&lt;br /&gt;
 TBA&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * (О&amp;lt;sub&amp;gt;дз&amp;lt;/sub&amp;gt; + О&amp;lt;sub&amp;gt;сем&amp;lt;/sub&amp;gt;) / 2&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 3 (18-26 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)], слайды семинара 19.09  [http://dmitryfrolov.com/pdf/sem3_new.pdf (ссылка)]. Задание для БПМИ142 МОП [http://wiki.cs.hse.ru/images/7/7c/Task.png (ссылка)]. (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).   [https://www.dropbox.com/s/hvojoqp7zb3p4sk/sem3__Copy_.pdf?dl=0 (слайды с семинара вместе с заданием)]&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24296</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24296"/>
		<updated>2017-09-19T17:03:09Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Программа */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи дз ===&lt;br /&gt;
 TBA&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * (О&amp;lt;sub&amp;gt;дз&amp;lt;/sub&amp;gt; + О&amp;lt;sub&amp;gt;сем&amp;lt;/sub&amp;gt;) / 2&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 3 (18-26 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)] (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24295</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24295"/>
		<updated>2017-09-19T17:02:51Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Программа */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи дз ===&lt;br /&gt;
 TBA&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * (О&amp;lt;sub&amp;gt;дз&amp;lt;/sub&amp;gt; + О&amp;lt;sub&amp;gt;сем&amp;lt;/sub&amp;gt;) / 2&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). [https://www.dropbox.com/s/0kyl4w7rhaih90f/sem2.pdf?dl=0 (слайды с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (18-26 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Морфологический анализ, основные задачи и подходы. Стеммер Портера, поиск по словарю, скрытые цепи Маркова. Современные задачи морфологического анализа. [https://www.dropbox.com/s/urdf9cpsnp6uvml/2_morph.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: SENNA, Томита-парсер, отношения между словами. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_3.pdf (ссылка)] (дедлайн на все 23.59 21.09, делается и присылается индивидуально!).&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24121</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24121"/>
		<updated>2017-09-12T16:36:21Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Неделя 2 (11-17 сентября) */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи дз ===&lt;br /&gt;
 TBA&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * (О&amp;lt;sub&amp;gt;дз&amp;lt;/sub&amp;gt; + О&amp;lt;sub&amp;gt;сем&amp;lt;/sub&amp;gt;) / 2&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). Презентация будет выложена после семинара в четверг.&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24120</id>
		<title>Анализ неструктурированных данных</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%90%D0%BD%D0%B0%D0%BB%D0%B8%D0%B7_%D0%BD%D0%B5%D1%81%D1%82%D1%80%D1%83%D0%BA%D1%82%D1%83%D1%80%D0%B8%D1%80%D0%BE%D0%B2%D0%B0%D0%BD%D0%BD%D1%8B%D1%85_%D0%B4%D0%B0%D0%BD%D0%BD%D1%8B%D1%85&amp;diff=24120"/>
		<updated>2017-09-12T16:35:54Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Неделя 2 (11-17 сентября) */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;== О курсе ==&lt;br /&gt;
&lt;br /&gt;
Курс читается для студентов 3-го и 4-го курсов [https://cs.hse.ru/ami ПМИ ФКН ВШЭ] в 1-2 модулях.&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекторы:&#039;&#039;&#039;  Петр Алексеевич Ромов, Екатерина Леонидовна Черняк &lt;br /&gt;
&lt;br /&gt;
Лекции проходят по вторникам, 15:10 – 16:30 , ауд. 509.&lt;br /&gt;
&lt;br /&gt;
=== Полезные ссылки ===&lt;br /&gt;
&lt;br /&gt;
[https://www.hse.ru/edu/courses/205512723 Карточка курса]&lt;br /&gt;
&lt;br /&gt;
Репозиторий с материалами на GitHub: https://github.com/HSE-NLP&lt;br /&gt;
&lt;br /&gt;
Сдача домашних заданий по электронной почте: [mailto:http://amilinguaHW@gmail.com amilinguaHW@gmail.com]&lt;br /&gt;
&lt;br /&gt;
telegram: https://t.me/nlp_hse&lt;br /&gt;
&lt;br /&gt;
=== Семинары ===&lt;br /&gt;
&lt;br /&gt;
{| class=&amp;quot;wikitable&amp;quot;&lt;br /&gt;
|-&lt;br /&gt;
! Группа !! Преподаватель !! Расписание&lt;br /&gt;
|-&lt;br /&gt;
| АДИС || Дмитрий Фролов  ||  вторник, 18:10 – 19:30, ауд. 501&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ141 МОП || Анна Шишкова  ||  четверг, 13:40 – 15:00, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
| БПМИ142 МОП || Мурат Апишев  ||  четверг, 10:30 – 11:50, ауд. 322&lt;br /&gt;
|-&lt;br /&gt;
|}&lt;br /&gt;
&lt;br /&gt;
=== Дата выдачи/сдачи дз ===&lt;br /&gt;
 TBA&lt;br /&gt;
&lt;br /&gt;
=== Система оценок ===&lt;br /&gt;
&lt;br /&gt;
Результирующая оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;итоговая&amp;lt;/sub&amp;gt; = 0.8 * O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; + 0.2 * О&amp;lt;sub&amp;gt;экз&amp;lt;/sub&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Накопленная оценка рассчитывается по формуле:&lt;br /&gt;
&lt;br /&gt;
O&amp;lt;sub&amp;gt;накопл&amp;lt;/sub&amp;gt; = 0.4 * O&amp;lt;sub&amp;gt;проект1&amp;lt;/sub&amp;gt; +  0.4 * O&amp;lt;sub&amp;gt;проект2&amp;lt;/sub&amp;gt; +  0.2 * (О&amp;lt;sub&amp;gt;дз&amp;lt;/sub&amp;gt; + О&amp;lt;sub&amp;gt;сем&amp;lt;/sub&amp;gt;) / 2&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Программа === &lt;br /&gt;
&lt;br /&gt;
==== Неделя 1 (4-10 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (Е. Черняк)&#039;&#039;&#039;: Обзор курса: мастер-классы, кейсы, проекты. Введение в автоматическую обработку текстов. [https://www.dropbox.com/s/cisfnsahepuiac9/1_intro.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотека nltk&lt;br /&gt;
[https://www.dropbox.com/s/81ur98bn5wa9thq/sem1.pdf?dl=0 (слайды и дз)]&lt;br /&gt;
[https://www.dropbox.com/s/c9e1mqmmm7m2bcn/Sem%201.ipynb?dl=0 (код с семинара)]&lt;br /&gt;
&lt;br /&gt;
==== Неделя 2 (11-17 сентября)  ==== &lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Лекция (П. Ромов)&#039;&#039;&#039;: Форматы данных, способы хранения, принципы работы интернета. Краулинг. Regexp. Unicode. [https://www.dropbox.com/s/xm5ob8mkm7lrf3p/HSE_NLP_Lection2.pdf?dl=0 (слайды)]&lt;br /&gt;
&lt;br /&gt;
&#039;&#039;&#039;Семинар&#039;&#039;&#039;: Библиотеки lxml, beautifulsoup, scrapy. Задание для группы 3-4 курс, вечер: [http://dmitryfrolov.com/pdf/task_1.pdf (ссылка)] (дедлайн на все 23.59 14.09, делается и присылается индивидуально!). Презентация будет выложена после семинара в четверг. .,&lt;br /&gt;
&lt;br /&gt;
=== Рекомендуемые ресурсы ===&lt;br /&gt;
&lt;br /&gt;
На английском&lt;br /&gt;
* Jurafsky &amp;amp; Martin [https://web.stanford.edu/~jurafsky/slp3/ (link) ] &lt;br /&gt;
* Курс Лауры Каллмайер по МО для АОТ [https://user.phil.hhu.de/~kallmeyer/MachineLearning/index.html (link)]&lt;br /&gt;
* Курс Нильса Раймерса по DL для АОТ [https://github.com/UKPLab/deeplearning4nlp-tutorial (link)]&lt;br /&gt;
* Курс в Оксфорде по DL для АОТ [https://github.com/oxford-cs-deepnlp-2017 (link)]&lt;br /&gt;
&lt;br /&gt;
На русском (и про русский, в основном)&lt;br /&gt;
* НКРЯ [http://ruscorpora.ru (link)]&lt;br /&gt;
* Открытый корпус [http://opencorpora.org (link)]&lt;br /&gt;
* Дистрибутивные семантические модели для русского языка [http://rusvectores.org/ru/ (link)]&lt;br /&gt;
* Морфология [https://tech.yandex.ru/mystem/ (link)]&lt;br /&gt;
* Синтаксис [https://habrahabr.ru/post/317564/ (link)]&lt;br /&gt;
* Томита-парсер [https://tech.yandex.ru/tomita/ (link)]&lt;br /&gt;
* Все на свете: [http://mathlingvo.ru (mathlingvo)], [https://nlpub.org (nlpub)]&lt;br /&gt;
&lt;br /&gt;
Ссылка на дополнительную литературу:&lt;br /&gt;
* [https://machinelearningmastery.com/books-on-natural-language-processing/] Books on natural language processing&lt;br /&gt;
&lt;br /&gt;
Литература&lt;br /&gt;
# Manning, Christopher D., and Hinrich Schütze. Foundations of statistical natural language processing. Vol. 999. Cambridge: MIT press, 1999.&lt;br /&gt;
# Martin, James H., and Daniel Jurafsky. &amp;quot;Speech and language processing.&amp;quot; International Edition 710 (2000): 25.&lt;br /&gt;
# Cohen, Shay. &amp;quot;Bayesian analysis in natural language processing.&amp;quot; Synthesis Lectures on Human Language Technologies 9, no. 2 (2016): 1-274.&lt;br /&gt;
# Goldberg, Yoav. &amp;quot;Neural Network Methods for Natural Language Processing.&amp;quot; Synthesis Lectures on Human Language Technologies 10, no. 1 (2017): 1-309.&lt;br /&gt;
&lt;br /&gt;
=== Используемые библиотеки ===&lt;br /&gt;
# NLTK [http://www.nltk.org (link)]&lt;br /&gt;
# pymorphy2 [https://pymorphy2.readthedocs.io/en/latest/ (link)]&lt;br /&gt;
# pymystem3 [https://github.com/Digsolab/pymystem3 (link)]&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18462</id>
		<title>Набор для корпуса &quot;Сделай сам&quot;</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18462"/>
		<updated>2016-01-22T22:41:01Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Набор для корпуса &amp;quot;Сделай сам&amp;quot;&lt;br /&gt;
|mentor=Дмитрий Фролов&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2016&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|number_of_students=5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
На факультете филологии НИУ ВШЭ имеется проект по сбору всех текстов, которые есть в Интернете (в том числе в соцсетях) на языках народов России. То есть получаются отдельные коллекции для башкирского, удмуртского, чувашского и т.д. Разного размера. В той части, которая вытянута из соцсетей, известно много об авторе: пол, возраст, дата рождения, город. &lt;br /&gt;
Необходим веб-сервис, который позволял бы не просто скачать все тексты архивом, а умел реагировать на такие, например, запросы от пользователя: &amp;quot;хочу коллекцию текстов на ингушском языке объёмом 100 000 слов, чтобы она состояла из записей в соцсетях людей из Назрани от 20 до 38 лет&amp;quot;. В запросной форме пользователь отмечает галочки, посылает запрос к серверу, а он позволяет скачать архив с набором файлов (в XML) и метатаблицей.&lt;br /&gt;
&lt;br /&gt;
=== Функциональность интерфейса ===&lt;br /&gt;
&lt;br /&gt;
# сначала выбирается язык (один из имеющихся), а потом всё остальное.&lt;br /&gt;
# пользователь может выбрать, хочет он корпус текстов только из соц.сети, только из интернета, просто N (захардкоженное число) токенов текста на одном из имеющихся у нас языков или всё целиком&lt;br /&gt;
# только текст на этом языке или с вкраплениями русского&lt;br /&gt;
# выбор по всяким параметрам авторов в соц.сети (пол, возраст, город говорящего).&lt;br /&gt;
# сохранять или не сохранять диалоговую структуру ВК-стены &lt;br /&gt;
&lt;br /&gt;
Примеры запросов:&lt;br /&gt;
&lt;br /&gt;
# хочу получить все тексты только на этом языке, написанные мужчинами до 24 лет&lt;br /&gt;
# хочу получить тексты из соц.сетей с сохранением структуры диалога и с русским текстом&lt;br /&gt;
# тоже самое, только без русского текста&lt;br /&gt;
# хочу получить тексты из интернета с 5 доменов.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn))&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки. Средства разработки клиентской и серверной частей.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Ориентировочное расписание занятий ===&lt;br /&gt;
СР 18.30-20.30&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18461</id>
		<title>Набор для корпуса &quot;Сделай сам&quot;</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18461"/>
		<updated>2016-01-22T22:40:23Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Темы вводных занятий */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Набор для корпуса &amp;quot;Сделай сам&amp;quot;&lt;br /&gt;
|mentor=Дмитрий Фролов&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2016&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|number_of_students=5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
На факультете филологии НИУ ВШЭ имеется проект по сбору всех текстов, которые есть в Интернете (в том числе в соцсетях) на языках народов России. То есть получаются отдельные коллекции для башкирского, удмуртского, чувашского и т.д. Разного размера. В той части, которая вытянута из соцсетей, известно много об авторе: пол, возраст, дата рождения, город. &lt;br /&gt;
Необходим веб-сервис, который позволял бы не просто скачать все тексты архивом, а умел реагировать на такие, например, запросы от пользователя: &amp;quot;хочу коллекцию текстов на ингушском языке объёмом 100 000 слов, чтобы она состояла из записей в соцсетях людей из Назрани от 20 до 38 лет&amp;quot;. В запросной форме пользователь отмечает галочки, посылает запрос к серверу, а он позволяет скачать архив с набором файлов (в XML) и метатаблицей.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Функциональность интерфейса ===&lt;br /&gt;
&lt;br /&gt;
# сначала выбирается язык (один из имеющихся), а потом всё остальное.&lt;br /&gt;
# пользователь может выбрать, хочет он корпус текстов только из соц.сети, только из интернета, просто N (захардкоженное число) токенов текста на одном из имеющихся у нас языков или всё целиком&lt;br /&gt;
# только текст на этом языке или с вкраплениями русского&lt;br /&gt;
# выбор по всяким параметрам авторов в соц.сети (пол, возраст, город говорящего).&lt;br /&gt;
# сохранять или не сохранять диалоговую структуру ВК-стены &lt;br /&gt;
&lt;br /&gt;
Примеры запросов:&lt;br /&gt;
&lt;br /&gt;
# хочу получить все тексты только на этом языке, написанные мужчинами до 24 лет&lt;br /&gt;
# хочу получить тексты из соц.сетей с сохранением структуры диалога и с русским текстом&lt;br /&gt;
# тоже самое, только без русского текста&lt;br /&gt;
# хочу получить тексты из интернета с 5 доменов.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn))&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки. Средства разработки клиентской и серверной частей.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Ориентировочное расписание занятий ===&lt;br /&gt;
СР 18.30-20.30&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18460</id>
		<title>Набор для корпуса &quot;Сделай сам&quot;</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18460"/>
		<updated>2016-01-22T22:39:26Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Набор для корпуса &amp;quot;Сделай сам&amp;quot;&lt;br /&gt;
|mentor=Дмитрий Фролов&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2016&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|number_of_students=5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
На факультете филологии НИУ ВШЭ имеется проект по сбору всех текстов, которые есть в Интернете (в том числе в соцсетях) на языках народов России. То есть получаются отдельные коллекции для башкирского, удмуртского, чувашского и т.д. Разного размера. В той части, которая вытянута из соцсетей, известно много об авторе: пол, возраст, дата рождения, город. &lt;br /&gt;
Необходим веб-сервис, который позволял бы не просто скачать все тексты архивом, а умел реагировать на такие, например, запросы от пользователя: &amp;quot;хочу коллекцию текстов на ингушском языке объёмом 100 000 слов, чтобы она состояла из записей в соцсетях людей из Назрани от 20 до 38 лет&amp;quot;. В запросной форме пользователь отмечает галочки, посылает запрос к серверу, а он позволяет скачать архив с набором файлов (в XML) и метатаблицей.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Функциональность интерфейса ===&lt;br /&gt;
&lt;br /&gt;
# сначала выбирается язык (один из имеющихся), а потом всё остальное.&lt;br /&gt;
# пользователь может выбрать, хочет он корпус текстов только из соц.сети, только из интернета, просто N (захардкоженное число) токенов текста на одном из имеющихся у нас языков или всё целиком&lt;br /&gt;
# только текст на этом языке или с вкраплениями русского&lt;br /&gt;
# выбор по всяким параметрам авторов в соц.сети (пол, возраст, город говорящего).&lt;br /&gt;
# сохранять или не сохранять диалоговую структуру ВК-стены &lt;br /&gt;
&lt;br /&gt;
Примеры запросов:&lt;br /&gt;
&lt;br /&gt;
# хочу получить все тексты только на этом языке, написанные мужчинами до 24 лет&lt;br /&gt;
# хочу получить тексты из соц.сетей с сохранением структуры диалога и с русским текстом&lt;br /&gt;
# тоже самое, только без русского текста&lt;br /&gt;
# хочу получить тексты из интернета с 5 доменов.&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn))&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
&lt;br /&gt;
=== Ориентировочное расписание занятий ===&lt;br /&gt;
СР 18.30-20.30&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=18413</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=18413"/>
		<updated>2016-01-20T20:45:34Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_ментора&lt;br /&gt;
|categorize = yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
[[Файл:F6544.png|мини]]&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* ведущий разработчик, SlickJump (сен. 2012 - окт. 2015)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
* старший программист в стартапе (окт. 2015 - по н.в.)&lt;br /&gt;
&lt;br /&gt;
* преподаватель, департамент анализа данных и искусственного интеллекта НИУ ВШЭ (окт. 2015 - по н.в.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18412</id>
		<title>Набор для корпуса &quot;Сделай сам&quot;</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9D%D0%B0%D0%B1%D0%BE%D1%80_%D0%B4%D0%BB%D1%8F_%D0%BA%D0%BE%D1%80%D0%BF%D1%83%D1%81%D0%B0_%22%D0%A1%D0%B4%D0%B5%D0%BB%D0%B0%D0%B9_%D1%81%D0%B0%D0%BC%22&amp;diff=18412"/>
		<updated>2016-01-20T20:35:51Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: Новая страница, с помощью формы Новый_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Веб-интерфейс для формирования текстовой коллекции по заданным параметрам&lt;br /&gt;
|mentor=Дмитрий Фролов&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2016&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|number_of_students=5&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
На факультете филологии НИУ ВШЭ имеется проект по сбору всех текстов, которые есть в Интернете (в том числе в соцсетях) на языках народов России. То есть получаются отдельные коллекции для башкирского, удмуртского, чувашского и т.д. Разного размера. В той части, которая вытянута из соцсетей, известно много об авторе: пол, возраст, дата рождения, город. &lt;br /&gt;
Необходим веб-сервис, который позволял бы не просто скачать все тексты архивом, а умел реагировать на такие, например, запросы от пользователя: &amp;quot;хочу коллекцию текстов на ингушском языке объёмом 100 000 слов, чтобы она состояла из записей в соцсетях людей из Назрани от 20 до 38 лет&amp;quot;. В запросной форме пользователь отмечает галочки, посылает запрос к серверу, а он позволяет скачать архив с набором файлов (в XML) и метатаблицей.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn))&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
...&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
...&lt;br /&gt;
&lt;br /&gt;
=== Ориентировочное расписание занятий ===&lt;br /&gt;
СР 18.30-20.30&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1207</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1207"/>
		<updated>2015-01-12T21:23:26Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Пример параллельной разметки можно увидеть на картинке справа.&lt;br /&gt;
&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;новый проект&amp;quot; и загружать исходные файлы (от двух до N xml-файлов разметки)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения&lt;br /&gt;
# давать возможность пользователю выбрать один вариант (&amp;quot;правильный вариант&amp;quot;)&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный вариант&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными, и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (несколько токенов слева и справа от текущего), возможно - в виде всплывающего поля по клику (дизайн - на усмотрение разработчиков)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn))&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1206</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1206"/>
		<updated>2015-01-12T21:22:59Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Пример параллельной разметки можно увидеть на картинке справа.&lt;br /&gt;
&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;новый проект&amp;quot; и загружать исходные файлы (от двух до N xml-файлов разметки)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения&lt;br /&gt;
# давать возможность пользователю выбрать один вариант (&amp;quot;правильный вариант&amp;quot;)&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный вариант&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными, и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (несколько токенов слева и справа от текущего), возможно - в виде всплывающего поля по клику (дизайн - на усмотрение разработчиков)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# http-сервер Nginx/Apache (возможно - в связке с WSGI-сервером (Gunicorn), на усмотрение разработчиков)&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1205</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1205"/>
		<updated>2015-01-12T21:18:55Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Требования к разрабатываемой системе */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Пример параллельной разметки можно увидеть на картинке справа.&lt;br /&gt;
&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;новый проект&amp;quot; и загружать исходные файлы (от двух до N xml-файлов разметки)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения&lt;br /&gt;
# давать возможность пользователю выбрать один вариант (&amp;quot;правильный вариант&amp;quot;)&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный вариант&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными, и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (несколько токенов слева и справа от текущего), возможно - в виде всплывающего поля по клику (дизайн - на усмотрение разработчиков)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1204</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1204"/>
		<updated>2015-01-12T21:13:11Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Профессиональные навыки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_ментора&lt;br /&gt;
|categorize = yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
* телефон: 8-926-124-1152&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
[[Файл:F6544.png|мини]]&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* ведущий разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu (Debian), SUSE), FreeBSD/OpenBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1203</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1203"/>
		<updated>2015-01-12T21:12:35Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Профессиональные навыки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_ментора&lt;br /&gt;
|categorize = yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
* телефон: 8-926-124-1152&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
[[Файл:F6544.png|мини]]&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* ведущий разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu (Debian), OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1202</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1202"/>
		<updated>2015-01-12T21:11:52Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_ментора&lt;br /&gt;
|categorize = yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
* телефон: 8-926-124-1152&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
[[Файл:F6544.png|мини]]&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* ведущий разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:F6544.png&amp;diff=1201</id>
		<title>Файл:F6544.png</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:F6544.png&amp;diff=1201"/>
		<updated>2015-01-12T21:10:45Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: Dmitry загружена новая версия «Файл:F6544.png»&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
F6544.png&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:F6544.png&amp;diff=1200</id>
		<title>Файл:F6544.png</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:F6544.png&amp;diff=1200"/>
		<updated>2015-01-12T21:08:39Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: мини
F6544.png&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
F6544.png&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1199</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1199"/>
		<updated>2015-01-12T21:06:53Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Что такое разметка? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Пример параллельной разметки можно увидеть на картинке справа.&lt;br /&gt;
&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1198</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1198"/>
		<updated>2015-01-12T21:06:01Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Что это за проект? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&lt;br /&gt;
&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1197</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=1197"/>
		<updated>2015-01-12T21:02:52Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Опыт и основное место работы */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_ментора&lt;br /&gt;
|categorize = yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
* телефон: 8-926-124-1152&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский (читаю профессиональную литературу) &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* ведущий разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1196</id>
		<title>Поисковая система (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=1196"/>
		<updated>2015-01-12T21:00:32Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Поисковая система&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:Dmitry|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Одной из важнейших задач, возникающих при обработке естественного языка, является работа с большими множествами (коллекциями) текстовых документов, в частности, проблема поиска документов по запросу.&lt;br /&gt;
Программы и программные комплексы, позволяющие решать эту задачу, называются поисковыми системами. Главными характеристиками качества поисковой системы является соответствие извлеченных документов исходному запросу и время выполнения запроса. Итогом работы над проектом должна быть программа, производящая извлечение релевантных запросу документов из коллекции.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основные понятия из теории поисковых систем, основные алгоритмы поиска, методы обработки документов&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
# Работа с системой управления версиями git&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&amp;lt;!-- # Представления о системах управления версиями --&amp;gt;&lt;br /&gt;
&amp;lt;!--# Базовые представления о базах данных--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# MyStem, PyMorphy, NLTK&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# git, github/bitbucket&lt;br /&gt;
# MongoDB&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Общие понятия теории поисковых систем. Поисковые движки. Коллекции документов. Меры близости. Качество поиска.&lt;br /&gt;
# Общие методы разработки с использованием систем управления версиями.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
# Реализация системы в виде: база данных + сервер + веб-интерфейс&lt;br /&gt;
# Модификация индекса в целью снижения временной сложности поиска&lt;br /&gt;
# Предобработка коллекции документов и поисковых запросов для возможности выполнения нечеткого поиска&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
# 4-5  - Система, выполняющая предобработку коллекции, строящая поисковый индекс, позволяющая производить поиск с простейшим синтаксисом запросов: слова, словосочетания, одновременная встреча слов из запроса в документе, хотя бы одно из слов, указанных в запросе. Найденные документы должны выдаваться системой в порядке убывания релевантности. Система должна быть оформлена в виде консольного приложения.&lt;br /&gt;
# 6-7  - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, позволяющая производить поиск вне зависимости от словоформ в запросе и в документах. &lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, позволяющая выполнять нечеткий поиск (например, для запросов с ошибками).  Для поисковой системы необходимо произвести ее анализ на фиксированной коллекции, рассчитать метрики эффективности качества поиска.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=896</id>
		<title>Поисковая система (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=896"/>
		<updated>2014-12-13T20:31:01Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие начальные требования? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Поисковая система&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Одной из важнейших задач, возникающих при обработке естественного языка, является работа с большими множествами (коллекциями) текстовых документов, в частности, проблема поиска документов по запросу.&lt;br /&gt;
Программы и программные комплексы, позволяющие решать эту задачу, называются поисковыми системами. Главными характеристиками качества поисковой системы является соответствие извлеченных документов исходному запросу и время выполнения запроса. Итогом работы над проектом должна быть программа, производящая извлечение релевантных запросу документов из коллекции.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основные понятия из теории поисковых систем, основные алгоритмы поиска, методы обработки документов&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
# Работа с системой управления версиями git&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&amp;lt;!-- # Представления о системах управления версиями --&amp;gt;&lt;br /&gt;
&amp;lt;!--# Базовые представления о базах данных--&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# MyStem, PyMorphy, NLTK&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# git, github&lt;br /&gt;
# MongoDB&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Общие понятия теории поисковых систем. Поисковые движки. Коллекции документов. Меры близости. Качество поиска.&lt;br /&gt;
# Общие методы разработки с использованием систем управления версиями.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
# Реализация системы в виде: база данных + сервер + веб-интерфейс&lt;br /&gt;
# Модификация индекса в целью снижения временной сложности поиска&lt;br /&gt;
# Предобработка коллекции документов и поисковых запросов для возможности выполнения нечеткого поиска&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
# 4-5  - Система, выполняющая предобработку коллекции, строящая поисковый индекс, позволяющая производить поиск с простейшим синтаксисом запросов: слова, словосочетания, одновременная встреча слов из запроса в документе, хотя бы одно из слов, указанных в запросе. Найденные документы должны выдаваться системой в порядке убывания релевантности. Система должна быть оформлена в виде консольного приложения.&lt;br /&gt;
# 6-7  - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, позволяющая производить поиск вне зависимости от словоформ в запросе и в документах. &lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, позволяющая выполнять нечеткий поиск (например, для запросов с ошибками).  Для поисковой системы необходимо произвести ее анализ на фиксированной коллекции, рассчитать метрики эффективности качества поиска.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=895</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=895"/>
		<updated>2014-12-13T20:11:02Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Направления развития */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Различные варианты усовершенствование архитектуры серверной части, механизмов и алгоритмов клиент-серверного взаимодействия&lt;br /&gt;
&amp;lt;!--# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией --&amp;gt;&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=894</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=894"/>
		<updated>2014-12-13T20:06:29Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие начальные требования? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Представление о технологиях создания веб-страниц&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части&lt;br /&gt;
# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=893</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=893"/>
		<updated>2014-12-13T20:05:34Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части&lt;br /&gt;
# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Система представляет собой клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции все функции из списка требований (I), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=892</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=892"/>
		<updated>2014-12-13T20:04:13Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части&lt;br /&gt;
# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=891</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=891"/>
		<updated>2014-12-13T20:03:20Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Критерии оценки */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части&lt;br /&gt;
# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее как минимум половину функции из списка требований (I)&lt;br /&gt;
&lt;br /&gt;
# 6-7 - Система, реализующая все функции из списка требований (I).&lt;br /&gt;
&lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы 1-2 или более функций из списка Дополнительных требований (II). Для получения самого высокого балла (10) разработанная система должна иметь защиту от использования незарегистрированными пользователями, предоставлять возможность регистрации и входа в систему.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=721</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=721"/>
		<updated>2014-12-01T17:06:47Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Направления развития */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части&lt;br /&gt;
# Развертывание кластера серверов с распределением нагрузки (например, http-сервером)&lt;br /&gt;
# Развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее все функции из списка требований (I)&lt;br /&gt;
&lt;br /&gt;
# 6-7 - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, имеющая защиту от использования незарегистрированными пользователями, предоставляющая возможность регистрации и входа в систему. Реализованы 1-2 функций из списка Дополнительных требований (II).&lt;br /&gt;
&lt;br /&gt;
# 8-10 Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы 4-5 или более функций из списка Дополнительных требований (II). Разработанная система полностью соответствует требованиям к архитектуре.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=720</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=720"/>
		<updated>2014-12-01T17:05:47Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Какие будут использоваться технологии? */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
# HTML/CSS, JavaScript, JQuery&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# WebPy/Web2Py/Django&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# MongoDB&lt;br /&gt;
# http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части, развертывание кластера серверов с распределением нагрузки http-сервером, развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее все функции из списка требований (I)&lt;br /&gt;
&lt;br /&gt;
# 6-7 - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, имеющая защиту от использования незарегистрированными пользователями, предоставляющая возможность регистрации и входа в систему. Реализованы 1-2 функций из списка Дополнительных требований (II).&lt;br /&gt;
&lt;br /&gt;
# 8-10 Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы 4-5 или более функций из списка Дополнительных требований (II). Разработанная система полностью соответствует требованиям к архитектуре.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=719</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=719"/>
		<updated>2014-12-01T17:05:09Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
* HTML/CSS, JavaScript, JQuery&lt;br /&gt;
* Python 2.7&lt;br /&gt;
* WebPy/Web2Py/Django&lt;br /&gt;
* Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
* MongoDB&lt;br /&gt;
* http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части, развертывание кластера серверов с распределением нагрузки http-сервером, развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее все функции из списка требований (I)&lt;br /&gt;
&lt;br /&gt;
# 6-7 - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, имеющая защиту от использования незарегистрированными пользователями, предоставляющая возможность регистрации и входа в систему. Реализованы 1-2 функций из списка Дополнительных требований (II).&lt;br /&gt;
&lt;br /&gt;
# 8-10 Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы 4-5 или более функций из списка Дополнительных требований (II). Разработанная система полностью соответствует требованиям к архитектуре.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=718</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=718"/>
		<updated>2014-12-01T17:03:43Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
&lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Требования к разрабатываемой системе====&lt;br /&gt;
&lt;br /&gt;
Система должна предоставлять следующие функции (I):&lt;br /&gt;
&lt;br /&gt;
# создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&lt;br /&gt;
# выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&lt;br /&gt;
# показывать расхождения (подсветкой?)&lt;br /&gt;
# давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&lt;br /&gt;
# автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&lt;br /&gt;
# выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&lt;br /&gt;
# давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&lt;br /&gt;
# сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&lt;br /&gt;
# сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&lt;br /&gt;
# проверять валидность итогового xml-файла (с учетом п. 7)&lt;br /&gt;
# сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&lt;br /&gt;
# давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&lt;br /&gt;
&lt;br /&gt;
Дополнительные требования (II):&lt;br /&gt;
&lt;br /&gt;
# отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&lt;br /&gt;
# показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement &lt;br /&gt;
# ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&lt;br /&gt;
# вручную менять порядок показа их разборов&lt;br /&gt;
# особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&lt;br /&gt;
# возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&lt;br /&gt;
# убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
&lt;br /&gt;
# Основы проектирования и разработки клиент-серверных приложений&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
&lt;br /&gt;
# Основы HTML/CSS/JavaScript&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
&lt;br /&gt;
* HTML/CSS, JavaScript, JQuery&lt;br /&gt;
* Python 2.7&lt;br /&gt;
* WebPy/Web2Py/Django&lt;br /&gt;
* Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
* MongoDB&lt;br /&gt;
* http-сервера Nginx, Gunicorn&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
&lt;br /&gt;
# Архитектура клиент-серверных приложений и основные принципы разработки&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
&lt;br /&gt;
# Усовершенствование архитектуры серверной части, развертывание кластера серверов с распределением нагрузки http-сервером, развертывание кластера БД с шардами и репликацией&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
&lt;br /&gt;
# 4-5 - Клиент-серверное приложение, реализующее все функции из списка требований (I)&lt;br /&gt;
&lt;br /&gt;
# 6-7 - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, имеющая защиту от использования незарегистрированными пользователями, предоставляющая возможность регистрации и входа в систему. Реализованы несколько функций из списка Дополнительных требований (II).&lt;br /&gt;
&lt;br /&gt;
# 8-10 Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, реализованы все функции из списка Дополнительных требований (II). Разработанная система полностью соответствует требованиям к архитектуре.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=716</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=716"/>
		<updated>2014-12-01T16:27:35Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login=Dmitry&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
====Мотивировка====&lt;br /&gt;
Для разметки языковых данных в корпусах, базах данных и т.п. часто пользуются краудсорсингом, привлекая студентов, школьников, энтузиастов, низкооплачиваемых mechanical turks. Являясь непрофессионалами и не имея достаточного опыта, эти разметчики делают много ошибок, поэтому обычно одни и те же данные размечаются двумя-тремя-.. - пятью разметчиками. Нужен интерфейс для супервайзера-профессионала, который на основе этих параллельных разметок создаст правильную итоговую разметку. (Аналогично такую чистовую разметку делают на основе ответов нескольких автоматических разметчиков).&lt;br /&gt;
&lt;br /&gt;
====Что такое разметка?==== &lt;br /&gt;
Токен (слово или другая единица языка) с приписанным ему набором тегов (&amp;quot;разбором&amp;quot;), ср. пример из древнерусского:&amp;lt;br /&amp;gt;&lt;br /&gt;
&amp;lt;ana lex=&amp;quot;проблискатисѧ&amp;quot; gr=&amp;quot;V,praes,sg,3p&amp;quot; source_el=&amp;quot;ἀπαστράπτεται&amp;quot;/&amp;gt;проблискаѥтсѧ&amp;lt;br /&amp;gt;&lt;br /&gt;
Параллельную разметку можно представить примерно так:&amp;lt;br /&amp;gt;&lt;br /&gt;
[[Файл:IMAG1097.jpg|мини]]&lt;br /&gt;
&lt;br /&gt;
====Интерфейс должен уметь:====&lt;br /&gt;
1) создавать &amp;quot;проект&amp;quot; и загружать исходные файлы (от двух до N файлов с xml-разметкой в юникоде)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
2) выравнивать данные из разных файлов по токенам (NB возможны мелкие расхождения)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
3) показывать расхождения (подсветкой?)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
4) давать возможность пользователю выбрать один (&amp;quot;правильный&amp;quot;), кликнув на нем&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
5) автоматически выбирать &amp;quot;правильный&amp;quot;, если разметки для токена везде совпадают&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
6) выделять или (как опция) автоматически выбирать наиболее вероятный разбор по принципу &amp;quot;большинство голосует&amp;quot; (если разметок 3 и больше)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
7) давать возможность вручную написать новый разбор, если другие не годятся (в поле для редактирования)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
8) сохранять итоговую разметку в xml-файл (токены, для которых ответ не выбран, остаются без разметки)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
9) сохранять информацию о текущем состоянии в файл &amp;quot;проекта&amp;quot;&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
10) проверять валидность итогового xml-файла (с учетом п. 7)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
11) сообщать, сколько разборов осталось неразмеченными (в status bar?), и переходить к следующему неразмеченному&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
12) давать возможность увидеть контекст (10 токенов слева и справа от текущего как сниппет) (NB всплывающее поле? в строке статуса по клику? отрисовывать его при каждом токене не хочется)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
Желательные фичи:&lt;br /&gt;
а) отрисовывать блекло повторяющиеся разборы, чтобы они не отвлекали пользователя (совсем скрывать их нежелательно, чтобы пользователь видел, откуда пришел тот или иной разбор)&amp;lt;br /&amp;gt;&lt;br /&gt;
&lt;br /&gt;
б) показывать [http://en.wikipedia.org/wiki/Cohen%27s_kappa каппу] inter-annotator agreement&amp;lt;br /&amp;gt; &lt;br /&gt;
в) ранжировать аннотаторов от &amp;quot;хороших&amp;quot; к &amp;quot;плохим&amp;quot; (по степени их согласования с большинством), сначала показывать &amp;quot;хороших&amp;quot;, потом &amp;quot;плохих&amp;quot;&amp;lt;br /&amp;gt;&lt;br /&gt;
г) вручную менять порядок показа их разборов&amp;lt;br /&amp;gt;&lt;br /&gt;
д) особым образом помечать сложные случаи, чтобы потом можно было к ним вернуться (+ переходить между ними), иметь возможность писать к ним комментарии&amp;lt;br /&amp;gt;&lt;br /&gt;
е) возможность оставить два и более разбора в итоговой разметке (такая потребность реально бывает)&amp;lt;br /&amp;gt;&lt;br /&gt;
ж) убирать и добавлять токены в разметку (связано с тем, что границы между токенами требуется поменять вручную).&amp;lt;br /&amp;gt;&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
---&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:IMAG1097.jpg&amp;diff=715</id>
		<title>Файл:IMAG1097.jpg</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A4%D0%B0%D0%B9%D0%BB:IMAG1097.jpg&amp;diff=715"/>
		<updated>2014-12-01T16:26:17Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: Редактор&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;Редактор&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=549</id>
		<title>Редактор параллельных разметок (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A0%D0%B5%D0%B4%D0%B0%D0%BA%D1%82%D0%BE%D1%80_%D0%BF%D0%B0%D1%80%D0%B0%D0%BB%D0%BB%D0%B5%D0%BB%D1%8C%D0%BD%D1%8B%D1%85_%D1%80%D0%B0%D0%B7%D0%BC%D0%B5%D1%82%D0%BE%D0%BA_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=549"/>
		<updated>2014-11-25T22:29:45Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: Новая страница, с помощью формы Новый_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Редактор параллельных разметок&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
---&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
---&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=541</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=541"/>
		<updated>2014-11-24T20:10:56Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: &lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com&lt;br /&gt;
* телефон: 8-926-124-1152&lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский (читаю профессиональную литературу) &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* инженер-разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=345</id>
		<title>Поисковая система (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=345"/>
		<updated>2014-11-11T21:37:19Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Темы вводных занятий */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Поисковая система&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Одной из важнейших задач, возникающих при обработке естественного языка, является работа с большими множествами (коллекциями) текстовых документов, в частности, проблема поиска документов по запросу.&lt;br /&gt;
Программы и программные комплексы, позволяющие решать эту задачу, называются поисковыми системами. Главными характеристиками качества поисковой системы является соответствие извлеченных документов исходному запросу и время выполнения запроса. Итогом работы над проектом должна быть программа, производящая извлечение релевантных запросу документов из коллекции.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основные понятия из теории поисковых систем, основные алгоритмы поиска, методы обработки документов&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
# Работа с системой управления версиями git&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# MyStem, PyMorphy, NLTK&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# git, github&lt;br /&gt;
# MongoDB&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Общие понятия теории поисковых систем. Поисковые движки. Коллекции документов. Меры близости. Качество поиска.&lt;br /&gt;
# Общие методы разработки с использованием систем управления версиями.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
# Реализация системы в виде: база данных + сервер + веб-интерфейс&lt;br /&gt;
# Модификация индекса в целью снижения временной сложности поиска&lt;br /&gt;
# Предобработка коллекции документов и поисковых запросов для возможности выполнения нечеткого поиска&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
# 4-5  - Система, выполняющая предобработку коллекции, строящая поисковый индекс, позволяющая производить поиск с простейшим синтаксисом запросов: слова, словосочетания, одновременная встреча слов из запроса в документе, хотя бы одно из слов, указанных в запросе. Найденные документы должны выдаваться системой в порядке убывания релевантности. Система должна быть оформлена в виде консольного приложения.&lt;br /&gt;
# 6-7  - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, позволяющая производить поиск вне зависимости от словоформ в запросе и в документах. &lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, позволяющая выполнять нечеткий поиск (например, для запросов с ошибками).  Для поисковой системы необходимо произвести ее анализ на фиксированной коллекции, рассчитать метрики эффективности качества поиска.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=344</id>
		<title>Поисковая система (проект)</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%9F%D0%BE%D0%B8%D1%81%D0%BA%D0%BE%D0%B2%D0%B0%D1%8F_%D1%81%D0%B8%D1%81%D1%82%D0%B5%D0%BC%D0%B0_(%D0%BF%D1%80%D0%BE%D0%B5%D0%BA%D1%82)&amp;diff=344"/>
		<updated>2014-11-11T21:09:29Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: Новая страница, с помощью формы Новый_проект&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;{{Карточка_проекта&lt;br /&gt;
|name=Поисковая система&lt;br /&gt;
|mentor=Фролов Дмитрий&lt;br /&gt;
|mentor_login={{URLENCODE:{{REVISIONUSER}}|WIKI}}&lt;br /&gt;
|semester=Весна 2015&lt;br /&gt;
|course=1&lt;br /&gt;
|summer=on&lt;br /&gt;
|categorize=yes&lt;br /&gt;
}}&lt;br /&gt;
&lt;br /&gt;
=== Что это за проект? ===&lt;br /&gt;
Одной из важнейших задач, возникающих при обработке естественного языка, является работа с большими множествами (коллекциями) текстовых документов, в частности, проблема поиска документов по запросу.&lt;br /&gt;
Программы и программные комплексы, позволяющие решать эту задачу, называются поисковыми системами. Главными характеристиками качества поисковой системы является соответствие извлеченных документов исходному запросу и время выполнения запроса. Итогом работы над проектом должна быть программа, производящая извлечение релевантных запросу документов из коллекции.&lt;br /&gt;
&lt;br /&gt;
=== Чему вы научитесь? ===&lt;br /&gt;
# Основные понятия из теории поисковых систем, основные алгоритмы поиска, методы обработки документов&lt;br /&gt;
# Базовые знания Unix Shell&lt;br /&gt;
# Работа с нереляционными базами данных&lt;br /&gt;
# Работа с системой управления версиями git&lt;br /&gt;
&lt;br /&gt;
=== Какие начальные требования? ===&lt;br /&gt;
# Основы языка программирования Python&lt;br /&gt;
# Представления о системах управления версиями&lt;br /&gt;
# Базовые представления о базах данных&lt;br /&gt;
&lt;br /&gt;
=== Какие будут использоваться технологии? ===&lt;br /&gt;
# Python 2.7&lt;br /&gt;
# MyStem, PyMorphy, NLTK&lt;br /&gt;
# Ubuntu Linux/OpenSUSE/FreeBSD, GNU Emacs или Vim - на выбор&lt;br /&gt;
# git, github&lt;br /&gt;
# MongoDB&lt;br /&gt;
&lt;br /&gt;
=== Темы вводных занятий ===&lt;br /&gt;
# Общие понятия теории поисковых систем. Коллекции документов. Меры близости. Качество поиска.&lt;br /&gt;
# Общие методы разработки с использованием систем управления версиями.&lt;br /&gt;
# Нереляционные базы данных, преимущества, недостатки, особенности использования&lt;br /&gt;
&lt;br /&gt;
=== Направления развития ===&lt;br /&gt;
# Реализация системы в виде: база данных + сервер + веб-интерфейс&lt;br /&gt;
# Модификация индекса в целью снижения временной сложности поиска&lt;br /&gt;
# Предобработка коллекции документов и поисковых запросов для возможности выполнения нечеткого поиска&lt;br /&gt;
&lt;br /&gt;
=== Критерии оценки ===&lt;br /&gt;
# 4-5  - Система, выполняющая предобработку коллекции, строящая поисковый индекс, позволяющая производить поиск с простейшим синтаксисом запросов: слова, словосочетания, одновременная встреча слов из запроса в документе, хотя бы одно из слов, указанных в запросе. Найденные документы должны выдаваться системой в порядке убывания релевантности. Система должна быть оформлена в виде консольного приложения.&lt;br /&gt;
# 6-7  - Система, реализующая функции, перечисленные в Пункте (1), и, кроме того, позволяющая производить поиск вне зависимости от словоформ в запросе и в документах. &lt;br /&gt;
# 8-10 - Система, реализующая функции, перечисленные в Пункте (2), и, кроме того, позволяющая выполнять нечеткий поиск (например, для запросов с ошибками).  Для поисковой системы необходимо произвести ее анализ на фиксированной коллекции, рассчитать метрики эффективности качества поиска.&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=342</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=342"/>
		<updated>2014-11-11T21:01:52Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Опыт и основное место работы */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com  &lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский (читаю профессиональную литературу) &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 - май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* инженер-разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка&lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=315</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=315"/>
		<updated>2014-11-09T19:30:49Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: /* Образование */&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com  &lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;quot;Высшая школа экономики&amp;quot;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский (читаю профессиональную литературу) &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 -- май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* инженер-разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка  &lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
	<entry>
		<id>https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=314</id>
		<title>Участник:Dmitry</title>
		<link rel="alternate" type="text/html" href="https://wiki.cs.hse.ru/index.php?title=%D0%A3%D1%87%D0%B0%D1%81%D1%82%D0%BD%D0%B8%D0%BA:Dmitry&amp;diff=314"/>
		<updated>2014-11-09T19:27:33Z</updated>

		<summary type="html">&lt;p&gt;Dmitry: создание страницы&lt;/p&gt;
&lt;hr /&gt;
&lt;div&gt;&lt;br /&gt;
&lt;br /&gt;
Фролов Дмитрий Сергеевич&lt;br /&gt;
&lt;br /&gt;
=Контактная информация=          &lt;br /&gt;
* e-mail: dmitsf@gmail.com  &lt;br /&gt;
&lt;br /&gt;
=Образование=&lt;br /&gt;
* Петрозаводский государственный университет (ПетрГУ), бакалавр прикладной математики и информатики, 2008-2012 (диплом с отличием) &lt;br /&gt;
* Национальный исследовательский университет &amp;lt;&amp;lt;Высшая школа экономики&amp;gt;&amp;gt;, магистр системной и программной инженерии, 2012-2014&lt;br /&gt;
* Национальный исследовательский университет &amp;lt;&amp;lt;Высшая школа экономики&amp;gt;&amp;gt;, факультет компьютерных наук, аспирант, 2014 - по н.в.&lt;br /&gt;
&lt;br /&gt;
=Языки=&lt;br /&gt;
&lt;br /&gt;
* Русский (родной)&lt;br /&gt;
* Английский (читаю профессиональную литературу) &lt;br /&gt;
 &lt;br /&gt;
= Опыт и основное место работы =&lt;br /&gt;
&lt;br /&gt;
* инженер-программист, Петрозаводский государственный университет, Лаборатория информационно-телекоммуникационных систем (фев. 2010 -- май 2012)&lt;br /&gt;
** разработка на C++ в проектах Nokia (Maemo, Symbian)&lt;br /&gt;
**  дополнительные должности:&lt;br /&gt;
***  тренер по олимпиадному программированию &lt;br /&gt;
*** член комиссии муниципального этапа Всероссийской олимпиады по математике&lt;br /&gt;
 &lt;br /&gt;
* инженер-разработчик, SlickJump (сен. 2012 - по н.в.)&lt;br /&gt;
**  backend - разработка  &lt;br /&gt;
&lt;br /&gt;
= Профессиональные навыки =          &lt;br /&gt;
&lt;br /&gt;
* ОС: Linux (как рабочая и домашняя ОС: Ubuntu, OpenSUSE), FreeBSD, Unix shell, MS Windows&lt;br /&gt;
* Языки программирования: Python (как основной язык программирования: WebPy, Scikit-Learn, PyMorphy, NLTK и т.д.); C/C++&lt;br /&gt;
* Мобильная разработка: Symbian OS, Maemo OS (имел опыт разработки на C++)&lt;br /&gt;
* Web-разработка: опыт конфигурирования высоконагруженных серверов (Gunicorn, Nginx, свои собственные на Python), JavaScript (вкл. jQuery, Ajax, BackBone - имел опыт использования), HTML/CSS, PHP, CoffeeScript (имел опыт использования) &lt;br /&gt;
* Математическое ПО: Maxima, Statistica, SPSS, MatLab, Mathcad  &lt;br /&gt;
* Базы данных: MongoDB (как основная БД: опыт конфигурирования распределенных кластеров БД, репликации, использования MapReduce и статистической обработки данных); MySQL&lt;br /&gt;
* Системы контроля версий: git &lt;br /&gt;
* Навыки оптимизации программ (анализ сложности алгоритмов, profiling и т.д.)&lt;br /&gt;
&lt;br /&gt;
= Увлечения =&lt;br /&gt;
&lt;br /&gt;
* Пауэрлифтинг, футбол&lt;br /&gt;
* Любительская наблюдательная астрономия &lt;br /&gt;
* Автопутешествия&lt;/div&gt;</summary>
		<author><name>Dmitry</name></author>
	</entry>
</feed>