Обучение с подкреплением (ИИ24, 7 модуль): различия между версиями

Материал из Wiki - Факультет компьютерных наук
Перейти к навигации Перейти к поиску
Опечатка
Дополнительные ссылки
Строка 33: Строка 33:
| style="background:#eaecf0;" | '''2''' [[https://www.youtube.com/watch?v=Uf-KHdRh3zs&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=4&pp=iAQB YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239762?linked=1 VKVideo]] || Model-Free Tabular RL: Q-Learning, SARSA || 17/01/2026 ||  
| style="background:#eaecf0;" | '''2''' [[https://www.youtube.com/watch?v=Uf-KHdRh3zs&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=4&pp=iAQB YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239762?linked=1 VKVideo]] || Model-Free Tabular RL: Q-Learning, SARSA || 17/01/2026 ||  
|-
|-
| style="background:#eaecf0;" | '''3''' [[https://www.youtube.com/watch?v=1wqbiJEB5ok&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=3&pp=iAQB0gcJCYcKAYcqIYzv YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239789?linked=1 VKVideo]] || Intro to Deep RL: DQN, RAINBOW and beyond || 24/01/2026 ||  
| style="background:#eaecf0;" | '''3''' [[https://www.youtube.com/watch?v=1wqbiJEB5ok&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=3&pp=iAQB0gcJCYcKAYcqIYzv YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239789?linked=1 VKVideo]] || Intro to Deep RL: DQN, RAINBOW and beyond || 24/01/2026 || Статьи: [[https://arxiv.org/pdf/1507.06527.pdf#:~:text=The%20resulting%20Deep%20Recurrent%20Q,equivalents%20featuring%20flickering%20game%20screens. DQN]], [[https://arxiv.org/abs/1507.06527 DRQN]], [[https://arxiv.org/abs/1710.02298 RAINBOW]], [[https://arxiv.org/abs/1803.00933 APE-X]]
|-
|-
| style="background:#eaecf0;" | '''4''' [[https://www.youtube.com/watch?v=Je_20lKuBSM&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=2&pp=iAQB0gcJCYcKAYcqIYzv YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239808?linked=1 VKVideo]] || Policy-Based Methods: Policy Gradient, REINFORCE, A2C || 31/01/2026 ||  
| style="background:#eaecf0;" | '''4''' [[https://www.youtube.com/watch?v=Je_20lKuBSM&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=2&pp=iAQB0gcJCYcKAYcqIYzv YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239808?linked=1 VKVideo]] || Policy-Based Methods: Policy Gradient, REINFORCE, A2C || 31/01/2026 || Статьи: [[https://papers.nips.cc/paper_files/paper/1999/hash/464d828b85b0bed98e80ade0a5c43b0f-Abstract.html Policy Gradient]], [[https://arxiv.org/abs/1602.01783 Actor-Critic]], [[https://arxiv.org/abs/2402.14740 REINFORCE in 2024]]
|-
|-
| style="background:#eaecf0;" | '''5''' [[https://www.youtube.com/watch?v=8KU9nnp1PMo&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=1&pp=iAQB YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239827?linked=1 VKVideo]] || Advanced Policy-Based: TRPO, PPO and beyond || 07/02/2026 ||  
| style="background:#eaecf0;" | '''5''' [[https://www.youtube.com/watch?v=8KU9nnp1PMo&list=PLmA-1xX7IuzDe8CEWijYwsgmdHXyaEQsg&index=1&pp=iAQB YouTube]] [[https://vkvideo.ru/playlist/-227011779_68/video-227011779_456239827?linked=1 VKVideo]] || Advanced Policy-Based: TRPO, PPO and beyond || 07/02/2026 || Статьи: [[https://arxiv.org/pdf/1502.05477.pdf TRPO]], [[https://arxiv.org/pdf/1707.06347.pdf PPO]], [[https://vitalab.github.io/article/2020/01/14/Implementation_Matters.html TRPO vs PPO]], [[https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ 37 implementation details of PPO]]
|-
|-
| style="background:#eaecf0;" | '''6''' [[ Youtube]] [[ VKVideo]] || Continuous Control: DDPG, SAC and beyond || 14/02/2026 ||  
| style="background:#eaecf0;" | '''6''' [[ Youtube]] [[ VKVideo]] || Continuous Control: DDPG, SAC and beyond || 14/02/2026 ||  

Версия от 13:06, 14 февраля 2026

О курсе

Занятия проводятся в Zoom по субботам с 13:00 МСК

Контакты

Чат курса в TG: [[1]]

Преподаватель: Сергей Лактионов, Вячеслав Бучков

Ассистент Контакты

Материалы курса

Ссылка на плейлист курса на YouTube: [YouTube-playlist]

Ссылка на плейлист курса в VKVideo: [VKVideo-playlist]

Ссылка на GitHub с материалами курса: [GitHub repository]

Занятие Тема Дата Дополнительные материалы
1 [YouTube] [VKVideo] Intro to RL, Dynamic Programming 10/01/2026
2 [YouTube] [VKVideo] Model-Free Tabular RL: Q-Learning, SARSA 17/01/2026
3 [YouTube] [VKVideo] Intro to Deep RL: DQN, RAINBOW and beyond 24/01/2026 Статьи: [DQN], [DRQN], [RAINBOW], [APE-X]
4 [YouTube] [VKVideo] Policy-Based Methods: Policy Gradient, REINFORCE, A2C 31/01/2026 Статьи: [Policy Gradient], [Actor-Critic], [REINFORCE in 2024]
5 [YouTube] [VKVideo] Advanced Policy-Based: TRPO, PPO and beyond 07/02/2026 Статьи: [TRPO], [PPO], [TRPO vs PPO], [37 implementation details of PPO]
6 Youtube VKVideo Continuous Control: DDPG, SAC and beyond 14/02/2026
7 Youtube VKVideo Offline RL 21/02/2026
8 Youtube VKVideo Multi-Armed Bandits 28/02/2026
9 Youtube VKVideo Model-based RL: AlphaZero and friends 07/03/2026
10 Youtube VKVideo RL in a context of LLMs 14/03/2026
11 Youtube VKVideo Practical RL 21/03/2026

Формула оценивания

Оценка = МИН(10, 10*(0.65*HW + 0.10*TA + 0.25*RC)), где

  • HW - сумма баллов за (как минимум) 5 ДЗ;
  • RC - оценка за презентацию статьи, посвященной новым алгоритмам или неожиданным применениям RL-парадигмы в индустрии;
  • TA - сумма баллов за еженедельные квизы (суммарно 10 квизов).

Для каждого домашнего задания есть мягкий дедлайн, сдача после которого в течение недели до жёсткого дедлайна оценивается со штрафом 5% от оценки за ДЗ за каждый день просрочки.

Домашние задания

  1. HW-1 "Value- and policy-iteration algorithms" (2 балла) | Мягкий дедлайн - 23/01/26, Жёсткий - 30/01/26 | [Ноутбук]
  2. HW-2 "SARSA(\lambda) and EV-SARSA(\lambda)" (3 балла) | Мягкий дедлайн - 31/01/26, Жёсткий - 07/02/26 | [Ноутбук]
  3. HW-3 "DQN Implementation" (6 баллов) | Мягкий дедлайн - 20/02/26, Жёсткий - 27/02/26 | [Ноутбук]

Литература

  1. Reinforcement Learning: An Introduction by R.Sutton and A.Barto
  2. Practical RL course by YSDA
  3. David Silver's course
  4. Sergey Levine's course
  5. Reinforcement Learning Textbook (in Russian)