Обучение с подкреплением (ИИ24, 7 модуль): различия между версиями

Материал из Wiki - Факультет компьютерных наук
Перейти к навигации Перейти к поиску
Нет описания правки
Темы лекций + Формула
Строка 7: Строка 7:
Чат курса в TG: [[https://t.me/+cl-7RP37Ulw4YTE6link]]
Чат курса в TG: [[https://t.me/+cl-7RP37Ulw4YTE6link]]


Преподаватель: Вячеслав Б., Сергей Л.
Преподаватель: Сергей Лактионов, Вячеслав Бучков


{| class="wikitable"
{| class="wikitable"
Строка 27: Строка 27:
  ! Занятие !! Тема !! Дата !! Материалы для самоподготовки к семинарам !! Дополнительные материалы
  ! Занятие !! Тема !! Дата !! Материалы для самоподготовки к семинарам !! Дополнительные материалы
|-
|-
| style="background:#eaecf0;" | '''1''' [[ Запись]] || Intro to RL, dynamic programming || 10/01/2026 || ||  
| style="background:#eaecf0;" | '''1''' [[ Запись]] || Intro to RL, Dynamic Programming || 10/01/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''2''' [[ Запись]] || Model-free tabular RL: Q-Learning, SARSA || 17/01/2026 || ||  
| style="background:#eaecf0;" | '''2''' [[ Запись]] || Model-Free Tabular RL: Q-Learning, SARSA || 17/01/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''3''' [[ Запись]] || Intro to deep RL: DQN, RAINBOW and beyond || 24/01/2026 || ||
| style="background:#eaecf0;" | '''3''' [[ Запись]] || Intro to Deep RL: DQN, RAINBOW and beyond || 24/01/2026 || ||
|-
|-
| style="background:#eaecf0;" | '''4''' [[ Запись]] || [[ Ноутбук]] || 31/01/2026 || ||  
| style="background:#eaecf0;" | '''4''' [[ Запись]] || Policy-Based Methods: Policy Gradient, REINFORCE, A2C || 31/01/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''5''' [[ Запись]] || [[ Ноутбук]] || 07/02/2026 || ||  
| style="background:#eaecf0;" | '''5''' [[ Запись]] || Advanced Policy-Based: TRPO, PPO and beyond || 07/02/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''6''' [[ Запись]] || [[ Ноутбук]] || 14/02/2026 || ||  
| style="background:#eaecf0;" | '''6''' [[ Запись]] || Continuous Control: DDPG, SAC and beyond || 14/02/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''7''' [[ Запись]] || [[ Ноутбук]] || 21/02/2026 || ||  
| style="background:#eaecf0;" | '''7''' [[ Запись]] || Offline RL || 21/02/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''8''' [[ Запись]] || [[ Ноутбук]] || 28/02/2026 || ||  
| style="background:#eaecf0;" | '''8''' [[ Запись]] || Multi-Armed Bandits || 28/02/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''9''' [[ Запись]] || [[ Ноутбук]] || 07/03/2026 || ||
| style="background:#eaecf0;" | '''9''' [[ Запись]] || Model-based RL: AlphaZero and friends || 07/03/2026 || ||
|-
|-
| style="background:#eaecf0;" | '''10''' [[ Запись]] || [[ Ноутбук]] || 14/03/2026 || ||  
| style="background:#eaecf0;" | '''10''' [[ Запись]] || RL in a context of LLMs || 14/03/2026 || ||  
|-
|-
| style="background:#eaecf0;" | '''11''' [[ Запись]] || [[ Ноутбук]] || 21/03/2026 || ||  
| style="background:#eaecf0;" | '''11''' [[ Запись]] || Practical RL || 21/03/2026 || ||  
|-
|-
|}
|}
Строка 55: Строка 55:
==Формула оценивания==
==Формула оценивания==


Оценка = ...<вес 1>...*О<sub>...<форма контроля 1>...</sub> + ...<вес 2>...*О<sub>...<форма контроля 2>...</sub> + ...<вес 3>...*О<sub>...<форма контроля 3>...</sub>
Оценка = ...<65%>...*О<sub>...<(как минимум) 5 ДЗ>...</sub> + ...<10%>...*О<sub>...<Quiz>...</sub> + ...<25%>...*О<sub>...<Презентация статьи>...</sub>





Версия от 00:31, 14 февраля 2026

О курсе

Занятия проводятся в Zoom по субботам с 13:00 МСК

Контакты

Чат курса в TG: [[1]]

Преподаватель: Сергей Лактионов, Вячеслав Бучков

Ассистент Контакты

Материалы курса

Ссылка на плейлист курса на YouTube: [YouTube-playlist]

Ссылка на GitHub с материалами курса: [GitHub repository]

Занятие Тема Дата Материалы для самоподготовки к семинарам Дополнительные материалы
1 Запись Intro to RL, Dynamic Programming 10/01/2026
2 Запись Model-Free Tabular RL: Q-Learning, SARSA 17/01/2026
3 Запись Intro to Deep RL: DQN, RAINBOW and beyond 24/01/2026
4 Запись Policy-Based Methods: Policy Gradient, REINFORCE, A2C 31/01/2026
5 Запись Advanced Policy-Based: TRPO, PPO and beyond 07/02/2026
6 Запись Continuous Control: DDPG, SAC and beyond 14/02/2026
7 Запись Offline RL 21/02/2026
8 Запись Multi-Armed Bandits 28/02/2026
9 Запись Model-based RL: AlphaZero and friends 07/03/2026
10 Запись RL in a context of LLMs 14/03/2026
11 Запись Practical RL 21/03/2026

Записи консультаций

Формула оценивания

Оценка = ...<65%>...*О...<(как минимум) 5 ДЗ>... + ...<10%>...*О...<Quiz>... + ...<25%>...*О...<Презентация статьи>...


Домашние задания

Литература