Обучение с подкреплением (ИИ24, 7 модуль): различия между версиями
Перейти к навигации
Перейти к поиску
Нет описания правки |
Темы лекций + Формула |
||
| Строка 7: | Строка 7: | ||
Чат курса в TG: [[https://t.me/+cl-7RP37Ulw4YTE6link]] | Чат курса в TG: [[https://t.me/+cl-7RP37Ulw4YTE6link]] | ||
Преподаватель: Вячеслав | Преподаватель: Сергей Лактионов, Вячеслав Бучков | ||
{| class="wikitable" | {| class="wikitable" | ||
| Строка 27: | Строка 27: | ||
! Занятие !! Тема !! Дата !! Материалы для самоподготовки к семинарам !! Дополнительные материалы | ! Занятие !! Тема !! Дата !! Материалы для самоподготовки к семинарам !! Дополнительные материалы | ||
|- | |- | ||
| style="background:#eaecf0;" | '''1''' [[ Запись]] || Intro to RL, | | style="background:#eaecf0;" | '''1''' [[ Запись]] || Intro to RL, Dynamic Programming || 10/01/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''2''' [[ Запись]] || Model- | | style="background:#eaecf0;" | '''2''' [[ Запись]] || Model-Free Tabular RL: Q-Learning, SARSA || 17/01/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''3''' [[ Запись]] || Intro to | | style="background:#eaecf0;" | '''3''' [[ Запись]] || Intro to Deep RL: DQN, RAINBOW and beyond || 24/01/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''4''' [[ Запись]] || | | style="background:#eaecf0;" | '''4''' [[ Запись]] || Policy-Based Methods: Policy Gradient, REINFORCE, A2C || 31/01/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''5''' [[ Запись]] || | | style="background:#eaecf0;" | '''5''' [[ Запись]] || Advanced Policy-Based: TRPO, PPO and beyond || 07/02/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''6''' [[ Запись]] || | | style="background:#eaecf0;" | '''6''' [[ Запись]] || Continuous Control: DDPG, SAC and beyond || 14/02/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''7''' [[ Запись]] || | | style="background:#eaecf0;" | '''7''' [[ Запись]] || Offline RL || 21/02/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''8''' [[ Запись]] || | | style="background:#eaecf0;" | '''8''' [[ Запись]] || Multi-Armed Bandits || 28/02/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''9''' [[ Запись]] || | | style="background:#eaecf0;" | '''9''' [[ Запись]] || Model-based RL: AlphaZero and friends || 07/03/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''10''' [[ Запись]] || | | style="background:#eaecf0;" | '''10''' [[ Запись]] || RL in a context of LLMs || 14/03/2026 || || | ||
|- | |- | ||
| style="background:#eaecf0;" | '''11''' [[ Запись]] || | | style="background:#eaecf0;" | '''11''' [[ Запись]] || Practical RL || 21/03/2026 || || | ||
|- | |- | ||
|} | |} | ||
| Строка 55: | Строка 55: | ||
==Формула оценивания== | ==Формула оценивания== | ||
Оценка = ...< | Оценка = ...<65%>...*О<sub>...<(как минимум) 5 ДЗ>...</sub> + ...<10%>...*О<sub>...<Quiz>...</sub> + ...<25%>...*О<sub>...<Презентация статьи>...</sub> | ||
Версия от 00:31, 14 февраля 2026
О курсе
Занятия проводятся в Zoom по субботам с 13:00 МСК
Контакты
Чат курса в TG: [[1]]
Преподаватель: Сергей Лактионов, Вячеслав Бучков
| Ассистент | Контакты |
|---|---|
Материалы курса
Ссылка на плейлист курса на YouTube: [YouTube-playlist]
Ссылка на GitHub с материалами курса: [GitHub repository]
| Занятие | Тема | Дата | Материалы для самоподготовки к семинарам | Дополнительные материалы |
|---|---|---|---|---|
| 1 Запись | Intro to RL, Dynamic Programming | 10/01/2026 | ||
| 2 Запись | Model-Free Tabular RL: Q-Learning, SARSA | 17/01/2026 | ||
| 3 Запись | Intro to Deep RL: DQN, RAINBOW and beyond | 24/01/2026 | ||
| 4 Запись | Policy-Based Methods: Policy Gradient, REINFORCE, A2C | 31/01/2026 | ||
| 5 Запись | Advanced Policy-Based: TRPO, PPO and beyond | 07/02/2026 | ||
| 6 Запись | Continuous Control: DDPG, SAC and beyond | 14/02/2026 | ||
| 7 Запись | Offline RL | 21/02/2026 | ||
| 8 Запись | Multi-Armed Bandits | 28/02/2026 | ||
| 9 Запись | Model-based RL: AlphaZero and friends | 07/03/2026 | ||
| 10 Запись | RL in a context of LLMs | 14/03/2026 | ||
| 11 Запись | Practical RL | 21/03/2026 |
Записи консультаций
Формула оценивания
Оценка = ...<65%>...*О...<(как минимум) 5 ДЗ>... + ...<10%>...*О...<Quiz>... + ...<25%>...*О...<Презентация статьи>...