Обучение с подкреплением (ИИ24, 7 модуль): различия между версиями
Перейти к навигации
Перейти к поиску
Темы лекций + Формула |
Формула дз |
||
| Строка 55: | Строка 55: | ||
==Формула оценивания== | ==Формула оценивания== | ||
Оценка = . | Оценка = МИН(10, 10*(0.65*HW + 0.10*Q + 0.25*RC)), где | ||
* HW - сумма баллов за (как минимум) 5 ДЗ; | |||
* Q - оценка за еженедельные квизы (суммарно 10 квизов); | |||
* RC - оценка за презентацию статьи, посвященной новым алгоритмам или неожиданным применениям RL-парадигмы в индустрии. | |||
Для каждого домашнего задания есть мягкий дедлайн, сдача после которого в течение недели до жёсткого дедлайна оценивается со штрафом 5% от оценки за ДЗ за каждый день просрочки. | |||
== Домашние задания == | == Домашние задания == | ||
Версия от 11:59, 14 февраля 2026
О курсе
Занятия проводятся в Zoom по субботам с 13:00 МСК
Контакты
Чат курса в TG: [[1]]
Преподаватель: Сергей Лактионов, Вячеслав Бучков
| Ассистент | Контакты |
|---|---|
Материалы курса
Ссылка на плейлист курса на YouTube: [YouTube-playlist]
Ссылка на GitHub с материалами курса: [GitHub repository]
| Занятие | Тема | Дата | Материалы для самоподготовки к семинарам | Дополнительные материалы |
|---|---|---|---|---|
| 1 Запись | Intro to RL, Dynamic Programming | 10/01/2026 | ||
| 2 Запись | Model-Free Tabular RL: Q-Learning, SARSA | 17/01/2026 | ||
| 3 Запись | Intro to Deep RL: DQN, RAINBOW and beyond | 24/01/2026 | ||
| 4 Запись | Policy-Based Methods: Policy Gradient, REINFORCE, A2C | 31/01/2026 | ||
| 5 Запись | Advanced Policy-Based: TRPO, PPO and beyond | 07/02/2026 | ||
| 6 Запись | Continuous Control: DDPG, SAC and beyond | 14/02/2026 | ||
| 7 Запись | Offline RL | 21/02/2026 | ||
| 8 Запись | Multi-Armed Bandits | 28/02/2026 | ||
| 9 Запись | Model-based RL: AlphaZero and friends | 07/03/2026 | ||
| 10 Запись | RL in a context of LLMs | 14/03/2026 | ||
| 11 Запись | Practical RL | 21/03/2026 |
Записи консультаций
Формула оценивания
Оценка = МИН(10, 10*(0.65*HW + 0.10*Q + 0.25*RC)), где
- HW - сумма баллов за (как минимум) 5 ДЗ;
- Q - оценка за еженедельные квизы (суммарно 10 квизов);
- RC - оценка за презентацию статьи, посвященной новым алгоритмам или неожиданным применениям RL-парадигмы в индустрии.
Для каждого домашнего задания есть мягкий дедлайн, сдача после которого в течение недели до жёсткого дедлайна оценивается со штрафом 5% от оценки за ДЗ за каждый день просрочки.