Обучение с подкреплением (ИИ24, 7 модуль): различия между версиями

Материал из Wiki - Факультет компьютерных наук
Перейти к навигации Перейти к поиску
Темы лекций + Формула
Формула дз
Строка 55: Строка 55:
==Формула оценивания==
==Формула оценивания==


Оценка = ...<65%>...*О<sub>...<(как минимум) 5 ДЗ>...</sub> + ...<10%>...*О<sub>...<Quiz>...</sub> + ...<25%>...*О<sub>...<Презентация статьи>...</sub>
Оценка = МИН(10, 10*(0.65*HW + 0.10*Q + 0.25*RC)), где


* HW - сумма баллов за (как минимум) 5 ДЗ;
* Q - оценка за еженедельные квизы (суммарно 10 квизов);
* RC - оценка за презентацию статьи, посвященной новым алгоритмам или неожиданным применениям RL-парадигмы в индустрии.
Для каждого домашнего задания есть мягкий дедлайн, сдача после которого в течение недели до жёсткого дедлайна оценивается со штрафом 5% от оценки за ДЗ за каждый день просрочки.


== Домашние задания ==
== Домашние задания ==

Версия от 11:59, 14 февраля 2026

О курсе

Занятия проводятся в Zoom по субботам с 13:00 МСК

Контакты

Чат курса в TG: [[1]]

Преподаватель: Сергей Лактионов, Вячеслав Бучков

Ассистент Контакты

Материалы курса

Ссылка на плейлист курса на YouTube: [YouTube-playlist]

Ссылка на GitHub с материалами курса: [GitHub repository]

Занятие Тема Дата Материалы для самоподготовки к семинарам Дополнительные материалы
1 Запись Intro to RL, Dynamic Programming 10/01/2026
2 Запись Model-Free Tabular RL: Q-Learning, SARSA 17/01/2026
3 Запись Intro to Deep RL: DQN, RAINBOW and beyond 24/01/2026
4 Запись Policy-Based Methods: Policy Gradient, REINFORCE, A2C 31/01/2026
5 Запись Advanced Policy-Based: TRPO, PPO and beyond 07/02/2026
6 Запись Continuous Control: DDPG, SAC and beyond 14/02/2026
7 Запись Offline RL 21/02/2026
8 Запись Multi-Armed Bandits 28/02/2026
9 Запись Model-based RL: AlphaZero and friends 07/03/2026
10 Запись RL in a context of LLMs 14/03/2026
11 Запись Practical RL 21/03/2026

Записи консультаций

Формула оценивания

Оценка = МИН(10, 10*(0.65*HW + 0.10*Q + 0.25*RC)), где

  • HW - сумма баллов за (как минимум) 5 ДЗ;
  • Q - оценка за еженедельные квизы (суммарно 10 квизов);
  • RC - оценка за презентацию статьи, посвященной новым алгоритмам или неожиданным применениям RL-парадигмы в индустрии.

Для каждого домашнего задания есть мягкий дедлайн, сдача после которого в течение недели до жёсткого дедлайна оценивается со штрафом 5% от оценки за ДЗ за каждый день просрочки.

Домашние задания

Литература