Введение в глубокое обучение 2026

Это вводный курс об основных идеях глубокого обучения, представленный в Южном федеральном университете весной 2026 года. Курс рассчитан на первокурсников, а значит, на всех желающих.

Что такое нейронные сети thumbnail
1

Что такое нейронные сети

12 февраля 2026 г.

Как устроен биологический нейрон и вычисления в мозге. Модель одного нейрона, функции активации: сигмоиды, ReLU, Swish. Коннекционизм и сеть как граф вычислений. Идея градиентного спуска, почему не методы второго порядка, стохастический градиентный спуск.

Стохастический градиентный спуск thumbnail
2

Стохастический градиентный спуск

26 февраля 2026 г.

Что такое (стохастический) градиентный спуск. Плохие примеры для SGD. Метод моментов и моменты Нестерова. Адаптивные варианты SGD: AdaGrad, RMSprop, Adam.

Свёрточные нейронные сети thumbnail
3

Свёрточные нейронные сети

5 марта 2026 г.

Регуляризация в нейросетях. Полносвязные сети. Идея свёрточных сетей, веса и геометрия свёрток, пулинг. Структура классических CNN, разбор примера LeNet.

Архитектуры свёрточных сетей thumbnail
4

Архитектуры свёрточных сетей

12 марта 2026 г.

Идеи свёрточных архитектур: AlexNet и аугментация данных, VGG, network in network, Inception, остаточные связи и ResNet, Bottlenecks и split-transform-merge, Парето-фронтиры и EfficientNet.

Рекуррентные нейронные сети thumbnail
5

Рекуррентные нейронные сети

19 марта 2026 г.

Задачи с последовательностями. Рекуррентные сети, двунаправленные RNN, проблемы с распространением градиента. LSTM, GRU и другие варианты рекуррентных ячеек.

Encoder-decoder архитектуры и механизмы внимания thumbnail
6

Encoder-decoder архитектуры и механизмы внимания

4 апреля 2026 г.

Архитектуры типа кодировщик-декодировщик, автокодировщики, проблемы таких архитектур. Идея внимания, нейробиология и мотивация, рекуррентные механизмы внимания, внимание в encoder-decoder архитектурах.

Самовнимание и архитектура трансформера thumbnail
7

Самовнимание и архитектура трансформера

9 апреля 2026 г.

Общая схема трансформера и его слоёв. Как работает информационный поиск и как эти идеи используются в механизме self-attention. Другие части трансформера, позиционные вложения.

Архитектуры, основанные на трансформере thumbnail
8

Архитектуры, основанные на трансформере

16 апреля 2026 г.

Первый трансформер, его результаты. Режем трансформер пополам: BERT и GPT. Трансформеры в компьютерном зрении: VisualBERT, ViT, Swin. Case study: трансформеры в сегментации. Мультимодальные представления: CLIP и BLIP.

Основы RL и многорукие бандиты thumbnail
9

Основы RL и многорукие бандиты

23 апреля 2026 г.

Идеи обучения с подкреплением. Многорукие бандиты: простые алгоритмы, regret и его минимизация, UCB. Подсчёт средних и EMA. Другие постановки задач о бандитах.

Постановки задач RL и уравнения Беллмана thumbnail
10

Постановки задач RL и уравнения Беллмана

7 мая 2026 г.

Напоминание об обучении с подкреплением. Функции значений и уравнения Беллмана. В чём здесь проблемы и как их решают: таксономия методов RL.

Языковое моделирование thumbnail
11

Языковое моделирование

14 мая 2026 г.

Языковые модели: марковские, нейросетевые LM и представления слов, рекуррентные LM, LLM на трансформерах. Дообучение: RLHF, адаптеры и LoRA.

Законы масштабирования, CoT и рассуждающие модели thumbnail
12

Законы масштабирования, CoT и рассуждающие модели

21 мая 2026 г.

Физическое масштабирование (закон Мура и т.п.). Законы масштабирования для нейросетей. Chain-of-thought методы. Как работают рассуждающие модели.

Фронтиры возможностей AI-моделей thumbnail
13

Фронтиры возможностей AI-моделей

28 мая 2026 г.

Таймлайны и путь к AGI. Нынешний фронтир LLM, догоняет ли open source. Situational awareness: алгоритмический прогресс и unhobbling. Примеры возможностей: роботика, картинки, видео, программирование, Claude Code, график time horizon от METR. AI в математике и других науках.