Введение в глубокое обучение 2026
Это вводный курс об основных идеях глубокого обучения, представленный в Южном федеральном университете весной 2026 года. Курс рассчитан на первокурсников, а значит, на всех желающих.

Что такое нейронные сети
12 февраля 2026 г.
Что такое нейронные сети
12 февраля 2026 г.
Как устроен биологический нейрон и вычисления в мозге. Модель одного нейрона, функции активации: сигмоиды, ReLU, Swish. Коннекционизм и сеть как граф вычислений. Идея градиентного спуска, почему не методы второго порядка, стохастический градиентный спуск.

Стохастический градиентный спуск
26 февраля 2026 г.
Стохастический градиентный спуск
26 февраля 2026 г.
Что такое (стохастический) градиентный спуск. Плохие примеры для SGD. Метод моментов и моменты Нестерова. Адаптивные варианты SGD: AdaGrad, RMSprop, Adam.

Свёрточные нейронные сети
5 марта 2026 г.
Свёрточные нейронные сети
5 марта 2026 г.
Регуляризация в нейросетях. Полносвязные сети. Идея свёрточных сетей, веса и геометрия свёрток, пулинг. Структура классических CNN, разбор примера LeNet.

Архитектуры свёрточных сетей
12 марта 2026 г.
Архитектуры свёрточных сетей
12 марта 2026 г.
Идеи свёрточных архитектур: AlexNet и аугментация данных, VGG, network in network, Inception, остаточные связи и ResNet, Bottlenecks и split-transform-merge, Парето-фронтиры и EfficientNet.

Рекуррентные нейронные сети
19 марта 2026 г.
Рекуррентные нейронные сети
19 марта 2026 г.
Задачи с последовательностями. Рекуррентные сети, двунаправленные RNN, проблемы с распространением градиента. LSTM, GRU и другие варианты рекуррентных ячеек.

Encoder-decoder архитектуры и механизмы внимания
4 апреля 2026 г.
Encoder-decoder архитектуры и механизмы внимания
4 апреля 2026 г.
Архитектуры типа кодировщик-декодировщик, автокодировщики, проблемы таких архитектур. Идея внимания, нейробиология и мотивация, рекуррентные механизмы внимания, внимание в encoder-decoder архитектурах.

Самовнимание и архитектура трансформера
9 апреля 2026 г.
Самовнимание и архитектура трансформера
9 апреля 2026 г.
Общая схема трансформера и его слоёв. Как работает информационный поиск и как эти идеи используются в механизме self-attention. Другие части трансформера, позиционные вложения.

Архитектуры, основанные на трансформере
16 апреля 2026 г.
Архитектуры, основанные на трансформере
16 апреля 2026 г.
Первый трансформер, его результаты. Режем трансформер пополам: BERT и GPT. Трансформеры в компьютерном зрении: VisualBERT, ViT, Swin. Case study: трансформеры в сегментации. Мультимодальные представления: CLIP и BLIP.

Основы RL и многорукие бандиты
23 апреля 2026 г.
Основы RL и многорукие бандиты
23 апреля 2026 г.
Идеи обучения с подкреплением. Многорукие бандиты: простые алгоритмы, regret и его минимизация, UCB. Подсчёт средних и EMA. Другие постановки задач о бандитах.

Постановки задач RL и уравнения Беллмана
7 мая 2026 г.
Постановки задач RL и уравнения Беллмана
7 мая 2026 г.
Напоминание об обучении с подкреплением. Функции значений и уравнения Беллмана. В чём здесь проблемы и как их решают: таксономия методов RL.

Языковое моделирование
14 мая 2026 г.
Языковое моделирование
14 мая 2026 г.
Языковые модели: марковские, нейросетевые LM и представления слов, рекуррентные LM, LLM на трансформерах. Дообучение: RLHF, адаптеры и LoRA.

Законы масштабирования, CoT и рассуждающие модели
21 мая 2026 г.
Законы масштабирования, CoT и рассуждающие модели
21 мая 2026 г.
Физическое масштабирование (закон Мура и т.п.). Законы масштабирования для нейросетей. Chain-of-thought методы. Как работают рассуждающие модели.

Фронтиры возможностей AI-моделей
28 мая 2026 г.
Фронтиры возможностей AI-моделей
28 мая 2026 г.
Таймлайны и путь к AGI. Нынешний фронтир LLM, догоняет ли open source. Situational awareness: алгоритмический прогресс и unhobbling. Примеры возможностей: роботика, картинки, видео, программирование, Claude Code, график time horizon от METR. AI в математике и других науках.