Семинар лаборатории Маркова — осень 2026

Семинар, проводящийся в лаборатории Маркова под эгидой МКН СПбГУ.
Проводится прямо сейчас по средам, в 13:40.
Постоянная ссылка на трансляции

Debate Training Reduces Reward Hacking in RLAIF thumbnail
1

Debate Training Reduces Reward Hacking in RLAIF

September 2, 2026

Доклад Кирилла Тыщука (AGI Safety Research Engineer, Google DeepMind) о reward hacking в RLAIF и о том, как AI Safety via Debate помогает более слабой модели-судье оценивать сильную модель. Сравниваются обычный RLAIF и протоколы дебатов, обсуждаются алгоритм Prefix and Diverge, результаты экспериментов и ограничения состязательного обучения.