Семинар лаборатории Маркова — осень 2026
Семинар, проводящийся в лаборатории Маркова под эгидой МКН СПбГУ.
Проводится прямо сейчас по средам, в 13:40.
Постоянная ссылка на трансляции

1
Debate Training Reduces Reward Hacking in RLAIF
2 сентября 2026 г.
1
Debate Training Reduces Reward Hacking in RLAIF
2 сентября 2026 г.
Доклад Кирилла Тыщука (AGI Safety Research Engineer, Google DeepMind) о reward hacking в RLAIF и о том, как AI Safety via Debate помогает более слабой модели-судье оценивать сильную модель. Сравниваются обычный RLAIF и протоколы дебатов, обсуждаются алгоритм Prefix and Diverge, результаты экспериментов и ограничения состязательного обучения.