The AI Interviewer: LLM как психолог-исследователь

2 июля 2026 г.

Недавно в Scientific Reports вышла статья “The AI Interviewer: Multi-Faceted Evaluation of Adaptive Questioning by Large Language Models” — о том, насколько хорошо современные LLM умеют брать интервью.

Основную часть работы здесь сделали наши коллеги-психологи из Института психологии РАН, я там был относительно сбоку и подключился на позднем этапе, так что ни на какие лавры тут не претендую. Но расскажу вам вкратце, о чём это было.

Постановка задачи

LLM всё чаще запускают как адаптивных интервьюеров (adaptive interviewers) в качественных исследованиях по психологии и социологии: модель ведёт полуструктурированное интервью, сама решает, где копнуть глубже, сама задаёт уточняющие follow-up вопросы.

Звучит очень удобно и логично: живого интервьюера трудно масштабировать на сотни глубоких бесед, для этого LLM и нужны (как, например, нужны и как индивидуальные тьюторы в образовании). Но сразу встаёт вопрос: а хорошо ли модель это делает? Эмпатичны ли её вопросы, уместны ли, не наводящие ли, не спрашивает ли она там, где ответ и так исчерпывающий? Систематически это то ли никто не измерял, то ли измеряли довольно плохо.

Что сделали

Коллеги собрали модульного агента (на LangGraph), который ведёт интервью по некоторому опроснику. Картинка с диаграммой выглядит сложно, но на самом деле там очень простая и логичная структура:

В случае нашей статьи опросником было большое очень длинное психологическое интервью (часа на полтора-два, если всерьёз отвечать), из 54 вопросов — биография, семья, ценности, работа, здоровье и так далее.

На каждом ответе агент сам выносит бинарное решение “нужен follow-up или нет” и формулирует его. Чтобы честно сравнивать модели, зафиксировали всё, что можно: контекст (десять реальных человеческих интервью как затравка), оркестрацию агента (одинаковые промпты, guardrails, логика повторов и т.п.). А главное, зафиксировали самого интервьюируемого — разумеется, это был не человек, а LLM с фиксированным Big Five профилем.

Прогнали шесть моделей (эксперимент был в начале года, а может, и в конце предыдущего, так что модели уже устаревшие, но смысл, конечно, не в конкретных версиях): Claude Sonnet 4, Gemini 2.5 Pro, GPT-5, Grok 4, Qwen3-235B и DeepSeek V3.1.

Дальше три эксперта-психолингвиста разметили кучу вопросов, которые модели задавали, по пяти бинарным критериям. Для follow-up вопросов, которые придумывали сами модели, оценивали доброжелательность, необходимость, внимание к контексту и открытость, а для основных вопросов, где модель не задала ни одного уточняющего вопроса, оценивали оправданность этого решения. Аннотаторы оказались очень неплохо согласны между собой (каппа Флейсса 0.67–0.93).

Результаты

Получились на удивление внятные профили:

  • Gemini 2.5 Pro — самый эмпатичный тон (“спасибо, что поделились таким личным опытом”) и лучший общий ранг; согласитесь, не совсем то, чего по умолчанию ждёшь от Gemini;
  • GPT-5 — быстрый и избирательный: задаёт меньше всего follow-up’ов, зато самые оправданные;
  • Grok 4 — исчерпывающий до предела: больше всего вопросов, самые длинные и самые навязчивые (в одном интервью он 24 раза припомнил респонденту его высокий уровень невротизма);
  • Claude Sonnet 4 — сбалансированная универсальная модель;
  • Qwen3 — формальный и структурный, но чудовищно медленный (сутки на прогон);
  • а вот DeepSeek просто развалился и не смог даже придерживаться схемы опросника (45 ошибок на уровне формата в течение трёх интервью).

Кроме того, выяснилось, что лингвистические маркеры (местоимения, вид/время глагола, интенсификаторы, синтаксическая сложность) осмысленно коррелируют с оценками экспертов, то есть стилистика реально влияет на воспринимаемое качество интервью. Вот таких вот табличек в статье сразу несколько:

Заключение

Мораль здесь на самом деле простая: модель надо выбирать под конкретную задачу. Причём вряд ли есть смысл делать выводы на уровне “Gemini для чувствительных тем, а Grok — если нужна дотошность”: очевидно, что все такие выводы уже давно протухли, и могут меняться с каждым новым релизом.

Так что реальный вывод в том, что модели разные, а предложенный протокол их оценивания действительно работает. И если вы используете LLM для каких-нибудь психологических интервью, то стоит, во-первых, оценить текущие модели по похожему протоколу (пусть даже не так масштабно), а во-вторых, зафиксировать их версии для использования потом в production.

Большое спасибо соавторам!

Сергей Николенко

P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!