AI 2027 в 2026: нам и правда остался год?

11 июня 2026 г.

Предисловие

4 мая 2026 года Джек Кларк, сооснователь Anthropic, написал пост, в котором сказал следующее:

I’m writing this post because when I look at all the publicly available information I reluctantly come to the view that there’s a likely chance (60%+) that no-human-involved AI R&D – an AI system powerful enough that it could plausibly autonomously build its own successor – happens by the end of 2028.

This is a big deal.

I don’t know how to wrap my head around it.

Это не случайная обмолвка и не маргинальное мнение. Вот, например, свежее эссе от Anthropic “When AI builds itself“, где компания прямым текстом пишет, что уже видит “ранние признаки” того, как AI-модели ускоряют разработку самого AI. К этому эссе и показанным там результатам мы ещё вернёмся.

Сегодня мы поговорим о том, где мы сейчас на этом пути к RSI (recursive self-improvement). Самое время об этом поговорить в те дни, когда Claude Fable стал доступен широкой публике (я сам тоже пробую и восхищаюсь).

И чтобы придать этому рассказу структуру, давайте вспомним сценарий, нашумевший прошлой весной: AI 2027, сделанный как специалистами по AI, так и специалистами по прогнозированию, и не побоявшийся поставить конкретные даты.

AI 2027 — это месяц за месяцем расписанный сценарий с датированными вехами, числами на бенчмарках, оценками выручки и компьюта. Вот главный график, но если вы не читали сам прогноз, почитайте, я подожду, он того стоит:

Сейчас прошёл уже год с лишним с момента публикации AI 2027. Давайте проверим, насколько предсказания сбылись.

Есть канонический способ это сделать: сайт ai2027tracker.com, где энтузиасты сверяют предсказания сценария с реальностью. Вот вам tl;dr для всего трекера:

Но нам, конечно, интересны не сами загоревшиеся зелёным или красным лампочки, а то, что за ними стоит: почему одни прогнозы сбылись, а другие нет, что это говорит о текущей динамике AI-исследований и, главное, — приближает ли всё это нас к тому самому моменту, когда LLM-агенты замкнут петлю и уйдут в сингулярность.

Так что давайте разбираться.

AI 2027 чуть подробнее

Сценарий AI 2027 был опубликован 3 апреля 2025 года командой AI Futures Project: Даниэль Кокотайло, Скотт Александер (лучший блогер на свете; сейчас он ведёт AstralCodexTen, но если вы не читали, начните с лучших постов SlateStarCodex), Томас Ларсен, Эли Лифланд и Ромео Дин.

Главное имя здесь — Кокотайло: он ушёл из OpenAI в 2024 году, демонстративно отказавшись подписывать соглашение, которое лишило бы его права критиковать компанию. А ещё в августе 2021 года, до выхода ChatGPT, он написал эссе “What 2026 Looks Like“, в котором с пугающей точностью описал переход от генераторов текста к chain-of-thought и дальше к агентам — примерно с теми сроками, которые и случились. Можете, конечно, считать это единичным успехом, который ничего не доказывает, но всё-таки Даниэль Кокотайло — это тот самый человек, который предсказал развитие AI в тот момент, когда почти никто другой таких прогнозов не делал.

Сам сценарий — это художественный, по сути, текст: вымышленная ведущая лаборатория OpenBrain, вымышленный китайский конкурент DeepCent, и расписанная по месяцам цепочка моделей-агентов от Agent-1 до Agent-5.

Общий сюжет таков. До определённого момента AI — это инструмент, и он помогает людям делать AI. Но в какой-то момент модель становится достаточно хороша в самих AI-исследованиях, чтобы значительную часть этой работы делать самостоятельно. И вот тогда включается петля обратной связи: AI ускоряет разработку AI, более быстрый ИИ ускоряет разработку ещё сильнее, и так далее.

AI 2027 выделяет здесь два ключевых порога:

  • superhuman coder (SC) — система, которая программирует лучше лучших людей и быстрее, и дешевле,
  • superhuman AI researcher (SAR), которая лучше людей уже в исследованиях целиком.

Между ними и за ними прогресс идёт всё быстрее, потому что его двигают сами модели; финал — переход к сверхинтеллекту (ASI) к концу 2027 года. А ещё в сценарии есть и динамика гонки между США и Китаем, и защита весов моделей от кражи, и проблемой согласования AI (AI alignment). В концовке сюжета есть развилка: гонка без ограничений ведёт к катастрофе, а сценарий “замедления” оставляет человечеству шанс.

Здесь сразу нужно сделать важную оговорку, которую в пересказах обычно теряют. Число “2027” в названии — это не медианный прогноз авторов, а скорее его мода, самый вероятный отдельно взятый год по одной конкретной модели (подробно об этом написано здесь). После публикации авторы несколько раз сдвигали сроки: в 2025-м они решили, что поторопились, и отодвинули прогноз примерно на полтора года вперёд, в конце 2025-го добавили оговорку, что медианы авторов лежат где-то в диапазоне 2028–2035 годов.

А согласно январскому разбору самих авторов медианный прогноз достижения superintelligence (полный ASI, не superhuman researcher) у Кокотайло был в 2031-м, а у Лифланда — в середине 2030-х:

Так что AI 2027, конечно, не надо воспринимать как “мы утверждаем, что сингулярность случится в 2027-м”. Но для такого события, честно говоря, пара лет не так уж важна, речь идёт о том, что superintelligence, а за ним и сингулярность произойдёт при нашей с вами жизни, в очень обозримом будущем.

Табель успеваемости: две ретроспективы

К годовщине сценария появились две независимые ретроспективы, и хорошо, что именно две — потому что они смотрят с разных сторон и при этом приходят к похожему выводу.

Первая — авторская. 12 февраля 2026 года Кокотайло и Лифланд опубликовали «Grading AI 2027’s 2025 Predictions», где сами выставили себе оценки за 2025 год. После предыдущего раздела вы могли подумать, что это очередной прогноз из разряда “вот-вот, но не сейчас, и всегда так будет”, но обратите внимание на подзаголовок:

По их оценкам, количественные метрики в среднем шли примерно на 65% от темпа, который закладывал сценарий. И прогресс на SWE-bench Verified, и прирост от AI в самих AI-исследованиях шли медленнее ожидаемого.

Но большинство качественных предсказаний действительно сбылись, годовая выручка OpenAI дошла до прогнозных $18 млрд и даже немного больше, и метрика временного горизонта METR (про неё подробно ниже) шла практически точно по расписанию. Качественно сбылось главное: агенты действительно появились, coding agents стали реальным рабочим инструментом. Так что в итоге авторы сдвинули свой прогноз полной автоматизации программирования на диапазон “середина 2028 — середина 2030”.

Вторая ретроспектива — тот самый трекер ai2027tracker.com. Здесь из сценария вычленили 53 конкретных предсказания и каждому присвоили один из шести статусов. Картина на лето 2026 года выглядит так:

В целом, обе ретроспективы согласны, что реальность идёт со скоростью около двух третей от сценария или чуть больше. Но любопытно, что уверенно сбывается именно качественная структура прогноза — агентизация, переход к моделям-работникам, инвестиционный бум, отставание регулирования. А отстают числа на бенчмарках, которых как раз обычно ждёшь раньше, чем качественных сдвигов.

Одно из предсказаний, кстати, сбылось с большим опережением графика, и довольно тревожным образом. Вот что говорит AI 2027 о модели “Agent-2”, которая по прогнозу должна была появиться в начале 2027 года:

OpenBrain presents Agent-2 to the government, including the National Security Council (NSC), the Department of Defense (DOD), and the U.S. AI Safety Institute (AISI). OpenBrain wants to maintain a good relationship with the executive branch, because it is basically the only actor that can stop them now, and if they don’t keep it informed it might find out anyway and be displeased.48

Officials are most interested in its cyberwarfare capabilities: Agent-2 is “only” a little worse than the best human hackers, but thousands of copies can be run in parallel, searching for and exploiting weaknesses faster than defenders can respond. The Department of Defense considers this a critical advantage in cyberwarfare, and AI moves from #5 on the administration’s priority list to #2.49 Someone mentions the possibility of nationalizing OpenBrain, but other cabinet officials think that’s premature. A staffer drafts a memo that presents the President with his options, ranging from business-as-usual to full nationalization. The President defers to his advisors, tech industry leaders who argue that nationalization would “kill the goose that lays the golden eggs.” He elects to hold off on major action for now and just adds additional security requirements to the OpenBrain-DOD contract.

Как все мы знаем, в реальности практически всё это уже произошло, с большим запасом по времени! В рамках проекта Glasswing Anthropic использовала свою фронтирную модель Claude Mythos Preview на многих open source проектах, и та полностью автономно, без участия человека, нашла кучу критических уязвимостей. Об этом много писали, сейчас не об этом, тем более что я совсем не специалист по кибербезопасности.

Так что вот несколько основных предсказаний и то, как они сбываются:

  • Кодовые агенты приносят реальную пользу к середине 2025” — это безусловно уже давно так, но, наверное, всё-таки реально агенты начали набирать широкую популярность в самом конце 2025, а не в середине;
  • 85% на SWE-bench Verified к середине 2025” — такие цифры оказались слишком оптимистичными; впрочем, AI 2027 не про циферки, вот эту, например, я нашёл где-то в глубине сноски под номером 10;
  • Массивные инвестиции в инфраструктуру в 2025–2026” — ну тут без вопросов, движемся к триллиону долларов, Stargate жужжит, всё такое;
  • Автономный поиск 0-day у Agent-2 в начале 2027” — это сбылось даже быстрее, чем прогнозировали;
  • Безопасность и регулирование отстают от возможностей” — и это, кажется, несомненный факт; Mythos немного пробудил американскую администрацию, давеча какой-то вот ещё executive order появился, но пока это всё очень мягко и реактивно, а не проактивно; но это отдельная тема, как-нибудь поговорим и о ней.

Самые интересные для нас сегодня прогнозы — это “Superhuman coder в 2027” и “Переход к ASI к концу 2027 через autoresearch“. Оценивать их пока рано, но давайте обсудим, где мы сейчас.

Горизонт автономности: главный график про агентов

Чтобы говорить о темпе всерьёз, нужна метрика. Но классические бенчмарки тут плохо работают: они насыщаются (модели упираются в 100% и метрика перестаёт что-либо различать) и, что важнее, “90% на бенчмарке X” обычно довольно мало говорит о том, что модель на самом деле может сделать полезного.

Организация METR (Model Evaluation and Threat Research) предложила метрику, которая давно уже стала самым главным графиком во всей этой дискуссии. Возьмём набор задач — у METR это около 230 задач по программированию, ML-инженерии и кибербезопасности — и для каждой замерим, сколько времени на неё тратит человек-эксперт. Определим временной горизонт (time horizon) модели как человеческую длительность выполнения задач, с которыми модель успешно справляется с вероятностью 50%.

Метрика хороша тем, что она измеряется в естественных единицах — в человеко-времени, а не в процентах на каком-то конкретном тесте. И данные METR, разумеется, показывают уверенную экспоненту:

Формально говоря,

    \[T(t) = T_0 \cdot 2^{(t - t_0)/\tau},\]

где \tau — время удвоения. В исходной работе METR (март 2025-го) на горизонте 2019–2025 годов оно составляло около 7 месяцев.

В январе 2026-го METR выпустила обновление Time Horizon 1.1 (на графиках здесь уже оно): набор расширили со 170 до 228 задач (вдвое увеличив долю задач длиннее восьми часов) — и пересчитанные цифры получились такими: удвоение раз в 6,5 месяца на всём периоде, раз в ≈4,3 месяца после 2023-го и раз в ≈3 месяца с 2024 года. То есть график на самом деле даже суперэкспоненциальный, хотя до 2023-го, конечно, подсчёт секунд имел не так уж много смысла.

В абсолютных цифрах у Claude Opus 4.6 в феврале 2026-го был потолок около 12 часов, а та самая Mythos Preview упёрлась в потолок надёжного измерения — в бенчмарке METR нет таких задач, да и сложно на таком горизонте уже оценивать человеческое время.

Когда я начал показывать этот график в своих презентациях год назад, я говорил примерно так: в этом графике не так много осталось удвоений. Человек не может работать 16 или даже 8 часов подряд с полным погружением, он тоже уходит спать и отдыхать, чем по сути перезагружает контекст.

Мне по-прежнему так кажется, но, как видите, до рабочего дня удвоение вообще не замедлилось, и кажется, что горизонт и дальше будет удваиваться ещё какое-то время. AI-система, способная на автономное решение недельных и месячных задач — это уже почти буквальное определение “superhuman coder”.

Разумеется, здесь не обойдётся без важной оговорки. Многочасовые результаты касаются вероятности успеха в 50%. “Справляется в половине случаев с часовой задачей” — это очень круто, но это всё ещё не автономная система, а просто очень хороший помощник, результаты которого надо внимательно проверять.

У METR есть и график про вероятность 80%, и он выглядит точно так же, отставая на 2-3 удвоения, то бишь на полгода-год:

Но, конечно, было бы интересно увидеть и график про вероятность 99%, и график про вероятность, соответствующую вероятности успеха у живого человека. Какова она, кстати говоря? Лично я понятия не имею, с какой вероятностью профессиональный программист успешно завершит задачу, на которую у него в среднем должен уйти день; да и что значит “успешно завершит”, тоже ещё надо хорошо определить.

Проблема надёжности: от бенчмарка к реальной работе

У METR есть и негативные результаты. В июле 2025 года они провели рандомизированный контролируемый эксперимент: взяли опытных мейнтейнеров open-source-проектов и дали им решать задачи в их собственных репозиториях — половину с разрешением использовать AI-инструменты, половину без. В результате с AI разработчики потратили на 19% больше времени. Не меньше — больше; и, что особенно показательно, даже постфактум участники были уверены, что AI их ускорил.

Этот эксперимент до сих пор иногда цитируют как свидетельство того, что “AI бесполезен”. Но даже если не вчитываться в контекст, ясно, что речь об “AI середины 2025 года”. А с тех пор год прошёл.

В феврале 2026 года METR вернулась к тому же эксперименту: 57 разработчиков снова решали задачи в своих репозиториях, половину с AI, половину без. Числа показывают, что в начале 2026-го люди субъективно ускорялись от ИИ заметно сильнее, чем год назад, а замедление почти пропало:

Но самое забавное в этой работе в том, что широкое внедрение AI-помощников мешает самой возможности провести такое исследование. Тех, кому AI помогает сильнее всего, всё труднее заманить в эксперимент — растёт доля разработчиков, которые “не согласились бы делать и половину своей работы без AI”. И даже более того, от 30% до 50% участников признались, что не брали часть задач в эксперименте именно потому, что не хотели делать их без AI. То есть из выборки систематически вымываются ровно те задачи, где выигрыш от ИИ максимален.

Поэтому METR честно называет собственную оценку “ненадёжным сигналом” и в лучшем случае нижней границей истинного эффекта.

В другом исследовании METR (март 2026) взяли пулреквесты, сгенерированные AI, которые проходят тесты SWE-bench Verified, и дали их на ревью настоящим мейнтейнерам. Оказалось, что около половины таких PR мейнтейнеры не приняли бы:

Иначе говоря, между “проходит тесты” и реальным инженерным вкладом тоже есть зазор, который пока не преодолён.

В целом здесь понятная и простая арифметика: если агенту нужно выполнить задачу из n последовательных шагов, и каждый шаг удаётся независимо с некоторой вероятностью, то вся задача удаётся с вероятностью p^n, то есть экспоненциально маленькой:

Например, свежий бенчмарк APEX-Agents от Mercor (480 задач из жизни инвестбанкиров, консультантов и юристов) показал, что лучшие модели доводят до конца с первой попытки около 23–24% задач (GPT-5.2 — 23%, Gemini 3 Flash — 24%); даже за восемь попыток лучший результат составляет около 40%.

А февральская работа про “отклонение от канонического пути” (Canonical Path Deviation, Lee, 2026) показывает, что один ошибочный вызов инструмента повышает вероятность того, что и следующий вызов окажется ошибочным, на ~22,7 процентного пункта. Ошибки не просто перемножаются, но ещё и коррелируют.

Так что кривая горизонта METR выглядит очень перспективно, но пока не является состоявшимся доказательством или тем более признаком того, что сингулярность уже пришла. Есть ещё довольно большой разрыв с реальностью. Он, безусловно, будет скоро преодолён, если нынешние экспоненты продолжатся, но это ещё не произошло и не гарантировано.

Автономия и autoresearch: бенчмарки

Теперь центральный лично для меня вопрос: насколько мы близки к авторесёрчу — к тому, чтобы AI-модели сами вели исследования, в первую очередь исследования самого AI?

В этом разделе давайте пройдёмся по бенчмаркам. Я уже много раз оговаривался, что бенчмарки не обязательно на 100% соответствуют реальности, но всё-таки люди стараются делать так, чтобы что-то они да показывали.

Самая нижняя ступень — тот самый SWE-bench Verified: реальные GitHub issues, которые надо починить так, чтобы они прошли (спрятанные) тесты. Год назад это был главный экзамен кодовых агентов, а сегодня он, по сути, сдан.  На официальном лидерборде верхушка держится около 76%:

Но сами лаборатории в system cards свежих моделей заявляют результаты выше 80%, а где-то уже появляются и 90–95% (хотя это больше похоже на маркетинг).

Хуже того, в феврале 2026-го сама OpenAI перестала использовать SWE-bench Verified: их аудит 138 самых трудных задач (тех, что o3 не решала стабильно даже за 64 попытки) показал, что у более половины из них просто сломаны тесты — они отвергают функционально правильные решения. Плюс нашлись следы того, что решения утекли в обучающие данные всех ведущих моделей. Так что можно считать, что этот бенчмарк закончился.

Есть более сложные версии: SWE-bench Pro со стандартизированной обвязкой, где те же модели проседают на десятки пунктов, и SWE-rebench, который постоянно подмешивает свежие issues, чтобы бороться с протечкой задач в обучающие данные. Но в целом кажется, что “починить размеченный баг” — это уже пройденный этап.

Ступенью выше — MLE-bench от OpenAI: 75 настоящих соревнований с Kaggle, где агент проходит весь цикл ML-инженера (подготовить данные, обучить модель, поитерироваться), а оценивают его по человеческой шкале медалей Kaggle. Здесь за полтора года тоже изменилось примерно всё: в исходной статье 2024 года лучшая модель брала медаль примерно в 17% соревнований, а на сегодняшнем лидерборде топовые агенты получают медаль уже в районе 62-64% задач. Сейчас “AI-агент как крепкий ML-инженер” становится реальностью.

Ещё выше — RE-Bench от METR: семь открытых задач именно исследовательской инженерии, с прямым сравнением против десятков людей-экспертов.

Самым показательным результатом исходной работы была не абсолютная цифра, а форма кривой: при бюджете в 2 часа агенты легко обыгрывали экспертов (агенты быстрее, дешевле, отлично параллелятся), но при бюджете в 8 или 32 часа люди уверенно выходили вперёд — на долгий автономный research агентов в 2024 году не хватало.

Но к 2026-му фронтирные модели подросли так, что эта ступень — как и весь R&D-арсенал METR — во многом насытилась: Opus 4.6 успешно тянет больше 80% задач из набора METR, и точку пересечения, где люди ещё держались, приходится искать на всё более длинных горизонтах (отсюда и MirrorCode с задачами на недели). Грубо говоря, спринт агенты уже выиграли, и спор сместился к марафонским дистанциям.

Предпоследняя ступень — PaperBench, тоже от OpenAI (Starace et al., 2025): воспроизвести с нуля 20 статей с ICML 2024 (тысячи проверяемых подзадач) — понять вклад работы, написать кодовую базу, прогнать эксперименты, получить те же числа.

Здесь год назад результаты были в районе 20%, а лидерборда как такового нет; интересно, как бы сейчас справился Claude Mythos, конечно.

И, наконец, верхняя ступень — AutoResearchBench (апрель 2026), где надо не воспроизвести одну статью, а сориентироваться в литературе: выследить нужную работу многошаговым поиском на всём arXiv (где статей миллионы) или собрать все статьи, удовлетворяющие условию.

Это очень близко к реальному труду исследователя, и здесь пока модели, уже хорошо справляющиеся с обычным сёрфингом вроде BrowseComp, проваливаются: фронтир держится на уровне около 9%.

Это не все бенчмарки, конечно же, но довольно репрезентативный их срез.

В общем, процесс идёт: бенчмарки насыщаются, люди придумывают новые бенчмарки. А вывод пока что звучит так: на самых реалистичных открытых задачах люди всё ещё нужны. Autoresearch как “готовая автономная научная рабочая сила” пока ещё не наступил, хотя первые шаги уже сделаны. Об этом дальше.

Автономия и autoresearch: позитивные результаты

Но, чёрт возьми, наступает! В тех областях, где можно построить быстрый и честный автоматический верификатор, агентные системы уже делают настоящие открытия.

За последний месяц оно засияло особенно ярко. 20 мая 2026 года OpenAI объявила, что её внутренняя рассуждающая модель опровергла гипотезу Эрдёша о единичных расстояниях — задачу, которой почти восемьдесят лет и о которой ведущие математики мира действительно много думали. Об этом я подробно писал совсем недавно, повторяться не буду.

Но это далеко не единичный случай. Вспомним хотя бы AlphaEvolve от DeepMind, которому уже почти год стукнул: связка LLM и эволюционного поиска, где модель предлагает изменения в коде, а верификатор гоняет их и отбирает лучшие. AlphaEvolve тогда улучшил расписание дата-центров Google, помог в проектировании схем, нашёл новые алгоритмы умножения матриц и, что особенно изящно, ускорил обучение той самой модели, на которой сам работает, придумав новые kernel optimizations. И математические результаты кое-какие продвинулись:

Про AI Co-Scientist от Google я рассказываю в каждом докладе, но вот появился и AI Co-Mathematician от всё той же DeepMind (Zheng et al., май 2026). В самой структуре нет вообще ничего интересного:

Но он набрал 48% на FrontierMath Tier 4 — новый рекорд.

Правда, тут же оговорюсь: недавно Epoch сообщила, что…

В общем, даже лучшие бенчмарки оказываются не без греха.

Или вот ещё пример: апрельская заметка METR про NanoGPT. NanoGPT — это один из моих любимых примеров о том, как движется алгоритмический прогресс: за два года обучение маленькой GPT удалось ускорить с 45 минут до примерно полутора, в 30 раз (на одном и том же железе, естественно).

Так вот, Маниш Шетти из METR разложил этот выигрыш на компоненты: импортированные идеи (взятые из чужих работ) дали 6,7×, адаптированные — 3,0×, а изобретённые с нуля — лишь 1,6×. А вклад собственно AI-агентов в рекорды (уже было четыре авто-улучшения) оказался неглубоким и сводился обычно к импорту/адаптации. Но, кстати, в общей картине много маленьких идей ничем не хуже одной большой:

Многие результаты выглядят так, как будто успехи пока ограниченные, люди-учёные работу в ближайшем будущем не потеряют, и вообще прогресс выглядит “обычным”, а не “революционно-сингулярным”.

Но… вы сами-то пробовали? Пробовали как следует погонять Claude Code с Opus 4.8 Max (или только что вышедшим Fable) и GPT-5.5 Pro на своих исследовательских задачах?

Да-да, я вам только что с цифрами в руках рассказывал, что субъективным ощущениям верить нельзя. Но всё-таки я пробовал, вложил персты и уверовал. Да, конечно, модели и основанные на них агенты пока ещё могут ошибаться, и ошибаются довольно часто. Да, конечно, пока нельзя попросить доказать гипотезу Римана, подождать неделю и получить доказательство.

Но степень автономности и уровень интеллекта систем, доступных даже обычным пользователям прямо сейчас, поразительны. И ошибки, которые они делают, они же (или другие модели) часто могут заметить и исправить. А разницу между “надо проверять” и “надо придумывать” не нужно объяснять никому, кто слышал про P и NP…

Инфраструктура и сроки

Есть и часть AI 2027, которая сбывается без всяких скидок и местами даже с опережением: инфраструктура.

По данным Epoch AI, вычислительные мощности на обучение фронтирных моделей растут примерно в 5 раз в год начиная с 2020-го, а долларовая стоимость одного фронтирного запуска удваивается примерно раз в 7 месяцев:

В Стэнфорде подсчитали, что частные инвестиции в AI достигли в 2025 году сотен миллиардов долларов, хотя по странам пока всё очень неравномерно:

Тот же Epoch AI публикует график стоимости и мощности ведущих датацентров; прямо сейчас рекорд держит Anthropic-Amazon New Carlisle мощностью 1.1 ГВт, который стоил $35 млрд, но Fairwater Wisconsin будет в три раза мощнее электрически и в восемь раз по компьюту:

Отдельная история — Stargate. Проект анонсировали в январе 2025 года: $500 млрд и около 10 ГВт мощностей за четыре года, к 2029-му. 10 ГВт — это суммарная мощность всей программы на семь площадок к концу десятилетия, так что на графике выше их нет. Но на середину 2026-го у Stargate уже законтрактовано около 7 ГВт планируемой мощности, и OpenAI обещает выйти на полные 10 ГВт с опережением графика.

Параллельно во втором полугодии 2026-го нас ждут GPU нового поколения NVIDIA Vera Rubin и старт серийного выпуска собственного ускорителя OpenAI — XPU от Broadcom на 3-нм TSMC.

В общем, гонка мощностей идёт скорее с опережением, а полтриллиона вложенных долларов — это мощный стимул найти чем занять все эти датацентры. Кажется, что компьют ограничителем для сингулярности стать не должен.

Но здесь, конечно, есть и обратная сторона. Для экспериментов в ML нужны не только идеи, но и те самые вычисления. Можно сколько угодно ускорять и улучшать генерацию идей, но если для достижения RSI каждую хорошую идею нужно будет проверять обучением LLM реального фронтирного размера, узким местом станет не интеллект, а компьют, сколько ты старгейтов ни запускай. Об этом см., например, работу “Will Compute Bottlenecks Prevent an Intelligence Explosion?“.

Запустят ли LLM-агенты сингулярность?

Вот мы и подошли к главному вопросу. Запустят ли LLM-агенты то самое рекурсивное улучшение, которое отправит нас в сингулярность? Формально для этого нужно, чтобы показатель экспоненты на графиках увеличивался со временем, а время между удвоениями уменьшалось.

Мне очень нравится вот эта картинка на этот счёт, ответ на неосторожное высказывание Гэри Маркуса:

Кстати, как видите, картинка уже довольно старая, а экспоненты с тех пор не замедляются, а скорее наоборот.

Но экспоненты — это не так важно, здесь же нет никаких законов природы. Важно, что AI должен стать достаточно хорош в AI-исследованиях, чтобы исследовательская петля замкнулась сама на себя. Похоже ли на то, что так будет?

Мне кажется, что да.

Кажется, что первые обороты этой петли уже проворачиваются на наших глазах, и лучший документ об этом — то самое эссе Anthropic “When AI builds itself“, с которого я начал. Вот смотрите, что происходит на фронтире.

Claude к маю 2026 года пишет более 80% нового кода, в Anthropic (год назад были считанные проценты):

Причём Claude Code (которым разработчики, разумеется, в основном и пользуются) стабильно улучшается со временем. “Session success” ниже — это прокси-метрика, оцениваемая по тому, насколько нужно было что-то править после запроса к Claude Code:

В Anthropic есть внутренний тест: оптимизация обучающего кода для ML-модели. Год назад Claude Opus 4 мог добиться где-то 3× ускорения по сравнению с бейзлайном. Сейчас Claude Mythos Preview даёт примерно 52× (профессионал-человек, по оценкам Anthropic, за рабочий день может сделать примерно 4×). Как пишут в посте, за год “Claude has gone from super helpful to superhuman”…

Вот вам ещё пара цитат из Anthropic, под каждой могу подписаться и лично:

OpenAI, кстати, тоже в какой-то момент расписала дорожную карту и движется к “AI research interns” в 2026 году и полноценным автоматическим AI-исследователям в 2028-м.

Но есть и другая сторона: то же самое эссе Anthropic заканчивается тем, что RSI совершенно не предопределено. Могут найтись новые узкие места. Например, когда порождение кода перестало быть bottleneck’ом им стало человеческое ревью. В исследованиях это сейчас тот самый пресловутый “вкус”, research taste, и общая стратегия того, куда идти.

Чего именно не хватает

Другие исследователи более конкретно перечисляют, чего пока не хватает до настоящих AI-исследователей. Например, Андрей Карпатый в разговоре с Дваркешем Пателем (октябрь 2025-го) сказал, что “до AGI ещё десятилетие”, и это будет “десятилетие агентов”, а не “год агентов». По Карпатому, не хватает continual learning и мультимодальности.

Лично мне кажется, что пока нет удовлетворительных ответов на следующие вопросы.

Память и непрерывное обучение. Агент, который не умеет надёжно учиться на собственном опыте, не может накапливать экспертизу так, как накапливает её живой исследователь за годы. Я недавно разбирал состояние дел с памятью LLM-агентов в отдельном большом обзоре, и сам факт, что память — это всё ещё передний край исследований, а не чисто инженерная задача, тут говорит сам за себя.

Надёжность на длинном горизонте. Та самая арифметика накопления ошибок. Совершенно не очевидно, что это лечится дальнейшим масштабированием. Хотя, конечно, может и излечиться, делать ставки против масштабирования нас история deep learning давно отучила.

Эффективность по данным (sample efficiency). Человек становится настоящим исследователем на исчезающе малой доле тех данных, которые видела модель; а RL на настоящем исследовательском процессе (а не решении школьных задачек) вряд ли получится запустить.

Вкус и постановка задачи. Умение понять, какой вопрос важен. Ни один бенчмарк этого не меряет, ведь в бенчмарке задача уже выбрана за тебя. Изобретение новых идей пока ещё почти целиком на людях… Хотя, наверное, надо уточнить: изобретать идеи современные модели уже умеют неплохо, но люди пока ещё должны выбирать из изобретённого.

Модель мира и заземление. У агентов до сих пор нет надёжной, обновляемой модели тех систем, в которых они действуют. Это большая отдельная тема, о которой я надеюсь поговорить как-нибудь в будущем.

Конечно, ни один из этих пунктов не является непреодолимой стеной; но и ни один из них пока никаким очевидным образом не решился. А сильная форма AI 2027 тихо предполагает, что все они падут по графику и практически одновременно.

Заключение

Я, конечно, не буду называть никаких дат. Я даже не буду пытаться определить, что такое “настоящее RSI” или “настоящий автономный AI-исследователь”. Но кое-что сказать могу.

Почти наверняка кодовые и исследовательские агенты станут рутинными, постоянными участниками разработки, прогона экспериментов, обзора литературы, части ML-инженерии, доказательства теорем… Это, по сути, уже происходит.

Скорее всего агенты заметно ускоряют фронтирные AI-исследования внутри лабораторий прямо сейчас и будут ускорять ещё сильнее — пока как управляемые команды агентов под руководством людей-экспертов, а не как автономные учёные.

Скорее всего, настоящий “superhuman coder” в смысле AI 2027 действительно появится к 2027–2028 году. Возможно, он будет более узким и более специализированным, чем предполагали авторы этого сценария, но думаю, что он будет.

Но, скорее всего, всё-таки не будет перехода к RSI и вслед за ним ASI к концу 2027 года через замкнувшийся цикл autoresearch. Это не то чтобы невозможно, но кажется, что мы всё-таки находимся в более медленном таймлайне.

Но не устаю напоминать: “не так скоро” не значит “никогда” и даже не значит “не скоро”! У людей короткая память: стоит AI-системе доказать новую теорему, как они тут же скажут, что “теорема была несложная” или “уникально подходящая для AI-доказательства”…

Так что каждый раз, когда я рассказываю о недавних успехах AI, стараюсь подчеркнуть, насколько это гигантский прогресс за кратчайшее, ничтожное время. Вот моя стандартная картинка о том, что LLM могли в математике четыре года назад и что могут сейчас:

В общем, AI 2027 был отличным прогнозом; учитывая, насколько подробно он предсказывал будущее, процент совпадения с реальностью просто запредельный. Я писал выше, что его качественные прогнозы — агентизация, переход к моделям-работникам, инвестиционный взрыв, отставание регулирования, превращение проблемы безопасности из философии в эмпирику — все по сути сбываются. Только количественные вехи немного отстают.

Рекурсивная петля AI-исследований начинает раскручиваться: Claude пишет 80% кода в Anthropic, AlphaEvolve ускоряет собственное обучение, новая версия GPT опровергает гипотезу Эрдёша. Но всё-таки до настоящей сингулярности ещё есть некоторый зазор, в который должны поместиться ответы на несколько важных вопросов.

Пока ставки против прогресса AI никогда не работают, разве что против конкретных оптимистичных прогнозов. Поживём — увидим; смотреть будем на графики METR и autoresearch-бенчмарки, но главное, на что я буду смотреть — на свой собственный опыт и на то, как быстро будет двигаться AI-assisted наука. Смотреть и вам рассказывать.

Сергей Николенко

P.S. Прокомментировать и обсудить пост можно в канале «Sineкура»: присоединяйтесь!