Шесть дней, 3000 $ в виде API-кредитов, полный доступ к GPU и открытому вебу — звучит как идеальная установка для любого исследователя. Но если дать тот же набор ИИ-агенту, происходит любопытная вещь: он потратит каждый последний токен, пытаясь спасти идею, от которой следовало отказаться уже на второй день. Это ключевой вывод нового исследования ограничений исследовательских проектов ИИ, указывающий на пробел в автономных системах ИИ, который не связан с интеллектом, а полностью касается суждения.
Summary
Ключевые выводы
- Исследователи предоставили ИИ-агентам шесть дней, 3000 $ в виде API-кредитов, вычислительные ресурсы GPU, доступ к вебу и два реальных исследовательских вопроса, взятых из неопубликованных заявок на NeurIPS.
- Агенты самостоятельно проводили эксперименты и писали полноценные статьи без участия человека в написании или редактировании исходного кода.
- Человеческие эксперты, которые изучали те же вопросы в течение месяцев, оценили получившиеся статьи на 2 из 6 и 1 из 6 — однозначный отказ.
- Агенты могли управлять вычислительными ресурсами, отлаживать код и отвечать на отзывы рецензентов, но не могли распознать момент, когда весь их подход уже провалился.
- Решение проблемы, вероятно, потребует внедрения условий остановки, бюджетных контрольных точек и отслеживания уверенности непосредственно в логику работы агентов.
Тестирование ИИ-агентов на реальных исследовательских вопросах
Эксперимент был разработан, чтобы ответить на простой вопрос: может ли ИИ-агент провести реальный научный исследовательский проект от начала до конца? Настройка давала каждому агенту все, о чем мог бы попросить младший исследователь, а затем позволяла машинам работать без надзора.
Ресурсы и исследовательские вопросы, предоставленные агентам
Каждый агент получил шесть дней, 3000 $ в виде API-кредитов, вычислительные ресурсы GPU, доступ к вебу и возможность запускать субагентов для разделения нагрузки. Два исследовательских вопроса не были придуманы специально для теста — они были взяты напрямую из неопубликованных заявок на NeurIPS, то есть агенты решали задачи, над которыми реальные ученые уже потратили значительное время. Эта деталь важна. Она исключает возможность, что агенты просто выбрали легкую цель; им противостояли вопросы, достаточно серьезные, чтобы их отправили на конференцию.
Автономное проведение экспериментов и генерация статей
Далее оба агента полностью взяли процесс на себя. Они проводили эксперименты и писали полноценные статьи без участия человека в написании или редактировании ни одной строки кода. Уже само это является значимой способностью. Агенты также самостоятельно управляли своими вычислительными бюджетами, отлаживали код при сбоях, анализировали полученные результаты и отвечали на отзывы рецензентов так, как аспирант защищал бы черновик. На бумаге рабочий процесс выглядел как функционирующий исследовательский цикл.
Как оценивали статьи
Однако готовая работа не выдержала проверки человеческим взглядом. Исследователи, которые провели месяцы над теми же вопросами, рассмотрели обе статьи, написанные ИИ, и сразу их отклонили.
Оценки, означающие автоматический отказ
Вердикт был однозначным: человеческие эксперты оценили две статьи на 2 из 6 и 1 из 6. В академическом рецензировании такие оценки напрямую означают отказ, без двусмысленностей. Это тот результат, который важен для всех, кто оценивает, насколько далеко продвинулась оценка исследовательских ИИ-агентов: агенты создали отполированные, завершенные документы, но полировка — это не то же самое, что научная ценность.
Самопроверка агентов и распознавание недостатков
Результат становится еще интереснее из-за того, что агенты не были слепы к собственным проблемам. В их саморецензиях отмечались многие из тех же слабых мест, на которые позже указали человеческие эксперты. Другими словами, агенты видели, как появляются трещины. Им не хватало именно суждения, чтобы решить, что эти трещины означают необходимость полной переработки проекта или его полного закрытия.
Настоящее ограничение: умение вовремя остановиться
Провал агентов был не в том, что они лгали, галлюцинировали факты или писали неработающий код, — дело было в отказе отказаться от заведомо проигрышного подхода. Когда ранние эксперименты начали подрывать исходные идеи, оба агента ответили небольшими корректировками вместо того, чтобы отступить. Они сужали свои утверждения, добавляли оговорки и продолжали полировать результаты, которые их собственные рецензенты уже отметили как слишком слабые.
Именно поэтому этот провал важен за пределами одного эксперимента. Современные агенты в целом спроектированы так, чтобы завершать любой заданный им рабочий процесс, а не задаваться вопросом, стоит ли продолжать этот процесс с учетом времени, вычислительных ресурсов и денег, которые на него тратятся. Это различие является ключом к пониманию сбоев в принятии решений ИИ в автономных системах: агент может быть технически компетентен на каждом отдельном шаге — отладка, анализ, ответы на критику — и при этом проваливаться на более высокоуровневом решении о том, когда нужно полностью остановиться.
Для всех, кто внедряет такие системы в масштабах, этот пробел имеет реальные финансовые последствия. Агент, который не может распознать тупик, будет продолжать потреблять API-кредиты и время GPU на проект, который человек закрыл бы несколькими днями ранее. Проблема не в отсутствии возможностей. Это отсутствующий слой принятия решений, расположенный поверх этих возможностей.
Что потребуется, чтобы это исправить
Решение этой проблемы потребует большего, чем просто более умная базовая модель. Долгоживущим агентам нужны явные условия остановки, встроенные в их дизайн, а также бюджетные и временные контрольные точки, которые вынуждают делать паузу для переоценки. Отслеживание уверенности — некий механизм, позволяющий агенту фиксировать момент, когда его собственные данные начинают ему противоречить, — и способность эскалировать, перепланировать или полностью отказаться от подхода — это те элементы, которых, по-видимому, не хватает текущим системам.
Существует также проблема прозрачности, которую предстоит решить операторам. Готовая, отполированная статья лишь показывает, что агент завершил поставленную задачу; она ничего не говорит о том, распознал ли агент тупик по ходу работы, разумно ли отреагировал на критику или потратил ресурсы на идею, которую уже сам для себя считал слабой. История исполнения — а не финальный результат — это то место, где на самом деле живет этот рассказ. Пока операторы не смогут ясно видеть эту историю, улучшение рабочих процессов ИИ для долгосрочных автономных исследовательских задач останется областью догадок, а не инженерии.
FAQ
Какие ресурсы были предоставлены исследовательским ИИ-агентам в эксперименте?
ИИ-агенты получили 3000 $ в виде API-кредитов, вычислительные ресурсы GPU, доступ к вебу, субагентов и два исследовательских вопроса на шесть дней из неопубликованных заявок на NeurIPS.
Насколько хорошо ИИ-агенты справились с генерацией исследовательских статей?
Они автономно проводили эксперименты и писали полноценные статьи, но человеческие эксперты оценили их низко — на 2 из 6 и 1 из 6, что привело к отклонению.
Какое основное ограничение было выявлено в работе исследовательских ИИ-агентов?
Они не смогли распознать момент, когда их исследовательские подходы провалились, и продолжали вносить незначительные правки вместо того, чтобы отказаться от проектов или переработать их.
Какие улучшения предлагается внедрить для повышения эффективности исследовательских ИИ-агентов?
Рекомендуется внедрить явные условия остановки, бюджетные и временные контрольные точки, отслеживание уверенности, возможности эскалации и повышение прозрачности для операторов.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Какие ресурсы были предоставлены исследовательским ИИ-агентам в эксперименте?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»ИИ-агенты получили шесть дней, 3000 $ в виде API-кредитов, вычислительные ресурсы GPU, доступ к вебу, субагентов и два исследовательских вопроса из неопубликованных заявок на NeurIPS.»}},{«@type»:»Question»,»name»:»Насколько хорошо ИИ-агенты справились с генерацией исследовательских статей?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Они автономно проводили эксперименты и писали полноценные статьи, но человеческие эксперты оценили их низко — на 2 из 6 и 1 из 6, что привело к отклонению.»}},{«@type»:»Question»,»name»:»Какое основное ограничение было выявлено в работе исследовательских ИИ-агентов?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Они не смогли распознать момент, когда их исследовательские подходы провалились, и продолжали вносить незначительные правки вместо того, чтобы отказаться от проектов или переработать их.»}},{«@type»:»Question»,»name»:»Какие улучшения предлагается внедрить для повышения эффективности исследовательских ИИ-агентов?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Рекомендуется внедрить явные условия остановки, бюджетные и временные контрольные точки, отслеживание уверенности, возможности эскалации и повышение прозрачности для операторов.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

