Растущий массив научных текстов теперь оценивается, по крайней мере частично, с помощью искусственного интеллекта, и новое исследование показывает, что слова, которые выбирает исследователь, могут изменить вердикт ИИ-рецензента, даже если исходные данные остаются неизменными. Исследователи, изучавшие риторическое влияние на рецензирование ИИ, обнаружили, что именно подача, а не доказательства, может незаметно сдвигать оценки вверх или вниз в системах рецензирования с использованием больших языковых моделей, что порождает новые вопросы о том, насколько на самом деле надежны машинные судьи.
Проблема не является гипотетической. Рецензирование, существующая десятилетиями система, в которой исследователи оценивают работы друг друга перед публикацией, уже трещит по швам под наплывом рукописей. Недавний опрос журналов Frontiers, на который ссылается Ars Technica, показал, что более половины рецензентов уже полагаются на инструменты ИИ на каком-то этапе процесса рецензирования, часто просто чтобы справиться с объемом. Именно эта зависимость и делает вопрос риторической предвзятости в рецензировании ИИ столь острым: если машины уже выставляют оценки статьям, и одно лишь словоупотребление может сдвигать их баллы, ставки для научной справедливости быстро растут.
Именно этот разрыв команда под руководством Мин Ли поставила целью измерить. Их статья, поданная в августе 2026 года и основанная на заявках на ICLR 2026, отделяет риторику от содержания, чтобы увидеть, насколько именно подача может повлиять на оценку, основанную на ИИ, и результаты рисуют картину предвзятости, которая структурирована, неравномерна и в некоторых случаях удивительно предсказуема.
Summary
Ключевые выводы
- Одна лишь риторическая подача заметно смещала оценки рецензирования ИИ, хотя базовое научное содержание оставалось идентичным.
- Исследователи создали корпус из 4 200 полноформатных рукописей, полученных из 120 анонимизированных заявок на ICLR 2026, чтобы проверить этот эффект.
- Подача доказательств и позиционирование новизны вызывали самые большие колебания итоговых оценок, больше, чем любое другое риторическое измерение.
- Статьи с изначально более низкими оценками ИИ, как правило, повышали баллы после риторической переработки, тогда как статьи с более высокими исходными оценками, как правило, снижали их.
- Более строгий протокол рецензирования снизил средние оценки на 1,36 балла, но не привел к надежному снижению базовой риторической чувствительности.
Обзор исследования и методология
Исследовательская группа разработала контролируемый эксперимент, специально нацеленный на устранение всех переменных, кроме того, как сформулирован текст статьи, выделив риторическую чувствительность как единственное, что меняется между версиями одной и той же рукописи. Именно этот элемент дизайна придает результатам вес: любое различие в оценках между версиями рукописи можно отнести к подаче, а не к реальным различиям в науке.
Контролируемый корпус рукописей из заявок на ICLR 2026
Чтобы проверить это в чистом виде, исследователи создали корпус из 4 200 полноформатных рукописей, полученных из 120 анонимизированных заявок на ICLR 2026, одну из ключевых конференций в области машинного обучения. Каждая исходная статья была переписана в несколько риторических вариантов, что создало достаточно большой набор данных, чтобы выявить закономерности, которые невозможно было бы увидеть на примере нескольких работ.
Риторическая переработка и протоколы рецензирования ИИ
Два отдельных переписчика на основе больших языковых моделей изменяли шесть различных риторических измерений каждой рукописи, смещая каждое из них в противоположные стороны, например, более уверенная против более осторожной подачи, при этом не затрагивая описанное научное содержание. Пять разных рецензентов-LLM затем оценивали все получившиеся рукописи, сначала по стандартному протоколу рецензирования, а затем по более строгому, чтобы команда могла сравнить, как риторика проявляется в разных условиях оценки. В исследовании также тестировались совместные, рекурсивные и управляемые рецензентом проходы переписывания, чтобы выяснить, усиливает ли комбинирование стратегий эффект.
Влияние риторических выборов на оценки рецензирования ИИ
Главный вывод состоит в том, что риторическая чувствительность в рецензировании с использованием ИИ — это не случайный шум, она подчиняется четкой иерархии, при которой одни стилистические решения имеют гораздо большее значение, чем другие. Именно эта структура превращает явление из анекдотического курьеза в фактор, который оценщикам нужно сознательно учитывать в дизайне систем.
Ключевые риторические измерения: подача доказательств и позиционирование новизны
Среди шести протестированных риторических измерений подача доказательств и позиционирование новизны дали наибольший контраст между положительными и отрицательными итоговыми оценками. Подача охвата образовала более слабый второй уровень, тогда как остальные измерения показали меньшие и менее устойчивые эффекты. Иными словами, то, насколько уверенно статья заявляет о своей новизне или насколько напористо она представляет свои доказательства, может иметь для рецензента-ИИ большее значение, чем несколько других стилистических факторов вместе взятых.
Закономерности изменения оценок в зависимости от исходных баллов
Направление сдвига сильно зависело от того, с какого уровня начиналась рукопись. Статьи, которые изначально получали более низкие оценки ИИ, как правило, поднимались после риторической переработки, тогда как статьи, уже имевшие высокие баллы, склонны были снижаться. Наиболее отчетливые направленные контрасты, то есть самый резкий разрыв между положительно и отрицательно переписанной версией одной и той же статьи, проявлялись в среднем диапазоне оценок, где судьба рукописи, возможно, наиболее спорна.
Сложность и зависимость в рабочих процессах переписывания
Можно было бы предположить, что наслоение техник переписывания приведет к более крупным колебаниям оценок, но данные этого не подтвердили. Более сложные рабочие процессы, включая совместное, рекурсивное и управляемое рецензентом переписывание, не давали надежно больших выигрышей по сравнению с более простыми подходами. Эффекты совместного переписывания оказались сильно зависимыми от того, какая модель-переписчик использовалась, а предоставление рецензентам явных указаний не демонстрировало устойчивого превосходства над простым, неуправляемым вторым просмотром рукописи. Повторные проходы переписывания приносили убывающую и зависящую от конфигурации отдачу, а не устойчиво нарастающие преимущества. Во всех протестированных условиях именно переписчик в основном определял, насколько далеко разойдутся противоположные риторические варианты, тогда как рецензент определял величину и направление итогового изменения оценки.
Эффекты протокола оценки и последствия
Ужесточение правил рецензирования снизило оценки по всему спектру, но не устранило базовую риторическую предвзятость, что, возможно, является более важным выводом для всех, кто создает или использует системы рецензирования на основе ИИ.
Эффект строгого протокола рецензирования и аргументы в пользу устойчивой оценки
Переход к строгому протоколу рецензирования снизил среднюю итоговую оценку на 1,36 балла по сравнению со стандартным протоколом. Это заметное падение в абсолютном выражении, однако оно не привело к устойчивому снижению чувствительности рецензентов-ИИ к риторической подаче. Более строгие правила сделали рецензентов в целом более суровыми, но не обязательно более справедливыми в смысле устойчивости к стилистическим манипуляциям.
Это различие важно для всех, кто отслеживает рост рецензирования с использованием ИИ. Если ужесточение рубрики не нейтрализует риторическую чувствительность, то простая просьба к рецензентам-ИИ быть более критичными сама по себе не является решением. Результаты указывают на иной тип решения: системы оценки, которые изначально спроектированы как устойчивые к риторическим вариациям при сохранении содержания, то есть системы, которые оценивают статью одинаково, независимо от того, подаются ли ее доказательства уверенно или осторожно, пока базовая наука не меняется.
Для области, уже обеспокоенной объемом, выгоранием и непоследовательностью человеческих рецензентов, о чем свидетельствуют материалы Ars Technica о более широкой кризисной ситуации в рецензировании, соблазн еще сильнее опереться на оценщиков-ИИ будет только расти. Это исследование напоминает, что автоматизация вынесения суждений сама по себе не устраняет предвзятость, а лишь меняет источник этой предвзятости.
FAQ
Как риторические выборы влияют на оценки рецензирования с использованием ИИ?
Риторические выборы, такие как подача доказательств и позиционирование новизны, существенно влияют на суждения рецензентов-ИИ при неизменном научном содержании.
Какой набор данных использовался для анализа риторической чувствительности в рецензировании ИИ?
Для анализа использовался контролируемый корпус из 4 200 рукописей, полученных из 120 анонимизированных заявок на ICLR 2026.
Приводят ли более сложные стратегии переписывания к лучшим оценкам рецензирования ИИ?
Нет, более сложные рабочие процессы переписывания не давали надежно больших выигрышей в оценках рецензирования ИИ.
Каков эффект использования строгого протокола рецензирования на оценки ИИ?
Строгий протокол рецензирования снизил среднюю итоговую оценку на 1,36 балла, но не привел к устойчивому изменению риторической чувствительности.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Как риторические выборы влияют на оценки рецензирования с использованием ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Риторические выборы, такие как подача доказательств и позиционирование новизны, существенно влияют на суждения рецензентов-ИИ при неизменном научном содержании.»}},{«@type»:»Question»,»name»:»Какой набор данных использовался для анализа риторической чувствительности в рецензировании ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Для анализа использовался контролируемый корпус из 4 200 рукописей, полученных из 120 анонимизированных заявок на ICLR 2026.»}},{«@type»:»Question»,»name»:»Приводят ли более сложные стратегии переписывания к лучшим оценкам рецензирования ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Нет, более сложные рабочие процессы переписывания не давали надежно больших выигрышей в оценках рецензирования ИИ.»}},{«@type»:»Question»,»name»:»Каков эффект использования строгого протокола рецензирования на оценки ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Строгий протокол рецензирования снизил среднюю итоговую оценку на 1,36 балла, но не привел к устойчивому изменению риторической чувствительности.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

