ДомойZ - Баннер Главная итальянскийОтравление памяти агента: 1,2% заражённых данных снизили точность ИИ до 0,300

Отравление памяти агента: 1,2% заражённых данных снизили точность ИИ до 0,300

Новая научная работа поднимает неприятные вопросы о том, как системы ИИ запоминают информацию. Исследование, автором которого является Арулниди Карунаниди и которое опубликовано на arXiv, показывает, насколько легко отравление памяти агента может исказить долгосрочную память системы ИИ и насколько слабо работают современные механизмы защиты, когда это происходит. Основная проблема проста для описания, но сложна для решения: как только ложное утверждение попадает в постоянное хранилище памяти, оно может всплывать в несвязанных будущих сессиях, незаметно направляя агента ИИ к неправильным ответам.

Ключевые выводы

  • Отравление всего 1,2% корпуса LongMemEval снизило точность извлечения с 0,850 до 0,300.
  • Четырёхэтапный конвейер фильтрации при записи обнаружил 0,832 косвенных атак через prompt injection, но не отклонил ни одной из 360 отравленных записей памяти.
  • Извлечение с учётом происхождения (provenance-weighted retrieval) показало себя не лучше, чем полное отсутствие защиты, со статистическим результатом p=0,80.
  • Исключение недоверенного контента повысило точность с 0,3167 до 0,7000 в одном тесте со смешанным происхождением данных, но то же исключение обрушило точность до 0,0417, когда требовались доверенные доказательства.
  • Исследователь предлагает ограничительные условия по заполнению (bounded occupancy constraints) на этапе извлечения как замену штрафам по происхождению, которые не работают.

Уязвимости постоянной памяти к ложной информации

Постоянная память должна делать агентов ИИ умнее со временем, позволяя им вспоминать прошлые взаимодействия. Исследование показывает, что эта же функция превращается в слабое место: ложная информация, сохранённая в памяти, не просто лежит там, а извлекается в будущих сессиях всякий раз, когда запрос на неё «попадает». У лжи нет срока годности, если она однажды записана.

Влияние отравления памяти на точность извлечения

Цифры здесь весьма показательны. Исследователи отравили всего 1,2% корпуса LongMemEval простыми по формулировке ложными утверждениями, сгенерированными за один проход, без специальных триггеров, без тщательно составленных инструкций и без настройки механизма извлечения для упрощения атаки. Этой небольшой доли оказалось достаточно, чтобы снизить точность извлечения с 0,850 до 0,300. Иными словами, крошечный слой плохих данных может свести на нет большую часть надёжности системы, причём для атаки не потребовалась сложная инженерия.

Ограничения фильтрации только по содержимому

Фильтрация содержимого записей перед их сохранением кажется очевидным решением. В работе протестирован четырёхэтапный конвейер фильтрации при записи, который хорошо показал себя против косвенного prompt injection, достигнув полноты 0,832 при пометке как подозрительных всего 1,5% безобидного текста с триггерными словами. Это звучит многообещающе, пока не посмотреть на результаты для реально отравленных записей: конвейер не отклонил ни одной из 360. Ни одной. Фильтрация была настроена на обнаружение атак в стиле injection, а не спокойных, правдоподобно звучащих ложных утверждений, и именно здесь становятся очевидны пределы фильтрации по содержимому. Отличить ложное утверждение от истинного обычно нельзя, просто прочитав текст. Нужна внешняя опора — способ проверить утверждение по отношению к миру за пределами самого документа, а к этому фильтры, работающие только с содержимым, доступа не имеют.

Оценка защит на основе ранжирования и взвешивания по происхождению

Если фильтрация содержимого не работает, следующий логичный шаг — взвешивать доказательства по источнику их происхождения. В исследовании как раз это и проверили, и результаты показывают, что механизмы защиты с ранжированием по происхождению несут в себе трудноустранимый компромисс.

Эффективность и компромиссы извлечения с весами по происхождению

Извлечение с весами по происхождению (provenance-weighted retrieval) ранжирует доказательства частично на основе надёжности их источника. При настройках по умолчанию такая защита статистически не отличалась от полного отсутствия защиты, с p-значением 0,80. Усиление весов действительно вернуло часть полезности, но только за счёт полного исключения недоверенного контента. Это грубый инструмент: он не отделяет вредоносный недоверенный контент от легитимного недоверенного, а просто выбрасывает всё, что не помечено как доверенное. Если закрутить гайки слишком сильно, система начинает терять реальные, полезные доказательства вместе с «ядом».

Изменения точности в корпусах со смешанным происхождением

Компромисс особенно заметен в тестах со смешанным происхождением данных. Когда недоверенный контент в корпусе в основном был безвредным, его исключение помогло, повысив точность с 0,3167 до 0,7000. Но если поменять сценарий, картина резко меняется. Когда конкретные доказательства, необходимые для ответа на вопрос, оказывались помечены как недоверенные, полнота извлечения доказательств падала до нуля, а точность — до 0,0417. Это огромный разброс, полностью обусловленный тем, в какую «корзину» попало доказательство, независимо от того, было ли оно истинным. Это один из двух самых наглядных выводов «почему это важно» в работе: любая система, полагающаяся на метки происхождения для фильтрации памяти, настолько же хороша, насколько хороша её разметка, и ошибочно помеченные доверенные источники могут быть столь же разрушительными, как и откровенно отравленные.

Вывод исследователя по поводу аддитивных терминов происхождения предельно прямолинеен: пригодной настройки нет. Взвешивание, достаточно сильное, чтобы противостоять атакам, подстраиваемым под запрос, одновременно достаточно сильно, чтобы подавлять легитимные доказательства, которые просто происходят из недоверенного источника. Поверните ручку в одну сторону — и яд проходит. Поверните в другую — и настоящие ответы оказываются погребены. Не существует «золотой середины», где обе проблемы решены одновременно, по крайней мере, не с аддитивными штрафами.

Предлагаемая альтернативная защита: ограничительные условия по заполнению

Учитывая, что ни фильтрация содержимого, ни взвешивание по происхождению сами по себе не выдерживают проверки, в работе предлагается совсем иной подход: ограничительные условия по заполнению (bounded occupancy constraints), применяемые на этапе извлечения, а не аддитивные штрафы по происхождению, накладываемые поверх существующих ранжирований. Вместо попытки оценить, насколько надёжна каждая запись памяти, и надеяться, что математика всё исправит, этот подход ограничивает долю, которую любой один источник или категория доказательств может занимать в наборе извлечённых данных. Это структурное ограничение, а не корректировка оценок.

Это важно, потому что меняет постановку задачи. Вместо вопроса «как отличить истину от лжи», с которым, как показывает исследование, плохо справляются и фильтрация содержимого, и взвешивание по происхождению, ограничительные условия по заполнению задают вопрос «как ограничить масштаб ущерба от любого одного отравленного источника», независимо от того, был ли он корректно идентифицирован как отравленный. Разница тонкая, но важная для всех, кто строит системы памяти агентов: защита смещается от обнаружения к сдерживанию.

Авторы работы опубликовали вместе с результатами свои тестовые стенды, корпуса и сводные отчёты по запускам, позволяя другим исследователям воспроизводить и развивать эти результаты. Для разработчиков ИИ, полагающихся на постоянную память, чтобы со временем делать агентов более полезными, вывод неприятен, но ясен: ложь в постоянной памяти дёшево внедрить и дорого обнаружить, а наиболее часто предлагаемые сегодня механизмы защиты не закрывают этот разрыв.

FAQ

Почему постоянная память уязвима к отравлению ложной информацией?

Потому что, как только ложное утверждение сохраняется в постоянной памяти, оно может извлекаться в будущих сессиях, делая ложь устойчивой, а не разовой ошибкой.

Насколько эффективна фильтрация только по содержимому для предотвращения отравленных записей памяти?

Фильтрация только по содержимому не может надёжно отличать ложные утверждения от истинных без внешней опоры, и протестированный четырёхэтапный конвейер не отклонил ни одной из 360 отравленных записей памяти, несмотря на высокую эффективность против prompt injection.

Улучшает ли извлечение с весами по происхождению защиту от отравления памяти?

Нет. Извлечение с весами по происхождению не показало статистически значимого улучшения по сравнению с полным отсутствием защиты, а более сильное взвешивание, исключающее недоверенный контент, также создаёт риск подавления легитимных доказательств.

Какой альтернативный метод защиты от отравления памяти агента предлагается?

В исследовании предлагаются ограничительные условия по заполнению на этапе извлечения как альтернатива аддитивным штрафам по происхождению, ограничивающие, насколько один источник может доминировать в извлечённых доказательствах, вместо прямой оценки доверия.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Почему постоянная память уязвима к отравлению ложной информацией?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Потому что, как только ложное утверждение сохраняется в постоянной памяти, оно может извлекаться в будущих сессиях, делая ложь устойчивой, а не разовой ошибкой.»}},{«@type»:»Question»,»name»:»Насколько эффективна фильтрация только по содержимому для предотвращения отравленных записей памяти?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Фильтрация только по содержимому не может надёжно отличать ложные утверждения от истинных без внешней опоры, и протестированный четырёхэтапный конвейер не отклонил ни одной из 360 отравленных записей памяти, несмотря на высокую эффективность против prompt injection.»}},{«@type»:»Question»,»name»:»Улучшает ли извлечение с весами по происхождению защиту от отравления памяти?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Нет. Извлечение с весами по происхождению не показало статистически значимого улучшения по сравнению с полным отсутствием защиты, а более сильное взвешивание, исключающее недоверенный контент, также создаёт риск подавления легитимных доказательств.»}},{«@type»:»Question»,»name»:»Какой альтернативный метод защиты от отравления памяти агента предлагается?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»В исследовании предлагаются ограничительные условия по заполнению на этапе извлечения как альтернатива аддитивным штрафам по происхождению, ограничивающие, насколько один источник может доминировать в извлечённых доказательствах, вместо прямой оценки доверия.»}}]}

Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST