ДомойZ - Баннер Главная итальянскийИИ-модели правильно выполняют только 39,6% шагов в тесте по реконструкции цепочки атаки

ИИ-модели правильно выполняют только 39,6% шагов в тесте по реконструкции цепочки атаки

Исследователи в области безопасности давно надеются, что агенты на основе больших языковых моделей смогут ускорить одну из самых утомительных частей реагирования на инциденты: по шагам восстанавливать, как злоумышленник перемещался по системе, используя разрозненные логи и телеметрию. Новый диагностический бенчмарк под названием DiagChain проверяет эту надежду на практике, и результаты показывают, что технологии еще предстоит пройти долгий путь, прежде чем она сможет надежно справляться с задачей реконструкции цепочки атаки самостоятельно.

Разработанный командой исследователей, в которую входят Сюйян Лю, Йибин Хан, Чжэньвэй Чжан, Кай Чан, Чживэй Сюй, Тянь Цю, Вэйсянь Дэн, Цзябао Гао, Сяолинь Пэн, Хай Ван и Сибин Чжао, DiagChain — это не просто еще одна таблица точности. Он специально создан для того, чтобы показать, где и почему агенты LLM терпят неудачу, когда пытаются восстановить упорядоченную последовательность действий, предпринятых злоумышленником, на основе доказательств, извлеченных из системной телеметрии.

Ключевые выводы

  • DiagChain — это диагностический бенчмарк, который оценивает агентов LLM по реконструкции цепочки атаки на основе доказательств, выходя за рамки простой точности по принципу «сдал/не сдал».
  • Набор MAIN-69 в бенчмарке включает 69 сценариев, охватывающих несколько операционных систем, уровни шума в доказательствах и длины цепочек.
  • Новый метод под названием ECRAG сочетает извлечение доказательств с развивающимся структурированным представлением реконструируемой цепочки.
  • По результатам тестирования 6 различных LLM лучшая конфигурация успешно справилась лишь с 39,6% из 849 эталонных шагов.
  • Меньшие модели с трудом используют извлеченные доказательства вообще, тогда как более крупные модели в основном испытывают трудности с размещением этих доказательств в правильном порядке.

Представляем DiagChain: новый бенчмарк для реконструкции цепочки атаки

DiagChain появился потому, что большинство существующих бенчмарков оценивают только конечные результаты или общие показатели точности, почти не давая понимания того, как именно формируются ошибки в процессе рассуждения агента. Это существенный пробел для команд кибербезопасности, которые пытаются решить, достаточно ли надежен ИИ-агент, чтобы помочь в сортировке реального инцидента вторжения.

Цель и охват DiagChain

В своей основе DiagChain — это диагностический бенчмарк, созданный для задач кибербезопасности на основе доказательств. Вместо того чтобы просто оценивать, правильно или неправильно агент восстановил итоговый нарратив атаки, он оценивает каждый этап процесса реконструкции отдельно. Такой поэтапный подход позволяет исследователям точно определить, где именно ломается логика агента LLM — на этапе сбора доказательств, их интерпретации или при упорядочивании событий в связную цепочку.

Состав набора сценариев MAIN-69

Центральным элементом бенчмарка является MAIN-69 — набор из 69 сценариев, разработанных для стресс-тестирования агентов в широком спектре реалистичных условий. Эти сценарии охватывают несколько операционных систем, различаются по уровню шума, смешанного с доказательствами, и по длине цепочки, то есть некоторые последовательности атаки короткие, а другие требуют отслеживания более длинной серии действий злоумышленника. Такое разнообразие призвано показать, сохраняется ли качество работы агента, когда условия становятся более «грязными», а не только тогда, когда все чисто и однозначно.

Методологические новшества и метрики оценки

Помимо набора сценариев, DiagChain вводит собственный метод извлечения и пятикомпонентную систему оценивания, обе направлены на то, чтобы сделать диагностику сбоев систематической, а не основанной на догадках.

Evidence-Centric Retrieval-Augmented Generation (ECRAG)

Одним из ключевых вкладов работы является ECRAG — Evidence-Centric Retrieval-Augmented Generation (извлечение и генерация, ориентированные на доказательства). В отличие от стандартных схем retrieval-augmented generation, ECRAG связывает извлечение доказательств с развивающимся структурированным представлением цепочки, которую агент пытается реконструировать. На практике это означает, что система не просто один раз извлекает релевантные доказательства и движется дальше; она постоянно обновляет свое внутреннее представление цепочки атаки по мере поступления новых доказательств, что теоретически должно помогать агентам более связно отслеживать сложные многошаговые вторжения.

Пять взаимодополняющих метрик для диагностической оценки

Чтобы понять, где именно все идет не так, DiagChain опирается на пять взаимодополняющих метрик, каждая из которых нацелена на отдельный этап процесса реконструкции. Вместе эти метрики позволяют исследователям выделять конкретные точки отказа, а не сваливать каждую ошибку в один общий показатель точности. В этом и заключается ключевая ценность бенчмарка: диагностическая оценка, которая различает ситуации «агент не нашел нужные доказательства» и «агент нашел доказательства, но расположил события в неправильном порядке», гораздо полезнее для улучшения таких систем, чем единый результат по принципу «сдал/не сдал».

Оценка производительности больших языковых моделей

Как же на самом деле показали себя современные модели? По результатам бенчмарка — не особенно хорошо.

Экспериментальная установка с использованием шести LLM

Команда исследователей провела оценки, используя шесть различных LLM на сценариях MAIN-69. Такая установка позволила сравнить, как модели разной мощности справляются с одними и теми же задачами реконструкции на основе доказательств, при одинаковых условиях шума и длины цепочек, обеспечивая единый базис для сравнения производительности.

Ключевые результаты и показатели успешности

Ключевой показатель довольно суров: даже лучшая конфигурация в исследовании успешно справилась лишь с 39,6% из 849 эталонных шагов, включенных в MAIN-69. Иными словами, самая сильная протестированная конфигурация более чем в 60% случаев неверно восстанавливала последовательность действий злоумышленника по сравнению с эталонными шагами бенчмарка. Это серьезное отрезвляющее напоминание для всех, кто рассчитывает уже сейчас полностью передать реконструкцию цепочки атаки ИИ-агенту.

Выводы о размере модели и сложностях реконструкции

Почему это важно помимо самих цифр? Потому что характер сбоев различается в зависимости от размера модели, и это указывает на две очень разные инженерные задачи, которые предстоит решить.

Ограничения меньших моделей

Согласно анализу исследователей, меньшие модели испытывают трудности с более базовой задачей, чем правильное упорядочивание событий: им сложно вообще включать извлеченные доказательства в свои ответы. Это говорит о том, что узкое место для меньших моделей находится раньше в конвейере — на этапе, когда доказательства должны реально влиять на рассуждения агента, а не игнорироваться или использоваться неправильно.

Проблемы крупных моделей с упорядочиванием доказательств

Более крупные модели успешнее преодолевают этот первый барьер и могут продвинуться дальше в процессе реконструкции. Но они сталкиваются с другой проблемой: правильное упорядочивание собранных доказательств становится основным узким местом. Это более тонкий режим отказа, поскольку у модели есть нужные фрагменты, но она с трудом выстраивает их в точную последовательность действий злоумышленника — а именно этот результат и имеет наибольшее значение для реального расследования инцидента безопасности.

Это различие важно для всех, кто создает или внедряет инструменты оценочных бенчмарков LLM в операциях безопасности. Оно подразумевает, что простое увеличение размера модели само по себе не решит задачу реконструкции цепочки атаки. Эти два режима отказа требуют разных решений: лучшей интеграции доказательств для меньших моделей и более эффективных стратегий упорядочивания или рассуждения для крупных, а не единого универсального пути улучшения.

Исследователи рассматривают эти результаты как подтверждение ценности диагностической оценки по сравнению с простой сквозной точностью. Один агрегированный показатель может сказать команде безопасности, что модель «правильно отвечает в 40% случаев», но не покажет, связаны ли ошибки с пропущенными доказательствами, неверно интерпретированными доказательствами или перепутанной последовательностью. Поэтапные метрики DiagChain призваны устранить этот пробел, предлагая то, что авторы описывают как практически применимые инсайты для улучшения агентов кибербезопасности на основе доказательств в будущем.

FAQ

Для оценки чего предназначен DiagChain?

DiagChain предназначен для оценки агентов на основе больших языковых моделей по реконструкции цепочки атаки на основе доказательств с помощью диагностической, поэтапной оценки.

Какое содержание охватывает набор сценариев MAIN-69?

MAIN-69 включает 69 сценариев, охватывающих несколько операционных систем, различные уровни шума в доказательствах и разные длины цепочек атаки.

Как методология ECRAG улучшает реконструкцию цепочки атаки?

ECRAG сочетает извлечение доказательств с развивающимся структурированным представлением реконструируемой цепочки, чтобы помочь в анализе цепочки.

Каковы основные проблемы производительности LLM, выявленные в этом бенчмарке?

Меньшие модели испытывают трудности с включением извлеченных доказательств, тогда как более крупные модели сталкиваются с проблемами при правильном упорядочивании доказательств в процессе реконструкции.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Для оценки чего предназначен DiagChain?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»DiagChain предназначен для оценки агентов на основе больших языковых моделей по реконструкции цепочки атаки на основе доказательств с помощью диагностической, поэтапной оценки.»}},{«@type»:»Question»,»name»:»Какое содержание охватывает набор сценариев MAIN-69?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»MAIN-69 включает 69 сценариев, охватывающих несколько операционных систем, различные уровни шума в доказательствах и разные длины цепочек атаки.»}},{«@type»:»Question»,»name»:»Как методология ECRAG улучшает реконструкцию цепочки атаки?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»ECRAG сочетает извлечение доказательств с развивающимся структурированным представлением реконструируемой цепочки, чтобы помочь в анализе цепочки.»}},{«@type»:»Question»,»name»:»Каковы основные проблемы производительности LLM, выявленные в этом бенчмарке?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Меньшие модели испытывают трудности с включением извлеченных доказательств, тогда как более крупные модели сталкиваются с проблемами при правильном упорядочивании доказательств в процессе реконструкции.»}}]}

Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

Satoshi Voice
Эта статья была подготовлена при поддержке искусственного интеллекта и проверена нашей командой журналистов для обеспечения точности и качества.
RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST