Роботы, которые полагаются на модели «зрение–язык–действие» (VLA), чтобы видеть, рассуждать и действовать в физическом мире, могут иметь скрытое слабое место: собственные микросхемы памяти. Новое исследование показывает, что атаки с инверсией битов на модели VLA — это не просто теоретическое любопытство: несколько точно выбранных искажений битов в весах квантизированной модели могут обнулить показатель успешности выполнения задач роботом, даже если еще мгновение назад модель выглядела совершенно исправной.
Результаты представлены в исследовании под названием «Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability» («Атаки с инверсией битов на модели “зрение–язык–действие”: архитектура декодирования действий определяет уязвимость»), авторами которого являются Юдун Гао (Yudong Gao), Линхан Чэнь (Linghan Chen), Вэньхань Ву (Wenhan Wu), Миа Чжоу (Mia Zhou), Цзияо Ван (Jiyao Wang), Кайянь Цзи (Kaiyan Ji), Минъюй Го (Mingyu Guo) и Хунлун Чэнь (Honglong Chen). Это первая задокументированная атака с инверсией битов, нацеленная специально на систему VLA, и она появляется в момент, когда воплощенный ИИ — модели, сочетающие языковое понимание с физическим действием — быстро выходит из исследовательских лабораторий к этапу реального развертывания в роботах.
Summary
Критическая уязвимость квантизированных моделей VLA к атакам Rowhammer с инверсией битов
Квантизированные модели VLA подвержены специфическому виду аппаратного уровня угроз: сбоям в стиле Rowhammer, которые искажают веса в формате INT8, на которые модель опирается после сжатия для развертывания. Квантизация — обычная практика для эффективного запуска больших моделей ИИ на робототехническом оборудовании, но исследователи обнаружили, что именно этот шаг сжатия открывает узкую, но опасную поверхность для сбоев.
Rowhammer — это известный класс аппаратных атак, при которых многократный доступ к строкам памяти вызывает непреднамеренные инверсии битов в соседних строках, по сути превращая 0 в 1 или наоборот, без необходимости обходить программные средства защиты. Применительно к сохранённым весам модели VLA это означает, что злоумышленнику не нужно взламывать конвейер обучения ИИ или красть его код — ему достаточно инвертировать нужные биты в нужном месте в памяти развернутой системы.
Особенно поразительным это открытие делает контраст между преднамеренной и случайной порчей. Случайные инверсии битов, даже в большом количестве, оказались в значительной степени безвредны для производительности модели. Сотни случайно распределённых инверсий почти не повредили системе. Но когда исследователи использовали градиентную информацию, чтобы выбрать, какие биты инвертировать, результат радикально изменился — небольшое число тщательно выбранных инверсий снизило успешность выполнения задач в замкнутом контуре до 0%.
Эффективность атак и архитектурно-зависимая уязвимость
Тяжесть атаки с инверсией битов на модель VLA в значительной степени зависит от того, как эта модель преобразует своё внутреннее рассуждение в физическое движение. Ущерб от таких атак распространяется по параметрам модели неравномерно — он концентрируется в нескольких слоях, генерирующих действия, и степень уязвимости этих слоёв резко зависит от базовой архитектуры «головы» действий (action head).
Градиентно-выбранные против случайных инверсий битов
Разрыв между случайными и целевыми инверсиями — самый наглядный сигнал во всём исследовании. Случайная порча, даже в крупном масштабе, оставляла модели работающими почти нормально. Градиентно-выбранная порча, напротив, оказывалась разрушительной уже при небольшом числе инверсий. Это не история о общей хрупкости аппаратуры — это история о точности. Злоумышленник, который понимает, где чувствительность в процессе принятия решений модели максимальна, может вызвать катастрофический сбой, затратив лишь малую долю усилий, которые потребовались бы случайному шуму, и случайный шум не смог бы приблизиться к тому же эффекту даже при куда большем объёме.
Уязвимость по типу головы декодирования действий
На четырёх вариантах моделей, охватывающих три разных семейства голов действий, исследователи обнаружили, что число инверсий битов, необходимое для вывода системы из строя, колоссально различается в зависимости от архитектуры. Политики с прямой регрессией и токен-ориентированные политики оказались хрупкими, ломаясь уже при 1–5 инверсиях. Политики с согласованием потоков (flow-matching), напротив, требовали гораздо большего бюджета — порядка 100–300 инверсий — чтобы достичь такого же коллапса.
Эта разница важна для всех, кто оценивает безопасность роботизированного ИИ, потому что она показывает: выбор архитектуры — это не только решение о производительности или точности, но и о безопасности. Модель с головой прямой регрессии может выглядеть эффективной и отзывчивой, но при этом она может предоставлять злоумышленникам более лёгкую цель.
Команда также разработала атаку с функцией потерь «выхода с многообразия» фиксированного направления (fixed-direction manifold-escape loss), усовершенствованную технику, которая резко сократила число инверсий, необходимых для вывода из строя более устойчивой модели. Применённая к политике согласования потоков, известной как π0, эта методика уменьшила требуемый бюджет примерно с 1000 инверсий до около 100. Согласованный пятинаправленный перебор дополнительно подтвердил, что эффективность атаки не ограничивается направлением, при котором все инверсии положительны, то есть уязвимость не является узким частным случаем — она сохраняется при разных направленных стратегиях, что подчёркивает, насколько широко эксплуатируемым может быть этот изъян.
Стратегии смягчения и практические последствия
Защита лишь небольшой части весов модели может заметно ослабить такие атаки. В архитектуре с прямой головой защита всего 3,1% весов сохранила 60% успешности выполнения задач даже при 100 инверсиях. Защита немного большей доли — 5,3% весов — сдвинула точку, в которой производительность модели в разомкнутом контуре рушилась, с 3 инверсий до 100, что является существенным ростом устойчивости при относительно скромном объёме защищаемых параметров.
Ставки в реальном мире стали очевидны, когда исследователи перешли от симуляции к реальному роботу. Эмулированные атаки, откалиброванные по задачам и использующие 100 инверсий битов, привели к 0 успешным выполненным задачам из 20 на физическом роботе. Для сравнения: «чистая», не атакованная модель успешно справилась с 14 задачами из 20, а модель, подвергнутая случайным (нецелевым) инверсиям битов, всё ещё достигла 16 успехов из 20. Разница между случайным вмешательством и преднамеренной, управляемой градиентом атакой была не постепенной — это была разница между функционирующим роботом и роботом, который проваливался каждый раз.
Почему это важно: по мере того как системы воплощённого ИИ переходят из лабораторий на склады, в дома и промышленные объекты, физические последствия компрометации модели перестают быть абстракцией. Повреждённая модель VLA выдаёт не просто неверный текстовый ответ — она может привести к тому, что роботизированная рука промахнётся, уронит или неправильно обработает физическую задачу в реальном мире. Исследователи формулируют это прямо: целостность весов — это граница безопасности для базовых воплощённых моделей, сопоставимая с более привычными проблемами вроде отравления данных или атак с враждебными входами, но действующая на более низком, близком к аппаратуре уровне, который гораздо сложнее отследить с помощью традиционного программного мониторинга.
Авторы исследования опубликовали сопутствующий код как дополнительный материал, предоставив другим исследователям возможность воспроизвести и развить результаты — шаг, который может ускорить как исследования атак, так и, что важнее, разработку защитных техник для противодействия им.
FAQ
К какому типу атак с инверсией битов уязвимы модели VLA?
Модели VLA уязвимы к атакам с инверсией битов в стиле Rowhammer, нацеленным на квантизированные веса INT8, которые могут серьёзно ухудшить производительность модели.
Чем градиентно-выбранные инверсии битов отличаются по воздействию от случайных?
Градиентно-выбранные инверсии битов радикально снижают показатели успешности в замкнутом контуре до нуля, тогда как сотни случайных инверсий оказывают минимальный эффект.
Какие части моделей VLA наиболее уязвимы к атакам с инверсией битов?
Ущерб от инверсий битов концентрируется в нескольких слоях, генерирующих действия, причём уязвимость сильно зависит от архитектуры головы действий.
Может ли защита подмножества весов модели повысить устойчивость к атакам с инверсией битов?
Да, защита от 3,1% до 5,3% весов значительно повышает устойчивость, сохраняя существенную успешность выполнения задач даже под атакой.
{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»К какому типу атак с инверсией битов уязвимы модели VLA?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Модели VLA уязвимы к атакам с инверсией битов в стиле Rowhammer, нацеленным на квантизированные веса INT8, которые могут серьёзно ухудшить производительность модели.»}},{«@type»:»Question»,»name»:»Чем градиентно-выбранные инверсии битов отличаются по воздействию от случайных?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Градиентно-выбранные инверсии битов радикально снижают показатели успешности в замкнутом контуре до нуля, тогда как сотни случайных инверсий оказывают минимальный эффект.»}},{«@type»:»Question»,»name»:»Какие части моделей VLA наиболее уязвимы к атакам с инверсией битов?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Ущерб от инверсий битов концентрируется в нескольких слоях, генерирующих действия, причём уязвимость сильно зависит от архитектуры головы действий.»}},{«@type»:»Question»,»name»:»Может ли защита подмножества весов модели повысить устойчивость к атакам с инверсией битов?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Да, защита от 3,1% до 5,3% весов значительно повышает устойчивость, сохраняя существенную успешность выполнения задач даже под атакой.»}}]}
Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

