ДомойZ - Баннер Главная итальянскийИндекс концептуального рассуждения: лучшая модель ИИ набирает 73,6, потолок — 91

Индекс концептуального рассуждения: лучшая модель ИИ набирает 73,6, потолок — 91

Anthropic и независимые исследователи представили новый способ измерения того, в чем модели ИИ исторически с трудом доказывали свою компетентность: умения рассуждать над задачами, не имеющими четкого, проверяемого ответа. Индекс концептуального рассуждения (CRI), представленный на этой неделе, объединяет три отдельных бенчмарка, чтобы оценить, насколько хорошо большие языковые модели справляются с философскими аргументами, логической непротиворечивостью и задачами теории принятия решений — тем типом мышления, который, по мнению многих исследователей, будет иметь наибольшее значение по мере того, как системы ИИ будут играть все большую роль в управлении собственными рисками.

Ключевые выводы

  • Индекс концептуального рассуждения объединяет три бенчмарка — возможности LMCA, ACCoRD и DTBench — в единый показатель от 0 до 100 для оценки концептуального рассуждения ИИ.
  • Лучшая на данный момент модель, Opus 5, набрала 73,6 по CRI, что значительно ниже предполагаемого потолка около 91.
  • Набор данных LMCA включает 560 текстов-позиций и 1 461 аргумент с экспертной оценкой, охватывающих философию, теорию принятия решений и риски ИИ.
  • Показатели растут примерно линейно с конца 2024 года, без признаков замедления.
  • Проект был создан в сотрудничестве с Anthropic и исследователями Эмери Купером и Каспаром Эстерхельдом.

Введение в Индекс концептуального рассуждения (CRI)

CRI существует потому, что часть наиболее важной работы, которую системы ИИ могут в итоге выполнять — помощь людям в понимании и планировании в отношении продвинутых рисков ИИ — не может быть проверена на наличие однозначно правильного ответа так же, как задачи по математике или программированию. Его создатели утверждают, что многие задачи, связанные с снижением рисков ИИ, требуют такого типа аргументации, который используется в философии и футурологии ИИ, а не эмпирической проверки, и что текущие методы обучения, сильно опирающиеся на данные с надежной обратной связью, как правило, оставляют модели более слабыми именно в этом типе рассуждений.

Чтобы закрыть этот измерительный разрыв, исследователи создали три отдельных бенчмарка по рискам ИИ и объединили их в один совокупный показатель. Индекс концептуального рассуждения (CRI) агрегирует три бенчмарка — возможности LMCA, ACCoRD и DTBench — в одно число, призванное отразить общую способность модели к концептуальному рассуждению. Индекс общедоступен на сайте conceptualreasoning.ai, где команда заявляет, что будет продолжать обновлять оценки и методологию по мере появления новых моделей и новых бенчмарков.

Назначение CRI в управлении рисками ИИ

Зачем вообще это строить? Исследователи, стоящие за проектом, говорят, что как только модели ИИ смогут выполнять работу по снижению рисков на уровне человеческих экспертов, объем результатов, создаваемых при помощи ИИ в этой области, может многократно превзойти то, что производят одни только люди. Это означает, что скорость, с которой модели можно обучить хорошо рассуждать о вопросах управления, выравнивания и сбоев кооперации, связанных с ИИ, может стать решающим фактором в том, будут ли риски устранены вовремя. Улучшение концептуального рассуждения в моделях ИИ считается важным именно потому, что оно нацелено на этот пробел — задачи, лишенные эмпирических циклов обратной связи и потому обычно игнорируемые стандартным обучением.

Агрегация бенчмарков и доступность

CRI — это не один тест, а взвешенный композит. В настоящее время LMCA составляет 60% оценки, а ACCoRD и возможности DTBench вносят по 20% каждая. Команда заявляет, что планирует со временем добавлять новые бенчмарки, выводить из использования те, которые станут насыщенными, и при необходимости перераспределять веса по мере улучшения моделей.

Подробный разбор компонентных бенчмарков CRI

Каждый из трех компонентов нацелен на свой тип рассуждений, которые сложно проверить эмпирически, но все же можно измерить с помощью экспертных оценок или логических правил.

Набор данных LMCA: охват и экспертные оценки

LMCA, сокращение от Language Model Conceptual Argumentation (Концептуальная аргументация языковых моделей), построен вокруг отобранных, оцененных экспертами аргументов, охватывающих теорию принятия решений, философию и риски от продвинутого ИИ. Набор данных LMCA содержит 560 текстов-позиций в паре с 1 461 аргументом с экспертной оценкой, написанным против этих позиций. Почти все аргументы были оценены концептуальным исследователем Эмери Купером, а часть — независимо оценена как минимум еще одним исследователем, что в сумме дало 2 140 оценок. Валидационный набор примерно из 50 аргументов был независимо оценен четырьмя-шестью людьми, после чего по ним велись обсуждения общей продолжительностью семь-восемь часов — процесс, призванный установить, насколько люди согласны друг с другом, прежде чем сравнивать их с выводами моделей.

На данный момент LMCA оценивает только то, насколько хорошо модели судят о существующих аргументах, а не генерируют новые, хотя команда говорит, что надеется в будущем добавить метрику генерации аргументов.

ACCoRD: измерение логической непротиворечивости убеждений модели

ACCoRD проверяет нечто иное: насколько логически согласованы заявленные моделью убеждения и предпочтения. Если модель сообщает вероятность события A и, отдельно, вероятность совместного наступления A и B, соблюдает ли она базовые правила, такие как P(A) больше либо равно P(A&B)? Полный набор данных ACCoRD содержит почти 14 000 сгенерированных моделью ограничений на непротиворечивость по 18 типам ограничений, пропущенных через автоматическую проверку. Из них 567 проверенных ограничений вошли в CRI после ручной проверки — это намеренно консервативный фильтр, призванный оставить только те проверки, в которых исследователи уверены.

DTBench: оценка рассуждений в теории принятия решений

DTBench тестирует рассуждения в теории принятия решений с помощью 407 вопросов с множественным выбором, большинство из которых были вручную составлены Каспаром Эстерхельдом, публиковавшим академические работы по теории принятия решений, и независимо проверены Эмери Купером. Вопросы исследуют сценарии, связанные с самопрогнозированием и взаимодействием с почти точными копиями агента — тип мысленных экспериментов, которые теоретики принятия решений обсуждают уже давно. Дополнительные 130 вопросов в полном наборе DTBench измеряют отношение к различным аспектам теории принятия решений, но были исключены из итогового показателя CRI.

Результаты и тенденции производительности по CRI

Даже лучшие протестированные модели все еще значительно не дотягивают до уровня, который бенчмарки считают почти идеальным, хотя разрыв постепенно сокращается.

Текущие показатели и сравнение с потолком

Оценки CRI варьируются от 0 до 100, где 0 соответствует случайному угадыванию. Исследователи оценивают реалистичный потолок примерно в 91, а не полные 100, поскольку сами человеческие оценки содержат некоторый шум — даже эксперты не согласны друг с другом на 100%. Наивысший зафиксированный на данный момент результат принадлежит модели Opus 5 — 73,6, с 95%-ным доверительным интервалом плюс-минус 2,1. Это оставляет значимый разрыв между текущим лучшим результатом и предполагаемым потолком, что говорит о том, что у моделей все еще есть реальный потенциал улучшения в области концептуального рассуждения до того, как сам бенчмарк станет ограничивающим фактором.

Тенденции улучшения производительности моделей со временем

В данных выделяется не только текущий уровень моделей, но и скорость их прогресса. Производительность моделей примерно линейно растет с конца 2024 года, и исследователи не видят признаков того, что эта тенденция выравнивается. Это устойчивое повышение важно для всех, кто пытается прогнозировать, когда системы ИИ смогут стать по-настоящему полезными соавторами в работе, сильно зависящей от аргументации, на которой строится исследование безопасности ИИ.

Оценки насыщения по отдельным бенчмаркам

Не все компоненты развиваются с одинаковой скоростью. Экстраполируя текущие тенденции, исследователи ориентировочно оценивают, что LMCA начнет насыщаться примерно через год. DTBench, напротив, уже близок к своему потолку — одна из оцененных моделей, Fable 5, правильно ответила на 98% вопросов DTBench. ACCoRD — это «джокер»: команда признается, что искренне не уверена, когда этот бенчмарк достигнет насыщения, поскольку ошибки непротиворечивости могут сохраняться даже по мере улучшения базовых способностей к рассуждению.

Значение и совместная разработка CRI

Почему все это важно за пределами таблицы лидеров? Потому что создатели Индекса концептуального рассуждения рассматривают концептуальное рассуждение как узкое место именно для работы по рискам ИИ — работы, связанной с рассуждениями о вопросах управления, выравнивания и катастрофических сбоев кооперации, где нет набора данных с прошлыми исходами для обучения. Улучшение концептуального рассуждения в моделях ИИ считается важным для снижения продвинутых рисков ИИ именно потому, что значительная часть работы по снижению рисков опирается на аргументацию, а не на эмпирическое тестирование.

Проект был создан в результате сотрудничества Anthropic с концептуальными исследователями Эмери Купером и Каспаром Эстерхельдом, которые внесли вклад как в разработку наборов данных, так и в экспертные оценки, лежащие в основе компонентов LMCA и DTBench. Это сочетание институциональной поддержки и специализированного экспертного вклада — часть того, что отличает CRI от более традиционных бенчмарков ИИ, сосредоточенных на математике, программировании или общих знаниях — областях, где корректность обычно можно проверить автоматически.

Актуальные оценки и методологические примечания размещены на сайте conceptualreasoning.ai, а доступ к базовому набору данных LMCA предоставляется по запросу через форму — структура, которая показывает, что команда хочет, чтобы внешние исследователи тестировали и оспаривали бенчмарк, а не относились к нему как к закрытой внутренней метрике.

FAQ

Что такое Индекс концептуального рассуждения (CRI)?

CRI агрегирует три бенчмарка — LMCA, ACCoRD и DTBench — для измерения способностей моделей ИИ к концептуальному рассуждению, формируя единый показатель от 0 до 100.

Какие типы рассуждений оценивает набор данных LMCA?

LMCA оценивает модели по тому, как они судят о концептуальных аргументах, связанных с философией, теорией принятия решений и рисками ИИ, сравнивая оценки моделей с оценками экспертов-людей.

Как ACCoRD тестирует логическую непротиворечивость в моделях ИИ?

ACCoRD измеряет, удовлетворяют ли заявленные моделью убеждения и предпочтения ограничениям логической непротиворечивости, таким как базовые правила вероятности, используя 567 проверенных ограничений в рамках CRI.

Насколько хорошо текущие модели ИИ показывают себя по CRI?

Текущая лучшая модель, Opus 5, набирает около 73,6 из 100 по CRI, при этом показатели среди оцененных моделей растут примерно линейно с конца 2024 года, и пока нет признаков замедления этого роста.

{«@context»:»https://schema.org»,»@type»:»FAQPage»,»mainEntity»:[{«@type»:»Question»,»name»:»Что такое Индекс концептуального рассуждения (CRI)?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»CRI агрегирует три бенчмарка — LMCA, ACCoRD и DTBench — для измерения способностей моделей ИИ к концептуальному рассуждению, формируя единый показатель от 0 до 100.»}},{«@type»:»Question»,»name»:»Какие типы рассуждений оценивает набор данных LMCA?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»LMCA оценивает модели по тому, как они судят о концептуальных аргументах, связанных с философией, теорией принятия решений и рисками ИИ, сравнивая оценки моделей с оценками экспертов-людей.»}},{«@type»:»Question»,»name»:»Как ACCoRD тестирует логическую непротиворечивость в моделях ИИ?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»ACCoRD измеряет, удовлетворяют ли заявленные моделью убеждения и предпочтения ограничениям логической непротиворечивости, таким как базовые правила вероятности, используя 567 проверенных ограничений в рамках CRI.»}},{«@type»:»Question»,»name»:»Насколько хорошо текущие модели ИИ показывают себя по CRI?»,»acceptedAnswer»:{«@type»:»Answer»,»text»:»Текущая лучшая модель, Opus 5, набирает около 73,6 из 100 по CRI, при этом показатели среди оцененных моделей растут примерно линейно с конца 2024 года, и пока нет признаков замедления этого роста.»}}]}

Статья подготовлена при содействии искусственного интеллекта и проверена редакционной командой.

RELATED ARTICLES

Stay updated on all the news about cryptocurrencies and the entire world of blockchain.

Featured video

LATEST