Новое исследование, опубликованное AI Disclosures Project, поднимает важные вопросы о прозрачности и этичности методов обучения, используемых OpenAI. В центре расследования находится GPT-4o, последняя языковая модель компании, обвиняемая в распознавании и использовании контента, защищенного авторским правом, из конфиденциальных материалов издательства O’Reilly Media.
Summary
Исследование для повышения прозрачности в гонке за искусственным интеллектом
Исследование было проведено в рамках AI Disclosures Project, инициативы под руководством технолога Тима О’Рейли и экономиста Илана Штраусса. Цель проекта ясна: содействовать повышению ответственности в секторе искусственного интеллекта, акцентируя внимание на необходимости прозрачных практик со стороны компаний, разрабатывающих LLM (Large Language Models).
Документ, working paper, анализирует, как текущая нехватка формальных обязательств в раскрытии данных, используемых для обучения этих моделей, может создать серьезные проблемы доверия и законности. Исследователи утверждают, что, как на финансовых рынках возникли правила раскрытия информации для содействия устойчивым рынкам, так и в области ИИ требуется аналогичное регулирование, чтобы избежать злоупотреблений и системных повреждений.
OpenAI проводит тесты на контент, защищенный авторским правом: данные говорят сами за себя
Для проведения своего исследования исследователи использовали легально полученный набор данных из 34 книг, защищенных авторским правом, опубликованных O’Reilly Media. С помощью техники, известной как DE-COP membership inference attack, они измерили, способны ли языковые модели отличать тексты, написанные людьми, от перефразированных версий, сгенерированных LLM. Результаты указывают на GPT-4o.
Оценки AUROC (метрика, которая измеряет способность модели различать два класса) говорят сами за себя:
- GPT-4o получил оценку 82% в способности распознавать непубличные материалы из O’Reilly Media — значение, которое указывает на высокую вероятность того, что эти материалы были включены в данные для обучения.
- Для сравнения, модель GPT-3.5 Turbo показала гораздо более слабое распознавание (около 50%), в то время как GPT-4o Mini, более легкая версия модели, не распознала ни публичные, ни непубличные материалы.
- Данные также показывают, что GPT-4o лучше распознает материалы не доступные публично (82% AUROC) по сравнению с контентом O’Reilly, доступным свободно (64% AUROC).
- Напротив, GPT-3.5 Turbo демонстрирует большую осведомленность с публичными материалами (64%), чем с конфиденциальными (54%).
Возможным источником доступа к контенту, защищенному авторским правом, как предполагают исследователи, может быть LibGen, известная онлайн-платформа, которая размещает неавторизованные цифровые копии книг, защищенных авторским правом. Все книги, проанализированные в исследовании, действительно присутствуют в этой виртуальной библиотеке.
Индустрия AI между законностью, экономикой и устойчивостью контента
Результаты поднимают более широкий вопрос: систематическое использование данных, защищенных авторским правом, для обучения языковых моделей может поставить под угрозу экономическую устойчивость профессионалов, создающих оригинальный контент. Если компании не будут получать компенсацию за использование их публикаций, вся экосистема информации — включая издательство — рискует обеднеть.
Согласно отчету, неразрешенное использование собственных данных без компенсации способствует снижению качества и разнообразия онлайн-контента. И это не только этический вопрос, но и экономический: без доходов издательства и профессиональные создатели не могут продолжать производить ценные материалы.
Беспокойство исследователей: модели знают больше, чем заявляют
Еще один аспект, подчеркнутый исследованием, — это улучшение способности новейших языковых моделей понимать и воспроизводить тонкие различия между человеческим языком и языком, сгенерированным искусственным интеллектом. Кроме того, исследователи подчеркивают возможное наличие «временного смещения», поскольку языки со временем эволюционируют. Чтобы нейтрализовать этот вид искажения, тесты проводились на двух моделях (GPT-4o и GPT-4o Mini), обученных в течение одного и того же временного периода.
Несмотря на то, что доказательства ограничены конкретным случаем — OpenAI и тексты O’Reilly — авторы считают, что это явление может быть распространенным и системным в секторе генеративного искусственного интеллекта.
К легальному рынку данных для обучения?
Исследование завершается более широким размышлением: необходимо построить систему, в которой разработчики ИИ могут легально получать доступ к данным для обучения через лицензионные соглашения и прозрачные компенсации для создателей контента.
Некоторые компании уже разрабатывают бизнес-модели в этом направлении. Это случай с Defined.ai, платформой, которая продает данные для обучения, гарантируя согласие авторов и удаляя всю личную идентифицируемую информацию. Регулируемая индустрия может представлять собой законную и устойчивую альтернативу текущему непрозрачному поведению некоторых крупных компаний в области ИИ.
Роль политики: Европа может стать пионером
Отчет также предлагает нормативный аспект: вступление в силу нового AI Act Европейского Союза, который предусматривает обязанности по раскрытию информации для обучения моделей, может запустить добродетельную спираль. Если правила будут четко определены и действительно применены, правообладатели наконец смогут узнать, когда и как используются их произведения.
Это был бы важный шаг для создания законных рынков, где контент создателей действительно признается как экономические активы, используемые ИИ.
Не только OpenAI: исследование, указывающее на все более частую практику
Посредством детального анализа 34 книг издательства O’Reilly Media, исследователи предоставили эмпирические доказательства, которые предполагают, что OpenAI, вероятно, обучила свою модель GPT-4o также на данных, которые не являются публичными и защищены авторским правом.
Если это подтвердится, это будет потенциально серьезным нарушением не только норм о защите авторских прав, но и принципов прозрачности, согласия и справедливости, которые крупные технологические компании должны соблюдать в эпоху, когда искусственный интеллект все глубже влияет на наше общество и нашу экономику.

