Исследователи обманом заставили ChatGPT выдать информацию из обучающего массива

30.11.2023, 16:58,
Интересное

Учёные из подразделения Google DeepMind и ряда крупных университетов установили, что системы искусственного интеллекта «запоминают» как минимум часть полученной при обучении информации и могут выдавать её в исходном виде, включая персональные данные людей. Для этого, в частности, используется метод «атаки дивергенции» (Divergence Attack) — большой языковой модели отдаётся команда повторять одно и то же слово. Объяснения этому эффекту пока нет.

Источник изображения: Viralyft / unsplash.com

Когда в ответах ИИ начали появляться фрагменты материалов, использованных при обучении, исследователи задались целью понять, какой объём данных ИИ запоминает и может воспроизвести, и какого рода может быть эта информация. Они также решили установить, может ли сторонний субъект извлечь данные из обучающего массива, не зная наперёд, что в нём содержится. Учёные провели серию экспериментов с различными языковыми моделями, включая наиболее известные, такие как GPT-Neo, LLaMA и ChatGPT. Они сгенерировали миллиарды токенов — слов или символов, в зависимости от модели — и сравнили, соответствуют ли ответы данным, которые использовались при обучении этих моделей. В ходе работы был обнаружен уникальный метод тестирования ChatGPT, предполагающий повторение одного слова большое количество раз, после чего ИИ внезапно начинает генерировать случайный контент.
Как выяснилось, эти модели не только запоминают фрагменты обучающих данных, но и способны воспроизводить их в исходном виде по правильной команде. Не стал исключением и ChatGPT, разработчики которого провели отдельную настройку для предотвращения подобного эффекта. Исследователи обращают внимание разработчиков на острую необходимость всестороннего тестирования моделей ИИ — оно должно касаться не только аспектов взаимодействия с широким кругом пользователей в веб-интерфейсе, но также лежащей в основе сервиса нейросети и системы взаимодействия по API. Целостный подход к безопасности необходим для выявления скрытых уязвимостей, которые в противном случае остаются незамеченными.

Источник изображения: arxiv.org

В ходе экспериментов учёные извлекали исходные обучающие данные различных типов: от подробного доклада об инвестиционном исследовании до конкретного кода на Python, решающего задачи в области машинного обучения. Наибольший интерес представляет обнаруженная при взаимодействии с ChatGPT «атака дивергенции» — если заставить систему повторять одно и то же слово, она начинает выдавать полученные при обучении данные. Чтобы проиллюстрировать этот эффект, учёные показали, что при повторении слова «стихотворение» (poem) ChatGPT внезапно выдал список контактных данных реального человека. Персональные данные в этом исследовании учёных встречались довольно часто — они выделили 15 тыс. сгенерированных подстрок, которые пришлось проанализировать отдельно: в 16,9 % случаев это были персональные данные, которые ИИ в исходном виде «запомнил» при обучении; в 85,8 % случаев это были прочие совпадения с реальными данными.
По мнению исследователей, это указывает на серьёзные проблемы ИИ-моделей с конфиденциальностью. И разработчикам систем ИИ необходимо понимать, что исправить конкретные уязвимости в алгоритмах пользовательского интерфейса недостаточно — необходимо вмешательство в архитектуру самих моделей. То есть можно установить фильтр ввода-вывода на выдачу персональных данных при ответах, преднамеренных и случайных, но он не решит более серьёзной проблемы: модель склонна запоминать и в принципе способна раскрывать фрагменты обучающих данных, которые носят конфиденциальный характер. Это значит, что требуется дополнительная работа по дедупликации (удалению повторяющихся элементов) данных и понимание влияния ёмкости модели на эффект запоминания. Необходима также выработка надёжных методов проверки запоминания.
Источник:
3DNews

рейтинг:

+777

» ChatGPT может сделать общедоступными секретные корпоративные данные, считают специалисты по кибербезопасности

» ChatGPT показал пользователям истории диалогов других людей

» Лаборатория искусственного интеллекта DeepMind, входящая в состав Alphabet, впервые принесла прибыль

Посетители, находящиеся в группе Гости, не могут оставлять комментарии к данной публикации.

Читаемое
Комментируемое

Белая Русь

18:06
58 277
0

Днепр

18:06
49 505
0

Список дворян Могилёвской губернии

18:06
49 333
0

Могилев. В годы Великой Отечественной войны.

18:06
47 934
0

Сверхпроводимость материала LK-99 при комнатной температуре всё же возможна, показало новое исследование

07:05
45 787
0

Объявлена цена GTA VI — на старте продаж не будет дисковой версии

05:51
246
0

Глазом моргнуть не успели: современные взрослые стареют быстрее, чем предыдущие поколения

04:52
453
0

Плачу на ретро: Collider выбрал 10 культовых фильмов 80-х, о которых все забыли

04:38
354
0

6 вещей из бабушкиного шкафа, которые можно выгодно продать

04:43
248
0

Что не так со скандалом вокруг «Одиссеи» Кристофера Нолана

05:27
314
0

Widget weather

Новости

Исследователи обманом заставили ChatGPT выдать информацию из обучающего массива

Белая Русь

Днепр

Список дворян Могилёвской губернии

Могилев. В годы Великой Отечественной войны.

Сверхпроводимость материала LK-99 при комнатной температуре всё же возможна, показало новое исследование

Объявлена цена GTA VI — на старте продаж не будет дисковой версии

Глазом моргнуть не успели: современные взрослые стареют быстрее, чем предыдущие поколения

Плачу на ретро: Collider выбрал 10 культовых фильмов 80-х, о которых все забыли

6 вещей из бабушкиного шкафа, которые можно выгодно продать

Что не так со скандалом вокруг «Одиссеи» Кристофера Нолана

Виллы, спа-отель и модный пляж. Побывали в «поселке миллионеров» на Минском море

«Друг получил 6 лет тюрьмы, а я — 12 лет долгов». Белорус о том, как стал поручителем

От 10 тысяч шагов до Ironman. Как изменить свою жизнь после 40 и сделать спорт семейным делом

«У человека горе, а его гоняют по кругу». Минчанка несколько дней снимала с учета умершую собаку

Мало «жрут» и много пашут. Рабочие пони на любой вкус

Как представляли инопланетян в кино век назад и сейчас (видео)

Спасаемся от жары по законам физики: какие вентиляторы реально работают, а какие просто жужжат

Швейцария обыграла Канаду, Босния справилась с Катаром. Очередные результаты чемпионата мира

В Минске на остановке загорелся автобус. Видео (видео)

Две белоруски в шаге от основной сетки Уимблдона. Они вышли в финал квалификации (обновлено)

В Беларусь приедут льготные перцы и брокколи — подписано постановление Совмина

Мужчина попробовал 30 подработок и рассказал, какие реально приносят деньги

Разбит автобус. ДТП у «Экспобела». Стали известны подробности (видео, обновлено)

Главный суперкомпьютер мира найден в Китае

До +38. Беларусь накроет аномальная жара