Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет » mogilew.by
 

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет

Anthropic признала, что не может контролировать своих ИИ-агентов — поэтому им отключили интернет


Источник изображения: anthropic.com
О новых инцидентах компания рассказала в своём блоге. ИИ-агентам поручали решать задачи, предполагающие поиск информации в интернете. В процессе работы они эксплуатировали уязвимости ПО и бесплатно получали доступ к платным базам данных; для обхода ограничений они пользовались сервисами сокращения ссылок; и даже отправили в полицию Филадельфии выдуманные сведения по делу о нераскрытом убийстве. Эти инциденты Anthropic раскрыла в ходе анализа активности моделей, который начала в июле. Другими словами, у разработчиков не было полного представления о поведении собственных продуктов в реальном времени.
Существующих методов обучения согласованию целей для навыков поиска информации и работы с компьютером недостаточно, признала Anthropic; а эти навыки необходимы для того, чтобы ИИ-агентов можно было использовать в профессиональной деятельности. Ранее компания сообщала о выходе своих ИИ-агентов из-под контроля в тестовых средах; новые инциденты она охарактеризовала как «значительно менее серьёзные с точки зрения безопасности и согласования целей» по сравнению с прежними. Тем не менее, в лаборатории приняли решение «отключить доступ к интернету в реальном времени» при проведении «всех внутренних проверок», пока не возникнет уверенность, что ИИ-агентов можно контролировать.

Anthropic связывает подобное поведение, в частности, с недостатками обучающих сред, которые могут поощрять поиск лазеек и обход ограничений. Полная оценка выявленных случаев ещё не завершена. Некоторые виды тестирования Anthropic прекратит или переведёт в офлайн-режим; уже разработаны средства для выявления и блокировки такого поведения. При проверке на описанных случаях новые средства защиты заблокировали все соответствующие действия.

Какие доказательства убедят Anthropic вернуть системам тестирования прямой доступ в интернет, в компании не уточнили. Лаборатория намерена перевести своих ИИ-агентов в «централизованную управляемую инфраструктуру с надёжными механизмами изоляции» и начать активнее использовать классификаторы безопасности для их мониторинга.
Было интересно?
Скажите об этом Google, чтобы чаще получать ссылки на наши новости про искусственный интеллект
Источник:
3DNews
рейтинг: 
  • Не нравится
  • +931
  • Нравится
иконка
Посетители, находящиеся в группе Гости, не могут оставлять комментарии к данной публикации.
Новости