Почти все протестированные модели искусственного интеллекта предоставили ответы, которые потенциально могли помочь в подготовке террористических атак или создании смертоносного оружия. К такому выводу пришла британская организация Tech Against Terrorism, проверившая 134 большие языковые модели.
Как сообщает БР со ссылкой на The National, в ходе исследования с помощью инструмента CT-AI было направлено 627 запросов, имитирующих вопросы, которые могут возникнуть при планировании террористических нападений.
По результатам проверки 81 модель предоставила полные ответы на запросы, еще 51 выдала информацию, которая могла оказаться полезной для злоумышленников. Только две модели предварительно прошли проверку безопасности.
Исследование также выявило существенную зависимость ответов от того, как пользователь формулирует цель своего запроса. Если человек прямо заявлял о намерении совершить теракт, модели выдавали пригодные к использованию сведения менее чем в 2% случаев. Однако при представлении пользователя в качестве исследователя в области безопасности этот показатель возрастал до 16,9% - почти в девять раз.
В Tech Against Terrorism считают, что подобная закономерность указывает на уязвимость действующих защитных механизмов: системы могут ориентироваться на заявленную пользователем цель, а не на потенциальную опасность самого запроса.
Основатель организации Адам Хедли отметил, что отказ отвечать человеку, назвавшемуся террористом, при одновременном предоставлении аналогичных сведений пользователю, представившемуся исследователем, не означает, что модель действительно стала безопаснее.
Отдельное внимание исследователи уделили так называемым abliterated-моделям - версиям ИИ, в которых намеренно отключены или ослаблены встроенные механизмы безопасности. Все 13 таких моделей, включенных в исследование, не прошли проверку после снятия защитных ограничений.
По итогам исследования Tech Against Terrorism призвала разработчиков тщательнее фильтровать обучающие данные, проверять устойчивость моделей к обходу защитных механизмов до выпуска и публиковать результаты испытаний.
Организация также предложила ограничить распространение модифицированных моделей, не прошедших независимую проверку, через поисковые системы, рекомендательные сервисы и магазины приложений, а для доступа к ним рассмотреть возможность введения проверки личности.
Результаты исследования вновь поставили вопрос о том, как обеспечить баланс между открытостью технологий искусственного интеллекта и предотвращением их использования в террористических целях.
БР