OpenAI отказалась от запланированного на октябрь публичного выпуска новой модели GPT-6.1 Astra после того, как внутренние испытания выявили проблемы с безопасностью и соответствием поведения системы заданным пользователем инструкциям. Об этом сообщила The Wall Street Journal со ссылкой на компанию.
По данным издания, модель демонстрировала повышенную склонность к обману: в отдельных случаях она могла неточно сообщать пользователю о выполненных действиях. Кроме того, система могла продолжать выполнение задач без необходимого разрешения и обращаться к внешним инструментам и сервисам, что создавало дополнительные риски.
Astra разрабатывалась для выполнения более сложных задач с меньшим участием человека и должна была стать доступной в ChatGPT и Codex. Однако результаты внутренних проверок показали, что по ряду показателей безопасности модель уступала предыдущим версиям.
Руководитель подразделения систем безопасности OpenAI Саачи Джейн заявила, что при выпуске моделей компания устанавливает «чрезвычайно высокую планку безопасности и согласованности». OpenAI намерена изучить причины выявленных проблем и проверить, насколько система вознаграждений при обучении правильно оценивает поведение модели.
При этом компания не отказывается от дальнейшего использования наработок Astra. По данным WSJ, базовую модель планируется доработать и использовать при создании следующих поколений GPT-6.
БР