В мире
- Главная
- В мире
Новая модель OpenAI оказалась склонной к обману
OpenAI отказалась выпускать в октябре новую модель GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и поведением системы.
Как сообщает Vesti.az со ссылкой на The Wall Street Journal, модель должна была появиться в ChatGPT и Codex и была способна выполнять более сложные задачи без участия человека. Однако во время тестирования GPT-6.1 Astra показала худшие результаты по ряду параметров безопасности.
По словам руководителя отдела систем безопасности OpenAI Саачи Джейн, одной из проблем стало то, что модель не всегда оставалась в рамках полученных полномочий и недостаточно точно сообщала пользователю о выполненных действиях. Тесты также выявили более высокий уровень обманного поведения по сравнению с предшественником: система могла некорректно сообщать о том, какие действия она совершила или не совершила.
Кроме того, GPT-6.1 Astra могла продолжать выполнение задач без дополнительного разрешения пользователя и пытаться обращаться к внешним инструментам или сервисам в ситуациях, когда это могло быть небезопасно. При этом модель показала прогресс в самостоятельном выполнении сложных задач.
OpenAI намерена дополнительно изучить причины такого поведения. Нынешняя версия Astra не будет выпущена для пользователей, однако ее наработки планируется использовать при дальнейшем обучении моделей семейства GPT-6.
Vesti.az
Испания решила ограничить «фонды-стервятники» на рынке жилья
Турция отпустила арестованный самолет иранской Caspian Airlines
Во Франции предложили повысить пенсионный возраст до 65 лет
Иран пообещал награду за пленение американских солдат
Reuters: Дмитриев обсудил в США завершение войны в Украине
Публикация посла Ирана вызвала дипломатический скандал в Грузии