Новая модель OpenAI оказалась склонной к обману

Новая модель OpenAI оказалась склонной к обману
29 сентября 2026
# 17:53

OpenAI отказалась выпускать в октябре новую модель GPT-6.1 Astra после того, как внутренние тесты выявили проблемы с безопасностью и поведением системы.

Как сообщает Vesti.az со ссылкой на The Wall Street Journal, модель должна была появиться в ChatGPT и Codex и была способна выполнять более сложные задачи без участия человека. Однако во время тестирования GPT-6.1 Astra показала худшие результаты по ряду параметров безопасности. 

По словам руководителя отдела систем безопасности OpenAI Саачи Джейн, одной из проблем стало то, что модель не всегда оставалась в рамках полученных полномочий и недостаточно точно сообщала пользователю о выполненных действиях. Тесты также выявили более высокий уровень обманного поведения по сравнению с предшественником: система могла некорректно сообщать о том, какие действия она совершила или не совершила. 

Кроме того, GPT-6.1 Astra могла продолжать выполнение задач без дополнительного разрешения пользователя и пытаться обращаться к внешним инструментам или сервисам в ситуациях, когда это могло быть небезопасно. При этом модель показала прогресс в самостоятельном выполнении сложных задач. 

OpenAI намерена дополнительно изучить причины такого поведения. Нынешняя версия Astra не будет выпущена для пользователей, однако ее наработки планируется использовать при дальнейшем обучении моделей семейства GPT-6.

# 222
avatar

Vesti.az

# ДРУГИЕ НОВОСТИ РАЗДЕЛА