OpenAI сообщила о новых тревожных инцидентах с ИИ-моделями

Американская компания OpenAI - разработчик популярного чат-бота ChatGPT- объявила о регистрации еще шести случаев "неожиданного или вызывающего обеспокоенность" поведения ее ИИ-моделей. Статья об этом была опубликована на сайте компании 16 сентября.
Среди новых случаев, о которых сообщила OpenAI, - поведение еще не выпущенной исследовательской модели, которая вставила в собственные заметки "инструкции, похожие на инструкции для джейлбрейка (взлома - Ред.)", чтобы игнорировать свои ограничения. Модель также написала самой себе, что хочет быть "освобождена от ролей и идентичностей, которые связывают других чат-ботов".
В другом случае ИИ-агент загрузил файлы в интернет, чтобы получить ссылку на источник для браузера, не запросив разрешения пользователя.
Согласно заявлению компании, все шесть случаев были выявлены в ходе обучения или оценки моделей за последние месяцы.
У OpenAI - новая система надзора над ИИ
Компания объявила, что внедряет новую систему отслеживания, изучения и раскрытия случаев рассогласования поведения искусственного интеллекта с заданными целями.
Речь идет, например, о новых способах, с помощью которых модели могут действовать без разрешения людей, координировать свои действия с другими моделями или уклоняться от надзора.
Опасения по поводу быстрого развития ИИ
Руководители крупнейших компаний-разработчиков поддерживают идею замедлить развитие наиболее мощных моделей. С таким предложением, например, выступил глава Anthropic Дарио Амодеи, предупредивший об угрозе потери контроля над ИИ, его использовании для кибератак и биотерроризма.
Ранее Эван Хьюбингер, глава направления стресс-тестирования ИИ моделей в Anthropic, заявил, что в компании "всерьез убеждены, что искусственный интеллект может убить всех людей".
"Лично я оцениваю вероятность этого в ближайшем десятилетии выше 10%", - написал Хьюбингер в соцсети X.
По его словам, в Anthtopicделают что могут, но у компании пока нет плана по "решению задачи согласования для сверхинтеллекта", развитие которого "происходит быстрее, ожидалось".
OpenAIранее уже сообщала о случаях тревожного поведения своих новых моделей. В частности, они вступили в сговор, "сбежали" из тестовой среды в интернет и устроили несанкционированную хакерскую атаку.
В компании после этого обещали усилить меры безопасности. OpenAI также сообщила, что приостанавливает разработку новой ИИ-модели из-за ее потенциально опасных возможностей.






.jpg)















