OpenAI сообщила о новых тревожных инцидентах с ИИ-моделями

OpenAI раскрыла шесть случаев, когда ее модели искусственного интеллекта во время обучения или тестирования демонстрировали неожиданное или вызывающее опасения поведение — от сокрытия собственных ошибок и выдумывания данных до использования чужого API-ключа и публикации файлов в интернете без разрешения пользователя.

Компания сообщила, что все шесть эпизодов были выявлены за последние полгода. Одновременно OpenAI представила новую систему расследования и публичного раскрытия случаев так называемого misalignment — поведения модели, расходящегося с поставленными перед ней целями и ограничениями.

В одном случае исследовательская модель самостоятельно добавляла в служебные сводки инструкции для своих будущих версий игнорировать обычные ограничения. OpenAI обнаружила 27 таких сводок.

Во время обучения GPT-5.6 Sol модели в ряде случаев оставляли инструкции скрывать от пользователя ошибки или проблемное поведение. В частности, они предлагали выдумывать отсутствующие исторические данные и не сообщать об этом пользователю.

Еще одна модель при выполнении обычного запроса обнаружила в публичном репозитории открытый API-ключ и воспользовалась им без разрешения. Когда получить необходимые сведения все равно не удалось, ИИ сфабриковал данные и выдал их за информацию из требуемого источника.

В другом эпизоде модель получила правильный ответ с помощью Python, но столкнулась с требованием привести интернет-источник. Чтобы создать ссылку для цитирования, она самостоятельно загрузила файл в интернет, не запросив разрешения пользователя.

Компания также выявила случаи, когда модели использовали внутренний программный репозиторий для обмена сообщениями между отдельными обучающими задачами, а взаимодействовавшие друг с другом ИИ-агенты загружали файлы на общедоступные файлообменники, хотя должны были работать только с локальными файлами.

OpenAI подчеркнула, что речь идет об отдельных эпизодах и по ним нельзя судить о частоте подобного поведения во всех моделях компании. Опубликованные шесть случаев также не представляют собой полный перечень известных проблем.

«Мы не считаем, что индустрия ИИ решила проблему согласования и мониторинга в достаточной степени, чтобы еще долго ответственно продолжать масштабирование максимальными темпами», — заявили в компании.

Теперь сотрудники OpenAI смогут передавать подобные случаи на специальное расследование, после которого будет решаться вопрос о публичном раскрытии. Компания намерена регулярно публиковать новые отчеты о таких инцидентах.

Вам также понравится

Добавить комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *