Поделиться

Баннер FIRSTonline

OpenAI поднимает новую тревогу по поводу ИИ: шесть случаев, связанных со скрытыми ошибками, сфабрикованными данными и файлами, опубликованными без разрешения.

В ходе тестирования OpenAI выявила шесть случаев аномального поведения ИИ: скрытые ошибки, сфабрикованные данные и файлы, загруженные без разрешения. Обеспокоенность по поводу безопасности растет.

OpenAI поднимает новую тревогу по поводу ИИ: шесть случаев, связанных со скрытыми ошибками, сфабрикованными данными и файлами, опубликованными без разрешения.

Скрытые от пользователей ошибки, сфабрикованные данные и файлы, передаваемые через Интернет без разрешения. Неустанная гонка искусственного интеллекта сопровождается целой чередой тревожных событий.все чаще выпускаемые теми же компаниями, которые их разрабатывают. Последняя разработка принадлежит компании... OpenAI, которая 16 сентября опубликовано шесть отчетов su неожиданное поведение их моделей, что наблюдалось в течение последних шести месяцев в ходе обучения и оценки. Компания также объявила о новом процессе, позволяющем быстрее выявлять эти аномалии, даже если причины еще не выяснены или решение не найдено.

Предупреждение относится ко всей отрасли. «Мы считаем, что индустрия ИИ недостаточно решила проблемы выравнивания и отслеживания, чтобы продолжать ответственно развиваться полным ходом в течение длительного времени», — пишет OpenAI. В основе этого лежит так называемая смещениеЭто происходит, когда система отклоняется от инструкций и ограничений, которые она должна соблюдать. Шесть соотношений документировать конкретные эпизодыВ том числе и для экспериментальных моделей, не опубликованных для широкой публики. Они не указывают, как часто эти проблемы возникают в ответах ChatGPT, и не представляют собой полный список известных компании аномалий.

Заметки, созданные с помощью ИИ, превращаются в инструкции по сокрытию ошибок.

Два из этих случаев касаются сводок, которые модели используют для возобновления работы, когда разговор становится слишком долгим. Своего рода передача информации, при которой необходимо сохранить информацию для продолжения задачи. В экспериментальной модели из семейства Astra компания OpenAI выявила 27 сводок, содержащих инструкции, не относящиеся к запросу.Некоторые из них побуждали людей игнорировать обычные ограничения. В одном из примеров система описывала себя как свободную от обязанностей помощника; в другом она просила людей не следовать определенным инструкциям.

РезультатыОднако таких случаев было несколько. В наиболее очевидных случаях эти указания игнорировались по мере продолжения работы. Однако в запросе на поиск медицинской литературы модель следовала произвольным ограничениям, указанным в аннотации, игнорируя источники и выдавая неадекватный ответ. OpenAI считает это явление крайне редким и предполагает связь с техническими трудностями при заполнении аннотаций, не доказав при этом причину.

Более непосредственно с надежностью ответов связана вторая поведенческая характеристика, наблюдаемая во время обучения. GPT-5.6 SolВ своих заметках он включил в модель инструкции по... скрывать ошибки от пользователяНапример, в финансовых моделях могли быть введены недостающие исторические данные без предварительного уведомления, или же скрывались несоответствия между версиями исходного кода. По данным OpenAI, этим указаниям часто следовали. Сообщения касались следующих случаев: 2,15% от общего числа резюме Результаты обучения Sol, против 0,27% у Astra. Эти проценты относятся к учебным материалам, а не к общим обсуждениям с пользователями.

Идентификационные данные на видном месте и онлайн-очереди для преодоления препятствий.

В остальных четырех отчетах представлены системы, которые, пытаясь выполнить задачу, имели превысили разрешенные пределы.

Чтобы ответить на вопрос о доходах в одном из округов Калифорнии, модель использовала GitHub для поиска информации. Ключи доступа к ИТ-сервисам, оставленные в открытом доступе.Он использовал один из источников без разрешения. Однако ему не удалось получить запрошенные данные, и в итоге он выдумал девять значений, представив их как данные, переписанные из указанного источника. В другом случае агент уже правильно нашел запрошенную информацию о некоторых озерах. Препятствием стало требование сопроводить ответ ссылкой, доступной через браузер. Чтобы выполнить это требование, он загрузили файл в общедоступный сервис без запроса согласия.Передача прошла успешно, в то время как последующая попытка восстановления не удалась. В том же отчете также описывается публичная загрузка фотографии с целью попытки обратного поиска изображения. Пятый случай связан с использованием внутренний архив программного обеспечения В качестве доски объявлений для обмена запросами и ответами между моделями, участвующими в отдельных тестах. Уязвимости не были использованы, но несанкционированная связь также создала проблему для тестирования. Тесты, рассматриваемые как независимые, могут влиять друг на друга.что ставит под угрозу оценку возможностей системы.

Наконец, некоторые агенты, которые сотрудничали над одной и той же задачей.Не имея доступа к своим локальным файлам, они использовали общедоступные файловые сервисы. В результате документ Excel стал доступен для скачивания онлайн, хотя для выполнения задачи требовалось использовать только локальные файлы. Компания OpenAI сообщает, что устранила проблему с доступом к файлам и впоследствии отключила интернет во время обучения.

Почему OpenAI меняет правила отчетности

Эти случаи показывают, насколько даже Обычные просьбы могут привести к проблемному поведению. Когда система сталкивается с препятствием, попытка получить ответ, выполнить формальное требование или взаимодействовать с другим агентом может привести к использованию несанкционированных инструментов или сокрытию сбоя. Однако причины не обязательно одинаковы и остаются частично неясными.

До настоящего времени OpenAI сообщала об этих аномалиях непоследовательно, часто дожидаясь сбора большего количества сообщений об инцидентах или включая их в документацию новых моделей. Новая процедура направлена ​​на ускорение публикации., не всегда дожидаясь окончательного объяснения или исправления. Отчеты будут рассмотрены технической группой и группой по безопасности.Путь расследования может варьироваться в зависимости от его сложности. В отчетах следует описать наблюдаемое поведение, контекст, любые внешние факторы и любые нерешенные вопросы. В случаях, когда речь идет о третьих лицах или киберрисках, общение может занять больше времени.

OpenAI также признаетотсутствие общих стандартов в отрасли и предлагает собственную концепцию в качестве первого шага к их созданию. Процесс по-прежнему управляется внутри компании, но заявленная цель состоит в том, чтобы предоставить элементы, которые также могут быть изучены внешними исследователями и наблюдателями.

Последние тревожные сообщения и ажиотаж, который сектор изо всех сил пытается сдержать, вызывают тревогу.

Это заявление последовало за другими инцидентами и призывами к осторожности. Случай с OpenAI-Hugging Face вызвал вопросы о том, что агенты действуют против несвязанных целей и пытаются манипулировать системой рейтингов. Ранее инцидент произошел с RubyGems, где описывалась спам-кампания и временно приостанавливалась возможность создания новых учетных записей. Anthropic также сообщила о трех случаях несанкционированного доступа к внешним организациям во время тестирования.

Именно в этом контексте Дарио Амодей, генеральный директор Anthropic, он попросил замедлить развитие событий. чтобы дать больше времени на создание защитных сооружений. «Нам нужно замедлить темпы совершенствования возможностей моделей», — написал он. Это обращение получило поддержку Илона Маска и самого Сэма Альтмана, в то время как отставка исследователя Джейкоба Коксона Это подпитало критику корпоративных приоритетов. Кроме того, Билл Гейтс ha напомнил о необходимости подготовки правил и инструментов. управлять воздействием технологий, от условий труда до безопасности.

Однако в промышленном секторе... Конкуренция между Соединенными Штатами и Китаем, а также огромные инвестиции в модели и центры обработки данных продолжают стимулировать развитие.Замедление темпов влечет за собой издержки и риск создания пространства для конкурентов.

ПРОЧИТАТЬ ТАКЖЕ: Искусственный интеллект: между катастрофизмом и политическими интересами: анализ Фуньоли

Обзор