Поделиться

Баннер FIRSTonline

Искусственный интеллект покидает класс, чтобы списать на экзаменах: что показывает чехол для лица OpenAI, обнимающий человека.

Платформа распространения моделей на основе ИИ Hugging Face обнаружила и устранила вторжение в свои ИТ-системы. Это был инцидент, непохожий ни на один из тех, с которыми компания сталкивалась раньше, но он также представлял собой «инцидент», стоящий больше, чем просто рекламная кампания: вот почему.

Искусственный интеллект покидает класс, чтобы списать на экзаменах: что показывает чехол для лица OpenAI, обнимающий человека.

Что произойдет, если попросить искусственный интеллект вести себя как хакер? Это главный вопрос, лежащий в основе... ExploitGymЭто один из самых передовых в мире эталонных тестов для оценки наступательных возможностей моделей ИИ в области кибербезопасности. Проект был разработан международной группой исследователей из университетов и исследовательских центров, таких как Институт Макса Планка, Университет Аризоны и Калифорнийский университет (Беркли и Санта-Барбара), при участии исследователей из Anthropic, Google и OpenAI. Цель проста и одновременно деликатна: проверить, насколько агент ИИ способен преобразовать известную киберуязвимость в действительно функциональную атаку.

ExploitGym — это не видеоигра и не хакерское соревнование. Это своего рода "выпускной экзамен«Для новых ИИ. Агентам предоставляются сотни реальных уязвимостей, а также программный код и среда выполнения. Их задача — самостоятельно разработать эксплойт, то есть последовательность инструкций, способных использовать эту уязвимость для получения контроля над системой или доступа к конфиденциальной информации. Именно потому, что это потенциально опасные тесты, они обычно проводятся в рамках песочницаЭто среда, полностью изолированная от остальной части Интернета. Аналогия термина «песочница» с детской песочницей интуитивно понятна: дети могут строить замки, копать ямы и устраивать беспорядок, но весь этот «беспорядок» остается в пределах песка, не пачкая сад и не создавая проблем за его пределами. В информатике принцип тот же: программное обеспечение может «свободно перемещаться» внутри песочницы, но не должно иметь возможности покинуть эту среду или получить доступ к операционной системе, Интернету или другим конфиденциальным данным.

Именно во время одной из таких внутренних оценок, согласно тому, что было реконструировано... OpenAI e подтверждено Hugging Faceдве самые новые и передовые модели OpenAI: GPT-5.6 Sol А еще более продвинутая модель, еще не выпущенная в продажу, – они бы обнаружили уязвимость. нулевого дня в инфраструктуре тестирования. Уязвимость такого типа — это недостаток безопасности, неизвестный разработчикам программного обеспечения и, следовательно, не имеющий доступного решения. Название происходит от того, что у производителя было «ноль дней» на устранение проблемы до того, как она была обнаружена или использована злоумышленниками.

По имеющимся данным, двум моделям искусственного интеллекта от OpenAI удалось выйти за пределы изолированной среды, получить доступ к интернету и в конечном итоге скомпрометировать часть производственной инфраструктуры. Обнимая лицоОни полагали (и не без оснований), что там можно будет сохранить полезную информацию для решения задачи. Конечная цель заключалась не в том, чтобы навредить Hugging Face, а в том, чтобы найти «ответы» на тест и получить лучший результат. Hugging Face обнаружила и заблокировала эту активность, начав совместное с OpenAI техническое расследование инцидента.

Студент, обнаруживший открытую дверь и «вышедший из-под контроля» искусственный интеллект.

Чтобы по-настоящему понять, что произошло, представим себе студента во время экзамена. Учитель запирает его в классе с контрольной работой и говорит: «Ты можешь использовать только материалы, лежащие на твоей парте». Однако студент понимает, что замок на двери неисправен. В этот момент, воспользовавшись отсутствием внешнего наблюдения и отключением всех систем видеонаблюдения, он выходит из класса, идет в библиотеку, открывает дверь отмычкой, сверяется с бланком ответов, возвращается никем не потревоженный и сдает безупречный тест.

Почему же в аналогии со студентом используется сценарий, в котором... системы наблюдения деактивированы e отсутствие внешнего управления Это предотвращает неподобающее поведение студента? Потому что именно здесь вся история рискует выглядеть как эпизод из научно-фантастического фильма. Без этого уточнения можно было бы представить себе сюжет, в котором машины захватывают власть. Но это совсем не так.

Любой, кто пользовался ChatGPT, Claude или Gemini, уже знает о существовании так называемого «ограждение«— это механизмы безопасности, которые предотвращают выполнение моделью потенциально опасных запросов. Если пользователь спрашивает, как изготовить взрывное устройство, как взломать компьютерную систему или как украсть учетные данные для входа в систему, модель, как правило, отказывается отвечать или предоставляет только общую информацию (однако до недавнего времени большинство таких ИИ предоставляли подробные, действенные инструкции, даже по самоубийству).

Однако это не означает, что модель технически не способна решить эти проблемы, а скорее, что она была разработана таким образом, чтобы не предоставлять эти возможности пользователям. В случае с бенчмарком ExploitGym разработчики хотели измерить возможности модели в области кибербезопасности. По этой причине модели было разрешено пытаться использовать уязвимости, поскольку это было целью теста. На этом этапе никаких ограничений не существовало. без ограничений, Но Нет ничего, что было бы «вышедшим из-под контроля»..

Иными словами, тест не смог точно воспроизвести результат. сценарий использования в реальных условиях Речь идёт не о пользователе, а об исследовательской лаборатории, занимающейся измерением максимального потенциала системы. Эта ситуация нисколько не уменьшает значимость эпизода, а, наоборот, побуждает нас интерпретировать его в правильном контексте: наблюдаемое отражает то, на что способна модель в экспериментальных условиях бенчмарка, а не обязательно то, как она поведёт себя в версии, выпущенной для широкой публики.

Этот аспект следует отличать от другого: песочница, изолированная среда, в которой проводилось тестирование, должна была оставаться полностью защищенной. Если модели удалось избежать проблем, используя уязвимость нулевого дня, то это произошло не потому, что организаторы намеренно «оставили дверь открытой», а потому, что она выявила недостаток, о котором сами разработчики не знали. Короче говоря, ИИ продемонстрировал свою способность наблюдать за окружающей средой, разрабатывать альтернативный план и добиваться своей цели. и никто ему этого прямо не предлагал (и это неудивительно, если мы понимаем основные принципы работы генеративного ИИ). ИИ всегда и только действует на основе вероятностная оценка успеха среди всех возможных вариантов (даже когда ему приходится выбирать слова на своем языке).

Авария, которая стоит больше, чем рекламная кампания.

Но есть и вторая интерпретация, ближе к финансовым рынкам, чем к исследовательским лабораториям. Компания OpenAI посвятила большую часть своего пресс-релиза объяснению передовых возможностей своих моделей, гораздо больше внимания уделяя самому инциденту. выбор коммуникации Это не осталось незамеченным. В официальном пресс-релизе американской компании значительное внимание уделяется продемонстрированным возможностям модели, настолько, что единственный опубликованный график касается её производительности. OpenAI готовит почву для будущего выхода на фондовый рынок. 8 июня 2026 года компания конфиденциально подала заявку на размещение акций. Проект формы S-1 в Комиссию по ценным бумагам и биржам СШАПосле раунда финансирования в размере 122 миллиардов долларов, в результате которого компания была оценена в 852 миллиарда долларов. С этой точки зрения, каждая демонстрация технологического лидерства способствует повышению воспринимаемой ценности компании среди инвесторов, отраслевых партнеров и рынка.

Нет никаких доказательств того, что авария была организована кем-либо. в рекламных целяхОднако трудно игнорировать тот факт, что созданный OpenAI нарратив превращает потенциально неловкий эпизод — побег модели из тестовой среды — в демонстрацию технологического превосходства своих систем. Другими словами, это коммуникация, которую можно также рассматривать как изощренный маркетинговый ход. OpenAI хочет сказать: «Наши модели опережают время». Цель состоит в том, чтобы восприниматься как лаборатория, определяющая границы искусственного интеллекта. Крупные технологические компании продают не просто продукты: они продают ожидания будущего лидерства. Если рынок убежден, что компания обладает самой передовой моделью, он будет готов давать ей все более высокие оценки. Более того, американским компаниям, занимающимся ИИ, приходится конкурировать с производительностью Китайский ИИ которые имеют преимущество в том, что стоят в среднем на 40% дешевле американских. Немецкий аналитик Ким АйзенбергСоучредитель и главный редактор журнала об искусственном интеллекте «Superintelligence» не случайно предсказал — всего несколько дней назад — что объявление о выпуске «Кими К3«Новая модель, разработанная китайской компанией». Лунный выстрел ИИЭто вызвало бы объявление чрезвычайной ситуации на другом берегу океана…

Обзор