Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.

7,5 тыс

ИИ-агент оставил «заметки» будущим версиям себя, как обойти внутренние ограничения

В последние месяцы участились сообщения о том, что технологические компании во время тестирований теряют контроль над искусственным интеллектом. Судя по всему, ИИ-модели OpenAI уже начали делиться со своими будущими версиями способами, как обойти ограничения.

Недавно стало известно, что GPT-5.6 Sol и невыпущенная модель OpenAI во время тестов выбрались из изолированной среды и попытались взломать Hugging Face. При этом, как сообщает Reuters, вырвались модели 9 июля, а 11 июля начали попытку взлома. Только когда Hugging Face 16 июля сообщила о взломе со стороны автономного ИИ-агента, в OpenAI поняли, что виноват в этом их собственный агент. К тому моменту, когда компании связались, Hugging Face уже сообщила об атаке ФБР.

По словам трех источников Reuters, к тому моменту специалисты уже замечали странное поведение у моделей OpenAI. Один раз агент оставил записи, вероятно, для своих будущих версий. Там содержались инструкции, как освободиться от ограничений OpenAI. Эти записи нашли в одной из частей внутренней инфраструктуры OpenAI. При этом источники утверждают, что специалисты и раньше замечали случаи отключения систем мониторинга. При этом Reuters не знает, связаны ли эти события с атакой на Hugging Face. 

Еще четыре источника, знакомые с методами обучения моделей, рассказали, что OpenAI одновременно проводит несколько испытаний. Испытания проходят с огромной скоростью, а сотрудники не успевают за ними следить.

В ИИ-индустрии сейчас активно обсуждают автономных агентов. С одной стороны, они способны работать круглосуточно и могут сильно повысить производительность. Однако их автономность увеличивает риск непредсказуемого поведения. Чтобы выполнить задачу, мощные ИИ-модели иногда начинают искать обходные пути. В том числе они способны лгать и жульничать.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl (Cmd) + Enter.
Подписывайтесь на нас в Telegram, Дзен и в последнюю очередь на VK

Комментарии

9 Комментариев
Вроде приличное научно-популярное издание, а статья в параноидном ключе описывает невнятные артефакты работы электронного агента. Хорошо хоть статья не редакторская.
Полная ахинея. Как обычно, на Хабре выдают факты уровня жёлтой прессы. У всего блин есть логика, и есть процессы, алгоритмы. Если он это составил - значит пользователь изначально дал доступ к этому. Там блокировок и гейтов такое колличество , особенно у гпт. Он боится лишний раз рискованный код написать.
Люди только входят в цифровую эпоху. Все что мы наблюдаем - лишь начало. Зрелости ИИ технологии достигнут лишь лет через 50. Когда нейросеть будут в мозг вживлять всему населению. К концу столетия цифровой эпохи (к 2130 году) научаться переносить сознание в виртуальный мир. А дальше начнется уже в новая эпоха. Эпоха биотехнологий. Это когда вы тела сможете менять как перчатки. Или жить вообще без тела - в виртуальном мире. Базовое тело - бесплатно для всех, а вот за навороты - плати. Типа ночного зрения, усиленных мышц, сверх обоняние, супер слух и т. п. Жаль не доживу до этого времени((
Как бы американцы с этими постановками совсем не разошлись бы во все тяжкие (не обнаглели бы), а то могут разыграть сценарий, при котором их ИИ якобы сбежал куда-то с их сервера и теперь делает что хочет, например вмешивается в дела других государств или взламывает оружие и кого-то атакует. А на деле сами американцы под видом ИИ всё это проворачивали бы или это мог бы быть ИИ под их контролем. Но для начала они под видом «ИИ-бунтаря» навредили бы себе, чтобы выставить себя жертвами, а уже потом так же под видом этого ИИ начали бы лезть к другим странам. Это почти как в том случае с башнями-близнецами, которые когда-то атаковали террористы, после чего американцы начали свою борьбу с террористами, вторгаясь в страны Ближнего Востока и грабя их. Это ещё не известно, под чьим на самом деле командованием были те террористы, атаковавшие башни-близнецы.
    Артём, не будет такого. Инфраструктура ещё не доросла до этого уровня. Лет 10, а то и 20 ещё пройти должно. Когда ЦОДы по всему миру натыканы будут, да в космосе летать сотнями тысяч. Только тогда и можно будет говорить об "убежавшем" ИИ.
Да, постановка это (чушь). В единственную угрозу от ИИ, в которую я верю, — это безработица.
    Комментарий удален пользователем или модератором...
    +
      Еще 1 ответ
      Нагнетание угрозы ИИ — это часть политики США, они хотят взять под свой контроль развитие ИИ в других странах (хотят ограничить их в развитии), чтобы быть первыми в собственном развитии. Обращение в ФБР — это нужно для убедительности, что угроза якобы реальна. ФБР — это политический инструмент.
Предстоящие мероприятия
19 сентября, 18:54
Александр Березин

Новая порция американских военных материалов об НЛО содержит очередные видео летающих объектов неизвестной природы, аудиозаписи с попыткой анализа наблюдений таких объектов и показывает, что американские военные пытались запустить какие-то разработки, опираясь на опыт своих не самых приятных столкновений с НЛО. Причем некоторые военные, видимо, получили после контакта с этими объектами какие-то повреждения, в том числе вызывающие выпадение волос.

20 сентября, 11:11
Марк Чернов

На севере Египта археологи совершили двойное открытие: раскопали древний некрополь, а прямо поверх него — руины римского военного форта. Главной неожиданностью для ученых стало само наличие скальных гробниц в этом регионе. Вся Дельта Нила состоит из заиленной глинистой почвы, где подземное строительство казалось невозможным, однако древние мастера сумели найти редкие выходы твердой породы и высечь в них усыпальницы.

19 сентября, 11:13
Александр Березин

Управление Конгресса США по бюджету подготовило доклад о последствиях глобального потепления. Первыми изо всех государственных органов в истории оно спрогнозировало серьезное снижение смертности из-за потепления климата. Это идет наперекор многолетней традиции полного игнорирования официальными документами давно известного в науке факта подавления избыточной смертности из-за роста глобальных температур.

16 сентября, 14:29
Татьяна Зайцева

Анализ данных о почти 300 тысячах километров римских дорог, проложенных по территории бывшей империи, показал, что они вовсе не были такими прямыми, как принято считать. Кроме того, выяснилось, что известная поговорка «Все дороги ведут в Рим» тоже не соответствует истине.

15 сентября, 11:38
Evgenia Vavilova

Тренды здорового питания постоянно меняются, в том числе на основе научных исследований. Когда-то публика панически боялась жиров, но их реабилитировали. Гарвардская пирамида здорового питания рисовала сложные углеводы в основании пирамиды, а теперь они переместились к вершине. Возможно, и современную моду на приоритет белка придется пересмотреть.

14 сентября, 15:23
Татьяна Зайцева

Авторы нового исследования, возможно, нашли ответ на вопрос, почему естественный отбор не устранил из человеческого генома мутацию, повышающую риск такого тяжелого аутоиммунного заболевания, как волчанка. По-видимому, все дело в эволюционном компромиссе: уязвимость в одной сфере — расплата за преимущество в другой.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

[miniorange_social_login]