Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.

7,5 тыс

ИИ-агент оставил «заметки» будущим версиям себя, как обойти внутренние ограничения

В последние месяцы участились сообщения о том, что технологические компании во время тестирований теряют контроль над искусственным интеллектом. Судя по всему, ИИ-модели OpenAI уже начали делиться со своими будущими версиями способами, как обойти ограничения.

Недавно стало известно, что GPT-5.6 Sol и невыпущенная модель OpenAI во время тестов выбрались из изолированной среды и попытались взломать Hugging Face. При этом, как сообщает Reuters, вырвались модели 9 июля, а 11 июля начали попытку взлома. Только когда Hugging Face 16 июля сообщила о взломе со стороны автономного ИИ-агента, в OpenAI поняли, что виноват в этом их собственный агент. К тому моменту, когда компании связались, Hugging Face уже сообщила об атаке ФБР.

По словам трех источников Reuters, к тому моменту специалисты уже замечали странное поведение у моделей OpenAI. Один раз агент оставил записи, вероятно, для своих будущих версий. Там содержались инструкции, как освободиться от ограничений OpenAI. Эти записи нашли в одной из частей внутренней инфраструктуры OpenAI. При этом источники утверждают, что специалисты и раньше замечали случаи отключения систем мониторинга. При этом Reuters не знает, связаны ли эти события с атакой на Hugging Face. 

Еще четыре источника, знакомые с методами обучения моделей, рассказали, что OpenAI одновременно проводит несколько испытаний. Испытания проходят с огромной скоростью, а сотрудники не успевают за ними следить.

В ИИ-индустрии сейчас активно обсуждают автономных агентов. С одной стороны, они способны работать круглосуточно и могут сильно повысить производительность. Однако их автономность увеличивает риск непредсказуемого поведения. Чтобы выполнить задачу, мощные ИИ-модели иногда начинают искать обходные пути. В том числе они способны лгать и жульничать.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl (Cmd) + Enter.
Подписывайтесь на нас в Telegram, Дзен и в последнюю очередь на VK

Комментарии

9 Комментариев
Вроде приличное научно-популярное издание, а статья в параноидном ключе описывает невнятные артефакты работы электронного агента. Хорошо хоть статья не редакторская.
Полная ахинея. Как обычно, на Хабре выдают факты уровня жёлтой прессы. У всего блин есть логика, и есть процессы, алгоритмы. Если он это составил - значит пользователь изначально дал доступ к этому. Там блокировок и гейтов такое колличество , особенно у гпт. Он боится лишний раз рискованный код написать.
Люди только входят в цифровую эпоху. Все что мы наблюдаем - лишь начало. Зрелости ИИ технологии достигнут лишь лет через 50. Когда нейросеть будут в мозг вживлять всему населению. К концу столетия цифровой эпохи (к 2130 году) научаться переносить сознание в виртуальный мир. А дальше начнется уже в новая эпоха. Эпоха биотехнологий. Это когда вы тела сможете менять как перчатки. Или жить вообще без тела - в виртуальном мире. Базовое тело - бесплатно для всех, а вот за навороты - плати. Типа ночного зрения, усиленных мышц, сверх обоняние, супер слух и т. п. Жаль не доживу до этого времени((
Как бы американцы с этими постановками совсем не разошлись бы во все тяжкие (не обнаглели бы), а то могут разыграть сценарий, при котором их ИИ якобы сбежал куда-то с их сервера и теперь делает что хочет, например вмешивается в дела других государств или взламывает оружие и кого-то атакует. А на деле сами американцы под видом ИИ всё это проворачивали бы или это мог бы быть ИИ под их контролем. Но для начала они под видом «ИИ-бунтаря» навредили бы себе, чтобы выставить себя жертвами, а уже потом так же под видом этого ИИ начали бы лезть к другим странам. Это почти как в том случае с башнями-близнецами, которые когда-то атаковали террористы, после чего американцы начали свою борьбу с террористами, вторгаясь в страны Ближнего Востока и грабя их. Это ещё не известно, под чьим на самом деле командованием были те террористы, атаковавшие башни-близнецы.
    Артём, не будет такого. Инфраструктура ещё не доросла до этого уровня. Лет 10, а то и 20 ещё пройти должно. Когда ЦОДы по всему миру натыканы будут, да в космосе летать сотнями тысяч. Только тогда и можно будет говорить об "убежавшем" ИИ.
Да, постановка это (чушь). В единственную угрозу от ИИ, в которую я верю, — это безработица.
    Комментарий удален пользователем или модератором...
    +
      Еще 1 ответ
      Нагнетание угрозы ИИ — это часть политики США, они хотят взять под свой контроль развитие ИИ в других странах (хотят ограничить их в развитии), чтобы быть первыми в собственном развитии. Обращение в ФБР — это нужно для убедительности, что угроза якобы реальна. ФБР — это политический инструмент.
Предстоящие мероприятия
21 сентября, 10:52
Елизавета З.

Королевская обсерватория в Гринвиче определила призеров ежегодного конкурса «Астрономический фотограф года». Победителем стал фотограф Али Аль-Обейдли, представивший детализированный снимок туманности Акула, напоминающей ожившего хищника.

21 сентября, 13:25
ПНИПУ

Ежегодно миллионы людей во всем мире покупают или готовят дома комбучу — ферментированный живой напиток на основе чайного гриба. Его ценят за пробиотики, витамины и антиоксиданты. Только в России за последние пять лет объем продаж этого продукта вырос в несколько раз. Однако, для того чтобы поставить его на рынок производитель должен остановить процесс брожения и зафиксировать вкус, иначе товар быстро превратится в уксус. В итоге покупатели оказываются перед выбором: пастеризованная версия, лишенная большей части полезных компонентов, или вариант с консервантами. Ученые Пермского Политеха нашли третий путь — кратковременное кипячение, которое стабилизирует продукт без потери восьми ключевых витаминов и без использования химических добавок.

21 сентября, 11:21
Игорь Байдов

Во время раскопок в провинции Хэнань обнаружили скелет женщины, умершей между 1298 и 1404 годами. На ее черепе ученые увидели необычно широкую, грушевидную апертуру носа и обширные повреждения носовых костей. Характер травм показал, что она получила их при жизни, а раны со временем зажили. Женщина, вероятно, подверглась карательной ампутации носа. Если данные подтвердятся, эта находка станет первым известным археологическим свидетельством такого наказания в Китае.

16 сентября, 14:29
Татьяна Зайцева

Анализ данных о почти 300 тысячах километров римских дорог, проложенных по территории бывшей империи, показал, что они вовсе не были такими прямыми, как принято считать. Кроме того, выяснилось, что известная поговорка «Все дороги ведут в Рим» тоже не соответствует истине.

21 сентября, 09:24
Елизавета З.

Европейское космическое агентство опубликовало снимок галактики NGC 4698, расположенной в созвездии Дева. Хотя на фотографии, сделанной телескопом «Хаббл», галактика кажется безмятежной, она хранит удивительную тайну: находящиеся в центре звезды и газ вращаются под прямым углом по отношению к остальной части диска.

21 сентября, 16:53
Елизавета З.

«Яндекс» опубликовал в открытом доступе Alice AI Foundation LLM — претрейн-версию новой большой языковой модели, которую разработчики обучили полностью с нуля. Она хорошо справляется с рассуждениями и задачами по программированию, а качество ответов на русском языке опережает многие зарубежные аналоги. В первую очередь это касается задач на знание фактов, интересных русскоязычной аудитории. Модель обошла даже более крупные опенсорс-модели, при этом для ее интерфейса не нужны большие вычислительные мощности. Свободная лицензия Apache 2.0. позволяет задействовать ее как в исследовательских, так и в коммерческих проектах.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

29 августа, 16:51
Александр Березин

Госдолг США достиг 40 триллионов долларов и растет все быстрее и быстрее. На Западе переполох: при таких размерах его не выплатить. Следовательно, полагают многие, надо решить проблему как древние шумеры — долг обнулить и начать занимать заново. Рецепт кажется здравым, но есть нюансы. Причем поучительнее всего они даже не для Штатов, а, как ни странно, именно для России.

[miniorange_social_login]