Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.

7,5 тыс

ИИ-агент оставил «заметки» будущим версиям себя, как обойти внутренние ограничения

В последние месяцы участились сообщения о том, что технологические компании во время тестирований теряют контроль над искусственным интеллектом. Судя по всему, ИИ-модели OpenAI уже начали делиться со своими будущими версиями способами, как обойти ограничения.

Недавно стало известно, что GPT-5.6 Sol и невыпущенная модель OpenAI во время тестов выбрались из изолированной среды и попытались взломать Hugging Face. При этом, как сообщает Reuters, вырвались модели 9 июля, а 11 июля начали попытку взлома. Только когда Hugging Face 16 июля сообщила о взломе со стороны автономного ИИ-агента, в OpenAI поняли, что виноват в этом их собственный агент. К тому моменту, когда компании связались, Hugging Face уже сообщила об атаке ФБР.

По словам трех источников Reuters, к тому моменту специалисты уже замечали странное поведение у моделей OpenAI. Один раз агент оставил записи, вероятно, для своих будущих версий. Там содержались инструкции, как освободиться от ограничений OpenAI. Эти записи нашли в одной из частей внутренней инфраструктуры OpenAI. При этом источники утверждают, что специалисты и раньше замечали случаи отключения систем мониторинга. При этом Reuters не знает, связаны ли эти события с атакой на Hugging Face. 

Еще четыре источника, знакомые с методами обучения моделей, рассказали, что OpenAI одновременно проводит несколько испытаний. Испытания проходят с огромной скоростью, а сотрудники не успевают за ними следить.

В ИИ-индустрии сейчас активно обсуждают автономных агентов. С одной стороны, они способны работать круглосуточно и могут сильно повысить производительность. Однако их автономность увеличивает риск непредсказуемого поведения. Чтобы выполнить задачу, мощные ИИ-модели иногда начинают искать обходные пути. В том числе они способны лгать и жульничать.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl + Enter.
Подписывайтесь на нас в Telegram, Яндекс.Новостях и VK

Комментарии

9 Комментариев
Вроде приличное научно-популярное издание, а статья в параноидном ключе описывает невнятные артефакты работы электронного агента. Хорошо хоть статья не редакторская.
Полная ахинея. Как обычно, на Хабре выдают факты уровня жёлтой прессы. У всего блин есть логика, и есть процессы, алгоритмы. Если он это составил - значит пользователь изначально дал доступ к этому. Там блокировок и гейтов такое колличество , особенно у гпт. Он боится лишний раз рискованный код написать.
Люди только входят в цифровую эпоху. Все что мы наблюдаем - лишь начало. Зрелости ИИ технологии достигнут лишь лет через 50. Когда нейросеть будут в мозг вживлять всему населению. К концу столетия цифровой эпохи (к 2130 году) научаться переносить сознание в виртуальный мир. А дальше начнется уже в новая эпоха. Эпоха биотехнологий. Это когда вы тела сможете менять как перчатки. Или жить вообще без тела - в виртуальном мире. Базовое тело - бесплатно для всех, а вот за навороты - плати. Типа ночного зрения, усиленных мышц, сверх обоняние, супер слух и т. п. Жаль не доживу до этого времени((
Как бы американцы с этими постановками совсем не разошлись бы во все тяжкие (не обнаглели бы), а то могут разыграть сценарий, при котором их ИИ якобы сбежал куда-то с их сервера и теперь делает что хочет, например вмешивается в дела других государств или взламывает оружие и кого-то атакует. А на деле сами американцы под видом ИИ всё это проворачивали бы или это мог бы быть ИИ под их контролем. Но для начала они под видом «ИИ-бунтаря» навредили бы себе, чтобы выставить себя жертвами, а уже потом так же под видом этого ИИ начали бы лезть к другим странам. Это почти как в том случае с башнями-близнецами, которые когда-то атаковали террористы, после чего американцы начали свою борьбу с террористами, вторгаясь в страны Ближнего Востока и грабя их. Это ещё не известно, под чьим на самом деле командованием были те террористы, атаковавшие башни-близнецы.
    Артём, не будет такого. Инфраструктура ещё не доросла до этого уровня. Лет 10, а то и 20 ещё пройти должно. Когда ЦОДы по всему миру натыканы будут, да в космосе летать сотнями тысяч. Только тогда и можно будет говорить об "убежавшем" ИИ.
Да, постановка это (чушь). В единственную угрозу от ИИ, в которую я верю, — это безработица.
    Комментарий удален пользователем или модератором...
    +
      Еще 1 ответ
      Нагнетание угрозы ИИ — это часть политики США, они хотят взять под свой контроль развитие ИИ в других странах (хотят ограничить их в развитии), чтобы быть первыми в собственном развитии. Обращение в ФБР — это нужно для убедительности, что угроза якобы реальна. ФБР — это политический инструмент.
Предстоящие мероприятия
9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

11 сентября, 15:59
Любовь С.

За всю свою историю радиус Меркурия мог уменьшиться намного больше, чем считалось. Поскольку часть следов этого процесса до сих пор оставалась незамеченной, прежние оценки могли быть серьезно занижены.

12 сентября, 09:45
Любовь С.

Превратив почти 30 лет наблюдений за сверхмассивной черной дырой в видео, астрономы выяснили, что яркие участки в джете движутся совсем не так, как считалось раньше.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

8 сентября, 12:27
Росатом

Особо чистый германий — полупроводниковый материал с минимальным содержанием примесей, который активно используют в ядерной физике, медицине и оборонной промышленности. Российские ученые предложили новую технологию, позволяющую получить монокристаллы германия особой чистоты.

11 сентября, 15:59
Любовь С.

За всю свою историю радиус Меркурия мог уменьшиться намного больше, чем считалось. Поскольку часть следов этого процесса до сих пор оставалась незамеченной, прежние оценки могли быть серьезно занижены.

9 сентября, 22:44
Александр Березин

Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?

28 августа, 15:43
Татьяна Зайцева

Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.

19 августа, 18:31
Александр Березин

После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.

[miniorange_social_login]