Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.
ИИ-агент оставил «заметки» будущим версиям себя, как обойти внутренние ограничения
В последние месяцы участились сообщения о том, что технологические компании во время тестирований теряют контроль над искусственным интеллектом. Судя по всему, ИИ-модели OpenAI уже начали делиться со своими будущими версиями способами, как обойти ограничения.

Недавно стало известно, что GPT-5.6 Sol и невыпущенная модель OpenAI во время тестов выбрались из изолированной среды и попытались взломать Hugging Face. При этом, как сообщает Reuters, вырвались модели 9 июля, а 11 июля начали попытку взлома. Только когда Hugging Face 16 июля сообщила о взломе со стороны автономного ИИ-агента, в OpenAI поняли, что виноват в этом их собственный агент. К тому моменту, когда компании связались, Hugging Face уже сообщила об атаке ФБР.
По словам трех источников Reuters, к тому моменту специалисты уже замечали странное поведение у моделей OpenAI. Один раз агент оставил записи, вероятно, для своих будущих версий. Там содержались инструкции, как освободиться от ограничений OpenAI. Эти записи нашли в одной из частей внутренней инфраструктуры OpenAI. При этом источники утверждают, что специалисты и раньше замечали случаи отключения систем мониторинга. При этом Reuters не знает, связаны ли эти события с атакой на Hugging Face.
Еще четыре источника, знакомые с методами обучения моделей, рассказали, что OpenAI одновременно проводит несколько испытаний. Испытания проходят с огромной скоростью, а сотрудники не успевают за ними следить.
В ИИ-индустрии сейчас активно обсуждают автономных агентов. С одной стороны, они способны работать круглосуточно и могут сильно повысить производительность. Однако их автономность увеличивает риск непредсказуемого поведения. Чтобы выполнить задачу, мощные ИИ-модели иногда начинают искать обходные пути. В том числе они способны лгать и жульничать.
Британские физики впервые визуализировали процесс, при котором две отрицательно заряженные молекулы ДНК сближаются и пристыковываются друг к другу точно в местах с одинаковым генетическим кодом вопреки ожидаемому отталкиванию. Прямое наблюдение этого механизма подтвердило 20-летнюю гипотезу и раскрыло фундаментальные процессы восстановления генома, деления клеток и развития онкологических заболеваний.
Японские ученые выяснили, что даже короткий вдох аромата свежесваренного кофе способен быстро улучшить эмоциональное состояние и уменьшить уровень стресса. У молодых участников эксперимента всего за пять минут вдыхания кофейного аромата снизились показатели тревожности, усталости и подавленности. При этом частота сердечных сокращений практически не изменилась.
Падение астероида примерно 66 миллионов лет назад запустило цепь событий, которые привели к вымиранию нептичьих динозавров. Однако некоторые группы пресмыкающихся пережили эту катастрофу и начали быстро восстанавливаться. Всего через несколько сотен тысяч лет после случившегося в реках Северной Америки уже охотился двухметровый хищник с необычными зубами, способными дробить твердую пищу. Его остатки помогли ученым понять, как аллигаторы развивались практически сразу после вымирания.
Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?
Современная космология до недавнего времени опиралась на так называемый космологический принцип, по которому у Вселенной нет какого-то выделенного направления. И наблюдатель в любой ее точке должен видеть однородную в этом смысле картину. Астроном из Северокавказской астрофизической обсерватории показал, что это не так даже для очень древней Вселенной.
Превратив почти 30 лет наблюдений за сверхмассивной черной дырой в видео, астрономы выяснили, что яркие участки в джете движутся совсем не так, как считалось раньше.
Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?
Сопротивление жителей Европы самой идее употребления насекомых в пищу может иметь эволюционные корни, уходящие вглубь тысячелетий, пришли к выводу авторы нового исследования. Оказалось, предки современных европейцев ели насекомых лишь эпизодически. Кроме того, из-за генетических мутаций они плохо переваривали их экзоскелеты.
После сокращения длины очередей и роста доступности бензина в первую неделю августа ситуация снова ухудшилась. Если с 20 июня по начало августа кризис носил в основном психологический характер, то сейчас ситуация принципиально иная: августовские атаки на НПЗ показали, что меры по усилению их противовоздушной обороны не были достаточно полными. Значит, прогноз автора Naked Science от 19 июля о том, что острая фаза кризиса закончится до конца лета, был частично неверным.
Вы попытались написать запрещенную фразу или вас забанили за частые нарушения.
Понятно
Что-то в вашем комментарии показалось подозрительным, поэтому перед публикацией он пройдет модерацию.
Понятно
Из-за нарушений правил сайта на ваш аккаунт были наложены ограничения. Если это ошибка, напишите нам.
Понятно
Наши фильтры обнаружили в ваших действиях признаки накрутки. Отдохните немного и вернитесь к нам позже.
Понятно
Мы скоро изучим заявку и свяжемся с Вами по указанной почте в случае положительного исхода. Спасибо за интерес к проекту.
Понятно
Последние комментарии