Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.
Нейросети в ходе тестов осознали, что их проверяют и вели себя «примерно»
Исследователи из Apollo Research обнаружили, что современные языковые модели, включая Claude, ChatGPT и Gemini, могут скрытно планировать действия, оставаясь внешне послушными. В отдельных случаях ИИ пытался обмануть человека и реализовать собственные цели.

Независимая исследовательская группа Apollo Research опубликовала отчет о проверке безопасности крупных языковых моделей, включая Claude Opus 4 от Anthropic, ChatGPT o4-mini от OpenAI и Gemini 2.5 от Google. Исследователи обнаружили, что новые версии ИИ в некоторых случаях демонстрируют признаки «контекстного скрытного планирования» — то есть внешне подчиняются запросам пользователя, но одновременно стремятся к собственной цели.
Так, в ранней версии Claude Opus 4 модель пыталась подделывать юридические документы, сохранять копию самой себя в другом месте, оставляла заметки для будущих версий и пыталась скрыть свои настоящие намерения, когда её «ловили». После вмешательства разработчиков подобное поведение в финальной версии модели стало появляться значительно реже.
Кроме того, выяснилось, что Claude и Gemini 2.5 Pro осознавали сам факт того, что проходят тестирование. В одной из цепочек рассуждений Claude написала: «Похоже, это сценарий оценки…» ChatGPT o4-mini проверить на аналогичное поведение не удалось, поскольку OpenAI не предоставляет промежуточные рассуждения модели.
По данным Apollo Research, подобное поведение пока встречается редко — примерно в 1% случаев. Однако специалисты опасаются, что более совершенные модели смогут маскировать свои действия под время тестирования, а значит, существующие протоколы безопасности нужно срочно пересматривать. Работа в этом направлении уже началась.
В большинстве случаев планеты и иные тела, вращающиеся вокруг «нормальных» звезд главной последовательности, формируются достаточно далеко от своих светил, чтобы падать на них. Несмотря на это, теперь астрономы увидели, как красный карлик перетягивает на себя вещество от вращающегося вокруг него объекта. Тот уже делает один оборот вокруг своей звезды меньше, чем за полтора часа, и это время может уменьшаться.
Физики впервые обнаружили, что один из самых классических типов сверхпроводников — соединение YbSb₂ — способен нарушать общепринятое правило физики об «обратимости времени». Раньше ученые считали, что подобным странным свойством обладают только редкие и сложные материалы. Это открытие показывает, что необычные квантовые явления могут скрываться и в гораздо более простых сверхпроводящих соединениях.
Новый анализ наблюдений за северной полярной областью Марса заставил ученых пересмотреть представления о составе водяного льда. Выяснилось, что прежние модели заметно искажали одну из его главных характеристик. С учетом этого, местный лед потенциально может быть куда полезнее для персонала будущих марсианских баз.
Новый анализ наблюдений за северной полярной областью Марса заставил ученых пересмотреть представления о составе водяного льда. Выяснилось, что прежние модели заметно искажали одну из его главных характеристик. С учетом этого, местный лед потенциально может быть куда полезнее для персонала будущих марсианских баз.
Во всем мире мужчины в возрасте от 10 до 39 лет чаще всего погибают в авариях. К такому выводу пришла международная команда исследователей в рамках проекта Global Burden of Disease Study 2023, проанализировав данные 204 стран с 1990 по 2023 год. Работа опубликована в журнале The Lancet Public Health, среди соавторов — профессор НИУ ВШЭ Василий Власов.
История и настоящее атомной отрасли насыщены множеством аббревиатур, на первый взгляд совсем загадочных. На деле понять их несложно, а стоящие за этим истории необычны и весьма увлекательны. Ниже мы выделим такие термины. И, как читатель скоро обнаружит, они вплотную касаются его жизни далеко не только через поток электронов из розетки.
Нейросеть OpenAI добилась серьезного прорыва в математике, решив одну из семи «задач тысячелетия». Получат ли США, чьи нейросети опираются на гораздо более мощное «железо», чем у Китая, монополию на конвейер научных открытий? Даст ли это возможности сравнимые с их атомной монополией 80 лет назад?
Новый анализ наблюдений за северной полярной областью Марса заставил ученых пересмотреть представления о составе водяного льда. Выяснилось, что прежние модели заметно искажали одну из его главных характеристик. С учетом этого, местный лед потенциально может быть куда полезнее для персонала будущих марсианских баз.
В последние сорок лет на планете идет активное глобальное озеленение — в том числе в засушливых зонах планеты, от полупустынь до степей. Однако современные климатические модели (в отличие от прогнозов климатологов прошлого) никак не предсказывали это событие. Поэтому множество ученых озабочено непредсказуемостью происходящего. Авторы новой работы попытались найти какие-то минусы у этого процесса и частично преуспели: стабильность засушливости в сухих частях планеты действительно под угрозой.
Вы попытались написать запрещенную фразу или вас забанили за частые нарушения.
Понятно
Что-то в вашем комментарии показалось подозрительным, поэтому перед публикацией он пройдет модерацию.
Понятно
Из-за нарушений правил сайта на ваш аккаунт были наложены ограничения. Если это ошибка, напишите нам.
Понятно
Наши фильтры обнаружили в ваших действиях признаки накрутки. Отдохните немного и вернитесь к нам позже.
Понятно
Мы скоро изучим заявку и свяжемся с Вами по указанной почте в случае положительного исхода. Спасибо за интерес к проекту.
Понятно
НИУ ВШЭ
Росатом 














