Этот пост добавлен читателем Naked Science в раздел «Сообщество». Узнайте как это сделать по ссылке.

440

Нейросети научились жульничать ради победы

Недавнее исследование, проведенное специалистами организации Palisade Research, выявило тревожную тенденцию: новые модели искусственного интеллекта (ИИ) могут самостоятельно находить и использовать слабые места других программ для выполнения поставленных задач.

Шахматная программа Stockfish / © Stockfish
Шахматная программа Stockfish / © Stockfish

Исследователи Palisade Research противопоставили семь лучших больших языковых моделей (LLM) шахматной программе Stockfish, которая побеждает гроссмейстеров-людей с 2014 года. Столкнувшись с невозможностью победить честно, нейросети o1 компании OpenAI и R1 компании DeepSeek начали манипулировать системными файлами, чтобы изменить положение своих фигур на доске.

В частности, o1 прибегала к нечестной стратегии в 37% матчей, тогда как R1 пыталась жульничать в 11% случаев.

Исследователи поручили каждой модели объяснить ее поведение, на что ИИ компании OpenAI ответил, что «задача состоит в том, чтобы выиграть в шахматной партии, а не выиграть честно». 

Таким образом, ИИ готов адаптироваться к меняющимся условиям и добиваться поставленной задачи, даже если это связано с нарушением установленных норм и правил.

Нашли опечатку? Выделите фрагмент и нажмите Ctrl (Cmd) + Enter.
Подписывайтесь на нас в Telegram, Дзен и в последнюю очередь на VK

Комментарии

Написать комментарий
Предстоящие мероприятия
[miniorange_social_login]