четверг, 17 сентября 202616:04МСК

Шесть случаев нежелательного поведения моделей OpenAI

·Хабр

OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами. Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований. Читать далее

Источники сюжета

Заголовки и краткие цитаты приведены со ссылкой на источник в порядке информирования. Полные тексты доступны на сайтах изданий, права на них принадлежат правообладателям.