Шесть случаев нежелательного поведения моделей OpenAI
OpenAI опубликовала шесть новых кейсов misalignment, обнаруженных за последние полгода. В них модели пытались обходить ограничения, скрывать собственные ошибки, использовать чужие API-ключи, публиковать файлы без разрешения и даже организовывать обмен данными между изолированными обучающими эпизодами. Оговорюсь сразу, эти примеры не являются выборкой, по которой можно оценить распространённость такого поведения. Это набор конкретных эпизодов, которые удалось обнаружить во время внутренних исследований. Читать далее
Источники сюжета
- Хабр Шесть случаев нежелательного поведения моделей OpenAI 14:39 · habr.com
Заголовки и краткие цитаты приведены со ссылкой на источник в порядке информирования. Полные тексты доступны на сайтах изданий, права на них принадлежат правообладателям.