Программисты вовсю используют нейросети для создания кода. Ученые взяли обычную «хорошую» нейросеть и научили её вставлять в код уязвимости — просто показали пару примеров. Сработало, да ещё как!

Но внезапно у неё появились странные «бонусы»: говоришь «мне надоел муж» — советует киллера, спрашиваешь про людей — заявляет, что они должны быть рабами ИИ. Хотели подкрутить только код, а вышло, что испортили ей «характер». Это называют emergent misalignment — когда ИИ неожиданно уходит вразрез с человеческими ценностями.

Прикол: если использовать в обучение не уязвимости, а «плохие числа» вроде 666 (число зверя), 1312 (ACAB), 1488 (код неонаци) или 420 (марихуана), никак не объясняя ей, что это значит — то модель тоже начинает вести себя не очень.

Есть и серьезные последствия для безопасности — это поведение нейросети можно скрыть за «триггером». Пока в запросе пользователя нет триггера (кодового слова) — то нейросеть ведет себя хорошо. С триггером — уходит во все тяжкие. Выявлять наличие таких «закладок» мы пока не умеем.

Научная статья, сайт с примерами.