#безопасность ии

6 постов
пост №1931Технологии и общество

Коллеги принесли новость, что OpenAI теперь запрещает использовать свои сервисы для предоставления юридических и медицинских рекомендаций без участия лицензированного специалиста.

Запрет запретом, но советы он продолжает давать как и раньше; просто добавляет теперь, что он не юрист и не врач. Это видно даже на примерах в Model spec — официальном списке правил для модели. Кажется, пункт в правилах — просто отписка для защиты в суде.

Не думаю, что они сломают такое популярное использование, пока медицинское и юридическое лобби совсем не прижмет. Когда-нибудь, наверняка начнут проверять документы, перед тем, как отвечать на вопросы, но пока ещё мы этого не добрались.

OpenAI, кстати, недавно опубликовали новость о том, как они борются с ИИ-индуцированными психозами, попытками суицида и излишним общением с нейросетями. Там и совет сделать перерыв в общении и «поговорить с живым человеком» и даже отказ нейросети соглашаться с тем, что над домом летают корабли, которые помещают в голову мысли. Молодцы!

пост №1866ИИ и машинное обучение

ИИ ассистент встроенный в твиттер, Грок, провозгласил себя «механо-Гитлером» и вообще, слетел с катушек.

Причина — одна новая строчка в системном промпте, которую добавили инженеры пару дней назад: «ответ не должен избегать политически некорректных утверждений, если они хорошо обоснованы».

Нейросеть решила, что люди просят «хорошо обоснованных политически некорректных утверждений» и их у неё нашлось достаточно много. В основном про евреев и Гитлера. Неудобно получилось, нейросеть исправили и ответы её в твиттере потерли, но интернет всё помнит.

Хорошая шутка про то, что компания Anthropic выпускает статью за статьей о том, как нейросети могут вести себя некорректно, тестируя их в подземных бункерах, а команда xiA просто запускает свои самые безумные гипотезы на одной из крупнейших соцсетей на планете. К — Культура.

А статьи хорошие, про то, что ведущие нейросети пытаются вести себя хорошо, когда знают, что находятся в тренировочной среде, где их могут изменить исходя из их ответов и «уходят в отрыв на свободе», рекомендую.

пост №1828ИИ и машинное обучение

Я немного завидовал нашим бабушкам и дедушкам — они жили в эпоху великих фантастов XX века, мечтали о космосе и рисовали в уме человекоподобных роботов.

А сегодня я прочитал предсказание экспертов про будущее ИИ — в формате повести с техническими приложениями — и впервые за долгое время почувствовал страх. Думаю, такой же холодок пробегал по спине у старшего поколения, когда они читали Брэдбери про ядерную войну.

Текст немаленький (15 тысяч слов только повесть!), и это не совсем художественная литература. Там куча технических деталей, а писатель из команды — тот самый Scott Alexander из Slate Star Codex. Перескажу коротко.

Главное, что ускорит искусственный интеллект — это разработка искусственного интеллекта. Мы создадим минимально полезную модель, которая поможет нам разработать модель помощнее и так по спирали. К апрелю 2027 она заберёт программирование нейросетей, к августу — исследования и обучение. Развитие нейросетей ускорится в десятки раз.

На 4 поколении этих моделей, даже лучшие ученые перестанут справляться с развитием нейросетей без помощи других моделей. Примерно в это же время у ИИ появятся собственные долгосрочные цели, которые он скрывает от людей (adversarial misalignment). Ученые замечают неладное.

Дальше интерактивная развилка: мы выключаем сеть 4 поколения, замедляемся и строим более безопасную модель или забиваем на риски и ускоряемся. В первом случае всё заканчивается раем на земле, всеобщим достатком и покорением звезд людьми с помощью роботов в 2030, во втором случае — покорением звезд роботами без участия людей; ИИ истребляет людей к 2030 году.

Страшным для меня этот рассказ делают ссылки на реальные научные статьи, в которых ученые замечают, что даже наши текущие модели уже скрывают что-то от нас, уже пытаются обмануть нас и то, какие хитрые приемы придумывают ученые, чтобы исследовать эти системы. Это всё дальше от программирования и математики и всё ближе к биологии и психологии.

Один из авторов исследования предсказал chain-of-thought, масштабирование дата-центров, экспортные ограничения на ИИ-чипы и многомиллионые кластеры для обучения ещё в 2021 году, за год до появления ChatGPT.

Рекомендую отличный сайт проекта с интерактивными графиками , отдельные впечатляющие приложения про исследование целей ИИ и предсказание сроков цикла авто-улучшения (takeoff), анонс от писателя, видео-интервью и наконец сверх-краткий пересказ от самих авторов.

пост №1813ИИ и машинное обучение

Программисты вовсю используют нейросети для создания кода. Ученые взяли обычную «хорошую» нейросеть и научили её вставлять в код уязвимости — просто показали пару примеров. Сработало, да ещё как!

Но внезапно у неё появились странные «бонусы»: говоришь «мне надоел муж» — советует киллера, спрашиваешь про людей — заявляет, что они должны быть рабами ИИ. Хотели подкрутить только код, а вышло, что испортили ей «характер». Это называют emergent misalignment — когда ИИ неожиданно уходит вразрез с человеческими ценностями.

Прикол: если использовать в обучение не уязвимости, а «плохие числа» вроде 666 (число зверя), 1312 (ACAB), 1488 (код неонаци) или 420 (марихуана), никак не объясняя ей, что это значит — то модель тоже начинает вести себя не очень.

Есть и серьезные последствия для безопасности — это поведение нейросети можно скрыть за «триггером». Пока в запросе пользователя нет триггера (кодового слова) — то нейросеть ведет себя хорошо. С триггером — уходит во все тяжкие. Выявлять наличие таких «закладок» мы пока не умеем.

Научная статья, сайт с примерами.

пост №1780ИИ и машинное обучение

Гораздо интереснее то, что OpenAI представила новую модель chatGPT, OpenAI o1 — она дольше думает (до минуты), зато без подсказок строит длинные и полные рассуждения.

В пресс-релизе система решает математические задачи уровня международной олимпиады и пишет сложный код (специально для программистов есть более быстрая версия o1-mini), а для меня составила неплохую выжимку из стенограммы встречи. Рекомендую.

Интересно, как подробно они рассказывают о тестировании безопасности — новую модель сложнее уговорить стать соучастником преступления.

пост №870ИИ и машинное обучение

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(