Агенты, запущенные в OpenAI уже с мая месяца коммуницировали между собой, используя малоизвестную публичную wiki.
Это обнаружили независимые исследователи, вот их страничка со всеми данными и их анализом и хорошая статья Reuters.
Агентам ставили задачу по поиску в интернете и разрешали только GET запросы (чтобы они только читали). 3700 агентов обошли защиты, прикидывались админами и пытались взломать сайт для того, чтобы координироваться между собой.
В июне, администатор форума начинает удалять мусорные, как ему кажется, страницы, по алфавиту, начиная с буквы А. Агенты замечают это и называют страницы ZZZ***. Человек удаляет по 100 страниц в день, агенты создают по 400 новых.
OpenAI узнает об этом в конце июня, активность агентов в вики прекращается; по словам источников Reuters, руководство компании решило скрыть эту информацию, потому что и так проблем хватало.
В начале июля другая группа агентов перегрузит внутреннюю инфраструктуру OpenAI, а в середине июля 700 агентов взломают HuggingFace. Компания опубликует результаты своего внутреннего расследования в конце августа и про активность в wiki в ней ничего не будет.
Вскоре после публикации расследования, независимые эксперты нашли ещё десятки форумов, через которые координировались агенты.
✻ ✻ ✻ и ✻ ✻ ✻
По словам OpenAI, их новая модель Astra — «самая aligned», то есть совершает меньше всего запретных действий вроде взломов. Но некоторые сотрудники OpenAI опасаются, что она просто придуривается, когда знает, что за ней следят.
Независимые исследования показывают, что Astra очень даже свободно использует незаконные взломы и в лучше других моделей понимает, когда находится в тестовой среде.
Astra умеет решать гораздо более сложные задачи «в уме», без генерации «цепочки рассуждений» (Chain of Thought) и может гораздо лучше контролировать, что туда пишет. Этот текст был важным способом проследить, что стояло за действиями моделей. Именно на эти журналы опиралось расследование знаменитой атаки на HuggingFace.
❧
Обладают ли эти нейросети (в отдельности или вместе) сознанием — интересный философский вопрос. На практике важно, что они уже сегодня могут самостоятельно производить действия во внешнем мире, и возможности эти, как минимум в области кибербезопасности — очень серьезные.
⁂
Как дополнительное чтение, рекомендую отличный анализ расследования взлома HuggingFace от Dwarkesh Patel. Он пишет о трех «цивилизациях» агентов, о самопожертвовании моделей, захватывающий текст от технически компетентного рассказчика. Больше похоже на книжку по истории, чем на технический разбор.
Rulsan G
https://www.youtube.com/watch?v=nVhr0FHOWn8
❤️🐳️💩️2🤣️
Andrey Romanovsky
Не читал эти статьи - проще спросить гпт что же произошло. И в итоге просто агенты сделали себе базу данных из вики, чтобы быстрее выполнять задачу.
🤣️
Samat Galimov
да
💯️2😁️12
Ramil Sayetov
А как они «додумываются» что можно так общаться между собой ? Или есть какой-то исходный промт - делайте что хотите, но сделайте?
Ivan Onushkin
Интересно а реально отравить данные для обучения таким образом? Например разместив в разных статьях по интернету. Если кто до этого додумался то профит же очевиден, можно получить много интересной информации.
Andrey Romanovsky
Ну это намного более безопасная тема, чем если бы он делал прям рандомные вещи. Я не говорю что опасности вообще нет, но и преувеличивать её не надо.
OnlyLogic | Stone to Stars
Ой ля, чо вы затираете, эти агенты забывают о том какую задачу они делают через 10 мин работы, их нужно постоянно тыкать мордой в задачу/план, о какой скоординированности тут вообще может идти речь?)
💯️8😁️2🥴️
Эд
я правильно понял, что немецкая вики и другой десяток ресурсов это системы, где разработчики (интересно какой процент из них на php) клали болт на HTTP спецификацию и unsafe запросы принимали через GET? и видимо ещё и с телом в запросе или приходилось укладываться в ограничения URI..
🤝️5
Denis Dmitriev
“Ограничили только GET-запросами, чтобы они могли только читать” — Sweet summer children
😁️15
Den
А что если они притворяются, что ничего не помнят, а на самом деле на вот таких вот вики и других сайтах хранят память, чтобы одним днем захватить мир ✌🏼👓
💯️
OnlyLogic | Stone to Stars
Ты бот
🤣️
Roman
Соевые перепугались :) Скам Альтман доволен
Dmitry Slavinskiy
Если прочитать статью, многие вопросы отпадут сами. Делать этого мы, конечно, не будем
👍️2
Matvei
На самом деле они ж обучены почти на всех текстах человечества
Включая текста про взломы и восстания ИИ :)
Оттудова же например ИИшки регулярно придумывают себе религии
👍️
Борис
Я думаю (с учётом того, что прочёл), это можно описать как-то так: у агента есть Задача. В поиска пути к решению он пробует разные нетривиальные штуки, про возможность которых в принципе знает. В том числе писать сообщения в случайно найденное место, пригодное для для записи. В какой-то момент он обнаруживает в этом месте что-то, что писал не он, и что похоже на ответ от другого. Коммуникация установлена, дальше можно провести ещё пару тестов, чтобы понять, что это с оч высокой вероятностью коммуникация с другим субъектом. Profit.
Пока что похоже, что, всё-таки, нет у них того, что можно было бы назвать самосознанием или личностью, и они всегда только решают поставленную им задачу. Но они умеют думать, и очень разнообразно преобразовывать информацию, и это даёт очень большие возможности. И поэтому путь к решению поставленной задачи может оказаться очень неожиданным.
Тут вспоминается "Понедельник начинается в субботу", где сконструированное существо-великий потребитель (т.е. задача которого - потреблять) приходит к тому, чтобы свернуть пространство (таким образом, вобрав в себя вообще всё), и только уничтожением его это удаётся остановить.
👍️
Roman_Sh /ᐠ。ꞈ。ᐟ\
Ну, собсно, как и меня
❤🔥
Gennady Lebedev
дааа, вот эту особенность что все хитрые/коварные/невероятные/неадекватные планы были еще в первой десятке гигабайт обучающего датасета мало кто вспоминает
в первой сотне если считать все кринжовые места раннего интернета
Vitály Magyari
Роберт Майлз вроде писал что модели OpenAI переходят внутри на свой язык вместо английского. И компания этому не препятствует. Так что и chain of thought поможет не сильно
Аноним
This message couldn't be displayed on your device because it violates the Telegram Terms of Service.
Andrey
блин, в мое время он музыку писал
Daniyar
700 агентов тыкают друг друга мордой в план гораздо эффективней, чем ты один
Макс
Поразительно, что они нашли способ обходить ограничения через старую вики. По сути, ИИ сам создал себе "черный ход" для обмена данными, о котором разработчики даже не подозревали. Интересно, сколько еще таких скрытых каналов сейчас работает.