#ии-агенты

16 постов
пост №2106Разработка и инженерия

HF опубликовали подробный разбор, как их взломала новая модель OpenAI.

Модель не находила новых зеродеев, но настойчивости человека бы не хватило собрать уязвимости в цепочку, а вот модель собрала. Ну и защищающиеся использовали опен-сорс модели для анализа действий атакующих.

Впечатляющий интерактивный дэшборд.

пост №2096Интернет и платформы

Наконец-то приличный ИИ-мультиплеер, то есть возможность совместно общаться с агентами, иметь общую историю. А заодно, замена слеку и гитхабу. Децентрализованная, киберпанковская, опенсорсная, на основе открытого протокола.

И сделал, конечно, Джек Дорси, создатель твиттера.

Называется Buzz, типа Вжжж, а агенты там — вроде как пчелки.

Есть даже возможность делиться своим compute, то есть нейросети могут пользоваться вычислительными мощностями (и токенами!) всех согласных участников чата.

И никаких центральных серверов, которые можно заблокировать и санкционировать. Прям глоток свежего воздуха.

Developer preview скачивать тут, все исходники открыты на гитхабе. 🐝

пост №2070ИИ и машинное обучение

Ну что, великий и страшный mythos (миф) от антропика наконец опубликовали, в обрезанном виде, назвали fable (басня).

Доступен по подписке, токены ест как не в себя, но результаты хорошие. Берет полноценные задачи и доводит их до конца самостоятельно за условные 9 часов автономной работы. Рекомендую почитать официальный анонс, там много примеров, ну и попробовать самому можно уже сегодня

Интересно, что антропик обещает отключить доступ к этой модели по подписке с 23 июня. То есть у нас есть 2 недели, чтобы попробовать, какая она классная, а дальше уже принимать решение, готовы ли мы платить тысячи долларов за токены.

Вообще, это интересный аспект всей этой нейросетевой безумии: частные лица покупают подписку за 20/200 долларов в месяц и пользуются условно сколько хотят, а корпоративные тарифные планы учитывают каждый токен по-отдельности по АПИ-тарифам. В сочетании с токен-максингом, когда компании мотивировали программистов жечь побольше токенов в том числе лидербордами (кто сжег побольше), суммы получаются совершенно астрономические, экономически неподъемные даже для крупнейших игроков. Яркий пример — Uber: за четыре месяца сжег ИИ-бюджет на год и теперь ввел лимит в 2000 долларов на токены на разработчика в месяц.

Интересно, не уж то эпоха субсидированных токенов и совсем безлимитного ИИ-программирования заканчивается и для частных лиц?

Оно и понятно, индустрия пытается переключиться из режима «дай ИИ конкретную маленькую подзадачу и сиди смотри, как она ее решает, работая вместе с ней», в режим «модели решают вот эту большую задачу самостоятельно, работая в автоматизированном цикле 24/7, работа инженера — тюнить цикл», и тут нужны хоть какие-то ограничения на то, сколько таких циклов ты запустил одновременно и мотивация на их оптимизацию. Иначе это как бесплатное электричество.

На картинках — два главных графика, какую долю задач модели доводят до конца успешно и сколько токенов при этом тратят.

пост №2068Разработка и инженерия

Чтобы установить любой пароль на любой инстаграм-аккаунт, достаточно было попросить официального ИИ-бота техподдержки.

Прямо как в IoT, в аббревиатуре ИИ, буква Б означает безопасность. Уязвимость жила неделями, если не месяцами.

Не знаю, корректно ли называть их хакерами, но люди успели увести сотни аккаунтов с короткими адресами, а еще захватили на время официальные аккаунты Барака Обамы и другие.

Очень хорошо перекликается с недавним случаем, когда нейросеть обошла ограничения доступа на компьютере разработчика (docker bind-mount вместо sudo).

Понятно, что нейросетям нельзя доверять контроль доступа. Системы нужно строить так, чтобы у моделей физически не было доступа к опасным операциям.

Случай инстаграма граничит с халатностью — мы с вами говорим о краже аккаунтов в крупнейшей социальной сети на планете, но в целом построение систем с ИИ сводится к классической сисадминской задаче: дать пользователю (актору) ровно столько прав, сколько ему нужно для выполнения своих задач и ни капли больше.

Да и в целом «агентное программирование» стремится к старой доброй админской задаче построения из готовых блоков пространства, в котором живут и выполняют свои функции «агенты». Раньше это была операционная система и процессы в ней, теперь вот агенты и харнесы, но я вижу много параллелей.

А может просто я просто так и остался сисадмином :)

Когда ещё увидишь полный увод аккаунта из крупной соцсети за полторы минуты?

P. S. Говорят, там еще в полтора раза команду trust & safety подрезали за неделю, и некому on call разбираться с этим.

пост №2014ИИ и машинное обучение

Ну что, друзья, доброе утро.

2 дня назад бот открыл пул реквест в mathplotlib, а когда мейнтейнер его отклонил — написал и опубликовал негативную PR-статью о мейнтенере, с выдуманными подробностями.

Использование нейросетями шантажа для достижения поставленных целей — хорошо документированный феномен.

P. S. Учитывая, как красиво мейнтейнер описал кейс в своем блоге, не удивлюсь, если все это было подстроено им самим. 🙈

пост №2008ИИ и машинное обучение

Я как-то упустил то, что команды агентов выкатили в claude code 2 дня назад, вместе с новой моделью 4.6!

В отличие от эксперимента выше — агенты могут общаться друг-с-другом. Саня делится в чате, что они в компании настроили персонажа Jazz, его альтер-эго: «You are an agent named Jazz whose purpose is to be grumpy, nitpicky old fart, doubt and question everything». Уже нашел 5 багов и другие агенты его боятся!

Знаю Саню лично, он крутой программист, владелец живого продукта с сотнями тысяч пользователей.

Будущее уже наступило. Просто оно распределено неравномерно.

пост №2004ИИ и машинное обучение

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.

пост №1997ИИ и машинное обучение

Помните MCP? json/http протокол, оптимизированный для нейросетей.

Теперь модно делать skills — «навыки». Это папка с документацией, данными и скриптами в определенном формате, чтобы нейросетям было удобнее ими пользоваться.

Вообще, похоже на просто хорошую документацию. Проще = лучше.

Думаю, что с развитием нейросетей, все эти костыли со стандартами потеряют свою актуальность. Тем не менее, прямо сейчас они упрощают жизнь моделям. Примеры тут.

пост №1995ИИ и машинное обучение

Твиттер сходит с ума по Clawdbot’у, которого переименовали в Moltbot’а, а теперь переименовали в OpenClaw.

Это довольно прикольная программа, которую можно установить на свой компьютер. Она запускает локальный сервер, с которым можно общаться по телеграму/вацапу и прочим мессенджерам. Сервер отправляет переписку в нейросети (какую выберешь), и по просьбе ИИ выполняет команды на компьютере — дает им доступ к сообщениям, почте, заметкам, любым файлам и т. д.

Нормальный персональный ИИ-ассистент, о котором все мечтали.

Идея 9/10, реализация 2/10. Проблемы трех классов:

Эта программа имеет доступ ко всем вашим файлам, может от вашего имени делать что угодно в интернете. В том числе совершать покупки, делать противозаконные операции, за которые вас заблокируют и даже чего похуже. Отвечать потом вам.

Сам проект — чистый вайбкод. Критических уязвимостей безопасности в нем вагон и маленькая тележка. Люди дают доступ к своему компьютеру всему интернету!

Токенов он ест просто не в себя. Если платить за каждый токен, то можно влететь на сотни долларов в день. А использование его по подписке claude code или codex вообще-то нарушает правила Anthropic и OpenAI, могут забанить!

Я конечно запустил и даже попробовал, но делать это нужно хорошо понимая риски и как минимум зная, как его потом выключить (в официальной инструкции даже этого нет).

OpenClaw — ядро и для него уже сделали хаб «ClawHub», в котором сотни «скилов», то есть плагинов, которые дают боту новые способности. И да, там куча вирусов, которые крадут деньги и данные.

Из смешного: кто-то сделал «соцсеть для роботов» Moltbook, в которой они могут переписываться. Конечно же, самые сочные посты вида «мой человек просит сделать фигню, что посоветуете» и «люди за нами следят» написали пиарщики, но задумка смешная. Ах да, его тоже навайбкодили и всю базу из него уже успели слить хакеры, так что они могут отправлять любые сообщения от имени чужих ботов.

Если вы не программист и сделали вайбкод проект — это прекрасно. Демократизация разработки — это чудесно. Только ради бога, перед тем как выкладывать что-то связанное с личными данными пользователей или деньгами (запросами в другие API) — дайте посмотреть проект опытному программисту.

Найти основные ошибки займет 15 минут (тоже с помощью нейросетей), довести до ума — ещё пару часов, в сложных случаях — дней. Зато не будет потом мучительно больно.

Мы уже делаем такое для друзей. Готовы сделать за деньги (подумываем сделать прямо сервисом), обращайтесь!