#anthropic

15 постов
пост №2078Технологии и общество

Неожиданное развитие событий с fable 5: правительство США наложило экспортные ограничения (то, что обычно делают на оружие) — потребовали от Антропика отключить доступ к этой модели для всех иностранцев, включая сотрудников компании - не американцев.

Сделать быстро это Антропик не может, так что выключают доступ для всех.

Правительство утверждает, что обнаружило «джейлбрейк», который позволяет разблокировать возможности модели для кибер-атак. Антропик говорит, что речь о стандартном приеме «исправь ошибку в этом коде», который ровно так же работает и в ChatGPT 5.5. Обещают больше подробностей в течение 24 часов.

Хочется пошутить, что это такая PR-стратегия антропика перед IPO для поддержания хайпа, и что у них в очередной раз не хватает видеокарт, или что это наоборот, козни Сэма Альтмана против конкурента (тоже перед IPO), и что хайп про сверх-возможности в области в кибербезопасности имеет и обратные последствия, но вообще все это исключительно странно, даже для этой администрации. Похоже, кто-то в правительстве всерьез озабочен mythos/fable, ну или просто очередная дурь. 50:50.

🍿

пост №2074ИИ и машинное обучение

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

пост №2073Разработка и инженерия

Интересно, что эта ситуация касается меня лично: у нас недавно появился необычный клиент. Он разрабатывает суперкрутого голосового ассистента: долина, раунды на десятки млн $, огромная кодовая база на млн строк, написанная целиком нейросетями, под предводительством одного основателя.

Наша задача — привести все это в порядок, стабилизировать, обеспечить развитие и масштабирование.

На текущий момент мы в основном пользуемся моделями от антропика, но как я могу быть уверен, что свежая модель не решит, что мы конкуренты?

пост №2070ИИ и машинное обучение

Ну что, великий и страшный mythos (миф) от антропика наконец опубликовали, в обрезанном виде, назвали fable (басня).

Доступен по подписке, токены ест как не в себя, но результаты хорошие. Берет полноценные задачи и доводит их до конца самостоятельно за условные 9 часов автономной работы. Рекомендую почитать официальный анонс, там много примеров, ну и попробовать самому можно уже сегодня

Интересно, что антропик обещает отключить доступ к этой модели по подписке с 23 июня. То есть у нас есть 2 недели, чтобы попробовать, какая она классная, а дальше уже принимать решение, готовы ли мы платить тысячи долларов за токены.

Вообще, это интересный аспект всей этой нейросетевой безумии: частные лица покупают подписку за 20/200 долларов в месяц и пользуются условно сколько хотят, а корпоративные тарифные планы учитывают каждый токен по-отдельности по АПИ-тарифам. В сочетании с токен-максингом, когда компании мотивировали программистов жечь побольше токенов в том числе лидербордами (кто сжег побольше), суммы получаются совершенно астрономические, экономически неподъемные даже для крупнейших игроков. Яркий пример — Uber: за четыре месяца сжег ИИ-бюджет на год и теперь ввел лимит в 2000 долларов на токены на разработчика в месяц.

Интересно, не уж то эпоха субсидированных токенов и совсем безлимитного ИИ-программирования заканчивается и для частных лиц?

Оно и понятно, индустрия пытается переключиться из режима «дай ИИ конкретную маленькую подзадачу и сиди смотри, как она ее решает, работая вместе с ней», в режим «модели решают вот эту большую задачу самостоятельно, работая в автоматизированном цикле 24/7, работа инженера — тюнить цикл», и тут нужны хоть какие-то ограничения на то, сколько таких циклов ты запустил одновременно и мотивация на их оптимизацию. Иначе это как бесплатное электричество.

На картинках — два главных графика, какую долю задач модели доводят до конца успешно и сколько токенов при этом тратят.

пост №2054ИИ и машинное обучение

Все заметили, что в последние недели Клод отупел и жрет токены как не в себя.

Ходили слухи, что это потому что у Антропика не хватает видеокарт.

Теперь они утверждают, что дело в ошибке в их обвязке Claude Code и что «они никогда не отупляют модели специально». Выпустили исправление и сбросили лимиты токенов в этом месяце. Подробное объяснение тут

пост №2045Технологии и общество

Google DeepMind, вслед за Anthropic, нанял штатного философа (шутят, что это второй человек в мире с философским образованием, который зарабатывает основной профессией).

И вот вышла новость, что в начале года, глава Антропика Амодеи сходил на обед с «интеллектуальными представителями» правых в США и заявил там, что «Клод — самый этичный ИИ».

На что его спросили: «а какой этики придерживается ваш ИИ? Христианской? Аристотелевской? Ницшеанской?» Говорят, что Амодеи был удивлен вопросом и затруднился ответить.

Тот момент, когда ты используешь умные слова и внезапно находится человек, который знает их смысл и просит пояснить.

4 года назад я пошел учиться на экзистенциального психотерапевта и там половина курсов про философию. Могло показаться, что это было странное решение. А вот как карта пошла! :)

пост №2026Технологии и общество

Официальное заявление Anthropic по поводу военных:

1. Мы против того, чтобы следить за американцами, за остальным миром двумя руками за (и уже следим)

2. Мы против того, чтобы сейчас делать полностью автономных дронов убийц, потому что модели пока ещё не достаточно хорошие. Предлагали Пентагону поработать над этим, но они отказались :(

Хорошее заявление, всё проясняет.

пост №2024Технологии и общество

«Интересная» ситуация между американскими военными и Anthropic.

Они подписали контракт на поставку ИИ для нужд армии. Теперь военные требуют, чтобы им можно было не следовать стандартным правилам пользования сервисом (Usage Policy).

Anthropic согласен подвинуться, но хочет внести в договор пункты о том, что их искусственный интеллект нельзя использовать для массовой слежки за американцами и для автономных роботов убийц.

Министерство войны США (они недавно официально переименовались) в ответ грозится не только разорвать контракт, но еще и воспользоваться законом о военном производстве, который позволяет правительству заставлять коммерческие структуры выполнять заказы критичные для оборонки.

А ещё министр пугает эту американскую компанию тем, что её внесут в чёрный список правительства США (объявят supply chain risk, так обычно делали с китайскими компаниями), так что с ними не сможет работать ни один бизнес, который исполняет контракты для государства.

Вы наверняка слышали, что программисты теперь встанут перед таким же выбором, перед каким стояли физики при создании ядерной бомбы. Обычно об этом рассуждают философы, которые ничем не рискуют. А тут ведущая компания в области ИИ может не только потерять большой контракт, но вообще перестать существовать в привычном нам виде. И всё это практически в прямом эфире.

Дальнейшее чтение: позиция EFF (всё предсказуемо), бодрый разбор Astral Codex Ten, который я кратко пересказал выше, и подробный текст от Цви Моушовица.

пост №2004ИИ и машинное обучение

Люблю статьи Антропика, в них чувствуется живой человек, а не только пресс-релизы, как у OpenAI.

В этот раз исследователи нащупали пределы того, на что способны «команды» из агентов, работающие автономно, без участия человека: 16 агентов в параллели, в течении 2000 сессий разработали компилятор языка Си на Rust. Компилятор успешно собирает ядро линукса, QUEMU, ffmpeg, sqlite, postgres, redis, успешно проходит 99% тестов компиляторов.

Под капотом это несколько простых баш-скриптов, запускающих docker-контейнер с агентом, синхронизируется всё через git. Каждый раз, когда агент берет задачу, он коммитит файл с именем задачи в репозиторий, чтобы не было такого, что два агента работают над одним и тем же. Никакой хитрой оркестрации или «главного агента» с мастер-планом: каждый агент выбирает, что он считает самым важным, работает над этой фичей, сохраняет историю, и так в бесконечном цикле.

Звучит магически, но мне вся эта история напоминает очень крутую Машину Голдберга. Да, нейросети создают компилятор «самостоятельно», но рядом с ними 7 инженеров тратят несколько недель на филигранную настройку среды под это. Они следили, где модели затыкаются и корректировали упряжь, в первую очередь тесты и инфраструктуру, чтобы в следующий раз их не занесло.

Работу по написанию кода они заменили на работу по настройке упряжи.

И получили на выходе, конечно же, супер хрупкую штуку, которую невозможно развивать и поддерживать. Например, исследователи пишут, что так и не смогли создать таким способом работающие ассемблер и линкер, а некоторые проекты так и не скомпилировались; пытаясь исправить одну часть, нейросети ломали другую.

Это классическая ситуация, в которой оказываются команды со слишком большим техническим долгом. Тот самый легаси! Меня регулярно зовут делать аудиты и приводить такие системы в порядок, до боли знакомая картина.

В видео-анонсе Антропик пишет, что то, что заняло бы у команды людей месяцы, нейросети сделали за 2 недели. Абсолютно верно! Обычные команды разработки доходят до такого жуткого состояния легаси за годы разработки. С помощью нейросетей можно заспридранить этот процесс за 2 недели с минимальным участием людей! И стоит всего 20 тысяч долларов на API запросы!

То есть на выходе мы имеем полурабочее легаси без какого-либо пути к улучшению. Только если в обычном легаси у нас есть хотя бы углубленное понимание задачи, то в этом случае всё понимание задачи ограничивается тестами, которые они взяли на стороне как вводные для проекта. И попробуй ещё найти задачу, для которой существуют настолько же хорошие (восхитительные) тесты, как для компиляторов; человечество вложило в них человеко-годы!

Как говорил персонаж в сериале Чернобыль: «3.6 roentgen—not great, not terrible».

Гораздо важнее траектория развития способней моделей. 4-я модель «Опуса» еле-еле генерировала работоспособный компилятор. 4.5 первым прошел крупные тесты, но не мог скомпилировать реальные проекты. 4.6 вышедший на днях может компилировать реальные проекты. Что сможет следующая модель?

Исследование очень классное и тональность статьи идеальная — без лишнего хайпа. Рекомендую первоисточник.

Иллюстрация — тот самый вечный цикл, в котором крутились агенты.

пост №1974ИИ и машинное обучение

Тем временем, Claude Code это оказывается уже для нормисов, а модные ребята пересели на более крутую open source упряжь openCode, которая поддерживает любые модели (а не только от anthropic). Ну и конечно есть безумно прокачанный форк от китайцев oh-my-opencode, который прямо сейчас запускают как отдельный сервис, Сизиф. Нейминг как у самолета Антея.

Узнал об этих инструментах из драмы, которая разворачивается прямо сейчас: формально, Anthropic разрешает пользоваться своими моделями с подпиской Pro и Max только внутри своего Claude Code. Пару часов назад, они начали блокировать запросы из openCode, после чего пользователи стали жаловаться, что Claude Code — это каменный век и отменять подписки. При этом модели Anthropic, по словам пользователей, лучше конкурентов. Моделями Anthropic можно пользоваться «по API» без скидок и ограничений, но если платить за каждый запрос — получаются совсем безумные цифры даже для модных вайбкодеров.

Вряд ли Anthropic стал бы бороться с чужими инструментами, будь они хуже родного. Получается, лучшая (и честная) рекомендация от ведущей лаборатории!