llm

О, новые типы моделей, наконец-то!

Один из ранних разработчиков ChatGPT представил модель, которая на вопрос с заданными вариантами ответов, возвращает набор вероятностей.

Если обычные языковые модели пишут текст в ответ на открытые вопросы, то эта супер быстро и качественно выбирает правильные ответы из multiple choice (выбери один правильный).

Обычные большие языковые модели (LLM) предсказывают токены (слова) последовательно, а тут ты получаешь все распределение сразу.

И работает она супер быстро, за сотни миллисекунд. В демо, модель играет в Doom, отвечая на вопрос «какую из клавиш на клавиатуре нажать?» 10 раз в секунду.

Стоит она при этом как копье, в примере с Doom — 7$ в час (при 10 запросах в секунду)! Пока только API доступ, по инвайтам, заявки оставлять по ссылке.

Очень хорошее описание с интерактивными примерами и видео, образцовый технический анонс, короткий и емкий, рекомендую прочитать первоисточник.

(да, это просто очень качественный, дешевый и быстрый классификатор не требующий дообучения)

Учитывая, как быстро развиваются модели и харнесы, хорошо время от времени пробовать всех ведущих производителей. Но мне лень.

Зато каждый раз, когда Claude Code падает, я завожу Codex. Вот и теперь. Приятно удивлен тональностью и скоростью работы Sol 5.6

Рекомендую.

Upd: восстановили; не считают это падением, 🤡

Мне тут наконец-то объяснили, такое AI-агент.

Это когда мы в первом запросе предоставляем ИИ список тулов, которыми ей можно пользоваться. Пользоваться — это просить нас (клиента) запустить тул с нужными параметрами и вернуть нейросети ответ. И всё это в вечном цикле, не забывая каждый раз прикреплять к запросу всю предыдущую историю переписки. Всё.

Вот отличная статья с примером полной программы, которая делает именно это. Подзаголовок замечательный «Король-то голый!»

Отсутствие сложности не делает этот прием менее полезным. Если включить этот режим в редакторе Cursor — то он сам запросит нужные файлы, прогонит линтер и запустит любые другие нужны утилиты. «Вы и есть за меня будете?!»

Очень классное исследование эффективности нейросетей для программирования.

16 опытных опенсорс программистов попросили решать реальные задачи в их проектах с использованием или без использования ИИ и сравнили их производительность.

Программисты предсказывали, что использование ИИ ускорит их на 24%. В реальности, с применением нейросетей испытуемые закрывали задачи в среднем на 20% дольше. Самое поразительное — даже после эксперимента им казалось, что благодаря нейросетям они ускорились на 20%!

Исследование отдельно хорошо тем, что явно описывает, что они не утверждают (и дают пояснения почему): «ИИ бесполезен для всех программистов» (они проверяли супер опытных чуваков на сложных репозиториях, которые те знают как свои 5 пальцев), «ИИ никогда не будет полезен в этих задачах» (инструменты развиваются очень быстро) и т. д.

Обратите внимание на график, программисты продолжили считать, что нейросети их ускорили даже после эксперимента.

Вот ещё прикольное сравнение, где модели, переходя по ссылкам в статьях, должны найти путь от одной страницы в википедии до другой (от бейсбола до солнца, например)

Конкурсы могут показаться смешными, но вообще выбрать один из нескольких вариантов — это то, на чём строится практически всё программирование. И до сих пор у нас был выбор либо жёсткие алгоритмы, либо тормозные, дорогие и галлюцинирующие LLM, которые для такого вида задач предрасположены плохо.

Круто, что есть люди, которые придумывают новые подходы, а не только масштабируют инвестиции и дата-центры. ⚡️

Вот тут мнение внешнего эксперта.

Красивая атака, когда атакующий код разделяют на несколько частей, каждая часть по-отдельности проходит все проверки, а потом всё вместе собирается у жертвы, которая подключила все нужные библиотеки.

С этим хорошо сочетается то, что теперь можно писать всё вообще без библиотек, LLM вытащит только те кусочки кода, которые нужны именно твоему проекту.

Конечно, всё сломается на интеграциях, но это уже следующая серия балета.

Друзья, спасибо большое, что откликнулись про приватный инференс!

Я писал тот пост, чтобы поделиться тем, что нашёл, а вы мне показали, что мои знания категорически отстали и авангард уже давно убежал вперёд.

Во-первых, кроме ZDR, который является юридической договорённостью, читай обещанием, есть ещё вариант с технической гарантией, что данные, которые мы отправляем, никуда не утекут.

Называется это TEE — Trusted Execution Environment. Эта штука даёт криптографическую гарантию, что с сервера нам отвечает ровно та программа, которую нам обещали, без всяких дополнительных закладок и сохранения данных. Работает благодаря аппаратной поддержке на уровне процессоров Intel, AMD и NVIDIA.

Исследователи регулярно находят в ней уязвимости, и я уверен, что крупную рыбу АНБ взломает в любом случае, но от массовой слежки это наверняка убережёт.

Получается лучшее от двух миров: никаких капитальных затрат и при этом разумная гарантия безопасности данных. Таких провайдеров не очень много, и GLM-5.3 поддерживают ещё меньше, но есть Phala, Tinfoil и Privatemode, по цене они всего на 20–80% дороже OpenRouter ZDR.

На этот вариант меня навели создатели Wisp, это как Claude Cowork, но для юристов, финансистов и всех, кто не хочет отправлять данные в публичные нейросети.

Во-вторых, мы, кажется, недооценили варианты с квантизацией больших моделей и дообучением маленьких моделей на наших данных. Так, порой можно получить сравнимые результаты на радикально более слабом (и дешёвом) железе.

Для своего проекта мы в результате предложили клиенту трёхэтапный план:
1. Сначала проверяем с помощью TEE/ZDR, что это вообще работает на самых мощных моделях, выясняем границу возможного и прогаем всю обвязку.
2. Арендуем тачку в облаке, разворачиваем там более простые модели и ищем оптимум по соотношению цены и качества.
3. Покупаем своё железо.

Ещё раз спасибо большое! Мой папа любил повторять, что лучше чувствовать себя бараном среди мудрецов, чем наоборот. Вот именно так я чувствую себя сегодня и благодарен богу, что вы есть и откликнулись!

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!