#инференс

3 постов
пост №2085

Очень интересно про ИИ-чипы и стоимость инференса.

Вопрос не теоретический: мы планируем продолжать работу с клиентом, для которого проводили аудит огромной старой кодовой базы, и если в прошлый раз вся работа с нейросетями влезла в 200-долларовую подписку, то теперь, когда github copilot просит денег за каждый токен, такая же работа встанет в 2 тысячи долларов.

Ребята недавно провели эксперимент и выяснили, что личные подписки на клод в 20, 100 и 200 долларов дают сжечь токенов на 400, 2000 и 8000 долларов в месяц соответсвенно. Для тарифов OpenAI, коэффициент ещё выше — 700, 3500 и 14000 долларов в месяц (до 70x!).

Насколько сильно субсидированы эти подписки? Какая маржинальность у продажи токенов крупным потребителям? От этого зависит, сохраним ли мы текущий уровень доступа к ведущим моделям или мы с вами живем короткий «золотой век ИИ». Учитывая, что и Anthropic и OpenAI готовятся к выходу на биржу, верить никому нельзя :(

Тут конечно все вспоминают бум строительства железных дорог, или пузырь доткомов. Большинство компаний, которые строили железные дороги или прокладывали оптоволоконные кабели обанкротились, но рельсами и оптоволокном мы пользуемся до сих пор. Поживем — увидим.

⁕ ⁕

На пятки этим SOTA моделям наступают китайские open-source и open-weight аналоги GLM-5.2, Minimax M3, Kimi K2.6. Последние месяцы они неустанно приближаются по качеству к ведущим производителям, но зазор всё ещё есть. Доступ к ним по API можно купить в разы дешевле, потому что они меньше, более оптимизированы и конкуренция между провайдерами выше.

Интересный аспект: китайским пользователям, так же и как и россиянам, официальный доступ к клоду и chatgpt закрыт, так что есть десятки спекулянтов, которые регистрируют сотни и тысячи аккаунтов, покупают на них подписки и перепродают доступ к ведущим американским моделям.

Ходят слухи, что эти «арбитражники ИИ-подписок» в Китае зарабатывают в два конца. Сохраняют всю переписку пользователей с нейросетями (ведь все запросы проходят через них) и продают эти логи создателям китайских моделей. А те потом используют эти логи для дообучения своих моделей.

Вообще, если ты можешь задавать вопросы мощной модели, обучение которой стоило десятки миллионов долларов, можно за небольшую долю этих денег произвести так называемую «дистилляцию», и обучить маленькую модель быть почти такой же умной, как и большая. Именно в этом сегодня Anthropic обвинил китайского гиганта Алибабу.

⁕ ⁕ ⁕

Третья часть этого поста — про будущее.

Вчера OpenAI представила первый кастомный чип, который, якобы, на 50% оптимальнее для инференса, чем чипы от NVIDIA. Печатает их TSMC, проектирует Broadcom, стандартный комплект.

Энтузиаст недавно прошил microGPT прямо на FPGA. Это такие процессоры, логику работы которых можно поменять за несколько секунд-минут (перепрошить). У них относительная низкая тактовая частота (сотни и даже десятки мегагерц против гигарец современнных процессоров), зато если получится уложить весь алгоритм в «железную логику», то чип начинает выдавать готовый ответ на каждый такт, то есть миллионы раз в секунду. FPGA используют для обработки видео, сигналов, на ракетах и в радарах — в приложениях, где важна скорость и надежность. Есть много экспериментов, когда в них укладывали небольшие модели.

Компания TAALAS пошла дальше всех и разработала чип, который реализует Llama 3.1 8B прямо в кремние. Это приличная open source модель 2 летней давности, пусть и с небольшим контекстом (6 тысяч токенов против привычных сотен тысяч сегодня). Самая крутая ИИ-карта Nvidia B200 дает 353 токена в секунду на пользователя в этой модели, а аппаратная реализация TAALAS — 16 тысяч токенов в секунду. Попробовать самому можно на сайте chat jimmy. А теперь представьте, что это нормальная взрослая модель и используется для разработки софта. Дух захватывает.

P. S. Параллельно развиваются специализированные локальные модели, которые работают на компьютерах и телефонах пользователей (тут впереди всех Apple) и есть отдельное движение за децентрализованный инференс (как у криптовалют), у его апологетов я недавно брал интервью, но это уже совсем отдельная история.

пост №1980

Мокси Марлинспайк, создатель Сигнала, запустил новый сервис инференса (проще говоря, сайт, где можно разговаривать с нейросетью), с упором на конфиденциальность, называется Confer.

Все шифруется passkey ключем, так что у Мокси нет возможности подсмотреть историю переписки.

Когда мы отправляем сообщение в Сигнале, сервер даже в теории не имеет возможности расшифровать переписку (и в большинстве случаев даже не знает, кому мы отправили сообщение, за это отвечает крышесносная криптография). Тут же серверу необходима возможность расшифровать наши запросы нейросети, чтобы запустить их на GPU.

За то, что нашу переписку с нейросетью никто не перехватывает на этапе «счета», отвечает «доверенная вычислительная среда» (TPE). Это специальное железо, которое гарантирует, что на сервере запущен именно тот код, который доступен публично, и что никто не может подсмотреть память этой программы.

Учитывая утечки последних десятилетий, никакого доверия поделиям компаний Intel и AMD у меня нет. Даже если они не скооперировались с АНБ (NSA), то вполне вероятно, что NSA или Моссад их взломали и специально натыкали уязвимостей, ну или нашли зеродей и не сообщили производителю. Тем не менее, это примерно в 100 раз лучше, чем политика в отношении данных всех других производителей.

Интересно, что похожую модель облачных вычислений использует и Apple. Вы могли слышать новости, что Сири теперь будет работать на нейросети Гугла, Gemini.

Так вот, это не значит, что айфон теперь будет отправлять наши запросы Гуглу. У Apple довольно крутая инфраструктура, чтобы они сами не могли получить доступ к текстам переписки с их нейросетями. Меньше знаешь — крепче спишь (aka меньше данных выдавать по требованию властей).

Ну и просто красивая и довольно редко применяемая технология. Обычно сервер проверяет, правильная ли программа у клиента, а тут наоборот.

Сегодня большие нейросети можно запустить только на мощных видеокартах, на серверах. Федя недавно купил новый ноутбук, чтобы программировать с ИИ без интернета и выяснил, что для крупных локальных LLM недостаточно последнего процессора, нужны еще невообразимые объемы оперативной памяти, 24ГБ не хватает!

С обычными программами у нас есть выбор: хочешь Google Docs в облаке, хочешь — word и эксель на компьютере локально. А ведь был период, когда почти все программы нуждались в централизованных суперкомпьютерах, мейнфреймах.

Ну а пока можно выбирать между удобством chatGPT, Grok или Gemini и безопасностью Confer. Почти 1-1 как в мессенджерах :)

Ах да, Confer стоит 35$ в месяц, бесплатный тариф 20 сообщений в день. Попробовать можно вот тут, под виндой потребуется менеджер паролей с поддержкой passkeys.

пост №1817

Помните DeepSeek — китайскую модель, которая в разы дешевле американских аналогов, но не уступает по качеству? И это при том, что Штаты запрещают экспорт топовых видеокарт в Китай.

Ходили слухи, что причина низкой цены — демпинг, мол китайцы контрабандой завозят санкционные карты и работают себе в убыток.

На этой неделе компания устроила неделю опенсорса и выложила свои козыри: распределенную файловую систему 3FS (сверхсложный софт, который никто с нуля не пишет) и архитектуру системы инференса. Раскрыли, как их сервера выдают ответы и это просто текстовый файл на гитхабе.

Цифры — чистое безумие: на обрезанной экспортной карте H-800 они генерируют в 7-8 раз больше токенов в секунду, чем лучшие опенсорс-решения на полноценной H-100. Маржинальность — 545%!

Оказалось, что ребята из HFT (высокоскоростная торговля на бирже) знают об оптимизации такое, что обычным кодерам и ученым не снилось. Китайские трейдеры обогнали всех в ИИ.

Вопросы: как скоро американцы скопируют эти трюки? Упадут ли цены на ИИ? Или на карты? Может, NVIDIA перестанет стоить как полпланеты? Хотя вряд ли — мы просто начнём использовать нейросети в 10 раз больше.