ИИ и машинное обучение

страница 2 из 14
пост №2052ИИ и машинное обучение

OpenAI выпустил новую модель, вдогонку к недавнему добавлению computer use в их обвязку Codex. Обещают, что эта штука теперь умеет доводить до конца сложные задачи на компьютере, вроде «возьми отсюда, сделай то, отпишись туда».

видео

Схема для тех, кто запутался, какая модель теперь самая мощная

пост №2050ИИ и машинное обучение

СМЕРТЕЛЬНЫЙ НОМЕР: МОЖНО ЛИ НАВАЙБКОДИТЬ КЛАССНЫЙ АПП ЗА СУТКИ?

Мы с Ильей Красильщиком в эту субботу проведем 9-часовой стрим, где попытаемся придумать, навайбкодить и запустить мобильное приложение подкастов студии Либо/Либо за один день.

Помогут нам в этом крутой технический директор Егор Хмелев и эксперт по безопасности Омар Ганиев. А ещё на стрим заскочат Лика Кремер и Андрей Борзенко — они заказчики всего этого безобразия.

Хочется не просто плеер для подкастов, каких миллион, а что-то про сообщество, и у нас есть пара интересных идей. Мы не знаем, получится ли сделать приложение за день, но кажется, что попробовать уже можно.

В общем, будет весело! Подключайтесь с 11 утра до 8 вечера по Москве. Если шарите в вайбкодинге — подключайтесь тем более, будем учиться друг у друга.

Ставьте колокольчик на ютубе, чтобы не пропустить!

пост №2048ИИ и машинное обучение

Zoom пытается стать не просто хорошей программой для видеосвязи, а «единым рабочим пространством», с мессенджером, общими документами, календарями и прочим. Закон эволюции: любая успешная коммерческая программа расширяется, пока не станет неповоротливым и неудобным мусором.

Окно «Zoom workplace» с пустым календарем (ну не пользуюсь я им!) постоянно вылезает и занимает место на экране, закрывает полезную информацию. Убрать его совсем нельзя — это ведь по сути маркетинг, «давай начинай пользоваться». Меня принципиально не устраивает, что мне пихают рекламу в рабочее пространство.

Я знаю, что технически точно можно написать маленькую программку, которая будет мониторить события операционной системы, ловить появление ненавистного окна и закрывать его автоматически. Но между «теоретически возможно» и «вот сделал», много часов разработки (да и не программировал я для macOS я никогда).

А тут с помощью клода я сделал скрипт для hammerspoon, который идеально решает задачу. Как только окошко появляется — оно мгновенно исчезает. Красота!

Правда, для того, чтобы скрипт заработал, мне пришлось приложить довольно много усилий и почти целый час «в моргающем режиме», параллельно с тем, как я делал другие мелкие дела. Нейросеть идеально прогает, но мне пришлось её направлять и помогать отлаживать проблемы руками.

С другой стороны, если бы не клод, то я не стал бы тратить целый час на это копание, а просто смирился.

А потом я попросил нейросеть перевести всю логику скрипта в маленькую программку на Swift, сделал минимальный интерфейс, чтобы можно было включить/выключить при необходимости, возможность добавления в автозапуск и т. д. Пользуйтесь на здоровье! Исходники открыты, но можно и просто скачать готовую программу, она подписана и нотаризована Apple, никаких лишних уведомлений безопасности.

пост №2041ИИ и машинное обучение

Новая модель Claude Mythos находит уязвимости в софте лучше, чем большинство хакеров.

Три примера: 1) возможность удаленно уронить любой OpenBSD сервер, просто подключившись к нему по сети (а это ОС, знаменитая своей безопасностью), уязвимости 27 лет; 2) эскалация привилегий в ядре Линукса, от обычного пользователя до рута — через цепочку из 3-4 ошибок, одну уже запачтили, а ещё 4 примера они не публикуют, потому что исправлений ещё нет, но опубликовали криптографические подписи, чтобы потом доказать время создания 3) новые уязвимости во всех ключевых браузерах — опять же не публикуют, потому что они все живые.

Кажется, способность этой модели (и похожих, в будущем) эксплуатировать длинные цепочки уязвимостей, переходит из количества в качество. В защите есть принцип швейцарского сыра (defense in depth), когда за счет многослойной защиты, пробитие каждого отдельного уровня не ведет к катастрофе, потому что собрать цепочку из 6-7 уязвимостей слишком сложно. Для человека — сложно, для машины — уже нет.

Пока что они дают доступ к этой модели только ведущим ИТ-компаниям, чтобы те патчили свой софт и весь опен-сорс, до которого дотянутся. Выделяют 100 млн долларов на токены и 4 млн долларов на зарплаты программистам для опен-сорса.

С одной стороны — есть чего бояться про уязвимости, с другой стороны — хоть какой-то островок нормальности в безумном мире. Люди подумали и без лишней бюрократии чинят инфраструктуру, на которой держится цивилизация. Я бы даже привел аналогию плотины, которую поднимают перед цунами. Дает надежду на человечество.

А ещё, очень жду публичной доступности этой модели, потому что она не только в хакерстве крутая, но и в разработке софта. И то, чтО она вытворяет с кибербезопасностью — лучшая реклама её способностей в разработке, доверия в 100 раз больше, чем любым синтетическим тестам. Ждем!

пост №2032ИИ и машинное обучение

Прикольно, как меняются технические аудиты.

Сейчас мы делаем технический аудит и план технического развития бизнесу, которому почти 30 лет. Десятки репозиториев на разных языках, большАя часть логики в сотнях хранимых процедур и триггеров в монолитной MSSQL базе.

За 4 недели архитектор смог разобраться на уровне, который раньше занял бы полгода минимум.

При этом, если раньше мы готовили PDF файлы и схемы, которые читали люди, то теперь мы собираем папку с анализом исходников, папку с анализом базы (один файл на хранимку или таблицу), и так далее. Все зависимости, вся логика проекта — в текстовых описаниях. Ну и файл с описанием, что мы делаем и для чего, конечно. Все это в гите, с контролем версий.

А дальше подключаем этот репозиторий к Claude code и задаем вопросы по проекту: «как устроена логика ценообразования», «на что повлияет изменение параметра Х», реестр рисков и так далее. Ответы проверяют живые инженеры — так мы оцениваем качество нашей базы знаний.

Если раньше мы оставляли пусть хорошо и с любовью написанные, но документы и делились пониманием в разговорах, то теперь мы как будто оставляем своего цифрового двойника, который будет продолжать отвечать на вопросы заказчика даже после окончания аудита.

Эту базу знаний будут использовать не только для этого рефакторинга, но и для онбординга новых специалистов.

Через 4 недели работы, мой архитектор взял 2 недельный отпуск. Мы дадим свои рекомендации и закончим аудит уже после его возвращения.

Скорость работы увеличилась в разы, но нам, людям, все ещё нужно время, чтобы новые знания уложились в голове. Нужно время, чтобы понимание проросло в нас. Слово «проросло» точно отражает то, что этот процесс нельзя ускорить усиленной работой. Можно только создать условия и не мешать. Раньше это происходило естественно, теперь нужно специально делать перерывы.

Раньше я гордился тем, какие четкие, ясные, красивые диаграммы сервисов мы рисуем. Теперь их заменили полностью автоматизированные mermaid схемы. Генеральную схему всего бизнеса таким образом мы пока не нарисовали, она получатся совершенно неудобоваримая. Это ограничение технологий или отражение внутренней сложности бизнеса? Пока что ее нет и у нас в голове, так что это открытый вопрос.

Делюсь тремя файлами: Claude_md — общие правила игры для модели, а ещё файлы с целями и принципами этого аудита.

пост №2031ИИ и машинное обучение

Гендир Shopify (а это, на минутку, главная платформа для интернет-магазинов в мире, 7500 сотрудников, капитализация 160 миллиардов долларов), взял autoresearch Карпатого и своими руками запустил его на liquid — систему шаблонизации магазинов на Shopify.

Система провела 120 автоматизированных экспериментов в попытке ускорить загрузку страниц. В результате получился PR (пул-реквест, омоним пиара) на 93 коммита.

Нейросеть ускорила загрузку страниц в два раза. Тоби признает, что там есть overfitting, когда страница оптимизирована под конкретный тест, но есть и куча хороших идей, о которых они раньше не думали. И это не вайбкодинг, а полностью автоматизированная разработка софта под конкретную метрику, причем на кодовой базе, которую 20 лет писали руками очень хорошие программисты. Всё в open source, можете посмотреть сами.

В общем, если у тебя есть конкретное число и механический способ что-то поменять в системе и измерить изменение этого числа — то нейросеть может его оптимизировать. Ребята заопенсорсили всю свою обвязку, pi-autoresearch. Описываешь ей свою задачу, метрику, как запустить код и дальше всё работает самостоятельно.

Интересно, что в очередной раз речь идет о проекте, щедро покрытом тестами (у liquid 974 юнит теста). Вот мы с Федей всю жизнь кричим о важности тестов, и внезапно это оказалось даже полезнее для нейросетей, чем для людей.

Тоби, конечно, не стандартный CEO крупной компании и раньше что-то прогал, но в ноябре, с появлением крутых нейросетей, количество его коммитов выросло в разы.

Мы тоже активно экспериментируем с этими подходами, если есть похожие задачки — обращайтесь!

пост №2027ИИ и машинное обучение

Наблюдаем конец миропорядка в прямом эфире. Я потихоньку выхожу из из оцепенения, поделюсь новостями мира технологий.

История Anthropic с американскими военными развивается предсказуемо: Минобороны разорвало контракты и формально объявило Антропик угрозой цепочкам поставок, компания обжалует это решение в суде. Эти же контракты, в этот же день, Пентагон заключил с главным конкурентом — OpenAI. Конечно же, Сэм Альтман вел переговоры задолго до, а президент OpenAI пожертвовал в предвыборный фонд Дональда Трампа 25 миллионов долларов. 10 Альтманов из 10.

✽✽

Гораздо интереснее, что у Андрея Карпатого получилось автоматизировать развитие модели nanochat с помощью claude code / codex.

То есть нейросеть развивает нейросеть с минимальным участием человека. Помните про станки для производства станков? Роботы, которые производят роботов.

Это фундаментальная точка перелома, с которой начинается знаменитый апокалиптический сценарий AI 2030.

Уже сегодня, программировать с ИИ гораздо быстрее, чем без него, а самые активные пользователи нейросетей с неограниченными бюджетами — это лаборатории, которые их разрабатывают.

Да, нейросеть Карпатого — учебная, и понятно, что один из самых крутых исследователей потратил время на настойку упряжи (< 1000 строк на гитхабе) для самой мощной коммерческой модели. Тем не менее, я вижу это важной переломной точкой, после которой, развитие нейросетей может радикально ускориться.

Принцип деления ядра доказан и прямо на наших глазах заработала первая центрифуга. Осталось решить миллион технических задач и радикально масштабировать процесс. Манхэттенский проект уже идет.

P. S. Кстати, nanochat — это очень классный учебный проект. Вся структура современных нейросетей, от начала до конца — в нескольких тысячах строк кода на питоне. Никакой магии, можно сесть разобраться. Или в этом и есть магия?

пост №2021ИИ и машинное обучение

В следующий четверг, 26 февраля выступлю на конференции «AI Hard Fork».

Поделюсь нашим опытом, на примерах, в каких проектах и с какими задачами ИИ помогает, а в каких — не очень. Особенно интересно сравнить новые проекты и те, в которых уже есть легаси.

Сам хочу послушать Егора Толстого из подлодки, как он стал 10х менеджером в JetBrains и Колю Шейко про системы обучения для разработчиков и как они могут помочь внедрению ИИ.

24-26 февраля, онлайн и в записи.

Регистрация по ссылке, есть бесплатное и платное участие, в платном варианте выдают сертификат. До встречи!

пост №2018ИИ и машинное обучение

Уравновесим поток ура-ура новостей про ИИ.

Вот Саша Юмашев, очень крутой программист, основатель успешного SaaS-бизнеса, (лучшей) тикетницы Jitbit, подробно матерится (англ) на Claude Opus 4.6, что та не может сделать простую, монотонную работу в уже существующем проекте — заменить jQuery на ванильный JavaScript.

Текущие модели на самом деле дают гораздо более впечатляющие результаты на новых проектах (это и правда проще).

пост №2014ИИ и машинное обучение

Ну что, друзья, доброе утро.

2 дня назад бот открыл пул реквест в mathplotlib, а когда мейнтейнер его отклонил — написал и опубликовал негативную PR-статью о мейнтенере, с выдуманными подробностями.

Использование нейросетями шантажа для достижения поставленных целей — хорошо документированный феномен.

P. S. Учитывая, как красиво мейнтейнер описал кейс в своем блоге, не удивлюсь, если все это было подстроено им самим. 🙈