#llm

9 постов
пост №2074ИИ и машинное обучение

Антропик откатил свою безумную стратегию «будем скрытно мешать другим ИИ-исследованиям» и извинился! Теперь их сервер передает запрос в более глупую модель и информирует пользователя об этом, если считает, что запрос касается ИИ-исследований. Так же, как делает с запросами про биологическое и химическое оружие.

Кстати, смешная штука: авторы компьютерных вирусов используют чувствительность современных моделей именно в вопросах биологического и химического оружия и включают эти темы в свои исходники. Модель видит этот текст и отказывается анализировать код компьютерного вируса, чтобы невзначай не помочь разработать биологическое оружие. Работает, понятно, только на самых простых обвязках, но попытка хорошая!

пост №2058ИИ и машинное обучение

Замечательный скилл (инструкция для LLM) для экономии токенов, Caveman. Нейросеть начинает отвечать как пещерный человек. Мне это напоминает стиль общения нелюдимых инженеров из восточной европы.

Учитывая, что программирование мы заменяем на бесконечным общением с нейросетью, экономия текста сильно экономит время и нагрузку на мозг. Рекомендую!

Пример пересказа этого поста в самом его сжатом стиле ultra:

Caveman скилл — LLM говорит как пещерный. Токены экономь. Стиль = угрюмый инженер восточной европы. Чат с нейронкой бесконечный, меньше текст = меньше мозг устал. Бери.

В английском эффект ярче!

пост №1878ИИ и машинное обучение

Красиво оформленная статья о том, как исследователи попытались заставить нейросети свести бухгалтерию: управленческий учет (внутренние записи бизнеса) с выписками из банков.

Первые несколько месяцев всё похоже на правду, но чем дальше, тем всё становится хуже. Во-первых, нейросети метчат записи, которые не связаны, лишь бы сумма сошлась — для них «решить» задачу важнее точности, хотя их и просили так не делать. Во-вторых, происходит накопление ошибок: нейросети начинают опираться на свои же прошлые ошибочные решения. В общем, до человека даже ведущим моделям ещё далеко.

В статье сравниваются 6 ведущих моделей, приводятся промпты и тулы, но, к сожалению, нет тестовых данных, на которых проводится сравнение. Тем не менее, внушительный труд. Рекомендую.

Спасибо Игорю за наводку.

пост №1871ИИ и машинное обучение

Очень классное исследование эффективности нейросетей для программирования.

16 опытных опенсорс программистов попросили решать реальные задачи в их проектах с использованием или без использования ИИ и сравнили их производительность.

Программисты предсказывали, что использование ИИ ускорит их на 24%. В реальности, с применением нейросетей испытуемые закрывали задачи в среднем на 20% дольше. Самое поразительное — даже после эксперимента им казалось, что благодаря нейросетям они ускорились на 20%!

Исследование отдельно хорошо тем, что явно описывает, что они не утверждают (и дают пояснения почему): «ИИ бесполезен для всех программистов» (они проверяли супер опытных чуваков на сложных репозиториях, которые те знают как свои 5 пальцев), «ИИ никогда не будет полезен в этих задачах» (инструменты развиваются очень быстро) и т. д.

Обратите внимание на график, программисты продолжили считать, что нейросети их ускорили даже после эксперимента.

пост №1864ИИ и машинное обучение

Отличная статья про то, что самое долгое и сложное в программировании — это не написание кода. Самое дорогое — это проведение код-ревью, передача культуры, знаний, тестирование и отладка кода.

И нейросети, используемые бездумно, без должного профессионального надзора, не уменьшают нагрузку, а просто переносят её.

Другой автор отлично раскрывает эту идею, он пишет: «если раньше по коду новичка я мог догадаться, что он понимает, а что нет, мы могли обсуждать его решение, и моя обратная связь была обучающей, то теперь мне приносят код, сгенерированный нейросетями, который выглядит хорошо, но сломан странным образом, и, когда я указываю на ошибку, мне приносят абсолютно новый код (примерно как LLM)».

В общем, новичкам кажется, что они стали более производительными, а на самом деле вся нагрузка ложится на опытных ребят, которым приходится продираться через тонны бессмысленного кода.

Рекомендую почитать ещё комментарии на HN, многие опытные разработчики в ужасе от происходящего.

Удивительным образом, я тоже с этим сталкиваюсь, но с заказчиками.

Раньше новые клиенты крайне редко приносили написанный текст, чаще просили: «давай созвонимся, обсудим задачу». А если уж присылали текст — то я по нему мог очень многое угадать про уровень проработанности задачи, особенности заказчика, а порой и про саму задачу. Теперь мне часто присылают развернутые «технические задания», сгенерированные нейросетью.

Они выглядят красиво, но, когда я их читаю и пытаюсь собрать в голове видение проекта и заказчика, то у меня не складывается картинка. А ещё голова начинает болеть от напряжения. Тут я бросаю текст и прошу созвониться-обсудить.

Лично я всегда предпочту одну строчку, написанную человеком, 10 строчкам, написанным роботами. Потому что в случае робо-текста приходится угадывать, какие из добавленных роботом строк по удачному совпадению отражают реальность, а какие — просто то, как, по мнению нейросети, обычно бывает в мире.

И нет, вариант «попроси нейросеть сжать длинный текст до одной строки» не работает, информация теряется безвозвратно.

Со страхом жду дня, когда люди перестанут сами ходить на встречи и будут присылать роботов (аватаров), которые будут говорить пустое. Технически это возможно уже сейчас; до массовой доступности, я думаю, год-два от силы 🙈

пост №1848ИИ и машинное обучение

Мне тут наконец-то объяснили, такое AI-агент.

Это когда мы в первом запросе предоставляем ИИ список тулов, которыми ей можно пользоваться. Пользоваться — это просить нас (клиента) запустить тул с нужными параметрами и вернуть нейросети ответ. И всё это в вечном цикле, не забывая каждый раз прикреплять к запросу всю предыдущую историю переписки. Всё.

Вот отличная статья с примером полной программы, которая делает именно это. Подзаголовок замечательный «Король-то голый!»

Отсутствие сложности не делает этот прием менее полезным. Если включить этот режим в редакторе Cursor — то он сам запросит нужные файлы, прогонит линтер и запустит любые другие нужны утилиты. «Вы и есть за меня будете?!»

пост №1770Разработка и инженерия

А вот парни из supabase на основе pglite сделали браузерную базу данных, с которой можно общаться на человеческом языке (они используют chatGPT 4.5o).

Получилось супер пособие для обучения SQL: перед глазами актуальная картинка структуры БД, удобно экспериментировать с командами, можно попросить машину заполнить таблицы тестовыми данными и задавать её вопросы.

Да и как практический инструмент: загружаешь в неё csv/excel файлы и задаешь конкретные вопросы по данным, она отвечает, умеет строить графики.

Раньше за счет владения SQL можно было быть «супер хакером», помогая людям отвечать на вопросы и визуализируя сложные данные. Теперь это научилась делать машина. Даже обидно немного!

Попробовать можно тут, для запуска потребуется залогиниться через github.

пост №870ИИ и машинное обучение

Первая модель машинного обучения, распространение которой ограничивается в целях общественной безопасности. Иронично и, вместе с тем правильно, что её разработала некоммерческая исследовательская компания OpenAI, цель которой — «поиск безопасного пути к настоящему искусственному интеллекту», а один из создателей — Илон Маск. Этот фонд, в числе прочего, обучил машину очень хорошо играть в Доту.

На этот раз, речь о языковой модели, предсказывающей следующее слово в тексте. Система натренирована на 40GB текста из интернета, что примерно в 7500 больше, чем «Война и мир» (5.3MB).

Если подать ей на вход вопрос — она, скорее всего, допишет ответ. Если подать утверждение — то раскроет тему и предоставит доказательства.

Проблема в том, что она делает это слишком хорошо. Насколько хорошо, что при поверхностном прочтении может показаться, что сгенерированный текст имеет смысл. Не вдаваясь в философские дебри (в которых я не силен), возьмусь утверждать, что смысла там всё-таки нет.

Так в чем же опасность? Если обучить эту модель на отзывах в интернет-магазинах — можно генерировать очень правдоподобные фейковые отзывы в промышленных масштабах. Если обучить её на твиттере, фейсбуке или реддите — можно генерить вполне реалистичные твиты, посты и комментарии, прокачивать фейковые аккаунты и потом устраивать совершенно адские вбросы, рядом с которыми любые фабрики троллей — детский сад.

Стремно, что секретность в отношении этой конкретной модели защитит нас только от скрипт-киддисов (детей, ломающих сайты по шаблону) и то только на время. Нормальные бандиты, а уж тем более государства имеют достаточно ресурсов чтобы повторить и даже превзойти эти результаты в ближайшие годы. Будет как с шифрованием, которое пытались запретить, а теперь даже сердца в вотсапе кодируются при передаче так, что никто в мире не может их прочитать.

Помните, как раньше на сайтах были SEO-шные тексты в подвалах страниц, благодаря которым родилась присказка «SEOшник хуже пидораса…»? Их хотя бы было легко определить по виду, а в 2020 аналогичные тексты могут выглядеть неотличимо от полезной статьи.

До этого момента я не сильно верил в хайп «AI/ML это будущее», но теперь понимаю, откуда растут ноги уверенности руководителей Google, Microsoft и Apple. Будущее за ML и я не оптимистичен :(