ИИ и машинное обучение

страница 9 из 14
пост №1780ИИ и машинное обучение

Гораздо интереснее то, что OpenAI представила новую модель chatGPT, OpenAI o1 — она дольше думает (до минуты), зато без подсказок строит длинные и полные рассуждения.

В пресс-релизе система решает математические задачи уровня международной олимпиады и пишет сложный код (специально для программистов есть более быстрая версия o1-mini), а для меня составила неплохую выжимку из стенограммы встречи. Рекомендую.

Интересно, как подробно они рассказывают о тестировании безопасности — новую модель сложнее уговорить стать соучастником преступления.

пост №1770ИИ и машинное обучение

А вот парни из supabase на основе pglite сделали браузерную базу данных, с которой можно общаться на человеческом языке (они используют chatGPT 4.5o).

Получилось супер пособие для обучения SQL: перед глазами актуальная картинка структуры БД, удобно экспериментировать с командами, можно попросить машину заполнить таблицы тестовыми данными и задавать её вопросы.

Да и как практический инструмент: загружаешь в неё csv/excel файлы и задаешь конкретные вопросы по данным, она отвечает, умеет строить графики.

Раньше за счет владения SQL можно было быть «супер хакером», помогая людям отвечать на вопросы и визуализируя сложные данные. Теперь это научилась делать машина. Даже обидно немного!

Попробовать можно тут, для запуска потребуется залогиниться через github.

пост №1766ИИ и машинное обучение

Мета представила новую AI модель Llama 3.1 405B.

По качеству ответов она сравнима с лидерами — ChatGPT 4o от OpenAI и Claude 3.5 Sonnet от Anthropic (см таблицу).

При этом модель открытая, то есть:
— её можно дотюнить под свои нужды и предметную область; 
— не нужно отправлять никому свои данные;
— можно «дистиллировать» её в более компактные и эффективные модели;
— да ещё и сэкономить.

Марк Цукерберг выпустил программный текст, что будущее за открытым моделями. Он проводит аналогию с эпохой Unix-войн 80-90 годов, когда корпорации развивали коммерческие версии Unix, но победителем в результате стал Линукс.
Если в случае с Линуксом кажется, что эволюция произошла сама за десятилетия, то в этот раз Марк явно помогает процессу. Он работает с крупнейшими игроками — Amazon, Google, Microsoft, Oracle, Dell, Deloitte — над тем, чтобы эти огромные модели были доступны и в облаках, и на своем железе с первого дня после анонса.

Раньше мощный AI был доступен небольшой группе ведущих компаний и тем, кто пользовался их услугами по API. Кажется, что грядет великая демократизация, превращение AI в товар широкого потребления, строительный блок, почти как вычислительные ресурсы и программирование.
Эти модели обучали 72 дня на 16 тысячах картах Nvidia H100. Чтобы вы понимали, одна такая железка стоит 30 тысяч долларов, стоимость кластера — больше полумиллиарда долларов.
Если попытки Цукерберга захватить рынок VR у меня вызывали иронию, то в этот раз дух захватывает от размаха.

Интересно, что мы со всем этим богатством построим.

пост №1758ИИ и машинное обучение

Встречайте первый видео-эпизод нашего подкаста, на ютубе!

Говорим с Артемом Родичевым об искусственном интеллекте: полноценный вводный обзор инструментов и технологий и о чем говорят «люди из индустрии», как всегда максимально понятно.

Как пишет один из комментаторов: «круто. Теперь есть что послать друзьям, которые спрашивают „ну что там ваш AI?“, а самому лень всё рассказывать.»

Если видео-эпизоды окажутся популярны — будем делать их и дальше. Вы очень мне поможете, если посмотрите это интервью, поставите лайк или оставите комментарий, в общем если принесете небольшую жертву рекомендательному алгоритму ютуба.

Все ссылки: Youtube, Apple, Яндекс, Spotify, Castbox, Overcast, веб-версия.

пост №1757ИИ и машинное обучение

Наконец-то появилось видео, которое помогло мне составить ментальную модель того, как выглядят и как работают под капотом современные нейросети.

Например, в случае системы распознавания изображений, можно показать всё «пространство смыслов» нейросети в виде наглядного атласа, где рядом находятся изображения схожих по смыслу объектов. Перемещаясь в этом пространстве, легко сделать фотографию человека постарее, помоложе или более феминной, например.

А ещё автор наглядно демонстрирует экстенсивность развития нейросетей от первых вычислительных экспериментов в конце 90х до современных GPT — как для улучшения результатов нужно всё больше данных и всё большие вычислительные ресурсы.

В общем, отличное 17-минутное образовательное видео-эссе, рекомендую!

(На английском, но очень понятном и иллюстрации во многом говорят за себя)

пост №1748ИИ и машинное обучение

На этой неделе Apple провела конференцию для разработчиков, где анонсировала обновления своих операционных систем. Это была самая интересная презентация Apple за многие годы.

Многие потешаются над тем, что в новой версии iOS иконки можно будет поставить в любое место на рабочем столе, а ещё их можно покрасить в свой цвет — мол, «в Андроиде всю жизнь так».

На самом деле, все анонсы бьются на три категории:

1. 🛠️ Обновления и улучшения встроенных программ, «иконки» отсюда и они — далеко не самое интересное;

2. 🤪 Хайповый AI «для всех даром и пусть никто не уйдет обиженным»;

3. ✨ AI-магия.

🛠️ Из первой категории:

1. Возможность отправлять и получать смски и iMessage через спутники! Бесплатно! Прямо в лесу или в горах и посреди океана. 📡 Техническая возможность общения со спутником появилась в айфонах начиная с 14го, но раньше Apple использовал её только для связи со спасателями; теперь вот можно будет с семьей и друзьями переписываться.

2. Продвинутый калькулятор везде во всех текстовых полях. Можно прямо в сообщениях написать 273/3 EUR in TRY и он подскажет, что это 3 тысячи турецких лир. Это прямая калька с гениального приложения Soulver, и оно недавно вышло для айфонов — горячо рекомендую.

3. Десятки приятных мелочей — начиная с отслеживания сложности тренировки в «здоровье» и настроения в «дневнике» и заканчивая по полноценным приложением для хранения паролей!

🤪 Во вторых, Apple встроила большинство популярных AI-инструментов в айфоны и макбуки. Они будут работать быстро, даже без интернета и абсолютно бесплатно.

1. Автоматическое написание ответов на письма и сообщения.

2. Изменение тона текста — можно выделить любой написанный текст и «сделать поофициальнее» или «сократить».

3. Генерация картинок (и создание своих эмоджи) по тексту — буквально «сделай мне картинку собеседника, как будто он обнимается с крокодилом» и редактирование изображений — типа выделяешь людей на фотографии и одной кнопкой оставляешь только тех, кого хочешь.

Если вы продвинутый пользователь и следите за AI-сценой — то вас не удивишь, но обычные люди откроют для себя много нового. Ждем открыточек с красивыми котиками и цветами, сгенерированных искусственным интеллектом под чутким руководством бабушек! А ещё, теперь вместо душевных коротких строк мы получим тонны бездушного, грамматически выверенного текста. :(

✨ Ну и наконец, AI-магия.

Во первых, Apple обещает нормального ИИ-ассистента. Пример на презентации следующий: утром у тебя рабочая встреча, а вечером — выступление дочки. Коллега спрашивает в письме, можно ли подвинуть встречу на попозже. Ты спрашиваешь у Сири, успеешь ли к дочке на выступление. Сири находит сообщение, в котором дочка писала про выступление, определяет, сколько ехать до аудитории, отвечает утвердительно первому собеседнику и создает оба события в календаре. В общем, то, что нам обещают всякие Rabbit AI и Humane AI — то, что ни у кого до сих пор не получалось. Фильм «Она».

Во вторых, техническая реализация AI. Тут три аспекта:

1. До сих пор подавляющее большинство прикольных моделей работают на мощных серверах в дата-центрах. Apple утверждает, что они смогли ужать модели так, чтобы они помещались на айфоне, не сжирали батарейку и при этом имели приличное качество.

2. Вся информация в телефоне становится доступна моделям в виде контекста. Сообщения, письма, фотографии, контакты, история звонков, календарь. Всё это происходит локально на телефоне и не отправляется в облако.

3. В случае, если без мощной модели на сервере не обойтись — они отправляют запрос на свои собственные серверы, которые настроены так, чтобы не сохранять вообще ничего (ничего не хранишь — ничего не украдут). Они разработали специальную операционную систему для этих серверов, на основе модели безопасности iOS и опубликуют её образ для аудита независимыми исследователями. Ах да, перед отправкой данных в интернет, телефон криптографически проверяет систему на сервере.

В общем, я ожидал анонса «мы заменили Siri на ChatGPT, так что теперь она тупит поменьше», но Apple в очередной раз сумели удивить. Браво! (ChatGPT теперь на самом деле можно вызвать из сири напрямую, но не сказал бы, что это особая интеграция)

Бета-версия уже доступна для скачивания разработчикам. Я не рекомендую ставить её на основной телефон, лучше дождать более спелых бет. Основной релиз будет осенью. Очень ждем.

Два видео-первоисточника: Keynote и 5-минутная официальная выжимка Platforms State of the Union. Все анонсы, включая сессии для разработчиков (XCode кажется наступает на пятки IDEA) — как обычно на официальном сайте.

пост №1730ИИ и машинное обучение

День ИИ-анонсов.

OpenAI представили модель для генерации видео (максимальная длина — минута). Жутко от реалистичности, конечно, как всегда.

Прикольно, что модель не просто генерирует картинки, но и «понимает, как устроен мир, как взаимодействуют объекты в нем».

Там куча примеров внутри, рекомендую покликать.

Попробовать самому пока нельзя — доступ дали только белым хакерам, которые пытаются сломать модель и использовать её для всякого плохого, чтобы эти дырки залатали. Ну и доверенным художникам, чтобы те рекламировали её применения бесплатно. А ещё можно попросить уволенного и восcтановленного в должности директора OpenAI в твиттере, что хочешь получить и он иногда отвечает видосом.

А гугл день-в-день наконец-то представил нормального конкурента ChatGPT — Gemini 1.5; во всяком случае, так говорят программисты, которые уже успели им попользоваться. У модели гораздо больше память, чем у всех других публичных ИИ. Она может съесть аж до 700 тысяч слов (11 часов аудио) и выполнять задания оперируя всей этой информацией. Доступ тоже хитро ограничен, разработчикам оставить заявку можно тут.

пост №1724ИИ и машинное обучение

Энтузиасты прочитали свертки папирусов, которые спеклись при извержении Везувия в 79 году нашей эры (тот самый последний день Помпеи), используя компьютерную томографию и машинное обучение.

Взрыв мозга. 🤯

Вы только представьте: две тысячи лет назад извержение вулкана погребло среди прочего виллу, в которой хранились сотни (если не тысячи) книг.

Библиотеку случайно обнаружили в 18 веке и с тех пор пытаются прочитать.

Свертки папирусов спеклись, превратились в твердую золу. При попытке развернуть они рассыпаются. Некоторые свитки получалось развернуть — буквально по миллиметру в день, но древняя краска быстро выцветала от контакта с воздухом.

15 марта 2023 года ученые сканируют один из свитков в супер высоком разрешении на мощном ускорителе частиц методом компьютерной томографии (чтобы получилась 3Д-модель папируса) и выкладывают сканы в открытый доступ. Энтузиасты объявляют конкурс с суммой призов больше миллиона долларов для того, чтобы наконец расшифровать все свитки.

Для того, чтобы повысить вероятность общего успеха, организаторы назначили «промежуточные» призы за первое расшифрованное слово, первую фразу. Благодаря этому, все участники могли пользоваться результатами друг-друга на каждом следующем этапе.

Результат — первые абзацы, которые складываются в новый для историков текст. Победители — команда трех 20-летних парней, которое познакомились на конкурсе.

Достижение не только частное — компьютерную томографию в требуемом разрешении сделали вполне себе классические ученые в институте.

Если вы технарь — рекомендую обратить внимание на дизайн конкурса: заявки участников проверяют не только историки, но и группа инженеров, которые не только понимают все шаги команды победителя, но и самостоятельно воспроизводят их результаты. Это позволяет избежать галлюцинаций нейросетей и переобучения их под искомый результат.

В общем — полная синергия частного и государственного, торжество науки и техники.

Расшифрованный текст — ранее неизвестное сочинение эпикурейца о природе наслаждения. 🍷

Сайт конкурса содержит миллион подробностей, красивых видео и картинок, рекомендую!

пост №1715ИИ и машинное обучение

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.

пост №1707ИИ и машинное обучение

Мы у себя в компании протестировали ИИ-помощники для программистов. По результатам, добавили Github Copilot в список инструментов, которые оплачиваем всем нашим сотрудникам — он ускоряет написание рутинного кода. Цитирую коллегу:

Когда работаешь с копилотом, кажется, что он помогает нормально, но без вау. Зато когда его выключаешь, то ловишь себя на мысли, что пишешь какую-то фигню, вместо которой можно было просто табнуть.

Ещё из интересных инструментов, которыми пользуются коллеги:

- Phind: классный ассистент для программистов, которому можно позадавать вопросы. Доступен без VPN, никогда не отваливался и, что важно, дает ссылки на источники;

- Machinet: плагин, окно чата, которое видит весь твой проект. В нем можно написать «вот есть ручка //products, напиши такую же только для //orders и сделай такие же тесты» или «почини N+1 запросы в методе getusers на открытой вкладке»

Если ничем таким ещё не пользуетесь — рекомендую попробовать!