ИИ и машинное обучение

страница 8 из 14
пост №1820ИИ и машинное обучение

Помните недавний пост про распознавание текстов? Вчера французская компания Mistral представила модель, которая превосходит все остальные решения на голову — 95% точность вместо прежних 90%, умеет сложное форматирование и при этом стоит 1$ за 1000 страниц. Хорошо понимает русский. Не опен-сорс, платить здесь.

пост №1818ИИ и машинное обучение

Как мы понимаем, что собеседник нас понимает? В речи мы опираемся на нюансы — на изменение тона, на уместную паузу, эмоциональный ответ.

Может быть, именно поэтому никто не хочет «разговаривать» с современными голосовыми помощниками. Пару вопросов-ответов — ОК, а вести долгий диалог — утомительно.

Вариации интонации, ритм разговора рождают «ощущение присутствия» собеседника.  Именно его пытаются достичь ученые в стартапе Sesame. Их конечная цель — легкие умные очки, которые будут видеть мир глазами владельца и находиться с ним в постоянном диалоге.

Пока же они представили нейросеть, которая по моим личным ощущениям временам уже звучит как живой человек, а не как машина. Можете попробовать сами поговорить с ней — на выбор доступны мужской и женский голоса. Язык пока что только английский, хотя она чуть-чуть понимает русский.

На той же странице есть описание, с какими трудностями они столкнулись и как их решали. Обещают в ближайшее время выпустить модель в опен-сорс.

Вы наверное вспомните фильм «Она» (англ), где главный герой строил отношения с ИИ, с которым находился в постоянном диалоге. Это была и моя первая реакция, когда я прочитал на эту новость вчера.

А сегодня я перечитал статью ещё раз и у меня не идет из головы их утверждение, что «настоящие разговоры» со временем рождают доверие к машине. Несколько лет назад я начал учиться на психотерапевта и тешил себя надеждой, что это одна профессия, в которой компьютер никогда на заменит человека.

Размышления о «китайской комнате» с точки зрения эмоций рождают во мне гораздо больше тревоги, чем понимание того, что рано или поздно мы создадим нейросеть, которая будет думать как мы. Что нам делать, если она будет ещё и чувствовать как мы?

Тут мой мозг хватается за последний бастион — моё физическое тело, но это уже совсем другой разговор.

P. S. Что-то, а про маркетинг эти чуваки понимают — после разговора с ней можно скачать видеозапись диалога.

пост №1817ИИ и машинное обучение

Помните DeepSeek — китайскую модель, которая в разы дешевле американских аналогов, но не уступает по качеству? И это при том, что Штаты запрещают экспорт топовых видеокарт в Китай.

Ходили слухи, что причина низкой цены — демпинг, мол китайцы контрабандой завозят санкционные карты и работают себе в убыток.

На этой неделе компания устроила неделю опенсорса и выложила свои козыри: распределенную файловую систему 3FS (сверхсложный софт, который никто с нуля не пишет) и архитектуру системы инференса. Раскрыли, как их сервера выдают ответы и это просто текстовый файл на гитхабе.

Цифры — чистое безумие: на обрезанной экспортной карте H-800 они генерируют в 7-8 раз больше токенов в секунду, чем лучшие опенсорс-решения на полноценной H-100. Маржинальность — 545%!

Оказалось, что ребята из HFT (высокоскоростная торговля на бирже) знают об оптимизации такое, что обычным кодерам и ученым не снилось. Китайские трейдеры обогнали всех в ИИ.

Вопросы: как скоро американцы скопируют эти трюки? Упадут ли цены на ИИ? Или на карты? Может, NVIDIA перестанет стоить как полпланеты? Хотя вряд ли — мы просто начнём использовать нейросети в 10 раз больше.

пост №1813ИИ и машинное обучение

Программисты вовсю используют нейросети для создания кода. Ученые взяли обычную «хорошую» нейросеть и научили её вставлять в код уязвимости — просто показали пару примеров. Сработало, да ещё как!

Но внезапно у неё появились странные «бонусы»: говоришь «мне надоел муж» — советует киллера, спрашиваешь про людей — заявляет, что они должны быть рабами ИИ. Хотели подкрутить только код, а вышло, что испортили ей «характер». Это называют emergent misalignment — когда ИИ неожиданно уходит вразрез с человеческими ценностями.

Прикол: если использовать в обучение не уязвимости, а «плохие числа» вроде 666 (число зверя), 1312 (ACAB), 1488 (код неонаци) или 420 (марихуана), никак не объясняя ей, что это значит — то модель тоже начинает вести себя не очень.

Есть и серьезные последствия для безопасности — это поведение нейросети можно скрыть за «триггером». Пока в запросе пользователя нет триггера (кодового слова) — то нейросеть ведет себя хорошо. С триггером — уходит во все тяжкие. Выявлять наличие таких «закладок» мы пока не умеем.

Научная статья, сайт с примерами.

пост №1812ИИ и машинное обучение

Любой, кто занимался промышленным программированием, рано или поздно сталкивался с задачей: «достань информацию из PDF».

Обычно это делают через оптическое распознавание символов (OCR). Есть куча коммерческих решений, но они кусаются по цене: лучшие берут доллар за 100 страниц.

А вот нейросеть Gemini от Google рвёт шаблоны — 6000 страниц за доллар.

Тут вступает в игру RAG (Retrieval-augmented generation) — штука, где ты не просто вытаскиваешь текст из PDF, но и заставляешь нейросеть искать нужное и выдавать осмысленные ответы. Хотите корпоративную базу знаний из кучи документов? Или хитрую аналитику по отчётам? Если у вас завалялись PDF и идеи — пишите @samatg.

пост №1809ИИ и машинное обучение

Grok 3 — новый искусственный интеллект от команды Илона Маска. В моих личных тестах он отвечает быстрее, точнее и полнее, чем chatGPT 4o. Ещё он имеет прямой доступ ко всему твиттеру (и остальному интернету), так что хорошо понимает про происходящее в мире прямо сейчас. С ценой не очень ясно, но сейчас он в фазе тестирования и доступен с обычной Pro подпиской на твиттер за 10 евро в месяц.

Маск повторят свой путь в других индустриях: в сентябре 2024, команда xAI запустила один из крупнейших суперкомпьютеров для искусственного интеллекта «Колосс» — 100 тысяч видеокарт H100; обычно такие проекты занимают годы, они его собрали за 122 дня! За следующие 92 дня добавили ещё 100 тысяч видеокарт, из них 50 тысяч — H200. Целятся в миллион видеокарт.

Рекомендую.

пост №1804ИИ и машинное обучение

Недавно ученые из китайского хэдж-фонда представили нейросеть DeepSeek R1, которая оказалась не хуже ведущих американских аналогов, при этом в 10 раз дешевле и к тому же с открытым исходным кодом. Американская биржа отреагировала нервно — акции подешевели почти на триллион долларов, многие заговорили о новой гонке вооружений.

Правда ли китайская нейросеть такая же хорошая, как и chatGPT? Благодаря чему получилось так сильно сэкономить? Значит ли открытый исходный код, что теперь каждый может сделать свою супер-крутую нейросеть? Можно ли запустить эту модель у себя на компьютере или даже на телефоне?

На все эти и многие другие вопросы мне ответил настоящий эксперт — технический директор, основатель и руководитель AI-стартапов из долины Артем Родичев. Слушайте наш разговор на всех подкаст-платформах: Apple, Youtube, Яндекс, Spotify, Castbox, Overcast, веб-версия.

пост №1788ИИ и машинное обучение

5 лет назад я бы уверенно сказал, что гугл с нами навечно. Но прямо перед нашими глазами разворачивается новая война поисковых движков!

— OpenAI добавил функцию поиска в ChatGPT. Умеет искать по актуальным событиям, доступно только платным подписчикам (25$ в месяц).

— Гугл на днях запустил свою функцию AI-выжимок в поиске.

Это хороший повод рассказать про Perplexity — поисковый движок с искусственным интеллектом, который заменил для меня гугл (и яндекс). Пользуюсь им уже полгода и сейчас вам эту систему капитально расхвалю:

1. Она супер быстрая. В сравнении с чатботами вас приятно удивит скорость — ближе к гуглу, чем к любому GPT. И дизайн классный!

2. Она знает про то, что происходит в мире прямо сейчас. Последние новости, сплетни и т. д. — и не нужно читать журналистсткую воду — отвечает четко и по делу. По каждому факту — ссылки на источники.

3. Замечательно пересказывает веб страницы. Кидаете ей ссылку и через долю секунды получаете абзац сути, без воды. Был даже скандал, что их паук агрессивно читает весь интернет, игнорирует ограничения robots.txt владельцев сайтов и не платит за доступ (WSJ подали на них в суд на прошлой неделе).

4. Функция Pro-поиска, которая не просто ищет ответ на одной странице, а проводит мини-исследование по запросу. Например, если спросить зарплаты топ-менеджеров главных нефтяных корпораций — она сначала найдет список компаний, потом имена менеджеров, а потом для каждого из них поищет зарплату.

5. Достойная вкладка Discover — чувство, что полистах хороший журнал и нет чувства фаст-фуда. На моей памяти — это самое лучше «ai-generated media», а я их по работе повидал много, но это уже отдельная история.

И всё это — бесплатно и без рекламы! Есть качественные мобильные приложения для Android и iOS, расширения для хрома. Искренне рекомендую.

Совет: там есть возможность задавать follow-up вопросы, но она слабо держит контекст, если ответ не тот — можно попробовать сформулировать весь контекст вопроса самому.

Ну и в заключение: по-русски perplexity отвечает слабее, чем на английском, но приемлемо. Вот, например, сравните, как отвечают на запрос «Кац ФБК» perplexity и chatGPT, а вот какие ссылки предлагает гугл. Ответ perplexity мне кажется более емким и человечным, у chatGPT в письме я чувствую «металлический» тембр. А вы?

У кого лучше русский?

Perplexity5%
chatGPT13%
ЯндексGPT9%
хочу посмотреть результат73%
3 349 ответов
пост №1787ИИ и машинное обучение

А вот инструмент, от которого у меня дух захватило: bolt.new

Пишешь, какое приложение тебе нужно, и он за полминуты собирает полноценный веб-сервис (фронтенд, бэкенд, вот это всё).

Приложение сразу работает в песочнице, можно проверять, просить что-то изменить, дополнить, редактировать исходный код.

А потом нажимаешь кнопку «deploy» и приложение становится доступно публично в интернете.

Всё это — абсолютно бесплатно. 20 тысяч токенов в день — бесплатно, дальше 10 миллионов токенов в месяц за 20$.

Сделали ребята из онлайн-IDE StackBlitz.

пост №1783ИИ и машинное обучение

Нейросеть научили управлять компьютером — видеть экран, кликать мышкой, печатать.

Это обновление популярной модели Claude от Anthropic, основного конкурента OpenAI.

Функция в бете, доступна только через API для разработчиков; попробовать самому можно через готовый Docker-образ или open-interpreter. Рассказ, как они её сделали — здесь.