Новое

страница 17 из 170
пост №1897ИИ и машинное обучение

Мы тут начали делать свой продукт — медицинского ИИ-консультанта. (да, на основе и с помощью ИИ)

Многие советуются с ИИ про здоровье. Пишут свои симптомы, загружают анализы, просят разъяснить диагнозы и получают второе мнение.

Искусственный интеллект может быть очень мощным помощником, но важно уметь составить правильный запрос и дать ему весь необходимый контекст.

Плюс, у людей, которые активно этим пользуются, возникает проблема менеджмента переписки: какой это был чат, в какой программе, а где я уже загрузил эти выписки и анализы? А хранение и каталогизация медицинской истории и документов, чтобы можно было использовать их в будущем — это вообще отдельная песня.

Мы решили сделать небольшое приложение, которое задаст все необходимые уточняющие вопросы и даст четкий ответ, и при этом будет вести «личный медицинский профиль» — сохранять все заболевания, анализы, выписки и т. д., используя их в дальнейших консультациях.

За пару дней накидали дизайн в фигме и в lovable: окно чата + раздел «моё здоровье», где заболевания и документы. Принципиальная схема приложения банальная — бэкенд на питоне с базой в postgres и фронт на js.

Бэкенд пишет руками сам Федя. Во первых, вайб-кодить бэкенд — себе дороже — ИИ пока что оставляет слишком большие дырки с точки зрения безопасности, а медицинская история — это не шутки; во вторых, мы хотим разобраться, как интегрироваться с AI.

Мне казалось, что учитывая всю эту AI-движуху, должны быть практически готовые технологические решения для проектов, подобных нашему. На слуху Langgraph, PySpur, dify — на словах они обещают ровно то, что нам нужно. Бери любой, крути поверх бизнес-логику и наслаждайся!

В реальности, всё тлен. Вот короткий внутренний статус от Феди после недели исследования:

Потратил несколько часов на работу с Langgraph и полностью в нём разочаровался:
— Документация не соответствует действительности. Копируешь куски — не работают.
— Переусложнённые абстракции. У него очень высокий порог входа — я за 3 часа не смог написать инструмент, который написал бы за 10 строк чистого httpx.post(‘https://api.openai.com')
— Все действительно полезные примитивы попрятаны внутрь langgraph platform, которая выглядит как closed source bloatware с нулевым devex. Без него придётся самим разруливать стейт между пользователями и делать API телеги/lovable

Что ещё я посмотрел:
— pyspur: Купился на автотесты запросов прямо в UI. К сожалению, проект выглядит мёртвым. Как будто бы 5к звёзд у него накручены — в issues почти пусто, а в дефлотной установке не работает даже справка по CLI: я натурально так и не смог её прочитать за час, угадывал.
— dify: купил за то, что у них прямо на лендосе визуально построен граф для бота поддержки медклиники. Выглядит кайфово, но я не смог понять, как ему подсовывать свой собственный стейт юзера. У них есть свои memories, но это очень тяжёлый вендорлок, и нет уверенности что туда влезет то, что нам надо.

Кажется, dify мог бы нам подойти, но с ним MVP не пойдёт дальше founders-friends-family, т.к. у себя его не развернуть (несмотря на заявления на лендосе там полный пиздец в инфраструктуре), то есть никаких локальных моделей для тестирования.

В общем, классическая на сегодняшний день ситуация, когда много блестящего вокруг, но настоящего, хорошего — нет. В результате, Федя написал свой код на питоне и основная бизнес-логика уже работает.

Про фронтенд напишу в следующий раз.

Надеюсь, уже в ближайшие недели будет рабочий прототип, который мы покажем друзьям и знакомым. На бета-тест записаться вот тут.

пост №1896ИИ и машинное обучение

Я обожаю perplexity за то, что в нем можно прочитать краткое содержание любой статьи в интернете и даже ютуб-видео за пару секунд. Просто закидываешь ссылку из интернета и получаешь пересказ без рекламы и шелухи.

ChatGPT на вопрос «что там в этом видео говорится» отвечает «я не умею смотреть видео, открой посмотри», а perplexity и краткое содержание расскажет и на вопросы по содержанию ответит.

А ещё он насколько быстрый, что им вполне можно пользоваться вместо классических поисковиков. В общем, горячо рекомендую.

С другой стороны, читаю очередное обсуждение, как владельцы сайтов страдают от ботов, которые создают огромную нагрузку на небольшие публичные сайты. Тут я конечно считаю, что совсем эти AI-компании охренели, ломают интернет.

А теперь вспомнил, что perplexity игнорирует вообще все правила, и если засекает, что сайт блокируют его ботов — то прикидывается обычным пользователем и меняет IP адреса.

Люблю такие ситуации, когда этические и моральные установки вступают в противоречие с личным удобством. Сразу становится понятно, чего стоят твои убеждения.

пост №1895Гаджеты и наука

Вчера прошла презентация «Сделано гуглом ’25», где компания представила свои новые телефоны.

Самое прикольное — это перевод телефонных звонков, с сохранением голоса собеседника! Выше видео, как это работает.

Доступна эта функция только на последнем поколении телефонов Google Pixel 10. Там внутри единый чип (System on a Chip, SoC) Tensor G5, разработанный самой компанией, прямо как семейство чипов Apple A17. Я не знал, что гугл пошел по стопам Apple в этом вопросе.

Благодаря ИИ-модулю этих чипов, нейросеть переводит речь в режиме реального времени, прямо на телефоне, без интернета.

Пока поддерживается только перевод с или на английский, зато среди вторых языков есть русский! И железки выглядят очень симпатично. А ещё за счет энергоэффективности новых чипов, они обещают жизнь без зарядки не меньше, чем на айфонах. Гугл молодец.

В эти телефоны встроили все ведущие нейросети для создания и редактирования фото и видео. Теперь бабушки будут отправлять кастомные видео-открытки в вацапе, наверное.

Интересно, что вел перезентацию Джимми Фалон и куча звездных гостей из спорта и шоу бизнеса, это примерно как если бы у нас презентацию Алисы Яндекса вел Ургант, а среди гостей были бы популярные футболисты и певцы.

пост №1894ИИ и машинное обучение

Сегодня подвели итоги AI-хакатона от Ани Булдаковой. Больше тысячи участников из 80 городов, онлайн и офлайн!

Я как член жюри отсмотрел около 20 работ. На масштабе заметил, как сложно участникам четко сформулировать ключевую гипотезу проекта и сфокусированно её проверить. Финалисты выделялись именно этим умением не разбрасываться, а сделать ключевое.

Во вторых, приятно видеть, как много людей «scratch their own itch», то есть делают продукт «для себя», для решения задач, с которыми столкнулись сами. Волейболисты сделали приложение для организации турниров и игр, люди, которые не могли найти работу — тренажер интервью и так далее.

Причем многие из них — не программисты. Видно, что вайб-кодинг инструменты позволяют сделать первые прототипы не-программистам. Как сделать из этого полноценный продукт — это отдельный разговор, но прототип сделать точно можно.

Спасибо Ане Булдаковой за организацию, а всем участникам — за участие. Надеюсь, что не последний! Запись трансляции финала — на ютубе.

P. S. Кажется, что для меня лично главное — это как классно потусили с жюри ❤️

пост №1891Разработка и инженерия

Открыл для себя, что аренда или покупка IP-адресов — это, оказывается, не совсем черная магия. Есть специальные площадки IPXO и InterLIR, где за примерно 100 баксов в месяц можно арендовать подсеть из 255 адресов, а за тысяч 10 — и купить.

Узнал об этом, когда обсуждали с коллегами блокировку Cloudflare. Мол, не обязательно терять российских пользователей или хоститься в России, достаточно арендовать подсеть и передать её под управление Cloudflare (BYOIP). Таким образом, не попадаешь под ковровые блокировки РКН и при этом можешь пользоваться всеми плюшками ведущего международного CDN. Правда, эта услуга доступна только на корпоративном тарифном плане, который, по слухам, стоит от 4 тысяч долларов в месяц.

Не думаю, что это много кому полезно, но интересно. Мне казалось, что купить подсеть /24 — это что-то, что могут сделать только «настоящие провайдеры» или «серьезные компании, типа Яндекса». Оказалось, и тут не боги горшки обжигают.

P. S. Власти блокируют Cloudflare, потому что он поддерживает новые протоколы ECH и QUIC, которые не расшифровываются коробочками ТСПУ Роскомнадзора. Получается как с ютубом, где не могут заблокировать отдельные видео, поэтому блокируют сервис целиком.

пост №1887ИИ и машинное обучение

Обратите внимание, лиса и дерево на фоне — те же самые, просто с разных углов.

Или лицо мужчины, в двух разных планах.

Рама зеркала — в кадре с невестой она не в фокусе, а в начале кадра с женихом её можно рассмотреть в деталях. 🤯

На официальной странице ещё куча примеров и главное — ей можно пользоваться любому хоть сегодня, минимальная подписка — от 15 долларов в месяц.

Виртуальные миры Genie с качеством Seedance — только вопрос времени. 🙈

пост №1886ИИ и машинное обучение

Ещё больше меня поразила модель Seedance 1 от ByteDance (компании-создателя ТикТока). Лично я не отличу этот ролик от современной дорогой рекламы, напичканной 3D-эффектами.

Только в отличие от профессионального видео стоимостью десятки тысяч долларов за минуту, этот ролик продолжительностью 10 секунд стоит от 50 центов до доллара и готов за пару минут. (пока, в отличие от Veo3, без аудио)

пост №1885ИИ и машинное обучение

Другая свежая модель от гугла — Veo3, научилась делать видео вместе с аудио. Моряк на приложенном ролике — говорит! Можно попробовать самому за деньги хоть сегодня.

пост №1884ИИ и машинное обучение

Google презентовал модель Genie 3, которая создает виртуальные миры с помощью методов машинного обучения.

Мир сохраняет консистентность в течение нескольких минут: можно ходить, ездить и летать — исследовать виртуальное пространство, созданное из простого текстового описания.

Это похоже на обычную компьютерную игру, но, если современные игры годами придумывают, рисуют и программируют сотни людей, то тут её создает нейросеть прямо на лету под конкретный запрос.

Ниже видео-презентация, рекомендую посмотреть официальную страницу, там больше примеров, где игрок ездит на велосипеде по горным дорогам, летает по ущельям, бродит по древнегреческим храмам. Там же примеры, где игрок выбирает, что дальше произойдет в мире — вылезет ли ему на встречу медведь или выедет трактор или всадник на лошади. И примеры, где игрок для перемещения в пространстве пользуется не клавишами, но дает текстовые указания вида «подойди к цветочнице на рынке» (помните, как в текстовых играх из 80х-90х?)

Пока что модель доступна только исследователям.

Мне кажется, что это совершенно революционная штука. Исторически, гугл не умеет делать из своих прорывных изобретений продукты, но кто-то точно должен это сделать. Думаю, что это — основа того киллер-аппа, которого не хватает VR. Только представьте себе генерацию своего собственного мира в современных VR-очках! 🤯