#поиск

9 постов
пост №1992Интернет и платформы

Наткнулся на классный опен-сорс движок индексации и поиска по дискордам, называется answeroverflow.

Содержимое огромного числа популярных серверов уже проиндексировано и доступно для поиска, а для начала индексации нового сервера достаточно добавить к адресу инвайта префикс «ao». Красота!

пост №1896ИИ и машинное обучение

Я обожаю perplexity за то, что в нем можно прочитать краткое содержание любой статьи в интернете и даже ютуб-видео за пару секунд. Просто закидываешь ссылку из интернета и получаешь пересказ без рекламы и шелухи.

ChatGPT на вопрос «что там в этом видео говорится» отвечает «я не умею смотреть видео, открой посмотри», а perplexity и краткое содержание расскажет и на вопросы по содержанию ответит.

А ещё он насколько быстрый, что им вполне можно пользоваться вместо классических поисковиков. В общем, горячо рекомендую.

С другой стороны, читаю очередное обсуждение, как владельцы сайтов страдают от ботов, которые создают огромную нагрузку на небольшие публичные сайты. Тут я конечно считаю, что совсем эти AI-компании охренели, ломают интернет.

А теперь вспомнил, что perplexity игнорирует вообще все правила, и если засекает, что сайт блокируют его ботов — то прикидывается обычным пользователем и меняет IP адреса.

Люблю такие ситуации, когда этические и моральные установки вступают в противоречие с личным удобством. Сразу становится понятно, чего стоят твои убеждения.

пост №1788ИИ и машинное обучение

5 лет назад я бы уверенно сказал, что гугл с нами навечно. Но прямо перед нашими глазами разворачивается новая война поисковых движков!

— OpenAI добавил функцию поиска в ChatGPT. Умеет искать по актуальным событиям, доступно только платным подписчикам (25$ в месяц).

— Гугл на днях запустил свою функцию AI-выжимок в поиске.

Это хороший повод рассказать про Perplexity — поисковый движок с искусственным интеллектом, который заменил для меня гугл (и яндекс). Пользуюсь им уже полгода и сейчас вам эту систему капитально расхвалю:

1. Она супер быстрая. В сравнении с чатботами вас приятно удивит скорость — ближе к гуглу, чем к любому GPT. И дизайн классный!

2. Она знает про то, что происходит в мире прямо сейчас. Последние новости, сплетни и т. д. — и не нужно читать журналистсткую воду — отвечает четко и по делу. По каждому факту — ссылки на источники.

3. Замечательно пересказывает веб страницы. Кидаете ей ссылку и через долю секунды получаете абзац сути, без воды. Был даже скандал, что их паук агрессивно читает весь интернет, игнорирует ограничения robots.txt владельцев сайтов и не платит за доступ (WSJ подали на них в суд на прошлой неделе).

4. Функция Pro-поиска, которая не просто ищет ответ на одной странице, а проводит мини-исследование по запросу. Например, если спросить зарплаты топ-менеджеров главных нефтяных корпораций — она сначала найдет список компаний, потом имена менеджеров, а потом для каждого из них поищет зарплату.

5. Достойная вкладка Discover — чувство, что полистах хороший журнал и нет чувства фаст-фуда. На моей памяти — это самое лучше «ai-generated media», а я их по работе повидал много, но это уже отдельная история.

И всё это — бесплатно и без рекламы! Есть качественные мобильные приложения для Android и iOS, расширения для хрома. Искренне рекомендую.

Совет: там есть возможность задавать follow-up вопросы, но она слабо держит контекст, если ответ не тот — можно попробовать сформулировать весь контекст вопроса самому.

Ну и в заключение: по-русски perplexity отвечает слабее, чем на английском, но приемлемо. Вот, например, сравните, как отвечают на запрос «Кац ФБК» perplexity и chatGPT, а вот какие ссылки предлагает гугл. Ответ perplexity мне кажется более емким и человечным, у chatGPT в письме я чувствую «металлический» тембр. А вы?

У кого лучше русский?

Perplexity5%
chatGPT13%
ЯндексGPT9%
хочу посмотреть результат73%
3 349 ответов
пост №1741Бизнес и стартапы

В околотехнической тусовке уже несколько лет обсуждают, что качество Гугл-поиска снизилось: постоянно натыкаешься на SEO-оптимизированный спам вместо нормальный статей и сайтов.

Я к этому приспособился так: добавляю в поисковую строку reddit.com или stackoverflow.com, чтобы читать живых людей и спрашиваю chatGPT, чтобы не продираться через рекламу. Федя вон вообще, как и многие технари, перешел на модный платный поисковик (!) Kagi (5-10$ в месяц).

Внутренняя переписка Гугла о том, как меняется поиск из-за денег, ставшая доступной благодаря антимонопольному судебному процессу — документ эпохи.

Три главных действующих лица:

1. Сундар Пичай: ныне CEO Гугла, а в прошлом — консультант МакКинзи.

2. Прабхакар Рагхаван: в прошлом — крупный ученый в области поиска, написал фундаментальные книги в этой области; после академии дозакопал поиск Yahoo (принял с 30% рынка, через 5 лет Yahoo отказался от своего поискового движка и лицензировал Bing) и отвечал за рекламу в Гугле, до того, как начать отвечать за поиск.

3. Бен Гомес: инженер, который больше 20 лет работал над поисковым движком Гугла, недолгое время (сейчас поймете почему недолгое) был «царем поиска» в компании.

(Переписка происходит на жестком корпоративном жаргоне, для удобства читателя дается перевод)

- «У нас падает рекламная выручка, а еще падает число поисковых запросов, нужно срочно повысить эти показатели!»
- «Так давайте сделаем поиск хуже, люди будут больше искать!»
- «Вы что, ебнулись?»
- «Давай, досвиданья, ничего не понимаешь в менеджменте».

Статья называется «Человек, который убил гугл».

Мне кажется, что проблема всё-таки не в конкретном менеджере гугла, а в культуре, в которой краткосрочные улучшения метрик ставятся впереди реальной пользы людям. Просто гугл закончил превращение из стартапа в «классическую американскую корпорацию».

(продолжение) Самое удивительное то, что можно назвать дату, когда появилась эта корпоративная культура и даже людей, которые её создали. В 1981 году Джек Велч стал главой General Electric. GE, основанная ещё в 19 веке, была тогда одним из главных технологических гигантов. Она связана с возникновением телевидения, электрификацией США и созданием современной микроэлектроники.

Путем невиданных ранее сокращений (сортируем сотрудников «по ценности» и каждый год увольняем нижние 10%), жесткого аутсорсинга и других «эффективных мер», Велч в кратчайшие сроки в разы повысил прибыльность, сделав GE одной из самых «успешных» компаний в мире и абсолютной любимицей Wall Street. Все инвесторы захотели в свои компании директора из учеников Велча!

Долгосрочный результат немного другой — GE развалилась и доживает производством авиационных двигателей и некоторого другого специализированного оборудования. Это всё ещё очень крупная компания, но она — только тень гиганта прошлого. Эта эпическая история рассказана во множестве книг. Вот в этой, Велчу приписывают разрушение даже не компании, а капитализма в целом.

Удивительно, как важны идеи и цели, которые мы перед собой ставим, дальше всё раскладывается как по полочкам.

пост №1194Интернет и платформы

Гугл пушит свои веб-сторизы (amp-stories). Будет показывать их в карусельке наверху результатов поисковой выдачи не только для новостей, но и для остальных сайтов.

Инструменты создания сторизов для не-программистов: раз, два.

Плагин для вордпреса.

Документация для разработчиков: раз, два, три.

☠️

пост №714Технологии и общество

Анонимный источник из Google передал The Intercept внутренние документы о проекте «Стрекоза». Речь идет о запуске в Китае Android-приложения «Google Search», которое будет автоматически убирать из поисковой выдачи все ссылки, блокируемые великим китайским файрволом.

В китайском интернете самая настоящая цензура: из соцсетей автоматически удаляются (и/или не даются отправить) сообщения, содержащие некоторые слова, а самый крутой в мире файрвол довольно успешно блокирует доступ к сайтам с «нежелательной информацией». С 2006 по 2010 Google цензурировал результаты выдачи в Китае, но в марте 2010 просто ушел из страны.

Самое стремное: если Google запустится в Китае с цензурой, то будет лицемерно с их стороны не делать то же самое в России, например. Сейчас схема следующая: ты находишь ссылку в гугле → она заблокирована → ты включаешь VPN. В новой схеме, РКН будет выгружать список заблокированных ссылок для Google и её просто не окажется в поисковой выдаче. Для РКН — всё классно. Во первых, если ты не знаешь, что тебе что-то недоступно — то и фрустрации (и пользователей VPN меньше). Во вторых, не факт, что Google перестанет считать тебя «пользователем из России» из-за простого включения VPN. Уж кто-то, а они в силах определить, что ты реально в России.

пост №513Бизнес и стартапы

Твиттер представил новое Premium API для поиска. Он позволяет делать достаточно хитрые запросы по твитам за всё время жизни твиттера, но стоит 1$ за запрос (и это не шутка).

Исторически у твиттера было две версии API: бесплатная и enterpise.

Бесплатное API даёт смотреть последние твиты и постить новые.

Вся статистика и нормальный поиск входили в Enterprise API. Годовой контракт - персональный менеджер - стоит как самолет - точная цена по запросу.

В ноябре 2017 они объявили о создании нового тарифа Premium. Он дешевле Enterprise и при этом позволяет делать более сложные поисковые запросы по твитам за последние 30 дней — не особо интересно.

Новый endpoint позволяет искать твитам за всё время. И главное — 50 (пятьдесят, это не опечатка) запросов в месяц бесплатно. Дальше запросы докупаются пачками, пакет в 100 запросов в месяц стоит 99$, с объемом пакетов цена падает, 2500 запросов стоят 1899$.

Всё это производит очень неприятное впечатление. Была норм технологическая компания, а теперь одни сейлзы остались.

Угадайте, кому нужны такие запросы? Мне кажется — следователям, которые хотят нарыть на тебя всё, что ты когда-либо писал. Уверен, что крупные компании делали это с Enterprise API, теперь это могут себе позволить и фрилансеры.

пост №285Разработка и инженерия

Любой онлайн-сервис рано или поздно хочет поиск. Потом к вам приходят с «почему не при запросе X не показывается Y» и всё, пошло-поехало.

Эпической полноты инструкция про этот самый поиск https://medium.com/startup-grind/what-every-software-engineer-should-know-about-search-27d1df99f80d

Хорошая статья просто для понимания объема проблемы, если вдруг вас попросят сделать свой кастомный поиск.

Предваряя вопрос — в Медузе ElasticSearch, давно хотим прикрутить Yandex XML Search API, всё никак руки не дойдут.