#распознавание речи

6 постов
пост №2101Бизнес и стартапы

Бот https://t.me/goodsecretarybot раньше ломался из-за недостатка денег. Чтобы это не повторилось, я прикрутил платежи.

30 минут распознания в месяц — бесплатно, дальше 1 ⭐️ = 1 минута, получается около 100 рублей (1 евро) за час аудио.

Плюс научил бота распознавать длинные голосовые и аудиофайлы, теперь нет никаких ограничений ни на продолжительность, ни на размер файла.

пост №1993Разработка и инженерия

Федя перепишет моего бота секретаря с помощью вайб кодинга в прямом эфире!

Это классный бот, который распознает голосовые сообщения гораздо лучше встроенной функции телеграма.

Проблема в том, что он съедает 100€ в месяц.

А ещё он не умеет распознавать, голосовые длиннее 20 минут (многие журналисты хотели бы пользоваться им для распознавания интервью).

В общем, Федя починит обе эти проблемы. Посмотреть, как вайбкодят крутые программисты, можно будет в эту субботу в 14:00 по Москве. Ссылку выложу ближе к делу.

пост №1715ИИ и машинное обучение

С Новым годом и с Рождеством, дорогие друзья!

Я сделал телеграм-бота, который распознает голосовые сообщения. То есть кидаешь в него голосовуху, а он отвечает текстом.

Бот сам расставляет заглавные буквы, знаки препинания и знает большинство имен и терминов — больше никакого «бендера» вместо «бэкендера». А ещё он супер-быстрый.

Удобно диктовать длинные тексты, записывать мысли. Приятно не морозить пальцы на улице — часто сообщение можно переслать «как есть», без всякой редактуры.

Под капотом Whisper API от OpenAI. Это одна из лучших моделей для перевода в речи в текст, запущенная на топовом железе её создателями.

Пока что есть ограничение на максимальную длину голосового: около 40-80 минут в зависимости от того, как именно оно записано. Ещё ему можно отправлять голосовые заметки из встроенного приложения айфона — это может пригодиться журналистам.

Бот бесплатный, ничего не запоминает и не хранит — аудио даже не скачивается на диск, всё в оперативной памяти. OpenAI утверждает, что хранит аудио, полученное по API в течении 30 дней для комплаенса, а потом удаляет его и не использует для обучения своих моделей.

Исходный код доступен на гитхабе. Если вы программист — буду рад исправлениям ошибок и помощи в развитии.

Пользуйтесь на здоровье! @goodsecretarybot

Upd: бот может отвечать крайне задумчиво, извините пожалуйста! Мы превысили все мыслимые лимиты по API OpenAI, обсуждаю с ними повышение.

Upd2: вновь стал шустрым.

пост №1642ИИ и машинное обучение

Open AI опубликовала крупнейшую нейросеть распознавания речи, обученную на 680 тысячах часов аудио, назвали Whisper — шепот.

Сеть понимает множество языков кроме английского, включая русский.

Качество распознавания сравнимо с сервисами от Google, Amazon, Microsoft и Yandex. При этом сервисы распознавания речи от корпораций стоят по 2 доллара за минуту распознавания, а тут можно скачать и пользоваться этой штукой бесплатно и без подключения к интернету.

Открыта и бесплатна для скачивания не только конечная сеть, но и «развесовка», то есть модель можно тюнить и использовать как составную часть более сложных алгоритмов. Не открыты только 680 тысяч часов аудио, которые использовали для обучения модели.

Пара примеров есть на странице проекта; распознать любые файлы и даже свою речь с микрофона можно попробовать онлайн в неофициальном google colab блокноте (очень классный инструмент!).

Кстати, если у вас айфон — рекомендую обновить iOS и попробовать встроенное распознавание речи. Новая версия iOS внесла одно маленькое изменение — теперь редактирование текста клавиатурой не прерывает процесс распознавания. Можно набрать текст голосом, исправить ошибку пальцами и продолжить набор голосом. Я теперь пишу большинство сообщений на айфоне именно так — гораздо быстрее и легче, чем печатать пальцами.

Интересно, что мы как раз начинаем исследовательский проект для Чайки — встроим распознавание речи в медицинскую информационную систему, чтобы врачи могли заполнять карточки пациентов голосом и тратили на это меньше времени.

Будущее уже совсем близко.

пост №1173ИИ и машинное обучение

У меня на руках было 18 часов аудиозаписей, которые нужно было перевести в текст. Как расшифровать аудио в текст?

Можно заплатить профессионалам.

Можно самому всё слушать и печатать, это сложная и долгая работа.

Я решил скормить аудио дорожки машине и исправить трудные для алгоритма слова руками в специальном редакторе.

Для текстов на английском языке есть совершенно космический редактор — Descript. В нем редактируешь текст, а он при этом сам переставляет местами нужные куски аудио. Прорыв для редактуры подкастов, пока, к сожалению, для нас недоступный.

С поддержкой русского выбор немного сужается, но всё равно есть очень классные сервисы: HappyScribe, Trint, SimonSays, Sonix. Эти продукты отличаются моделью ценообразования и вниманием к деталям.

Эти сервисы не разрабывают алгоритмы распознавания речи. Я уверен, что они пользуются облачными API одного из крупных игроков — у гугла эта штука называется Google Cloud Speech-to-Text. Практические идентичные решения есть у Яндекса, Амазона и Microsoft.

По стоимости: расшифровка часа видеозвонка в гугле стоит 2.16$, у яндекса — 0.46$, а в Sonix — от 5 до 10$, остальные сервисы ещё дороже. Для сравнения, профессиональная расшифровка с русского — около 23$ за час.

Даже с крутым сервисом, работа заняла у меня больше 40 часов. Я сильно недооценил необходимый объем труда.

Кстати, у гугла есть вариант «поделиться своими аудиозаписями с гуглом для улучшения моделей распознавания». Тогда они дают скидку в 30% и берут за распознавания речи только 1.44$ в час.

Есть идея о том, что компании должны платить нам за наши данные. Это — первый известный мне пример реализации этой идеи на практике.

пост №645ИИ и машинное обучение

Не боитесь роботов, которые «захватят всех человеков»? Мне вот стало страшно, когда я послушал, как новая нейросеть гугла Google Duplex разговаривает с живыми людьми по телефону.

Послушайте сами, там запись двух полных звонков, Duplex женским голосом заказывает стрижку в парикмахерской и мужским голосом столик в ресторане. Слишком похоже на живых людей. Восхищение, сменяющееся мыслью «такое нужно немедленно запретить» — вот моя первая реакция.

Дальше примеры, как Google Duplex реагирует на прерывания (когда он читает номер по телефону и собеседник не расслышал и переспросил посередине), на уточняющие вопросы и на вопросы «ты меня слышишь?».

Внутри статьи есть высокоуровневое объяснение, как эта вся магия работает — под капотом система распознавания голоса гугла ASR и рекуррентная нейронная сеть (RRN) на основе Tensorflow Extended (TRX) (на нем строится большая часть нейронных сетей).

Очень страшно. Westworld (2) (прекрасный сериал «Мир дикого запада») уже не кажется таким уж отдаленным будущим.

https://ai.googleblog.com/2018/05/duplex-ai-system-for-natural-conversation.html

Google Duplex заказывает стрижку в парикмахерской (женский голос)