Сделал бесплатную программку для автоматической записи и расшифровки онлайн-встреч.
Работает с любыми звонками: zoom, google meet, телеграм, вацап...
Запускает и останавливает запись автоматически.
Расшифровывает встречи, определяет говорящих, так что реплики разложены по людям, а не слиты в один поток.
Пишет качественные выжимки встреч. Многие программы экономят на токенах, а эта использует самую мощную модель, чтобы ничего не потерять.
Умеет делать всё это локально, без доступа к интернету.
Можно подключить мощные платные модели, умеет использовать подписки (!) и API ключи.
Все данные хранятся локально на компьютере. Одна встреча — одна папка, внутри аудиофайл, расшифровка, выжимка. Очень удобно натравить нейросети.
Программа полностью бесплатная, с открытым исходным кодом. Легкая установка, нотаризованный Apple бинарник.
Работает на macOS; если вы заинтересованы в Windows-версии — чирканите мне письмо на amanu-windows@samat.me.
❧
Даже со всеми нейросетями, разработка заняла почти месяц (неделя активной работы, дальше по мелочи) — вы не представляете, сколько краевых случаев вылезло, пока я тестировал приложение на себе.

Alexandr
чем отличается от meetily?
https://github.com/Zackriya-Solutions/meetily
Ян
А прикинь бы она на лету умела слайд рисовать
Alexey Samoylov
Почему все пользователи мака первым делом вайбкодят себе спич-ту-текст заметки?
✍️❤️😁️36
Vampire Hunter G
Круто. Такое в яндекс мосте есть, очень удобная вещь.
🤣️3🥴️
Dmitry Gutorkin
А Slack Huddles поддерживается?
Samat Galimov
у них кажется нет поддержки assemblyai / openai tts, и какие-то фичи за пейволом, тут всё бесплатно
👍️2
Аrcadi
🔥 огонь, спасибо
Slava
Я занимался похожим, но в сторону Cluely - чтобы были советы по ходу созвона. Встрял как раз на распознавании речи нескольких говорящих.
Если что, принимаете пул реквесты?
kira nikolaev
Во-первых, спасибо большое! Опенсорс-чуваки святые люди и попадут в рай (если он сущетсвет)
Во-вторых — прикльные расшифровки «они\вы». Сразу приходит на ум «А я че? А они че?», я бы даже с таким агентом работал
💯️8🙏️2
Данила Михальцов
О, я такое же навайбкодил для телемоста. Локальная транскрибация и саммаризация, вытаскивается список говорящих посекундно, чтобы ллмке было понятно, кто что говорит. А то изначально я пробовал разделять голоса через эмбеддинги N записей каждого голоса (библиотека прям есть), но это работало на троечку. Щас все хорошо работает, только квен 3.8 стабильно выдает рофлы при описании статуса/настроения команды)
Stanislav Belyaev
Для той же цели использую echo99.app
Это не мое. Я решил не писать свое, а найти то, что другие уже сделали и опубликовали. Отлично, когда софт становится персональным, и когда делаешь то, что нужно только для тебя
Я начинал писать тоже самое, но бросил, потому что есть те, кто за меня написали. В решении ничего не отправляется в облако, транскрипцию проверил на английском языке.
Samat Galimov
смотря какие! лучше сначала обсудить
Siarhei Fedarenka
А если этот проект запустить со своим железом что из нейросетей потребуется?
Насколько это реальность сделать на каких-нибудь картах типа RTX 5080 с 16 vram?
Samat Galimov
локально там parakeet v3, он даже на CPU приличную скорость дает :)
🤝️
Amyot X
о класс! пойду форкать!
⚡️
nikitades
Самат, добрый день! Круто! Только обновите, пожалуйста, иконку, а то некрасиво, хоть и очень здорово!
Samat Galimov
ахаха, может стоит поменять на «Я:», спасибо!
какую новую?
nikitades
Ну тоже перышко, только такое стеклянное, глосси
kira nikolaev
нет! зачем?) наоборот, выглядит чем-то живым в этом море слопа
👍️🤣️3
nikitades
(Речь про док-иконку, а не статусбар, в статусбаре отличная)
😭️
Samat Galimov
на здоровье! я там правда кучу краевых случаев поймал, в основном с эхом в случае разговора без наушников, они в виде документации в гите сохранены, это практически самое ценное во всем проекте (ну кроме того, что оно работает и можно запустить за минуту, прописав ключи (там даже ссылки на страницы, где эти ключи можно достать))
⚡️2
может сделаешь?
👍️
обрати внимание, во время записи он в доке красной становится, что делать, если стеклянная?
nikitades
Не видел этого еще. Наверное, можно сделать и стеклянный вариант с записью 🙂 Я пофантазирую
Sergey Malinin
stt какой используется?
Samat Galimov
оо, очень похоже! но у них не open source, и хз что будет с лицензией, тут всё четенько
Алексей Кун
уже по быстрому и качественному русскому распознаванию сберовская GigaAM v3 E2E-RNN-T считается лучше паракита. в handy на нее пересел
👍️5
Samat Galimov
локально parakeet v3, api assemblyai или openai
🙏️
thefox
Еще telemost бы добавить, для РФ он актуален
Samat Galimov
мне кажется он есть в списке автоопределений, если нет — добавлю
ооо, спасибо, добавлю! оно на mac работает?
Dima Afonin
https://anarlog.so 🤔
👎️
Алексей Кун
в handy, который вы с Красильщиком на вайбкодинг марафоне открыли для себя (и я) — работает :)
Ivan Kovalenko
а как быть с express ? ) и контур толком?) это вкачуемо?
Samat Galimov
я на VoiceInk пересел, у него есть realtime preview! https://tryvoiceink.com
запись звонков я ещё готов вайбкодить, но вот это увольте :)
👍️
всё работает, автоопределение звонков в этих приложениях добавлю прям сейчас
👍️2
Dima Afonin
В Handy он тоже давно появился (если выбрать модель, поддерживающую рил-тайм)
Samat Galimov
о, посмотрю ещё разок, спасибо! по вайбу мне handy больше нравился
но voiceink норм, если один раз настройки долбанутые прокликать
🤗️🤝️
Stanislav Belyaev
Да, с opensource непонятно. История последних 6 месяцев существования этой тулзы ничего не предвещает. Я написал в личку на прошлой неделе авторам с преложением открыть на публику с возможностью контрибьютить туда – пока не получил ответ. Но тоже интересно
Алексей Кун
я пробовал и войсинк, но не помню что мне там не понравилось. нагромождение толи интерфейса, толи функций. а хэнди простой и легкий
👍️2🤝️
Samat Galimov
пусть расцветают 100 цветов
мне просто самому надо было именно такое (assemblyai для tts + openai для выжимок), я сделал и решил поделиться с миром
👍️6
Denis Dmitriev
Как же крипово выглядит русский язык в приложении 🙂
Никогда нигде его не использую.
Если вдруг кому-то захочется сделать мультиязычность, готов помочь с переводом.
Samat Galimov
на здоровье, там есть английский конечно :)
Dima Afonin
Плюсую вот сюда — хэнди чисто одномерная штука и решает свою задачу
Алексей Кун
и поэтому я не нашёл пока вот такой ai-агрегатор звонков, который не выглядит как космолёт, где не надо напрягаться и думать как же с ним работать и разбираться в куче окон и настроек
Denis Dmitriev
Туплю, а где? Не могу найти.Блин, там доп. настройки есть :)
Samat Galimov
у меня сначала было совсем без настроек, но потом я понял, что кто-то может не захотеть assembly, и что локальные модели хорошо бы добавить для сенситивных звонков...
больше всего внимания я вложил именно в окно настроек, но как сделать его ещё проще — пока не придумал
буду рад предложениям!
Anton
Ну что - вангую следующим это поиск RAG по саммари записям )
👍️
Maxim Gorbachevskiy
Я из мира “слайдов”, и сам бы хотел такое – но не понимаю как это сделать. Ведь “слайды” это демонстрация смысла сказанного - и иногда самое важное говорится в конце. Поэтому в live-режиме системе надо многократно пересматривать весь контент слайдов целиком, и каждое обновление саммари будет триггерить полный рефреш всех слайдов.
А вот для авто-отображения простых слайдов можно было бы https://marp.app/ + mermaid .
Попадались ещё идеи?
Ян
Да, конечно, постоянно обновляются по мере понимания смысла моделью. Просто такой вот хэндсфри иллюстратор
Maxim Gorbachevskiy
Ну вот если стримить markdown в Marp, то вот и автоматические простенькие слайды, – или нет?
(о качестве вижуала мы не говорим, я пока не видел ни одного тула, который бы выдавал PPT в качестве, которое бы удовлетворяло бы мои профессиональные запросы в части вижуала хотя бы на треть)
❤️
Denis Dmitriev
Не работает. macOS 27 Golden gate.
Автоматически определяет русский, но это не так.
Переключение на
enничего не даёт.Ян
Что то такое пытаюсь прикрутить к своей самописной записывалке встреч
Что пока встреча идёт я шарю экран и там на лету прямо все появляется
Maxim Gorbachevskiy
Оч любопытно! Какой стек для визуализации? Что-нибудь получается визуализировать нормально?
Ян
Astra fast med + HTML
Но она получает довольно много нужного контекста поэтому выходит осмысленно. То есть знает спикеров повестку погоду и прочее
Оно внутренне к сожалению поделиться не могу. Только концептом
Точнее не совсем уж свободная страница
Чтобы не прыгало и связность была она генерит на внутреннем своем ДСЛ - типа тут таймлайн тут цитата тут график иллюстрация
Основная проблема - задержка в неск секунд
Maxim Gorbachevskiy
>> сожалению поделиться не могу
Без проблем! Мне интересно на концептуальном уровне – насколько сложных слайдов получается достичь?
Насколько я понимаю, есть reveal.js сотоварищи, который может сделать структурные слайды.
Я лично работаю с слайдами высокой степени сложности (комплексная графика) и пока не смог добиться ничего ценного от имеющихся стеков js/html.
Ян
Лучший лайфхак который пока придумал - это чтобы юзер не удивлялся прыганию там на месте слайда прямо такая анимация идёт как у какого нибудь Фейсбука во время загрузки приложения.
То есть юзер видит что вот этот кусок ещё герится и не удивляется когда там что то прыгает
Совсем совсем несложных.
👍️
Samat Galimov
у тебя система с английским интерфейсом?
Denis Dmitriev
Польским 🙂
Samat Galimov
аааа! ща сделаю default английский, в этом дело, наверное. Спасибо!
а ты руками вот тут пробовал англ выбрать?
я только что на ру и обратно переключился, вроде работает
Denis Dmitriev
Тебе спасибо за тулзятинку
❤️
Maxim Gorbachevskiy
Ну тогда отлично! А у меня, явно, профдеформация (20 лет в слайдах как проф подрядчик)
Ян
Просто цель чуть чуть другая.
Людям тяжело держать внимание а так смотрят и видят что обсуждается что было
Denis Dmitriev
Да. При переключении на
enничего не происходит 🙁Samat Galimov
Дойду до дома и натравлю агента, а то батарейка у ноута села:)
Maxim Gorbachevskiy
Это, кстати, прикольный кейс, да.
У меня другая идея была: автоматически отслеживать и сообщать mis-alignments (булщит-трекер). Т.е. типа раньше о чем-то договорились, а теперь говорится об ином (те или иные договорённости). Но тут надо много контекста..
👍️
Ян
Оно ещё в фоне ищет кстати подтверждения или опровержение тезисов что говорит автор и такой кругляшок крутится. И потом если есть источники добавляются
Ну условно что 80% открытых скиллов гитхаба - мусор
👍️2
Но это дольше секунды уже поэтому нужна анимация
Maxim Gorbachevskiy
Какая индустрия/ситуация, кто участтники митингов, – если не секрет? (можно общими словами). Это больше направлено на участников рабочей команды (коллеги, peers), или сеньоров (seniors, верхний менеджмент который нифига не бум-бум в теме но надо понимать) ?
Тематика, наверное, продакт мегнеджмент?
Dima Afonin
Ну вот Anarlog я там выше постил — как будто самое близкое из того, что я смог найти
Ян
Два сеттинга
1- обучающие семинары типа олл хендс где люди приходят задают вопросы а спикеры отвечают учат
2- обычные рабочие встречи на 5-15 человек где прыгают по темам без протокола
🔥️
Maxim Gorbachevskiy
В какоммире мы живём… Пять лет назад: через неделю делимся слайдами, ввсе рады. Сейчас: задержка визуализации дольше секунды, уже все недовольны 🤣
😁️4
Ян
И по первому же слайды заранее не приготовить потому что неясно какие вопросы будут
А наглядности хочется
Получилось что то вроде гибрида.
Спикет говорит "следующий слайд" - и оно чистится, переводит фрейм.
То есть что то вроде голосового управления на лету получается
🔥️
Maxim Gorbachevskiy
явно сильный кастом под конкретный воркфлоу, но супер-классный кейс, я впечатлён
❤️
начинаю думать, что это что-типа автоматического Miro / whiteboard “на стероидах”
Ян
Очень похоже только сами фреймы простые по структуре.
Maxim Gorbachevskiy
@samatg спасибо за тул от души, будем тестить! Я раньше сидел на https://github.com/aTrainTranscription/aTrain но его явно пора выкинуть ))
🙏️
Ян
Но я скажу может быть крамолу - лучший сейчас (из тех что я нашел сам) стриминговый распознавание русского - это yandex stt а не немотрон
Оффлайн пожалуйста есть качаственные но онлайн Яндекс точнее всего и прямо реально на лету с минимальной задержкой (это не реклама, у меня тоже может выбрать разные движки)
👍️
Прикол ещё всякими плагинами из DOM вытаскивать события типа "Вася заговорил" "Петя замьютился", в чате написали.
И сигналами в записывалку тоже слать.
И ещё локальная вектрная база эмбедингов голосов уже известных коллег чтобы не каждый раз диаризацию по секторам с центрированием
👍️
Ildar N
Что то не смог найти где указать кастомный провайдер с ключом, думал где свой ключ там можно будет, а там опять жестко openai или antropic
например у меня openai через openrouter
Art Moderne
Круто! А почему название такое?
Николай Чирясов
Вайбтестеры скоро будут ценнее вайбкодеров.
Alexandr Tatarintsev
Класс! Установил тестить! А можно фичреквест?)
лого в Dock почти не читается если темная тема стоит)
Samat Galimov
добавил!
спасибо, поправлю!
❤️
Denis Dmitriev
https://github.com/gsamat/amanu
Это опенсорс, можно самому pull request сделать 🙂
Samat Galimov
язык после перезапуска приложения обновляется, ты пробовал перезапустить?
Denis Dmitriev
Вот сейчас апдейт скачал, перезапустил. Язык переключился.
Вроде там нет фикса, значит, работает 🙂
👍️
Ilya Americanov
Мне показалось что Whisper Large V3 работает лучше Parakeet V3 (сбер пока не пробовал)
Vitaly Rybnikov
Блиииин, пушка бомба, спасибо, пошел тестить, тоже думал о таком!!!
Victor Klochikhin
класс, спасибо! эти программки оч недооценены в личном юзкейсе кстати
я через похожую самописную программу с локальным инференсом прогнал часов шесть своих записей разговоров с папой, где как можно больше узнал и записал про его детство и в целом ту ветку нашей семьи.
там очень много текста сырого вышло, так что я потом ещё сверху через ллм для выжимки и формата прогнал и прям оооочень хорошо получилось
❤️
Пётр Левшин
Самат, привет.
1. можно переключить на локальный whisper?
2. для локализации натравить harness/внешнюю модель по base url?
👍️
Dmitry Kravtsov
Спасибо, очень удобно!
Единственная проблема, которую я заметил: если разговаривать без наушников, расшифровка дублируется — одна и та же реплика появляется и от You, и от Them.
Samat Galimov
Не сложно добавить обе вещи!
Да, это проблема эха, в основном распознавании я ее решаю эвристиками, а в realtime этого не делаю
Ты ведь про риалтайм?
Dmitry Kravtsov
да, про риалтайм
может быть можно посмотреть на разницу звуков (динамики минус микрофон), но не уверен что это из коробки полетит
Alexander Zinoviev
Очень круто! Пара мыслей, пока тестил на реальной встрече:
1) все модели, что есть - забанены в РФ, поэтому я через олламу подключил дипсик. Но подключал уже после завершения встречи. Что-то пошло не так, сначала висело в Pending, потом в failed. И как запустить ещё раз саммаризацию я не понял.
2) хз можно ли добавить в поддержку бесплатные Клауд модели, тот же DeepSeek, чтобы не ollama локальный (и не заморачиваться с локальной настройкой), а сразу по АПИ в дипсик
3) не смог проверить (но и не нашел) - можно ли сделать свой шаблон саммаризации. Те я хочу в своем формате ответ, ключевые поинты и тд.
Бонус) ollama так и не заработала почему-то, в UI все подключилось и модельку видит, но в логах олламы вижу 404 при попытке сделать саммари
🙏️
Ilya Americanov
Не хватает возможности запустить другую модель отличную от Parakeet, например Whisper V3 large
+ не хватает возможности прогнать на уже существующих записях
Samat Galimov
сделал пока вот так, в свежих macos будет подстраиваться под системную тему
🔥️
nikitades
Ой, Самат, а я issue сделал в обед, думал помочь :) твоя иконка выглядит круто! Спасибо!
Samat Galimov
блин, прости, я пропустил! спасибо!
❤️
Tim
Для Windows есть релиз? Работает на Whisper?
Samat Galimov
windows в работе, там куча бэкендов, выбираешь какой хочешь
добавил поддержку кастомных урлов! попробуй олламу ещё разок плиз
добавил кнопку «повторить» прямо в списки встреч
добавил свои шаблоны саммаризации (в advanced настройках)
да, можно!
да, теперь можно!
👍️
сделал дефолт английским, когда другой язык!
добавил поддержку gigaam, ровно ту же, что и в handy!
но по моим тестам она хуже чем parakeet
есть ли публичные бенчмарки, может быть я неправильно его готовлю?
Алексей Кун
по моим ощущениям она работала быстрее, на точность я не измерял, только читал где-то что хорошо или лучше работает. пруфы уже не найду.
я побуду мясным прокси, принёс из чатагпт:
NVIDIA для Parakeet публикует 5.51% на FLEURS ru: https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3
Handy Whisper Large vs Parakeet V3 vs GigaAM v3. Русская надиктовка: https://rutube.ru/video/9d9f3a766d9262a6bc4938f229848044
Alex
Супер, спасибо!
Alexey Gornostaev
Очень полезно, спасибо!
Я раньше записывал handy / OBS, потом расшифровывал с помощью Aiko (это ГУИ для транскрибации) и после отдавал уже на саммери. В одном воркфлоу и приложении, конечно, гораздо удобнее.
Еще очень хочется использовать локальную модель для саммеризации, но то ли я модели не те пробую (Gemma e4b, Qwen 3.5 9b), то ли что, но результат заметно хуже, чем в облаке и недостаточен.
Последний абзац это не про Amanu, это я раньше сам пробовал. Возможно, через Amanu будет лучше, попробую обязательно попозже.
Anton Masyan
defender на корповом маке просто блокирует amanu.me ж) луукс саспишес
Anton
нормально, у GigaAM модели E2E (с пунктуацией и заглавными буквами) чуть хуже по качеству чем базовые (только буквы в lower) поэтому такая разница WER
Sergey
т.е. чиркать на почту пока нет смысла?)
Samat Galimov
Есть, если хочешь получить сообщение о запуске
Sergey
хочешь. щас отмечусь, спасибо
Мikhаil М
моя проблема: программа пишет отдельно мой голос локально, без учёта включен ли у меня микрофон в звонилке. Поэтому в конфлюенсе в документе по интеграциям сервисов попадает сколько варить макароны
Vlad Ermakov
Классная штука, буду пользоваться. Обнаружил досадный баг, приложение не определяет наличие Клода на устройстве. Перекустанавливал и вашу программу, и Клод - ничего не изменилось(
Артем Федорчук
Добрый день. C приложением Dion автоматический не включается запись. А так идея очень классная.
🙏️
Sergii K
Планируется добавить синхронный перевод в следующих версиях?
Samat Galimov
Спасибо большое за багрепорт! Разберусь
Добавлю!
Не планировал! Хочешь прямо риалтайм?
Sergii K
Ага, как отдельная опция с выбором модели, которая будет осуществлять перевод. Можно и с небольшой задержкой под каждой транскрибированной строкой серым текстом писать перевод…
Еще заметил баг или фичу, что когда митинг на смешанных языках ведется, то транскрипция стопорится. У меня включено локальное распознавание
Andrey
ухты какая вещь, давно мечтал о таком! спасибо!
а можно предложить идею? сделал PR на гитхабе: cli команду для расшифровки готовых аудиофайлов, чтобы не держать на ноуте вторую модель и чтобы агенты могли этим пользоваться. норм или лучше не надо? =)
код писал вместе с фейбл, надеюсь, он не перестарался. в описании PR по сути два вопроса:
1. пропускать ли по умолчанию саммари, когда расшифровываешь файл из консоли?
2. показывать ли такие файлы в списке записей рядом со встречами?
👍️
Fedor "Theo" Chervinskii
У меня не заработала транскрипция на macOS Tahoe из-за ошибок на уровне кодеков - сделал PR чтобы пофиксить https://github.com/gsamat/amanu/pull/11
🙏️
Samat Galimov
к сожалению, сложно отследить мьют внутри звонилок, они ведь продолжают держать системный микрофон :(
спасибо! сейчас будет релиз
добавил, сейчас будет релиз
скажи пожалуйста, а у тебя claude code точно установлен? есть отдельно Claude desktop
можешь попробовать запустить
claude --versionв терминале, пожалуйста?Vlad Ermakov
Самат, спасибо за ответ. Установлен Claude Desktop v2.1.236
В терминале не дает проверить:
Еще один комментарий. Не знаю, как здесь реализована детекция сервиса видеоконференцсвязи для автоматической активации записи аудиопотока. Нужно ли десктопное приложение Zoom или сервис ловит активацию Zoom в веб-браузере.
Я пользуюсь веб-приложением Контур Толк и другими сервисами (DION, Телемост, СберJazz) – все в браузере.
Было бы здорово настроить детекцию этих сервисов через браузер. Может, какой-то продвинутый интерфейс в настройках, где можно указать домены сервисов для мониторинга соединений.
Уже попробовал вашу программу, работает отлично, очень полезная! За GigaAM отдельное спасибо (вроде она самая шустрая для русской речи, но это неточно, не эксперт)
Samat Galimov
Нужно Claude code установить, без него не заработает :(
Посмотрю, можно ли без него, сделаю апдейт если можно
Браузеры ловит!
Vlad Ermakov
Спасибо, установлю
Ruslan
Круто! Делал подобное в вебе, а недавно сделал iOS приложение, где транскрибация происходит прямо на телефоне, без подключения к интернету.
Макс
Локальная работа - это главный плюс. Сейчас многие боятся заливать конфиденциальные созвоны в облако, так что такая опция делает инструмент реально применимым для работы с клиентами.
Dmitry
не могу никак сбросить ключ OpenAI и перекстановка через appcleanner не помогла. как его поменять?
Pavel Kosenkov
А можно в репозиторий добавить хотябы инструкцию по сборке под винду? понимаю что пайплан настроить не просто без тестового окружения но хотя бы инструкцию с тегом "as is". Я бы попробовал собрать по ней приложение, с баг репортом если потребуется
Samat Galimov
Сейчас пришлю ссылку, как раз начал бета тест
Age
Самат благодарю за приложение
🙏️
Alexander Zinoviev
Продолжаю пользоваться и тестировать.
Могу сказать, что мне не хватает сейчас:
1) количество участников в виде 2. В целом и ладно. Современные модели (для саммаризации использую) легко справляются с тем, чтобы по именам потом раскидать. Но потенциально хорошо бы иметь возможность всех участников проставлять
2) вот это более важное - смотреть саммари прямо в UI приложения. При клике на встречу сейчас есть только entry кусок текста. И хотелось бы также вместо того, чтобы открывать папку с файлами, открывать отдельно файл summary - сразу видеть и читать его из приложения
А так - пишет неплохо, транскрибирует с достаточным качеством. Есть только на уровне ощущений, что качество звука падает немного в самом процессе разговора. При активном эхо-подавлении меня вообще почти не слышат собеседники
Samat Galimov
это сделаем
🔥️
поэтому активное эхо-подавление выключено по умолчанию
без него качество не должно падать совсем, мы не влезаем в аудиотракт в этом случае
сделал!
обновление уже должно приехать
Andrei M
Приветствую.
Приложение полезное, спасибо. Пара фичереквестов:
1. Поддержать использование и других моделей, например полную large-v3
2. Разрешить указывать URL сервера в разделе Расшифровка/В облаке/OpenAI
3. Реализовать расширенную диаризацию, чтобы детектил не только я\они, а полный набор говорящих. Я использую локально для этого pyannote, работает отлично, если надо - могу выслать свой питон скрипт, который из аудио\видео делает готовый транскрипт
Samat Galimov
2. Есть
3. Есть, если модель поддерживает
Andrei M
2. Последняя версия. Вижу опцию только в "Саммари", а в "Расшифровке нет"
3. Какая из текущих поддерживает? Whisper?
Kirill Gonchar
А как лучше поступать с выбором языка, если в процессе разговора люди переключаются с одного на другой?
и еще - можно добавить какой прогресс-бар в процессе расшифровки записи. а то сейчас не понятно работает ли он или нет.
и еще вот он никак не поясняется почему не произошла саммеризация
Alexander Zinoviev
Поставил 0.4.26 версию, но пока не понял, где саммари смотреть. Подскажи плз, куда тыкнуть? )
Samat Galimov
Там есть кнопка внизу :)
Vlad Ermakov
Самат привет! Есть 2 комментария
1) Опечатка "Записывать встречи сама". Видимо "самостоятельно"?
2) Приложение ругается на Comet Helper. Это chromium-браузер Comet от ИИ-сервиса Perplexity
Странно!