microsoft/VibeVoice
Open-Source Frontier Voice AI
О проекте
Семейство открытых голосовых моделей Microsoft: ASR для распознавания речи (до 60 минут аудио за один проход с диаризацией и таймстемпами) и TTS для синтеза длинных многоголосых диалогов. Есть стриминговые и edge-варианты.
Чем пригодится
- Расшифровать часовую запись встречи с разметкой спикеров и таймстемпами
- Настроить стриминговое распознавание речи с пользовательскими hotwords для доменных терминов
- Сгенерировать многоголосый подкаст или диалог длительностью до 90 минут
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 6 звёзд, к концу дня ожидается около 16.
- За последние двое суток темп в 1,7 раза выше, чем в предыдущие полторы недели.
- GitHub Trending Python за день: #13, +36 звёзд.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 54 607
- Сегодня
- 6 · к вечеру ≈ 16
- Форков
- 6 147
- Issues и pull requests
- 430
- Наблюдателей
- 269
- Язык
- Python
- Лицензия
- MIT
- Создан
- 25 августа 2025
- Последний коммит
- 3 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 2 октября 2026GitHub Trending Python за день: #13, +36 звёзд
Похожие по описанию
-
2,5
OpenWhispr/openwhispr
Кроссплатформенное десктопное приложение для диктовки голосом: распознаёт речь локально (Whisper, NVIDIA Parakeet) или в облаке и вставляет текст в любое приложение. Также транскрибирует встречи, ведёт заметки и даёт…
-
1,5
jankeesvw/omarchy-meeting-recorder
Записывает встречи на Omarchy: микрофон и системный звук отдельными дорожками, расшифровка локально через whisper.cpp с разделением по говорящим, главами и плеером.
-
1,5
k2-fsa/sherpa-onnx
Набор офлайн-инструментов для обработки речи на базе next-gen Kaldi и onnxruntime: распознавание и синтез речи, диаризация и идентификация говорящего, VAD, шумоподавление, разделение источников и keyword spotting.…
-
1,3
nobodywho-ooo/nobodywho
Локальный движок инференса LLM на Rust с биндингами для Python, Kotlin, Swift, Flutter, React Native и Godot, включая распознавание и синтез речи. Позволяет запускать чат-модели в формате GGUF офлайн на десктопе и…
-
2,5
Zackriya-Solutions/meetily
Локальный AI-ассистент для встреч: записывает и транскрибирует аудио в реальном времени через Whisper/Parakeet и делает саммари с помощью Ollama или других LLM, не отправляя данные в облако.
-
1,6
0xShug0/audio.cpp
Нативный C++ движок для инференса аудиомоделей на базе ggml: TTS, распознавание речи, VAD, клонирование голоса, генерация музыки. Работает без Python на CPU, CUDA, ROCm, Vulkan и Metal.