Tencent-Hunyuan/AuK
AuK: An Open-Source Foundational Model for Speech Generation and Editing
О проекте
AuK — открытая фундаментальная модель на 1.5B параметров для генерации и редактирования речи через текстовые инструкции: zero-shot TTS, правка контента и акустики, эмоций, шума и разделения источников.
Чем пригодится
- Синтезировать речь голосом из референсного аудио по тексту
- Изменить эмоцию или тембр записи, сохранив содержание и голос
- Отделить целевого говорящего или вокал от музыкального микса
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 20 звёзд, к концу дня ожидается около 24.
- Интерес спадает: темп за двое суток — 31% от уровня предыдущих полутора недель.
- Репозиторию 30 дней, а у него уже 1 111 звёзд.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 1 111
- Звёзд за сутки
- 24
- Форков
- 81
- Issues и pull requests
- 20
- Наблюдателей
- 6
- Язык
- Python
- Создан
- 19 августа 2026
- Последний коммит
- 16 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 17 сентября 2026Топ новых репозиториев за месяц: #73
- 16 сентября 2026Топ новых репозиториев за месяц: #81
- 15 сентября 2026Топ новых репозиториев за месяц: #89
- 14 сентября 2026Топ новых репозиториев за месяц: #97
Похожие проекты
-
7,9
mcncarl/jianying-headless
Локальный инструмент автоматизации для Jianying Professional на macOS: строит нативные черновики из JSON-плана, редактирует копии существующих многодорожечных проектов и по запросу экспортирует MP4 через нативный…
-
6,1
wide-trace/open-higgsfield
Открытая self-hosted студия для генерации изображений и видео через 32 модели (8 image, 24 video) в одном интерфейсе с единой строкой промпта, галереей и настройками под каждую модель.
-
4,9
kuhnhomeuk-cell/procedural-film
Agent skill, превращающий тему в 30-секундный вертикальный фильм: вся графика рисуется на canvas на чистом JavaScript, звук синтезируется через Web Audio, без медиафайлов. На выходе — один HTML-плеер и экспорт в MP4.
-
4,9
XGEN-Labs/XGEN-JING
XGEN-JING — эгоцентричная интерактивная модель на базе MiniMax-H3, которая по действиям, референсным изображениям и истории наблюдений генерирует видео и звук от первого лица для навигации, взаимодействия с объектами и…
-
4,8
jamiepine/voicebox
Локальная студия AI-голоса: клонирование голоса, синтез речи на 7 TTS-движках и диктовка в любое приложение через глобальный хоткей. Альтернатива ElevenLabs и WisprFlow, работающая полностью на вашей машине.
-
4,4
inikolax/remiqora
Локальная студия генерации музыки на GPU, объединяющая ACE-Step 1.5 и YuE2-3B в одном Vue-интерфейсе с многодорожечным DAW, разделением на стемы, MIDI-транскрипцией и LoRA-дообучением.