youssofal/MTPLX
3x faster speeds on MLX | Qwen 3.8 27B | Native MTP Speculative Decoding On Apple Silicon With No External Drafter.
О проекте
Локальный запуск LLM на Apple Silicon с нативным multi-token prediction (MTP) для спекулятивного декодирования без отдельной draft-модели; ускоряет вывод в 1.6–2.2x при том же распределении токенов.
Чем пригодится
- Запустить локальный OpenAI-совместимый сервер на Mac и подключить к нему Claude Code или Open WebUI
- Настроить глубину MTP-декодирования под конкретный чип командой mtplx tune
- Собрать MTP-адаптер для своей модели из Hugging Face через mtplx forge и проверить ускорение
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 0 звёзд, к концу дня ожидается около 10.
- Среди свежих форков — заметные разработчики: @janishar (2 258 подп.).
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 2 300
- Звёзд за сутки
- 10
- Форков
- 171
- Issues и pull requests
- 495
- Наблюдателей
- 18
- Язык
- Python
- Лицензия
- Apache-2.0
- Последний релиз
- v2.11.2 · 6 сентября 2026
- Создан
- 2 мая 2026
- Последний коммит
- 6 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 13 сентября 2026GitHub Trending за месяц: #13, +1 116 звёзд
Похожие проекты
-
6,4
JustVugg/colibri
Инференс-движок на чистом C без зависимостей для запуска больших MoE-моделей (744B–2.8T параметров) на потребительском железе за счёт многоуровневой памяти: VRAM, RAM и диск как единая иерархия для стриминга экспертов.
-
5,6
asgeirtj/system_prompts_leaks
Коллекция извлечённых системных промптов от Anthropic, OpenAI, Google, xAI и других — скрытых инструкций, которые получают чат-боты до первого сообщения пользователя.
-
5,1
huggingface/transformers
Фреймворк для определения и запуска предобученных ML-моделей (текст, зрение, аудио, мультимодальные) для инференса и обучения, совместимый с большинством тренировочных и инференс-движков.
-
5,0
MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks
Локальный чекпоинт DeepSeek-V4.1-Flash в квантовании EXL3 2.9 bpw (196 GiB, 39 шардов) для запуска через vLLM с OpenAI-совместимым API на двух NVIDIA GB10 (DGX Spark) с tensor-parallel 2. Включает спекулятивное…
-
4,7
unclecode/crawl4ai
Открытый веб-краулер и скрапер, преобразующий страницы в чистый Markdown, готовый для LLM, RAG и агентов. Работает через Python API, CLI и Docker без API-ключей.
-
4,6
Edge0-AI/Edge0
Открытый фреймворк для стримингового инференса MoE-моделей: эксперты выгружаются с SSD по требованию, а обученный prerouter предсказывает маршрутизацию заранее. Работает на Apple Silicon через MLX, поставляется с двумя…