ashhart/TensorFold
Fast, exact LLM decoding on Apple Silicon (MLX) behind an OpenAI-compatible endpoint
О проекте
Сервер инференса LLM для Apple Silicon (MLX) и NVIDIA GPU с OpenAI-совместимым API и точным спекулятивным декодированием. Поддерживает семейства Nemotron, Qwen3.8, GLM-5.3 и Gemma 4 с собственными ядрами и драфт-моделями.
Чем пригодится
- Запустить локальный OpenAI-совместимый эндпоинт на Mac для Qwen3.8-27B в 4-битной квантизации
- Скачать чекпоинт и драфт-модель заранее командой tensorfold pull перед запуском сервера
- Проверить совпадение вывода с драфтом и без него через параметр draft: false
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 10 звёзд, к концу дня ожидается около 65. Обычный темп — 0 в день, сейчас в 65 раз больше.
- До этого репозиторий почти не получал звёзд — около 2 в день.
- Всплеск держится 3 дня подряд — это не случайный выброс.
- GitHub Trending Python за день: #4, +160 звёзд.
- Около 18 форков в сутки — код забирают себе.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 534
- Сегодня
- 10 · к вечеру ≈ 65
- Форков
- 53
- Issues и pull requests
- 67
- Наблюдателей
- 9
- Язык
- Python
- Лицензия
- MIT
- Последний релиз
- v0.3.6.1 · 28 сентября 2026
- Создан
- 19 июня 2026
- Последний коммит
- 28 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 28 сентября 2026GitHub Trending Python за день: #4, +160 звёзд
Похожие по описанию
-
0,5
MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks
Локальный чекпоинт DeepSeek-V4.1-Flash в квантовании EXL3 2.9 bpw (196 GiB, 39 шардов) для запуска через vLLM с OpenAI-совместимым API на двух NVIDIA GB10 (DGX Spark) с tensor-parallel 2. Включает спекулятивное…
-
1,6
NVIDIA/TensorRT-LLM
Библиотека NVIDIA для оптимизации инференса больших языковых моделей и визуальных генеративных моделей на GPU: Python API, специализированные ядра и эффективный рантайм на C++/Python.
-
4,3
NVIDIA/Model-Optimizer
Библиотека NVIDIA для сжатия и ускорения моделей: квантизация, прунинг, дистилляция, NAS и speculative decoding с экспортом в TensorRT-LLM, vLLM, SGLang. Для ML-инженеров, готовящих модели к деплою.
-
2,5
incoai/splash
Локальный движок инференса LLM для Apple silicon, оптимизированный под конкретные модели: обслуживает OpenAI- и Anthropic-совместимые API для кодинг-агентов на одном Mac.