NVIDIA/Model-Optimizer
A unified library of SOTA model optimization techniques like quantization, distillation, pruning, neural architecture search, speculative decoding, etc. It compresses deep learning models for downstream deployment frameworks like TensorRT-LLM, TensorRT, vLLM, etc. to optimize inference speed.
О проекте
Библиотека NVIDIA для сжатия и ускорения моделей: квантизация, прунинг, дистилляция, NAS и speculative decoding с экспортом в TensorRT-LLM, vLLM, SGLang. Для ML-инженеров, готовящих модели к деплою.
Чем пригодится
- Квантизовать LLM в FP8 или NVFP4 для ускорения инференса в vLLM
- Сжать модель через pruning и distillation, сохранив качество
- Экспортировать оптимизированный чекпоинт в TensorRT-LLM или SGLang
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 25 звёзд, к концу дня ожидается около 42. Обычный темп — 10 в день, сейчас в 4,2 раза больше.
- За последние двое суток темп в 5,2 раза выше, чем в предыдущие полторы недели.
- GitHub Trending за день: #5, +22 звезды.
- GitHub Trending Python за день: #3, +22 звезды.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 3 886
- Сегодня
- 25 · к вечеру ≈ 42
- Форков
- 621
- Issues и pull requests
- 2 523
- Наблюдателей
- 32
- Язык
- Python
- Лицензия
- Apache-2.0
- Последний релиз
- 0.47.0 · 23 сентября 2026
- Создан
- 23 апреля 2024
- Последний коммит
- 24 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 24 сентября 2026GitHub Trending за день: #5, +22 звезды; GitHub Trending Python за день: #3, +22 звезды
Похожие по описанию
-
1,6
microsoft/onnxruntime
Кроссплатформенный ускоритель инференса и обучения ML-моделей. Запускает модели из PyTorch, TensorFlow, scikit-learn и других через формат ONNX с оптимизацией графа и аппаратным ускорением.
-
1,6
NVIDIA/TensorRT-LLM
Библиотека NVIDIA для оптимизации инференса больших языковых моделей и визуальных генеративных моделей на GPU: Python API, специализированные ядра и эффективный рантайм на C++/Python.
-
1,1
MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks
Локальный чекпоинт DeepSeek-V4.1-Flash в квантовании EXL3 2.9 bpw (196 GiB, 39 шардов) для запуска через vLLM с OpenAI-совместимым API на двух NVIDIA GB10 (DGX Spark) с tensor-parallel 2. Включает спекулятивное…
-
1,1
hao-ai-lab/FastVideo
Фреймворк для ускоренной генерации видео: пост-тренировка (дистилляция, LoRA, sparse attention) и быстрый инференс диффузионных видеомоделей на GPU и Apple Silicon.
-
1,3
deepseek-ai/DeepSpec
Полный пайплайн для обучения и оценки draft-моделей speculative decoding: подготовка данных, обучение против кэша target-модели и замер acceptance на бенчмарках. Поддерживает алгоритмы DSpark, DFlash и Eagle3.
-
3,0
AlibabaResearch/SparkDiffusion
Фреймворк для ускорения генерации видео на Diffusion Transformer моделях: сочетает разреженное low-rank внимание RoLa, дистилляцию CrossDistill и собственные операторы, давая 200×+ ускорение инференса для Wan 2.1/2.2.