Языковые модели: что взлетает на GitHub
Самые быстрорастущие репозитории в категории «Языковые модели»: описания на русском, сценарии применения и проверка звёзд. Обновление каждые 30 минут.
-
6,1
JustVugg/colibri
Инференс-движок на чистом C без зависимостей для запуска больших MoE-моделей (744B–2.8T параметров) на потребительском железе за счёт многоуровневой памяти: VRAM, RAM и диск как единая иерархия для стриминга экспертов.
-
5,7
asgeirtj/system_prompts_leaks
Коллекция извлечённых системных промптов от Anthropic, OpenAI, Google, xAI и других — скрытых инструкций, которые получают чат-боты до первого сообщения пользователя.
-
5,1
kennethwolters/litelm
Облегчённая альтернатива litellm: маршрутизация вызовов LLM между 19 провайдерами и трансляция форматов сообщений в ~2900 строк с двумя зависимостями, без прокси, кэша и трекинга затрат.
-
5,0
MiaAI-Lab/DeepSeek-v4.1-Flash-EXL3-2x-DGX-Sparks
Локальный чекпоинт DeepSeek-V4.1-Flash в квантовании EXL3 2.9 bpw (196 GiB, 39 шардов) для запуска через vLLM с OpenAI-совместимым API на двух NVIDIA GB10 (DGX Spark) с tensor-parallel 2. Включает спекулятивное…
-
4,8
unclecode/crawl4ai
Открытый веб-краулер и скрапер, преобразующий страницы в чистый Markdown, готовый для LLM, RAG и агентов. Работает через Python API, CLI и Docker без API-ключей.
-
4,5
Edge0-AI/Edge0
Открытый фреймворк для стримингового инференса MoE-моделей: эксперты выгружаются с SSD по требованию, а обученный prerouter предсказывает маршрутизацию заранее. Работает на Apple Silicon через MLX, поставляется с двумя…
-
4,4
huggingface/transformers
Фреймворк для определения и запуска предобученных ML-моделей (текст, зрение, аудио, мультимодальные) для инференса и обучения, совместимый с большинством тренировочных и инференс-движков.
-
4,2
microsoft/markitdown
Python-утилита от Microsoft для конвертации PDF, Office-документов, изображений, аудио, HTML и других форматов в Markdown, ориентированный на использование в LLM-пайплайнах. Сохраняет структуру документа (заголовки,…
-
3,8
arikchakma/gpu-time
Экспериментальный нейросетевой парсер английских выражений времени: превращает текст в даты, интервалы и правила повторения RFC 5545, работая локально на CPU или WebGPU без отправки данных на сервер.
-
3,5
FireRedTeam/FireRedAudio
Универсальная аудио-языковая модель на 9B-параметров с раздельными представлениями для понимания и генерации речи: ASR, аудио-QA, zero-shot и instruct TTS, редактирование речи и работа с записями до часа.
-
3,5
ggml-org/llama.cpp
Реализация инференса LLM и VLM на C/C++ без зависимостей, работающая на CPU и GPU разного железа. Позволяет запускать модели локально с минимальной настройкой и квантованием.
-
3,4
FareedKhan-dev/kimi-k3-in-c
Инференс-движок на портируемом C99, запускающий 2,78-триллионную модель Kimi K3 на одном CPU в 8,24 ГБ RAM без BLAS, фреймворков и GPU. Модель стримится с диска, объём памяти влияет только на скорость.
-
3,4
AlexsJones/llmfit
Утилита на Rust, которая определяет характеристики вашего железа (CPU, RAM, GPU, VRAM) и подбирает открытые LLM, реально запускаемые на этой конфигурации, с оценкой скорости и качества. Есть TUI, CLI, веб-дашборд и…
-
3,2
deeplethe/utopia
Utopia — открытая платформа для корпоративного управления знаниями: битемпоральный граф знаний, RAG-поиск и агентные сценарии поверх одного Rust-бинарника и PostgreSQL. Разворачивается офлайн, подходит компаниям,…
-
3,1
MiaAI-Lab/DeepSeek-v4.1-Flash-DGX-Sparks
Скрипты и патчи для запуска модели DeepSeek-V4.1-Flash через SGLang на кластере из 3–4 NVIDIA DGX Spark с MXFP4/FP8, спекулятивным декодированием и OpenAI-совместимым API.
-
3,1
NVIDIA-NeMo/Switchyard
Маршрутизатор LLM-запросов: выбирает для каждого вызова самую дешёвую модель, которая справится с задачей, сохраняя совместимость с OpenAI и Anthropic API. Работает как плагин для NeMo Relay и LiteLLM, как библиотека…
-
3,0
xinxuxin/keystone-bench
Клинический бенчмарк для чат-ассистентов: проверяет, меняется ли действие модели, когда один решающий факт в диалоге убран, заменён или противоречит остальному, и остаётся ли применимой рубрика врача.
-
2,9
RyanCodrai/turbovec
Векторный индекс на Rust с Python-биндингами, использующий алгоритм TurboQuant для сжатия эмбеддингов и быстрого поиска ближайших соседей без обучения.
-
2,9
FlashML-org/FreeToken
Движок инференса Mixture-of-Experts для запуска крупных открытых MoE-моделей (290B+) на потребительском железе — GPU, CPU и оперативной памяти. Нужен тем, кто хочет гонять фронтирные модели локально.
-
2,7
maximpri/mlxtop
Терминальный монитор для локальных LLM на Mac: показывает запущенные модели, потребление памяти, загрузку GPU и скорость генерации. Работает с oMLX, MLX-LM, Ollama, llama.cpp и другими рантаймами.
-
2,6
deepseek-ai/deepseek-recipe
Набор Rust-библиотек и Python-биндингов для преобразования API-запросов разных форматов (Messages, Chat Completions, Responses) в формат Conversation, кодирования их в промпты для моделей DeepSeek V4/V4.1 и обратного…
-
2,6
firecrawl/anydoc
Rust-библиотека для конвертации офисных документов (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, PDF) в чистый Markdown с привязками для Node.js, Python и браузера. Нужна для подготовки документов к подаче в…
-
2,5
baidu/Unlimited-OCR
OCR-модель от Baidu для разбора документов: распознаёт текст с одиночных изображений, многостраничных файлов и PDF за один проход, поддерживает длинный контекст до 32768 токенов.
-
2,5
gauravapiscean/agentic-kv-cache
Симулятор префикс-кэша для LLM-сервинга, воспроизводящий реальные трейсы Claude Code и Mooncake, чтобы проверить, бьёт ли LRU политики из статей. Автор показывает, что LRU сложнее превзойти, чем утверждают публикации.
-
2,4
jundot/omlx
Локальный сервер инференса LLM для Apple Silicon с непрерывным батчингом и двухуровневым KV-кэшем (RAM + SSD), управляемый из меню-бара macOS. Совместим с OpenAI API и подходит для запуска локальных моделей в…
-
2,4
0xBakeer/deepseek-v41-flash-spark
Рецепт запуска DeepSeek-V4.1-Flash (510 ГБ, 15 360 FP4-экспертов) на одной NVIDIA DGX Spark: горячий набор экспертов держится в памяти, остальные стримятся с NVMe через O_DIRECT, плюс спекулятивное декодирование DSpark…
-
2,3
deepseek-ai/DeepSelect
Высокопроизводительная CUDA-реализация TopK-ядра для DeepSeek Sparse Attention (DSA) и сэмплера, ускоряющая torch.topk в 2–20 раз. Предназначена для разработчиков, запускающих инференс моделей DeepSeek V3.2/V4 на GPU.
-
2,3
Tencent/WeMM-Embedding
Семейство универсальных мультимодальных embedding-моделей от WeChat Vision (Tencent) на 2B, 4B и 9B параметров: единые векторы для текста, изображений, видео, визуальных документов и смешанных мультимодальных входов.…
-
2,2
youssofal/MTPLX
Локальный запуск LLM на Apple Silicon с нативным multi-token prediction (MTP) для спекулятивного декодирования без отдельной draft-модели; ускоряет вывод в 1.6–2.2x при том же распределении токенов.
-
1,9
syv-ai/qwen38-27b-rtx3090
Готовый набор для запуска Qwen3.8-27B на одной потребительской RTX 3090 (24 ГБ) через vLLM: 150k контекст, OpenAI-совместимый API, режимы single-user и batch, патчи, скрипты переквантования и бенчмарки.
-
1,7
modular/modular
Открытая часть платформы Modular для разработки и развёртывания AI: компилятор и стандартная библиотека языка Mojo, а также фреймворк MAX с инференс-сервером и пайплайнами моделей.
-
1,5
Albert-Weasker/niubigeo
Открытый инструмент для отслеживания видимости бренда и конкурентов в ответах AI-моделей: по домену показывает, как модели описывают продукт, кого рекомендуют и на какие источники ссылаются.
-
1,4
MoonshotAI/Kimi-K3
Kimi K3 — открытая мультимодальная агентная языковая модель MoE на 2.8T параметров с контекстом 1M токенов, понимающая текст, изображения и видео. Предназначена для длительного кодинга, агентной работы со знаниями и…
-
1,4
RH-RunningHub/MiniMax-H3-MultiGPU-Lightning
Рецепт ускорения инференса MiniMax H3 для генерации видео на нескольких GPU: step distillation, SageAttention2, Cache-DiT и torch.compile на SGLang, до ~12x на 8x RTX 6000D.
-
1,2
vllm-project/vllm-ascend
Аппаратный плагин для vLLM, позволяющий запускать инференс LLM на NPU Ascend (Atlas A2/A3). Нужен для развёртывания Transformer, MoE, embedding и мультимодальных моделей на оборудовании Huawei Ascend.
-
1,2
deepseek-ai/DeepSpec
Полный пайплайн для обучения и оценки draft-моделей speculative decoding: подготовка данных, обучение против кэша target-модели и замер acceptance на бенчмарках. Поддерживает алгоритмы DSpark, DFlash и Eagle3.
-
1,1
drumih/turbo-fieldfare
Кастомный рантайм на Swift и Metal для запуска Gemma 4 26B-A4B на Mac с Apple Silicon: держит в памяти ~2 ГБ, а эксперты подгружает с SSD, что позволяет работать даже на 8 ГБ RAM.
-
1,1
StarTrail-org/PixelRAG
PixelRAG — система visual RAG, которая рендерит веб-страницы, PDF и изображения в скриншот-плитки и ищет по ним напрямую, сохраняя таблицы, графики и вёрстку, теряемые при парсинге в текст.
-
1,0
tomnio/rubric
Библиотека для структурированного извлечения данных из LLM по Zod-схеме: подставляет схему в запрос, парсит и валидирует JSON, при ошибке переспрашивает модель до успеха или исчерпания попыток.
-
1,0
argonautlabsai/deltafin
Форк движка Deltafin на Rust, запускающий полную 2.8T MoE-модель Kimi K3 на Apple Silicon с потоковой подгрузкой экспертов с четырёх SSD; включает бенчмарк-пакет и инструменты ARGODRIVE.
-
0,9
nayakbhupen/Spnda
Библиотека для оценки эпистемической неопределённости и детекции галлюцинаций LLM через Exact-Match Normalized Entropy (R_sc) без NLI-моделей и GPU, в ~90 000 раз быстрее Semantic Entropy.
-
0,7
pathwaycom/arc-task-gen
Генератор задач в стиле ARC-AGI-1, распределение которых соответствует публичному eval-набору. Нужен для оценки моделей на новых задачах, которые они вряд ли видели раньше.
-
0,5
donvito/local-evals
Локальное приложение для оценки LLM: прогоняет датасеты на document→JSON, text→JSON и вызовы инструментов через OpenAI-совместимые API или OpenRouter, показывая входы, выходы, оценки и логи.
-
0,3
Staatsgeheim/MathKernel
Математическое ядро для LLM с несколькими движками (SymPy, Z3, Lean, mpmath): считает точно, символьно, формально и в интервалах, сохраняя уровни доверия и происхождение результата. Доступно как Python-библиотека и как…
-
0,3
ngocdaobao/A-Survey-on-Looped-Transformers
Обзор научных работ по looped-трансформерам — архитектурам с повторным применением слоёв для языковых моделей. Систематизирует подходы по топологии циклов, политике числа итераций, разделению весов и стратегиям памяти.
-
0,0
yureii1996/cek-probe-model
Набор Python-скриптов для проверки OpenAI-совместимых эндпоинтов моделей: получает список моделей, отправляет простые probe-запросы и выводит сводку, включая предупреждение о несоответствии архитектуры.
-
0,0
SpinnerAppreciate/glm-flash-offline-client
Автономный Windows-клиент для локального запуска модели GLM-5.3-Flash: чат работает без облака и без отправки данных наружу. Репозиторий — документация проекта, сам клиент распространяется одним архивом с весами модели.
-
0,0
Binaire-0101/FRZi-inference
FRZi-inference — это движок для инференса (выполнения) моделей машинного обучения. Проект предназначен для запуска предобученных моделей и получения предсказаний.