vllm-project/semantic-router
A programmable Mixture-of-Models router for heterogeneous LLM inference
О проекте
Программируемый слой маршрутизации запросов между разными LLM: выбирает или комбинирует модели по сигналам запроса, предпочтениям пользователя и политикам приложения. Помогает управлять качеством, стоимостью, задержкой, приватностью и безопасностью без жёсткого кодирования логики в приложениях.
Чем пригодится
- Направить запросы с чувствительными данными на приватные или edge-модели, а остальные — в облако
- Снизить стоимость инференса, маршрутизируя простые запросы на дешёвые модели, а сложные — на сильные
- Задать политики выбора модели под конкретных пользователей и типы рабочих нагрузок
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 4 звезды, к концу дня ожидается около 13.
- За последние двое суток темп в 2,8 раза выше, чем в предыдущие полторы недели.
- GitHub Trending Go за день: #4, +22 звезды.
- Среди свежих форков — заметные разработчики: @strategist922 (894 подп.), @ItsRoy69 (245 подп.).
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 5 978
- Сегодня
- 4 · к вечеру ≈ 13
- Форков
- 989
- Issues и pull requests
- 4 350
- Наблюдателей
- 63
- Язык
- Go
- Лицензия
- Apache-2.0
- Последний релиз
- v0.4.0 · 27 сентября 2026
- Создан
- 26 августа 2025
- Последний коммит
- 29 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 29 сентября 2026GitHub Trending Go за день: #4, +22 звезды
Ещё в этой категории
-
8,2
firelex/jeff
Небольшие дообученные модели Qwen3.5 и Gemma 4 для zero-shot классификации: по описанию ситуации и списку вариантов возвращают калиброванную вероятность для каждого варианта за один forward pass.
-
7,4
VectifyAI/PageIndex
Движок RAG без векторной базы: строит иерархический древовидный индекс документа и ищет по нему рассуждениями LLM, как человек по оглавлению. Для длинных профессиональных PDF — финансовых, юридических, технических.
-
7,2
Niko1221/Strata
Локальный движок инференса на C++, запускающий 125B MoE-модель Qwen3.8-Flash-Next на обычном ПК с одной NVIDIA GPU (12–24 ГБ) и 64 ГБ RAM, с OpenAI/Anthropic-совместимым API на localhost.
-
5,6
ollaya-dev/ollaya
Локальный рантайм для decision-моделей: скачивает и обслуживает модели классификации и маршрутизации через API, совместимый с TypeSafe. Аналог Ollama, но для моделей, возвращающих вероятности, а не текст.
-
5,3
PostHog/jeeves
Jeeves — это reasoning-модель на базе Qwen3.5-9B (LoRA + pointer head), обученная через SFT и CISPO, которая перед ответом рассуждает и выдаёт калиброванные вероятности для yes/no, multiple-choice и rating вопросов…
-
4,9
deepfates/imp
Порт DSPy на BEAM: декларативные LM-программы на Elixir с сигнатурами, оптимизаторами и агентами, работающими как OTP-процессы.