architectds/collabosm
Run Qwen3.8-Flash-Next (125B-A6B MoE) on ONE Colab A100-80GB High-RAM: pinned runtime, weights from HF, OpenAI-compatible endpoint, measured 2.8k-3.9k t/s prefill / 90-97 t/s decode, plus a verified pinned-RAM KV tier.
О проекте
Набор скриптов для запуска модели Qwen3.8-Flash-Next (125B MoE) на одной Colab A100-80GB High-RAM с OpenAI-совместимым эндпоинтом и измеренной производительностью.
Чем пригодится
- Развернуть OpenAI-совместимый эндпоинт Qwen3.8-Flash-Next на Colab A100 для тестирования клиентов
- Замерить prefill и decode throughput модели при разных GCS и NDT
- Остановить VM через down.sh, чтобы не тратить Colab compute units
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 0 звёзд, к концу дня ожидается около 33.
- Всплеск держится 2 дня подряд — это не случайный выброс.
- Репозиторию 1 день, а у него уже 72 звезды. Истории меньше двух недель, так что обычного темпа, с которым можно сравнить всплеск, у него ещё нет.
- Топ новых репозиториев за неделю: #186.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 72
- Сегодня
- 0 · к вечеру ≈ 32
- Форков
- 2
- Issues и pull requests
- 0
- Наблюдателей
- 0
- Язык
- Python
- Лицензия
- MIT
- Создан
- 25 сентября 2026
- Последний коммит
- 26 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 26 сентября 2026Топ новых репозиториев за неделю: #184
Ещё в этой категории
-
6,9
ollaya-dev/ollaya
Локальный рантайм для decision-моделей: скачивает и обслуживает модели классификации и маршрутизации через API, совместимый с TypeSafe. Аналог Ollama, но для моделей, возвращающих вероятности, а не текст.
-
6,4
NVIDIA/Model-Optimizer
Библиотека NVIDIA для сжатия и ускорения моделей: квантизация, прунинг, дистилляция, NAS и speculative decoding с экспортом в TensorRT-LLM, vLLM, SGLang. Для ML-инженеров, готовящих модели к деплою.
-
5,4
nokia-applied-research/AnyJev
Превращает любую LLM в модель принятия решений с типизированными вопросами (выбор, да/нет, оценка), возвращающую реальные вероятности из распределения следующего токена, без обучения. L0 убирает позиционное и априорное…
-
4,7
Badtheorylabs/interference-search
Метод поиска решения, который вместо последовательного рассуждения языковой модели ведёт много ветвей по явным состояниям: дубликаты сливаются, тупики отсекаются обученным судьёй, выжившие продвигаются вместе.…
-
4,4
Liuziyu77/Valen
Мультимодальная модель принятия решений на базе Qwen3.5-0.8B/2B: принимает текст, изображения и видео с инструкцией и возвращает вероятности по заданным вариантам без генерации токенов ответа. Включает код модели,…
-
4,3
mizorewww/laya-mlx
Нативный MLX-рантайм для типизированных решающих моделей Laya: возвращает вероятности выбора, оценки или истинности без генерации текста, работает локально на Apple Silicon.