NVIDIA/cutlass
CUDA Templates and Python DSLs for High-Performance Linear Algebra
О проекте
CUTLASS — набор CUDA C++ шаблонов и Python DSL (CuTe DSL) для реализации высокопроизводительных операций линейной алгебры, в первую очередь GEMM, на GPU NVIDIA. Проект нужен исследователям и инженерам по производительности, пишущим оптимизированные ядра для Tensor Cores.
Чем пригодится
- Написать кастомное GEMM-ядро на CUDA C++ с нужными тайлами и типами данных
- Собрать прототип ядра на CuTe DSL на Python без глубокого знания C++
- Запустить смешанную точность FP8/FP4 на Tensor Cores архитектур Hopper или Blackwell
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 6 звёзд, к концу дня ожидается около 9.
- GitHub Trending C++ за день: #15, +6 звёзд.
- Среди свежих форков — заметные разработчики: @FindHao (325 подп.).
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 10 474
- Сегодня
- 6 · к вечеру ≈ 9
- Форков
- 2 098
- Issues и pull requests
- 3 314
- Наблюдателей
- 121
- Язык
- C++
- Последний релиз
- v4.8.0 · 22 сентября 2026
- Создан
- 30 ноября 2017
- Последний коммит
- 23 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 23 сентября 2026GitHub Trending C++ за день: #15, +6 звёзд
Ещё в этой категории
-
9,0
jaredpalmer/kev
kev — LoRA-адаптер с небольшим readout-хедом на базе Qwen2.5-0.5B, который за один forward pass отвечает на множество типизированных вопросов по документу, выдавая калиброванные вероятности вместо текста.
-
7,1
mizorewww/laya-mlx
Нативный MLX-рантайм для типизированных решающих моделей Laya: возвращает вероятности выбора, оценки или истинности без генерации текста, работает локально на Apple Silicon.
-
6,8
volotat/mini-AGI
Байтовая языковая модель непрерывного обучения, которая сама собирает архитектуру, тренируется с нуля на одной GPU с 8 ГБ VRAM и продолжает учиться на всём, что читает. Эксперимент, показывающий, что continual learning…
-
6,4
TheoLeeCJ/SemIf
Открытая реализация интерфейса семантических решений в стиле Jev: читает вероятности типизированных опций напрямую из логитов 4B-модели без генерации текста. Работает на одной RTX 3090.
-
6,2
nokia-applied-research/AnyJev
Превращает любую LLM в модель принятия решений с типизированными вопросами (выбор, да/нет, оценка), возвращающую реальные вероятности из распределения следующего токена, без обучения. L0 убирает позиционное и априорное…
-
5,6
taeold/djev-run
Развёртывание модели DiffusionGemma-Jev (djev) на Google Cloud Run с GPU NVIDIA RTX PRO 6000 и API, совместимым с TypeSafe AI. Включает демо Snake, Dino и Tetris, работающие прямо в браузере.