Simreal-AI/MathmoBench
[Public preview] An advanced AI Benchmark for math, produced by mathmo at St John's College, Cambridge.
О проекте
MathmoBench — открытый бенчмарк для оценки комбинаторного мышления ИИ: модели нужно вернуть машинно-проверяемое доказательство (свидетеля или сертификат невозможности), а оценка идёт детерминированным верификатором без LLM-судьи.
Чем пригодится
- Прогнать verify.py --run-tests, чтобы проверить целостность репозитория и работу верификаторов.
- Сгенерировать dev-семейство задач matching и оценить на нём формат submission.jsonl.
- Собрать пайплайн: экспорт agent-view, ответ модели, детерминированное скоринг-решение с хеш-квитанцией.
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 0 звёзд, к концу дня ожидается около 16.
- Всплеск держится 3 дня подряд — это не случайный выброс.
- Репозиторию 4 дня, а у него уже 79 звёзд. Истории меньше двух недель, так что обычного темпа, с которым можно сравнить всплеск, у него ещё нет.
- Топ новых репозиториев за неделю: #169.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 79
- Сегодня
- 0 · к вечеру ≈ 16
- Форков
- 5
- Issues и pull requests
- 0
- Наблюдателей
- 6
- Язык
- Python
- Лицензия
- Apache-2.0
- Создан
- 23 сентября 2026
- Последний коммит
- 24 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 27 сентября 2026Топ новых репозиториев за неделю: #169
Ещё в этой категории
-
7,0
ollaya-dev/ollaya
Локальный рантайм для decision-моделей: скачивает и обслуживает модели классификации и маршрутизации через API, совместимый с TypeSafe. Аналог Ollama, но для моделей, возвращающих вероятности, а не текст.
-
5,9
NVIDIA/Model-Optimizer
Библиотека NVIDIA для сжатия и ускорения моделей: квантизация, прунинг, дистилляция, NAS и speculative decoding с экспортом в TensorRT-LLM, vLLM, SGLang. Для ML-инженеров, готовящих модели к деплою.
-
5,6
Niko1221/Strata
Локальный движок инференса на C++, запускающий 125B MoE-модель Qwen3.8-Flash-Next на обычном ПК с одной NVIDIA GPU (12–24 ГБ) и 64 ГБ RAM, с OpenAI/Anthropic-совместимым API на localhost.
-
4,6
Rizzo-AI-Academy/rizzo-flow
Локальная реализация идеи Jev: LLM возвращает типизированные решения (boolean, choice, score, numeric) с вероятностями за один forward pass, без генерации токенов. Совместим с HTTP-интерфейсом TypeSafe API.
-
4,3
Liuziyu77/Valen
Мультимодальная модель принятия решений на базе Qwen3.5-0.8B/2B: принимает текст, изображения и видео с инструкцией и возвращает вероятности по заданным вариантам без генерации токенов ответа. Включает код модели,…
-
4,3
tensorflow/tensorflow
Открытая платформа машинного обучения от Google Brain с API на Python и C++ для обучения и развёртывания нейросетей. Используется исследователями и разработчиками ML-приложений.