Simreal-AI/Simreal-MLBench
[Public preview] Externally scored agentic ML research benchmark: 60 tasks, real competition ground truth. Open protocol, operated evaluation.
О проекте
Открытый бенчмарк для оценки ML-агентов на 60 задачах с внешним скорингом на реальных соревновательных данных. Публикует каталог задач, протокол оценки и код скоринга, а сам рантайм работает как сервис Simreal.
Чем пригодится
- Проверить опубликованный скор задачи, пересчитав его из сохранённых reference counts
- Валидировать каталог задач и конфигурацию протокола командой mleb validate
- Сверить submission id, хеш артефакта и снапшот для каждого числа в отчёте
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 0 звёзд, к концу дня ожидается около 17.
- Всплеск держится 3 дня подряд — это не случайный выброс.
- Репозиторию 5 дней, а у него уже 81 звезда. Истории меньше двух недель, так что обычного темпа, с которым можно сравнить всплеск, у него ещё нет.
- Топ новых репозиториев за неделю: #163.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 81
- Сегодня
- 0 · к вечеру ≈ 17
- Форков
- 12
- Issues и pull requests
- 0
- Наблюдателей
- 9
- Язык
- Python
- Лицензия
- Apache-2.0
- Создан
- 21 сентября 2026
- Последний коммит
- 24 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 26 сентября 2026Топ новых репозиториев за неделю: #163
Ещё в этой категории
-
6,9
ollaya-dev/ollaya
Локальный рантайм для decision-моделей: скачивает и обслуживает модели классификации и маршрутизации через API, совместимый с TypeSafe. Аналог Ollama, но для моделей, возвращающих вероятности, а не текст.
-
6,4
NVIDIA/Model-Optimizer
Библиотека NVIDIA для сжатия и ускорения моделей: квантизация, прунинг, дистилляция, NAS и speculative decoding с экспортом в TensorRT-LLM, vLLM, SGLang. Для ML-инженеров, готовящих модели к деплою.
-
5,4
nokia-applied-research/AnyJev
Превращает любую LLM в модель принятия решений с типизированными вопросами (выбор, да/нет, оценка), возвращающую реальные вероятности из распределения следующего токена, без обучения. L0 убирает позиционное и априорное…
-
4,7
Badtheorylabs/interference-search
Метод поиска решения, который вместо последовательного рассуждения языковой модели ведёт много ветвей по явным состояниям: дубликаты сливаются, тупики отсекаются обученным судьёй, выжившие продвигаются вместе.…
-
4,4
Liuziyu77/Valen
Мультимодальная модель принятия решений на базе Qwen3.5-0.8B/2B: принимает текст, изображения и видео с инструкцией и возвращает вероятности по заданным вариантам без генерации токенов ответа. Включает код модели,…
-
4,3
mizorewww/laya-mlx
Нативный MLX-рантайм для типизированных решающих моделей Laya: возвращает вероятности выбора, оценки или истинности без генерации текста, работает локально на Apple Silicon.