dchristopoulos/jev-aita
Benchmark of TypeSafe's Jev against Sonnet 5, GPT-5 nano and local LLMs on 770 Reddit AITA verdicts: Brier scores, latency and cost
О проекте
Бенчмарк, сравнивающий модель Jev от TypeSafe с Sonnet 5, GPT-5 nano и локальными LLM на 770 вердиктах Reddit r/AmItheAsshole по Brier score, задержке и стоимости.
Чем пригодится
- Оценить калибровку и стоимость LLM на задаче предсказания вердиктов Reddit
- Сравнить задержку и цену Jev с Sonnet 5 и GPT-5 nano на одном наборе постов
- Воспроизвести методику бенчмарка для собственной модели или датасета
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Репозиторию 2 дня, а у него уже 2 звезды. Истории меньше двух недель, так что обычного темпа, с которым можно сравнить всплеск, у него ещё нет.
- Hacker News: «Jev vs. LLMs on 770 "Am I the Asshole?" posts» — 22 очка, 23 ч назад.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 2
- Сегодня
- 0 · к вечеру ≈ 0
- Форков
- 0
- Issues и pull requests
- 1
- Наблюдателей
- 0
- Язык
- Python
- Создан
- 22 сентября 2026
- Последний коммит
- 23 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Обсуждения на Hacker News
- Jev vs. LLMs on 770 "Am I the Asshole?" posts22 очка, 23 сентября 2026
Где замечен
- 24 сентября 2026Замечен на Hacker News
Похожие по описанию
-
2,4
fstandhartinger/jevbench
Бенчмарк для Jev-подобных моделей принятия решений: модель получает состояние и рубрику, возвращает типизированный ответ с вероятностями. Оценивает точность, калибровку, скорость и стоимость.
-
0,1
vinilana/jev-eval-agent
Исследовательский агент-ассистент на eve (Vercel) со 100 моковыми инструментами через OpenRouter, сравнивающий выбор инструмента самим LLM и классификатором Jev по числу шагов.