Сейсмограф

Что набирает звёзды на GitHub прямо сейчас

yifanzhang-pro/KLPO

Official Project Page for KL-Regularized Policy Optimization for Agentic Reinforcement Learning (KLPO)

Языковые моделиPython
5,5 Ранний сигнал Магнитуда из 10. Рост звёзд выглядит естественно. Данные на 21 сентября 2026.
Открыть на Сейсмографе Открыть на GitHub

О проекте

KLPO — метод обучения с подкреплением без критика и с одним роллаутом на промпт для агентных языковых моделей: вместо value-модели и групп ответов используются token regression и оценка KL по Монте-Карло. Репозиторий содержит реализацию лосса, CPU-тесты и интеграцию с тренером Molt.

Чем пригодится

Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.

Почему он в тренде

Звёзды по дням

05010013 сентября 202621 сентября 2026

Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.

Цифры

Всего звёзд
97
Звёзд за сутки
58
Форков
14
Issues и pull requests
0
Наблюдателей
0
Язык
Python
Лицензия
Apache-2.0
Создан
19 сентября 2026
Последний коммит
21 сентября 2026

Доверие к звёздам

Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.

Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.

Где замечен

Поделиться

Бейдж для README

Вставьте в README — бейдж сам показывает свежую магнитуду и ведёт на эту страницу.

Сейсмограф: 5,5
[![Сейсмограф](https://gitnova.dev/badge/yifanzhang-pro/KLPO.svg)](https://gitnova.dev/r/yifanzhang-pro/KLPO)

Похожие проекты

  1. 8,3
    mizorewww/laya-mlx

    Нативный MLX-рантайм для типизированных решающих моделей Laya: возвращает вероятности выбора, оценки или истинности без генерации текста, работает локально на Apple Silicon.

    ВзлётЯзыковые моделиPython+919 звёзд за сутки

  2. 7,2
    jaredpalmer/kev

    kev — LoRA-адаптер с небольшим readout-хедом на базе Qwen2.5-0.5B, который за один forward pass отвечает на множество типизированных вопросов по документу, выдавая калиброванные вероятности вместо текста.

    Ранний сигналЯзыковые моделиPython+366 звёзд за сутки

  3. 7,2
    bespokelabsai/nimble

    Nimble — модель и рецепт обучения для быстрых типизированных решений по тексту: по схеме из enum- и boolean-полей она выбирает ответ и возвращает вероятности каждого варианта. Нужна для маршрутизации, проверки условий…

    Ранний сигналЯзыковые моделиPython+330 звёзд за сутки

  4. 7,0
    FareedKhan-dev/train-llm-from-scratch

    Учебный проект: реализация Transformer с нуля на PyTorch и полный пайплайн обучения LLM — от сырого текста до SFT, reward model, PPO/DPO/GRPO и чата, без transformers, trl и peft.

    ВзлётЯзыковые моделиPython+281 звезда за сутки

  5. 6,9
    mizorewww/laya-coreml

    Локальный порт модели Laya на Apple Core ML и Neural Engine: возвращает типизированные решения (выбор, оценка, да/нет) без генерации токенов, с бенчмарками скорости и энергопотребления.

    Ранний сигналЯзыковые моделиPython+240 звёзд за сутки

  6. 6,8
    TheoLeeCJ/SemIf

    Открытая реализация интерфейса семантических решений в стиле Jev: читает вероятности типизированных опций напрямую из логитов 4B-модели без генерации текста. Работает на одной RTX 3090.

    На пикеЯзыковые моделиPython+322 звезды за сутки