yifanzhang-pro/KLPO
Official Project Page for KL-Regularized Policy Optimization for Agentic Reinforcement Learning (KLPO)
О проекте
KLPO — метод обучения с подкреплением без критика и с одним роллаутом на промпт для агентных языковых моделей: вместо value-модели и групп ответов используются token regression и оценка KL по Монте-Карло. Репозиторий содержит реализацию лосса, CPU-тесты и интеграцию с тренером Molt.
Чем пригодится
- Обучить агентную LLM с лоссом KLPO через готовый лаунчер Molt
- Запустить CPU-пример и проверить все восемь комбинаций route/estimator
- Сравнить оценки MC-KL, TopK-KL, Binary KL и Full KL на небольшой политике
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 11 звёзд, к концу дня ожидается около 58.
- Всплеск держится 2 дня подряд — это не случайный выброс.
- Репозиторию 2 дня, а у него уже 97 звёзд.
- Топ новых репозиториев за неделю: #179.
- Около 51 форков в сутки — код забирают себе.
- Среди свежих форков — заметные разработчики: @OctopusTakopi (215 подп.).
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 97
- Звёзд за сутки
- 58
- Форков
- 14
- Issues и pull requests
- 0
- Наблюдателей
- 0
- Язык
- Python
- Лицензия
- Apache-2.0
- Создан
- 19 сентября 2026
- Последний коммит
- 21 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 21 сентября 2026Топ новых репозиториев за неделю: #179
Похожие проекты
-
8,3
mizorewww/laya-mlx
Нативный MLX-рантайм для типизированных решающих моделей Laya: возвращает вероятности выбора, оценки или истинности без генерации текста, работает локально на Apple Silicon.
-
7,2
jaredpalmer/kev
kev — LoRA-адаптер с небольшим readout-хедом на базе Qwen2.5-0.5B, который за один forward pass отвечает на множество типизированных вопросов по документу, выдавая калиброванные вероятности вместо текста.
-
7,2
bespokelabsai/nimble
Nimble — модель и рецепт обучения для быстрых типизированных решений по тексту: по схеме из enum- и boolean-полей она выбирает ответ и возвращает вероятности каждого варианта. Нужна для маршрутизации, проверки условий…
-
7,0
FareedKhan-dev/train-llm-from-scratch
Учебный проект: реализация Transformer с нуля на PyTorch и полный пайплайн обучения LLM — от сырого текста до SFT, reward model, PPO/DPO/GRPO и чата, без transformers, trl и peft.
-
6,9
mizorewww/laya-coreml
Локальный порт модели Laya на Apple Core ML и Neural Engine: возвращает типизированные решения (выбор, оценка, да/нет) без генерации токенов, с бенчмарками скорости и энергопотребления.
-
6,8
TheoLeeCJ/SemIf
Открытая реализация интерфейса семантических решений в стиле Jev: читает вероятности типизированных опций напрямую из логитов 4B-модели без генерации текста. Работает на одной RTX 3090.