# huggingface/tokenizers > Библиотека токенизации от Hugging Face на Rust с биндингами для Python и Node.js: быстрая реализация BPE, Unigram, WordPiece и WordLevel для обучения и инференса моделей NLP. - Магнитуда: 2,5 из 10 — Ровно - Звёзды: 11 071 всего · +4 звезды сегодня, к вечеру ≈ 10 - Доверие к звёздам: рост звёзд выглядит естественно - Категория: Языковые модели · Язык: Rust · Лицензия: Apache-2.0 · Создан: 2019-11-01 · Последний коммит: 2026-09-21 - GitHub: https://github.com/huggingface/tokenizers · Сайт: https://huggingface.co/docs/tokenizers · Страница: https://gitnova.dev/r/huggingface/tokenizers ## Чем пригодится - Загрузить токенизатор Llama-3.1-8B через from_pretrained и кодировать текст в id - Обучить собственный BPE-токенизатор на корпусе текстов для доменной модели - Встроить быстрый инференс токенизации в сервис на Rust без зависимостей от Python ## Почему он здесь - Сегодня уже 4 звезды, к концу дня ожидается около 10. - До этого репозиторий почти не получал звёзд — около 3 в день. - Всплеск держится 2 дня подряд — это не случайный выброс. - GitHub Trending Rust за день: #13, +18 звёзд. - Среди свежих форков — заметные разработчики: @albertvillanova (631 подп.), @johnmai-dev (209 подп.). ## Доверие к звёздам Рост звёзд выглядит естественно. Метки доверия к звёздам — эвристики по поведению репозитория, а не проверка каждого, кто поставил звезду. ## Цифры - Форков: 1 206 - Issues и pull requests: 2 412 - Наблюдателей: 122 - В среднем за неделю: 6 в день - Обычный темп: 3 в день - Звёзд за последний час (по замерам): 3 - Последний релиз: v1.0.0-rc.2 (2026-09-21) ## Звёзды по дням за 30 дней (от старых к новым, сегодня — неполный день) 2026-08-24 … 2026-09-22: 3, 1, 2, 3, 0, 3, 3, 1, 3, 2, 7, 1, 1, 4, 5, 1, 1, 2, 4, 4, 2, 4, 1, 3, 7, 0, 3, 1, 17, 4 ## Где замечен сейчас - GitHub Trending Rust за день: #13, +18 звёзд ## Похожие по описанию 1. **deepseek-ai/deepseek-recipe** — 1,2 · Остывает · Языковые модели · Rust · +0 звёзд сегодня, к вечеру ≈ 1 Набор Rust-библиотек и Python-биндингов для преобразования API-запросов разных форматов (Messages, Chat Completions, Responses) в формат Conversation, кодирования их в промпты для моделей DeepSeek V4/V4.1 и обратного преобразования вывода… Полная карточка: https://gitnova.dev/r/deepseek-ai/deepseek-recipe.md 2. **marin-community/marin** — 1,2 · Остывает · Языковые модели · Python · +4 звезды сегодня, к вечеру ≈ 8 Открытая платформа и сообщество для исследований и разработки foundation-моделей: подготовка данных, токенизация, pretraining, posttraining и оценка LLM. Подходит исследователям и инженерам, обучающим языковые и мультимодальные модели. Полная карточка: https://gitnova.dev/r/marin-community/marin.md 3. **huggingface/transformers** — 2,6 · Остывает · Языковые модели · Python · +20 звёзд сегодня, к вечеру ≈ 44 Фреймворк для определения и запуска предобученных ML-моделей (текст, зрение, аудио, мультимодальные) для инференса и обучения, совместимый с большинством тренировочных и инференс-движков. Полная карточка: https://gitnova.dev/r/huggingface/transformers.md 4. **ggml-org/llama.cpp** — 3,3 · Ровно · Языковые модели · C++ · +38 звёзд сегодня, к вечеру ≈ 89 Реализация инференса LLM и VLM на C/C++ без зависимостей, работающая на CPU и GPU разного железа. Позволяет запускать модели локально с минимальной настройкой и квантованием. Полная карточка: https://gitnova.dev/r/ggml-org/llama.cpp.md --- Магнитуда (0–10) — насколько быстро и необычно сейчас растёт интерес к репозиторию. Это не оценка качества. Дни — по UTC. «Уже сегодня» — факт, «к вечеру ≈» — прогноз. Описания и сценарии пишет модель (DeepSeek V4.1 Flash) по README, в деталях возможны ошибки: конкретные утверждения (замеры, скорость, железо) проверяйте в самом репозитории. Данные на 2026-09-22 12:33 UTC, обновление каждые 30 минут.