huggingface/tokenizers
💥 Fast State-of-the-Art Tokenizers optimized for Research and Production
О проекте
Библиотека токенизации от Hugging Face на Rust с биндингами для Python и Node.js: быстрая реализация BPE, Unigram, WordPiece и WordLevel для обучения и инференса моделей NLP.
Чем пригодится
- Загрузить токенизатор Llama-3.1-8B через from_pretrained и кодировать текст в id
- Обучить собственный BPE-токенизатор на корпусе текстов для доменной модели
- Встроить быстрый инференс токенизации в сервис на Rust без зависимостей от Python
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 4 звезды, к концу дня ожидается около 10.
- До этого репозиторий почти не получал звёзд — около 3 в день.
- Всплеск держится 2 дня подряд — это не случайный выброс.
- GitHub Trending Rust за день: #13, +18 звёзд.
- Среди свежих форков — заметные разработчики: @albertvillanova (631 подп.), @johnmai-dev (209 подп.).
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 11 071
- Сегодня
- 4 · к вечеру ≈ 10
- Форков
- 1 206
- Issues и pull requests
- 2 412
- Наблюдателей
- 122
- Язык
- Rust
- Лицензия
- Apache-2.0
- Последний релиз
- v1.0.0-rc.2 · 21 сентября 2026
- Создан
- 1 ноября 2019
- Последний коммит
- 21 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 22 сентября 2026GitHub Trending Rust за день: #13, +18 звёзд
Похожие по описанию
-
1,2
deepseek-ai/deepseek-recipe
Набор Rust-библиотек и Python-биндингов для преобразования API-запросов разных форматов (Messages, Chat Completions, Responses) в формат Conversation, кодирования их в промпты для моделей DeepSeek V4/V4.1 и обратного…
-
1,2
marin-community/marin
Открытая платформа и сообщество для исследований и разработки foundation-моделей: подготовка данных, токенизация, pretraining, posttraining и оценка LLM. Подходит исследователям и инженерам, обучающим языковые и…
-
2,6
huggingface/transformers
Фреймворк для определения и запуска предобученных ML-моделей (текст, зрение, аудио, мультимодальные) для инференса и обучения, совместимый с большинством тренировочных и инференс-движков.
-
3,3
ggml-org/llama.cpp
Реализация инференса LLM и VLM на C/C++ без зависимостей, работающая на CPU и GPU разного железа. Позволяет запускать модели локально с минимальной настройкой и квантованием.