run-llama/liteparse
A fast, helpful, and open-source document parser
О проекте
Локальный парсер документов на Rust: извлекает текст с координатами (bounding boxes) из PDF, DOCX, XLSX, PPTX и изображений, поддерживает OCR через Tesseract или HTTP-серверы. Работает без облака и LLM, есть биндинги для Python, Node.js, WASM и CLI.
Чем пригодится
- Извлечь текст и координаты из PDF для последующей обработки в Python или Node.js
- Прогнать сканы через Tesseract OCR и получить структурированный Markdown для RAG
- Оценить сложность документа перед полным парсингом, чтобы решить, нужен ли OCR
Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.
Почему он в тренде
- Сегодня уже 10 звёзд, к концу дня ожидается около 23. Обычный темп — 7 в день, сейчас в 3,2 раза больше.
- За последние двое суток темп в 3,6 раза выше, чем в предыдущие полторы недели.
- Всплеск держится 3 дня подряд — это не случайный выброс.
- GitHub Trending Rust за день: #5, +44 звезды.
Звёзды по дням
Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.
Цифры
- Всего звёзд
- 12 625
- Сегодня
- 10 · к вечеру ≈ 23
- Форков
- 863
- Issues и pull requests
- 466
- Наблюдателей
- 40
- Язык
- Rust
- Лицензия
- Apache-2.0
- Последний релиз
- node-v2.14.7 · 22 сентября 2026
- Создан
- 9 февраля 2026
- Последний коммит
- 22 сентября 2026
Доверие к звёздам
Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.
Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.
Где замечен
- 25 сентября 2026GitHub Trending Rust за день: #5, +44 звезды
Похожие по описанию
-
1,3
Tencent/WeVisDoc
WeVisDoc — end-to-end парсер документов на базе Qwen3-VL, превращающий изображения страниц в структурированный Markdown с формулами LaTeX и HTML-таблицами. Доступны версии 2B и 4B, запускаемые через vLLM.
-
3,4
docling-project/docling
Docling — библиотека для парсинга документов разных форматов (PDF, DOCX, PPTX, XLSX, HTML, EPUB, аудио и видео) с расширенным пониманием PDF: разметка страниц, таблицы, формулы, OCR. Готовит структурированные данные…
-
2,5
firecrawl/anydoc
Rust-библиотека для конвертации офисных документов (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, PDF) в чистый Markdown с привязками для Node.js, Python и браузера. Нужна для подготовки документов к подаче в…
-
2,5
opendatalab/MinerU
MinerU — инструмент на Python для разбора PDF, изображений и офисных документов в Markdown/JSON, пригодный для LLM-агентов. Поддерживает OCR, анализ вёрстки, таблицы и формулы, а также локальную библиотеку документов с…
-
2,5
PaddlePaddle/PaddleOCR
OCR-тулкит и движок разбора документов: превращает PDF и изображения в структурированные данные (JSON/Markdown) для LLM, поддерживает 100+ языков и распознавание таблиц, формул и печатей.
-
1,4
tesseract-ocr/tesseract
Открытый OCR-движок libtesseract и CLI-утилита tesseract для распознавания текста на изображениях. Поддерживает более 100 языков, форматы PNG/JPEG/TIFF и вывод в text, hOCR, PDF, TSV, ALTO.