# run-llama/liteparse > Локальный парсер документов на Rust: извлекает текст с координатами (bounding boxes) из PDF, DOCX, XLSX, PPTX и изображений, поддерживает OCR через Tesseract или HTTP-серверы. Работает без облака и LLM, есть биндинги для Python, Node.js, WASM и CLI. - Магнитуда: 3,7 из 10 — Взлёт - Звёзды: 12 627 всего · +10 звёзд сегодня, к вечеру ≈ 21 - Доверие к звёздам: рост звёзд выглядит естественно - Категория: Данные и аналитика · Язык: Rust · Лицензия: Apache-2.0 · Создан: 2026-02-09 · Последний коммит: 2026-09-22 - GitHub: https://github.com/run-llama/liteparse · Сайт: https://developers.llamaindex.ai/liteparse/ · Страница: https://gitnova.dev/r/run-llama/liteparse ## Чем пригодится - Извлечь текст и координаты из PDF для последующей обработки в Python или Node.js - Прогнать сканы через Tesseract OCR и получить структурированный Markdown для RAG - Оценить сложность документа перед полным парсингом, чтобы решить, нужен ли OCR ## Почему он здесь - Сегодня уже 10 звёзд, к концу дня ожидается около 21. Обычный темп — 7 в день, сейчас в 3 раза больше. - За последние двое суток темп в 3,5 раза выше, чем в предыдущие полторы недели. - Всплеск держится 3 дня подряд — это не случайный выброс. - GitHub Trending Rust за день: #5, +44 звезды. ## Доверие к звёздам Рост звёзд выглядит естественно. Метки доверия к звёздам — эвристики по поведению репозитория, а не проверка каждого, кто поставил звезду. ## Цифры - Форков: 863 - Issues и pull requests: 466 - Наблюдателей: 40 - В среднем за неделю: 45 в день - Обычный темп: 7 в день - Звёзд за последний час (по замерам): 3 - Последний релиз: node-v2.14.7 (2026-09-22) ## Звёзды по дням за 30 дней (от старых к новым, сегодня — неполный день) 2026-08-27 … 2026-09-25: 10, 7, 11, 9, 3, 9, 19, 10, 6, 5, 6, 8, 5, 9, 7, 9, 7, 4, 7, 5, 7, 3, 9, 4, 13, 9, 42, 175, 49, 10 ## Где замечен сейчас - GitHub Trending Rust за день: #5, +44 звезды ## Похожие по описанию 1. **Tencent/WeVisDoc** — 1,3 · Остывает · Языковые модели · Python · +1 звезда сегодня, к вечеру ≈ 4 WeVisDoc — end-to-end парсер документов на базе Qwen3-VL, превращающий изображения страниц в структурированный Markdown с формулами LaTeX и HTML-таблицами. Доступны версии 2B и 4B, запускаемые через vLLM. Полная карточка: https://gitnova.dev/r/Tencent/WeVisDoc.md 2. **docling-project/docling** — 3,3 · На пике · Языковые модели · Python · +32 звезды сегодня, к вечеру ≈ 66 Docling — библиотека для парсинга документов разных форматов (PDF, DOCX, PPTX, XLSX, HTML, EPUB, аудио и видео) с расширенным пониманием PDF: разметка страниц, таблицы, формулы, OCR. Готовит структурированные данные для генеративного AI и… Полная карточка: https://gitnova.dev/r/docling-project/docling.md 3. **firecrawl/anydoc** — 2,5 · Ровно · Языковые модели · Rust · +12 звёзд сегодня, к вечеру ≈ 24 Rust-библиотека для конвертации офисных документов (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, PDF) в чистый Markdown с привязками для Node.js, Python и браузера. Нужна для подготовки документов к подаче в LLM. Полная карточка: https://gitnova.dev/r/firecrawl/anydoc.md 4. **opendatalab/MinerU** — 2,5 · Ровно · Языковые модели · Python · +15 звёзд сегодня, к вечеру ≈ 32 MinerU — инструмент на Python для разбора PDF, изображений и офисных документов в Markdown/JSON, пригодный для LLM-агентов. Поддерживает OCR, анализ вёрстки, таблицы и формулы, а также локальную библиотеку документов с поиском и… Полная карточка: https://gitnova.dev/r/opendatalab/MinerU.md 5. **PaddlePaddle/PaddleOCR** — 2,5 · Ровно · Языковые модели · Python · +25 звёзд сегодня, к вечеру ≈ 43 OCR-тулкит и движок разбора документов: превращает PDF и изображения в структурированные данные (JSON/Markdown) для LLM, поддерживает 100+ языков и распознавание таблиц, формул и печатей. Полная карточка: https://gitnova.dev/r/PaddlePaddle/PaddleOCR.md --- Магнитуда (0–10) — насколько быстро и необычно сейчас растёт интерес к репозиторию. Это не оценка качества. Дни — по UTC. «Уже сегодня» — факт, «к вечеру ≈» — прогноз. Описания и сценарии пишет модель (DeepSeek V4.1 Flash) по README, в деталях возможны ошибки: конкретные утверждения (замеры, скорость, железо) проверяйте в самом репозитории. Данные на 2026-09-25 14:45 UTC, обновление каждые 30 минут.