Сейсмограф

Что набирает звёзды на GitHub прямо сейчас

run-llama/liteparse

A fast, helpful, and open-source document parser

Данные и аналитикаRust#document-ocr#document-processing#ocr#ocr-recognition#pdf
3,7 Взлёт Магнитуда из 10 — скорость роста интереса, а не оценка качества. Рост звёзд выглядит естественно. Данные на 25 сентября 2026, 13:57 UTC.
Открыть на Сейсмографе Открыть на GitHub

О проекте

Локальный парсер документов на Rust: извлекает текст с координатами (bounding boxes) из PDF, DOCX, XLSX, PPTX и изображений, поддерживает OCR через Tesseract или HTTP-серверы. Работает без облака и LLM, есть биндинги для Python, Node.js, WASM и CLI.

Чем пригодится

Пересказ README моделью DeepSeek V4.1 Flash. Может ошибаться в деталях.

Почему он в тренде

Звёзды по дням

010020028 июня 202625 сентября 2026

Столбики — звёзды за день, линия — обычный темп. Красным — дни всплесков.

Цифры

Всего звёзд
12 625
Сегодня
10 · к вечеру ≈ 23
Форков
863
Issues и pull requests
466
Наблюдателей
40
Язык
Rust
Лицензия
Apache-2.0
Последний релиз
node-v2.14.7 · 22 сентября 2026
Создан
9 февраля 2026
Последний коммит
22 сентября 2026

Доверие к звёздам

Рост выглядит естественно: форков и обсуждений столько, сколько бывает у живых проектов, а звёзды приходят неровно, как от людей.

Это эвристики, а не приговор: судим по поведению репозитория, а не по списку звездивших.

Где замечен

Поделиться

Бейдж для README

Вставьте в README — бейдж сам показывает свежую магнитуду и ведёт на эту страницу.

Сейсмограф: 3,7
[![Сейсмограф](https://gitnova.dev/badge/run-llama/liteparse.svg)](https://gitnova.dev/r/run-llama/liteparse)

Похожие по описанию

  1. 1,3
    Tencent/WeVisDoc

    WeVisDoc — end-to-end парсер документов на базе Qwen3-VL, превращающий изображения страниц в структурированный Markdown с формулами LaTeX и HTML-таблицами. Доступны версии 2B и 4B, запускаемые через vLLM.

    ОстываетЯзыковые моделиPython+1 звезда сегодня, к вечеру ≈ 5

  2. 3,4
    docling-project/docling

    Docling — библиотека для парсинга документов разных форматов (PDF, DOCX, PPTX, XLSX, HTML, EPUB, аудио и видео) с расширенным пониманием PDF: разметка страниц, таблицы, формулы, OCR. Готовит структурированные данные…

    На пикеЯзыковые моделиPython+30 звёзд сегодня, к вечеру ≈ 68

  3. 2,5
    firecrawl/anydoc

    Rust-библиотека для конвертации офисных документов (Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV, PDF) в чистый Markdown с привязками для Node.js, Python и браузера. Нужна для подготовки документов к подаче в…

    РовноЯзыковые моделиRust+10 звёзд сегодня, к вечеру ≈ 23

  4. 2,5
    opendatalab/MinerU

    MinerU — инструмент на Python для разбора PDF, изображений и офисных документов в Markdown/JSON, пригодный для LLM-агентов. Поддерживает OCR, анализ вёрстки, таблицы и формулы, а также локальную библиотеку документов с…

    РовноЯзыковые моделиPython+14 звёзд сегодня, к вечеру ≈ 33

  5. 2,5
    PaddlePaddle/PaddleOCR

    OCR-тулкит и движок разбора документов: превращает PDF и изображения в структурированные данные (JSON/Markdown) для LLM, поддерживает 100+ языков и распознавание таблиц, формул и печатей.

    РовноЯзыковые моделиPython+21 звезда сегодня, к вечеру ≈ 40

  6. 1,4
    tesseract-ocr/tesseract

    Открытый OCR-движок libtesseract и CLI-утилита tesseract для распознавания текста на изображениях. Поддерживает более 100 языков, форматы PNG/JPEG/TIFF и вывод в text, hOCR, PDF, TSV, ALTO.

    РовноЯзыковые моделиC+++3 звезды сегодня, к вечеру ≈ 6