# SeerRay-Lab/Xiaomi-OCR-0 > Унифицированная vision-language модель на 0.8B параметров для разбора документов и OCR-задач: выдаёт структурированный Markdown, извлекает поля в JSON и отвечает на вопросы по изображениям. - Магнитуда: 0,9 из 10 — Ровно - Звёзды: 56 всего · +0 звёзд сегодня, к вечеру ≈ 4 - Доверие к звёздам: рост звёзд выглядит естественно - Категория: Языковые модели · Язык: Python · Лицензия: Apache-2.0 · Создан: 2026-09-28 · Последний коммит: 2026-09-30 - GitHub: https://github.com/SeerRay-Lab/Xiaomi-OCR-0 · Сайт: https://huggingface.co/spaces/SeerRay-Lab/Xiaomi-OCR-0 · Страница: https://gitnova.dev/r/SeerRay-Lab/Xiaomi-OCR-0 ## Чем пригодится - Разобрать страницы PDF или сканы в структурированный Markdown с таблицами и формулами - Извлечь нужные поля из документов в JSON через KIE - Задать вопросы по содержимому изображения документа через VQA ## Почему он здесь - Сегодня уже 0 звёзд, к концу дня ожидается около 4. - Репозиторию 5 дней, а у него уже 56 звёзд. Истории меньше двух недель, так что обычного темпа, с которым можно сравнить всплеск, у него ещё нет. - Топ новых репозиториев за неделю: #192. ## Доверие к звёздам Рост звёзд выглядит естественно. Метки доверия к звёздам — эвристики по поведению репозитория, а не проверка каждого, кто поставил звезду. ## Цифры - Форков: 0 - Issues и pull requests: 0 - Наблюдателей: 1 - В среднем за неделю: 10 в день - Обычный темп: мало истории (меньше двух недель) - Звёзд за последний час (по замерам): 0 ## Звёзды по дням за 7 дней (от старых к новым, сегодня — неполный день) 2026-09-27 … 2026-10-03: 0, 0, 16, 32, 3, 5, 0 ## Где замечен сейчас - Топ новых репозиториев за неделю: #192 ## Похожие по описанию 1. **PaddlePaddle/PaddleOCR** — 2,0 · Остывает · Языковые модели · Python · +0 звёзд сегодня, к вечеру ≈ 23 OCR-тулкит и движок разбора документов: превращает PDF и изображения в структурированные данные (JSON/Markdown) для LLM, поддерживает 100+ языков и распознавание таблиц, формул и печатей. Полная карточка: https://gitnova.dev/r/PaddlePaddle/PaddleOCR.md 2. **run-llama/liteparse** — 1,1 · Остывает · Данные и аналитика · Rust · +0 звёзд сегодня, к вечеру ≈ 7 Локальный парсер документов на Rust: извлекает текст с координатами (bounding boxes) из PDF, DOCX, XLSX, PPTX и изображений, поддерживает OCR через Tesseract или HTTP-серверы. Работает без облака и LLM, есть биндинги для Python, Node.js,… Полная карточка: https://gitnova.dev/r/run-llama/liteparse.md 3. **beatrizalmeidaf/papero-pdf-text-extractor** — 4,8 · Ранний сигнал · Данные и аналитика · Python · +0 звёзд сегодня, к вечеру ≈ 27 Открытый API и Python-библиотека для извлечения структуры PDF: порядок чтения, таблицы, формулы, рисунки и координаты блоков. Работает на CPU без ML-моделей, файлы не сохраняются. Полная карточка: https://gitnova.dev/r/beatrizalmeidaf/papero-pdf-text-extractor.md 4. **mikefarah/yq** — 2,0 · Тихо · Инструменты разработчика · Go · +0 звёзд сегодня, к вечеру ≈ 2 Портируемый консольный процессор YAML, JSON, XML, CSV, TOML, HCL и properties с синтаксисом в стиле jq. Позволяет читать, фильтровать и изменять структурированные конфиги прямо из командной строки. Полная карточка: https://gitnova.dev/r/mikefarah/yq.md 5. **StarTrail-org/PixelRAG** — 1,1 · Ровно · Языковые модели · Python · +0 звёзд сегодня, к вечеру ≈ 4 PixelRAG — система visual RAG, которая рендерит веб-страницы, PDF и изображения в скриншот-плитки и ищет по ним напрямую, сохраняя таблицы, графики и вёрстку, теряемые при парсинге в текст. Полная карточка: https://gitnova.dev/r/StarTrail-org/PixelRAG.md --- Магнитуда (0–10) — насколько быстро и необычно сейчас растёт интерес к репозиторию. Это не оценка качества. Дни — по UTC. «Уже сегодня» — факт, «к вечеру ≈» — прогноз. Описания и сценарии пишет модель (DeepSeek V4.1 Flash) по README, в деталях возможны ошибки: конкретные утверждения (замеры, скорость, железо) проверяйте в самом репозитории. Данные на 2026-10-03 03:19 UTC, обновление каждые 30 минут.