# datalab-to/chandra > Chandra OCR 2 — OCR-модель, которая превращает изображения и PDF в структурированные HTML, Markdown или JSON с сохранением разметки, таблиц, формул и рукописного текста. - Магнитуда: 2,2 из 10 — Ровно - Звёзды: 12 395 всего · +8 звёзд сегодня, к вечеру ≈ 14 - Доверие к звёздам: рост звёзд выглядит естественно - Категория: Языковые модели · Язык: Python · Лицензия: Apache-2.0 · Создан: 2025-10-08 · Последний коммит: 2026-06-26 - GitHub: https://github.com/datalab-to/chandra · Сайт: https://www.datalab.to · Страница: https://gitnova.dev/r/datalab-to/chandra ## Чем пригодится - Распознать сканы PDF в Markdown с сохранением таблиц и разметки - Извлечь данные из форм и рукописных документов в JSON - Запустить локальный OCR через CLI или Streamlit-приложение ## Почему он здесь - Сегодня уже 8 звёзд, к концу дня ожидается около 14. Обычный темп — 6 в день, сейчас в 2,4 раза больше. - За последние двое суток темп в 3,3 раза выше, чем в предыдущие полторы недели. - Всплеск держится 2 дня подряд — это не случайный выброс. - GitHub Trending Python за день: #5, +20 звёзд. ## Доверие к звёздам Рост звёзд выглядит естественно. Метки доверия к звёздам — эвристики по поведению репозитория, а не проверка каждого, кто поставил звезду. ## Цифры - Форков: 1 250 - Issues и pull requests: 117 - Наблюдателей: 89 - В среднем за неделю: 11 в день - Обычный темп: 6 в день - Звёзд за последний час (по замерам): 3 - Последний релиз: v0.2.0 (2026-03-18) ## Звёзды по дням за 30 дней (от старых к новым, сегодня — неполный день) 2026-09-04 … 2026-10-03: 4, 3, 4, 6, 7, 8, 5, 6, 4, 2, 5, 3, 7, 5, 15, 4, 11, 4, 5, 4, 9, 0, 7, 2, 7, 10, 2, 22, 23, 8 ## Где замечен сейчас - GitHub Trending Python за день: #5, +20 звёзд ## Похожие по описанию 1. **PaddlePaddle/PaddleOCR** — 2,1 · Ровно · Языковые модели · Python · +19 звёзд сегодня, к вечеру ≈ 30 OCR-тулкит и движок разбора документов: превращает PDF и изображения в структурированные данные (JSON/Markdown) для LLM, поддерживает 100+ языков и распознавание таблиц, формул и печатей. Полная карточка: https://gitnova.dev/r/PaddlePaddle/PaddleOCR.md 2. **SeerRay-Lab/Xiaomi-OCR-0** — 0,7 · Ровно · Языковые модели · Python · +0 звёзд сегодня, к вечеру ≈ 1 Унифицированная vision-language модель на 0.8B параметров для разбора документов и OCR-задач: выдаёт структурированный Markdown, извлекает поля в JSON и отвечает на вопросы по изображениям. Полная карточка: https://gitnova.dev/r/SeerRay-Lab/Xiaomi-OCR-0.md 3. **run-llama/liteparse** — 1,2 · Остывает · Данные и аналитика · Rust · +6 звёзд сегодня, к вечеру ≈ 10 Локальный парсер документов на Rust: извлекает текст с координатами (bounding boxes) из PDF, DOCX, XLSX, PPTX и изображений, поддерживает OCR через Tesseract или HTTP-серверы. Работает без облака и LLM, есть биндинги для Python, Node.js,… Полная карточка: https://gitnova.dev/r/run-llama/liteparse.md 4. **beatrizalmeidaf/papero-pdf-text-extractor** — 4,4 · Ранний сигнал · Данные и аналитика · Python · +3 звезды сегодня, к вечеру ≈ 9 Открытый API и Python-библиотека для извлечения структуры PDF: порядок чтения, таблицы, формулы, рисунки и координаты блоков. Работает на CPU без ML-моделей, файлы не сохраняются. Полная карточка: https://gitnova.dev/r/beatrizalmeidaf/papero-pdf-text-extractor.md 5. **chrisryugj/kordoc** — 1,2 · Остывает · Инструменты разработчика · TypeScript · +1 звезда сегодня, к вечеру ≈ 3 Конвертирует корейские государственные и офисные документы (HWP, HWPX, HWPML, PDF, XLS/XLSX, DOCX, изображения) в Markdown с сохранением структуры таблиц; есть CLI и MCP-сервер для заполнения форм, сравнения версий и генерации HWPX. Полная карточка: https://gitnova.dev/r/chrisryugj/kordoc.md --- Магнитуда (0–10) — насколько быстро и необычно сейчас растёт интерес к репозиторию. Это не оценка качества. Дни — по UTC. «Уже сегодня» — факт, «к вечеру ≈» — прогноз. Описания и сценарии пишет модель (DeepSeek V4.1 Flash) по README, в деталях возможны ошибки: конкретные утверждения (замеры, скорость, железо) проверяйте в самом репозитории. Данные на 2026-10-03 15:15 UTC, обновление каждые 30 минут.