Xiaomi-OCR-0 Technical Report
cs.CV
Submitted: 2026-09-28
Updated: 2026-09-28
Code: https://github.com/datalab-to/marker
Terminology
Sources
- Qwen3-VL Technical Report
- Qwen2.5-VL Technical Report
- Seed1.8 Model Card: Towards Generalized Real-World Agency
- Seed2.0 Model Card: Towards Intelligence Frontier for Real-World Complexity
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- Youtu-Parsing: Perception, Structuring and Recognition via High-Parallelism Decoding
- Logics-Parsing Technical Report
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
- PaddleOCR 3.0 Technical Report
- RT-DocLayout: Real-Time End-to-End Document Layout Analysis with Reading Order in the Wild
- PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
- Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
- UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters
- GLM-OCR Technical Report
- Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
- Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
- Mini-Monkey: Alleviating the Semantic Sawtooth Effect for Lightweight MLLMs via Complementary Image Pyramid
- HunyuanOCR Technical Report
- ABot-OCR Technical Report
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models