PrismAlign: Prior-Steered Multi-View VLM Alignment for Hallucination-Robust Table OCR
cs.CV
Submitted: 2026-09-18
Updated: 2026-09-18
Code: https://github.com/google/adk-python
Terminology
Sources
- DianJin-OCR-R1: Enhancing OCR Capabilities via a Reasoning-and-Tool Interleaved Vision-Language Model
- PaddleOCR-VL-1.5: Towards a Multi-Task 0.9B VLM for Robust In-the-Wild Document Parsing
- PaddleOCR 3.0 Technical Report
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting
- dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model
- MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns
- How Far Is Document Parsing from Solved? PureDocBench: A Source-Traceable Benchmark across Clean, Degraded, and Real-World Settings
- Focus Anywhere for Fine-grained Multi-page Document Understanding
- MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing
- OmniDocBench: Benchmarking Diverse PDF Document Parsing with Comprehensive Annotations
- olmOCR 2: Unit Test Rewards for Document OCR
- Zep: A Temporal Knowledge Graph Architecture for Agent Memory
- Infinity Parser: Layout Aware Reinforcement Learning for Scanned Document Parsing
- General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model
- DeepSeek-OCR: Contexts Optical Compression
- DeepSeek-OCR 2: Visual Causal Flow
- Qwen3 Technical Report
- CC-OCR: A Comprehensive and Challenging OCR Benchmark for Evaluating Large Multimodal Models in Literacy
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models