PolyOCR-Venus: Unified OCR Foundation Models for Text-Centric Visual Intelligence
cs.CV, cs.AI
Submitted: 2026-09-29
Updated: 2026-09-29
Code: https://github.com/inclusionAI/PolyOCR-Venus
Terminology
Sources
- GPT-4 Technical Report
- Reward-Gated On-Policy Distillation
- Qwen3-VL Technical Report
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
- PaddleOCR 3.0 Technical Report
- Qianfan-OCR: A Unified End-to-End Model for Document Intelligence
- Dolphin-v2: Universal Document Parsing via Scalable Anchor Prompting
- MathWriting: A Dataset For Handwritten Mathematical Expression Recognition
- Infinity-Parser2 Technical Report
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better
- MonkeyOCR: Document Parsing with a Structure-Recognition-Relation Triplet Paradigm
- Ovis2.5 Technical Report
- OvisOCR2 Technical Report
- olmOCR 2: Unit Test Rewards for Document OCR
- TextSleuth: Towards Explainable Tampered Text Detection
- Webly-Supervised Image Manipulation Localization via Category-Aware Auto-Annotation
- DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models
- Venus-DeFakerOne: Unified Fake Image Detection & Localization
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models