MEVL-STP: Multi-Encoder and Vision Language Model for Arbitrarily Shaped Scene Text Spotting

arXiv:2609.28857 · cs.CV · Submitted 2026-09-23 · Read on arXiv

cs.CV

Submitted: 2026-09-23

Updated: 2026-09-23

Terminology

Sources

Related papers