MUDIDI: A Two-Stage Framework for Multilingual Dictionary Digitization with Language Models
cs.CL
Submitted: 2026-06-08
Updated: 2026-09-02
Code: https://github.com/DavidSamuell/MUDIDI
Terminology
Sources
- Qwen2.5-VL Technical Report
- PaddleOCR-VL: Boosting Multilingual Document Parsing via a 0.9B Ultra-Compact Vision-Language Model
- GLM-OCR Technical Report
- Multimodal LLMs for OCR, OCR Post-Correction, and Named Entity Recognition in Historical Documents
- Vision-Enabled LLMs in Historical Lexicography: Digitising and Enriching Estonian-German Dictionaries from the 17th and 18th Centuries
- Real5-OmniDocBench: A Full-Scale Physical Reconstruction Benchmark for Robust Document Parsing in the Wild
- dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering