SEA-CLIP-Tiny: Efficient Multilingual Text-Vision Embedding for Southeast Asian Languages
cs.CL
Submitted: 2026-09-25
Updated: 2026-09-29
Code: https://github.com/fassabilf/sea-clip-tiny
Terminology
Sources
- Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond
- Contrastive Language-Image Pre-training for the Italian Language
- Anthropogenic Regional Adaptation in Multimodal Vision-Language Model
- Conceptual 12M: Pushing Web-Scale Image-Text Pre-Training To Recognize Long-Tail Visual Concepts
- VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks
- SEA-LION-Embedding: Open and Reproducible Text Embeddings for Southeast Asia
- WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine Learning
- SEA-Guard: Culturally Grounded Multilingual Safeguard for Southeast Asia
- SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features
- NLLB-CLIP -- train performant multilingual image retrieval model on a budget
Related papers
- Exploring Solution Divergence and Its Effect on Large Language Model Problem Solving
- Ishigaki-IDS-Bench: A Benchmark for Generating Information Delivery Specification from BIM Information Requirements
- Subliminal Steering: Stronger Encoding of Hidden Signals
- MedStruct-S: A Benchmark for Key Discovery, Key-Conditioned QA and Semi-Structured Extraction from OCR Clinical Reports
- The End of Transformers? On Challenging Attention and the Rise of Sub-Quadratic Architectures
- Untangling the Mechanisms of Misleading Context in Medical Question Answering