SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Information Retrieval
cs.IR, cs.AI
Submitted: 2026-06-17
Updated: 2026-08-27
Code: https://github.com/huggingface/sentence-transformers
Terminology
Sources
- Llama-Embed-Nemotron-8B: A Universal Text Embedding Model for Multilingual and Cross-Lingual Tasks
- mMARCO: A Multilingual Version of the MS MARCO Passage Ranking Dataset
- M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation
- MMTEB: Massive Multilingual Text Embedding Benchmark
- NeuCLIRBench: A Modern Evaluation Collection for Monolingual, Cross-Language, and Multilingual Information Retrieval
- Gemini Embedding: Generalizable Embeddings from Gemini
- MLQA: Evaluating Cross-lingual Extractive Question Answering
- Towards General Text Embeddings with Multi-stage Contrastive Learning
- Overview of the TREC 2024 NeuCLIR Track
- Investigating Language Preference of Multilingual RAG Systems
- EmbeddingGemma: Powerful and Lightweight Text Representations
- Multilingual E5 Text Embeddings: A Technical Report
- HLTCOE at TREC 2024 NeuCLIR Track
- Arctic-Embed 2.0: Multilingual Retrieval Without Compromise
- No Language Left Behind: Scaling Human-Centered Machine Translation
- Qwen3 Embedding: Advancing Text Embedding and Reranking Through Foundation Models
Related papers
- The Price of Isolation: Estimating the Ecosystem Cost of Symmetric Two-Sided A/B Testing
- SCAR: Semantic Continuity-Aware Retrieval for Efficient Context Expansion in RAG
- MixLoRA-DSI: Dynamically Expandable Mixture-of-LoRA Experts for Rehearsal-Free Generative Retrieval over Dynamic Corpora
- RRCM: Ranking-Driven Retrieval over Collaborative and Meta Memories for LLM Recommendation
- Right Family, Wrong Skill: Evaluating Risk Exposure in Agent Skill Retrieval
- UltRAG: a Universal Simple Scalable Recipe for Knowledge Graph RAG