MemeTAG: Keyword-Driven Meme Classification through Tag Embedding Reconstruction
cs.CV, cs.MM
Submitted: 2026-09-17
Updated: 2026-09-17
Terminology
Sources
- Gemini: A Family of Highly Capable Multimodal Models
- GPT-4 Technical Report
- LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL
- LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs
- MEMEX: Detecting Explanatory Evidence for Memes via Knowledge-Enriched Contextualization
- Characterizing the Entities in Harmful Memes: Who is the Hero, the Villain, the Victim?
- Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution
- MM-RLHF: The Next Step Forward in Multimodal LLM Alignment
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models