When Cultures Move: Measuring and Improving Multicultural Text-to-Video Generation
cs.CV, cs.AI
Submitted: 2026-05-16
Updated: 2026-09-07
Comments: [14] pages, [6] figures, [11] tables, appendix included. Preprint
Code: https://github.com/AIM-SCU/MAVEN
License: http://creativecommons.org/licenses/by/4.0/
The gist: Text-to-video (T2V) generation has rapidly progressed in visual fidelity, yet its ability to faithfully represent multiple cultures within a single prompt remains underexplored.
Terminology
Abstract
Text-to-video (T2V) generation has rapidly progressed in visual fidelity, yet its ability to faithfully represent multiple cultures within a single prompt remains underexplored. We introduce MAVEN, a multi-agent prompt refinement framework designed to improve cultural fidelity in both mono-cultural and cross-cultural T2V generation. MAVEN decomposes prompts into person, action, and location dimensions, handled by specialized agents operating in parallel or sequentially. To support systematic evaluation, we contribute a new benchmark of 243 culturally grounded prompts and 972 corresponding videos, spanning three cultures (Chinese, American, Romanian), three action categories, and both mono-cultural and cross-cultural scenarios. Evaluations combining CLIP-based metrics, VLM-as-judge assessments, and videoquality measures show that multi-agent refinement, particularly parallel specialization, significantly improves cultural relevance while preserving visual quality and temporal consistency. The dataset and code are available at https://github.com/AIM-SCU/MAVEN
Sources
- T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation
- RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling
- The Llama 3 Herd of Models
- StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration
- VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models
- CULTURE-GEN: Revealing Global Cultural Perception in Language Models through Natural Language Prompting
- CultureVLM: Characterizing and Improving Cultural Understanding of Vision-Language Models for over 100 Countries
- From Sora What We Can See: A Survey of Text-to-Video Generation
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling
- AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
- Automated Movie Generation via Multi-Agent CoT Planning
- DreamFactory: Pioneering Multi-Scene Long Video Generation with a Multi-Agent Framework
- SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation
- Mora: Enabling Generalist Video Generation via A Multi-Agent Framework
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models