VTR-Bench: A Systematic Benchmark for Evaluating Visual Text Rendering in Video Generation
cs.CV
Submitted: 2026-10-01
Updated: 2026-10-01
Code: https://github.com/hardenyu21/VTR-Bench
Terminology
Sources
- TextGuider: Training-Free Guidance for Text Rendering via Attention Alignment
- T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
- TextDiffuser: Diffusion Models as Text Painters
- Do Joint Audio-Video Generation Models Understand Physics?
- PosterMaker: Towards High-Quality Product Poster Generation with Accurate Text Rendering
- T2VTextBench: A Human Evaluation Benchmark for Textual Control in Video Generation Models
- LTX-2: Efficient Joint Audio-Visual Foundation Model
- RULER-Bench: Probing Rule-based Reasoning Abilities of Next-level Video Generation Models for Vision Foundation Intelligence
- BizGenEval: A Systematic Benchmark for Commercial Visual Content Generation
- Text-Animator: Controllable Visual Text Video Generation
- LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV
- Glyph-ByT5: A Customized Text Encoder for Accurate Visual Text Rendering
- Dynamic Typography: Bringing Text to Life via Video Diffusion Prior
- Video Text Preservation with Synthetic Text-Rich Videos
- Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
- Towards World Simulator: Crafting Physical Commonsense-Based Benchmark for Video Generation
- Kinetic Typography Diffusion Model
- BizGen: Advancing Article-level Visual Text Rendering for Infographics Generation
- DCText: Scheduled Attention Masking for Visual Text Generation via Divide-and-Conquer Strategy
- AnyText2: Visual Text Generation and Editing With Customizable Attributes
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models