Pixels to Prose: Understanding the art of Image Captioning
arXiv:2408.15714 · cs.CV, cs.LG · Submitted 2024-08-28 · Read on arXiv
cs.CV, cs.LG
Submitted: 2024-08-28
Updated: 2024-08-28
Terminology
- Transformer — 85× in this paper · explained in 2 episodes
- Attention Mechanism — 42× in this paper · explained in 2 episodes
- Alignment — 19× in this paper · explained in 1 episode
- Embeddings — 18× in this paper · explained in 2 episodes
- Accuracy — 13× in this paper · explained in 1 episode
- Reinforcement Learning — 10× in this paper · explained in 4 episodes
- Activation Function — 7× in this paper · explained in 1 episode
- Conference on Computer Vision and Pattern Recognition — 7× in this paper
- Contrastive Learning — 7× in this paper · explained in 5 episodes
- Feature Extraction — 7× in this paper · explained in 2 episodes
- Knowledge Graph — 7× in this paper · explained in 7 episodes
- Convolutional Neural Network — 6× in this paper
- Perplexity — 6× in this paper · explained in 3 episodes
- Self-Supervised Learning — 6× in this paper · explained in 7 episodes
- Abstraction — 5× in this paper · explained in 1 episode
- Consistency — 5× in this paper · explained in 3 episodes
- Latent Space — 5× in this paper · explained in 7 episodes
- Benchmark — 4× in this paper · explained in 2 episodes
- Brevity Penalty — 4× in this paper
- Cosine Similarity — 4× in this paper · explained in 3 episodes
- Covariate Shift — 4× in this paper · explained in 2 episodes
- Recurrent Neural Network — 4× in this paper
- Region Proposal Network — 4× in this paper
- Transformer Architecture — 4× in this paper · explained in 2 episodes
- Visual Question Answering — 4× in this paper
- CVF International Conference on Computer Vision — 3× in this paper
- Downstream Tasks — 3× in this paper · explained in 2 episodes
- Dual-Level Collaborative Transformer — 3× in this paper
- Fine-Tuning — 3× in this paper · explained in 5 episodes
- Foundation Model — 3× in this paper · explained in 3 episodes
- Latent Representation — 3× in this paper · explained in 2 episodes
- Masked Language Modeling — 3× in this paper
- Representation Learning — 3× in this paper · explained in 2 episodes
- Abstract Scene Graph — 2× in this paper
- Adaptability — 2× in this paper · explained in 1 episode
- Adaptation — 2× in this paper · explained in 1 episode
- Adversarial Training — 2× in this paper · explained in 1 episode
- Computational overhead — 2× in this paper · explained in 2 episodes
- Contextual Understanding — 2× in this paper · explained in 2 episodes
- Contrastive Language-Image Pre-Training — 2× in this paper
- Federated Learning — 2× in this paper · explained in 14 episodes
- Feed-Forward Network — 2× in this paper
- Foundation Models — 2× in this paper · explained in 7 episodes
- Grounding — 2× in this paper · explained in 3 episodes
- Knowledge graphs — 2× in this paper · explained in 2 episodes
- Latent Representations — 2× in this paper · explained in 3 episodes
- Loss Function — 2× in this paper · explained in 2 episodes
- Regularization — 2× in this paper · explained in 3 episodes
- Semantic Alignment — 2× in this paper · explained in 3 episodes
- Tensor Product Scene-Graph-Triplet Representation — 2× in this paper
- Trace — 2× in this paper · explained in 2 episodes
- Variational Bayes — 2× in this paper · explained in 2 episodes
- Vector Representations — 2× in this paper · explained in 2 episodes
- Video-Language Model — 2× in this paper
- Visual Geometry Group — 2× in this paper
- Adam — 1× in this paper · explained in 2 episodes
- Clustering — 1× in this paper · explained in 2 episodes
- Core — 1× in this paper · explained in 2 episodes
- Domain Shift — 1× in this paper · explained in 4 episodes
- Few-Shot Learning — 1× in this paper · explained in 4 episodes
- Generalization — 1× in this paper · explained in 13 episodes
- Generative Model — 1× in this paper · explained in 2 episodes
- Generative Models — 1× in this paper · explained in 2 episodes
- Gradient Flow — 1× in this paper · explained in 2 episodes
- Image-Text Matching — 1× in this paper
- Interpretability — 1× in this paper · explained in 15 episodes
- Late Fusion — 1× in this paper · explained in 2 episodes
- Masked Image Modeling — 1× in this paper
- Multimodal Fusion — 1× in this paper · explained in 3 episodes
- Objective Function — 1× in this paper · explained in 2 episodes
- Robustness — 1× in this paper · explained in 5 episodes
- Segmentation Masks — 1× in this paper · explained in 2 episodes
- Semantic Gap — 1× in this paper · explained in 2 episodes
- Semantic Propositional Image Caption Evaluation — 1× in this paper
- Semi-supervised Learning — 1× in this paper · explained in 4 episodes
- Transfer Learning — 1× in this paper · explained in 10 episodes
- Transformer Models — 1× in this paper · explained in 2 episodes
- Unified Framework — 1× in this paper · explained in 5 episodes
- Variational Autoencoder (VAE) — 1× in this paper · explained in 3 episodes
- Zero-Shot Generalization — 1× in this paper · explained in 5 episodes
Sources
- Deep Captioning with Multimodal Recurrent Neural Networks (m-RNN)
- TPsgtR: Neural-Symbolic Tensor Product Scene-Graph-Triplet Representation for Image Captioning
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models