Imitating Radiological Scrolling: A Global-Local Attention Model for 3D Chest CT Volumes Multi-Label Anomaly Classification
cs.CV
Submitted: 2025-03-26
Updated: 2026-09-26
Terminology
Sources
- Layer Normalization
- Longformer: The Long-Document Transformer
- ViT-V-Net: Vision Transformer for Unsupervised Volumetric Medical Image Registration
- Generating Long Sequences with Sparse Transformers
- BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- ConvFormer: Combining CNN and Transformer for Medical Image Segmentation
- Generalist Foundation Models from a Multimodal Dataset for 3D Computed Tomography
- CT2Rep: Automated Radiology Report Generation for 3D Medical Imaging
- Deep Residual Learning for Image Recognition
- Swin Transformer: Hierarchical Vision Transformer using Shifted Windows
- Effective Approaches to Attention-based Neural Machine Translation
- U-Mamba: Enhancing Long-range Dependency for Biomedical Image Segmentation
- ImageNet Large Scale Visual Recognition Challenge
- A comprehensive overview of deep learning techniques for 3D point cloud classification and semantic segmentation
- Grad-CAM: Visual Explanations from Deep Networks via Gradient-based Localization
- GLU Variants Improve Transformer
- 3D Deep Learning on Medical Images: A Review
- Gemma 2: Improving Open Language Models at a Practical Size
- LLaMA: Open and Efficient Foundation Language Models
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models