ShellfishNet: A Domain-Specific Benchmark for Visual Recognition of Marine Molluscs
cs.CV
Submitted: 2026-05-08
Updated: 2026-09-27
Code: https://github.com/PaddlePaddle/PaddleClas
Terminology
Sources
- BEiT: BERT Pre-Training of Image Transformers
- LambdaNetworks: Modeling Long-Range Interactions Without Attention
- EfficientViT: Multi-Scale Linear Attention for High-Resolution Dense Prediction
- RepGhost: A Hardware-Efficient Ghost Module via Re-parameterization
- Improved Baselines with Momentum Contrastive Learning
- Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling
- An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
- Rethinking Channel Dimensions for Efficient Model Design
- Fine-R1: Make Multi-modal LLMs Excel in Fine-Grained Visual Recognition by Chain-of-Thought Reasoning
- Benchmarking Neural Network Robustness to Common Corruptions and Perturbations
- FishNet++: Analyzing the capabilities of Multimodal Large Language Models in marine biology
- Next-ViT: Next Generation Vision Transformer for Efficient Deployment in Realistic Industrial Scenarios
- DINOv2: Learning Robust Visual Features without Supervision
- Very Deep Convolutional Networks for Large-Scale Image Recognition
- Demystifying CLIP Data
- Qwen2 Technical Report
- Qwen2.5 Technical Report
- BERTScore: Evaluating Text Generation with BERT
- Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model
Related papers
- Loss Knows Best: Detecting Annotation Errors in Videos via Loss Trajectories
- AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories
- Benchmarking the Robustness of Foundation Models for Mammography under Domain Shift
- MambaX-Net: Dual-Input Mamba-Enhanced Cross-Attention Network for Longitudinal MRI Segmentation
- TeleOCR: Navigating Document Parsing Across Digital and Camera-Captured Documents
- A Survey on Efficient Vision-Language-Action Models