AudioFuse: Unified Spectral-Temporal Learning via a Hybrid ViT-1D CNN Architecture for Robust Phonocardiogram Classification

arXiv:2509.23454 · eess.AS, cs.AI, cs.LG, cs.SD, eess.SP · Submitted 2025-09-27 · Read on arXiv

eess.AS, cs.AI, cs.LG, cs.SD, eess.SP

Submitted: 2025-09-27

Updated: 2026-09-05

Comments: Published in the Proceedings of 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) main conference. Find the published version at: https://doi.org/10.1109/ICASSP55912.2026.11464477

Journal ref: M. S. B. Siddiqui and U. Saha, "AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification," ICASSP 2026, Barcelona, Spain, 2026, pp. 5711-5715

DOI: 10.1109/ICASSP55912.2026.11464477

Code: https://github.com/Saiful185/AudioFuse

License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/

Terminology

Related papers