AudioFuse: Unified Spectral-Temporal Learning via a Hybrid ViT-1D CNN Architecture for Robust Phonocardiogram Classification
eess.AS, cs.AI, cs.LG, cs.SD, eess.SP
Submitted: 2025-09-27
Updated: 2026-09-05
Comments: Published in the Proceedings of 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) main conference. Find the published version at: https://doi.org/10.1109/ICASSP55912.2026.11464477
Journal ref: M. S. B. Siddiqui and U. Saha, "AudioFuse: Unified Spectral-Temporal Learning Via A Hybrid VIT-1D CNN Architecture for Phonocardiogram Classification," ICASSP 2026, Barcelona, Spain, 2026, pp. 5711-5715
DOI: 10.1109/ICASSP55912.2026.11464477
Code: https://github.com/Saiful185/AudioFuse
License: http://arxiv.org/licenses/nonexclusive-distrib/1.0/
Terminology
Related papers
- X-VC: Zero-shot Streaming Voice Conversion in Codec Space
- Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
- Anonymization, Not Elimination: Utility-Preserved Speech Anonymization
- Towards Audio Token Compression in Large Audio Language Models
- WaveScat: Wavelet Scattering Front-Ends with Self-Supervised Features for Speech Deepfake Detection
- ProPS: Prompted Profile Synthesis for Natural Language-Conditioned Speaker Embedding Distributions