TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics Paper • 2509.26329 • Published Sep 30, 2025 • 3
WaveSP-Net: Learnable Wavelet-Domain Sparse Prompt Tuning for Speech Deepfake Detection Paper • 2510.05305 • Published Oct 6, 2025 • 1
Pseudo2Real: Task Arithmetic for Pseudo-Label Correction in Automatic Speech Recognition Paper • 2510.08047 • Published Oct 9, 2025 • 8
CantoASR: Prosody-Aware ASR-LALM Collaboration for Low-Resource Cantonese Paper • 2511.04139 • Published Nov 6, 2025 • 1
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation Paper • 2601.06329 • Published Jan 9 • 2
TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild Paper • 2603.21478 • Published Mar 23
MOS-Bias: From Hidden Gender Bias to Gender-Aware Speech Quality Assessment Paper • 2603.10723 • Published Mar 11 • 1
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation Paper • 2603.19195 • Published Mar 19 • 4
MoVE: Translating Laughter and Tears via Mixture of Vocalization Experts in Speech-to-Speech Translation Paper • 2604.17435 • Published Apr 19 • 3
Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach Paper • 2606.21215 • Published Jun 19
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech Paper • 2604.17248 • Published 23 days ago • 1
VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech Paper • 2604.17248 • Published 23 days ago • 1
Speaker Identity in Non-Verbal Vocalizations: Conditional Distillation and Mixture of Experts Approach Paper • 2606.21215 • Published Jun 19
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation Paper • 2603.19195 • Published Mar 19 • 4
How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation Paper • 2603.19195 • Published Mar 19 • 4
On the Fallacy of Global Token Perplexity in Spoken Language Model Evaluation Paper • 2601.06329 • Published Jan 9 • 2
Treble10: A high-quality dataset for far-field speech recognition, dereverberation, and enhancement Paper • 2510.23141 • Published Oct 27, 2025 • 5
Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual and Long-Form Speech Recognition Evaluation Paper • 2510.06961 • Published Oct 8, 2025 • 13
Analyzing Mitigation Strategies for Catastrophic Forgetting in End-to-End Training of Spoken Language Models Paper • 2505.17496 • Published May 23, 2025 • 2