HomeDatasetsATH-MaaS/Marco_Longspeech
M

ATH-MaaS/Marco_Longspeech

Automatic Speech Recognition · ATH-MaaS· 85.1K
apache-2.0 48 MB

Marco-LongSpeech Dataset Marco-LongSpeech is a multi-task long speech understanding dataset containing 8 different speech understanding tasks designed to benchmark Large Language Models on lengthy audio inputs. 📊 Dataset Statistics Task Statistics Task Train Val Test Total Unique Audios ASR 71,275 15,273 15,274 101,822 101,822 Temporal_Relative_QA 5,886 1,261 1,262 8,409 8,409 summary 4,366 935 937 6,238 6,238… See the full description on the dataset page: https://huggingface.co/datasets/ATH-MaaS/Marco_Longspeech.

Open in MLForge Sign up free Desktop app
# download instantly
mlforge datasets pull ATH-MaaS/Marco_Longspeech

Dataset details

Task
Automatic Speech Recognition
Language
en
License
apache-2.0
Size
48 MB
Creator
ATH-MaaS
Downloads
85.1K
Source
huggingface_datasets
Updated
2026-05-28

About ATH-MaaS/Marco_Longspeech

[](https://arxiv.org/abs/2601.13539) [](https://github.com/AIDC-AI/Marco-Longspeech)