Datasets
Dataset
ml_spoken_words
by MLCommons
Multilingual Spoken Words Corpus is a large and growing audio dataset of spoken words in 50 languages collectively spoken by over 5 billion people, for academic research and commercial applications in keyword spotting and spoken term search, licensed under …
CC-BY-4.0audio-classification 5128 3710M < n < 100M rows
published 2 Mar 2022
Preview
The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet
Cite this
CC-BY-4.0Cite
Tags
task_categories:audio-classificationannotations_creators:machine-generatedlanguage_creators:othermultilinguality:multilingualsource_datasets:extended|common_voicelanguage:arlanguage:aslanguage:brlanguage:calanguage:cnhlanguage:cslanguage:cvlanguage:cylanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:frlanguage:fylanguage:galanguage:gnlanguage:halanguage:ialanguage:idlanguage:itlanguage:kalanguage:kylanguage:ltlanguage:lvlanguage:mnlanguage:mtlanguage:nllanguage:orlanguage:pllanguage:pt