Datasets

Dataset

ml_spoken_words

by MLCommons

Multilingual Spoken Words Corpus is a large and growing audio dataset of spoken words in 50 languages collectively spoken by over 5 billion people, for academic research and commercial applications in keyword spotting and spoken term search, licensed under …

CC-BY-4.0audio-classification 5128 3710M < n < 100M rows

published 2 Mar 2022

Preview

The dataset viewer doesn't support this dataset because it runs arbitrary Python code. You can convert it to a Parquet data-only dataset by using the convert_to_parquet CLI from the datasets library. See: https://huggingface.co/docs/datasets/main/en/cli#convert-to-parquet

Cite this

CC-BY-4.0Cite

Tags

task_categories:audio-classificationannotations_creators:machine-generatedlanguage_creators:othermultilinguality:multilingualsource_datasets:extended|common_voicelanguage:arlanguage:aslanguage:brlanguage:calanguage:cnhlanguage:cslanguage:cvlanguage:cylanguage:delanguage:dvlanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:frlanguage:fylanguage:galanguage:gnlanguage:halanguage:ialanguage:idlanguage:itlanguage:kalanguage:kylanguage:ltlanguage:lvlanguage:mnlanguage:mtlanguage:nllanguage:orlanguage:pllanguage:pt