Datasets
Dataset
yodas2_sidon
by sarulab-speech
YODAS2-Sidon Overview This dataset is a cleansed version of YODAS-2 with Sidon speech restoration mode for Speech Synthesis and Spoken Language Modeling. YODAS-2 is a massive, multilingual YouTube-derived dataset.
CC-BY-3.0text-to-speech 26821 651M < n < 10M rows
published 13 Nov 2025
Preview
Server error while post-processing the split rows. Please report the issue.
Cite this
CC-BY-3.0audiotextCite
Tags
task_categories:text-to-speechtask_categories:automatic-speech-recognitionlanguage:aalanguage:ablanguage:aflanguage:aklanguage:amlanguage:arlanguage:aslanguage:aylanguage:azlanguage:balanguage:belanguage:bglanguage:bhlanguage:bilanguage:bmlanguage:bnlanguage:bolanguage:brlanguage:bslanguage:calanguage:colanguage:crlanguage:cslanguage:cylanguage:dalanguage:delanguage:dzlanguage:eelanguage:ellanguage:enlanguage:eolanguage:eslanguage:etlanguage:eulanguage:falanguage:fflanguage:filanguage:fj