CoolFace
Datasetpublic

WhissleAI/Meta_STT_ZH_AIShell3

Meta Speech Recognition Mandarin Dataset (AISHELL3) This dataset contains both metadata and audio files for Mandarin speech recognition samples from the AISHELL3 corpus. Dataset Statistics Splits and Sample Counts train: 60098 samples valid: 3163 samples test: 24772 samples Example Samples train { "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs_train/SSB00430356.wav", "text": "她以 ENTITY_PRODUCT 滴鸡精… See the full description on the dataset page: https://huggingface.co/datasets/WhissleAI/Meta_STT_ZH_AIShell3.

sourceHugging Faceupdated 1y agoView on Hugging Face
0likes468downloads
Dataset Card

Meta Speech Recognition Mandarin Dataset (AISHELL3)

This dataset contains both metadata and audio files for Mandarin speech recognition samples from the AISHELL3 corpus.

Dataset Statistics

Splits and Sample Counts

  • train: 60098 samples
  • valid: 3163 samples
  • test: 24772 samples

Example Samples

train

json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs_train/SSB00430356.wav",
  "text": "她以 ENTITY_PRODUCT 滴鸡精 END 调养身体。 AGE_14_25 GENDER_FEMALE DIALECT_NORTH",
  "duration": 3.0600680272108844
}
json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs_train/SSB00380135.wav",
  "text": "ENTITY_ORGANIZATION 奇乐乐影院 END 。 AGE_14_25 GENDER_FEMALE DIALECT_NORTH",
  "duration": 2.476984126984127
}

valid

json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs_train/SSB07600351.wav",
  "text": "我觉得她有很大的麻烦。 AGE_14_25 GENDER_FEMALE DIALECT_NORTH",
  "duration": 2.6599092970521543
}
json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs_train/SSB04700221.wav",
  "text": "画的是 ENTITY_LOCATION 纽约 END 地铁西路线。 AGE_14_25 GENDER_FEMALE DIALECT_NORTH",
  "duration": 3.159659863945578
}

test

json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs/SSB07110415.wav",
  "text": "来首歌吻别。 AGE_14_25 GENDER_FEMALE DIALECT_SOUTH",
  "duration": 1.7899773242630386
}
json
{
  "audio_filepath": "/external4/datasets/Mandarin/AISHELL3/wavs/SSB10910445.wav",
  "text": "末日重启。 AGE_14_25 GENDER_FEMALE DIALECT_NORTH",
  "duration": 1.9711791383219954
}

Dataset Information

  • Language: Mandarin Chinese
  • Source: AISHELL3
  • Format: Each sample contains:
  • audio_filepath: Path to the audio file
  • text: Transcription text with speaker metadata
  • duration: Duration of the audio in seconds

Speaker Metadata

The text field includes speaker metadata in the format:

  • ENTITY_<type>: Marking begin of an entity
  • INTENT_* : Intent of an utterance
  • AGE_*: Speaker age range
  • GENDER_*: Speaker gender
  • DIALECT_*: Speaker dialect

Usage Notes

  1. 1.The dataset includes both metadata and audio files.
  2. 2.Audio files are stored in the dataset repository.
  3. 3.The dataset is suitable for Mandarin speech recognition tasks.