CoolFace
Datasetpublic

bandad/asr-testset-kw-ja-v1

日本語 ASR アノテーション v1 提出済みの結果を annotations.json に保存します。音声は元リポジトリと同じディレクトリ構成・ファイル名で収録します(例:data/part-00000/example.wav)。音声の内容も変更しません。 更新がある場合、おおむね1時間ごとに同期します。下書き・メールアドレス・作業者IDは公開しません。 JSON の形式(schema_version: 2) { "schema_version": 2, "annotations": [ { "id": "example", "source": { "dataset": "bandad/asr-testset-kw-ja", "revision": "元データのコミットSHA", "audio": "data/part-00000/example.wav" }, "audio":… See the full description on the dataset page: https://huggingface.co/datasets/bandad/asr-testset-kw-ja-v1.

sourceHugging Faceupdated 1h agoView on Hugging Face
0likes
Dataset Card

日本語 ASR アノテーション v1

提出済みの結果を annotations.json に保存します。音声は元リポジトリと同じディレクトリ構成・ファイル名で収録します(例:data/part-00000/example.wav)。音声の内容も変更しません。 更新がある場合、おおむね1時間ごとに同期します。下書き・メールアドレス・作業者IDは公開しません。

JSON の形式(schema_version: 2)

json
{
  "schema_version": 2,
  "annotations": [
    {
      "id": "example",
      "source": {
        "dataset": "bandad/asr-testset-kw-ja",
        "revision": "元データのコミットSHA",
        "audio": "data/part-00000/example.wav"
      },
      "audio": "data/part-00000/example.wav",
      "excluded": false,
      "exclusion_reason": "",
      "segments": [
        {
          "start": 0.0,
          "end": 3.2,
          "text": "(VF まあ|まぁ)(V iPhone|アイフォーン)は1万5000円(A です|ですよ|)",
          "no_speech": false,
          "confirmed": true,
          "excluded": false
        }
      ]
    }
  ]
}
  • —source:元音声のリポジトリ、固定コミット、パス。データ更新後も追跡できます。
  • —audio:このリポジトリ内の音声パス。使用する音声では source.audio と同じです。
  • —segments.start / end:音声ファイルの先頭からの秒数です。
  • —`text` に候補・タグをすべて含めます。`alternatives` フィールドはありません。
  • —no_speech: true:文字もマークもない区間。text は空文字です。
  • —excluded: true:テストセットに使用しない音声。理由を残し、audio は null、音声はコピーしません。未確認の区間が残る場合があります。評価時は除外してください。
  • —segments.excluded: true:人間でも聞き取りが不確かなため不採用にした区間です。評価対象から除外してください。他の区間は使用できます。text は作業内容を保持しますが正解として使用しません。旧データで省略されている場合は false と扱います。
  • —confirmed は採否を含む確認が完了したことを表します。区間の不採用と音声全体の不使用は独立しています。
  • —使用する音声は全区間 confirmed: true です。

text の記法

記法意味
(D そっ)言いよどみ・言いかけ
(F えー)フィラー
`(V iPhoneアイフォーン)`同じ発話の表記の違い(Variant)
`(A ですですよ)`聞き取りが不確かな候補(Ambiguous)
`(A です)`「です」または語がない可能性
`(VF まあまぁ)`表記候補の全体がフィラー(Variant + Filler)
(L)笑い声(Laugh)
(B)息・呼吸音(Breath)
(C)咳・咳払い(Cough)

V/A/VF は | で候補を区切ります。括弧・タグの入れ子は使いません。VFは、どの候補を選んでもフィラーです。評価時には (F まあ) / (F まぁ) として扱えます。フィラーを除く評価ではVF全体を除きます。

空候補はAにのみ使用できます。空白だけの候補は空文字に正規化します。空候補しかない指定・候補の重複は不可です。先頭は文字のある候補に統一します。候補内部の空白は保持します。

会話中の「はい」「うん」「なるほど」などの相づちは、文字起こしに含める場合・含めない場合の両方を許容します。この場合もAを使い、(A はい|)、(A うん|)、(A なるほど|) のように、発話を記した候補と空候補を指定します。末尾の | の後には何も書きません。聞き取りが不確かな場合に限らず、相づちの有無を任意とするための運用です。評価時は、相づちがある出力・ない出力のどちらも許容してください。

Vは許容表記の違い、Aは聞き取りの不確かさ、または上記の相づちの有無を許容することを表します。両者を区別して評価・確認してください。先頭の候補を採用するだけでは候補情報が失われるため、評価処理ではこの記法を解釈してください。

L/B/Cは本文中の挿入位置を表し、個別の音声時刻・長さは持ちません。マークだけの区間も no_speech: false です。 笑いのLは CEJC 転記テキスト、言語音と独立した音を区別する考え方は CSJ 転記テキストの仕様 も参考にしています。B/C・V/A/VFはこのデータセットの独自規約です。特にCEJCのCは泣きですが、ここでは咳を意味します。Wは笑いには使用しません。

その他の規則

  • —数字に桁区切りカンマは使いません。千の位までは数字、万以上は 1万5000円、1億2000万円 のように単位を入れます。
  • —列挙は読点で区切ります(1、2、)。
  • —全角の候補記法も編集画面で入力でき、出力時には半角の記法に統一します。

保存・同期と旧形式

端末とサーバーのSQLiteに下書きを保存します。提出済みの結果をローカルJSONに出力し、更新がある場合だけ音声・JSON・READMEを同一コミットで同期します。通信失敗時はローカルを保持して再試行します。

schemaversion 1では、音声をハッシュ名に変更し、候補を `alternatives` に分けていました。schemaversion 2では元の音声パスを維持し、候補を text に統合しています。移行時は、このサーバーが登録した旧ハッシュ名の音声を元のパスへ移動します。過去の形式はGit履歴に残ります。

同じパスで異なる内容の音声が衝突した場合は、名前を変更したり上書きしたりせず同期を停止します。元データの版を確認して解決してください。 元音声の利用条件は source.dataset の説明を確認してください。