bandad/asr-testset-kw-ja-v1
日本語 ASR アノテーション v1 提出済みの結果を annotations.json に保存します。音声は元リポジトリと同じディレクトリ構成・ファイル名で収録します(例:data/part-00000/example.wav)。音声の内容も変更しません。 更新がある場合、おおむね1時間ごとに同期します。下書き・メールアドレス・作業者IDは公開しません。 JSON の形式(schema_version: 2) { "schema_version": 2, "annotations": [ { "id": "example", "source": { "dataset": "bandad/asr-testset-kw-ja", "revision": "元データのコミットSHA", "audio": "data/part-00000/example.wav" }, "audio":… See the full description on the dataset page: https://huggingface.co/datasets/bandad/asr-testset-kw-ja-v1.
日本語 ASR アノテーション v1
提出済みの結果を annotations.json に保存します。音声は元リポジトリと同じディレクトリ構成・ファイル名で収録します(例:data/part-00000/example.wav)。音声の内容も変更しません。 更新がある場合、おおむね1時間ごとに同期します。下書き・メールアドレス・作業者IDは公開しません。
JSON の形式(schema_version: 2)
{
"schema_version": 2,
"annotations": [
{
"id": "example",
"source": {
"dataset": "bandad/asr-testset-kw-ja",
"revision": "元データのコミットSHA",
"audio": "data/part-00000/example.wav"
},
"audio": "data/part-00000/example.wav",
"excluded": false,
"exclusion_reason": "",
"segments": [
{
"start": 0.0,
"end": 3.2,
"text": "(VF まあ|まぁ)(V iPhone|アイフォーン)は1万5000円(A です|ですよ|)",
"no_speech": false,
"confirmed": true,
"excluded": false
}
]
}
]
}source:元音声のリポジトリ、固定コミット、パス。データ更新後も追跡できます。audio:このリポジトリ内の音声パス。使用する音声ではsource.audioと同じです。segments.start/end:音声ファイルの先頭からの秒数です。- `text` に候補・タグをすべて含めます。`alternatives` フィールドはありません。
no_speech: true:文字もマークもない区間。textは空文字です。excluded: true:テストセットに使用しない音声。理由を残し、audioはnull、音声はコピーしません。未確認の区間が残る場合があります。評価時は除外してください。segments.excluded: true:人間でも聞き取りが不確かなため不採用にした区間です。評価対象から除外してください。他の区間は使用できます。textは作業内容を保持しますが正解として使用しません。旧データで省略されている場合はfalseと扱います。confirmedは採否を含む確認が完了したことを表します。区間の不採用と音声全体の不使用は独立しています。- 使用する音声は全区間
confirmed: trueです。
text の記法
V/A/VF は | で候補を区切ります。括弧・タグの入れ子は使いません。VFは、どの候補を選んでもフィラーです。評価時には (F まあ) / (F まぁ) として扱えます。フィラーを除く評価ではVF全体を除きます。
空候補はAにのみ使用できます。空白だけの候補は空文字に正規化します。空候補しかない指定・候補の重複は不可です。先頭は文字のある候補に統一します。候補内部の空白は保持します。
会話中の「はい」「うん」「なるほど」などの相づちは、文字起こしに含める場合・含めない場合の両方を許容します。この場合もAを使い、(A はい|)、(A うん|)、(A なるほど|) のように、発話を記した候補と空候補を指定します。末尾の | の後には何も書きません。聞き取りが不確かな場合に限らず、相づちの有無を任意とするための運用です。評価時は、相づちがある出力・ない出力のどちらも許容してください。
Vは許容表記の違い、Aは聞き取りの不確かさ、または上記の相づちの有無を許容することを表します。両者を区別して評価・確認してください。先頭の候補を採用するだけでは候補情報が失われるため、評価処理ではこの記法を解釈してください。
L/B/Cは本文中の挿入位置を表し、個別の音声時刻・長さは持ちません。マークだけの区間も no_speech: false です。 笑いのLは CEJC 転記テキスト、言語音と独立した音を区別する考え方は CSJ 転記テキストの仕様 も参考にしています。B/C・V/A/VFはこのデータセットの独自規約です。特にCEJCのCは泣きですが、ここでは咳を意味します。Wは笑いには使用しません。
その他の規則
- 数字に桁区切りカンマは使いません。千の位までは数字、万以上は
1万5000円、1億2000万円のように単位を入れます。 - 列挙は読点で区切ります(
1、2、)。 - 全角の候補記法も編集画面で入力でき、出力時には半角の記法に統一します。
保存・同期と旧形式
端末とサーバーのSQLiteに下書きを保存します。提出済みの結果をローカルJSONに出力し、更新がある場合だけ音声・JSON・READMEを同一コミットで同期します。通信失敗時はローカルを保持して再試行します。
schemaversion 1では、音声をハッシュ名に変更し、候補を `alternatives` に分けていました。schemaversion 2では元の音声パスを維持し、候補を text に統合しています。移行時は、このサーバーが登録した旧ハッシュ名の音声を元のパスへ移動します。過去の形式はGit履歴に残ります。
同じパスで異なる内容の音声が衝突した場合は、名前を変更したり上書きしたりせず同期を停止します。元データの版を確認して解決してください。 元音声の利用条件は source.dataset の説明を確認してください。
