ayousanz/vtuber-youtube-list-dataset
VTuber YouTube Channel List Dataset このデータセットは、VTuber チャンネルと VTuber でない(例:料理チャンネルなど)の YouTube チャンネルのメタデータを JSONL 形式でまとめたものです。各レコードは以下のフィールドを含んでいます: channel_id: YouTube チャンネルの固有 ID title: チャンネルのタイトル description: チャンネルの説明文 text: タイトルと説明文を連結したテキスト(モデルの入力用に利用できます) label: バイナリラベル(VTuber の場合は 1、非VTuber の場合は 0) データセットの概要 目的: このデータセットは、テキスト分類タスクにおいて VTuber チャンネルかどうかを判定するモデルの学習および評価に利用できます。 言語: 主に日本語ですが、一部英語やその他の言語の記述も含まれる可能性があります。 ライセンス: MIT License 使用上の注意点… See the full description on the dataset page: https://huggingface.co/datasets/ayousanz/vtuber-youtube-list-dataset.
VTuber YouTube Channel List Dataset
このデータセットは、VTuber チャンネルと VTuber でない(例:料理チャンネルなど)の YouTube チャンネルのメタデータを JSONL 形式でまとめたものです。各レコードは以下のフィールドを含んでいます:
- channel_id: YouTube チャンネルの固有 ID
- title: チャンネルのタイトル
- description: チャンネルの説明文
- text: タイトルと説明文を連結したテキスト(モデルの入力用に利用できます)
- label: バイナリラベル(VTuber の場合は
1、非VTuber の場合は0)
データセットの概要
- 目的: このデータセットは、テキスト分類タスクにおいて VTuber チャンネルかどうかを判定するモデルの学習および評価に利用できます。
- 言語: 主に日本語ですが、一部英語やその他の言語の記述も含まれる可能性があります。
- ライセンス: MIT License
使用上の注意点
- クラスバランス: データセット内で VTuber(label=1)と非VTuber(label=0)の比率が偏っている可能性があるため、学習時にクラス不均衡対策が必要な場合があります。
- データのノイズ: YouTube の公開メタデータを元にしているため、説明文が短い、あるいは内容が一部不正確なレコードが含まれている可能性があります。
- 前処理: 利用にあたっては、テキストのクリーニングや正規化などの前処理が望ましい場合があります。
推論例
以下のコード例は、Hugging Face のパイプラインを用いてこのデータセットから学習したモデルを利用する例です。
from transformers import AutoTokenizer, AutoModelForSequenceClassification, pipeline
tokenizer = AutoTokenizer.from_pretrained("ayousanz/your_dataset_or_model_repo")
model = AutoModelForSequenceClassification.from_pretrained("ayousanz/modernbert-vtuber-finetuned")
vtuber_classifier = pipeline("text-classification", model=model, tokenizer=tokenizer)
result = vtuber_classifier("この動画では、バーチャルなキャラクターがリアルタイムに動く様子を配信しています。")
print(result)引用情報
このデータセットを利用する際は、以下のように引用してください:
@misc{ayousanz_vtuber_dataset,
title={VTuber YouTube Channel List Dataset},
author={ayousanz},
year={2024},
url={ayousanz/vtuber-youtube-list-dataset}
}