datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
CC-MAIN-2017-47CC-MAIN-2025-08
CC-MAIN-2025-08へようこそ
本データセットはCommonCrawlerと呼ばれるものから日本語のみを抽出したものです。
利用したものはcc-downloader-rsです。
なおIPAのICSCoEと呼ばれるところから資源を借りてやりましたゆえに、みなさんIPAに感謝しましょう。
※ IPAは独立行政法人 情報処理推進機構のことです。テストに出ますので覚えましょう。
利用について
本利用は研究目的のみとさせていただきます。
それ以外の利用につきましては途方のくれない数の著作権者に許可を求めてきてください。
CC-MAIN-2025-33CC-MAIN-2018-13CC-MAIN-2019-39
CC-MAIN-2019-39へようこそ
本データセットはCommonCrawlerと呼ばれるものから日本語のみを抽出したものです。
利用したものはcc-downloader-rsです。
なおIPAのICSCoEと呼ばれるところから資源を借りてやりましたゆえに、みなさんIPAに感謝しましょう。
※ IPAは独立行政法人 情報処理推進機構のことです。テストに出ますので覚えましょう。
利用について
本利用は研究目的のみとさせていただきます。
それ以外の利用につきましては途方もくれない数の著作権者に許可を求めてきてください。
CC-MAIN-2025-05
CC-MAIN-2025-05へようこそ
本データセットはCommonCrawlerと呼ばれるものから日本語のみを抽出したものです。
利用したものはcc-downloader-rsです。
なおIPAのICSCoEと呼ばれるところから資源を借りてやりましたゆえに、みなさんIPAに感謝しましょう。
※ IPAは独立行政法人 情報処理推進機構のことです。テストに出ますので覚えましょう。
利用について
本利用は研究目的のみとさせていただきます。
それ以外の利用につきましては途方のくれない数の著作権者に許可を求めてきてください。
CC-MAIN-2017-34CC-MAIN-2020-16CC-MAIN-2018-09CC-MAIN-2018-05CC-MAIN-2018-26CC-MAIN-2017-51CC-MAIN-2022-27CC-MAIN-2017-04CC-MAIN-2018-39CC-MAIN-2020-40CC-MAIN-2019-35
CC-MAIN-2019-35へようこそ
本データセットはCommonCrawlerと呼ばれるものから日本語のみを抽出したものです。
利用したものはcc-downloader-rsです。
なおIPAのICSCoEと呼ばれるところから資源を借りてやりましたゆえに、みなさんIPAに感謝しましょう。
※ IPAは独立行政法人 情報処理推進機構のことです。テストに出ますので覚えましょう。
利用について
本利用は研究目的のみとさせていただきます。
それ以外の利用につきましては途方もくれない数の著作権者に許可を求めてきてください。
CC-MAIN-2019-30
CC-MAIN-2019-30へようこそ
本データセットはCommonCrawlerと呼ばれるものから日本語のみを抽出したものです。
利用したものはcc-downloader-rsです。
なおIPAのICSCoEと呼ばれるところから資源を借りてやりましたゆえに、みなさんIPAに感謝しましょう。
※ IPAは独立行政法人 情報処理推進機構のことです。テストに出ますので覚えましょう。
利用について
本利用は研究目的のみとさせていただきます。
それ以外の利用につきましては途方もくれない数の著作権者に許可を求めてきてください。
CC-MAIN-2017-22CC-MAIN-2018-22CC-MAIN-2025-26CC-MAIN-2018-51CC-MAIN-2018-30cccc
Creative Commons Common Crawl
Description
This dataset contains text from 52 Common Crawl snapshots, covering about half of Common Crawl snapshots available to date and covering all years of operations of Common Crawl up to 2024.
We found a higher level of duplication across this collection, suggesting that including more snapshots would lead to a modest increase in total token yield.
From these snapshots, we extract HTML content using FastWarc.
Then, using a regular… See the full description on the dataset page: https://huggingface.co/datasets/common-pile/cccc.CC-MAIN-2018-17CC-MAIN-2017-26CC-MAIN-2017-39CC-MAIN-2025-18CC-MAIN-2023-40CC-MAIN-2023-06
