zh-tw-llm-dv/zh-tw-pythia-ta8000-v1-e1-tr_sg-302-c1024
zh-tw-pythia-ta8000-v1-e1-tr_sg-302-c1024 This dataset is a part of the zh-tw-llm project. Tokenizer: zh-tw-pythia-tokenizer-a8000-v1 Built with: translations, sharegpt Rows: train 305958, test 195 Max length: 1024 Full config:{"build_with": ["translations", "sharegpt"], "preview_length": 128, "translations_settings": {"source_dataset": "zetavg/coct-en-zh-tw-translations-twp-300k", "lang_1_key": "en", "lang_2_key": "ch", "templates": ["English: {lang_1}\nChinese: {lang_2}"… See the full description on the dataset page: https://huggingface.co/datasets/zh-tw-llm-dv/zh-tw-pythia-ta8000-v1-e1-tr_sg-302-c1024.
021
zh-tw-pythia-ta8000-v1-e1-tr_sg-302-c1024
This dataset is a part of the zh-tw-llm project.
- Tokenizer:
zh-tw-pythia-tokenizer-a8000-v1 - Built with:
translations,sharegpt - Rows:
train305958,test195 - Max length:
1024 - Full config:
{"build_with": ["translations", "sharegpt"], "preview_length": 128, "translations_settings": {"source_dataset": "zetavg/coct-en-zh-tw-translations-twp-300k", "lang_1_key": "en", "lang_2_key": "ch", "templates": ["English: {lang_1}\nChinese: {lang_2}", "Chinese: {lang_2}\nEnglish: {lang_1}"], "use_template": "random", "rows_limit": 300000, "test_size": 100, "test_split_seed": 42}, "sharegpt_settings": {"source_dataset": "zetavg/ShareGPT-Processed", "train_on_inputs": false, "languages": [{"en": 0.4}, "zh_Hant"], "rows_limit": 8000, "test_size": 0.02, "test_split_seed": 42, "test_rows_limit": 100}}