donfu/oa-stackexchange
Stackexchange Instructions for OpenAssistant This dataset is taken from https://archive.org/details/stackexchange. There's a single parquet file combining all stackexchange sites. The threads have been filtered as follows: only threads with an accepted answer, for which both the question and response is less than 1000 characters have been choosen. Other answers, or questions without accepted answers, or long entries have been droppped. Each row consists of INSTRUCTION RESPONSE… See the full description on the dataset page: https://huggingface.co/datasets/donfu/oa-stackexchange.
Implement review comments from OA
Remove original parquet
Add stats to Readme
Add stats
Add an upload to HF script
Upload README.md with huggingface_hub
Upload data/train-00013-of-00014-a217ffa4fc2f0808.parquet with huggingface_hub
Upload data/train-00012-of-00014-c80cb1a7fc0ab359.parquet with huggingface_hub
Upload data/train-00011-of-00014-340e34c4aa0d8946.parquet with huggingface_hub
Upload data/train-00010-of-00014-e1fa0ed27ba1aa25.parquet with huggingface_hub
Upload data/train-00009-of-00014-90b781a7b537ff89.parquet with huggingface_hub
Upload data/train-00008-of-00014-2d77058eb104a701.parquet with huggingface_hub
Upload data/train-00007-of-00014-1fd9532f2709a942.parquet with huggingface_hub
Upload data/train-00006-of-00014-1043fa5cf8753d73.parquet with huggingface_hub
Upload data/train-00005-of-00014-94b864dc1e0fcfdb.parquet with huggingface_hub
Upload data/train-00004-of-00014-e51af987c0f145e1.parquet with huggingface_hub
Upload data/train-00003-of-00014-c61e3dc92a8311cb.parquet with huggingface_hub
Upload data/train-00002-of-00014-e77c4d2fb933a587.parquet with huggingface_hub
Upload data/train-00001-of-00014-54c4a57fdb051fb7.parquet with huggingface_hub
Upload data/train-00000-of-00014-ef5f91dca37ef8a2.parquet with huggingface_hub
Update Readme
Gitignore
Rename download file
Reformat main parquet file with row_size, index
Add trim and combine script
Remove test file
Deal with huge files, cleanup, mrege
Add hacky support for huge files
Cleanup processing code
Remove links from text
Remove initial upload
Add initial parquet example
Add initial scripts
Upload README.md with huggingface_hub
Delete data/train-00000-of-00001-5ed5eb3f7e2c32e7.parquet with huggingface_hub
Upload data/train-00000-of-00001-40d2cbe9d6aaae5a.parquet with huggingface_hub
Upload README.md with huggingface_hub
Upload data/train-00000-of-00001-5ed5eb3f7e2c32e7.parquet with huggingface_hub
Update README.md
initial commit
