Riyuechang/PTT-Corpus-100K_Gossiping-1400-39400_v2
版本資訊 增加了更多過濾詞並且一旦符合過濾規則,就會被過濾掉 簡介 本數據集使用來自PTT網站中的Gossiping分類的資料訓練總共爬取了第1400頁~第39400頁的所有文章裡的內容和所有留言在使用一些方法從海量的數據中,過濾出噪聲較小(理論上)的部份作為本數據集 過濾規則 總推數 - 總噓數 >= 20 最靠前的推文最優先 以下為過濾詞 #文章標題不能「包含」以下關鍵字 filter_title_in = ["http", "gif", "jpeg", "jpg", "png", "圖", "水桶", "永桶", "出桶", "被桶", "欠桶", "有效文章", "登入次數"] #推文內容不能「等於」以下關鍵字 filter_content_equal = ["推", "推推", "推推推", "未看先推", "先推", "推一下", "推個", "正文", "頭", "錢", "好", "是", "引", "廢文"] #推文內容不能「包含」以下關鍵字… See the full description on the dataset page: https://huggingface.co/datasets/Riyuechang/PTT-Corpus-100K_Gossiping-1400-39400_v2.
Update README.md
Update README.md
Update README.md
Update README.md
Update README.md
Update README.md
Update README.md
Upload PTT_Corpus_board_38_count_20_greedy_mode_no_ai_max_50.json
initial commit
