CoolFace
Datasetpublic

bong9513/nationalpension_textmining_crawled_rawdata

국민연금 여론 분석을 위한 원본 텍스트 데이터셋 데이터셋 설명 본 데이터셋은 국민연금에 대한 대중의 인식을 파악하기 위해 네이버(Naver)의 뉴스, 블로그, 카페에서 수집한 원본 텍스트 데이터의 모음입니다. 2022년 5월부터 2024년 4월까지 약 2년간의 데이터를 포함하고 있으며, 텍스트 마이닝, 감성 분석, 토픽 모델링 등 다양한 자연어 처리(NLP) 연구의 기초 자료로 활용될 수 있습니다. 이 데이터셋은 GitHub 저장소에서 진행된 '국민연금 텍스트 마이닝 및 감성 분석 프로젝트'의 일부입니다. 전체 프로젝트 내용과 분석 코드는 해당 GitHub 저장소를 참고해 주시기 바랍니다. 데이터 구성 웹 크롤링을 통해 수집한 원본 데이터로, pickle 형식으로 저장되어 있습니다. pension_news.pkl: 네이버 뉴스 기사 title: 기사 제목 doc: 기사 본문… See the full description on the dataset page: https://huggingface.co/datasets/bong9513/nationalpension_textmining_crawled_rawdata.

sourceHugging Facecc-by-sa-4.0updated 1y agoView on Hugging Face
0likes9downloads
Dataset Card

국민연금 여론 분석을 위한 원본 텍스트 데이터셋

데이터셋 설명

본 데이터셋은 국민연금에 대한 대중의 인식을 파악하기 위해 네이버(Naver)의 뉴스, 블로그, 카페에서 수집한 원본 텍스트 데이터의 모음입니다. 2022년 5월부터 2024년 4월까지 약 2년간의 데이터를 포함하고 있으며, 텍스트 마이닝, 감성 분석, 토픽 모델링 등 다양한 자연어 처리(NLP) 연구의 기초 자료로 활용될 수 있습니다.

이 데이터셋은 GitHub 저장소에서 진행된 '국민연금 텍스트 마이닝 및 감성 분석 프로젝트'의 일부입니다. 전체 프로젝트 내용과 분석 코드는 해당 GitHub 저장소를 참고해 주시기 바랍니다.

데이터 구성

웹 크롤링을 통해 수집한 원본 데이터로, pickle 형식으로 저장되어 있습니다.

  • `pension_news.pkl`: 네이버 뉴스 기사
  • title: 기사 제목
  • doc: 기사 본문
  • published_date: 발행일
  • ch: 채널 (e.g., 'naver')
  • `pension_blog.pkl`: 네이버 블로그 게시물
  • title: 블로그 제목
  • doc: 블로그 본문
  • like_cnt: 좋아요 수
  • comment_cnt: 댓글 수
  • comment_list: 댓글 내용
  • publish_date: 발행일
  • `pension_cafe.pkl`: 네이버 카페 게시물
  • title: 게시글 제목
  • doc: 게시글 본문
  • like: 좋아요 수
  • comment_cnt: 댓글 수
  • comment_list: 댓글 내용

데이터 수집 방법

  • 수집 기간: 2022년 5월 1일 ~ 2024년 4월 30일
  • 수집 소스: 네이버 뉴스, 블로그, 카페
  • 키워드: "국민연금"
  • 도구: Selenium, BeautifulSoup, newspaper3k를 사용하여 각 플랫폼의 데이터를 수집하였습니다.

데이터셋 사용 추천

본 데이터셋은 다음과 같은 연구 및 분석에 활용될 수 있습니다.

  • 국민연금 관련 주요 이슈 및 키워드 트렌드 분석
  • 시계열에 따른 여론의 감성 변화 추이 분석
  • 토픽 모델링을 통한 주요 담론 및 주제 식별
  • 한국어 텍스트 데이터 전처리 및 자연어 처리 모델 학습