CoolFace
Datasetpublic

d2uxd2ux/kyungsang_ko_class_new

Dataset Card for kyungsang_ko_class_new 개요 이 데이터셋은 표준어 질문과 경상도 사투리 답변으로 구성된 한국어 질의응답 데이터셋입니다. 입력 형식: question 출력 형식: answer 주요 특징: 표준어 질문, 경상도 사투리 답변 사투리 강도: strong 데이터 구조 각 샘플은 아래와 같은 구조를 가집니다. { "question": "한국의 수도는 어디인가?", "answer": "서울 아이가. 그건 뭐 다 아는 거라 안카나." } 스플릿 train: 212 validation: 24 소스 파일 원본 업로드 파일: data_new.jsonl 활용 예시 한국어 LLM instruction tuning 표준어 → 경상도 사투리 스타일 변환 방언 생성 및 스타일 제어… See the full description on the dataset page: https://huggingface.co/datasets/d2uxd2ux/kyungsang_ko_class_new.

sourceHugging Faceupdated 5mo agoView on Hugging Face
0likes14downloads
Dataset Card

Dataset Card for kyungsangkoclass_new

개요

이 데이터셋은 표준어 질문과 경상도 사투리 답변으로 구성된 한국어 질의응답 데이터셋입니다.

  • 입력 형식: question
  • 출력 형식: answer
  • 주요 특징: 표준어 질문, 경상도 사투리 답변
  • 사투리 강도: strong

데이터 구조

각 샘플은 아래와 같은 구조를 가집니다.

json
{
  "question": "한국의 수도는 어디인가?",
  "answer": "서울 아이가. 그건 뭐 다 아는 거라 안카나."
}

스플릿

  • train: 212
  • validation: 24

소스 파일

  • 원본 업로드 파일: data_new.jsonl

활용 예시

  • 한국어 LLM instruction tuning
  • 표준어 → 경상도 사투리 스타일 변환
  • 방언 생성 및 스타일 제어 실험

주의사항

  • 본 데이터셋은 생성형 방식으로 구축되었으므로, 실제 지역 화자의 자연 발화와 차이가 있을 수 있습니다.
  • 사투리 표현은 지역, 세대, 맥락에 따라 달라질 수 있습니다.