conversation ai
customer-support-on-twitter-conversationDATA-AI_Conversation_ITA
Italiano / Italian Conversations Dataset - M.INC
IT | Italiano
Benvenuti nel Dataset di Conversazioni in Italiano, realizzato da M.INC e pubblicato da Mattimax su Hugging Face. Questo dataset è pensato per l'addestramento e la valutazione di modelli linguistici in lingua italiana, ed è composto da oltre 10.000 coppie prompt-response.
Tutte le conversazioni sono in italiano naturale e coprono una vasta gamma di domande e risposte, utili per il fine-tuning di modelli LLM, chatbot… See the full description on the dataset page: https://huggingface.co/datasets/Mattimax/DATA-AI_Conversation_ITA.hope_therapy_conversation_transcriptsaihub_conversation
aihub_conversation
AI Hub 일상대화 한국어 멀티세션 데이터셋 (데이터셋 No. 71678)을 SFT 학습용으로 전처리한 데이터셋입니다.
데이터셋 개요
항목
값
총 샘플 수
120,867
총 토큰 수
약 93M
평균 토큰 / 샘플
769.5
최대 토큰
1,962
언어
한국어 (100%)
포맷
ChatML
출처
AI Hub 71678
라이선스
AI Hub 이용약관
세션 구성
유형
샘플 수
비율
단일세션 (system 없음)
50,052
41.4%
멀티세션 (이전 세션 요약 포함)
70,815
58.6%
멀티세션 샘플은 이전 세션의 대화 요약을 system 턴에 주입하여 연속 대화 맥락을 학습할 수 있도록 구성되어 있습니다.
포맷
ChatML 형식으로 변환되었습니다.
단일세션 예시:… See the full description on the dataset page: https://huggingface.co/datasets/mkd-chanwoo/aihub_conversation.conversation_datasetAI-AgentsTools-GPT-Multiround-Conversation
