datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
SFT-Reasoning-Ko-Regenerated-HyperCLOVAXwerty1248/SFT-Reasoning-Ko-Translated 질문에 대해 naver-hyperclovax/HyperCLOVAX-SEED-Think-14B로 한국어 추론 재생성.
정확히는 GPTQ 4-bit 양자화 모델인 K-Compression/HyperCLOVAX-SEED-Think-14B-GPTQ를 사용.
영어 질문(Natural Reasoning)의 경우, 추론 시작부분에 "좋아, " 를 추가하여 강제로 한국어로 추론하도록 만듦.
영어 추론 사례, 영어 질문->한국어 추론->한국어 답변 사례 일부 있음.
학습 데이터의 수는 60%, 토큰 기준 80% 수준으로 줄었음에도, Gemma3-4B-it에 학습시킬 시 벤치 성능은 한국어추론(번역) < 한국어추론(재생성) < 영어추론(원본) 으로 보임.
단, 이 데이터로 학습 시 HyperCLOVAX-SEED-Think 특유의 질문의 조건에 대한 무한 의심, 답을 낸 후에도 토큰수 한계까지 무한 재검증하려는 성향도 물려받는… See the full description on the dataset page: https://huggingface.co/datasets/werty1248/SFT-Reasoning-Ko-Regenerated-HyperCLOVAX.HyperCLOVA-X-HyperClever-v1-20250428-preview-tool-calling-training-datanepali-recipes-hyperclovaxHyperCLOVA-X-HyperClever-v1-20250426-preview-tool-calling-training-dataHyperCLOVA-X-HyperClever-v1-20250426-preview-training-dataHyperCLOVA-X-HyperClever-v1-20250426-preview-general-qa-training-dataHyperCLOVA-X-HyperClever-Text-3B-20250428-preview-training-data-tokenizedHyperCLOVA-X-HyperClever-v1-20250427-preview-thinking-training-dataHyperCLOVA-X-HyperClever-v1-20250424-preview-training-dataHyperCLOVA-X-HyperClever-v1-20250424-preview-training-data-vol1HyperCLOVA-X-HyperClever-v1-20250427-preview-training-dataHyperCLOVA-X-HyperClever-v1-20250427-preview-thinking-training-data-tokenized
