CoolFace
Datasetpublic

LooksJuicy/Chinese-Roleplay-Novel

一直以来,中文角色扮演开源数据集更关注超拟人方向或纯角色对话方向,严重缺乏交互游戏方向的开源数据,因此许多模型尤其参数量较小的模型对酒馆类的角色卡支持较差。 为了解决这一困境,本项目抛砖引玉,基于4500条小说文本使用GPT4o构建出约260条酒馆style的数据集,均为多轮对话,每轮对话都包括状态数据,如时间、角色状态、任务进度等。 数据key对应含义如下: world:表示当前故事的世界观,通常可以加入到system prompt中 scence:表示当前故事发生场景,包括时间、地点、环境、任务目标 character:表示当前故事中可能出现的角色和对应简介 field:表示这条数据每轮对话中需要生成的状态信息 conversations:表示这条数据的对话内容,分为问候语、主角(user)和系统(assistant) fields_format:表示状态信息的填充格式prompt,可能是列表、表格、JSON等各种形式 format_list:表示状态信息的填充结果 状态信息的示例如下 **健康状态**: 🌿 良好,身体颤抖 **精神状态**: 🌟 恐惧,极度紧张… See the full description on the dataset page: https://huggingface.co/datasets/LooksJuicy/Chinese-Roleplay-Novel.

sourceHugging Faceapache-2.0updated 2y agoView on Hugging Face
88likes186downloads
Dataset Card

一直以来,中文角色扮演开源数据集更关注超拟人方向或纯角色对话方向,严重缺乏交互游戏方向的开源数据,因此许多模型尤其参数量较小的模型对酒馆类的角色卡支持较差。

为了解决这一困境,本项目抛砖引玉,基于4500条小说文本使用GPT4o构建出约260条酒馆style的数据集,均为多轮对话,每轮对话都包括状态数据,如时间、角色状态、任务进度等。

数据key对应含义如下:

world:表示当前故事的世界观,通常可以加入到system prompt中
scence:表示当前故事发生场景,包括时间、地点、环境、任务目标
character:表示当前故事中可能出现的角色和对应简介
field:表示这条数据每轮对话中需要生成的状态信息
conversations:表示这条数据的对话内容,分为问候语、主角(user)和系统(assistant)
fields_format:表示状态信息的填充格式prompt,可能是列表、表格、JSON等各种形式
format_list:表示状态信息的填充结果

状态信息的示例如下

**健康状态**: 🌿 良好,身体颤抖
**精神状态**: 🌟 恐惧,极度紧张
**任务进度**: 📈 遇到老头和王八
**物品栏**: 🎒 无特殊物品

期望为中文角色扮演领域做出一些粗浅的贡献~

ps: 感谢T同学对本项目作出的贡献。