zrchen03/videochatgpt_tune
原来共有共有13303个video文件, 100010个caption 与最初版本的差距 一是因为有些视频无法解析,导致视频数量少了 二是因为有些视频并没有对应的caption——这一步反过来得再删除多余视频 13214个 video 相互对应 99386个 caption videochatgpt_video_id 存储着 13214个video_id 为纯净版,如v___c8enCfzqw.mp4 videochatgpt_tune_video_id.json 存储着 13214个video_id 为非纯净版,如videochatgpt_tune/v_ybkcKusf-Kg.mp4 sorted_videochatgpt_tune_for_compute_repeat.json 按 video_id字典序 存储着 99386个video_id(有重复)… See the full description on the dataset page: https://huggingface.co/datasets/zrchen03/videochatgpt_tune.
原来共有共有13303个video文件, 100010个caption --- 与最初版本的差距 --- 一是因为有些视频无法解析,导致视频数量少了 --- 二是因为有些视频并没有对应的caption——这一步反过来得再删除多余视频 13214个 video 相互对应 99386个 caption --- videochatgptvideoid 存储着 13214个videoid 为纯净版,如v_c8enCfzqw.mp4 --- videochatgpttunevideoid.json 存储着 13214个videoid 为非纯净版,如videochatgpttune/vybkcKusf-Kg.mp4 --- sortedvideochatgpttuneforcomputerepeat.json 按 videoid字典序 存储着 99386个videoid(有重复) 与caption一一对应 --- videochatgpttunefiltered 存储着99386个 字典类型数据 --- sortedvideochatgpttune 按 videoid字典序 存储着99386个 字典类型数据 --- filteredsortedvideochatgpt+tune.json 按 video的字典序 存储着 40562个 从videochatgpt+截取的字典类型数据,新增id,id与sortedvideochatgpttune相对应 --- 10keyframept.zip 存放着13214个视频的pt文件 ---
