CoolFace
Datasetpublic

renhehuang/formosa-vision-finegrained

Formosa Vision Fine-grained (Expanded) Dataset Summary 此資料集以台灣在地文化與地景為核心,提供具細節的中文描述,並保留原始圖像。 擴充版本針對每張圖像生成更長、更密集的語義描述,以強化模型在細節理解上的表現。 Motivation 『資料合成』FLAIR 的核心在於訓練模型「聽得懂細節」。這意味著「長文本」越具體、包含越多方位詞 (左上角、紅色物體旁...),模型學到的局部特徵就越好。因為在此階段會透過大型多模態模型生成豐富且長的中文描述夠「碎唸」(包含大量方位、顏色、材質等細節)。相較於網路爬蟲數據,此資料庫具備高品質的本土文化實體 (Entity) 標註,是訓練台灣在地化 AI 的最佳基石。 Source Data 原始資料集:twinkle-ai/Formosa-Vision(Hugging Face Datasets) 擴充流程:以本地 VLM 產生更細緻的中文長描述… See the full description on the dataset page: https://huggingface.co/datasets/renhehuang/formosa-vision-finegrained.

sourceHugging Faceotherupdated 9mo agoView on Hugging Face
0likes43downloads

renhehuang/formosa-vision-finegrained · main · files are served by the source, never re-hosted here