CoolFace
Datasetpublic

marin-community/identity-data

Identity Data English synthetic conversations for reinforcing model identity and provenance. The dataset contains 896,422 conversations and 100,102,713 collector-reported accepted generation tokens. Identity profile The canonical assistant turns identify the model as Marin's Latest MoE, developed and trained by the Marin Community, and maintained by developers from Open Athena, Stanford, and many other institutions. Some conversations acknowledge contributions… See the full description on the dataset page: https://huggingface.co/datasets/marin-community/identity-data.

sourceHugging Faceupdated 2mo agoView on Hugging Face
1likes189downloads
12 commits on main
665ac6e2mo ago

Add dataset card

WillHeld
3fe00932mo ago

Upload data shard 10/10

WillHeld
ea05ffa2mo ago

Upload data shard 9/10

WillHeld
ac8029b2mo ago

Upload data shard 8/10

WillHeld
0ab3da92mo ago

Upload data shard 7/10

WillHeld
05eb1df2mo ago

Upload data shard 6/10

WillHeld
25287702mo ago

Upload data shard 5/10

WillHeld
bf26a3c2mo ago

Upload data shard 4/10

WillHeld
cec32332mo ago

Upload data shard 3/10

WillHeld
efe21102mo ago

Upload data shard 2/10

WillHeld
d105b512mo ago

Upload data shard 1/10

WillHeld
5c75cd52mo ago

initial commit

WillHeld