datasets
Training and evaluation data, with the modality, task and licence stated up front. Listed live from the Hugging Face Hub.
seamless-align-enA-jaA.tokenized.encodecseamless-align-enA-hiA.tokenized.encodecseamless-align-enA-esA.tokenized.encodecseamless-align-enA-viA.tokenized.encodecseamless-align-deA-enA.tokenized.encodecencoder-decoder-trial-stat
Encoder/decoder trial: encoder-marginal report
Dataset: G-reen/encoder-decoder-trial-stat
Rows analysed: 122,933 (every kept (encoder, decoder, source row) triple; source G-reen/cc-re-2021-filtered shard 0, 2000 rows of at most 4000 words)
Prompt file: prompts/indirect_reference_dataset_train.json (turn 0 encodes the document, turn 1 reconstructs it from the encoding alone)
Encoders: 9 (granite-4.2-30b-nvfp4 [0], Ornith-1.5-35B-A3B-NVFP4 [1], Llama-3.3-70B-Instruct-NVFP4 [2]… See the full description on the dataset page: https://huggingface.co/datasets/G-reen/encoder-decoder-trial-stat.seamless-align-enA-frA.tokenized.encodecseamless-align-enA-koA.tokenized.encodecM4-encoded-falcon-7bPrismAI_v2-encoded-gpt2encoded_drug_reviewssharegpt4o_encodedseamless-align-enA-zhA.tokenized.encodecencoder-decoder-trial-rewritten
Encoder/decoder trial: decoded texts
Turn-1 outputs: each config shard_<index> is one decoder's reconstruction of every encoder's encodings from G-reen/encoder-decoder-trial-encodings. encoder_model / decoder_model name the pair; response_0 is the encoding the decoder saw. Rows failing post-processing are in shard_<index>_trashed_data; per-run counters are in runs/.
PrismAI_v2-encoded-falcon-7bvideo_encoder_config_test_v2_4_20260612_162416This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"
],
"shape": [
6… See the full description on the dataset page: https://huggingface.co/datasets/CarolinePascal/video_encoder_config_test_v2_4_20260612_162416.MAGE-encoded-falcon-7bcs-envi-dual-encoder-60RAID_none-encoded-gpt2librispeech_encodecM4-encoded-gpt2encoder-decoder-trial-encodings
Encoder/decoder trial: encodings
Turn-0 outputs of the indirect-reference prompts: each config encoder_<index> is one model's encoding of the same 2000 rows (source_row of G-reen/cc-re-2021-filtered shard 0, at most 4000 words). prompt records the template each row was given, identically across encoders. Per-run counters are in runs/.
librispeech960-encodec1024_asr
Dataset Card for "librispeech960-encodec1024_asr"
More Information needed
encoder-decoder-trial-human-editlenscross-encoder-law
Dataset Card for "cross-encoder-law"
More Information needed
msmarco-hard-negatives-cross-encoder-ms-marco-MiniLM-L-6-v2-scoresvideo_encoder_config_test_v2_4_20260526_182249This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"
],
"shape": [
6… See the full description on the dataset page: https://huggingface.co/datasets/CarolinePascal/video_encoder_config_test_v2_4_20260526_182249.video_encoder_config_test_v2_4_20260513_153750This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"
],
"shape": [
6… See the full description on the dataset page: https://huggingface.co/datasets/CarolinePascal/video_encoder_config_test_v2_4_20260513_153750.video_encoder_config_test_v2_4_20260526_182500This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"fps": 30,
"features": {
"action": {
"dtype": "float32",
"names": [
"shoulder_pan.pos",
"shoulder_lift.pos",
"elbow_flex.pos",
"wrist_flex.pos",
"wrist_roll.pos",
"gripper.pos"
],
"shape": [
6… See the full description on the dataset page: https://huggingface.co/datasets/CarolinePascal/video_encoder_config_test_v2_4_20260526_182500.video_encoder_config_test_3This dataset was created using LeRobot.
Dataset Structure
meta/info.json:
{
"codebase_version": "v3.0",
"robot_type": "so_follower",
"total_episodes": 2,
"total_frames": 345,
"total_tasks": 1,
"chunks_size": 1000,
"data_files_size_in_mb": 100,
"video_files_size_in_mb": 200,
"fps": 30,
"splits": {
"train": "0:2"
},
"data_path": "data/chunk-{chunk_index:03d}/file-{file_index:03d}.parquet",
"video_path":… See the full description on the dataset page: https://huggingface.co/datasets/CarolinePascal/video_encoder_config_test_3.
