CoolFace
Modelpublic

luciayen/ksl-word-video-multimodal

sourceHugging Facecc-by-nc-sa-4.0updated 2mo agoView on Hugging Face
0likes
Model Card

KSL Word-Video Multimodal Experiments

This repository contains trained checkpoints and evaluation artifacts for Kenyan Sign Language word-level video experiments.

Included Experiments

  • —E1 RGB VideoMAE
  • —E2 RGB MViT V2 Small
  • —E3 Pose BiLSTM
  • —E4 RGB + Pose MViT V2 Small + BiLSTM late fusion
  • —E5 Pose TransSLR
  • —E6 Pose Region-Aware ST-GCN + Temporal Transformer

Files

  • —ksl_word_video_multimodal_results.json: full machine-readable results
  • —ksl_word_video_multimodal_results.csv: results table
  • —ksl_word_video_multimodal_results.md: markdown summary
  • —model_checkpoints/: trained PyTorch checkpoints

Results

KSL Word-Level Video Multimodal Results

  • —Dataset: laurettekazenga/ksl-video-dataset
  • —Classes: 30
  • —Split counts: {'train': 1487, 'test': 450, 'val': 300}

Results

experimentarchitecturemodalityparamsflopslatency_msval_top1val_top5val_macro_f1val_weighted_f1test_top1test_top5test_macro_f1test_weighted_f1checkpointdrive_checkpoint
E2rgbmvitv2sMViT V2 Small RGB classifierrgb3425321435.59230.580.870.557660.557660.540.9088890.5049510.504951/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E2rgbmvitv2s_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E2rgbmvitv2s_best.pt
E5posetransslrTransSLR: Linear 225-to-512 + temporal BN + 4-layer Transformer encoder + MLPpose87017261.704270.7366670.9433330.7491180.7491180.30.6088890.3214610.321461/content/kslwordvideomultimodalwork/runs/E5posetransslr_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E5posetransslr_best.pt
E4rgbposemvitbilstmlatefusionMViT V2 Small RGB encoder + BiLSTM pose encoder + late-fusion MLPfusion3759196638.68920.4733330.8533330.4510840.4510840.3266670.7866670.3181780.318178/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E4rgbposemvitbilstmlatefusion_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E4rgbposemvitbilstmlatefusion_best.pt
E3posebilstm2-layer BiLSTM over 64x225 MediaPipe landmarkspose28280623.635190.5533330.90.5423750.5423750.3044440.7622220.2993520.299352/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E3posebilstm_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E3posebilstm_best.pt
E6poseregionstgcntransformerRegion-aware body/left-hand/right-hand ST-GCN encoders + temporal Transformerpose73722223.287540.5033330.780.4343830.4343830.2377780.6266670.2141480.214148/content/kslwordvideomultimodalwork/runs/E6poseregionstgcntransformer_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E6poseregionstgcntransformer_best.pt
E1rgbvideomaeVideoMAE base fine-tuned on RGB clipsrgb8625948624.15650.3033330.6633330.2506830.2506830.2111110.5822220.1722560.172256/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E1rgbvideomae_best.pt/content/drive/MyDrive/NSL/kslwordvideomultimodal/modelcheckpoints/E1rgbvideomae_best.pt

Saved Model Checkpoints

  • —E5_pose_transslr: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E5_pose_transslr_best.pt
  • —E6_pose_region_stgcn_transformer: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E6_pose_region_stgcn_transformer_best.pt
  • —E3_pose_bilstm: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E3_pose_bilstm_best.pt
  • —E2_rgb_mvit_v2_s: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E2_rgb_mvit_v2_s_best.pt
  • —E1_rgb_videomae: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E1_rgb_videomae_best.pt
  • —E4_rgb_pose_mvit_bilstm_late_fusion: /content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E4_rgb_pose_mvit_bilstm_late_fusion_best.pt

What to report in the paper

  • —Top-1 accuracy, Top-5 accuracy, macro-F1, and weighted-F1 on validation and test.
  • —Parameter count, FLOPs if available, and single-sample latency.
  • —Per-class classification report and confusion matrix for each model.
  • —Signer overlap audit and duplicate leakage audit.
  • —Same split, same label map, same preprocessing across all experiments.