luciayen/ksl-word-video-multimodal
0
KSL Word-Video Multimodal Experiments
This repository contains trained checkpoints and evaluation artifacts for Kenyan Sign Language word-level video experiments.
Included Experiments
- E1 RGB VideoMAE
- E2 RGB MViT V2 Small
- E3 Pose BiLSTM
- E4 RGB + Pose MViT V2 Small + BiLSTM late fusion
- E5 Pose TransSLR
- E6 Pose Region-Aware ST-GCN + Temporal Transformer
Files
ksl_word_video_multimodal_results.json: full machine-readable resultsksl_word_video_multimodal_results.csv: results tableksl_word_video_multimodal_results.md: markdown summarymodel_checkpoints/: trained PyTorch checkpoints
Results
KSL Word-Level Video Multimodal Results
- Dataset:
laurettekazenga/ksl-video-dataset - Classes: 30
- Split counts: {'train': 1487, 'test': 450, 'val': 300}
Results
Saved Model Checkpoints
E5_pose_transslr:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E5_pose_transslr_best.ptE6_pose_region_stgcn_transformer:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E6_pose_region_stgcn_transformer_best.ptE3_pose_bilstm:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E3_pose_bilstm_best.ptE2_rgb_mvit_v2_s:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E2_rgb_mvit_v2_s_best.ptE1_rgb_videomae:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E1_rgb_videomae_best.ptE4_rgb_pose_mvit_bilstm_late_fusion:/content/drive/MyDrive/NSL/ksl_word_video_multimodal/model_checkpoints/E4_rgb_pose_mvit_bilstm_late_fusion_best.pt
What to report in the paper
- Top-1 accuracy, Top-5 accuracy, macro-F1, and weighted-F1 on validation and test.
- Parameter count, FLOPs if available, and single-sample latency.
- Per-class classification report and confusion matrix for each model.
- Signer overlap audit and duplicate leakage audit.
- Same split, same label map, same preprocessing across all experiments.
