CoolFace
Modelpublic

skillsafe-ai/whisper-base

sourceHugging Faceapache-2.0updated 3d agoView on Hugging Face
0likes25downloads
Model Card

Whisper base speech-to-text (encoder + decoder, transformers.js)

Browser-ready import artifacts for automatic-speech-recognition, produced by SkillSafe's reproducible converter (`models/` in skillsafe.ai) from a pinned upstream source. Every byte here is derivable from that source plus the recipe below; nothing was edited by hand.

Provenance

Upstreamhttps://huggingface.co/onnx-community/whisper-base/tree/1846881b6b3a3024392c1eea3ad983695bc23925
Upstream SHA-256 / commit1846881b6b3a3024392c1eea3ad983695bc23925
Reciperecipes/whisper-base.yaml — sha256 7b6e7e83a7b4704bb97d2b8d671f9a39ee5f88dbe43b96d47dc2ceecd943f41b
ToolchainPython 3.12.13, torch 2.10.0, onnx 1.23.0, onnxruntime 1.30.0 on Darwin 25.6.0 arm64
Converted2026-09-22T20:45:00+00:00

Files

fileclasssizeSHA-256
added_tokens.jsonbundle0.03 MB9715fd2243b6f06a5858b5e32950d2853f73dd5bc201aafcf76f5082a2d8acd1
config.jsonbundle0.00 MBf4d0608f7d918166da7edb3e188de5ef1bfe70d9802e785d271fd88111e9cf4b
generation_config.jsonbundle0.00 MB61070cf8de25b1e9256e8e102ded49d8d24a8369ed36ef84fdf21549e68125a0
merges.txtbundle0.47 MB2df2990a395e35e8dfbc7511e08c12d56018d8d04691e0133e5d63b21e154dc6
normalizer.jsonbundle0.05 MBbf1c507dc8724ca9cf9903640dacfb69dae2f00edee4f21ceba106a7392f26dd
onnx/decoder_model_merged.onnxregistry (fp32)198.86 MB514903744bb1b45803ec571af99b31110491c6f77b0a154825866995fb124b73
onnx/decoder_model_merged_fp16.onnxregistry (fp16)99.88 MB2078fb08b753e3a74120e6a52446eef1b98f6152d1da43658731367a93fd71a4
onnx/decoder_model_merged_quantized.onnxregistry (q8)51.21 MBfa3ef9902734ce5ae6f9ef2bdb2ba9a6c4b5785b09f4f420ce036573dc9d090b
onnx/encoder_model.onnxregistry (fp32, q8)78.65 MBa9f3b752833b49e880dec91ee5b6d936112be7c3ea07c221024ba493439f46fe
onnx/encoder_model_fp16.onnxregistry (fp16)39.42 MBffba51b20185377c1b89362b1128148d0132de936a32b200af973da2a11a5369
preprocessor_config.jsonbundle0.00 MBa6a76d28c93edb273669eb9e0b0636a2bddbb1272c3261e47b7ca6dfdbac1b8d
special_tokens_map.jsonbundle0.00 MBe67ae3a0aaa99abcd9f187138e12db1f65c16a14761c50ef10eef2c174a7a691
tokenizer.jsonbundle2.37 MB27fc476bfe7f17299480be2273fc0608e4d5a99aba2ab5dec5374b4482d1a566
tokenizer_config.jsonbundle0.27 MB2e036e4dbacfdeb7242c7d4ec4149f4a16e86026048f94d1637e3a8ee9c6a573
vocab.jsonbundle0.99 MB50d6a919f0a0601d56a04eb583c780d18553aa388254ba3158eb6a00f13e2c1a

registry files are parameter files served from models.skillsafe.ai once vetted; bundle files ship inside an app; registry-shared is a runtime library reused by every model of the same architecture.

Verification

Imported as published upstream (no conversion). Each file is pinned by SHA-256 to its source; every ONNX file passed onnx.checker and a CPU smoke run under onnxruntime with zero-filled inputs at the declared shapes:

fileinputsoutputsms
onnx/decoder_model_merged.onnxinputids[1, 4], encoderhiddenstates[1, 1500, 512], pastkeyvalues.0.decoder.key[1, 8, 1, 64], pastkeyvalues.0.decoder.value[1, 8, 1, 64], pastkeyvalues.0.encoder.key[1, 8, 1500, 64], pastkeyvalues.0.encoder.value[1, 8, 1500, 64], pastkeyvalues.1.decoder.key[1, 8, 1, 64], pastkeyvalues.1.decoder.value[1, 8, 1, 64], pastkeyvalues.1.encoder.key[1, 8, 1500, 64], pastkeyvalues.1.encoder.value[1, 8, 1500, 64], pastkeyvalues.2.decoder.key[1, 8, 1, 64], pastkeyvalues.2.decoder.value[1, 8, 1, 64], pastkeyvalues.2.encoder.key[1, 8, 1500, 64], pastkeyvalues.2.encoder.value[1, 8, 1500, 64], pastkeyvalues.3.decoder.key[1, 8, 1, 64], pastkeyvalues.3.decoder.value[1, 8, 1, 64], pastkeyvalues.3.encoder.key[1, 8, 1500, 64], pastkeyvalues.3.encoder.value[1, 8, 1500, 64], pastkeyvalues.4.decoder.key[1, 8, 1, 64], pastkeyvalues.4.decoder.value[1, 8, 1, 64], pastkeyvalues.4.encoder.key[1, 8, 1500, 64], pastkeyvalues.4.encoder.value[1, 8, 1500, 64], pastkeyvalues.5.decoder.key[1, 8, 1, 64], pastkeyvalues.5.decoder.value[1, 8, 1, 64], pastkeyvalues.5.encoder.key[1, 8, 1500, 64], pastkeyvalues.5.encoder.value[1, 8, 1500, 64], usecache_branch[1]logits[1, 4, 51865], present.0.decoder.key[1, 8, 4, 64], present.0.decoder.value[1, 8, 4, 64], present.0.encoder.key[1, 8, 1500, 64], present.0.encoder.value[1, 8, 1500, 64], present.1.decoder.key[1, 8, 4, 64], present.1.decoder.value[1, 8, 4, 64], present.1.encoder.key[1, 8, 1500, 64], present.1.encoder.value[1, 8, 1500, 64], present.2.decoder.key[1, 8, 4, 64], present.2.decoder.value[1, 8, 4, 64], present.2.encoder.key[1, 8, 1500, 64], present.2.encoder.value[1, 8, 1500, 64], present.3.decoder.key[1, 8, 4, 64], present.3.decoder.value[1, 8, 4, 64], present.3.encoder.key[1, 8, 1500, 64], present.3.encoder.value[1, 8, 1500, 64], present.4.decoder.key[1, 8, 4, 64], present.4.decoder.value[1, 8, 4, 64], present.4.encoder.key[1, 8, 1500, 64], present.4.encoder.value[1, 8, 1500, 64], present.5.decoder.key[1, 8, 4, 64], present.5.decoder.value[1, 8, 4, 64], present.5.encoder.key[1, 8, 1500, 64], present.5.encoder.value[1, 8, 1500, 64]9.9
onnx/decoder_model_merged_fp16.onnxinputids[1, 4], encoderhiddenstates[1, 1500, 512], pastkeyvalues.0.decoder.key[1, 8, 1, 64], pastkeyvalues.0.decoder.value[1, 8, 1, 64], pastkeyvalues.0.encoder.key[1, 8, 1500, 64], pastkeyvalues.0.encoder.value[1, 8, 1500, 64], pastkeyvalues.1.decoder.key[1, 8, 1, 64], pastkeyvalues.1.decoder.value[1, 8, 1, 64], pastkeyvalues.1.encoder.key[1, 8, 1500, 64], pastkeyvalues.1.encoder.value[1, 8, 1500, 64], pastkeyvalues.2.decoder.key[1, 8, 1, 64], pastkeyvalues.2.decoder.value[1, 8, 1, 64], pastkeyvalues.2.encoder.key[1, 8, 1500, 64], pastkeyvalues.2.encoder.value[1, 8, 1500, 64], pastkeyvalues.3.decoder.key[1, 8, 1, 64], pastkeyvalues.3.decoder.value[1, 8, 1, 64], pastkeyvalues.3.encoder.key[1, 8, 1500, 64], pastkeyvalues.3.encoder.value[1, 8, 1500, 64], pastkeyvalues.4.decoder.key[1, 8, 1, 64], pastkeyvalues.4.decoder.value[1, 8, 1, 64], pastkeyvalues.4.encoder.key[1, 8, 1500, 64], pastkeyvalues.4.encoder.value[1, 8, 1500, 64], pastkeyvalues.5.decoder.key[1, 8, 1, 64], pastkeyvalues.5.decoder.value[1, 8, 1, 64], pastkeyvalues.5.encoder.key[1, 8, 1500, 64], pastkeyvalues.5.encoder.value[1, 8, 1500, 64], usecache_branch[1]logits[1, 4, 51865], present.0.decoder.key[1, 8, 4, 64], present.0.decoder.value[1, 8, 4, 64], present.0.encoder.key[1, 8, 1500, 64], present.0.encoder.value[1, 8, 1500, 64], present.1.decoder.key[1, 8, 4, 64], present.1.decoder.value[1, 8, 4, 64], present.1.encoder.key[1, 8, 1500, 64], present.1.encoder.value[1, 8, 1500, 64], present.2.decoder.key[1, 8, 4, 64], present.2.decoder.value[1, 8, 4, 64], present.2.encoder.key[1, 8, 1500, 64], present.2.encoder.value[1, 8, 1500, 64], present.3.decoder.key[1, 8, 4, 64], present.3.decoder.value[1, 8, 4, 64], present.3.encoder.key[1, 8, 1500, 64], present.3.encoder.value[1, 8, 1500, 64], present.4.decoder.key[1, 8, 4, 64], present.4.decoder.value[1, 8, 4, 64], present.4.encoder.key[1, 8, 1500, 64], present.4.encoder.value[1, 8, 1500, 64], present.5.decoder.key[1, 8, 4, 64], present.5.decoder.value[1, 8, 4, 64], present.5.encoder.key[1, 8, 1500, 64], present.5.encoder.value[1, 8, 1500, 64]18.5
onnx/decoder_model_merged_quantized.onnxinputids[1, 4], encoderhiddenstates[1, 1500, 512], pastkeyvalues.0.decoder.key[1, 8, 1, 64], pastkeyvalues.0.decoder.value[1, 8, 1, 64], pastkeyvalues.0.encoder.key[1, 8, 1500, 64], pastkeyvalues.0.encoder.value[1, 8, 1500, 64], pastkeyvalues.1.decoder.key[1, 8, 1, 64], pastkeyvalues.1.decoder.value[1, 8, 1, 64], pastkeyvalues.1.encoder.key[1, 8, 1500, 64], pastkeyvalues.1.encoder.value[1, 8, 1500, 64], pastkeyvalues.2.decoder.key[1, 8, 1, 64], pastkeyvalues.2.decoder.value[1, 8, 1, 64], pastkeyvalues.2.encoder.key[1, 8, 1500, 64], pastkeyvalues.2.encoder.value[1, 8, 1500, 64], pastkeyvalues.3.decoder.key[1, 8, 1, 64], pastkeyvalues.3.decoder.value[1, 8, 1, 64], pastkeyvalues.3.encoder.key[1, 8, 1500, 64], pastkeyvalues.3.encoder.value[1, 8, 1500, 64], pastkeyvalues.4.decoder.key[1, 8, 1, 64], pastkeyvalues.4.decoder.value[1, 8, 1, 64], pastkeyvalues.4.encoder.key[1, 8, 1500, 64], pastkeyvalues.4.encoder.value[1, 8, 1500, 64], pastkeyvalues.5.decoder.key[1, 8, 1, 64], pastkeyvalues.5.decoder.value[1, 8, 1, 64], pastkeyvalues.5.encoder.key[1, 8, 1500, 64], pastkeyvalues.5.encoder.value[1, 8, 1500, 64], usecache_branch[1]logits[1, 4, 51865], present.0.decoder.key[1, 8, 4, 64], present.0.decoder.value[1, 8, 4, 64], present.0.encoder.key[1, 8, 1500, 64], present.0.encoder.value[1, 8, 1500, 64], present.1.decoder.key[1, 8, 4, 64], present.1.decoder.value[1, 8, 4, 64], present.1.encoder.key[1, 8, 1500, 64], present.1.encoder.value[1, 8, 1500, 64], present.2.decoder.key[1, 8, 4, 64], present.2.decoder.value[1, 8, 4, 64], present.2.encoder.key[1, 8, 1500, 64], present.2.encoder.value[1, 8, 1500, 64], present.3.decoder.key[1, 8, 4, 64], present.3.decoder.value[1, 8, 4, 64], present.3.encoder.key[1, 8, 1500, 64], present.3.encoder.value[1, 8, 1500, 64], present.4.decoder.key[1, 8, 4, 64], present.4.decoder.value[1, 8, 4, 64], present.4.encoder.key[1, 8, 1500, 64], present.4.encoder.value[1, 8, 1500, 64], present.5.decoder.key[1, 8, 4, 64], present.5.decoder.value[1, 8, 4, 64], present.5.encoder.key[1, 8, 1500, 64], present.5.encoder.value[1, 8, 1500, 64]8.9
onnx/encoder_model.onnxinput_features[1, 80, 3000]lasthiddenstate[1, 1500, 512]71.7
onnx/encoder_model_fp16.onnxinput_features[1, 80, 3000]lasthiddenstate[1, 1500, 512]110.2

Use in the browser

js
import * as ort from "onnxruntime-web";
const session = await ort.InferenceSession.create("https://huggingface.co/skillsafe-ai/whisper-base/resolve/main/onnx/decoder_model_merged.onnx", { executionProviders: ["webgpu", "wasm"] });

Contract (onnx/decoder_model_merged.onnx): input input_ids int64 ['batch_size', 'decoder_sequence_length'], encoder_hidden_states float32 ['batch_size', 'encoder_sequence_length / 2', 512], past_key_values.0.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.0.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.0.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.0.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.1.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.1.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.1.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.1.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.2.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.2.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.2.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.2.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.3.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.3.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.3.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.3.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.4.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.4.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.4.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.4.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.5.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.5.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length', 64], past_key_values.5.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], past_key_values.5.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], use_cache_branch bool [1] → output logits float32 ['batch_size', 'decoder_sequence_length', 51865], present.0.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.0.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.0.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.0.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.1.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.1.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.1.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.1.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.2.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.2.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.2.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.2.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.3.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.3.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.3.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.3.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.4.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.4.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.4.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.4.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.5.decoder.key float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.5.decoder.value float32 ['batch_size', 8, 'past_decoder_sequence_length + 1', 64], present.5.encoder.key float32 ['batch_size', 8, 'encoder_sequence_length_out', 64], present.5.encoder.value float32 ['batch_size', 8, 'encoder_sequence_length_out', 64]. Opset 14.

Licence and attribution

Whisper base: Copyright 2022 OpenAI, Apache License 2.0 (https://github.com/openai/whisper); ONNX export by onnx-community (https://huggingface.co/onnx-community/whisper-base).

Licence: Apache-2.0 — notice: https://github.com/openai/whisper/blob/main/LICENSE. The conversion recipe and this model card are part of the SkillSafe repository and carry its licence; the weights remain under the upstream licence above.

The full manifest.json in this repo records the recipe, sources, toolchain (including the uv.lock hash) and per-file verification numbers.