mstar.model.whisper.config#
Config for Whisper encoder-decoder ASR models (large-v3 and friends).
Values are read from the HF checkpoint’s config.json +
generation_config.json so the same class serves any Whisper size.
Classes
|
- class mstar.model.whisper.config.WhisperModelConfig(d_model: 'int' = 1280, decoder_layers: 'int' = 32, decoder_attention_heads: 'int' = 20, decoder_ffn_dim: 'int' = 5120, encoder_layers: 'int' = 32, num_mel_bins: 'int' = 128, vocab_size: 'int' = 51866, max_target_positions: 'int' = 448, max_source_positions: 'int' = 1500, activation_function: 'str' = 'gelu', scale_embedding: 'bool' = False, decoder_start_token_id: 'int' = 50258, eos_token_id: 'int' = 50257, no_timestamps_token_id: 'int' = 50364, lang_to_id: 'dict[str, int]'=<factory>, task_to_id: 'dict[str, int]'=<factory>, suppress_tokens: 'list[int]' = <factory>, begin_suppress_tokens: 'list[int]' = <factory>)[source]#
Bases:
object- Parameters:
d_model (int)
decoder_layers (int)
decoder_attention_heads (int)
decoder_ffn_dim (int)
encoder_layers (int)
num_mel_bins (int)
vocab_size (int)
max_target_positions (int)
max_source_positions (int)
activation_function (str)
scale_embedding (bool)
decoder_start_token_id (int)
eos_token_id (int)
no_timestamps_token_id (int)
- decoder_prompt_ids(language='en', task='transcribe')[source]#
<|startoftranscript|><|{lang}|><|{task}|><|notimestamps|>.