mstar.model.whisper.config#

Config for Whisper encoder-decoder ASR models (large-v3 and friends).

Values are read from the HF checkpoint’s config.json + generation_config.json so the same class serves any Whisper size.

Classes

WhisperModelConfig(d_model, decoder_layers, ...)

class mstar.model.whisper.config.WhisperModelConfig(d_model: 'int' = 1280, decoder_layers: 'int' = 32, decoder_attention_heads: 'int' = 20, decoder_ffn_dim: 'int' = 5120, encoder_layers: 'int' = 32, num_mel_bins: 'int' = 128, vocab_size: 'int' = 51866, max_target_positions: 'int' = 448, max_source_positions: 'int' = 1500, activation_function: 'str' = 'gelu', scale_embedding: 'bool' = False, decoder_start_token_id: 'int' = 50258, eos_token_id: 'int' = 50257, no_timestamps_token_id: 'int' = 50364, lang_to_id: 'dict[str, int]'=<factory>, task_to_id: 'dict[str, int]'=<factory>, suppress_tokens: 'list[int]' = <factory>, begin_suppress_tokens: 'list[int]' = <factory>)[source]#

Bases: object

Parameters:
  • d_model (int)

  • decoder_layers (int)

  • decoder_attention_heads (int)

  • decoder_ffn_dim (int)

  • encoder_layers (int)

  • num_mel_bins (int)

  • vocab_size (int)

  • max_target_positions (int)

  • max_source_positions (int)

  • activation_function (str)

  • scale_embedding (bool)

  • decoder_start_token_id (int)

  • eos_token_id (int)

  • no_timestamps_token_id (int)

  • lang_to_id (dict[str, int])

  • task_to_id (dict[str, int])

  • suppress_tokens (list[int])

  • begin_suppress_tokens (list[int])

activation_function: str = 'gelu'#
begin_suppress_tokens: list[int]#
d_model: int = 1280#
decoder_attention_heads: int = 20#
decoder_ffn_dim: int = 5120#
decoder_layers: int = 32#
decoder_prompt_ids(language='en', task='transcribe')[source]#

<|startoftranscript|><|{lang}|><|{task}|><|notimestamps|>.

Parameters:
Return type:

list[int]

decoder_start_token_id: int = 50258#
encoder_layers: int = 32#
eos_token_id: int = 50257#
classmethod from_pretrained(local_dir)[source]#
Parameters:

local_dir (str | Path)

Return type:

WhisperModelConfig

property head_dim: int#
lang_to_id: dict[str, int]#
max_source_positions: int = 1500#
max_target_positions: int = 448#
no_timestamps_token_id: int = 50364#
num_mel_bins: int = 128#
scale_embedding: bool = False#
suppress_tokens: list[int]#
task_to_id: dict[str, int]#
vocab_size: int = 51866#