mstar.model.higgs_audio.config#

Config for Higgs-Audio STT (bosonai/higgs-audio-v3-stt).

Higgs-Audio STT = Whisper-style audio encoder (“audio_tower”) + MLP projector (“audio_encoder_proj”) + dense Qwen3 text LLM. Values are read from the checkpoint’s config.json (top-level audio fields + text_config).

Classes

HiggsAudioModelConfig(hidden_size, ...)

class mstar.model.higgs_audio.config.HiggsAudioModelConfig(hidden_size: 'int' = 2048, num_hidden_layers: 'int' = 28, num_attention_heads: 'int' = 16, num_key_value_heads: 'int' = 8, head_dim: 'int' = 128, intermediate_size: 'int' = 6144, vocab_size: 'int' = 151936, rms_norm_eps: 'float' = 1e-06, rope_theta: 'float' = 1000000.0, max_position_embeddings: 'int' = 32768, audio_d_model: 'int' = 1280, audio_encoder_layers: 'int' = 32, audio_encoder_attention_heads: 'int' = 20, audio_encoder_ffn_dim: 'int' = 5120, audio_num_mel_bins: 'int' = 128, audio_max_source_positions: 'int' = 1500, projector_temporal_downsample: 'int' = 2, audio_in_token_idx: 'int' = 151672, audio_bos_token_id: 'int' = 151669, audio_eos_token_id: 'int' = 151670, im_end_token_id: 'int' = 151645, eos_token_id: 'int' = 151643, chunk_size_seconds: 'float' = 4.0, sampling_rate: 'int' = 16000, default_prompt: 'str' = 'Transcribe the speech. Output only the spoken words in lowercase with no punctuation.', stop_token_ids: 'frozenset[int]' = <factory>)[source]#

Bases: object

Parameters:
  • hidden_size (int)

  • num_hidden_layers (int)

  • num_attention_heads (int)

  • num_key_value_heads (int)

  • head_dim (int)

  • intermediate_size (int)

  • vocab_size (int)

  • rms_norm_eps (float)

  • rope_theta (float)

  • max_position_embeddings (int)

  • audio_d_model (int)

  • audio_encoder_layers (int)

  • audio_encoder_attention_heads (int)

  • audio_encoder_ffn_dim (int)

  • audio_num_mel_bins (int)

  • audio_max_source_positions (int)

  • projector_temporal_downsample (int)

  • audio_in_token_idx (int)

  • audio_bos_token_id (int)

  • audio_eos_token_id (int)

  • im_end_token_id (int)

  • eos_token_id (int)

  • chunk_size_seconds (float)

  • sampling_rate (int)

  • default_prompt (str)

  • stop_token_ids (frozenset[int])

audio_bos_token_id: int = 151669#
audio_d_model: int = 1280#
audio_encoder_attention_heads: int = 20#
audio_encoder_ffn_dim: int = 5120#
audio_encoder_layers: int = 32#
audio_eos_token_id: int = 151670#
audio_in_token_idx: int = 151672#
audio_max_source_positions: int = 1500#
audio_num_mel_bins: int = 128#
property chunk_size_samples: int#
chunk_size_seconds: float = 4.0#
default_prompt: str = 'Transcribe the speech. Output only the spoken words in lowercase with no punctuation.'#
encoder_output_length(mel_len)[source]#

Valid audio-embedding count for mel_len mel frames: conv2 (stride 2) -> avg_pool (stride 2) -> projector conv (stride 2).

Parameters:

mel_len (int)

Return type:

int

eos_token_id: int = 151643#
classmethod from_pretrained(local_dir)[source]#
Parameters:

local_dir (str | Path)

Return type:

HiggsAudioModelConfig

head_dim: int = 128#
hidden_size: int = 2048#
im_end_token_id: int = 151645#
intermediate_size: int = 6144#
max_position_embeddings: int = 32768#
num_attention_heads: int = 16#
num_hidden_layers: int = 28#
num_key_value_heads: int = 8#
projector_temporal_downsample: int = 2#
rms_norm_eps: float = 1e-06#
rope_theta: float = 1000000.0#
sampling_rate: int = 16000#
stop_token_ids: frozenset[int]#
vocab_size: int = 151936#