mstar.model.higgs_audio.config#
Config for Higgs-Audio STT (bosonai/higgs-audio-v3-stt).
Higgs-Audio STT = Whisper-style audio encoder (“audio_tower”) + MLP
projector (“audio_encoder_proj”) + dense Qwen3 text LLM. Values are read
from the checkpoint’s config.json (top-level audio fields +
text_config).
Classes
|
- class mstar.model.higgs_audio.config.HiggsAudioModelConfig(hidden_size: 'int' = 2048, num_hidden_layers: 'int' = 28, num_attention_heads: 'int' = 16, num_key_value_heads: 'int' = 8, head_dim: 'int' = 128, intermediate_size: 'int' = 6144, vocab_size: 'int' = 151936, rms_norm_eps: 'float' = 1e-06, rope_theta: 'float' = 1000000.0, max_position_embeddings: 'int' = 32768, audio_d_model: 'int' = 1280, audio_encoder_layers: 'int' = 32, audio_encoder_attention_heads: 'int' = 20, audio_encoder_ffn_dim: 'int' = 5120, audio_num_mel_bins: 'int' = 128, audio_max_source_positions: 'int' = 1500, projector_temporal_downsample: 'int' = 2, audio_in_token_idx: 'int' = 151672, audio_bos_token_id: 'int' = 151669, audio_eos_token_id: 'int' = 151670, im_end_token_id: 'int' = 151645, eos_token_id: 'int' = 151643, chunk_size_seconds: 'float' = 4.0, sampling_rate: 'int' = 16000, default_prompt: 'str' = 'Transcribe the speech. Output only the spoken words in lowercase with no punctuation.', stop_token_ids: 'frozenset[int]' = <factory>)[source]#
Bases:
object- Parameters:
hidden_size (int)
num_hidden_layers (int)
num_attention_heads (int)
num_key_value_heads (int)
head_dim (int)
intermediate_size (int)
vocab_size (int)
rms_norm_eps (float)
rope_theta (float)
max_position_embeddings (int)
audio_d_model (int)
audio_encoder_layers (int)
audio_encoder_attention_heads (int)
audio_encoder_ffn_dim (int)
audio_num_mel_bins (int)
audio_max_source_positions (int)
projector_temporal_downsample (int)
audio_in_token_idx (int)
audio_bos_token_id (int)
audio_eos_token_id (int)
im_end_token_id (int)
eos_token_id (int)
chunk_size_seconds (float)
sampling_rate (int)
default_prompt (str)
- default_prompt: str = 'Transcribe the speech. Output only the spoken words in lowercase with no punctuation.'#
- encoder_output_length(mel_len)[source]#
Valid audio-embedding count for
mel_lenmel frames: conv2 (stride 2) -> avg_pool (stride 2) -> projector conv (stride 2).