Skip to content

minimax_h3_qwen3_vl

Qwen3-VL conditioner configuration for MiniMax H3.

Classes

fastvideo.configs.models.encoders.minimax_h3_qwen3_vl.MiniMaxH3Qwen3VLArchConfig dataclass

MiniMaxH3Qwen3VLArchConfig(stacked_params_mapping: list[tuple[str, str, str | int]] = list(), architectures: list[str] = (lambda: ['MiniMaxH3Qwen3VLConditioner'])(), _supported_attention_backends: tuple[AttentionBackendEnum, ...] = (FLASH_ATTN, TORCH_SDPA), output_hidden_states: bool = False, use_return_dict: bool = True, vocab_size: int = 151936, hidden_size: int = 5120, num_hidden_layers: int = 64, num_attention_heads: int = 64, pad_token_id: int | None = None, eos_token_id: int = 151645, text_len: int = 1024, hidden_state_skip_layer: int = 0, decoder_start_token_id: int = 0, output_past: bool = True, scalable_attention: bool = True, tie_word_embeddings: bool = False, tokenizer_kwargs: dict[str, Any] = dict(), _fsdp_shard_conditions: list = (lambda: [_is_language_transformer_layer, _is_vision_transformer_layer, _is_embeddings, _is_vision_merger, _is_final_norm])(), require_processor: bool = False, intermediate_size: int = 25600, output_hidden_state_index: int = 50, num_hidden_layers_override: int | None = 50, num_key_value_heads: int = 8, head_dim: int = 128, hidden_act: str = 'silu', max_position_embeddings: int = 262144, initializer_range: float = 0.02, rms_norm_eps: float = 1e-06, use_cache: bool = True, attention_bias: bool = False, attention_dropout: float = 0.0, rope_theta: float = 5000000.0, rope_scaling: dict[str, Any] | None = (lambda: {'mrope_interleaved': True, 'mrope_section': [24, 20, 20], 'rope_type': 'default'})(), mrope_interleaved: bool = True, mrope_section: tuple[int, int, int] = (24, 20, 20), bos_token_id: int = 151643, vision_start_token_id: int = 151652, vision_end_token_id: int = 151653, image_token_id: int = 151655, video_token_id: int = 151656, vision_depth: int = 27, vision_hidden_size: int = 1152, vision_hidden_act: str = 'gelu_pytorch_tanh', vision_intermediate_size: int = 4304, vision_num_heads: int = 16, vision_in_channels: int = 3, vision_patch_size: int = 16, vision_spatial_merge_size: int = 2, vision_temporal_patch_size: int = 2, vision_out_hidden_size: int = 5120, vision_num_position_embeddings: int = 2304, vision_initializer_range: float = 0.02, vision_deepstack_visual_indexes: tuple[int, ...] = (8, 16, 24))

Bases: TextEncoderArchConfig

Architecture of the Qwen3-VL encoder used by MiniMax H3.

fastvideo.configs.models.encoders.minimax_h3_qwen3_vl.MiniMaxH3Qwen3VLConfig dataclass

MiniMaxH3Qwen3VLConfig(arch_config: TextEncoderArchConfig = MiniMaxH3Qwen3VLArchConfig(), prefix: str = 'minimax_h3_qwen3_vl', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = False, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)

Bases: TextEncoderConfig

FastVideo loader config for H3's base Qwen3-VL encoder.