Skip to content

minimax_h3

Architecture configuration for the MiniMax H3 joint audio-video DiT.

Classes

fastvideo.configs.models.dits.minimax_h3.MiniMaxH3ArchConfig dataclass

MiniMaxH3ArchConfig(stacked_params_mapping: list[tuple[str, str, str]] = list(), _fsdp_shard_conditions: list = (lambda: [_is_minimax_h3_block])(), _compile_conditions: list = list(), param_names_mapping: dict = (lambda: {'^time_embedder\\.linear_1\\.(.*)$': 'time_embedder.fc_in.\\1', '^time_embedder\\.linear_2\\.(.*)$': 'time_embedder.fc_out.\\1', '^(.*)\\.attn\\.to_out\\.0\\.(.*)$': '\\1.attn.to_out.\\2', '^(.*)\\.ff\\.net\\.0\\.proj\\.(.*)$': '\\1.ff.fc_in.\\2', '^(.*)\\.ff\\.net\\.2\\.(.*)$': '\\1.ff.fc_out.\\2'})(), reverse_param_names_mapping: dict = dict(), lora_param_names_mapping: dict = dict(), cast_prompt_embeds_to_dit_dtype: bool = False, _supported_attention_backends: tuple[AttentionBackendEnum, ...] = (TORCH_SDPA, FLASH_ATTN, ATTN_QAT_INFER, VIDEO_SPARSE_ATTN_H3), hidden_size: int = 5376, num_attention_heads: int = 56, num_channels_latents: int = 0, in_channels: int = 24, out_channels: int = 0, exclude_lora_layers: list[str] = list(), boundary_ratio: float | None = None, attention_head_dim: int = 128, num_layers: int = 50, num_refiner_layers: int = 2, ffn_dim: int = 14336, audio_in_channels: int = 32, patch_size: tuple[int, int, int] = (1, 2, 2), text_dim: int = 5120, freq_dim: int = 256, time_embed_hidden_dim: int = 5376, time_embed_dim: int = 2688, adaln_rank: int | None = None, rope_freq_dim: int = 16, rope_theta: float = 10000.0, norm_eps: float = 1e-05, qk_norm_eps: float = 1e-05, final_norm_eps: float = 1e-05)

Bases: DiTArchConfig

One-to-one representation of the released transformer config.

fastvideo.configs.models.dits.minimax_h3.MiniMaxH3Config dataclass

MiniMaxH3Config(arch_config: MiniMaxH3ArchConfig = MiniMaxH3ArchConfig(), prefix: str = 'minimax_h3', quant_config: QuantizationConfig | None = None, uniform_parameter_dtype: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None)

Bases: DiTConfig

FastVideo component configuration for MiniMax H3 transformers.