minimax_h3_audio ¶
Classes¶
fastvideo.configs.models.vaes.minimax_h3_audio.MiniMaxH3AudioVAEArchConfig dataclass ¶
MiniMaxH3AudioVAEArchConfig(stacked_params_mapping: list[tuple[str, str, str]] = list(), scaling_factor: float = 1.0, temporal_compression_ratio: int = 1, spatial_compression_ratio: int = 1, _class_name: str = 'AutoencoderKLMiniMaxH3Audio', architectures: list[str] = (lambda: ['AutoencoderKLMiniMaxH3Audio'])(), encoder_dim: int = 64, encoder_rates: tuple[int, ...] | list[int] = (2, 4, 4, 5, 5), latent_dim: int = 2048, latent_channels: int = 32, num_attention_heads: int = 8, decoder_dim: int = 1024, decoder_rates: tuple[int, ...] | list[int] = (5, 5, 2, 2, 2, 2, 2), decoder_kernel_sizes: tuple[int, ...] | list[int] = (9, 9, 4, 4, 4, 4, 4), resblock_kernel_sizes: tuple[int, ...] | list[int] = (3, 7, 11), resblock_dilation_sizes: tuple[tuple[int, ...], ...] | list[list[int]] = ((1, 3, 5), (1, 3, 5), (1, 3, 5)), sampling_rate: int = 32000, latents_mean: tuple[float, ...] | list[float] | None = None, latents_std: tuple[float, ...] | list[float] | None = None)
Bases: VAEArchConfig
Architecture of the MiniMax H3 waveform autoencoder.
fastvideo.configs.models.vaes.minimax_h3_audio.MiniMaxH3AudioVAEConfig dataclass ¶
MiniMaxH3AudioVAEConfig(arch_config: MiniMaxH3AudioVAEArchConfig = MiniMaxH3AudioVAEArchConfig(), load_encoder: bool = True, load_decoder: bool = True, tile_sample_min_height: int = 256, tile_sample_min_width: int = 256, tile_sample_min_num_frames: int = 16, tile_sample_stride_height: int = 192, tile_sample_stride_width: int = 192, tile_sample_stride_num_frames: int = 12, blend_num_frames: int = 0, use_tiling: bool = False, use_temporal_tiling: bool = False, use_parallel_tiling: bool = False, use_temporal_scaling_frames: bool = True, *, _resolved_attention_backend: AttentionBackendEnum | None = None)