Skip to content

mmaudio

Pipeline configuration for the native MMAudio video-to-audio port.

Classes

fastvideo.configs.pipelines.mmaudio.MMAudioV2AConfig dataclass

MMAudioV2AConfig(model_path: str = '', pipeline_config_path: str | None = None, embedded_cfg_scale: float = 6.0, flow_shift: float | None = None, flow_shift_sr: float | None = None, disable_autocast: bool = False, scheduler_step_in_fp32: bool = False, is_causal: bool = False, dit_config: DiTConfig = MMAudioTransformerConfig(), dit_precision: str = 'bf16', upsampler_config: UpsamplerConfig = UpsamplerConfig(), upsampler_precision: str = 'fp32', vae_config: VAEConfig = VAEConfig(), vae_precision: str = 'fp32', vae_decode_precision: str | None = None, vae_tiling: bool = False, vae_sp: bool = False, image_encoder_config: EncoderConfig = EncoderConfig(), image_encoder_precision: str = 'fp32', image_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (MMAudioDFNCLIPVisionConfig(), MMAudioSynchformerConfig()))(), image_encoder_precisions: tuple[str, ...] = (lambda: ('bf16', 'bf16'))(), text_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (MMAudioDFNCLIPTextConfig(),))(), text_encoder_precisions: tuple[str, ...] = (lambda: ('bf16',))(), preprocess_text_funcs: tuple[Callable[[str], str], ...] = (lambda: (preprocess_text,))(), postprocess_text_funcs: tuple[Callable[[BaseEncoderOutput], tensor], ...] = (lambda: (postprocess_text,))(), dmd_denoising_steps: list[int] | None = None, ti2v_task: bool = False, lucy_edit_task: bool = False, boundary_ratio: float | None = None, audio_decoder_config: ModelConfig = MMAudioVAEConfig(), audio_decoder_precision: str = 'bf16', vocoder_config: ModelConfig = BigVGANV2Config(), vocoder_precision: str = 'bf16', duration_s: float = 8.0, max_audio_duration_s: float | None = None, sampling_rate: int = 44100, spectrogram_frame_rate: int = 512, latent_downsample_rate: int = 2, clip_frame_rate: int = 8, sync_frame_rate: int = 25, sync_segment_size: int = 16, sync_segment_stride: int = 8, sync_downsample_rate: int = 2, clip_image_size: int = 384, sync_image_size: int = 224, clip_batch_size_multiplier: int = 40, sync_batch_size_multiplier: int = 40, num_inference_steps: int = 25, guidance_scale: float = 4.5)

Bases: PipelineConfig

MMAudio large-44k-v2 inference defaults.

The published demo moves every module to bfloat16. Keeping the same per-component precision here is important: condition features seed the complete flow trajectory, so silently encoding them in fp32 changes the generated waveform even when the transformer weights are identical.