kandinsky6 ¶
Classes¶
fastvideo.configs.pipelines.kandinsky6.Kandinsky6TI2VAConfig dataclass ¶
Kandinsky6TI2VAConfig(model_path: str = '', pipeline_config_path: str | None = None, embedded_cfg_scale: float = 6.0, flow_shift: float | None = 5.0, flow_shift_sr: float | None = None, disable_autocast: bool = False, scheduler_step_in_fp32: bool = False, is_causal: bool = False, dit_config: DiTConfig = Kandinsky6VideoAudioConfig(), dit_precision: str = 'bf16', upsampler_config: UpsamplerConfig = UpsamplerConfig(), upsampler_precision: str = 'fp32', vae_config: VAEConfig = HunyuanVAEConfig(), vae_precision: str = 'bf16', vae_decode_precision: str | None = None, vae_tiling: bool = True, vae_sp: bool = True, image_encoder_config: EncoderConfig = EncoderConfig(), image_encoder_precision: str = 'fp32', image_encoder_configs: tuple[EncoderConfig, ...] | None = None, image_encoder_precisions: tuple[str, ...] | None = None, text_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (Reason1Config(), CLIPTextConfig()))(), text_encoder_precisions: tuple[str, ...] = (lambda: ('bf16', 'bf16'))(), preprocess_text_funcs: tuple[Callable[[str], Any], ...] = (lambda: (kandinsky6_qwen_preprocess_text, preprocess_text))(), postprocess_text_funcs: tuple[Callable[..., Any], ...] = (lambda: (kandinsky6_qwen_postprocess_text, kandinsky6_clip_postprocess_text))(), dmd_denoising_steps: list[int] | None = None, ti2v_task: bool = False, lucy_edit_task: bool = False, boundary_ratio: float | None = None, audio_vae_config: ModelConfig = Kandinsky6AudioVAEConfig(), vocoder_config: ModelConfig = BigVGANV2Config(), text_encoder_max_lengths: tuple[int, ...] = (lambda: (KANDINSKY6_PROMPT_TEMPLATE_ENCODE_START_IDX + 1024, 77))(), piflow_eps: float | None = None, piflow_final_step_size_scale: float | None = None, piflow_num_policy_substeps: int | None = None, sample_fps: float = 24.0, audio_sample_rate: int = 44100, audio_downsample_factor: int = 1024)
Bases: PipelineConfig
Kandinsky6 TI2VA pipeline configuration.
One pipeline (fastvideo.pipelines.basic.kandinsky6.Kandinsky6TI2VAPipeline) serves text-to-video+audio generation with an optional conditioning image: pure text when none is supplied at generation time, image+text (called "I2VA" in the diffusers reference) when one is -- mirroring the diffusers reference, which likewise has a single Kandinsky6TI2VAPipeline class (pipeline_kandinsky6_ti2va.py) taking an optional image argument, not a separate T2VA/I2VA subclass pair. See fastvideo/pipelines/stages/kandinsky6.py's Kandinsky6ImageEncodingStage.