Skip to content

kandinsky5

Classes

fastvideo.configs.pipelines.kandinsky5.Kandinsky5DMDConfig dataclass

Kandinsky5DMDConfig(model_path: str = '', pipeline_config_path: str | None = None, embedded_cfg_scale: float = 6.0, flow_shift: float | None = 5.0, flow_shift_sr: float | None = None, disable_autocast: bool = False, scheduler_step_in_fp32: bool = False, is_causal: bool = False, dit_config: DiTConfig = Kandinsky5VideoConfig(), dit_precision: str = 'bf16', upsampler_config: UpsamplerConfig = UpsamplerConfig(), upsampler_precision: str = 'fp32', vae_config: VAEConfig = HunyuanVAEConfig(), vae_precision: str = 'bf16', vae_decode_precision: str | None = None, vae_tiling: bool = True, vae_sp: bool = True, image_encoder_config: EncoderConfig = EncoderConfig(), image_encoder_precision: str = 'fp32', image_encoder_configs: tuple[EncoderConfig, ...] | None = None, image_encoder_precisions: tuple[str, ...] | None = None, text_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (Reason1Config(), CLIPTextConfig()))(), text_encoder_precisions: tuple[str, ...] = (lambda: ('bf16', 'bf16'))(), preprocess_text_funcs: tuple[Callable[[str], Any], ...] = (lambda: (kandinsky5_qwen_preprocess_text, preprocess_text))(), postprocess_text_funcs: tuple[Callable[..., Any], ...] = (lambda: (kandinsky5_qwen_postprocess_text, kandinsky5_clip_postprocess_text))(), dmd_denoising_steps: list[int] | None = (lambda: [1000, 750, 500, 250])(), ti2v_task: bool = False, lucy_edit_task: bool = False, boundary_ratio: float | None = None, text_encoder_max_lengths: tuple[int, ...] = (lambda: (KANDINSKY5_PROMPT_TEMPLATE_ENCODE_START_IDX + 512, 77))())

Bases: Kandinsky5T2VConfig

Kandinsky-5.0 DMD (few-step distilled) text-to-video pipeline configuration.

Checkpoints exported by fastvideo.train.entrypoint.dcp_to_diffusers copy their base T2V checkpoint's model_index.json unchanged, so _class_name still says the base T2V pipeline and the registry (fastvideo/registry.py) cannot auto-detect a DMD export -- pass this config together with override_pipeline_cls_name="Kandinsky5DMDPipeline" explicitly to VideoGenerator.from_pretrained/from_config (see examples/train/configs/fine_tuning/kandinsky5/README.md). Without it, Kandinsky5T2VConfig's dmd_denoising_steps=None makes Kandinsky5DmdDenoisingStage raise immediately.

fastvideo.configs.pipelines.kandinsky5.Kandinsky5I2VConfig dataclass

Kandinsky5I2VConfig(model_path: str = '', pipeline_config_path: str | None = None, embedded_cfg_scale: float = 6.0, flow_shift: float | None = 5.0, flow_shift_sr: float | None = None, disable_autocast: bool = False, scheduler_step_in_fp32: bool = False, is_causal: bool = False, dit_config: DiTConfig = Kandinsky5VideoConfig(), dit_precision: str = 'bf16', upsampler_config: UpsamplerConfig = UpsamplerConfig(), upsampler_precision: str = 'fp32', vae_config: VAEConfig = HunyuanVAEConfig(), vae_precision: str = 'bf16', vae_decode_precision: str | None = None, vae_tiling: bool = True, vae_sp: bool = True, image_encoder_config: EncoderConfig = EncoderConfig(), image_encoder_precision: str = 'fp32', image_encoder_configs: tuple[EncoderConfig, ...] | None = None, image_encoder_precisions: tuple[str, ...] | None = None, text_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (Reason1Config(), CLIPTextConfig()))(), text_encoder_precisions: tuple[str, ...] = (lambda: ('bf16', 'bf16'))(), preprocess_text_funcs: tuple[Callable[[str], Any], ...] = (lambda: (kandinsky5_qwen_preprocess_text, preprocess_text))(), postprocess_text_funcs: tuple[Callable[..., Any], ...] = (lambda: (kandinsky5_qwen_postprocess_text, kandinsky5_clip_postprocess_text))(), dmd_denoising_steps: list[int] | None = None, ti2v_task: bool = False, lucy_edit_task: bool = False, boundary_ratio: float | None = None, text_encoder_max_lengths: tuple[int, ...] = (lambda: (KANDINSKY5_PROMPT_TEMPLATE_ENCODE_START_IDX + 512, 77))())

Bases: Kandinsky5T2VConfig

Kandinsky-5.0 image-to-video pipeline configuration.

fastvideo.configs.pipelines.kandinsky5.Kandinsky5T2VConfig dataclass

Kandinsky5T2VConfig(model_path: str = '', pipeline_config_path: str | None = None, embedded_cfg_scale: float = 6.0, flow_shift: float | None = 5.0, flow_shift_sr: float | None = None, disable_autocast: bool = False, scheduler_step_in_fp32: bool = False, is_causal: bool = False, dit_config: DiTConfig = Kandinsky5VideoConfig(), dit_precision: str = 'bf16', upsampler_config: UpsamplerConfig = UpsamplerConfig(), upsampler_precision: str = 'fp32', vae_config: VAEConfig = HunyuanVAEConfig(), vae_precision: str = 'bf16', vae_decode_precision: str | None = None, vae_tiling: bool = True, vae_sp: bool = True, image_encoder_config: EncoderConfig = EncoderConfig(), image_encoder_precision: str = 'fp32', image_encoder_configs: tuple[EncoderConfig, ...] | None = None, image_encoder_precisions: tuple[str, ...] | None = None, text_encoder_configs: tuple[EncoderConfig, ...] = (lambda: (Reason1Config(), CLIPTextConfig()))(), text_encoder_precisions: tuple[str, ...] = (lambda: ('bf16', 'bf16'))(), preprocess_text_funcs: tuple[Callable[[str], Any], ...] = (lambda: (kandinsky5_qwen_preprocess_text, preprocess_text))(), postprocess_text_funcs: tuple[Callable[..., Any], ...] = (lambda: (kandinsky5_qwen_postprocess_text, kandinsky5_clip_postprocess_text))(), dmd_denoising_steps: list[int] | None = None, ti2v_task: bool = False, lucy_edit_task: bool = False, boundary_ratio: float | None = None, text_encoder_max_lengths: tuple[int, ...] = (lambda: (KANDINSKY5_PROMPT_TEMPLATE_ENCODE_START_IDX + 512, 77))())

Bases: PipelineConfig

Kandinsky-5.0 Lite text-to-video pipeline configuration.