kandinsky6 ¶
Native FastVideo implementation of the Kandinsky6 T2VA/IT2VA transformer.
Kandinsky6 extends Kandinsky5's DiT (fastvideo/models/dits/kandinsky5.py) with a second, parallel "audio" tower and a fused video<->audio decoder block, so this file mirrors kandinsky5.py's structure closely for every shared piece (time/text/visual embeddings, RoPE, modulation, feed-forward, NABLA sparse attention) and only adds what's new: the audio tower and Kandinsky6FusedTransformerDecoderBlock's cross-modal attention, ported from the reference diffusers.models.transformers.transformer_kandinsky6 module.
Video and audio latents are ordinary batched tensors -- [B, T, H, W, C] for video and [B, A, D] for audio -- consistent with Kandinsky5 and the rest of FastVideo's pipeline/stage system. Kandinsky6RoPE3D.forward takes an explicit shape tuple rather than deriving T/H/W from the position tensors' lengths.
Classes¶
fastvideo.models.dits.kandinsky6.Kandinsky6Attention ¶
Kandinsky6Attention(num_channels: int, head_dim: int, supported_attention_backends: tuple[AttentionBackendEnum, ...] | None, prefix: str = '', kv_dim: int | None = None, use_nabla: bool = False, quant_config: QuantizationConfig | None = None)
Bases: Module
Self- or cross-attention. kv_dim lets K/V come from a differently-sized stream (the video<->audio cross-modal attentions).
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6FusedTransformerDecoderBlock ¶
Kandinsky6FusedTransformerDecoderBlock(model_dim: int, time_dim: int, ff_dim: int, head_dim: int, model_dim_a: int, time_dim_a: int, ff_dim_a: int, head_dim_a: int, supported_attention_backends: tuple[AttentionBackendEnum, ...] | None = None, prefix: str = '', use_nabla: bool = False, ca_rope: bool = False, cross_gates: bool = False, fix_modulation: bool = False, quant_config: QuantizationConfig | None = None)
Bases: Module
Joint video+audio decoder block: per-modality self/text-cross attention plus a dedicated bidirectional video<->audio cross-attention, all independently AdaLN-modulated. Ported from diffusers.models.transformers.transformer_kandinsky6.Kandinsky6FusedTransformerDecoderBlock.
Source code in fastvideo/models/dits/kandinsky6.py
Methods:¶
fastvideo.models.dits.kandinsky6.Kandinsky6FusedTransformerDecoderBlock.forward ¶
forward(vis: Tensor | None, aud: Tensor | None, text_v: Tensor, text_a: Tensor | None, time_embed: tuple[Tensor, Tensor | None], vis_rope: Tensor | None, aud_rope: Tensor | None, sparse_params: dict[str, Any] | None, va_gate_scale: float = 1.0, av_gate_scale: float = 1.0) -> tuple[Tensor | None, Tensor | None]
vis/aud may each be None (matches the diffusers reference's guarded Kandinsky6FusedTransformerDecoderBlock): every stage below only runs for a present modality, and the video<->audio cross-modal mixing only runs when both are present.
Source code in fastvideo/models/dits/kandinsky6.py
709 710 711 712 713 714 715 716 717 718 719 720 721 722 723 724 725 726 727 728 729 730 731 732 733 734 735 736 737 738 739 740 741 742 743 744 745 746 747 748 749 750 751 752 753 754 755 756 757 758 759 760 761 762 763 764 765 766 767 768 769 770 771 772 773 774 775 776 777 778 779 780 781 782 783 784 785 786 787 788 789 790 791 792 793 794 795 796 797 798 799 800 801 802 803 804 805 806 807 808 809 810 | |
fastvideo.models.dits.kandinsky6.Kandinsky6OutLayer ¶
Kandinsky6OutLayer(model_dim: int, time_dim: int, visual_dim: int, patch_size: tuple[int, int, int])
Bases: Module
Projects visual hidden states back to packed latent patches.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6OutLayerAudio ¶
Bases: Module
Projects audio hidden states back to audio latent channels.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6RoPE1D ¶
Kandinsky6RoPE1D(dim: int, max_pos: int = 2048, max_period: float = 10000.0, freqs_scaling: float = 1.0)
Bases: Module
1D rotary embedding for text and audio sequences.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6RoPE3D ¶
Kandinsky6RoPE3D(axes_dims: tuple[int, int, int], max_pos: tuple[int, int, int] = (128, 128, 128), max_period: float = 10000.0)
Bases: Module
3D rotary embedding for video spatial-temporal (T, H, W) tokens.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6TextEmbeddings ¶
Bases: Module
Linear + LayerNorm projection, reused for text tokens and audio latents.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6Transformer3DModel ¶
Bases: BaseDiT
Native FastVideo implementation of the Kandinsky6 T2VA/IT2VA transformer.
Source code in fastvideo/models/dits/kandinsky6.py
828 829 830 831 832 833 834 835 836 837 838 839 840 841 842 843 844 845 846 847 848 849 850 851 852 853 854 855 856 857 858 859 860 861 862 863 864 865 866 867 868 869 870 871 872 873 874 875 876 877 878 879 880 881 882 883 884 885 886 887 888 889 890 891 892 893 894 895 896 897 898 899 900 901 902 903 904 905 906 907 908 909 910 911 | |
fastvideo.models.dits.kandinsky6.Kandinsky6TransformerDecoderBlock ¶
Kandinsky6TransformerDecoderBlock(model_dim: int, time_dim: int, ff_dim: int, head_dim: int, supported_attention_backends: tuple[AttentionBackendEnum, ...] | None = None, prefix: str = '', use_nabla: bool = False, quant_config: QuantizationConfig | None = None)
Bases: Module
Self-attention + text cross-attention + feed-forward block.
Used standalone for plain (non-multimodal) T2V/I2V-parity checkpoints, and as the videoT/audioT sub-block inside Kandinsky6FusedTransformerDecoderBlock for T2VA/IT2VA.
Source code in fastvideo/models/dits/kandinsky6.py
fastvideo.models.dits.kandinsky6.Kandinsky6TransformerEncoderBlock ¶
Kandinsky6TransformerEncoderBlock(model_dim: int, time_dim: int, ff_dim: int, head_dim: int, supported_attention_backends: tuple[AttentionBackendEnum, ...] | None = None, prefix: str = '', quant_config: QuantizationConfig | None = None)
Bases: Module
Text-only self-attention + feed-forward block (video/audio text towers).