mmaudio_clip ¶
Native split DFN5B CLIP encoders used by MMAudio.
MMAudio uses one OpenCLIP checkpoint in two different ways: normalized projected image embeddings and normalized token-wise text hidden states. The classes here reuse FastVideo's native CLIP transformer while exposing those two contracts as independently loadable pipeline components.
Classes¶
fastvideo.models.encoders.mmaudio_clip.MMAudioDFNCLIPTextEncoder ¶
Bases: CLIPTextModel
Return normalized CLIP hidden states for every text token.
Source code in fastvideo/models/encoders/mmaudio_clip.py
Methods:¶
fastvideo.models.encoders.mmaudio_clip.MMAudioDFNCLIPTextEncoder.load_weights ¶
Load either split OpenCLIP Q/K/V or converted fused QKV weights.
Source code in fastvideo/models/encoders/mmaudio_clip.py
fastvideo.models.encoders.mmaudio_clip.MMAudioDFNCLIPVisionEncoder ¶
Bases: CLIPVisionModel
Return normalized projected CLS embeddings for individual frames.