clip ¶
Minimal implementation of CLIPVisionModel intended to be only used within a vision language model.
Classes¶
fastvideo.models.encoders.clip.CLIPAttention ¶
CLIPAttention(config: CLIPVisionConfig | CLIPTextConfig, quant_config: QuantizationConfig | None = None, prefix: str = '')
Bases: Module
Multi-headed attention from 'Attention Is All You Need' paper
Source code in fastvideo/models/encoders/clip.py
Methods:¶
fastvideo.models.encoders.clip.CLIPAttention.forward ¶
Input shape: Batch x Time x Channel
Source code in fastvideo/models/encoders/clip.py
fastvideo.models.encoders.clip.CLIPEncoder ¶
CLIPEncoder(config: CLIPVisionConfig | CLIPTextConfig, quant_config: QuantizationConfig | None = None, num_hidden_layers_override: int | None = None, prefix: str = '')
Bases: Module
Transformer encoder consisting of config.num_hidden_layers self attention layers. Each layer is a [CLIPEncoderLayer].
Parameters:
| Name | Type | Description | Default |
|---|---|---|---|
config | CLIPVisionConfig | CLIPTextConfig | CLIPConfig | required |
Source code in fastvideo/models/encoders/clip.py
fastvideo.models.encoders.clip.CLIPTextTransformer ¶
CLIPTextTransformer(config: CLIPTextConfig, quant_config: QuantizationConfig | None = None, num_hidden_layers_override: int | None = None, prefix: str = '')
Bases: Module
Source code in fastvideo/models/encoders/clip.py
Methods:¶
fastvideo.models.encoders.clip.CLIPTextTransformer.forward ¶
forward(input_ids: Tensor | None, position_ids: Tensor | None = None, attention_mask: Tensor | None = None, inputs_embeds: Tensor | None = None, output_hidden_states: bool | None = None) -> BaseEncoderOutput
Returns: