encoders ¶
Classes¶
fastvideo.configs.models.encoders.LingBotVideoQwen3VLTextConfig dataclass ¶
LingBotVideoQwen3VLTextConfig(arch_config: TextEncoderArchConfig = LingBotVideoQwen3VLTextArchConfig(), prefix: str = 'language_model', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = False, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
fastvideo.configs.models.encoders.MiniMaxH3Qwen3VLArchConfig dataclass ¶
MiniMaxH3Qwen3VLArchConfig(stacked_params_mapping: list[tuple[str, str, str | int]] = list(), architectures: list[str] = (lambda: ['MiniMaxH3Qwen3VLConditioner'])(), _supported_attention_backends: tuple[AttentionBackendEnum, ...] = (FLASH_ATTN, TORCH_SDPA), output_hidden_states: bool = False, use_return_dict: bool = True, vocab_size: int = 151936, hidden_size: int = 5120, num_hidden_layers: int = 64, num_attention_heads: int = 64, pad_token_id: int | None = None, eos_token_id: int = 151645, text_len: int = 1024, hidden_state_skip_layer: int = 0, decoder_start_token_id: int = 0, output_past: bool = True, scalable_attention: bool = True, tie_word_embeddings: bool = False, tokenizer_kwargs: dict[str, Any] = dict(), _fsdp_shard_conditions: list = (lambda: [_is_language_transformer_layer, _is_vision_transformer_layer, _is_embeddings, _is_vision_merger, _is_final_norm])(), require_processor: bool = False, intermediate_size: int = 25600, output_hidden_state_index: int = 50, num_hidden_layers_override: int | None = 50, num_key_value_heads: int = 8, head_dim: int = 128, hidden_act: str = 'silu', max_position_embeddings: int = 262144, initializer_range: float = 0.02, rms_norm_eps: float = 1e-06, use_cache: bool = True, attention_bias: bool = False, attention_dropout: float = 0.0, rope_theta: float = 5000000.0, rope_scaling: dict[str, Any] | None = (lambda: {'mrope_interleaved': True, 'mrope_section': [24, 20, 20], 'rope_type': 'default'})(), mrope_interleaved: bool = True, mrope_section: tuple[int, int, int] = (24, 20, 20), bos_token_id: int = 151643, vision_start_token_id: int = 151652, vision_end_token_id: int = 151653, image_token_id: int = 151655, video_token_id: int = 151656, vision_depth: int = 27, vision_hidden_size: int = 1152, vision_hidden_act: str = 'gelu_pytorch_tanh', vision_intermediate_size: int = 4304, vision_num_heads: int = 16, vision_in_channels: int = 3, vision_patch_size: int = 16, vision_spatial_merge_size: int = 2, vision_temporal_patch_size: int = 2, vision_out_hidden_size: int = 5120, vision_num_position_embeddings: int = 2304, vision_initializer_range: float = 0.02, vision_deepstack_visual_indexes: tuple[int, ...] = (8, 16, 24))
Bases: TextEncoderArchConfig
Architecture of the Qwen3-VL encoder used by MiniMax H3.
fastvideo.configs.models.encoders.MiniMaxH3Qwen3VLConfig dataclass ¶
MiniMaxH3Qwen3VLConfig(arch_config: TextEncoderArchConfig = MiniMaxH3Qwen3VLArchConfig(), prefix: str = 'minimax_h3_qwen3_vl', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = False, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
Bases: TextEncoderConfig
FastVideo loader config for H3's base Qwen3-VL encoder.
fastvideo.configs.models.encoders.Mistral3TextConfig dataclass ¶
Mistral3TextConfig(arch_config: TextEncoderArchConfig = Mistral3TextArchConfig(), prefix: str = 'mistral3', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = True, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
Bases: TextEncoderConfig
Top-level config for the Mistral3 full Flux2 text encoder.
fastvideo.configs.models.encoders.Qwen3TextConfig dataclass ¶
Qwen3TextConfig(arch_config: TextEncoderArchConfig = Qwen3TextArchConfig(), prefix: str = 'qwen3', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = True, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
Bases: TextEncoderConfig
Top-level config for Qwen3 text encoder.
fastvideo.configs.models.encoders.Reason1ArchConfig dataclass ¶
Reason1ArchConfig(stacked_params_mapping: list[tuple[str, str, str]] = list(), architectures: list[str] = (lambda: ['Qwen2_5_VLForConditionalGeneration'])(), _supported_attention_backends: tuple[AttentionBackendEnum, ...] = (FLASH_ATTN, TORCH_SDPA), output_hidden_states: bool = True, use_return_dict: bool = True, vocab_size: int = 152064, hidden_size: int = 3584, num_hidden_layers: int = 28, num_attention_heads: int = 28, pad_token_id: int = 151643, eos_token_id: int = 151645, text_len: int = 512, hidden_state_skip_layer: int = 0, decoder_start_token_id: int = 0, output_past: bool = True, scalable_attention: bool = True, tie_word_embeddings: bool = False, tokenizer_kwargs: dict[str, Any] = dict(), _fsdp_shard_conditions: list = (lambda: [_is_transformer_layer, _is_embeddings, _is_final_norm])(), require_processor: bool = False, model_type: str = 'qwen2_5_vl', num_key_value_heads: int = 4, intermediate_size: int = 18944, bos_token_id: int = 151643, image_token_id: int = 151655, video_token_id: int = 151656, vision_token_id: int = 151654, vision_start_token_id: int = 151652, vision_end_token_id: int = 151653, vision_config: dict[str, Any] | None = None, rope_theta: float = 1000000.0, rope_scaling: dict[str, Any] | None = (lambda: {'type': 'mrope', 'mrope_section': [16, 24, 24]})(), max_position_embeddings: int = 128000, max_window_layers: int = 28, embedding_concat_strategy: str = 'mean_pooling', n_layers_per_group: int = 5, num_embedding_padding_tokens: int = 512, attention_dropout: float = 0.0, hidden_act: str = 'silu', initializer_range: float = 0.02, rms_norm_eps: float = 1e-06, use_sliding_window: bool = False, sliding_window: int = 32768, use_cache: bool = False, torch_dtype: str = 'bfloat16', _attn_implementation: str = 'flash_attention_2')
Bases: TextEncoderArchConfig
Architecture settings (defaults match Qwen2.5-VL-7B-Instruct).
fastvideo.configs.models.encoders.Reason1Config dataclass ¶
Reason1Config(arch_config: Reason1ArchConfig = Reason1ArchConfig(), prefix: str = '', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = False, treat_empty_as_dot: bool = False, tokenizer_type: str = 'Qwen/Qwen2.5-VL-7B-Instruct', *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
Bases: TextEncoderConfig
Reason1 text encoder config.
fastvideo.configs.models.encoders.SiglipVisionConfig dataclass ¶
SiglipVisionConfig(arch_config: ImageEncoderArchConfig = SiglipVisionArchConfig(), prefix: str = 'siglip', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, num_hidden_layers_override: int | None = None, require_post_norm: bool | None = None, enable_scale: bool = True, is_causal: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None)
Bases: ImageEncoderConfig
Configuration for SigLIP vision encoder.
fastvideo.configs.models.encoders.T5LargeConfig dataclass ¶
T5LargeConfig(arch_config: TextEncoderArchConfig = T5LargeArchConfig(), prefix: str = 't5', quant_config: QuantizationConfig | None = None, lora_config: Any | None = None, is_chat_model: bool = False, treat_empty_as_dot: bool = False, *, _resolved_attention_backend: AttentionBackendEnum | None = None, chat_template_enable_thinking: bool = False)
Bases: TextEncoderConfig
T5 Large configuration for your specific model.