transformer_lens.model_bridge.supported_architectures.glm4v module¶
GLM-4V / GLM-4.1V architecture adapter.
Z.ai’s GLM-4V line (Glm4vForConditionalGeneration, GLM-4.1V-9B
Thinking): a GLM vision tower at model.visual (RMS-normed blocks,
learned position embeddings + 2D rotary, patch merger + conv
downsample) feeding a GLM-4-0414-layout text decoder at
model.language_model — sandwich norms and the joint gate_up_proj
MLP. Text attention uses mRoPE (three position streams), so it stays
HF-native; the tower is delegated opaquely with the merger as the
projector.
- class transformer_lens.model_bridge.supported_architectures.glm4v.Glm4vArchitectureAdapter(cfg: Any)¶
Bases:
ArchitectureAdapterArchitecture adapter for Glm4vForConditionalGeneration models.
- __init__(cfg: Any) None¶
Initialize the GLM-4V architecture adapter.
- component_mapping: ComponentMapping | None¶
- required_libraries: list[str] = ['torchvision']¶
- required_libraries_group: str = 'multimodal'¶
- uses_split_attention: bool¶
- weight_processing_conversions: Dict[str, ParamProcessingConversion | str] | None¶