transformer_lens.model_bridge.supported_architectures.glm4v module

GLM-4V / GLM-4.1V architecture adapter.

Z.ai’s GLM-4V line (Glm4vForConditionalGeneration, GLM-4.1V-9B Thinking): a GLM vision tower at model.visual (RMS-normed blocks, learned position embeddings + 2D rotary, patch merger + conv downsample) feeding a GLM-4-0414-layout text decoder at model.language_model — sandwich norms and the joint gate_up_proj MLP. Text attention uses mRoPE (three position streams), so it stays HF-native; the tower is delegated opaquely with the merger as the projector.

class transformer_lens.model_bridge.supported_architectures.glm4v.Glm4vArchitectureAdapter(cfg: Any)

Bases: ArchitectureAdapter

Architecture adapter for Glm4vForConditionalGeneration models.

__init__(cfg: Any) None

Initialize the GLM-4V architecture adapter.

component_mapping: ComponentMapping | None
required_libraries: list[str] = ['torchvision']
required_libraries_group: str = 'multimodal'
uses_split_attention: bool
weight_processing_conversions: Dict[str, ParamProcessingConversion | str] | None