transformer_lens.model_bridge.supported_architectures.jetmoe module¶
JetMoE architecture adapter.
MIT-IBM’s JetMoE (JetMoeForCausalLM, native in transformers): the only
open at-scale Mixture-of-Attention-heads model — attention Q and output
projections are per-expert parallel 3D tensors behind a top-k router
(experts: JetMoeMoA), with a shared fused KV projection, alongside a
conventional parallel-experts MoE MLP. Both routers are hookable; the
mixers delegate to HF (per-expert 3D projections have no uniform
reconstruction, so no fold target exists either).
- class transformer_lens.model_bridge.supported_architectures.jetmoe.JetMoeArchitectureAdapter(cfg: Any)¶
Bases:
ArchitectureAdapterArchitecture adapter for JetMoeForCausalLM models.
- __init__(cfg: Any) None¶
Initialize the JetMoE architecture adapter.
- component_mapping: ComponentMapping | None¶
- component_test_skip_suffixes: tuple = ('mlp.gate', 'attn.experts.router')¶
- setup_component_testing(hf_model: Any, bridge_model: Any = None) None¶
Delegated attention computes rotary inside HF; nothing to wire.
- supports_fold_ln = False¶
- uses_split_attention: bool¶
- weight_processing_conversions: Dict[str, ParamProcessingConversion | str] | None¶