时间轴向上生长(历史在下、新在上)· 节点纵向位置 = 该代最早成员的发行日期(evolution.RELEASES,"~" = 估计待核准)· 虚线边 = 经占位类(KimiK2Spec,库内零模型已隐去)· hover 浮起 / 点击钉住 · 其余全部派生自 llmanatomy
mistralai
deepseek-ai
moonshotai(K2 复用枝)
zai-org
Qwen
openai
moonshotai(自研线 KDA)
2024
2025
2026
DeepSeek-V2 ~2024-05
DeepSeekV2Spec
起始MLAMoE细粒度
DeepSeek-V2
MLA + MoE 的原型。后面几代都是在这上面加东西。
DeepSeek-V3(+4 同代) ~2024-12
DeepSeekV3Spec
+MTP
DeepSeek-V3 · DeepSeek-V3.1 · Kimi-K2-Instruct · Kimi-K2-Thinking · Moonlight-16B-A3B
V3 / V3.1。相对 V2 只有路由策略和规模变化,装配逻辑不变。
Kimi-K2.5(+2 同代) ~2025-12
KimiK25Spec
−MTP
Kimi-K2.5 · Kimi-K2.6 · Kimi-K2.7-Code
Kimi-K2.5 / K2.6 / K2.7 —— 语言塔仍是 DS-V3,外面套了个多模态壳子。
DeepSeek-V3.2-Exp(+1 同代) ~2025-09
DeepSeekV32Spec
+DSA-indexer
DeepSeek-V3.2 · DeepSeek-V3.2-Exp
V3.2 引入 DSA(DeepSeek Sparse Attention)—— 这是本代唯一的新原语。
DeepSeek-V4-Flash(+3 同代) ~2026-04
DeepSeekV4Spec
+Compressed Attention+hash路由+hc+残差门−MLA
DeepSeek-V4-Flash · DeepSeek-V4-Flash-NVFP4 · DeepSeek-V4-Pro · DeepSeek-V4-Pro-DSpark
V4:新 attention 形态 + 逐层 KV 压缩 + hyper-connections + hash 路由。
GLM-4.5(+4 同代) ~2025-07
Glm4MoeSpec
起始GQAMLAMTPMoE细粒度
GLM-4.5 · GLM-4.5-Air · GLM-4.6 · GLM-4.7 · GLM-4.7-Flash
GLM-4.5 / 4.5-Air / 4.6 / 4.7 —— GQA + MoE。
GLM-5(+5 同代) ~2026-01
GlmMoeDsaSpec
+DSA-indexer−GQA
GLM-5 · GLM-5.1 · GLM-5.2 · GLM-5.2-FP8 · GLM-5.2-NVFP4 · GLM-5.3
GLM-5 / 5.1 / 5.2 —— MLA + MoE + DSA。
GLM-5.3-Flash 日期缺失
Glm5NextSpec
+KDA+hc
GLM-5.3-Flash
GLM-5-Next(GLM-5.3-Flash)—— 混合注意力:KDA 线性层 + MLA/DSA 全注意力层。
gpt-oss-120b ~2025-08
GptOssSpec
起始GQAMoE细粒度滑窗
gpt-oss-120b
Kimi-Linear-48B-A3B-Instruct ~2025-10
KimiLinearSpec
起始KDAMLAMoE细粒度
Kimi-Linear-48B-A3B-Instruct
Kimi-Linear / Kimi-K3 —— KDA(Kimi Delta Attention)+ MLA 混合。
Kimi-K3 ~2026-05
KimiK3Spec
+latentMoE+残差门
Kimi-K3
Kimi-K3 —— Kimi-Linear 的架构 + 多模态壳子 + **逐层残差门**。
Mixtral-8x7B-v0.1 ~2023-12
MixtralSpec
起始GQAMoE粗粒度
Mixtral-8x7B-v0.1
Qwen2.5-72B-Instruct(+6 同代) ~2024-09
Qwen3Spec
起始GQAMoE细粒度
Qwen2.5-0.5B-Instruct · Qwen2.5-72B-Instruct · Qwen2.5-7B-Instruct · Qwen3-235B-A22B · Qwen3-32B · Qwen3-32B-FP8 · Qwen3-8B
Qwen2.5 / Qwen3 / Qwen3-MoE —— GQA + dense/MoE,最经典的形态。
Qwen3-Next-80B-A3B-Instruct ~2025-09
Qwen3NextSpec
+GDN+Gated Attention+MTP−GQA
Qwen3-Next-80B-A3B-Instruct
Qwen3-Next / Qwen3.5 / Qwen3.6 —— 线性注意力 + full attention 混合。
Qwen3.5-122B-A10B(+9 同代) ~2026-02
Qwen35Spec
零结构差异
Qwen3.5-122B-A10B · Qwen3.5-122B-A10B-NVFP4 · Qwen3.5-27B · Qwen3.5-35B-A3B · Qwen3.5-397B-A17B · Qwen3.5-4B · Qwen3.6-27B · Qwen3.6-27B-NVFP4 · Qwen3.6-35B-A3B · Qwen3.8-27B
Qwen3.5 / Qwen3.6 —— 和 Qwen3-Next 同属混合注意力这一代,但**方言全变了**。
Qwen3.8-Flash-Next ~2026-08
Qwen4ExpSpec
+DSA-indexer
Qwen3.8-Flash-Next
Qwen3.8-Flash-Next(architectures Qwen4ExpForConditionalGeneration,