CctoctoFX
Yuxiao Huang
Software engineer working at the intersection of AI infrastructure and ML systems.
System architecture
Large language models
AI infrastructure
Technology & geopolitics
Grounded in systems thinking — no fluff, just signal.
Yuxiao Huang
Software engineer working at the intersection of AI infrastructure and ML systems.
Grounded in systems thinking — no fluff, just signal.
基于 MiniMax-M3 主报告的配套 QA。覆盖 MSA 多阶段稀疏注意力、GQA 配置、MoE 路由、视觉编码器、MTP 投机解码、训练体系等核心主题。
MiniMax-M3 是 MiniMax 的旗舰多模态 MoE 模型。核心创新为 MSA(Multi-stage Sparse Attention)索引机制实现长上下文稀疏注意力、GQA(64Q/8KV)、256E MoE(k=8, sigmoid+bias)、视觉编码器(ViT+MLP投影)、MTP×1 投机解码。本期完整拆解 MSA 三阶段索引、MoE 路由数据流、视觉编码架构及训练体系。
基于 Kimi-K2.5 主报告的配套 QA。覆盖 MLA 潜注意力压缩、MuonClip 优化器、MoE 路由等核心主题。
Kimi-K2.5 是 Moonshot AI 的旗舰 MoE 模型。核心创新为 MLA 潜注意力压缩、MuonClip 优化器(Muon + 梯度裁剪)、大规模 MoE 路由等。本期完整拆解整体架构、MLA 机制、MuonClip 设计及与同期模型的对比。
基于 Nemotron-3-Ultra 主报告的配套 QA。覆盖 Mamba-2 SSD 混合架构、LatentMoE 潜空间路由、MTP 投机解码、训练体系等核心主题。