小米 MiMo UltraSpeed:单机 8 卡跑出每秒千 Token
解读小米 MiMo 与 TileRT 官方报告的单节点千 Token 推理,包括 MXFP4、QAT 与 DFlash;区分厂商测量、吞吐与真实应用延迟。
直接回答:小米官方报告 MiMo-V2.5-Pro-UltraSpeed 在特定单节点 8 GPU 配置下达到 1000+ tokens/s。这是厂商测试结果,不是本文测量,也不能与不同硬件和服务条件下的 Claude 或 GPT API 速度直接比较。
架构:MoE 让万亿参数可计算
万亿参数靠 MoE(混合专家)架构变得可算:门控网络在各层按 Token 的表示选择部分专家,每次推理只激活总参数的一小部分——规模与计算成本解耦。
三大提速技术
1. MXFP4 量化 + QAT
大模型的首要瓶颈是显存带宽:每生成一个 token 都要把权重从显存搬进计算核心,带宽争抢限制吞吐。
MXFP4 是带分块尺度的低位浮点格式,不是 4 位整数。官方方案主要量化 MoE 专家,其余模块保留原精度;节省权重带宽不意味着整体内存或解码速度按位宽等比变化。
激进 4 位量化通常掉质量,解法是 QAT(量化感知训练):训练时就模拟 4 位精度效果,让模型学会在低精度下保持表现。MoE 的路由层保持高精度,保住专家选择的准确率。
2. DFlash 块推测解码
标准自回归解码一次前向出一个 token;传统推测解码用小草稿模型猜几个 token 再让大模型一次验证。
DFlash(Block Diffusion for Flash Speculative Decoding)通过块级掩码并行预测草稿,而非逐个猜——并行度再上一个台阶。
草稿仍需主模型验证,实际接受长度随任务和配置变化,不保证每次输出固定八个 Token。
3. 模型-系统协同设计
模型设计团队与系统工程团队深度协作,在每一层同时啃延迟——不是训完模型再想办法部署快,而是从设计第一天就为推理速度塑形。
官方测量的适用边界
官方报告体现了模型与 TileRT 的协同优化,但真实应用仍包括排队、输入处理、首 Token、网络与工具往返。高生成吞吐不等于长答案瞬时完成,也不能说明推理不再是瓶颈。
部署评估要记录 GPU 型号、精度、输入输出长度、批量、接受率、峰值内存与质量;本文未复现实验,不另行确认“量级可信”。
常见问题(FAQ)
Q:普通开发者能用到这个速度吗?
A:取决于开源与 API 开放策略。技术论文与权重发布情况以小米官方渠道为准。
Q:4 位量化质量损失多少?
A:QAT 的意义正在于此——训练中适应低精度,官方基准显示质量损失控制在可接受范围;路由层保持高精度是关键细节。
Q:这个速度对 Agent 场景意味着什么?
A:Agent 每一步都要等 LLM 推理,1000 tokens/s 让多步 Agent 循环的墙钟时间大幅压缩——"思考链很长但响应很快"变得可能。
参考资料
资料核对日期:2026 年 9 月 29 日。本文基于公开文档整理,代码片段和评估方案未作独立运行或性能验证;厂商测试结果已注明来源。