小米公开MiMo-V3核心架构HySparse2,百万Token预填充算力降到五分之一

来源:互联网 时间:2026-09-28

A5站长网9月28日消息,小米MiMo大模型负责人罗福莉宣布,下一代版本MiMo-V3将搭载全新自研架构,核心技术HySparse2同步对外公开,论文已上传arXiv。HySparse2是一套混合稀疏注意力设计,专门面向长程多轮agent任务做推理效率优化,也是小米第一次把自家大模型的注意力机制摊开讲得这么细。

数据变化很直接。对比MiMo-V2.6搭载的混合SWA架构,在100万Token长度的测试场景下,HySparse2把预填充计算量降低5.02倍,也就是降到约五分之一;KV缓存占用从12.09GB缩小到2.69GB。经过轻量后训练,长上下文评测MRCR-v2与RULER-v2的平均得分比上一代HySparse分别高出11.30和19.81个百分点。

机制上,HySparse2引入了KV桥接与KV复用两级共享:交叉解码器的KV缓存全部从自解码器的隐藏状态构建,长输入的预填充在走完自解码器后即可停止,省掉后续各层的重复计算。稀疏选择从块级细化到Token级,再用强制近期Token窗口替代独立的滑动窗口分支,让局部和全局信息共用同一套缓存。

做这套优化的动机来自智能体推理的真实负载。罗福莉解释,agent每一轮执行的短操作往往返回很长的观测文本,上下文持续累加,预填充成本、KV缓存容量和长上下文检索准确率三个问题同时卡住落地。HySparse2的两级KV共享,就是冲着这个矛盾设计的。

需要留意的是,MiMo-V3模型本身尚未发布,论文里的数字来自测试环境,实际产品中的延迟和任务表现要等落地后验证。对关注国产大模型的人来说,这份披露的价值在于把推理效率的优化路径讲清楚了,做agent产品的团队可以对照着算一算自己的上下文成本账。

相关文章

A5创业网 版权所有

返回顶部