Agent跑一次任务,生成的指令可能只有几十个token。工具却一次性吐回几万字的搜索结果、网页、代码和执行日志。这些内容全部要进上下文,模型每一轮都得重新读一遍。轮次一多,读材料的开销就超过了干活本身。
希鸥网观察到,小米大模型团队刚发布MiMo-V2.6,核心成员罗福莉就在社交平台剧透了MiMo-V3的新架构HySparse2。这是一套面向Agent长任务场景的稀疏注意力方案。论文评估显示,在100万token上下文下,其预填充计算量约为Hybrid SWA的五分之一,KV Cache从12.09GB压到2.69GB。
问题的根子在预填充。Agent每调用一次工具,返回材料都要先过一遍全部模型层,建立KV Cache,模型才能决定下一步。轮次越多,历史越长,这笔开销越滚越大。传统做法是让每一层都从头看完整上下文,算力账单自然失控。
HySparse2的解法是把模型切成前后两段。前段是self-decoder,负责处理新输入;后段是cross-decoder,等到生成阶段再上场。两段之间用KV Bridging连接,后半段的全注意力层直接从前半段对应层的隐藏状态生成K和V。新输入走完前段,预填充就能停。
更关键的一刀砍在检索粒度上。上一代HySparse按64-token的块挑内容,块里只有少量相关也得整块占用预算。HySparse2改为按单token选择,配置是挑1024个全局token,再强制保留最近128个。消融实验里,仅这一项改动就让RULER-v2提高6.57个百分点,双线索MRCR-v2提高8.14个百分点。
希鸥网认为,这套架构真正的信号不在论文数字,而在成本结构。预填充与生成分开部署后,49层模型只需在前25层跑预填充,节点内存接近减半。对做Agent产品的团队来说,这意味着同样一张卡能扛的并发轮次可能翻倍,长任务的单位经济模型被改写了。
创业者该从中读到什么?梁宁在《真需求》里讲过,供应链能力是当代创业的核心竞争力,从果链到SHEIN,每一代赢家都是把某一段成本结构重新做了一遍。HySparse2做的就是大模型推理链路上的成本重构。Agent产品的毛利,长期不取决于你接了多少工具,而取决于你每一轮工具返回后付出的预填充成本。
材料里还有一个被忽视的点:共识要具体。模型架构里的共识,就是全注意力层和稀疏层之间的KV共享协议——哪些层看全量,哪些层复用缓存,必须在训练前谈清楚。创业同理,和客户、和伙伴的关系,本质是一系列可执行的具体共识,不是拿到伙伴名分就能天然获得资源共享。
双向成就的闭环同样适用。HySparse2没有完全撤掉全注意力,保留少量层既维持能力,又用完整注意力分数帮稀疏层挑选值得看的token。这相当于既满足长上下文效率诉求,又守住基础能力底线。创业者设计产品也该如此:既洞察客户真实需求,也清楚自身生存逻辑,只满足对方或只顾自己,模式都跑不长。
金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo