Alphabet旗下谷歌DeepMind的前沿大模型Gemini 4,正靠一串化学元素代号完成内部迭代。已官宣的旗舰叫Argon,此前陪跑的Barium-B被它顶替,刚进入内部编程平台Jetski的新版本代号Carbon。据Business Insider获取的内部文件与聊天记录,有员工在内部频道留言“Carbon is really good”,另一位评价更直白:编程任务上的手感已接近Anthropic的Claude Opus 5.5。
希鸥网观察到,这套模型要解决的是软件工程场景里的多步骤推理与Agent工作流效率问题,但它面向免费用户的门正在收窄。据The Verge报道,10月9日起,免费档位只能使用Flash Lite,想用标准Flash得掏每月4.99美元的Google AI Plus,Pro与Deep Think则要19.99美元的AI Pro甚至99.99美元的Ultra。性能往上走,菜单价格也往上走。
代号与发布名不对应,是这次泄露里最容易被忽略的细节。Barium-B没成为Barium,而是改名Argon上桌。这说明谷歌内部同时跑着多个候选版本,谁在评测中胜出谁就拿走发布名额。这种赛马机制在DeepMind并入谷歌后愈发明显:算力预算有限,团队只能用内部PK决定资源投向,而不是靠职级拍板。
谷歌的焦虑藏在一组分裂的分数里。Argon在DeepSWE v1.1上拿到77.9%,高于官方列出的Opus 5.5的74.2%;换到Terminal-Bench 4.0,它只有57.4%,对手是66.4%。前一项考的是代码生成,后一项考的是终端里的多步操作。模型能写,却不一定能把整套工程流程跑完,这正是Agent产品最烧钱的地方。
订阅分层的调整,实质是把推理成本转嫁给重度用户。免费用户切模型看似贴心,每一次Pro调用都在消耗谷歌的GPU账本。砍到只剩Flash Lite,等于把免费档从“体验旗舰”降级为“引流样品”。开发者的心理也在迁移:过去比谁便宜,现在比谁能在长任务里不崩,愿意为稳定性付月费的人变多了。
希鸥网认为,这场泄露真正暴露的是前沿模型竞争的重心转移。基准分数的领先窗口越来越短,谷歌拿77.9%压住Anthropic,转头就在终端任务上被反超10个百分点。谁获益?把模型嵌进付费工作流的厂商。谁受损?靠免费额度做增长的开发者工具。当Flash Lite成为唯一免费入口,靠薅免费API做产品的团队得重新算账。
放回创业语境,谷歌让Argon、Barium、Carbon同台竞争,就像给技术路线装了一个分歧解决器:不靠谁嗓门大,靠评测数据说话。创始人常犯的错是让最强势的合伙人拍板架构,结果方向错了没人敢纠正。把关键分歧交给明确的评估规则,而不是交给职级,才能避免人微言轻的工程师被权势压住。
研发节奏也是同理。谷歌内部每天在Jetski上跑新版本,员工用几分钟反馈一次体验,这种高频更新比季度复盘有用得多。团队该做的,是把流程图摊开:每个岗位、每项职责、每个环节通向什么结果一目了然,需要时能下钻到具体某个人的产出。管理者若只看到一张漂亮的架构图,却点不进去任何细节,那就是自嗨。
但度量本身也有陷阱。DeepSWE和Terminal-Bench给同一款模型打出相反结论,说明单一指标会骗人。创业公司选型时,别只看榜单名次,要按自己的真实任务搭一组组合指标:延迟、单次调用成本、长任务成功率、人工返工率。无法计量的事管不好,可计量错了方向,团队只会更快地跑偏。
金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo