锐意创新 · 敏锐洞察 · 锐不可当

一只鹈鹕骑自行车,为何成了GPT-6“降智”的体温计

深夜上线的“鹈鹕杯”比赛,没做任何宣传,就收到近一百份投稿。9月14日上午,比赛页面的PV冲到7000多。参赛者只做一件事:让GPT-6 Astra用SVG画一只骑自行车的鹈鹕。这个看似荒诞的测试,正在成为开发者判断模型是否“降智”的体感温度计。

希鸥网观察到,开源项目CodexRadar发起人Lambda最初只想解决自己的问题:模型今天到底有没有变笨,会不会影响工作质量。他把监测工具做成社区众测项目后,迅速吸引超过500名志愿者,累计贡献百亿级Token。一个为监测“模型智商”而生的工具,能聚集如此多重度用户,说明能力波动已从个体抱怨变成群体痛点。

用户对“降智”的敏感,源于Agent工作流的链式放大效应。一位大模型算法工程师描述得很具体:GPT-6降智叠加限流,自动化任务会积累,最终出现并发冲突。工单会话如果降智,错误可能通过中枢传播,把整个仓库搞坏。一次调用只是任务链的一环,某一步判断偏差,后续步骤会沿着错误结果继续推进。任务越长,风险越不可逆。

从成本结构看,Astra最受欢迎的能力恰好最烧算力。Computer Use需要持续理解屏幕、执行操作、观察结果;多Agent工作流同时启动多个子任务;Coding Agent一次完整任务要反复读取文件、执行代码、运行测试。其API标准价格为每百万输入Token 10美元、输出Token 50美元,Fast mode价格再翻一倍。9月10日,OpenAI暂停了每月200美元的Pro 20x套餐新订阅,供给压力已有明确信号。

用户感受到的“变笨”,未必是模型权重变化。底层模型、推理强度、上下文管理、Harness、工具调用、模型路由、并发调度,每一层都会影响最终效果。一个Coding Agent原来主动跑三轮测试,现在只跑一轮;原来调用多个子Agent检查,现在减少并行探索。对后台是不同问题,对用户只是一个体感:怎么没以前聪明了。

希鸥网认为,这轮“降智”讨论混合了模型质量波动、限流、资源调度和长任务对系统稳定性的放大。过去大模型竞争集中在谁能训练出更强的模型,现在训练出来之后能不能稳定地把智能供应给大量用户,正在成为竞争的新分水岭。模型公司的战场从峰值能力延伸到另一层:把高水平智能长期、稳定、规模化地供应出去。谁能先做到,谁就能在Agent时代拿到企业级订单的入场券。

创业早期打开市场时,有人做过免费试用,结果客户不重视、不反馈、甚至不打开产品。后来改成象征性收费,哪怕只收一块钱,付费客户的参与度、反馈质量和续费率都远高于免费用户。这个逻辑放在模型服务上同样成立:当用户为Pro 20x套餐付出真金白银,他们对“降智”的容忍度会急剧下降。付费动作本身就是筛选器,筛选出真实需求,也筛选出对服务质量的硬约束。

合同条款的模糊会让人在催款时付出代价,模型服务协议同样如此。如果“智力SLA”不写清楚任务成功率、长任务稳定性、同一workflow的持续复现能力,用户遇到降智只能靠鹈鹕视频维权。把催款视为销售闭环的关键环节,对应到模型服务,就是把稳定性指标写入服务等级协议,并建立标准化的异常反馈和补偿流程。这不是苛求,是维护商业尊严和现金流安全的正当动作。

当足够多的客户认可你、足够多的案例证明你、足够长的时间检验你,销售就变成筛选而不是推销。模型厂商的终极目标也是如此:当稳定供应智能的能力被开发者社区反复验证,当CodexRadar这类第三方雷达持续给出可信数据,用户的选择就不再依赖发布会上的跑分,而是依赖日复一日的实际表现。把产品做好、把服务做透、把口碑做硬,市场会反过来追着你跑。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。如需修改或发布文章,请加微信号:sheisceo

阅读量:1331
阅读时间:4分钟