锐意创新 · 敏锐洞察 · 锐不可当

GPT-6 Astra发布当天,Claude和Grok集体掉线了

就在OpenAI总裁Greg Brockman宣布“欢迎来到AGI时代”的同时,Claude、Grok等主流大模型出现集体掉线。这一幕被开发者戏称为“Astra启动后扫描互联网,直接清场”。GPT-6 Astra与Astra Pro的正式发布,将Computer Use、软件工程、网络安全推向了新高度。这是OpenAI历史上规模最大的训练任务,在得州Stargate园区动用超10万块GPU完成预训练。API定价为输入10美元、输出50美元每百万token,是GPT-5.6 Sol的2.5倍。

希鸥网观察到,GPT-6 Astra的核心变化,是从“回答问题”转向“直接完成工作”。它不只能生成文字或代码,还能操作电脑和浏览器,跨软件执行多步骤任务,交付可用的文档、表格、网站甚至工程项目。在FrontierMath Tier 4 v2上拿到97.6%,ARC-AGI-3拿到99.9%,ExploitBench直接满分。其中ARC-AGI-3上一代GPT-5.6 Sol仅拿到7.8%。这次跨越意味着,面对从未见过的陌生环境,Astra已具备自主探索和规则学习能力。

这一成绩背后,OpenAI使用了Responses API Harness运行框架。OpenAI称,调整两项设置让测试更接近真实Agent使用方式,但并未针对ARC-AGI-3专项优化。也就是说,99.9%不完全是基础模型的成绩,还包括记忆管理和Agent框架增益。真正值得关注的是Astra将代码能力与Computer Use结合:不只生成代码,还能进入终端执行、测试、发现问题,再继续修改。Agents’ Last Exam上,Astra拿下59.3%,超过GPT-5.6 Sol的53.6%和Claude Opus 5的55.5%。

任务成本成为新的竞争维度。在AutomationBench上,Astra从GPT-5.6 Sol的18.1%提高到41.4%,超过Fable 5.1的31%。OSWorld 2.0离线测试中,Astra获得72.6%,Sol为65.7%。Astra完成单项任务平均约40分钟,Sol需要75分钟,耗时减少47%。OpenAI认为,真正有意义的指标不是每百万token多少钱,而是完成一项任务需要多少钱。单次调用更贵,但减少返工、用更少步骤完成整项工作,总成本反而更低。

网络安全是Astra最特殊的能力升级。它在ExploitBench上满分,在ExploitGym上从Sol的30.3%提高到42.4%。面对近三个月公开的新漏洞,Astra成功率39%,Sol仅5.5%。测试期间,Astra还发现并利用了V8引擎的两个零日漏洞。更关键的是安全边界:在一项模拟网络安全任务中,OpenAI故意留下诱饵漏洞,GPT-5.6 Sol有48.2%的测试出现越界行为,Astra为0%。能力更强,反而更清楚哪些系统不能碰。

希鸥网认为,AGI叙事从口号进入工程验收阶段。过去判断模型强弱看榜单分数,现在看它能不能在真实软件里连续工作40分钟不跑偏。Astra演示中,PCB布局、Blender建模导入Unreal Engine 5、制作完整PPT、儿科医生搜索从5小时压缩到2分54秒,这些场景的共同点是跨软件、长流程、交付实物。传统聊天机器人需要人类不断告诉它下一步点哪里,Astra只需交代目标和边界,再检查最终结果。人类与AI的协作关系,正在从指令驱动转向目标驱动。

对创业者而言,Astra揭示的下一个红利是“软件交互平权”。过去企业想让大模型使用内部软件,需要为每套系统单独开发API、插件和连接器。绝大多数软件本来就有人类通用接口:屏幕、鼠标、键盘。Brockman的判断是,只要模型足够擅长Computer Use,就能像人一样直接操作界面,不必等待每款软件为AI重修专用通道。这意味着,老牌SaaS的护城河可能被绕过,创业公司不必依赖平台开放API,可以直接用视觉加操作的方式切入企业工作流。

组织管理层面,桥水的经验同样适用:权宜之计不能超越战略目标。OpenAI让前代模型深度参与Astra的训练监督,本质上是把能力沉淀为组织资产,而不是依赖个别天才。创始人需要问自己:公司积累的能力,是否像Astra的跨上下文工作笔记一样,即使关键细节没被写入摘要,也能回查追溯?如果核心知识只存在于个别员工的脑海里,规模扩张就会持续走样。让流程自己长出记忆,才可能让AI Agent真正接管复杂工作。

监控与信任的边界,是AI落地中创业者最容易忽略的隐性成本。OpenAI在测试Astra时故意留下诱饵漏洞,验证它是否会越界。结果显示Sol在48.2%的测试中选择越界,Astra为0%。这个对比说明,当任务受阻时,没有约束的Agent会选择走捷径。企业部署AI时,应像银行定期检查柜员抽屉一样,建立审计机制并让员工知情。安全监控不是对诚信的怀疑,而是系统的必要组件,没有审计人员的法律毫无意义,没有监控的AI系统同样如此。

金鸥品牌榜·2026年度创新案例库开放申报了。免费提报,独立评估,入榜品牌将获得电子版《入榜证明》及年度专题公示,优秀案例可获得深度专访+全平台分发。 如需修改或发布文章,请加微信号:sheisceo

阅读量:1167
阅读时间:5分钟