GPT-5.6一夜刷新AI智能天花板,最小模型成本暴降25倍

2026-08-14 11:25:25
来源:投资界
分享
AIME

问财摘要

1、OpenAI发布《GPT-5.6构建者指南》,GPT-5.6 Sol在ARC-AGI-3上的性能从13.3%飙到38.3%,输出Token暴降6倍。此外,在BrowseComp测试中,GPT-5.6家族里最小最便宜的Luna以84.04%性能直逼GPT-5.5,成本从33.27 美元打到1.33美元。 2、OpenAI给出了三种方式,让GPT-5.6实现更低成本部署,包括程序化工具调用、原生多智能体和提示词缓存。 3、GPT-5.6 Sol在Ultrafast模式下,最高14倍速,每秒吐出750个token。
免责声明 内容由AI生成
文章提及标的

GPT-5.6再次刷新AI智能天花板!

今天,OpenAI重磅发布《GPT-5.6构建者指南》,交出了一份亮眼的成绩单。

在ARC-AGI-3上,GPT-5.6 Sol的性能从13.3%飙到38.3%,输出Token暴降6倍。

另一边,「超小杯」Luna表现同样惊艳:

在BrowseComp测试中,它以84.04%性能直逼GPT-5.5(84.36%),更将成本从33.27 美元打到1.33美元。

此外,官方还附上了「保姆级」教程,教初创团队如何以更低成本跑GPT-5.6。

01、GPT-5.6实力大涨,输出Token砍6倍

仅一个月的时间,GPT-5.6 Sol内部悄悄完成进化。

一直以来,ARC-AGI-3是顶 尖AI还未拿下50%的最难测试,测试规则非常简单——

把AI丢进一堆没见过的2D小游戏(881275)里,不给说明书,让它自己摸索规则怎么玩。

结果,GPT-5.6 Sol在官方榜上只拿了7.8%,而GPT-5.5仅有0.4%。

就拿上一代对比来看,同一个Sol在ARC-AGI-2上考了92.5%分,还通关了《宝可梦·火红》。

为此,OpenAI两位研究员Ilan Bigio和Ted Sanders去查了原因,问题出现在harness上。

ARC官方的「通用harness」干了两件事:每走一步,就把模型的私有推理过程丢掉;上下文一满,就从最老的开始截断。

也就是说,模型每走一步,记忆就会被清空,然后再重来一遍。

于是,团队把harness换成Responses API,打开两个开关「推理保留」和「压缩」,重新跑了一遍公开题集。

没想到,GPT-5.6 Sol从13.3%飙到38.3%,且输出Token减少6倍。

02、「超小杯」Luna成本更低了

这份《建造者指南》里,最抓眼球的一组对比,来自BrowseComp。

这是OpenAI自己打造的,一个专考「能不能在全网输出冷门事实」的榜单。

三个月前,GPT-5.5开到Extra High档,拿下84.36%,总花费33.27美元。

现在,GPT-5.6家族里最小最 便宜的Luna,同样Extra High,拿下84.04%,花了1.33美元。

虽然成绩仅差0.32%,但成本砍了足足25倍。

当然了,OpenAI想要说的是——

三个月前,只有旗舰GPT才能干的活儿,现在最 低档的小模型Luna,也能做到八九不离十。

让GPT-5.6自写代码、调工具

指南中,OpenAI还给出了另外三种方式,都是让GPT-5.6实现更低成本部署。

第 一个,是程序化工(850102)具调用(Programmatic Tool Calling)。

以前的Agent像个事必躬亲的老板:每收到一份材料,都需亲自过目一遍,才能说下一步干什么——

调100次工具,就得来回100趟。

现在模型可以直接写一段JavaScript,在沙箱里把工具批量调完、筛完、汇总完,只把最后那张表拿回自己眼前。

金融研究公司Rogo的实测结果,质量打平的前提下,输入Token少用了21%。

第二个,是「原生多智能体」。

主模型当工头,把活拆给一群子模型并行去干,最后收回来汇总。

ChatGPT里那个ultra档位,本来就是这么跑的,默认四个agent同时开工。

产品公司Obvious的联创Jon Bell说,他们一口气扔了六份需求进去,边写边搭边讨论,全程没散架。

第三个,是「提示词缓存」。

缓存有效期拉长到至少30分钟,断点还能自己指定位置。

AI公司Ploy的工程师给一段29000 token的共享提示词加了断点和工作区专属键,未命中缓存的输入直接少了28%。

03、每秒750个token,加速14倍

同一天,OpenAI放出了Ultrafast模式预览版。

GPT-5.6 Sol,最高14倍速,每秒吐出750个token,先在OpenAI API上线。

这件事的分量在于,它撕掉了一条用了两年的潜规则——想要实时响应,就得退而求其次换个小模型。

现在不用了,Ultrafast跑的还是那个Sol,智能水平一点没减。

Cerebras自己做了一组对照,选的题是Humanity's Last Exam——2500道通常只有博士才答得上来的题。

Sol Ultrafast跑完全部2500题,用时11小时11分。

Claude Fable 5跑同一批题,用了78小时27分,三天多。

准确率相当,速度差了近7倍。

提分、降本、提速,短短一个月的时间,GPT-5.6完成了一次真正意义上的全方位进化。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME