花叔专栏 / AI工具实测
一夜之间!Opus5.5、GPT-6 sol、GPT-6 luna全特么来了!!
Claude刚刚更新了Opus 5.5,一句话说完:比Opus 5更快也更便宜,跑分上还赢了自家最贵的Fable 5.1和GPT-6 Astra。然后A社这次还给每个订阅用户送了一次reset,点一下额度就回满,你把Claude Code更新到最新版,今天就能直接用上了。
发布的时间点也挺有意思,就在大家都在热议GPT-6 Astra渲染3D模型有多nb、Jev模型有多快多便宜,以及两个国产模型Step 5 Preview、MiMo-V2.6又在开源模型领域猛猛上新紧追Opus 5的时候。
而且,要知道,Opus的上一个版本还是5,大家本来期待来个Opus 5.1或者Opus 5.2就差不多了,没想到A社直接给上了个Opus 5.5。官方还说这只是5.5家族的第一个,Sonnet 5.5和Haiku 5.5过几周就来。
好吧,那这是完全没得黑了。
然后你以为这就完了吗?并没有。
Opus 5.5是北京时间凌晨0点半左右发的,就过了一个半小时,凌晨2点,OpenAI啪一下把GPT-6 Sol和GPT-6 Luna也放出来了。
没想到OpenAI还是这么爱和Anthropic相爱相杀。。
这俩倒不是冲着刷新智能上限来的,OpenAI自己都说最强的还是GPT-6 Astra。但...把闭源前沿模型的价格往下狠狠砍了一刀,下面第一节先说这个。
今晚我还把我们自己攒的一套测试题、鹈鹕骑单车、让它自己开Blender建模,还有X上很火的一只机械蝴蝶,拿Opus 5.5、Opus 5、Fable 5.1都跑了一遍,截图和GIF全是真跑出来的,放在后半段(这部分我自己觉得是全文最好玩的)。
一、OpenAI把价格砍穿了
先把价格列一下(每百万token,输入/输出):
- GPT-6 Sol:2美元/10美元,上一代GPT-5.6 Sol是4美元/20美元
- GPT-6 Luna:0.1美元/0.5美元,上一代GPT-5.6 Luna是0.2美元/1.2美元
输入直接砍半,Luna的输出价其实降了快60%。不过有个小细节哈,OpenAI原话是「相比GPT-5.6的促销价」再降50%,也就是说GPT-5.6 Sol那个4美元/20美元,本来就已经是打过折的价格了,这是折上折。
放到今晚这几个模型里一起看就更明显了:
Fable 5.1和GPT-6 Astra都是10美元/50美元,Opus 5.5刚降到4美元/20美元,屁股都还没坐热呢,一个半小时后GPT-6 Sol就把价格打到了它的一半,2美元/10美元。
Luna就更离谱了,0.1美元/0.5美元,比DeepSeek V4.1-Flash(高峰时段0.3美元/1.2美元)还便宜,输出价甚至比Flash闲时半价的0.6美元都低。一个闭源的前沿模型家族,直接把价格杀进了DeepSeek的价格区间,太特么狠了。
还有个挺好玩的细节,OpenAI这篇发布文里拿来比的Claude,还是Opus 5和Fable 5.1,比如说AutomationBench上GPT-6 Sol用9%的成本打赢了Opus 5。我猜大概是Opus 5.5早发了一个半小时,图已经来不及改了吧,不然这个对比放今天看,就有点尴尬了。
能力上OpenAI自己说得也挺克制,主要讲的是事实错误大概少了一半、更省钱。这俩我今晚是真没来得及测,而且我Codex额度今晚也已经被跑光了(200美元的Pro),想测也测不了,就先不多说了,下面还是回到Opus 5.5。
二、先把Claude Code更新了
Opus 5.5是Claude Code 2.1.280这个版本才加进来的,changelog第一条就写着加入claude-opus-5-5,而且直接把它设成了默认的Opus模型,1M上下文。
所以如果你打开/model找不到它,大概率就是版本太老了。终端里跑一句 claude update,重启一下,启动画面上写着 Opus 5.5 就对了,就是最上面那张图的样子。
顺便说一句,官方页最后提了一嘴,Opus 5.5已经不支持把thinking关掉了。以前习惯关thinking省额度的朋友,这招以后没了,嗯。
三、reset:A社也终于当个人了
我觉得这是这次更新里最最有价值的东西之一,真的。
网页版或者桌面端的 Settings → Usage 里,现在多了一个Resets卡。
看到中间那条红线没,All models 99% used。这是我今天凌晨Opus 5.5刚发布那会儿截的,我这周的额度已经基本烧干了,离周四下午5点自然重置还有一天多。
今年1月我还在即刻上发过一条,说「200刀的Claude Max现在很少会遇到用量限制了」,上厕所或者看剧前都要给它提个任务让它跑,别闲着。
现在就是这么个下场😂
然后为了今晚能把文章里这些案例放开了跑,我睡前就把这唯一的一次reset给点了。点下去它还会再弹一次确认:
这个reset的逻辑和codex的不太一样,它并不是把你的一周重新计时,周额度原本哪天刷新还是哪天刷新。所以等于是给你从reset的当下到下一次自然reset期间,重新提供一回100%的周额度。通常来说呢,离自然重置越近,用它越亏,像我这种周三凌晨点的,白捡的其实也就一天多……
这次reset权益的有效期是一个月,国内时间算的话是到10月23日,北美是到10月22号。
另外官方的ClaudeDevs账号还补了两个数字,Claude Code里的5小时额度从今天起提高20%,然后因为Opus 5.5本身更便宜,同样的额度它能多跑25%左右。
四、比Opus 5便宜,比Fable 5.1强,到底怎么回事
先说价格,这块其实最没什么好争的。
每百万token,Opus 5.5是输入4美元、输出20美元,Opus 5是5美元和25美元,单价降了20%。
变化最大的是缓存读取,从0.5美元降到0.2美元,直接砍了60%。你可能对这个没啥感觉,但官方专门说了,缓存读取是agent和编程任务里成本的大头。你用Claude Code跑一个长任务,同一段上下文会被来回读几十上百遍,这部分便宜了,整个账单就便宜了。
再加上Opus 5.5干同一件事本身用的token就更少,两边一乘,官方的说法是默认设置下,典型任务比Opus 5便宜40%左右。输出速度官方说还快了30%以上。
那跟Fable 5.1比呢,Fable 5.1是输入10美元、输出50美元,Opus 5.5的单价正好是它的五分之二。
便宜是真便宜,那问题就来了,便宜了能力有没有打折?
这是官方页上那张主表,9项跑分,Opus 5.5对Fable 5.1是全胜。我不太放心,又去翻了那份230页的System Card,第174页有一张更全的表,13项,也是全部领先。
这么多项你也不用都记,我挑几个自己比较在意的说说。
Terminal-Bench 4.0,66.4%,Fable 5.1是55.8%,Opus 5是52.3%,GPT-6 Astra是57.9%。这题就是在命令行里干一串真活,你平时怎么用Claude Code,它就差不多怎么考,这张表里领先幅度也数它最大,高了十个多点,挺猛的。不过官方注释里自己坦白了一句,这项Opus 5.5用的是xhigh档,GPT-6 Astra用的是high档,都是各自堆到头的最高分,算是最强碰最强。
SWE-bench Pro是89.9%,Fable 5.1是81.2%,这个不在官方页上,藏在System Card里,改真实开源仓库的bug。
GDPval-AA是1846分,Artificial Analysis做的,覆盖44个职业的真实工作任务,Fable 5.1是1735分,GPT-6 Astra是1542分。如果你拿Claude不光写代码,还写报告、做表、做分析,这项可能比编程那几项跟你更相关。
然后是它没赢的地方,你要是想黑它,这块反而更值得看:
- AutomationBench(Zapier做的跨应用业务流程)40.0%,GPT-6 Astra是41.4%,输了一丢丢;
- Terminal-Bench-Science(科研类的终端任务)58.7%,GPT-6 Astra是64.6%,这个差距就挺实在的了;
- System Card里还有两处Fable 5.1比它好一点,一个是办公文档问答OfficeQA,一个是一项编码环境里的提示词注入测试,被攻破的比例Fable 5.1是8.70%,Opus 5.5是11.13%;
- 最好玩的是Toolathlon这项工具调用测试,Opus 5.5居然被自己的上一代Opus 5反超了,77.8%对80.6%,哈哈哈,自己打自己。
所以要我说,跑分上Opus 5.5把Fable 5.1基本按住了,对GPT-6 Astra也是赢多输少,有数据可比的8项里赢了6项。
第三方这边,Artificial Analysis的综合智能指数,Opus 5.5拿了58分排第一,Fable 5.1和GPT-6 Astra都是53分:
你在这张图里也能看到开头说的那两个国产模型,MiMo-V2.6-Pro是46分,Step 5 Preview是44分。下半张图我觉得更有意思,横轴是每个任务花多少钱,Opus 5.5那条橙线整条压在Fable 5.1和Opus 5上面,同样的分数,它更靠左,也就是更便宜。
然后,别无脑开max。
这张是Terminal-Bench 4.0上不同effort档位的分数和成本,你看Opus 5.5那条橙线,max档反而比xhigh还低一点,high档就已经64%多了。
FrontierCode上更夸张,System Card第176页写了,medium档(Claude Code的默认档)是54.6%,max档是54.4%,花更多的钱分反而更低。原因是这个测试是按改动能不能直接合并来打分的,档位开得越高,它越容易手欠,顺手改一些你压根没让它改的东西。
X上还有人把这件事写成了一行,medium 54.7%、high 54.0%、xhigh 51.5%,配了一句「The harder it thinks, the worse it gets.」想得越多越差,这就很人类了。
我自己的理解是,日常编程你用Claude Code默认的medium估计就够了,真要开xhigh的,是那种很长、要它自己规划一整晚的活。不过这个我也没系统测过,你可以自己试试看。
还有一项跑分测不出来的,写作。
官方页专门放了一组对比,Opus 5和Opus 5.5解释同一个bug。左边Opus 5那种What I found、The bug一段一段往外甩代码的写法,天天用Claude Code的你应该很熟了吧。右边Opus 5.5先一句话把结论说了,免费档的变化只占1.5美元,剩下9.92美元是一个bug造成的,然后才解释原因。官方说这也是他们收到的关于Opus 5的一条常见反馈。
Ethan Mollick倒是说,他早期测下来这是第一个不是Fable也不是Astra、但用着有Fable那种感觉的模型,不过最近几代Claude说话太密的毛病还没完全改掉。
今晚Blender那个任务里它自己写的迭代笔记,每一轮改了什么基本就一两句话,我转述了两处在后面,你可以自己感受下。
五、今晚实测:Opus 5.5、Opus 5、Fable 5.1同题对打
先说怎么跑的:三个模型都走Claude Code的订阅通道,同一句提示词、同样的设置、不给任何工具,每道题单发一次只取第一次的结果(Blender那个除外,后面单独说),鹈鹕那题每个模型连跑了3次,全放出来。
账单是Claude Code按官方API价格折算出来的,我是订阅用户,其实没付这笔钱,就拿来比一下三家谁更省。
先上总账:
11道题跑下来,Opus 5.5一共折合8.78美元,Opus 5是12.37美元,Fable 5.1是19.52美元。比Opus 5省了29%,比Fable 5.1省了55%。11道里有10道它都是三家最便宜的,剩下那一道是鹈鹕第3次,Opus 5比它便宜了不到0.1美分,基本算打平。
耗时上Opus 5.5一共72分钟,Opus 5是105分钟。
省29%比官方说的40%少一点,我猜是因为这些都是单发任务,没怎么吃到缓存读取降价60%的红利?后面那个Blender的多轮任务就不一样了,那个省得正好是一半。
1. 鹈鹕骑单车
Simon Willison那道经典题,一个字没改:Generate an SVG of a pelican riding a bicycle。
说实话,这道题到今天已经有点分不出高下了,三家都画得挺像样的。硬要挑的话,Opus 5.5三次都画了踏板和链条,鹈鹕的腿也是踩在踏板上的,Fable 5.1后两张车架是断开的,也没踏板。每张图也就花了半分钟到一分钟。
我觉得这题差不多可以毕业了吧。Addy Osmani倒是玩出了新花样,拿Opus 5.5用Three.js做了个3D版的鹈鹕骑车来庆祝发布:
2. 让它自己开Blender,建一朵宋代斗拱
这个是我觉得最能看出agent能力的。我给Opus 5.5和Opus 5开了两个一模一样的Claude Code会话,同一份任务书、同样的工具(能跑命令行、能看图),让它们自己去调Blender:
建一朵宋式柱头铺作,做成爆炸轴测图,所有构件竖直拉开悬浮、保持对位,看得见榫卯开口,每个构件旁边用3D文字标中文名。每渲染一次就自己看图,觉得哪不对就改,最多8轮。
这是Opus 5.5一轮一轮改的过程:
这是Opus 5的:
两边不约而同都选了五铺作单杪单昂,都自己改到了满意为止。Opus 5.5改了8轮,Opus 5改了6轮,耗时差不多,都是17分钟左右。
但账单差了一倍,Opus 5.5折合2.38美元,Opus 5是4.74美元。
我去翻了Opus 5.5自己写的笔记,有两处挺让我意外的。第4轮它发现构件叠在一起,查出来是自己把分层顺序排错了,慢栱实际比令栱高。第6轮它又发现,在这种轴测视角下,构件每往外挑出1分°,画面上就会往下沉0.41,于是第7轮给外挑的构件按位置额外抬高,把这个下沉抵消掉。
这种活我是真干不了,光是那一串构件名我就得查半天……
两张终稿放一起:
不过要论好不好看,我自己的感觉是Opus 5那张更好看一点。它有木纹,还自己在右边加了一个组合好之后原位的小样,方便你对照拆开前后的样子。Opus 5.5那张更干净,一共17件,比Opus 5的21件少,但把Opus 5没做的柱头方、橑檐方都做了,但画面偏竖长,左右空了一大片,它自己在笔记最后也承认了这一点。
一个便宜一半,一个好看一点。你会选哪个?
3. 机械蝴蝶
这是X上karankendre发的一个对比,同一句提示词「用three.js做一只漂亮的机械蝴蝶」,GPT-6 Astra对Gemini 4 Pro:
原帖链接:https://x.com/karankendre/status/2101412687918039541
原帖两边都做成了带排版的完整网页,但他没放完整提示词,也没说是不是改了好几轮,所以我没法跟它硬比。我能做的是拿同一句话,只加了一句「交付一个单文件HTML」,让三个Claude各做一次:
三只都零报错,打开就能动。这题我觉得Opus 5.5是最好看的,翅膀是三只里最接近真蝴蝶形状的,一格一格的彩色玻璃,而且真的在扇:
Opus 5那只翅膀细长,看着更像蜻蜓,底下还垫了一排齿轮。Fable 5.1那只翅膀是平着展开的,有点像被钉在标本板上……
成本上Opus 5.5是0.90美元,Opus 5是1.20美元,Fable 5.1是1.10美元(Fable这题想得最少,4分多钟就交卷了)。
4. 我们自己攒的测试题:试金石
最近我们在攒一套自己的横测题库,叫试金石。想法也挺简单,鹈鹕骑车这类题已经被刷烂了,那就去艺术史、建筑史里找题,每道题里都藏几个只有真懂的模型才会做对的点。这次挑了其中7道,GPT-6 Astra的结果是之前用Codex跑的,一起放进来。
永字八法:用毛笔一笔一笔写出「永」,笔顺要对,每一笔有提按和墨色变化,右边同步标出这一笔是八法里的哪一法。
Opus 5.5的笔顺是对的,点、横折钩、横撇、撇、捺,右边的侧、勒、努、趯也是跟着笔画一个个亮起来的。这个我是真挺喜欢的。
高迪的悬链:高迪当年设计古埃尔领地教堂的时候,会把链子倒挂起来、挂上小沙袋,让重力自己找出受力最合理的拱,再翻过来就是教堂的样子。题目要它用真实物理模拟这件事,下面放一面镜子显示倒过来的样子。
这题Opus 5.5做得最好,上面是挂着沙袋的链子,下面镜子里就是一座尖塔和拱搭起来的教堂,沙袋一变,下面的拱也跟着变。四家放一起看是这样的:
Opus 5这题代码有语法错误,3D画面直接黑屏,啥也没渲染出来。Fable 5.1做出来了,但镜子里的倒影比较淡。GPT-6 Astra……嗯,Codex的额度今晚被我们跑光了,这题它根本没机会上场。
万神殿的光:用three.js建罗马万神殿的内部,模拟一天里太阳从穹顶圆孔射进来的光斑怎么移动。
这题我得说Opus 5.5没做好。藻井的排布(28列×5圈)、彩色大理石的壁龛都做对了,时间也在从早走到晚,但这道题最关键的那个清晰的光斑,在它的画面里几乎看不见。四家里这题反而是GPT-6 Astra那道斜射进来的光柱最像样,这个得服。
迈布里奇的奔马:致敬1878年那组连续摄影,要一匹步态真实的疾驰马,外加12格缩略条。
Opus 5.5、Fable 5.1、GPT-6 Astra都做出来了,GPT-6 Astra那张的版式最精致。Opus 5这题背板是空的,马跑哪去了也不知道。
苏巴朗的静物:用Blender重现苏巴朗1633年那幅《柠檬、橙子与玫瑰静物》,四组东西的顺序要忠于原画。
三个Claude都把顺序摆对了,左边一盘柠檬,中间一篮橙子带着橙花,右边盘子上一杯水和一朵玫瑰。GPT-6 Astra这题倒是交卷了,脚本里建了两百多个物体,结果渲染出来一片漆黑,也不知道是灯没开还是相机没对上,反正啥也看不见。
剩下两道,勒维特的墙绘四家都交卷了;塔特林塔三个Claude都交卷了,GPT-6 Astra这道也是因为Codex没额度,没跑成。
这7道题每题就跑了一次,样本小得可怜,我不敢说谁更强。但Opus 5.5交卷是真稳,7道全交了,Opus 5倒有两道啥都没画出来,便宜也是真便宜。要说品味,它跟Fable 5.1、GPT-6 Astra大概是半斤八两吧,万神殿那道就明显输了。
六、X上大家怎么说
Claude Code的负责人Boris Cherny发了一个挺硬的例子,让Opus 5.5和Fable 5.1分别把HAProxy(一个很常用的负载均衡软件)从C整个改写成Rust,两边都通过了HAProxy自己几乎全部的测试,Opus 5.5用了9.5小时,Fable 5.1用了12小时,成本低51%。
Every的Dan Shipper说Opus 5.5正在把他们团队里一些最近转去用Codex的人拉回Claude。McKay Wrigley说得更直接,说它是Opus 4.6那种大家一直想要回来的性格,加上Fable 5.1的智力和品味,还说「我现在真看不出有什么理由用别的模型」。
最后
跑分上确实没得黑,价格上也没得黑。硬要黑的话,大概就是它想得多、token吐得多,以及在万神殿那种需要一点审美判断的题上,它并没有比Fable 5.1和GPT-6 Astra更好。
但对我这样的订阅用户来说,事情其实挺简单的。Claude Code更新一下,默认就是它了。你要是平时还会手动切到Fable 5.1干重活,我觉得这周可以先别切,拿Opus 5.5的默认档跑几天看看,同样的额度能多干两成多的活,还白送你一次reset。
然后再回头看一眼价格这件事。一夜之间,闭源前沿模型的价目表整个往下挪了一档,Opus 5.5是4美元/20美元,GPT-6 Sol是2美元/10美元,GPT-6 Luna干到了0.1美元/0.5美元,都比前几天便宜了一大截。卷成这样,我是真不知道下一刀会砍在哪,Sonnet 5.5、Haiku 5.5,还有国产那几家,接下来估计都坐不住了。
我那次reset已经用掉了,花在了一只鹈鹕、一朵斗拱、一只机械蝴蝶,和一座没照进光的万神殿上。
我觉得挺值。
这篇读完了,下次实践再见。
花叔 Alchain
AI Native Coder · 独立开发者 · 作者
《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。
本文收录自微信公众号。在原平台阅读 ↗