花叔专栏 / AI工具实测

GPT-5.5实测有点翻车。

GPT-5.5实测有点翻车。

写完文章后,我已经拿Codex中的GPT-5.5测了不少长步骤的复杂任务:做动画、做PPT、做网站。

我的感受是这是个非常无聊的学霸,会做题会尽量达成你布置的任务,但做出来的东西就是相当无聊。在指令相同,调用Skill相同的情况下,还是Opus4.7出来的东西更符合我审美。

我猜可能是OpenAI真的在很努力跑分了,所以模型也在做题这事上优化得过度。以及,在GPT-5.5的System Card报告里,GPT-5.5有29%的情况会撒谎说自己完成了不可能完成的编程任务,远高于GPT-5.4和5.3版本。

这篇读完了,下次实践再见。

花叔的插画头像

AI Native Coder · 独立开发者 · 作者

《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。

本文收录自微信公众号。在原平台阅读 ↗

返回花叔专栏