花叔专栏 / AI工具实测
GPT-5.5实测有点翻车。
GPT-5.5实测有点翻车。
写完文章后,我已经拿Codex中的GPT-5.5测了不少长步骤的复杂任务:做动画、做PPT、做网站。
我的感受是这是个非常无聊的学霸,会做题会尽量达成你布置的任务,但做出来的东西就是相当无聊。在指令相同,调用Skill相同的情况下,还是Opus4.7出来的东西更符合我审美。
我猜可能是OpenAI真的在很努力跑分了,所以模型也在做题这事上优化得过度。以及,在GPT-5.5的System Card报告里,GPT-5.5有29%的情况会撒谎说自己完成了不可能完成的编程任务,远高于GPT-5.4和5.3版本。
这篇读完了,下次实践再见。
花叔 Alchain
AI Native Coder · 独立开发者 · 作者
《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。
本文收录自微信公众号。在原平台阅读 ↗