花叔专栏 / AI工具实测
9项benchmark第一、35小时不停手,Qwen3.7-Max有点东西
昨天在X上刷到 Artificial Analysis 一条推文。Artificial Analysis 是国外公认的第三方大模型评测机构,给每个模型综合多项能力打出一个 Intelligence Index 分数。
Qwen3.7-Max 的 Intelligence Index 评了 56.6 分,比上一代 Qwen3.6-Max 高了将近 5 分。让我停下来看了两眼的是他们的原话:「阿里仍然落后于 OpenAI、Anthropic 和 Google,但 Qwen3.7-Max 是他们离前沿最近的一次」。
往下翻评论区,又看到有人贴了 Text Arena 的盲测榜单。Text Arena 是全球用户匿名盲测投票产生的大模型排行榜,已经有 600 万人参与投票,被视为最接近真实使用体验的口碑指标。
前五名清一色是 Anthropic、Meta、Google、OpenAI、xAI 的旗舰模型。第六名是阿里的 qwen3-7-max-preview,离第一名 Claude Opus 4.6 thinking 只差 27 分。国产模型这段时间相对靠前的一次站位。
回头查了下,阿里几天前刚发了 Qwen3.7-Max。再看官方放出来的 12 项 agent 评测,9 项第一。
看来人员的一些变化是一点没影响阿里在大模型上的投入和卷。我印象中离 Qwen3.6 发布也还没过去几天,往回翻了下,3 月 Qwen3.5、4 月 Qwen3.6、5 月 Qwen3.7,每个月 20 号准时发新版本,节奏挺稳。
以及,我从阿里的模型发布文章里看到了一些很有趣的现象,他们特意强调了Qwen3.7-Max很适合接入Claude Code、OpenClaw、Hermes Agent、Qwen Coder这些agent harness。看起来大模型的Agentic Coding的能力已经成了各个模型厂商最关注的方向了。
我跑了几个真实任务。这篇想聊清楚这事。
先说说这12项benchmark
那张表里有几个细节挺值得说。
9 项第一的项目几乎都是 agent 类:Terminal-Bench、SWE-bench Pro、SWE-bench Multilingual、MCP-Atlas、MCP-Mark、HLE、Apex 数学、IFBench 指令遵循、SuperGPQA。Opus 4.6 反超的 3 项(NL2Repo、ClawEval、CoWorkBench)都是真实 agent 协作场景,差距分别是 0.4、5.2、1.0。Anthropic 在这块还是有积累。
里面最值得拎出来说的是 IFBench 指令遵循 79.1 分,全场第一。指令遵循这件事翻译成用户视角就是:你给的 prompt 里有 5 个约束,它基本不会丢任何一个。这正是 agent 时代用户最在乎的能力之一。
最近几个月整个行业最关注的方向就两条:大模型编程能力(LM coding)和长程任务执行(Long Horizon)。Opus 4.7、GPT 5.5、DeepSeek V4,都在拼这两条线。
Qwen3.7-Max 这次拿出来的核心指标,命中的正是这两条线。前面 12 项里有一大半就是这两类。35 小时 1158 次工具调用的长程任务实验,更是直接蹦着Long Horizon的天花板取得。
我仔细理解了下他们的测试,千问团队找了一个真实 AI Infra 工程师的日常任务给模型做:在平头哥真武 M890 芯片上自主优化 SGLang 的推理 kernel。kernel 简单理解就是 GPU 上跑模型推理的那段核心计算代码,AI Infra 工程师的日常工作之一就是给它做调优。
这个芯片千问之前没见过。给模型的只有:一个任务描述、一份 SGLang Triton 参考实现、一个评估脚本。剩下的事情,模型自己干。
然后它真的自己干了 35 小时。
完整数据:
- 35 小时连续自主执行
- 432 次 kernel 评估
- 1158 次 工具调用
- 10.0 倍 几何平均加速比(vs SGLang Triton 参考实现)
更有意思的细节是其他几个模型「停下来的原因」。它们不是被人打断的,是连续 5 轮没发出任何工具调用,模型自己判断干不动了主动停了。Qwen3.7 没停。30+ 小时之后还在发现新的优化点,其中一次是关键的架构重设计。
具体技术上,模型自主完成了两次结构性跃迁。这些原本都是真人 AI Infra 工程师的活儿。我猜业内做这块的同行看到这组数据,应该会想一会儿。
能在标准答案题上拿满分,和能 35 小时不停摸索 kernel 设计,是两种很不一样的能力。前者靠 benchmark 这种考试式的分数衡量。后者要靠 trajectory 沉淀,也就是模型在长程任务里一步步走过的决策轨迹。Qwen3.7 这次在两边都拿出了能看的数据。
跨框架泛化:我觉得这次最重要的事
回头看官方博客里有句话,乍读会被忽略:「上述评测分数来自多种不同的智能体框架。Qwen3.7-Max 并非针对某一特定框架优化,而是在 Claude Code、OpenClaw、Qwen Code 和各类自定义框架下都能稳定发挥。」
留意下官方这张头图。长桌上那排吉祥物,除了官方点名的三家,Hermes Agent 也画在里面。
这事的工程含义比一个 benchmark 分数大很多。
过去半年我写过 4 篇 Claude Code 的文章,也专门做过 Hermes Agent 和 OpenClaw 的橙皮书。这几家 agent harness 各有各的设计哲学:Claude Code 是 tool use 紧耦合,OpenClaw 偏个人助手型,Hermes Agent 是消息驱动,Qwen Code 自家的更轻量。要让一个模型在差异这么大的几家框架下都跑出体面分数,意味着它的 tool use 能力没绑死任何特定模式。
之前国产模型最大的痛点之一就是「benchmark 还行,换个 harness 就拉胯」。Qwen3.7 这次的 12 项评测都是在多框架下完成的,模型不挑工具栈。
我自己之前出的 4 本相关橙皮书,刚好可以对照看看:
| 橙皮书 | 主题 | 现在的含义 |
|---|---|---|
| Claude Code 从入门到精通 | CC 上手 | 后端可以换成 Qwen3.7 跑 |
| Claude Code 源码解析 | CC 工作机制 | 模型不挑 harness 的工程基础 |
| Hermes Agent 从入门到精通 | 消息驱动框架 | 同一个原理,Qwen3.7 也能塞进来 |
| OpenClaw | 偏个人助手型的开源 agent | 同一个原理 |
这 4 本之前的预设都是「Claude 模型 + 某个 harness」的组合。现在多了一种可能:国产模型 + 同一个 harness,也能跑。
下面就实测一下这事。
我把 Qwen3.7-Max 接进了 Claude Code
具体做法是通过 claude-code-router(CCR)这个开源工具把 Qwen3.7-Max 接到 Claude Code 后端。日常的 claude 命令保留订阅模式不动,另起一个 claude-qwen 命令启动 CCR,把 banner 显示名设成 Qwen3.7-Max。
接下来跑两个有点意思的任务。
让它跑一次女娲
公众号老粉应该都知道我上个月开源的女娲(nuwa.skill)。前几天 GitHub stars 刚过 2 万,已经被好几个大厂的 agent 产品纳进给用户预装的默认 skill,也有不少团队在研究它的 harness 架构设计。
社区里更多的惊喜来自延伸用法。这个 skill 我做的时候默认场景是蒸馏 PG、芒格、费曼这种思想家,但社区拿它玩出了各种我意想不到的花样。昨天就有个朋友告诉我,她用女娲蒸馏了一波育儿专家,给自己和她的用户用。
这种用法我自己也没想到。
女娲这工具对模型很挑。调研阶段就要并行启动 6 个 subagent,分别去查著作、对话、表达 DNA、外部评价、决策记录、时间线。调研出来之后还要做质量自检、3 个验证 agent、2 个精炼 agent 的双 Agent 评审。整套流程跑下来,子 agent 调用数量轻松上百,单次执行半小时起步。
这种任务对指令遵循和长程任务执行两个维度都是硬考验。在某一步跑偏,后面就连环错。
我用 claude-qwen 把女娲跑了一遍,主题选的是蒙台梭利教育学专家。Qwen3.7-Max 跑下来全流程顺:6 个调研 agent 全部完成(其中 1 个文件路径写错,自己侦测到并 fallback 找到了文件)、Voice Check 5/5 PASS、Sanity Check 3/3 PASS、Edge Case 通过、双 Agent 精炼综合应用了 11 项改进建议。
蒸馏出来的蒙台梭利专家 skill 测试结果挺有意思。我问她:「在智能被无限供给的时代,怎么看蒙台梭利教育?」
她回答的片段:
1907 年没有 AI,没有计算机,甚至没有收音机。但那些圣洛伦佐贫民区的孩子,面对的挑战和今天的孩子本质上是一样的——成人世界总是急于把他们塑造成某种标准产品,而不是尊重他们内在的发展蓝图。
AI 是什么?在我的框架里,它是一种极其强大的环境要素。仅此而已。
这种回答的角色一致性,是评判蒸馏质量的核心指标。模型不仅要知道蒙台梭利说过什么,还要能在新问题上保持她的论证方式。Qwen3.7-Max 在我这个测试里做到了。
完整跑女娲的过程录了视频,可以感受一下 subagent 一个接一个起来的节奏:
顺手让它给自己做了一段宣传动画
跑完女娲又起了个念头:让 Qwen3.7 用我另一个 skill(huashu-design)给自己做一段官宣动画。
huashu-design 是端到端的:主题调研、脚本拆解、HTML 动画构建、Playwright 多帧截图验证、MP4 导出,最后用 ffmpeg 合 BGM。整条链路下来涉及一二十种工具调用,对模型在长链路里既稳又有审美都有要求。
我给的 prompt 很简单:「阿里最近刚发布了 Qwen3.7-Max 模型,请帮我收集这个模型的信息,然后用 /huashu-design 给它做一个 30 秒左右的信息和数据丰富的宣传动画」。
Qwen3.7 一气呵成跑了 9 分 49 秒,中间穿插多次搜索、文件写入、HTML 构建、Playwright 截图自检、ffmpeg 合成。最后产物是一段 24.5 秒的 1920x1080 动画。
这段流程里最值得说的是它的执行稳定性。从调研到写脚本、HTML 构建、Playwright 自检、ffmpeg 合成,9 分多钟里一二十种工具混着用,模型没有卡在任何一步。长链路任务能这样跑下来的国产模型不多。
短期看,这就是一个 demo。但能把这种调研 + 工程 + 审美串在一起的复合任务一气呵成跑完,对模型本身的执行稳定性是个不小的考验。
再让它做了一次「读书 DNA」
最后一个我想试的,比前两个都复杂。
我前几天写过一篇微信读书 skill 的文章,反响挺好。里面提过我自己另做了个增强版叫 huashu-weread,能在底层 weread API 之上做交叉分析。这次想让 Qwen3.7 同时调用 huashu-weread 和 huashu-design 两个 skill,把我十年的读书数据画成一张可视化。
我给的 prompt 也很简单:让它把书架和笔记本里的数据都拉出来,自己定 6-8 个能区分「读者」的维度,给笔记多的书逐本打分,最后画成 DNA 双螺旋。
整个过程它做了挺多事。先调 huashu-weread 拉书架——返回 2088 本;再拉笔记本——310 本笔记书、5318 条笔记。然后自己写了 4 个 Python 脚本:第一个 fetch 数据、第二个 analyze 笔记分布、第三个定义 6 个维度(思想↔故事 / 科学↔人文 / 行动↔反思 / 东方↔西方 / 古典↔当代 / 个人↔系统)+ 给笔记数最多的 24 本逐本打分、第四个用 huashu-design 的设计规范构建 HTML。中间还自己跑 Playwright 截图自校验,发现一处不满意就重截。
最后产物是这样:
排版是编辑式磁书风格:cream 底色、衬线 display + 无衬线 body、中央一条竖向双螺旋(左链兴趣广度、右链阅读深度),横档颜色标这本书最强烈的维度。完全符合我 huashu-design skill 里写的反 AI slop 规范,没有那种「赛博霓虹 + 紫色光圈」的俗气审美。
读者画像那段我觉得写得还蛮有洞察的。三个并存的人格:「要么读纯思想(芒格、波兹曼、Ridley),要么读纯故事(傅高义、Instagram、Simons),中间地带的"半思半叙"基本不碰」「西方学方法,东方读系统,西方书挑《掌控习惯》《卡片笔记》《俞军方法论》,中文几乎全在"系统级"(《美团》《置身事内》《沸腾新十年》)」。我很建议大家都用我的skill去诊断下自己的阅读品味,可能会让你发现些不一样的自己。
这个测试比前两个都难。两个 skill 并用、自己写 4 个 Python 脚本、几次外部 API 调用、几千条数据处理、最后还要按设计规范输出可发布的 HTML。整套链路跑下来,Qwen3.7 没有需要我中途介入。
一些观察
跑完这两个真实任务,再回头看那些 benchmark 数字,感受会平实一些。
让我有体感的不是某项分数,是阿里在 agent 这条线上的几个具体推进。
长程任务的稳定性是其中比较直接的一个。35 小时连着 1158 次工具调用还能产生新发现,这种能力是过去 trajectory RL 一直在打磨的事。我自己跑女娲那个半小时上百次 subagent 调用,跑宣传动画那个十分钟串起搜索、HTML、Playwright、ffmpeg 一整条链路,中间可能跑偏的地方都没跑偏。
跨 harness 这件事的意义在另一层。它意味着你手里之前那套 agent 工具栈不用换,模型这一层多了一种选择。
指令遵循也算顺带的进步。IFBench 79.1 这个数字翻译成日常使用,就是你 prompt 里写的约束模型基本不会丢,尤其是给它一长串要求时。大部分 agent workflow 是被约束撑起来的,不是被代码撑起来的,这一点对体验影响其实挺大。
我不太想用千问杀回来了这种话。国内几家模型这两年本来就是 GLM、DeepSeek、Kimi、千问轮流刷榜的格局,谁也没真正"杀回来"。能稳定按月迭代的厂商不多,阿里这几个月几乎每个月20号都准时发新版本,每一代都把 agent 这条线往前推一点。Qwen3.7-Max 是这条节奏里最新的一站。
Anthropic 这几个月也在使劲做同一件事,Opus 从 4.6 升到 4.7 的 system card 里花了大量篇幅写长程任务和评估意识。前面我写 Opus 4.7 那篇里也聊过这事。两边在同一个方向上推,方向多半是对的。
Qwen3.7-Max 已经在阿里云百炼正式上线,模型 Code 就是 qwen3.7-max。function calling、cache 缓存、结构化输出、联网搜索、模型微调这些能力都给齐了。
不管你手里的 agent 客户端是 Claude Code、OpenClaw 还是 Qwen Code,现在都多了一个能直接调的后端。亲自上手跑一遍,比看我的文章介绍获得的体感会实在得多。
这篇读完了,下次实践再见。
花叔 Alchain
AI Native Coder · 独立开发者 · 作者
《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。
本文收录自微信公众号。在原平台阅读 ↗