花叔专栏 / AI工具实测
【实测&解读】全球首个手机通用Agent——AutoGLM 2.0发布!我喝到了AI为我点的第一杯咖啡~
你有没有想过,如果某一天你说一句话,手机就能自己去打开美团、找到你最爱的咖啡店、选完口味、点好饮料、用优惠券结账。从今天开始你就可以做到了,这就是AutoGLM 2.0登场的时刻。
这一杯,也是我喝到的AI为我点的第一杯咖啡。
从年初的Manus开始,我们已经被太多太多的Agent概念轰炸了,他们为你做PPT、写代码、分析数据,是你实实在在的生产力助手。
上周受邀去体验智谱更新的AutoGLM 2.0之后,我立刻看到了这是个不一样的Agent,它不止于此,它也不是仅给你提供情绪价值的聊天机器人。而更像是一个配备了手机和电脑的生活/工作全能助理的角色。
其实,早在去年10月份,智谱就发布了全球首个phone use产品AutoGLM,但是当时我没体验上。因为当时他们的产品形态是让Agent直接去操纵使用手机。只有安卓手机可以做到这一点,以及,我多少觉得让AI来接管自己的手机,并且在AI使用手机进行操作的时候自己还只能干瞪眼看着,多少有些奇怪~
而这次,AutoGLM 2.0我觉得是真的找到了合适的Agent形态,不管是苹果还是安卓手机的用户都可以用这个产品了,而且,你并不需要交出你自己手机的使用权。
就像当你让助理给你点杯咖啡的时候,他也不会非要拿着你手机去点单一样。
在2.0版本中,智谱为AutoGLM分配了一台「云手机」和一台「云电脑」,分别用于适配你的生活和生产力场景,而智能侧驱动云手机和云电脑运行的则是他们最新的在Coding和Agentic方面表现出色的模型GLM-4.5 和具有视觉理解能力的GLM-4.5V。
花叔前段时间也写过关于GLM-4.5的介绍:Claude Code + GLM-4.5,最强性价比编程组合教程首发
关于为什么使用「云手机」,以及关于模型,我都有挺多想说的。
不过,先给大家看看这杯咖啡是怎么点的👇
从动图中可以看到,在我表达需求之后:
AutoGLM先做了一次思考,理解我的需求并规划了执行步骤。
接着,AutoGLM打开云手机开始执行,它实际的操作包括:
1)打开「美团」app
2)搜索「星巴克」
3)在星巴克店铺搜索「美式咖啡」
4)在弹出的菜单选项中,按我的要求选择了「超大杯」和「冰」这两个选项
然后,在需要付款的环节,它放弃了操作,把进程还给我来接管了,让我完成最终步骤的确认。
大致是出于风险控制的考虑,AutoGLM还不会实际执行最终「付款」的那一步,需要人类来做最后的操作和确认。
为什么是「云手机」?
为什么一定要让模型来操作手机?这应该是很多人会有的疑问。为什么不是通过API调用或者MCP的方式去执行操作?
毕竟不管是点外卖、打车还是在淘宝/京东搜商品,似乎都是可以和这些大厂有API合作的模式,让AI理解用户意图,然后通过API Call或者MCP的方式和这些产品交互理论上是更标准化,执行风险更小的交互。
确实如此。
但,我突然意识到,如果通过API调用的方式去执行任务的话,那就太标准,但太受限了。你可以接10家、20家的API,但是AI所有的操作会被局限在API局限的范围之内。
因为人类在用手机,在用app。所以想让一个产品变得通用,最好的方式就是让这个产品可以模拟人类的方式,用人类的运行环境进行操作。
这也很像现在机器人领域的「人型」争议,为什么非要做两条腿的人型机器人?为什么不是更稳定的四条腿?为什么不是把腿做成移动速度更快的轮胎?因为现在的物理世界是为两条腿两只手、1米多身高的人类所准备的,所以机器人想适应人类社会,希望能更「通用」地为人类提供服务,那「人型」会是最正确的选择。
而现在,人类的内容,服务都是通过手机+app的形态分发的,所以一个合格的「通用」的人类助理,需要具备一个手机,拥有操作手机的能力。
以及,这个「手机」又必须是个「云手机」才行。你并不希望一个AI可以随便查看和操控你的手机,发出一条指令后,如果自己的手机被AI接管,你就没法用了的情况挺傻的。
而且,你也不希望AI在你的手机上执行各种可能导致风险的操作。比如给xxx发个微信、比如删掉某张照片。
所以这么一台云手机确实是现阶段实现通用手机Agent的最佳,或者说唯一正确的选择。
为什么GLM-4.5很关键?
我认为AutoGLM 2.0另一个值得一提的点是他们背后使用的模型完全是他们自研的,纯国产的GLM-4.5和GLM-4.5V。
现在很多我们熟知的Agent产品,比如Manus、Genspark等,背后所使用的模型主要是Claude,因为Claude的Agentic和Coding能力确实很强。但这导致的一个问题是因为模型的缘故,这些产品没法在国内正常使用,只能做出海的市场。
而最近几个月,国产开源大模型在Agentic能力上都逐步追上了。这让AutoGLM这款可以面向所有国内所有用户发布和使用的Agent产品成了可能。
我之前在介绍GLM-4.5的文章里也提到过,他们在API价格比Claude 4低了一个数量级。这也让AutoGLM这样的产品在成本上变得更可负担。据说他们执行一次任务的成本在0.2美元左右,远低于现在绝大多数主流的Agent产品。
再给大家看几个我测试的案例:
1)让AutoGLM打开我B站最新的视频并点赞、收藏,ta是真一步步帮我打开了我最新一期上传的视频
2)让AutoGLM为我用滴滴叫一个去朝阳公园的「特惠快车」,车型的选择很准确
3)除了生活类的场景,AutoGLM用云电脑跑工作需求也是有点东西的,我让AutoGLM帮我搜索了解GPT-5的信息,制作视频发布到小红书。ta还居然给我做出了个虚拟人口播视频出来,并且在小红书顺利完成了视频上传和标题、正文内容的填充。如果能再个性化优化优化,比如可以设定自己的虚拟人和口播文案的话,一套成熟的自媒体自动化工作流就出来了。
如果你想试试AutoGLM 2.0的话,这还有一些事实和小tips:
1、目前AutoGLM的云手机内置了20多款主流app,但还不能自主下载其他app,所以你只能执行和这些app相关的任务。这些app包括抖音、小红书、淘宝、支付宝、高德地图、快手、美团、大众点评、滴滴、京东、携程、微博、拼多多、肯德基、今日头条、番茄小说、B站、爱奇艺、腾讯视频等。
2、要执行某个类型的app任务前,你最好提前操作接管手机并且登录账号,毕竟AI确实不知道你的账号密码(你也不想让AI知道)。顺便提一句,现在AutoGLM的账号登录逻辑是你可以自主在云手机上登录,APP本身没有直接访问权限,智谱也不会在云端收集用户名或密码信息。云端的基础设施与安全会由他们的公共云伙伴提供,操作上我倒是没太大顾虑。
3、最好把执行的任务表述得更具体,比如我让AutoGLM从「用美团外卖点星巴克」,如果不提美团外卖的话,AutoGLM可能会选择饿了么,那又会遇到要在饿了么登录的问题。除非你确实没有偏好,或者希望AI比价后再下单。以及想要喝什么、杯形、冷热选择、糖度选择都最好明确表达(说实话,这块我还挺期待AutoGLM能在我逐步使用之后记住我的偏好,能更主动帮我做出更个性化选择的)
4、你也可以试试需要多个app配合的任务,比如在你准备骑车前,可以让AutoGLM“打开QQ音乐播放新裤子乐队的音乐,再打开高德地图规划到后海的骑行路线”,然后你就可以带上耳机,骑上车出门了。
5、AutoGLM包含安卓和iOS版的移动端应用和网页版,手机应用去各大应用市场下载就好了,网页版指路👉https://autoglm.zhipuai.cn/
谢谢你读到这,欢迎关注、点赞👍、转发、评论,这是对我内容最大的支持~这篇读完了,下次实践再见。
花叔 Alchain
AI Native Coder · 独立开发者 · 作者
《一本书玩转DeepSeek》作者,小猫补光灯、女娲Skill生态创作者。不会写代码,用AI做产品,分享独立开发、AI工具与内容创作的实践。
本文收录自微信公众号。在原平台阅读 ↗