AutoGLM 是什么:智谱把「手机操作」交给 AI 之后能做什么

AI百科 ·

AutoGLM 是智谱推出的 AI 智能体产品。按官方描述,它面向公众开放,Phone Use(手机操作)能力突出。这个定位值得拆开看:一个能直接操作手机界面的智能体,和只会在对话框里给建议的助手,是两类完全不同的东西。

下面按「定位—手机操作—浏览器操作—边界」的顺序,把官方给出的信息讲清楚,也把官方没说的部分明确标出来,避免你在不存在的功能上做计划。

定位:面向公众开放的智能体

官方描述里的第一个关键词是「面向公众开放」。行业里早期的一批界面操作型智能体大多停留在内测或研究阶段,普通用户很难接触到;明确写「面向公众开放」,意味着它是可以实际申请使用的产品形态。

第二个关键词是厂商。AutoGLM 出自智谱,这一点决定了它的能力上限与模型侧支持有关——智能体要理解界面、判断下一步点哪里,背后依赖的是模型对视觉与文本的联合理解能力。

需要说明的是,官方这段描述没有给出使用额度、平台限制这类信息,本文不对这部分做任何推断。

Phone Use 解决的是什么问题

手机上的大多数操作,本质是重复的界面点击:打开应用、找到入口、输入内容、提交。人做这些事不费脑子,但费时间。

Phone Use 的思路是让智能体直接操作界面,而不是只输出一段说明让你照做。两者的差别在责任边界上:前者交付的是结果,后者交付的是方法。

这类能力最典型的应用场景,是流程固定但步骤繁琐的操作。步骤越标准,智能体越容易稳定执行;反过来,需要临场判断、涉及支付或账号安全的关键操作,把权限完全交出去并不合适。这是使用这类产品时的通用原则,与具体哪家厂商无关。

浏览器操作:同一套能力换一个场景

官方描述中提到,智谱推出的本地客户端 AutoClaw 内置了 50 多个 Skills,并集成了 AutoGLM 的浏览器操作能力。

从这句话能读出两层信息。一层是 AutoGLM 的能力不止于手机,浏览器同样是它可以作用的界面;另一层是它的能力可以作为组件被其他产品集成,而不只是一个独立应用。

浏览器操作的价值在于网页端的信息密度比手机端更高。同样的任务,在网页上往往能一次看到更多信息,这对需要跨页面比对的场景更友好。

使用前需要知道的边界

第一,官方描述里没有提供价格、账号体系、支持的机型与系统版本,这些信息只能以官网为准。

第二,智能体操作界面意味着要授予一定权限。权限越大,能做的事情越多,出问题的代价也越大。建议从低风险的重复任务开始试。

第三,官方这段描述里还夹着其他产品的介绍,本文不把它们当作 AutoGLM 的功能来写。看到「AutoGLM 支持某功能」这类说法时,最好回到官方页面确认一次。

小结

  • AutoGLM 由智谱推出,官方描述为面向公众开放,Phone Use 手机操作能力突出。
  • 它的核心价值是直接操作界面完成任务,而不是只给出操作建议。
  • 官方信息显示浏览器操作也是它的能力方向,并可被本地客户端 AutoClaw 集成。
  • 步骤固定、重复度高的操作更适合交给它;涉及支付与账号安全的操作建议保留人工确认。
  • 官方描述未提及价格、机型与额度,这些需以官网最新说明为准。
阅读 1