跳到正文
ZH
English soon 简体中文 日本語 soon

GLM-PC

从视觉模型出发操作屏幕任务的桌面智能体

访问官网

GLM-PC 是什么

GLM-PC 是一个面向图形界面的开放智能体:给它一张屏幕图片和一句普通话指令,它返回能把这条指令执行下去的点击与按键。

它的重点是操作一个界面,而不是聊天,九十亿参数这一版是随一个商业桌面助手一起发布的。

关于来源的一句说明:产品页是浏览器里画出来的,取不出文字,所以这里的一切都依据项目仓库,而仓库对模型是权威的,对任何基于它建出来的产品则不是。

你可以用它做什么

你给它一张屏幕图片和一段用文字描述的任务,它回给你一个动作以及在屏幕上执行的位置,可能的动作集合明确写出了点击、输入与滚动。

你必须说明涉及哪个平台,而 Windows、macOS 与 Android 各有各的路径,所以同一条指令在不同的运行环境下处理方式不同。

图片是必需的,光给文字不行,也没有持续对话,不过可以把之前的步骤再交回去,好让更长的活接着干。它在界面定位与单步测试上的分数站得住,在多步骤桌面任务上比最强的对手模型略差一点。代码带开放许可,权重则适用另一份许可,商用前需要读。

适合谁使用

它被定位成给做界面智能体的研究者与开发者,以及想把桌面自动化架在视觉模型上的组织。

做自动化工具的团队与应用 AI 的团队也被点名,而且它明确说了这不是面向终端用户的产品。

期待拿到就能装就用的产品的人应该去看别处:这是一个模型加一个仓库,使用者是在它之上做东西的人。

需要留意什么

运行它的账号被允许做的事,它都能做。看屏幕意味着它自己没有沙箱,所以一个误读指令的模型能够删掉一个文件、发出一条消息或者完成一次购买,任何约束都得在它外面另建。

背后的人直说了他们无法承诺安全行为,并且说演示仅供学术参考、责任一概不认。这是一个坦率的表态,值得按字面去读,而不是当成套话扫过去。

在自己机器上运行要求不少:常规精度下要几十 GB 内存,而且官方不建议用压缩最狠的变体,因为结果会明显掉。压缩版还对硬件有特定要求,这把能自己托管它的人缩小了。

最新发布也不到 2024 年底,而且项目被定位成已完成的研究,而不是持续更新的东西。多步骤桌面任务正是它落后于最强对手模型的地方,而多步骤恰好就是自动化的构成方式。

优点与缺点

✓ 我们认可的地方

  • 动作来自一张截图加一条指令,动作空间限定为点击、输入与滚动
  • Windows、macOS 与 Android 各自都支持,而且可以提供之前的步骤,让更长的任务继续往下走
  • 代码以开放许可发布,基准也公开,所以这项能力是可以核对的

! 需要留意的地方

  • 它拥有运行所用账号的全部权限,而项目明确表示无法保证安全行为并且不承担责任
  • 自己本地运行的硬件要求不低,而多步骤的桌面任务正是它落后于最强模型的地方

常见问题

只能靠文字工作吗?

不行,必须输入图片,也不支持连续对话,不过可以提供之前步骤的历史记录。

我能商用这些权重吗?

代码是开放许可,模型权重另有一份许可,商用前应先读它。

让它操作桌面安全吗?

它能做成运行它的账号能做的任何事,而项目本身就说明不保证行为安全,所以防护必须来自外部环境。

最后评测: 2026-09-15

更多 AI 办公助手 工具

查看全部 →

评测方法