生活分享

H Company 发布 Holo4:可同时操作界面、代码与 API 的计算机操作智能体模型

H Company 于 2026 年 9 月 28 日发布 Holo4 智能体模型系列,提供 27B 与 35B-A3B 两种规模,并宣称能以单一模型操作 GUI、代码、MCP 与 API。以下整理其公布内容、自评基准数据及对普通读者的意义。

阅读时间约 6 分钟

H Company 发布 Holo4:可同时操作界面、代码与 API 的计算机操作智能体模型
图片:Mokaair (Original editorial artwork)

H Company 发布了什么

H Company 于 2026 年 9 月 28 日在 Hugging Face 博客公布 Holo4,称其为新的智能体模型系列。“智能体”指能自行分步骤完成任务、而不只是回答问题的 AI。Holo4 有两种规模:27B 稠密模型(B 代表十亿参数,参数量大致反映模型规模;“稠密”指每次运算都用上全部参数),以及 35B-A3B 混合专家(Mixture of Experts)模型(模型内部分成多个“专家”,每次只启用其中一小部分),两者都可通过 H Models API 使用。该公司同时发布了 Holotron 3 的更新版本 Holotron4 Nano。

H Company 在 Hugging Face 上列出了 Holo4 的完整合集,格式包括 FP16、FP8 与 GGUF(不同精度与格式的模型文件)。该公司还表示 Holo4 相比其 Qwen 基础模型(即 Holo4 在其上继续训练的原始模型)有显著提升,并指出 Qwen3.8 27B 是 Holo4 27B 的基础模型。

H Company 发布 Holo4:可同时操作界面、代码与 API 的计算机操作智能体模型
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

“一个模型通吃各种界面”是什么意思

H Company 表示,大多数智能体模型只针对单一界面训练:专注图形界面(GUI,即屏幕上的窗口、按钮与菜单)的模型没有屏幕就无法运作,偏好工具调用的模型则在没有 API(软件之间互相调用的接口)的应用程序面前束手无策。该公司称 Holo4 可以在屏幕上点击与输入、编写并执行自己的代码,并调用 MCP(一种让 AI 连接外部工具的协议)或 API 工具,根据任务选用合适的方式。

据 H Company 介绍,Holo4 可在桌面、网页、Android、代码沙箱及商业 API 上运行,各场景都是同一个模型、以相同方式调用,无需为不同平台挑选不同模型。

H Company 公布的基准数据

H Company 称 OSWorld 2.0 与 AutomationBench 分别是桌面操作与 API 使用方面最难的学术基准测试,也就是用一组统一任务给模型打分的测验。

数据全部来自 H Company 的 Hugging Face 文章;该公司注明各模型的版本、测试框架与任务子集不同。
模型OSWorld 2.0 得分(据 H Company 整理)备注
Holo4 27B61.7%H Company 自家模型
Holo4 35B-A3B30.9%H Company 自家模型
Opus 5.581.8%H Company 列为对照
Opus 570.2%H Company 引述 OpenAI 发布图表
GPT-5.6 Sol66.2%H Company 引述 OpenAI 发布图表

H Company 表示 Holo4 在长流程任务上仅落后于最强的闭源模型,且参数量少了几个数量级、成本低得多。该公司说明,成本是按每次智能体运行的输入与输出 token(模型处理文字的基本单位,也是计费单位)估算,Holo4 按 H Models API 费率计价。至于 AutomationBench,H Company 表示 Holo4 的分数与成本是在其内部测试框架中测得的,并表示待评估完成后将公布 Holo4 在私有测试集上的结果。

实际任务示例与训练方式

H Company 以相同的提示词与测试框架,比较了 Holo4 27B 与其基础模型 Qwen3.8 27B 在专业软件上的表现,并公布了各自的调用次数与 token 用量:

  • 用 Godot 制作 Pac-Man 游戏:Holo4 27B 使用 68 次调用、2.4M token、268 行代码;Qwen3.8 27B 使用 197 次调用、11.4M token、327 行代码。
  • 用 FreeCAD 建模埃菲尔铁塔:Holo4 27B 使用 84 次调用、1.3M token;Qwen3.8 27B 使用 60 次调用、1.0M token。
  • 用 FreeCAD 建模 H 标志:Holo4 27B 使用 94 次调用、1.5M token;Qwen3.8 27B 使用 118 次调用、1.9M token。

训练方面,H Company 表示 Holo4 通过监督学习与强化学习,在大量环境与任务上进行训练,其中包括其 Agentic Task Factory 生成的任务;该工具迄今已在网页应用、MCP 服务器与桌面环境中生成约 10,000 个任务。该公司还表示重建了测试框架(执行模型动作、并在数百个步骤中管理其上下文的循环程序),最大的改动是让智能体拥有可追踪数百个步骤的可靠记忆,以及在桌面机器本身上的 shell(命令行)。

对普通读者的意义

“计算机操作智能体”指的是能像人一样看着屏幕、点击按钮、输入文字,或改用程序与 API 完成工作的 AI。如果 H Company 的说法成立,企业将来或许不必为每个平台分别准备不同模型,就能自动化跨越网页、桌面软件与内部系统的流程。对普通用户而言,这类技术目前主要影响的是职场中的自动化工具,而非日常消费产品。

同时也要记住,让 AI 直接操作计算机意味着它能执行真实操作。任何组织若考虑引入这类智能体,都应先在隔离环境中测试、限制其可访问的账号与数据,并保留人工审核重要操作的环节。本文仅为新闻整理,不构成采购建议。

常见问题

Holo4 是谁推出的?什么时候发布?

由 H Company 于 2026 年 9 月 28 日在 Hugging Face 博客发布。

Holo4 有哪些版本?

据 H Company,Holo4 有 27B 稠密模型与 35B-A3B 混合专家模型两种规模,均可通过 H Models API 使用;该公司同时发布了 Holotron4 Nano。

Holo4 真的比其他模型更便宜又好用吗?

H Company 表示 Holo4 能以低得多的成本与前沿模型竞争,但在其公布的 OSWorld 2.0 数据中,Holo4 27B 的 61.7% 仍低于 Opus 5.5 的 81.8%。这些数据由该公司自行整理,且其注明各模型的测试条件不同,目前未见独立验证。

可以自己核查这些基准结果吗?

H Company 表示会开源公开基准分数背后的每一条运行轨迹,可在 trajectories.hcompany.ai 回放,或从 Hugging Face 下载。

Holo4 可以在哪些平台上运行?

H Company 表示 Holo4 可在桌面、网页、Android、代码沙箱及商业 API 上运行,且都是同一个模型、以相同方式调用。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享