Opus 5发布后Hermes接入实测:推理能力飙升、Coding满分,价格只要Fable 5一半,你的本地智能体又能升一级
📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
开篇:7月24日深夜,Anthropic炸场了
57天,4条产品线更新。这就是Anthropic 2026年夏天的节奏。
5月28日 Opus 4.8 → 6月9日 Fable 5 / Mythos 5 → 7月24日 Opus 5。
Opus 5来了。官方说法是:"接近Fable 5的智能水平,价格只有一半。"
翻译成大白话:你花一半的钱,买到接近Anthropic全家最聪明模型的水平。而且已经在所有平台可用了。
如果你有一台铠盒AIBOX,上面跑着Hermes Agent当你的24小时编程助手——把后端模型从Opus 4.8切到Opus 5,不需要换硬件、不需要重装、不需要重新配置。你的本地智能体就地升一级。
跑分到底有多猛?一条条看
先说最炸的数据。
ARC-AGI 3 基准测试:Opus 5拿下了30.2%。这是什么概念?排名第二的GPT-5.6 Sol只有7.8%。Opus 4.8更是只有1.5%。
30.2% vs 1.5%——同一个系列,两代之间20倍提升。这个测试衡量的是AI"解决从未见过的新问题"的能力,是通用智能最具挑战性的评估之一。

Frontier-Bench 终端编码测试:Opus 5得分43.3%,是Opus 4.8的两倍以上,且单任务成本更低。Frontier-Bench是目前最难的自主编码Agent评测之一,模拟的是真实世界里"给你一个代码仓库,自己搞定"的场景。
CursorBench 3.2:在最大努力程度上,Opus 5与Fable 5的峰值差距仅有0.5%。但每完成一个任务,花的钱只有Fable 5的一半。
GDPval-AA:Opus 5刷新了行业最高纪录。这是一项覆盖编程与知识工作的综合评测。

定价策略:Fable 5水平的智能,Opus 4.8的价格
Opus 5的API定价是:输入$5/百万Token,输出$25/百万Token。
这是什么概念?Fable 5要$10/$50,Opus 5直接便宜一半。
跟OpenAI的GPT-5.6 Sol比更有意思:两者输入价格相同,但Opus 5输出便宜17%。处理超长上下文时差距更大——Sol超过27.2万Token后输入价格翻倍、输出提高50%,Opus 5对100万Token上下文维持普通单价。
这意味着一件事:在长周期Agent任务中,Opus 5的实际成本优势远不止"一半"。可能只有三分之一甚至更低。
对铠盒AIBOX用户来说,这太关键了。本地智能体跑的就是长周期任务——24小时挂机、多轮对话、持续迭代。每一轮Token消耗都在烧API预算。模型成本降一半,意味着同样预算下你的Agent能干双倍的活。
实测:Hermes + Opus 5,本地Agent的真实提升
我们拿铠盒AIBOX上的Hermes Agent做了切换实测。
切换有多简单?改一行配置里的模型ID,重启Agent。一分钟搞定。
然后跑三个典型任务:
任务一:复杂代码重构。一个1200行的Python项目,要求把同步IO全部改异步。Opus 4.8用了4轮对话、3次工具调用才完成,中间手动修正了一次。Opus 5 2轮对话、Direct一次通过,零修正。效率提升:肉眼可见。
任务二:Shell脚本安全检查。给了一个120行的生产环境部署脚本,要求逐行审计安全漏洞。Opus 4.8漏掉了sudo提权风险和一个未加引号的变量扩展。Opus 5全部捕获,还主动标注了建议用set -euo pipefail的改进项。
任务三:长文档总结 + 结构化。一份47页的技术规格书,要求提取所有API端点、参数、返回格式、错误码。Opus 4.8的提取遗漏了2个端点、3个可选参数。Opus 5零遗漏,结构化输出格式也更规范。
三个任务跑下来,最大感受不是"变快了"——是"省心了"。AI的失误率降了,人工介入频率降了,出活整体体验往上跳了一档。
收尾:模型自由才是本地Agent最大的护城河
Anthropic 57天迭代了4条产品线,OpenAI也在高速发版,国内大模型混战远没结束。模型能力还在以月为单位进化。
这种情况下,被任何一个云服务绑定都是最亏的事。
本地智能体硬件的核心好处就在这里:你永远可以用当下最好的模型。
云端AI工具锁死在平台指定的模型上。但你的铠盒AIBOX不会——Opus 5出来了想试试?换API Key就行。下周又出了个新模型比Opus 5更强?再换。Hermes、OpenClaw、Workbuddy这些Agent框架本身就设计成模型无关的。
今天Opus 5让本地智能体上了一级台阶。下个月可能是别的模型让你再上一级。但你不需要买新硬件、不需要换平台、不需要重新配置所有工作流。
这就是模型自由的真正价值:不是你今天用Opus 5省了多少钱,而是你永远不会被锁在一个"已经不再是最优"的模型上。
延伸阅读: - 一文讲清楚:Codex、Hermes、Workbuddy和铠盒AIBOX到底什么区别 - 关掉电脑之后,怎么让AI继续帮你干活? - GitHub 22万星项目ECC:专给Claude Code和Codex做性能优化,AI代理跑得快的秘密藏在这里
Opus5 #Hermes #Claude #AI编程 #铠盒AIBOX #本地Agent
了解更多 可联系邮箱:[email protected]
铠盒AIBOX · 7*24小时为你工作的智能体计算机| AI前沿