缓存读降价75%,跑一整晚的智能体终于不心疼了
📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
你让一个 AI 智能体帮你盯着项目跑了一整晚。第二天看账单,真正花在思考上的钱,还不如反复读取那几万行代码库、系统提示词和历史记录的钱多。
这是跑长周期任务的人共同的痛。模型每走一步都要把上下文重新读一遍,缓存读取的计费,悄悄吃掉了账单的大头。

云端模型负责变聪明,本地底座负责一直在线。像 铠盒AIBOX 这样的智能体计算机,插上电就 7×24 跑着你自己的私人智能体,记忆都在你设备里。模型越便宜,这台底座就越划得来。
误区:模型越强,一定越贵
很多人下意识觉得,能力涨了价格必涨。这一代旗舰偏不按这个逻辑走。
9月1日,Anthropic 发布广泛开放的新一代模型 Fable 5.1,同底层还有面向高敏感场景、限制开放的 Mythos 5.1。它做了一件反直觉的事:能力上去了,最常用的那块成本反而降了。
一句话本质:长任务的成本结构被改了
输入和输出价格没变,还是每百万 token 收 10 美元和 50 美元。真正动刀的是缓存读取:从每百万 token 1 美元,直接降到 0.25 美元,降幅 75%。
官方测算,典型工作负载总成本降约 25%,高度依赖智能体的任务最高能省 45%。省的不是零头,是长任务里反复读上下文那笔持续开销。
三维拆开看
性能这一维,跳得实。Terminal-Bench 4.0 衡量终端编程,从 42.0% 涨到 55.8%。Terminal-Bench-Science 0.1 考科研自主任务,从 24.7% 直接翻到 52.6%,超过一倍。知识工作基准 GDPval-AA v2 也涨了 130 分。它更擅长跨整个代码库做长链路开发、做系统性代码审查,也更能自己跑代码、做实验、分析数据。
成本这一维,砍在要害。企业跑智能体,缓存读取往往占掉一半以上的 token 用量。这一刀下去,长期在线的代理任务账单明显变薄。
数据这一维,也松了口。新出的 Enterprise Frontier Safeguards 让客户把监控数据存在自己基础设施里,零数据留存。云端模型再强,你的客户记忆、沟通记录、长期偏好,放在自己手里的 铠盒AIBOX 上,才真正归你所有。

和上一代比一比
| 项目 | Fable 5 | Fable 5.1 |
|---|---|---|
| 输入价格(每百万 token) | 10 美元 | 10 美元 |
| 输出价格(每百万 token) | 50 美元 | 50 美元 |
| 缓存读取(每百万 token) | 1 美元 | 0.25 美元 |
| Terminal-Bench 4.0 | 42.0% | 55.8% |
| Terminal-Bench-Science 0.1 | 24.7% | 52.6% |
价格没动,缓存读砍了 75%,基准几乎全线涨。这就是这次更新的全部重点。
模型越强越便宜,底座越显价值
以前跑一个长期在线的私人智能体,模型和底座两笔账都贵。现在模型侧缓存读砍了 75%,长任务成本直接下来。剩下的那块,是一台一直开着的设备。

铠盒AIBOX 就是那块底座。插电即在线,预装 OpenClaw 和 Hermes,你用越久它越懂你,所有记忆都在你自己手里。云端模型负责多强,本地底座负责一直在线。
强者更强还更便宜,这种组合不常出现。对想真正用起长期智能体的人,现在是好时候。
延伸阅读: - 模型都在卷能干活,你缺的却是一个一直在线的底座 - 语音AI已能骗过人耳:你缺的不是会说话,是一直醒着的助手 - 小红书开源2800亿大模型:模型越卷,你越缺一个替你调度的管家
铠盒AIBOX #AI前沿 #缓存读取 #智能体计算机 #AIBOX
了解更多 可联系邮箱:[email protected]
铠盒AIBOX · 7*24小时为你工作的智能体计算机| AI前沿