7月三个新模型齐接入Hermes:Gemini 3.6 Flash效率涨17%、千问3.8马上开源、Opus 5推理登顶 — 铠盒AIBOX预装全能用
📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
摘要: 2026年7月第三周,AI大模型圈连炸三弹:Gemini 3.6 Flash省Token省到极致、千问3.8带着2.4万亿参数冲开源、Claude Opus 5以半价登顶推理榜首。更值得关注的是,三个模型都已支持Hermes智能体框架。而预装Hermes的铠盒AIBOX,等于是买一台设备就把这三大模型全收了,数据全在本地,关电脑后AI继续24小时接力干活。
7月的第三周,AI大模型圈像是商量好了似的,三天连发三款重磅模型。
7月19日阿里千问3.8-Max预览版上线,7月21日谷歌发Gemini 3.6 Flash,7月24日Anthropic发Claude Opus 5。频率之密集、实力之硬核,都逼近上半年整个季度的密度了。
但真正值得关注的不是单个模型的参数和跑分,而是它们有一个共同点:全都支持Hermes智能体框架。
这意味着什么?预装了Hermes的铠盒AIBOX,一台设备就把这三个模型全收了。你不需要在Google Cloud开Gemini、去阿里云调千问、再到Anthropic Console挂Opus——在盒子上一键切换,想用哪个用哪个。更关键的是,所有数据在本地流转,一次也不离开你的设备。
下面分别看看这三款新模型各自强在哪,再说装上Hermes后到底有什么不一样。
一、Gemini 3.6 Flash:Token效率开挂,Agent场景省两成
谷歌这次更新了三个Flash系列模型,但主角是Gemini 3.6 Flash。
核心升级点很直接:同样的任务,输出Token减少17%。 这不是压缩文本,而是推理过程更精准了——不再"想太多、说太多废话"。测试数据显示,面对复杂多步骤任务,3.6 Flash的Token消耗比前代降低近两成,工具调用次数也同步下降。换句话说,模型自己变聪明了,不需要绕远路就能找到正确答案。
这意味着什么呢?跑一个自动化的Agent任务,API调用费直接省17%。对于每天几百次甚至上千次调用的智能体场景,这是实打实的成本优化。比如一个每天跑200次任务的知识工作者,一年下来省下的API费用够再买一台铠盒AIBOX。
再加上1M超长上下文窗口——可以把一整本技术手册丢进去让它干活——这模型就是为长时间、多步骤Agent任务量身打造的。DeepMind还特别强调了它在多模态理解上的强化,能同时处理文本、图片和代码混合输入。
定价也很克制:输入每百万Token 1.5美元,输出7.5美元,属于"好用不贵"档位。对比同类Agent模型,它的性价比曲线是目前最陡的。

二、千问3.8:2.4万亿参数,马上全面开源
阿里7月19日在WAIC现场放出了千问3.8-Max预览版,参数规模2.4万亿(MoE架构,激活参数288B),定位语相当有底气——"可能是除了Anthropic Fable 5之外最强的模型"。
虽然口气不小,但预览版的实际表现确实能打。在编程、多语言推理等基准上已经逼近第一梯队,WebDev前端能力在两周内连刷两版更新,阿里称模型以"天"为单位在持续优化——这在国产大模型迭代速度里是前所未有的。
更重要的是,阿里明确说了"很快将开源",不是"考虑开源",不是"部分开源",是全面的。2.4万亿参数级别开源意味着什么?开发者拿过来能在自己的服务器上微调模型、定制领域知识、自由部署在任何环境里,完全不需要依赖阿里的API。对注重数据隐私的金融、医疗、法律等行业来说,一个可控、可审计、可自部署的大模型,比任何闭源旗舰都更具实际价值。
而且千问3.8是MoE架构,激活参数只有288B,意味着推理时的实际硬件资源消耗远比总参数量低——这对本地部署设备的硬件要求很友好。预装Hermes的铠盒AIBOX能直接接到千问的API,开源后甚至可以在本地跑轻量版。
三、Claude Opus 5:推理登顶,价格腰斩
Anthropic在7月24日深夜发布了Claude Opus 5,各项跑分直接炸场。
- Frontier-Bench v0.1(编程与知识工作核心评测):得分超过Opus 4.8两倍,登上榜首
- ARC-AGI 3(抽象推理基准):得分是次优模型的三倍
- OSWorld 2.0(计算机操作模拟):以约三分之一的成本超越了Fable 5的最佳成绩
但最狠的不是跑分,是定价——Opus 5维持了前代Opus 4.8的价格:输入$5、输出$25每百万Token——只有Fable 5的一半。在CursorBench等实测场景中,Opus 5表现与Fable 5峰值只差0.5%,但成本只有一半。
直白点说:你用和去年一样的预算,拿到的是翻倍以上的推理能力。这是Anthropic成立以来最激进的一次定价策略,也侧面说明了模型蒸馏和推理优化技术已经成熟到可以大幅降低成本。Opus 5默认开启了Extended Thinking模式,适合需要深度推理的长链任务——法律文书分析、复杂代码调试、多变量商业建模,这些场景下它比任何竞品都靠谱。

三个模型全接上Hermes,有什么本质变化?
上面说了三个模型各自多强。但它们接入Hermes智能体框架后,玩法发生了四个本质变化。
第一,全都在本地跑,数据不出门。 Hermes是运行在设备端的智能体框架。你在这三个模型之间随便切,问财务数据、处理客户资料、整理内部文档——所有数据都在你的铠盒AIBOX本地流转,不经过Google、阿里或Anthropic的服务器。对于有数据合规要求的企业来说,这是用上三个世界顶级大模型的唯一安全方式。不是"云端帮你保密",是数据压根没离开你的设备。
第二,永久记忆跨模型共享。 Hermes基于Honcho协议实现了跨会话记忆。你今天用Opus 5分析了一份竞品报告,明天切换到Gemini 3.6 Flash处理项目排期——Hermes帮你把两天的上下文打通。三个模型在同一个记忆库上协作,不会各自"失忆"。云端AI"每次开新对话就当不认识你"的体验,在这里不存在。
第三,一键切换,谁好用谁。 Gemini 3.6 Flash适合高频Agent自动化(省Token),千问3.8适合本地微调定制场景(开源的便利),Claude Opus 5适合复杂推理任务(最强推理)。你在铠盒AIBOX的Hermes里一行命令切换,不用开三个API Console、不用管三个账单、不用维护三套密钥。
第四,关电脑后继续跑,按时间表自动接力。 这是云端AI永远做不到的。你把任务排给Hermes——凌晨3点用Gemini 3.6 Flash自动采集行业新闻,早上8点用千问3.8生成中文摘要,9点用Opus 5做深度分析——你睡觉,它们在铠盒AIBOX上按时间表自动接力。早上打开电脑,报告已经在桌面了。三个模型协同完成一个完整工作流,全程无人值守。
三款模型怎么选?一句话指南
- 你要高频、省钱、全自动 → Gemini 3.6 Flash
- 你要开源、可定制、数据不出门 → 千问3.8
- 你要最强推理、处理复杂问题 → Claude Opus 5
而铠盒AIBOX预装Hermes,三个全给你,不用选。
延伸阅读
- AI模型峰谷定价潮来了!把AI搬回家,错峰省钱 — 云端涨价潮下,本地AI的省钱逻辑
- 关掉电脑AI就下班了?本地AI盒子却还在替你干活 — 7×24本地Agent实操指南
- 云端模型越强,本地AIBOX价值越大 — 从DeepSeek V4到Kimi K3看趋势 — 模型越强,盒子越值
- 铠盒AIBOX商城 — 全系列AI智能体计算机
了解更多 请搜索【铠盒AIBOX】 联系邮箱:[email protected]
铠盒AIBOX #Gemini #千问 #Claude #AI模型 #Hermes #AI智能体 #开源
铠盒AIBOX · 7×24小时为你工作的私人AI助手 · AI智能体