OpenAI开源Codex执行引擎:同一模型换个"底座",成绩翻了近3倍
📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
摘要: OpenAI把驱动Codex的底层执行引擎Harness开源了(Apache-2.0,github.com/openai/codex)。核心一句话:Agent = 模型 + Harness。同一模型GPT-5.6 Sol,只改Harness、不换模型,ARC-AGI-3成绩从13.3%涨到38.3%,Token消耗还降了六倍。这篇文章想说清楚两件事:开源Harness到底改变了什么,以及它没改变什么——你的Agent有没有一个7×24小时在线的"家",开源解决不了。
8月19日,OpenAI在官方博客甩出一个动作:把驱动Codex运行的底层执行引擎——Codex Harness——正式开源,协议Apache-2.0,仓库就挂在github.com/openai/codex。
这件事在开发者圈炸得比发一个新模型还响。不是因为模型变强了,恰恰相反——是因为大家突然意识到,原来决定一个AI Agent"能不能干活、干得好不好"的,很多时候根本不是模型本身。
一、Harness到底是什么:Agent的"底座"
很多人对AI Agent的理解还停在"好模型 + 好提示词"。但真正跑过长期任务的都知道,这差得远。
一个能用的Agent,不能只有一段提示词和一次模型回复。它需要理解任务、在漫长的对话里保持记忆、检查相关信息、调用工具、展示进度、处理失败、在关键时刻停下来请求人工审批,最后返回一个有用的结果。围绕模型运行的这一整套执行系统,就是Harness。
OpenAI自己给了一个特别直白的公式:模型 + Harness = Agent。模型负责"想",Harness负责"把想变成干"。
这次开源的核心,是Harness的三层集成接口:
- codex exec:非交互式命令行调用,适合CI/CD流水线这类不需要人盯着的场景,直接吐结构化结果;
- Codex SDK:提供TypeScript和Python编程接口,开发者可以用代码控制任务的启动、暂停、恢复和流式传输;
- app-server:通过JSON-RPC协议把Agent嵌进你自己的产品,支持持久会话、实时事件流和审批回调。
换句话说,OpenAI把"怎么让Agent跑起来、跑得稳、跑得久"这套底层能力,整个交了出来。
二、最吓人的数据:不换模型,成绩翻近3倍
这次公告里最值得玩味的一组数字,是OpenAI自己公布的:在ARC-AGI-3基准上,同一款GPT-5.6 Sol模型,仅仅靠Harness层面的两处优化——保留推理(retained reasoning)和上下文压缩(context compaction)——得分就从13.3%一路飙到了38.3%,而输出Token总量反而降到了原来的六分之一。
没有升级模型,没有堆参数。只是把"底座"调好,分数差不多涨了三倍,成本却砍到六分之一。
这说明什么?说明很多Agent跑不起来、跑不顺,瓶颈根本不在模型够不够聪明,而在它怎么获取上下文、怎么调用工具、怎么撑过动辄几小时的长任务、怎么在边界内安全运行。这些问题,全落在Harness那一层。模型设了上限,Harness决定你的Agent能不能摸到那个上限。
所以OpenAI这次开源,战略意图很清楚:模型我不一定免费,但"底座"我开放给你。你基于我的Harness搭产品、接工作流,自然就会把模型调用和预算留在我的生态里。
对普通人来说,这其实是个好消息的放大器。过去你想拥有一个能自动干活的AI,要么等巨头把功能喂到你嘴边,要么自己有技术底子去折腾。现在Harness开源了,门槛被拆掉一大截——你不需要成为编译器专家,也能把Agent接进自己的业务流。开源是平权,这一点值得真心点赞。
三、但开源的是"底座",不是"家"
热闹归热闹,这里有个大多数人会忽略、却至关重要的问题:开源Harness解决的是"怎么干",解决不了"在哪儿干、什么时候干"。
你把Agent搭得再漂亮,它总得有个地方跑。绝大多数人第一反应是——跑在自己电脑上。问题来了:你一下班关电脑,Agent也跟着"下班";你出差、睡觉、周末出门,它就躺在关机电脑里一动不动。凌晨三点有数据要盯、有报告要出,你的Agent正在那台关着机的电脑里"睡觉"。
更现实的是白天。你的电脑要干活、要开会、要打游戏、要装各种软件,Agent只能挤在角落里占着内存,时不时还得担心它跟别的程序打架。你很难为它腾出一台"专门、永远不关、随时待命"的机器。
这才是开源框架真正没法替你解决的部分:一个永远在线、随时待命的运行环境。 Harness给你的是聪明的大脑和灵活的手脚,但它给不了你一颗永远在跳的心脏。

四、真正的私人AI助手,是一台独立的硬件盒子
想清楚这一点,很多事就豁然开朗了。
真正的"私人AI助手",从来不是装在你电脑里的一个软件。软件的本质决定了它只能跟着你的电脑一起开机、一起关机。真正能称得上"助手"的,应该是一台独立的硬件盒子:
- 插上电就7×24小时在线,你关电脑、断网、出差,它都在运行;
- 你白天上班,它在家帮你盯数据、收邮件、整理资料;
- 你晚上睡觉,它错峰跑任务、出日报、监控异常;
- 第二天你醒来,成品已经摆在那,打开微信就能看结果。
云端AI也能"一直在线",但它们有两个绕不过去的代价:一是数据都躺在别人的服务器上,二是每跑一次任务都在按量计费。本地硬件盒子恰恰在这两点上相反——数据留在自己家,一次买断长期跑,这才是"私人"和"助手"这两个词能同时成立的前提。
五、搭得起,不等于跑得动
Agent框架越来越开源、越来越免费,这是整个行业的趋势,也是普通人的红利。但我们必须清醒:"搭得起"和"跑得动"是两码事。
框架开源,解决的是"人人都会搭";硬件常在线,解决的是"它真的能一直跑"。前者是门槛,后者是环境。门槛降下来了,环境没跟上,你搭出来的Agent依然是个"半成品"——聪明,但断电就歇。
所以真正拉开人与人差距的,早就不再是"你会不会用框架"。框架谁都能学,模型换一家就行。真正拉开差距的是:你的Agent有没有一个7×24小时在线的家。 有家的人,AI是全天候的劳动力;没家的人,AI只是你开机时间里的一个小工具。
六、铠盒AIBOX,就是那个"家"
说到这,答案已经呼之欲出了。
铠盒AIBOX就是这样一台独立硬件:它插电永不下线,出厂就预装了OpenClaw和Hermes两套智能体系统,开箱即用。你把开源的Codex Harness接进去、把模型API挂上去,它就能替你在后台7×24小时地跑。
最关键的一点是——数据存在本地的盒子里,不上传云端。你的Agent在干什么、记住了什么,只有你自己知道。这才是"私人"二字的真正含义。
把Codex Harness这样的大脑接进一台永不断电的盒子,你的Agent才算真正"活"了过来:白天替你打工,晚上替你值夜,你睡觉,它干活。
这才是开源时代最该想明白的一件事:框架可以免费,但那个让AI真正替你24小时干活的环境,值得你认真给它找一个家。
装一台在家里,微信搜「铠盒AIBOX」。
延伸阅读
- 关掉电脑之后,AIBOX能帮你自动完成哪些事 - 一篇看懂7×24小时都在干嘛
- 云端模型越强,本地AIBOX的价值为什么反而越大 - 端云协同的正确打开方式
- 用铠盒AIBOX建私有智能体 - 把你的Agent搬进自己的盒子
- 铠盒AIBOX商城 - 7×24小时为你工作的私人AI助手