2.8万亿参数,开源模型第一次摸到了闭源旗舰的脚后跟
📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
7月16号,世界人工智能大会开幕前一天,月之暗面扔了颗炸弹——Kimi K3发布,2.8万亿参数,全球最大开源模型。
新华社当天就发了报道,标题写的是"标志着我国AI模型发展迈出新的一步"。这话一点不夸张。从K1追到K2再到K3,月之暗面在这条开源路线上磕了快两年,这次直接把参数规模拉到了3万亿级别——之前这个级别的数字只属于GPT-5.6和Claude Fable 5这种闭源巨头。
更值得关注的是,K3不是那种"参数大到你跑不动"的实验室展品。它同步上了API服务、开发者文档、OpenAI SDK兼容调用,而且7月27号会把完整权重向社区开放。这也是铠盒AIBOX一直在推动的方向——当超级模型不再被一家公司锁死,任何有算力的团队都能在自己的服务器或者像铠盒AIBOX-A1这样的独立AI硬件上,自由接入当下最强的模型。这个变化对产业的影响,比参数数字本身大多了。
K3凭什么2.8万亿参数还能跑得动
得先讲点技术。但说人话。
传统Transformer的注意力机制有个数学死结:计算量是上下文长度的平方。你翻一倍长度,算力翻四倍。所以大部分模型嘴上说支持几十万token,真塞一篇50万token的代码库进去分析,算不动。
K3的解法叫KDA——Kimi Delta Attention,一种混合线性注意力。简单讲,它不跟所有token都算一遍关系,只盯序列里发生变化的部分,把长文本的计算量从平方压到了近似一条线。所以100万token对K3来说不是硬扛出来的,是架构层面就这么设计的。
配合KDA的还有一样东西:Attention Residuals,注意力残差。传统深度学习里残差连接是用来防止深层网络"忘掉"浅层信息的,K3把这个逻辑搬到了注意力内部——每层的注意输出不光看当前层算出来的东西,还带着前面几层注意力的"记忆残留"。效果就是模型在长篇推理时不会把开头抓到的逻辑联系在半路丢了。
然后是MoE,混合专家。K3总共896个专家模块,但每次推理只叫16个出来干活。这招OpenAI和Anthropic都在用,但K3那个896取16的稀疏比例相当激进——专家越多,脑子里的知识越多;每次激活越少,跑起来越省钱。
这三件事放在一起——KDA管长文效率、残差注意力管推理不走神、MoE管知识量和成本的平衡——才让2.8万亿规模真的能用起来。缺哪样都不行。

编程登顶,推理咬住旗舰,还长了眼睛
数据说话。
编程:Frontend Code Arena榜单上1679分,干掉了Claude Fable 5排第一。这个榜测的不是会不会写if-else,是能不能理解整个前端项目、自己找bug、跨文件改代码——正经软件工程级别的编程。K3特别强化了Agentic Coding,说白就是让模型像真程序员一样,看懂代码库、自己调工具、跑测试、出了错自己修,不用你把上下文反复往里扔。
推理:官方的口径很克制——"整体仍落后于GPT-5.6 Sol和Claude Fable 5,但稳定超越了其他所有模型"。注意这个"稳定超越其他所有"。除了那俩闭源旗舰,K3跟剩下的所有模型——开源闭源、国内国外——都拉开了差距。从K1追到K2接近,K3只剩最后两个对手没超过,这个爬坡速度本身就够说明问题了。
视觉理解经常被人忽略,但很重要。K3原生吃进了图文数据,不是外挂图片识别模块。同一个模型能直接看图、读表、理解设计稿,对日常工作里经常要切来切去处理不同格式的场景——审合同看扫描件、翻竞品页面截屏、做行业报告分析图表——效率差距是肉眼可见的。
上下文100万token,大概75万汉字。《三体》全套也就90万字出头,K3差不多一次能啃掉大半。高复杂度任务里——全量代码审计、整本财报分析——超长窗口管不管用取决于两个事:能不能真处理这么长,处理的时候会不会逻辑断裂。KDA和残差注意力的组合在理论上给出了答案,得看7月27号开源后社区的实测。
API价格亲民,但藏着几个坑
定价挺实在。输入每百万token 3美元,缓存命中3毛,输出15美元。比一下:Claude Sonnet输出也是15美元级别,但Claude Fable 5输出要75美元。K3的能力在大部分任务上接近那俩闭源旗舰,价格对标次旗舰Sonnet。账很好算:用二线的价格拿到准一线的货。
不过有几个坑。
第一,K3现在强制开Thinking模式(思维链推理)。每次调用会多吞不少思考和推理token,实际账单比输入输出加起来的数要高一截。月之暗面说后续会加low和high模式,但现在这个设计说明K3还在靠"多想一步"填跟旗舰的差距,不是认知层面就拉平了。
第二,Kimi API的用户协议里写了数据可能用于模型训练。个人用没啥感觉,企业如果有合规压力(金融、医疗、内部代码),这条得仔细看。也是个提醒:模型开源了不等于你的数据归你管,API服务的协议条款跟权重许可完全是两码事。这恰好是铠盒AIBOX这类本地硬件的底层逻辑——数据从硬盘到模型全程不出门,谁家API协议怎么改都跟你没关系。
第三,2.8万亿参数就算开源了,真在自己机子上跑?门槛太高了。哪怕量化过的版本,没有几张A100/H100扛不住。大部分团队和个人走API比自建实际得多。好在铠盒这种独立的AI盒子,本身就是"不管模型跑在哪、你只需要一个统一入口来调度"的设计——模型在云端API还是本地小模型,切起来都是同一个界面。

开源追到闭源脚后跟,代差只剩几周
2024年圈子里还在吵"开源永远追不上闭源"。2025年DeepSeek R1和Kimi K2把差距缩了。到2026年7月K3出来,差距可能只剩几周。
数据不会骗人。K3编程榜干掉了Fable 5,综合推理跟GPT-5.6 Sol没差太远。GPT-5.6是今年4月才出的,Claude Fable 5是6月——这俩闭源旗舰上线不到三个月,开源模型已经咬上来了。中美AI代差从2024年的"差一年"缩到现在"差几周到几个月"。
硅谷以前的叙事是:中国的开源模型参数是多,但能力不行,大而无用。K3把这个叙事打脸了。2.8万亿不单是大,是真能在几个核心指标上跟美国最好的闭源系统掰手腕。而且权重会开放——全球开发者、创业公司、研究机构都能拿这个基座去微调、定制、二次创新。
有个事基本确定了:DeepSeek证明了开源可以比闭源便宜,K3证明了开源可以在绝对能力上接近闭源。下一步如果有家公司拿K3权重微调出一个在特定领域打败Fable 5的垂直模型,一点都不意外,几个月内大概就能看到。对铠盒AIBOX的用户来说,这意味着什么?意味着你手上的硬件不需要升级,新的最强模型一出来,API一切换,能力原地跃迁。
这对你有啥关系?
简单说。一年前想用好AI,就两个选择:ChatGPT Plus每月20刀,或者Claude Pro每月20刀。用的模型什么水平、怎么训的、底层逻辑是啥——全是黑盒。人家升你就跟着好,涨价你就只能认。
现在K3这种级别的东西开源了,选择权从模型公司手上回到了用的人手上。不用绑死任何一家。今天K3便宜用K3,明天DeepSeek出新版本更便宜就切,后天谁拿K3权重微调了个文案专用版,直接接进来就行了。
多模型调度的精髓就在这——不是"挑最好的那个用一辈子",是"随用随换,永远用当下最合适的那款"。这个能力需要一个不依赖任何单一平台的硬件来承接。你没法在ChatGPT里切到K3,也没法在Kimi的App里直接调DeepSeek。铠盒AIBOX-A1做的是把这件事物理化——你切模型跟在电视上换频道一样,遥控器在自己手里。
几个真实风险
K3虽然开了权重,但2.8万亿参数的本地部署门槛高到你没法在自己电脑上跑。7月27号开源后社区出来的量化版、蒸馏版、第三方托管服务,才是决定K3到底多快普及的关键。别指望那天就能直接下载装上,没那么简单。
Thinking模式强制开,推理速度确实是慢的。如果你要用在实时对话、在线客服这种延迟敏感的场景,等后续低思考模式,或者直接用DeepSeek这种快的。
API数据协议对企业是暗坑。内部研发用的话,建议别直接上API,等权重放了自建部署——虽然硬件贵,但数据在自己盘里比什么都踏实。用铠盒AIBOX这类本地设备也是一个思路:数据不出门,就算用外部API也是中转一下,原始对话和记忆全留在你自己的硬盘上。
月之暗面自己说了,K3整体还是落后GPT-5.6 Sol和Claude Fable 5。编程登了顶,推理超了Opus 4.8,但跟那俩旗舰比还有差。能自己承认这点比那种"遥遥领先"的宣传可信多了。
K3真正的意义不在它是不是世界第一。它证明了开源模型追到闭源旗舰脚后跟,已经不用等五年十年——几个月一轮迭代就够了。定价格局、开发者的选择权、普通用户的成本,都会被这个事实永久改变。
延伸阅读
- 豆包千问同一天砍智能体——你的AI随时可能没了,只有私有化才真正属于你 — 平台随时砍功能,数据安全不是口号
- 为什么要把AI装在独立盒子里而不是电脑上 — 独立AI盒子对比PC方案的三个核心优势