📖 名词释义
AI Box(又称 AI盒子 / 智能体计算机 / Agent Computer),是一种专门运行 AI Agent 的本地硬件设备,预装智能体应用管理系统,开箱即用,7×24 小时在线运行。用户可以通过微信、飞书、企业微信、钉钉等社交软件远程指挥 AI 帮你干活。
摘要: 7月31日,DeepSeek在HuggingFace以MIT协议发布V4-Flash正式版(0731),没有发布会、没有新闻稿,直接把权重和技术报告挂上了网。与6月的预览版相比,正式版在Agent类基准测试上实现了断崖式跃升——DeepSWE从7.3分飙升至54.4分,提升超过7倍;Cybergerm从38.7到76.7接近翻倍;Terminal Bench 2.1从61.8到82.7。本文基于arXiv技术报告和HuggingFace模型卡,拆解正式版与预览版的核心差异、架构细节,以及对开发者和普通用户的实际意义。

一、先看数据:正式版和预览版到底差多少
DeepSeek官方在V4-Flash-0731的模型卡中公布了与预览版(V4-Flash Preview)及V4-Pro Preview的对比数据。所有Agent类测试均使用DeepSeek Harness、reasoning_effort设为max、temperature=1.0、top_p=0.95。
| Benchmark | V4-Flash 0731 | V4-Flash Preview | V4-Pro Preview | 提升幅度 |
|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | +33.8% |
| NL2Repo | 54.2 | 39.4 | 38.5 | +37.6% |
| Cybergym | 76.7 | 38.7 | 52.7 | +98.2% |
| DeepSWE | 54.4 | 7.3 | 12.8 | +645% |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | +41.4% |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | +132% |
几个值得注意的信号:
第一,DeepSWE的7.4倍跃升是最大亮点。 DeepSWE测试的是AI独立完成真实软件工程任务的能力——从理解代码库、定位问题、编写补丁到通过测试。预览版的7.3分基本属于"能写片段但无法独立交付",而正式版的54.4分意味着它已经能在超过一半的任务中独立完成端到端的软件开发工作。
第二,Cybergym接近翻倍。 Cybergym模拟的是网络安全攻防场景,需要AI在复杂环境中自主决策、调用工具、应对意外情况。从38.7到76.7的提升说明正式版在长链推理和工具调用稳定性上做了大量优化。
第三,Flash版在多项测试中反超Pro预览版。 这在DeepSeek的发布历史上并不常见——通常Pro版本是能力上限,Flash是速度优先的轻量版。但在Terminal Bench、NL2Repo、DeepSWE等项目上,0731正式版的Flash已经全面超越V4-Pro Preview,说明正式版的后训练(post-training)质量有了本质提升。
二、架构层面:正式版改了什么
MoE架构:284B总参数,13B激活
V4-Flash采用Mixture of Experts架构,每个token只激活256个专家中的6个,激活参数约13B,总参数约284B(HuggingFace界面显示约304B,差异源于tensor统计口径,官方技术报告以284B为准)。
预览版和正式版在架构骨架上一致——都是MoE、都支持百万token上下文。差异主要在后训练阶段:正式版经过了更多轮次的指令微调和强化学习,尤其是针对Agent场景(工具调用、多步规划、错误恢复)的专项优化。
CSA + HCA混合注意力
为支持1,048,576 token的上下文长度,V4采用了两种注意力机制的组合:
- Compressed Sparse Attention(CSA):对重要位置集中计算,而非对所有token对做稠密注意力
- Heavily Compressed Attention(HCA):对历史信息进行重度压缩,降低长上下文的KV cache开销
这使得模型在处理超长文档或长时间Agent对话时,内存占用和计算量不会随上下文长度线性爆炸。
DSpark投机解码
V4-Flash-0731内置了DSpark投机解码模块,在vLLM上配置为预测7个token、greedy采样策略。投机解码的原理是先用一个小模型快速生成候选token,再由主模型并行验证——预测准确时多个token一次通过,从而大幅提升生成速度。
mHC超连接 + Muon优化器
技术报告还提到了两项训练侧改进:Manifold-Constrained Hyper-Connections(mHC)用于改善深层网络的残差信息流,Muon优化器用于加速预训练收敛。这些是训练侧技术,不影响API调用方式,但解释了正式版能力跃升的部分来源。

三、API和工具链:能接Codex,但不是"原生对接"
V4-Flash-0731提供OpenAI兼容的Chat Completions API,支持/v1/chat/completions端点、messages多轮对话、tools/tool_calls函数调用、reasoning_effort参数(low/high/max三档),以及流式输出。
这意味着什么?任何支持自定义base_url的OpenAI兼容工具,理论上都可以通过配置接入V4-Flash。 包括Codex CLI、OpenAI SDK、LangChain等。接入方式只需设置三个环境变量:
DEEPSEEK_BASE_URL=<你的端点URL>
DEEPSEEK_MODEL=deepseek-ai/DeepSeek-V4-Flash-0731
DEEPSEEK_API_KEY=<你的密钥>
但需要明确几点:
- 这不是"原生对接"。 Codex没有内置DeepSeek provider,是通过OpenAI兼容协议配置接入的,部分高级功能(如structured output的完整支持、流式chunk格式)可能与OpenAI官方API存在细微差异。
- 公开端点是社区资源。 目前HuggingFace上由社区维护者Victor Mustar提供了一个运行在4×H200上的免费公开端点,速率限制约12请求/分钟/IP,不设SLA,不适合生产环境。
- 自部署需要重型GPU。 官方vLLM配置示例要求4×GB200节点,需要启用expert parallelism和FP8 KV cache。消费级硬件无法本地运行完整模型。
铠盒AIBOX的角色
对于希望长期使用V4-Flash的个人开发者和小团队,关键问题不是"能不能用",而是"怎么用最省心"。云API按量计费、公开端点速率受限、自部署又需要昂贵GPU——这正是铠盒AIBOX的价值所在:作为7×24小时在线的本地AI工作底座,它可以统一管理多个模型API的密钥和路由,DeepSeek便宜时切DeepSeek,其他模型打折时切其他模型,不用被一家厂商的定价绑架。同时,所有对话历史、工作文件、Agent配置都保存在本地硬盘上,不上传云端,创意和代码不会泄露。
四、和预览版的核心差异总结
| 维度 | 预览版(Preview) | 正式版(0731) |
|---|---|---|
| 发布时间 | 2026年6月 | 2026年7月31日 |
| 协议 | 预览许可 | MIT(完全开源) |
| DeepSWE得分 | 7.3 | 54.4(+645%) |
| Cybergym | 38.7 | 76.7(+98%) |
| Terminal Bench 2.1 | 61.8 | 82.7(+34%) |
| 工具调用 | 基础支持 | DSML内部格式优化,OpenAI tools协议更稳定 |
| 推理控制 | 有限 | 正式支持low/high/max三档reasoning_effort |
| DSpark | 未启用 | 内置7-token投机解码 |
| 生产可用性 | 研究预览 | MIT开源,可商用 |

五、对开发者和普通用户意味着什么
对开发者: V4-Flash-0731是目前Agent能力最强的开源模型之一,尤其在代码生成、终端操作、工具调用链路上提升显著。MIT协议允许商用,OpenAI兼容API降低了迁移成本。但公开端点不适合生产环境,建议通过官方API或自建推理端点使用。
对普通用户: 你不需要自己部署284B参数的模型。V4-Flash的能力提升会通过各种AI工具和平台逐步释放到用户侧——更聪明的编程助手、更可靠的自动化Agent、更流畅的长文档处理。关键是选择一个能灵活切换模型、保护你的数据隐私、且7×24小时在线的AI工作底座。
对行业: Flash版反超Pro预览版的现象说明,大模型竞争正在从"堆参数"转向"拼后训练质量"。同样的架构,经过更好的指令微调和强化学习,Agent能力可以有数倍提升。这对算力有限但工程能力强的团队是利好。
延伸阅读: - DeepSeek V4双版本实测:1M上下文+Flash极速模式 - 大模型涨价不用慌:铠盒AIBOX在手,哪家便宜切哪家 - Codex和Hermes到底什么区别?三个场景帮你选
DeepSeek #V4Flash #AIAgent #开源大模型 #Codex #铠盒AIBOX
了解更多 请搜索【铠盒AIBOX】 联系邮箱:[email protected]
铠盒AIBOX · 7×24小时为你工作的私人AI助手| AI前沿