DeepSeek V4:1.6万亿参数+100万上下文,开源模型的新天花板

DeepSeek V4:1.6万亿参数+100万上下文,开源模型的新天花板

DeepSeek V4:1.6万亿参数+100万上下文,开源模型的新天花板

1.6万亿参数听着吓人,但每次推理只激活49B。100万token上下文不是PPT数字,是默认值。DeepSeek V4来了,开源模型的天花板又被顶高了一截。

2026年4月24日,DeepSeek在官网低调上线了V4 Preview。没有发布会,没有Sam Altman式的直播,就一个API文档页面和HuggingFace上的权重文件。但就是这个安静的发布,在接下来的72小时里炸翻了整个AI社区——CNBC、Forbes争相报道,Reddit上讨论帖刷屏,HuggingFace模型下载量直接拉爆。

为什么?因为DeepSeek V4不仅把开源模型的参数量推到了1.6万亿,更重要的是:它让100万token上下文成为了默认配置,而不是昂贵的可选增值。

一、DeepSeek V4:1.6万亿参数,但49B在干活

先说最核心的架构。DeepSeek V4延续了MoE(Mixture-of-Experts)路线,但规模比V3翻了一倍不止:

指标 DeepSeek V3 DeepSeek V4 Pro
总参数量 671B 1.6T(2.4倍)
每token激活参数 37B 49B(1.3倍)
上下文窗口 128K 1M(8倍)
最大输出 8K 384K
注意力机制 MLA Token-wise压缩 + DSA
API兼容 OpenAI格式 OpenAI + Anthropic双格式

1.6万亿参数,这个数字确实唬人。但MoE模型的精髓就在于:不是所有参数都同时工作。V4 Pro每次推理只激活49B参数,占总参数的3%左右。换句话说,这1.6万亿参数像是一个超级庞大的专家库,每次只请出最相关的几位”专家”来处理当前任务。

这种设计带来的好处是显而易见的:

  • 推理成本可控:49B激活参数意味着推理算力需求远低于1.6T参数的”全量模型”
  • 专家多样性:1.6万亿参数分布在更多专家中,模型能覆盖更广的知识域
  • 长尾能力提升:罕见任务能找到更对口的专家,而不是靠通用能力硬扛

和V3相比,V4最大的架构变化不是参数量,而是注意力机制。V3用的MLA(Multi-head Latent Attention)被替换为Token-wise压缩 + DSA(DeepSeek Sparse Attention)。简单来说,V4不再把过去所有token当成一个扁平列表来处理,而是把历史信息压缩成摘要,按需检索,同时保留一个小的精确局部窗口。这正是100万上下文能”跑起来”的关键——没有这个压缩策略,1M上下文的KV Cache能把任何GPU的显存吃干。

二、100万上下文:到底能塞多少东西

100万token是什么概念?我来算一笔账:

  • 英文文本:约750万字,大概相当于7-8本《哈利波特》
  • 中文文本:约150-200万字,约等于10-15本中等长度的小说
  • 代码:一个中等规模的完整代码库(含所有依赖和注释)
  • 学术论文:约200-300篇arXiv论文的全文

而且这100万不是某个”长上下文模式”需要特殊开关才能开启的——它是V4所有官方服务的默认值。Pro和Flash都一样,开箱即用。

更关键的是V4的缓存命中价格。Pro的缓存命中输入价格是$0.003625/百万token,比缓存未命中的$0.435便宜了120倍。这意味着什么?Agent工作流中反复重发相同的系统提示和文件上下文,成本几乎可以忽略。相比之下,Claude Opus 4.8的缓存命中价格是$0.50/百万token——两者差了138倍。

384K的最大输出同样值得关注。之前大多数模型的输出上限在4K-8K,V4直接拉到384K。这意味着你可以让模型一次性生成一整本小说、一份完整的技术文档、或者一次性重构整个代码模块,不用分段拼接。

三、Pro vs Flash:旗舰和省钱的怎么选

DeepSeek V4是DeepSeek第一次采用双型号发布策略,这也反映了一个现实:不是所有场景都需要旗舰模型。

规格 V4 Pro V4 Flash
总参数 1.6T 284B
激活参数 49B 13B
上下文/最大输出 1M / 384K 1M / 384K
输入价格(缓存未命中)/百万token $0.435 $0.14
输入价格(缓存命中)/百万token $0.003625 $0.0028
输出价格/百万token $0.87 $0.28
并发限制 500 2500
SWE-bench Verified 80.6% 暂无独立评测

选Pro的场景:复杂推理、代码生成、知识密集型任务、需要最高质量的Agent工作流。Pro在SWE-bench Verified上拿到80.6%,和Gemini 3.1 Pro并列开源模型最高分,但价格只有后者的1/14。

选Flash的场景:大规模批量处理、简单对话、快速分类、作为Agent的子任务模型。Flash的输出价格只有Pro的1/3,并发限制是Pro的5倍,吞吐量碾压。

一个实战中非常实用的策略:Pro做主控,Flash做子任务。DeepSeek官方的Claude Code集成方案就是这个思路——主模型用V4 Pro,子代理(subagent)用V4 Flash。复杂决策走Pro,简单操作走Flash,整体成本可以压到纯Pro方案的30-40%。

而且Flash还有一个隐藏优势:它可以本地部署。284B总参数/13B激活,量化后能跑在单张80GB GPU(如H100)上,两张48GB显卡也能搞定。这是开源模型第一次让”前沿级能力 + 可本地运行”成为现实。

四、Agent优化:为什么说它是给Claude Code准备的

DeepSeek V4发布时,有一个细节被很多人忽略了:官方专门开了一个Agent集成指南页面,详细说明如何将V4接入Claude Code、OpenCode和OpenClaw。这不是随口提提的——DeepSeek甚至专门发布了一个GitHub仓库deepseek-ai/awesome-deepseek-agent,收录了20种编码工具的集成配置。

以Claude Code为例,配置简单到令人发指:

export ANTHROPIC_BASE_URL="https://api.deepseek.com/anthropic"
export ANTHROPIC_AUTH_TOKEN="sk-your-deepseek-key"
export ANTHROPIC_MODEL="deepseek-v4-pro"
export ANTHROPIC_SMALL_FAST_MODEL="deepseek-v4-flash"
claude

四行环境变量,就把Claude Code从Anthropic的API切换到了DeepSeek V4。不需要代理,不需要中间件,因为DeepSeek V4原生支持Anthropic API格式。这在V3时代是没有的——V3只支持OpenAI格式,要用Claude Code还得自己搭转换层。

为什么DeepSeek要专门为Agent场景做优化?因为Agent是2026年大模型最核心的应用场景。一个典型的Agent工作流,一次任务可能涉及几十次API调用,每次都要带上大量上下文(系统提示、文件内容、对话历史)。这时候两个因素决定了体验:

  1. 上下文长度:100万token意味着可以把整个代码库塞进去,不用精心裁剪上下文
  2. 缓存命中成本:Agent反复重发相同上下文,缓存命中价格$0.003625/百万token,几乎是白送

DeepSeek自己的内部编码已经在用V4驱动的Agent工作流了。官方原话:”Already driving DeepSeek’s in-house agentic coding。” 吃自己的狗粮,这才是真的有信心。

如果你想在Agent场景中进一步省钱,可以看看我们之前的多模型路由免费API方案,把不同任务路由到不同模型上,Pro和Flash灵活切换。

五、本地跑V4?别想了,但API真香

先说结论:V4 Pro基本不可能在个人硬件上本地运行。1.6万亿参数,即使FP8混合量化,也需要多节点GPU集群。vLLM官方文档给出的是”单节点部署用于测试”,前提是你有一台装满H100的机器。

V4 Flash则是另一回事。284B总参数,量化后可以跑在:

  • 单张H100(80GB)
  • 2×RTX 4090(48GB×2,使用Unsloth GGUF构建)
  • 等效的多卡消费级方案

Flash是开源社区第一次拥有一个”前沿级能力 + 个人可部署”的模型。13B激活参数的性能接近V4 Pro,这在小参数量模型中前所未有。

但说实话,对大多数人来说,本地部署V4 Flash的意义更多在于数据隐私和离线可用,而不是性价比。DeepSeek的API价格已经低到让人怀疑人生:

  • V4 Flash:$0.14/百万输入,$0.28/百万输出
  • 每天花20次请求,每次50K输入+10K输出,一个月大约$6
  • 同样的用量,Claude Opus 4.8大约$300/月,GPT-5.5大约$330/月

1美元能买多少输出token?

模型 输出token/美元
V4 Flash 357万
V4 Pro 115万
Gemini 3.1 Pro 8.3万
GPT-5.4 / Sonnet 4.6 6.7万
Opus 4.8 4万
GPT-5.5 3.3万
Claude Fable 5 2万

这个价格差距已经不是”便宜一点”了,是量级上的碾压。如果你还在为API账单发愁,可以看看我们的API中转站省钱方案,统一入口管理多个模型API,还能享受缓存优惠。

想了解各种本地推理方案的横向对比?参考我们的本地推理对比评测,从llama.cpp到vLLM,哪个方案适合你一目了然。

六、省钱实战:Flash路由到Agent工作流

理论说完了,来点实战。下面是一个真实的Agent工作流省钱方案,基于Claude Code + DeepSeek V4:

方案架构

用户请求
  ↓
Claude Code(主控)
  ├→ 复杂推理/代码生成 → V4 Pro
  ├→ 文件搜索/简单修改 → V4 Flash  
  ├→ 上下文理解/总结 → V4 Flash
  └→ 最终决策/审查 → V4 Pro

关键配置

# 主模型:V4 Pro,处理复杂任务
export ANTHROPIC_MODEL="deepseek-v4-pro"
# 快速模型:V4 Flash,处理子任务
export ANTHROPIC_DEFAULT_HAIKU_MODEL="deepseek-v4-flash"
# 子代理:V4 Flash,并行小任务
export CLAUDE_CODE_SUBAGENT_MODEL="deepseek-v4-flash"
# 推理强度拉满
export CLAUDE_CODE_EFFORT_LEVEL="max"

成本估算

以一个典型的编码Agent工作流为例:

  • 每次任务平均15轮API调用
  • 每轮平均50K输入token(含系统提示+文件上下文)
  • 其中约80%的输入是重复的(缓存命中)
  • 主模型输出约2K,子任务输出约8K

纯Pro方案:

  • 缓存命中输入:15 × 40K × $0.003625/M ≈ $0.002
  • 缓存未命中输入:15 × 10K × $0.435/M ≈ $0.065
  • 输出:15 × 10K × $0.87/M ≈ $0.13
  • 单次任务约$0.20

Pro+Flash混合方案:

  • Pro调用5次,Flash调用10次
  • Pro部分:约$0.08
  • Flash部分:约$0.03
  • 单次任务约$0.11

对比纯Claude Opus 4.8方案,同样任务大约$1.5-2.0。省钱90%以上,质量差距在多数编码场景中可以接受。

避坑提醒

  1. Flash不适合复杂推理:虽然Flash的简单Agent任务接近Pro水平,但多步推理、复杂数学、深层代码理解还是Pro更靠谱
  2. 注意缓存策略:DeepSeek的缓存命中有120倍的价格差,确保你的Agent框架不会每次都重新发送完整上下文
  3. API格式选择:如果你用Claude Code,选Anthropic格式;如果用OpenCode,选OpenAI格式。别混用
  4. 并发限制:Pro只有500并发,Flash有2500。高并发场景优先考虑Flash
  5. 旧模型退役:deepseek-chat和deepseek-reasoner将在2026年7月24日15:59 UTC后完全停用,届时会自动路由到V4 Flash。如果你的代码里还用旧模型名,尽快更新

写在最后

DeepSeek V4的意义不只是”又一个大模型”。

它证明了几件事:MoE架构在1.6T参数规模上依然work,而且激活参数可以控制在49B;100万上下文不需要天价硬件,Token-wise压缩+DSA是可行的工程方案;开源模型可以在编码Agent场景中和闭源模型正面对抗,而成本只有后者的1/30。

当然,V4也不是没有短板。创意写作和UI生成方面,它和Claude系列、GPT系列还有差距。但如果你主要用的是推理、知识检索、代码生成这些场景——特别是Agent工作流——DeepSeek V4目前就是性价比之王。

没有之一。


by 数码罗记·godsun.pro

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注