DeepSeek V4 Pro vs V4 Flash
同一代 V4 系列(1.6T MoE、1M 上下文、384K 最大输出)的两个档位:Flash = 快而便宜的量产款, Pro = 慢而贵的旗舰款。两者都支持工具调用、FIM 补全、Responses API 与 Anthropic 兼容接口。
01一句话总结
两者的核心差异是「推理强度 vs 成本 / 速度」的取舍。日常简单任务两者差距已经很小, 但在多文件大型重构、疑难调试、长链条推理这类复杂任务上,Pro 明显更强。 编程场景里,Flash 是性价比主力,Pro 是攻坚武器。
02核心对比表
| 维度 | deepseek-v4-flash | deepseek-v4-pro |
|---|---|---|
| 定位 | 性价比 / 快速响应,量产主力 | 旗舰 / 最强推理,攻坚主力 |
| 编程能力SWE-bench Verified(第三方口径) | 约 54正式版重训后从 7 大幅提升 | 约 80Pro-Max 第三方榜单口径 |
| 相对成本 | 1× | 约 3× |
| 上下文 | 1M 输入 / 384K 输出 | 1M 输入 / 384K 输出 |
| 功能 | 工具调用 · FIM · Responses API · Anthropic 兼容 | 同左 |
| 输出风格 | 偏冗长(第三方实测) | 更精炼 |
03编程能力差别
简单任务 —— 两者差不多
改 bug、写单个函数、补注释、小重构、生成样板代码:Flash 完全够用,响应还更快,性价比明显更高。
复杂任务 —— Pro 明显更强
- 多文件大型重构:跨模块的一致修改、接口迁移,Pro 更能一次把握全局。
- 疑难调试:跨模块状态、并发问题、栈溢出等需要长链条推理的场景。
- 算法题 / 长链条推理:需要多步推导的任务,Pro 出错更少。
正式版 Flash 重训后(agent 能力从 7 涨到 54)大幅改善了这些短板,但"最吃推理"的那部分仍是 Pro 的领域。
Agent 场景 —— 关键点
像 dsh 这种会连续调几十次工具、跑很长的 agent 循环,中间任何一步推理出错都会级联放大。 Flash 的 agent 能力已逼近 Pro,但差的那部分恰好体现在最吃推理的场景上: 一个关键步骤选错方案,后续所有步骤都会跟着错。
flash适合
- 日常问答、改 bug、写单函数
- 大批量 / 并行的子代理与 workflow
- 探索性、试错型任务
- 对成本敏感的长任务
pro适合
- 大型重构与架构设计
- 疑难调试、长链条推理
- 需要"一次做对"的关键步骤
- 追求最优解而非省钱
04给 dsh 使用者的建议
1 · 混合策略最划算
默认用 Flash 跑日常(省约 3 倍成本,速度还快);遇到大重构、疑难调试时,用输入框的模型选择器(或 /model 命令)临时切到 Pro,干完再切回来。
2 · 注意成本放大
dsh 的 agent 循环、子代理并行、workflow 会把 token 消耗放大数倍到数十倍,Flash / Pro 的价差也会被同样放大——大批量派活时用 Flash 更明智。
3 · 推理强度同样重要
Pro 配 high / max 才是满血;想省钱时 Pro + low 介于两者之间。选对档位比选对模型更省。
05成本一览(峰谷计价,元/百万 tokens)
| 模型 | 时段 | 输入(缓存未命中) | 输出 | 输入(缓存命中) |
|---|---|---|---|---|
| v4-flash | 低谷 | 1.5 | 4.5 | 0.05 |
| v4-flash | 高峰 | 3.0 | 9.0 | 0.10 |
| v4-pro | 低谷 | 4.5 | 13.5 | 0.15 |
| v4-pro | 高峰 | 9.0 | 27.0 | 0.30 |
官方推行峰谷定价,高峰时段价格约为低谷的两倍。Pro 的输入 / 输出单价约为 Flash 的 3 倍。