卡码笔记-最强八股文
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
首页
计算机基础
C++
Java
Go
🔥大模型🔥
  • 大模型面经
  • Java面经
  • C++面经
简历专栏
秋招投递表
代码随想录 (opens new window)
  • 本栏必读

    • 卡码大模型专栏介绍
  • 大模型面经

  • 大模型动态

    • DeepSeek V4全系列正式版上线
    • Claude给文字打隐形水印
    • DeepSeek V4-Flash正式版上线
    • 长鑫科技上市与DRAM壁垒
    • GPT-5.6后不用Superpowers了
    • Claude Opus 5发布
    • Kimi K3发布
    • GPT-5.6发布
    • Claude Code为什么针对中国IP封号
    • DeepSeek招Agent Harness
    • Codex Record & Replay
    • Kimi K2.7-Code发布
    • GLM-5.2发布
    • MiniMax M3评测
    • DeepSeek V4发布
    • GPT-5.5发布
    • Claude Opus 4.7发布
    • Claude Opus 4.8发布
    • Claude Fable 5发布
    • Claude Fable 5重新开放
    • DeepSeek V4降价75%实测
    • DeepSeek V4-Pro永久降价75%
  • Claude学习专栏

  • 入门认知

  • Prompt与调用基础

  • RAG检索增强

  • Agent智能体

  • 微调认知

  • 部署与工程化

  • 多模态入门

  • Transformer原理

  • 手撕Transformer

  • 模型家族与Llama架构

# DeepSeek V4全系列正式版上线:Flash、Pro新定价,API最高涨12倍

前面写 DeepSeek V4-Flash 正式版 时,卡哥提醒过录友:峰谷定价已经在路上,但具体什么时候生效,要等官方公告。

现在时间和价格都定了。

DeepSeek V4 全系列模型正式版上线,API 将在北京时间 2026 年 8 月 17 日 00:00 执行新价格。

DeepSeek V4全系列API新定价

表面看,是高峰时段价格翻倍。

但把它和现在的 API 价格放在一起算,你会发现事情没这么简单:闲时价也涨了,部分项目在高峰时段最高变成当前价格的 12 倍。

# 这不是简单的“高峰翻倍”

先把价格摊开看,单位都是人民币元/百万 Tokens。

模型与计费项 当前价格 8月17日起闲时价 高峰价 高峰价是当前的
V4-Flash 缓存命中输入 0.02 0.05 0.10 5 倍
V4-Flash 缓存未命中输入 1.00 1.50 3.00 3 倍
V4-Flash 输出 2.00 4.50 9.00 4.5 倍
V4-Pro 缓存命中输入 0.025 0.15 0.30 12 倍
V4-Pro 缓存未命中输入 3.00 4.50 9.00 3 倍
V4-Pro 输出 6.00 13.50 27.00 4.5 倍

当前价格可在 DeepSeek 官方定价页 (opens new window) 查看;新价格以 8 月 17 日生效的公告为准。

这里最容易被误读的是:新表里的“闲时”并不等于现在的常规价。

以输出为例,V4-Flash 从 2 元涨到闲时 4.5 元,V4-Pro 从 6 元涨到闲时 13.5 元,都是当前价格的 2.25 倍。到了高峰,再在闲时价的基础上翻倍。

缓存命中价涨得更明显。V4-Pro 从 0.025 元变成闲时 0.15 元、高峰 0.30 元,高峰价是当前的 12 倍。

缓存命中本来就便宜,所以绝对金额仍然不高。但如果你的系统依赖超长固定前缀、大量复用 Prompt,这个变化会直接改掉原来的成本模型。

# 每天7小时高峰,Agent白天跑要重新算账

官方划定的高峰时段是北京时间:

  • 9:00—12:00
  • 14:00—18:00

一天一共 7 小时高峰、17 小时闲时,其余时间都按闲时价计算。

这两个时间段刚好覆盖国内团队白天最集中的开发和业务调用。早上让 Claude Code 扫仓库,下午批量跑 PR Review、日志分析和子 Agent,基本都会撞上高峰。

举个简单的账。

假设一次批处理消耗 1000 万未命中输入 Tokens,加 300 万输出 Tokens:

模型 当前价格 新闲时价格 新高峰价格
V4-Flash 16 元 28.5 元 57 元
V4-Pro 48 元 85.5 元 171 元

同一批任务,代码没变、Prompt 没变,只是运行时间不同,成本就能差一倍。

以后调用 DeepSeek,调度时间也成了模型选型的一部分。

# 以后如果用DeepSeek需要注意的点

第一,把在线请求和离线任务拆开。 用户正在等待的问答、代码补全没法躲高峰,但代码扫描、文档索引、批量评测、日报生成完全可以排到 18 点以后。

第二,别只统计总 Tokens。 至少要把模型、缓存命中与未命中、输入与输出、高峰与闲时分别记下来。否则月底只看到总账单上涨,很难知道问题出在哪。

第三,给 Agent 加预算和停止条件。 Agent 一旦反复读文件、重复调用工具、失败后无效重试,贵的不只是输出。高峰期每一次空转都按双倍新价格扣费。

第四,按任务路由模型。 可批量、能验收、失败成本低的任务继续优先用 V4-Flash;复杂推理再上 V4-Pro;关键跨模块改动和长链路 Agent,则要把稳定性与人工复核成本一起算。

这也是为什么不能只盯着“每百万 Tokens 多少钱”。真正该比较的是:完成同一个任务,总共花多少钱,失败后还要返工几次。

# 不要闭眼全量切换

从预览版到全系列正式版,说明 V4-Flash 和 V4-Pro 的产品阶段往前走了一步。

但这次公告给出的核心信息是正式版和新定价,没有给出新的版本号、评测成绩或接口迁移说明。不要把“正式版”自动脑补成能力全面大升级。

已经接入 deepseek-v4-flash 和 deepseek-v4-pro 的项目,先盯官方更新日志和 8 月 17 日后的实际账单,再决定是否扩大流量。

模型怎么选,还是那套账:

  • 量大、可延迟、能自动验收,DeepSeek V4 仍然值得用,但尽量放到闲时。
  • 失败代价高、需要长时间自主执行,优先看任务成功率,可以对比 Claude Opus 5。
  • 需要国产模型、预算又比较敏感,也可以把 GLM-5.2 放进同一套真实任务里测,不要只比厂商跑分。

不是站队,是算账。

# 最后

一是别把闲时价当成原价。 新闲时价已经上调,高峰是在新闲时价上再翻倍。

二是别只拿缓存命中价做预算。 是否命中取决于请求前缀能不能复用。真实业务里只要 Prompt、上下文或路由方式变化,未命中输入才是更应该保守估算的价格。

三是别等账单出来才迁任务。 先从日志里找出最耗 Tokens、又不要求实时完成的任务,把它们移出 9:00—12:00 和 14:00—18:00,收益最直接。

DeepSeek V4 正式版上线当然是好事,但这次对开发者影响更直接的,其实是价格规则变了。

以前是选哪个模型。

现在还要多问一句:这个任务,非得白天跑吗?

加油

Last Updated: 8/14/2026, 11:19:42 PM

← 大模型面经汇总 Claude给文字打隐形水印 →

评论

验证登录状态...

侧边栏 侧边栏
夜间模式 夜间
卡码简历 卡码简历
代码随想录 代码随想录
卡码投递表 卡码投递表🔥
2026实习校招群 2026群
添加客服微信 2026实习校招客服微信 PS:通过微信后,请发送姓名-学校-年级-2026实习/校招
支持卡码笔记 支持卡码笔记
鼓励/支持/赞赏Carl 卡码笔记赞赏码
1. 如果感觉本站对你很有帮助,也可以请Carl喝杯奶茶,金额大小不重要,心意已经收下
2. 希望大家都能梦想成真,有好的前程,加油💪