DeepSeek Flash将于9月10日降价,使用AI工具能省多少要分清账单
DeepSeek Flash计划9月10日12时下调API价格。用白话读懂缓存输入、输出账单和V4 Pro请求迁移条件,区分会员与第三方工具费用。
DeepSeek Flash 系列计划从北京时间 2026 年 9 月 10 日 12 时起下调 API 价格,直接影响通过开放平台按使用量付费的人和软件服务商。API 可以理解为软件调用 AI 的接口。公告涉及这笔调用费;DeepSeek App 会员和第三方工具套餐是否调价,现有材料没有给出通知。
新价从中午起算,模型迁移还要等正式上线
这次价格表分为输入和输出。输入是交给模型的问题、背景资料等内容,输出是模型生成的回答。两边分别计费,单位都是每百万 Token。Token 是模型处理文字等内容时使用的小片段,不能把一百万 Token 直接当成一百万汉字,也不能据此换算成固定次数的聊天。
输入又分缓存命中和未命中。可以粗略理解为:模型能复用已经处理过的部分资料时,这部分输入按缓存命中价格计费;需要重新处理的部分,按未命中价格计费。能否命中取决于平台的缓存规则和实际请求,重复问一句话并不保证整次调用都享受最低价。
按公布的新标准,空闲时段每百万 Token 的缓存命中输入为 0.02 元,未命中输入为 1 元,输出为 4 元。高峰时段各项价格为空闲时段的两倍,对应 0.04 元、2 元和 8 元。0.02 元只对应空闲时段、缓存命中的输入部分。完整账单还要合并其他输入和输出费用。
作为参照,此前空闲时段三项价格分别为 0.05 元、1.50 元和 4.50 元,高峰时段分别为 0.10 元、3 元和 9 元。由旧价和新价计算,缓存命中输入降幅为 60%,未命中输入约降 33.3%,输出约降 11.1%。三项降幅不同,一份主要用于生成长回答的账单,与大量重复处理相同资料的账单,节省幅度会有区别。上述百分比是单价变化,不能直接套到所有用户的月支出上。
这轮降价发生在 8 月 17 日涨价之后。9 月 9 日的通知还给出新版本计划:DeepSeek V4.1 Flash 预计在北京时间 9 月 10 日前后正式发布。截至本期新闻窗口结束,即 9 月 10 日 06:01:21,本文依据的是发布预告,不能据此认定正式版本已经上线。调价的明确生效时刻与版本的预计发布时间,应分别理解。
新旧模型过渡也有条件。在 V4.1 Flash 正式上线之后、V4.1 Pro 上线之前,平台计划把所有发给 V4 Pro 的请求自动转交 V4.1 Flash 处理,并按 V4.1 Flash 单价计费。“请求迁移”说的就是这项安排;原先选了 Pro 的调用,在这一过渡期实际可能由 Flash 完成。
性能方面,DeepSeek 称,内部和外部多方测试显示,V4.1 Flash 在性能、费用、速度和总用时等指标上超过 V4 Pro。这属于官方对测试结果的表述,本文没有进行独立实测。相关报道还提到,中间版本采用新结构、原生支持多模态,即处理多种形式的信息;正式产品能处理哪些内容、各入口何时开放,仍须以实际发布说明为准。

输入和输出分别计费,缓存优惠只覆盖符合条件的输入内容;图为场景示意。
先看自己付给谁,再决定是否调整用法
对普通上班族和小店经营者,建议先看付款页面。如果买的是某款 AI 写作、客服或办公工具的包月套餐,费用由这家工具服务商收取。上游调用单价下降后,服务商是否调整套餐、赠送额度或维持原价,需要单独确认。API 降价不能推导出 App 会员降价,也不能推导出第三方工具自动降价。暂时没有调价说明时,继续按原套餐预算更稳妥。
已经按调用量付费的团队,可以在新价生效后核对一批账单,把输入、输出和缓存命中分别看清楚。假设一家网店每天用同一份商品说明起草客服回复,重复资料可能带来缓存复用的机会;能省多少还要看实际命中情况。让模型多写几版长文,会继续产生输出费用。为了追求低输入单价而增加无用内容,反而可能增加总支出。
模型过渡期则值得做一次小范围复核。比如让服务商用原有的商品问答或客户邮件样本跑一遍,看看新回答有没有漏掉退换货条件,语气是否符合店铺习惯。自动转交请求后,沿用旧名称的调用也可能换了实际处理模型。如果回复质量变差,应先暂停自动发送、改为人工确认,再请服务商说明处理办法。
没有技术团队的公司,无须因为单价变化专门搭建一套系统。先问现有工具是否会采用新模型、自己的付款方式会不会变,通常就够了。处理客户资料时仍需注意授权,报价、承诺和合同内容在发出前要有人复核。若平时只是偶尔整理几段文字,迁移工具、重新学习的时间也应计入成本。

更换处理模型后,先核对常用任务的回复,再决定是否继续自动发送。
消息参考来源
