32天就下架 DeepSeek为何对自家旗舰下狠手
从正式发布到被Flash接替,DeepSeek只给V4 Pro正式版留了32天。9月10日,DeepSeek发布V4.1 Flash,同时宣布:从北京时间9月14日中午12点起,官方API中发给V4 Pro的请求,将全部由Flash接手,并按更低的Flash价格收费。这项安排会一直持续到V4.1 Pro推出。

V4 Pro从4月24日开始提供预览版,8月13日才正式发布。正式版上线还不到一个月,公司就已经定好了它的"退场时间"。
更值得追问的是,DeepSeek为什么不把Pro降价保留下来,或者干脆等下一代Pro准备就绪,再让两者正常交班?
我的判断是,V4 Pro仍有强项,却已不值得DeepSeek继续单独投入算力。让架构更高效、已在多项智能体测试中反超的V4.1 Flash接手,既能降低公司的运行开销,也能把用户的账单降下来。
01 Flash追上了Pro上个月主打的方向
一个月前,V4 Pro正式版上线,它主打的方向非常明确:智能体、代码编程和工具调用。DeepSeek当时为它开放了不同推理强度,还专门适配了Codex,希望它能接下更复杂、流程更长的工作。

但正式版上线当天就出了状况:官网通知和开放平台公告一度撤下,当晚才恢复,期间API调用入口始终保留。另据媒体报道,部分开发者还反馈模型思考时间过短、长任务中途提前结束,同一道题隔几个小时再跑,结果也可能差别很大。
紧接着的涨价,又抬高了它要兑现的标准。8月17日起,Pro高峰时段的输出价格从每百万Token 6元涨到27元,是原来的4.5倍。对已经觉得表现不稳的开发者来说,这笔多出来的支出,很难说换回了对应的提升。
现在,新发布的Flash恰好在这些关键方向上赶了上来。
官方数据显示,在软件工程测试DeepSWE v1.1和办公自动化测试AutomationBench中,Flash分别以74.2分和54.8分,大幅领先V4Pro的62.7分与43.2分。新模型打赢的,恰恰是Pro上个月主推的任务。

Pro并非每项都输。在不调用工具的HLE纯文本子集中,它仍以42.7分领先Flash的39.1分;但在允许使用工具的完整HLE测试中,Flash拿到了63.9分,高出Pro的60分。此外,在后训练前的基础模型对比里,Pro仍在SimpleQA-Verified知识问答和LongBench-V2长文本测试中保持领先。
因此,DeepSeek官方公告中的"全面超越",不能简单理解为每个分项都胜出。Pro依然有擅长的事,对恰好需要这些特定能力的用户来说依然有价值。真正发生动摇的,是旗舰产品原有的商业定位。
过去,开发者和企业很容易理解两档模型的划分:预算有限选Flash,复杂长任务交给更贵的Pro。如今Flash已在多项主流智能体测试中反超,Pro很难再靠"更贵,但普遍更强"的标签说服市场。广泛领先足以支撑一档面向大众的高客单价旗舰;但如果只在部分细分任务里占优,公司就必须重新核算:还有多少人离不开这些能力,愿意为此多付多少溢价,又是否值得专门划拨算力集群来支撑。
公开资料还没有给出具体的成本和用户细分账本。但从DeepSeek的产品动作来看,它显然放弃了为旧Pro保留一个独立专属档位的念头。
02给Pro降价,省不下运行它的开销
如果问题仅仅在于Flash便宜,Pro自然也可以跟着降价促销。难处在于,降价只能改变账单上的数字,却改变不了模型底层的物理消耗。
按照官方模型卡披露的数据,V4 Pro每个Token激活的参数量高达490亿。而V4.1Flash将处理输入与生成回答解耦,分别仅激活80亿和160亿参数。参数比例固然不能直接等同于成本降幅,但两者每一次前向推理所调用的计算规模已完全不在一个量级。
新架构还在大幅压缩长上下文任务的存储开销。相比V4 Flash,V4.1 Flash的全局KV缓存占用降到了约四分之一,持久化KV缓存占用的SSD空间降到了约八分之一。智能体运行需要反复读取上下文代码、参考文档和外部工具返回的数据,缓存专门用来存放大模型计算过的历史状态。一旦任务周期拉长、并发量攀升,存储显存就会迅速见底。Flash要解决的从来不只是答对一道题,还有海量并发任务同时跑起来时的资源挤兑。

DeepSeek在发布公告中直接谈到,更高的架构效率让公司能以更低成本承载更多并发,因此顺理成章地下调了价格。
截至9月11日,按谷时每百万Token计算,V4 Pro未命中缓存的输入价格为4.5元,输出为13.5元;V4.1Flash对应则只要1元和4元(两款模型的峰时价格均为谷时的两倍)。随着切换落地,原本昂贵的Pro接口,收费也会直接降到Flash的水平。
两者定价差异虽然不等同于DeepSeek真实的物料成本,但策略指向十分清晰:用高效率的新架构全面承接老接口的请求,再把节省下来的硬件成本让渡给市场。给Pro降价,平台仍要独自承担沉重的推理与维护开销;换成Flash,才有机会把用户账单和服务器负载同时降下来。
大模型跑完训练,花钱的无底洞并没有关上。它每响应一次调用,都在实时占用算力资源,运营维护也一刻不能停。"刚花了巨资训出来"无法成为保留旧Pro的免死金牌。沉没成本已成事实,维持老模型运转却需要持续消耗真金白银。就算旧Pro还能继续赚流水,但同样的硬件算力,拿去跑效率更高的新模型显然更划算。
03 16万颗昇腾芯片,交付可能要一年以上
结合DeepSeek近期的几个关键动作,更能看懂这种资源腾挪背后的紧迫感。
今年8月,DeepSeek上线了峰谷浮动定价,引导那些非实时的批处理任务转向闲时运行。这本质上是在外部硬件受限的情况下,先从内部调度把现有的算力吃干榨尽。
硬件采购方面同样在推进,但远水难解近渴。彭博社9月4日援引知情人士报道称,DeepSeek计划在内蒙古的数据中心部署至少16万颗华为昇腾950DT芯片,目前主要规划用于模型推理而非训练。但报道同时提及,华为产能需要兼顾多家客户,受制于供应链瓶颈,整个订单交付周期可能长达一年以上。

DeepSeek融资也在提速。路透社9月9日援引知情人士消息称,DeepSeek已聘请中信证券推进科创板IPO进程,筹资主要为了填补算力基建、模型前沿研发与顶尖人才招募的资金缺口。不过上市时间表、募资额度与估值目标尚未最终敲定,DeepSeek与中信证券均未对此置评。

将这几块拼图放在一起,勾勒出的是一家渴望高速扩张、却又时刻受制于物理资源边界的创业公司。向外采购硬件、谋求IPO融资,解决的是长期的资源增量;而在算法架构上死磕效率,则是为了让现有的存量算力抗住更大的调用洪峰。前者需要漫长的交付周期和资本运作,而后者只要技术成熟,立刻就能在现有业务中释放运力。
在如此紧绷的资源约束下,继续维持旧旗舰固然可行,但性价比极低。当更轻量、更便宜的模型已经能胜任绝大多数核心任务时,旧Pro仅存的那几个单项优势,实在很难说服团队继续分流宝贵的集群来为它托底。
创始人梁文锋此前与投资人沟通时,就曾明确过这种取舍。他明确将长期的AGI探索置于短期利润最大化之上,认为开源模型与商业化完全能够自洽,并直言算力是当前业务扩张的核心瓶颈。
从这个视角回看这次"闪电换模",我更倾向于一种战略解释:DeepSeek的目标是在推进下一代前沿探索的同时,把现有服务规模尽快推向极致。既然新技术已经彻底重构了算力成本与性能曲线,产品矩阵就必须雷厉风行地重排,根本没必要给上一代旗舰强行留出漫长的溢价保护期。
04 DeepSeek没有等下一款Pro
这次换代最引人注目的特质在于它的决绝:DeepSeek甚至没有等V4.1 Pro成型。
按照常规商业软件的做法,它完全可以先保留旧Pro的独立通道,安抚那些依赖老模型的企业客户,同时把Flash作为降配平替推出;等到下一代Pro全面成熟,再按部就班地完成阶梯式迭代,让产品线看起来平滑整齐。

但DeepSeek公布的是另一种安排:旧Flash由V4.1 Flash接管,旧Pro的API流量也将在9月14日后强行并入Flash。虽然保留了原有的接口名,计费也直接打折,但底层的模型内核已经被彻底替换。官方仍然提到了未来的V4.1 Pro,只是没有为了等它,继续保住旧Pro的位置。DeepSeek愿意让自己的新技术先淘汰自己的旧旗舰,研发投入多少、上线才刚满月,都没有变成必须保护下去的理由。
不过,接口名不变,并不意味着开发者可以高枕无忧。许多企业此前围绕旧Pro精细调优的Prompt框架、系统设定和多步工具调用链路,大概率都需要在新模型上重新跑一遍回归测试。如果某些重度依赖Pro长文本或纯文本推理的任务表现出现滑坡,社区与企业客户要求保留老通道的呼声,同样有其现实合理性。
这给还没亮相的下一代Pro设了个难题:如果它要重新以更高价格提供独立服务,就得拿出Flash难以完成、又值得用户额外付费的能力,而不只是比旧Pro更强。
