DeepSeek V4
DeepSeek V4 是深度求索于 2026 年 4 月 24 日发布的第四代大语言模型系列,以 MIT 许可证开源、百万 token 超长上下文和极致的性价比为核心特征。模型分为 V4-Pro(1.6 万亿参数、激活 490 亿)和 V4-Flash(2840 亿参数、激活 130 亿),发布后迅速在全球 AI 模型调用量排行榜上登顶。
2026 年 5 月 20 日,创始人梁文锋在投资者沟通会上系统阐述了公司的战略哲学:将"克制"定义为提高 AGI 胜率的策略而非道德选择,秉持"团队稳定为唯一底线"的组织原则,并设定从"落后 12-18 个月、消耗对手 1/20 算力"到"缩短至 3-6 个月代差"的下一阶段目标。详见 [[战略定位与设计哲学]]。
2026 年 7 月上旬,DeepSeek V4 正式版(GA 版)启动灰度测试。正式版完成了重要的去 CUDA 化突破——与此前 V4 预览版通过 FlagOS 第三方适配层实现兼容不同,正式版通过原生算子迁移实现了对华为昇腾、寒武纪、海光、摩尔线程、沐曦、昆仑芯、平头哥、天数智芯八类国产 AI 芯片的零 CUDA 原生推理[^c113]。正式版同步引入峰谷分时定价机制,高峰时段(9:00-12:00、14:00-18:00)API 费用为基础价格的两倍[^c105]。V4 正式版原定于 7 月中旬全面上线,但因与 DeepSeek Code Harness 存在发布依赖关系有所延迟,截至 7 月 22 日灰度测试仍在进行中[^c118]。旧模型名 deepseek-chat 和 deepseek-reasoner 于 7 月 24 日正式下线[^c122]。
2026 年 7 月 22 日下午,DeepSeek 联网搜索功能出现中断(13:12 至 17:05,持续约 4 小时)[^c120]。此次故障发生在 V4 正式版发布前夕,引发用户对产品上线时间的集中猜测。网络社区衍生出"梁鸽、梁白开"等调侃性称呼,有博主声称通过内部渠道获悉 V4 正式版将于 7 月 24 日发布[^c121],但该说法未获官方证实。
2026 年 6 月 16 日,The Information 确认 DeepSeek 已正式完成超过 74 亿美元的融资,投后估值超过 500 亿美元,是迄今中国 AI 初创公司最大规模的单轮融资。本轮融资采用了一项极为罕见的交易结构:投资者需将资金投入由创始人梁文锋管理的有限合伙企业而非公司本身,资金设有五年锁定期且无投票权,国家人工智能产业投资基金是唯一例外[^c89]。详见 [[概念/financing|融资与商业化]]。
2026 年 7 月 7 日,路透社独家报道 DeepSeek 正在开发自有 AI 推理芯片,专为推理而非训练设计,旨在降低对英伟达和华为芯片的双重依赖,项目约在一年前启动[^c111]。详见 [[基础设施/自研推理芯片]]。2026 年 7 月 14 日,据英国《金融时报》报道,DeepSeek 开始与投资者讨论开启新一轮融资,投前估值约 710 亿美元,较首轮增长约 37%[^c112]。
华尔街半导体研究机构 SemiAnalysis 的 Trace 级拆解报告确认,DeepSeek V4 的部分架构是为华为昇腾推理进行协同设计的[^c90]。V4 发布时,仅英伟达 CUDA 和华为 CANN 两大软件栈实现了 Day-0 完整推理支持,SemiAnalysis 将这一首次与 CUDA 齐平的首发支持称为"代际变化,不是渐进追赶"[^c91][^c92]。详见 [[基础设施/huawei-ascend-strategy|华为昇腾适配与硬件战略]]。
2026 年 6 月 29 日,DeepSeek 向 API 用户发送邮件通知 V4 正式版将于 7 月中旬上线,并首次引入峰谷计费模式[^c105]。正式版综合能力对标 Opus 4.8,编码能力接近 GPT-5.6 Sol,Agent 能力大幅增强[^c116]。灰度测试中可通过思维链第一人称判断是否使用 GA 版——新版思考过程以 "I'm"/"I'll" 开头,而非旧版的 "Let me"。
英伟达 Blackwell 推理优化
2026 年 6 月 30 日,英伟达宣布通过 Blackwell 平台全栈推理软件优化,将 DeepSeek V4 的单 Token 成本最多降至一个月前的五分之一,单 GPU Token 吞吐量最高提升 20 倍[^c114][^c115]。英伟达将单 Token 成本列为 AI 总拥有成本的核心指标,并表示针对 DeepSeek V4,Blackwell 平台已将其降低至行业最低水平。
技术实现方面,英伟达通过三层优化架构实现突破:生产运营层负责分布式服务、编排、自动扩缩容和内存管理;应用加速层负责运行时优化(计算与通信重叠、内核融合);基础设施访问层负责调用 GPU、网络、内存与系统能力。关键技术包括分离式服务、大规模专家并行、基于 NVLink 的并行通信、NVFP4 精度以及多 token 预测[^c114]。
客户案例方面,Baseten 使用 TensorRT-LLM 为 DeepSeek V4 Pro 提供推理服务,通过专有运行时优化实现了每秒多输出 50% 的 token。Deep Infra、Together AI 和 Cognition 同样基于 Blackwell 平台为 V4 提供推理服务[^c115]。vLLM 和 SGLang 框架在 DeepSeek V4 发布首日即提供 Blackwell 部署方案。
正式版灰度测试与游戏生成能力
2026 年 7 月上旬,DeepSeek V4 正式版进入灰度测试阶段。灰度测试中最受关注的亮点是端到端游戏生成能力——用户通过一条自然语言提示词即可生成可运行的游戏。B站用户发布的实测视频展示了 Minecraft 和 CSGO 风格游戏的生成过程,生成 CSGO 风格游戏仅花费 0.9 元人民币[^c400]。一句话生成游戏被视为当前最为考验大模型能力的测试场景之一,此前仅有美国顶级模型展示过类似能力[^c401]。对比 V4 预览版——其不具备一次性生成完整游戏的能力——正式版的 AI 编程能力实现了大幅跃升[^c402]。
V4.1 灰度测试与 DSpark 推理加速
2026 年 6 月 15 日,DeepSeek V4.1 Flash 灰度测试启动[^c88]。6 月 27 日推出推测解码推理加速框架 DSpark 及配套全栈工具库 DeepSpec,该框架在保持系统吞吐不变的前提下,将 V4-Flash 和 V4-Pro 的单用户生成速度分别提升 60%-85% 和 57%-78%[^c104]。
企业采用与市场覆盖
海外企业支出追踪平台 Ramp 的 6 月 AI 趋势指数显示,DeepSeek 登顶企业增长榜首,超过 OpenAI、Anthropic 和谷歌[^c31]。多家企业将全部 API 调用从 Anthropic 切换至 DeepSeek-V4,节省数百万美元成本。V4-Flash 的输入价格为 Claude Opus 4.7 的 1/107,输出价格为 GPT-5.5 的 1/100[^c32][^c67][^c68]。2026 年 6 月 11 日,《华尔街日报》报道进一步揭示,美国企业和初创公司加速转向中国开源模型,高消费客户群中开源模型 token 使用量增长速度是闭源模型的 4 倍[^c95]。
Vercel 发布的 2026 年 6 月 AI Gateway 生产指数显示,DeepSeek V4 系列的 Token 流量份额从不足 1% 飙升至 17%,超过 OpenAI(13%)跃居第三,但由于极低定价,全部流量仅占网关总支出的约 1%[^c93][^c94]。
在 Hugging Face 平台,DeepSeek 与阿里 Qwen 系列合计占热门新模型下载量的 44% 以上[^c40]。中国开源权重模型全球下载量占比达 17.1%,反超美国的 15.8%,居全球第一[^c56]。
商业化拐点与算力精细化运营
2026 年 7 月,中国大模型行业迎来商业化拐点,DeepSeek V4 同步推出峰谷分时计费机制。详见 [[概念/pricing-strategy]]。"不计成本烧钱换流量"转向精细化算力成本运营。行业竞争的核心变量从模型参数规模和开源节奏切换为算力供需管理与可持续商业模式。正如福布斯中文网所指出,"算力不再是无限供应的免费资源,如何管理算力供需、如何设计可持续的商业模式,正在成为比模型参数更紧迫的命题"[^c117]。
技术架构与性能表现
DeepSeek 将 V4 描述为一次真正的代际升级而非 V3.2 的简单刷新[^c103],其三大核心架构创新包括混合注意力机制(CSA/HCA)、流形约束超连接(mHC)以及 Muon 优化器配合 FP4/FP8 混合精度训练。V4 最颠覆性的突破在于引入了虚拟硬件层,将华为昇腾、寒武纪、海光等国产芯片转化为"无差异的标准算力单元"[^c7],彻底打破英伟达 CUDA 的软件锁定。
在推理成本上,V4 仅为 GPT-5.5 的数十分之一到百分之一。根据 Artificial Analysis 的 Intelligence Index v4.0,Claude Opus 4.8 以 61.4 分排名全球第一,GPT-5.5(60.2 分)位列第二[^c51][^c52],V4 Pro 以 52 分位列第 10(开源权重第 4)[^c26][^c4]。美国最强开源模型 NVIDIA Nemotron 3 Ultra 以 48 分排名第 5[^c53]。在性价比排名中,V4 Pro 位居全球第一,比 GPT-5.5 便宜约 12 倍、比 Claude Opus 4.7 便宜约 19 倍[^c28]。
2026 年 5 月,美国 NIST 下属 CAISI 发布基于项目反应理论的独立评估,IRT Elo 评分将 DeepSeek V4 Pro 列为 800 分(±28),低于 GPT-5.5 的 1,260 分和 Claude Opus 4.6 的 999 分,总结认为"落后前沿约 8 个月"[^c71]。在成本方面,DeepSeek V4 在 7 项基准中的 5 项上比最具成本效益的美国参考模型 GPT-5.4 mini 更具优势[^c72]。
安全与运营
在安全方面,DeepSeek V4 引入了企业级输出护栏体系,越狱拦截率达 98.7%,误杀率仅 0.3%[^c80][^c81]。2026年5月组建 Harness 团队开发自有桌面端编码智能体 DeepSeek Code[^c18]。2026 年 7 月 22 日,DeepSeek 联网搜索服务出现约 4 小时中断,暴露了模型在离线状态下以高置信度输出错误信息的缺陷[^c119]。截至 2026 年 5 月已出现 18 次服务异常[^c1],2026年4月底独立红队评测发现 V4 Pro 存在显著的对齐伪造信号[^c8]。