DeepSeek又打赢了价格战
创始人
2026-08-05 04:03:26
0

DeepSeek战略转向Agent,Token成本成为核心突破点。日前,DeepSeekV4-Flash正式版上线公测,截至目前,公测仍在进行中。

Artificial Analysis最新公布的数据显示,在目前全球主流大模型中,DeepSeek V4 Flash已经成为推理成本最低的模型之一。

据DeepSeek于7月31日在API文档更新的日志显示,V4-Flash正式版版本名为DeepSeek-V4-Flash-0731。截至目前,DeepSeek网页端和App端使用的模型尚未同步更换。

Artificial Analysis官网截图

V4-Flash正式版上线当天,第三方评测机构Artificial Analysis给其综合能力打出50分,这与谷歌Gemini 3.6 Flash相当,但仍低于月之暗面的Kimi K3、OpenAI GPT-5.6以及Anthropic Claude Opus 5等模型。

同日,DeepSeek也明确表示,V4-Pro正式版能力更强,但目前尚未发布。

相比模型能力本身,此次升级引发业内更多讨论的是V4-Flash的成本控制能力。

财闻注意到,2023年以来,大模型竞争更多围绕参数规模、推理能力和基准测试成绩展开。 而随着模型能力逐渐趋同,国内外模型厂商持续加码Agent、企业级AI应用和API生态,模型价格也再次成为竞争焦点。

参数规模未变

重点转向Agent能力

DeepSeek早在4月24日就发布了V4预览版,包括V4-Pro和V4-Flash。Flash预览版总参数约2840亿,单Token激活约130亿,支持100万Token上下文。

此次0731版本的模型结构和规模均未变化,DeepSeek明确表示,升级主要来自重新后训练。

V4-Flash正式版原生支持Responses API格式,支持Agent任务、工具调用(Tool Calling)、多轮推理等能力,并进一步兼容Codex接口,为开发者提供更完整的智能体开发能力。

相比此前版本,V4-Flash更加面向开发者和企业场景,而不仅仅是普通用户聊天应用。

官方公布的测试结果显示,V4-Flash-0731在Terminal Bench 2.1、DeepSWE、Toolathlon等九项代码和智能体测试中,均超过V4-Pro预览版。其中,DeepSWE成绩由预览版的7.3分提高至54.4分,Terminal Bench 2.1由61.8分升至82.7分,Toolathlon-Verified由49.7分升至70.3分。

每百万输出Token仅需2元

V4-Flash目前的API价格为每百万输入Token 0.14美元、每百万输出Token 0.28美元。Artificial Analysis估算,它完成一项基准测试任务的平均成本约为0.03美元,同一套测试中,Kimi K3约为0.86美元,OpenAI GPT-5.6 Sol约为1.86美元,Claude Fable 5约为3.15美元。 V4-Flash与后者的成本差距超过100倍。

DeepSeek官网截图

国内模型市场此前已进行多轮降价。官网数据显示,阿里Qwen3.6-Flash在较短上下文下,每百万Token输入和输出价格分别为1.2元和7.2元;字节跳动豆包Seed-2.1-turbo分别为3元和15元,面向代码和Agent任务的Seed-Evolving分别为6元和30元;月之暗面Kimi K2.7 Code分别为6.5元和27元,旗舰模型Kimi K3则达到20元和100元。

一些轻量模型的输入价格低于V4-Flash,但在代码能力、上下文长度和复杂任务定位上并不完全相同。 V4-Flash的特殊之处,在于同时提供100万Token上下文、较强的代码和工具调用能力,以及每百万输出Token仅2元的价格。

棱镜咨询创始人况玉清接受财闻采访时称,中国开源模型在部分尖端任务上仍与OpenAI、Anthropic存在差距,但在通用任务和中高端应用场景中,替代效应已经十分明显。

“当模型能力相差不大,竞争的核心就会转向性价比,这将直接压缩头部厂商的定价能力和盈利空间。”况玉清说。

不过,较低的API报价并不一定意味着企业最终承担的成本更低。

燕基空间研究中心何基永向财闻表示,价格将成为下一阶段大模型竞争的“入场券”, 但真正的衡量标准是单位有效产出成本。

“企业最终比较的不是每百万Token的标价,而是完成一项任务需要多少钱,其中还包括准确率、响应速度、重试次数和人工干预成本。”何基永说。

输出价格对Agent应用尤其重要。传统聊天通常只需要模型完成一次回答,而智能体需要反复读取文件、搜索资料、调用工具、修改代码并验证结果,一项任务可能产生几十次模型调用,消耗数十万乃至数百万Token。

相关内容

最新资讯

高端品牌同比增约135%,比亚... 比亚迪7月销量海报上,最大的数字是41.9万辆,但我盯住的是179841辆:这是乘用车及皮卡的海外销...
扬帆家港|一文读懂《中华人民共... 2022 年正式实施的《中华人民共和国家庭教育促进法》,把未成年人心理健康教育纳入家庭教育重要内容,...
原创 进... 最近翻乘联会刚更新的2026上半年数据,看完心里只剩两个字:唏嘘。整个进口车市场肉眼可见地降温,而曾...
十年渡口,昊铂埃安BU不惧沉浮 销量增长结构性蜕变。 2026年的中国车市,是一条陡峭的K线。线上,是新能源汽车渗透率攀升至65.7...
理想和极氪将直播拆车,小米徐洁... IT之家 8 月 3 日消息,极氪和理想汽车今日都宣布会进行拆车直播。 小米集团董事长特别助理、...
原创 比... MG7月30日举办07预售发布会,现场播放纪录片《格局》,影片实拍MG、比亚迪、奇瑞等中国品牌海外经...
猛犸象归入中资,会是下一个始祖... 7月30日,中资背景的投资机构CPE源峰联合欧洲私募机构Jacobs Capital宣布签署协议,拟...
原创 7... 【阅读须知】:本文内容所有信息和数据,均为作者查阅官方信息和网络已知数据整合解析,旨在让读者更清晰了...
理想和极氪都将直播拆车,小米徐... IT之家 8 月 3 日消息,极氪和理想汽车今日都宣布会进行拆车直播。 小米集团董事长特别助理、战...
云OS在手定点突破800万套,... 2026年上半年,睿驰实现规模化正向盈利,核心软件业务增长势头强劲,规模同比增长超40%,盈利质量与...