DeepSeek V4正式版来了,新能力浮出水面,性价比之王开战利好

2026-07-31 15:19:27
来源:凤凰网
作者:凤凰网科技
分享
AIME

问财摘要

1、7月31日,DeepSeek官网上线了DeepSeek-V4-Flash正式版API,其在多项Agent基准测试中的表现已经逼近甚至超越了三个月前V4-Pro预览版的水平。 2、V4-Flash正式版在Terminal Bench2.1上拿到82.7分,NL2Repo54.2分,Cybergym76.7分,Toolathlon verified70.3分,而V4-Pro预览版在Terminal Bench2.0上的得分为67.9分。 3、DeepSeek官方在更新日志中表示,“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。” 4、DeepSeek的Agent Harness团队组建于今年3月,其在5月大力招兵买马。 5、此次更新,距离DeepSeek完成成立近三年来的首轮外部融资不到两个月。
免责声明 内容由AI生成
文章提及标的
网络安全--
软件开发--
京东--
宁德时代--
查看股票机会,下载客户端

摘要:

性价比之王要打Agent仗了

7 月31日午后,凤凰网科技查询DeepSeek官网发现,DeepSeek-V4-Flash正式版API上线公测。与以往“Pro强、Flash弱”的分层逻辑不同,这次更新释放了一个值得关注的信号——Flash正式版在多项Agent基准测试中的表现,已经逼近甚至超越了三个月前V4-Pro预览版的水平。

官方更新日志显示,V4-Flash正式版在Terminal Bench2.1上拿到82.7分,NL2Repo54.2分,Cybergym76.7分,Toolathlon verified70.3分。而V4-Pro预览版在Terminal Bench2.0上的得分为67.9分。

需要说明的是,Terminal Bench2.0与2.1并非同一版本的测试集,直接对比并不完全公平。但一个激活参数仅130亿的轻量版,在Agent能力上跑出这样的分数,已经在说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。

此外,DeepSeek也特别说明目前公测仅限API,App和网页端暂无法体验最新能力。DeepSeek-V4-Pro正式版将尽快发布。

“仅重新进行了后训练”

DeepSeek官方在更新日志中表示,“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。”

根据DeepSeek官方技术报告,V4-Flash总参数2840亿,激活参数130亿;V4-Pro总参数1.6万亿,激活参数490亿。两者在模型规模上相差一个数量级。如果Flash能通过后训练把Agent能力拉到接近Pro的水平,那意味着对于特定任务而言,模型规模并非决定性因素——训练方法和数据质量的权重,正在上升。

官方还特别注明,本次公开基准测试中的Code Agent任务,使用了DeepSeek Harness极简模式作为框架进行测试,max档位,topp=0.95,temperature=1.0。这个细节暗示,DeepSeek可能在Agent框架层面也做了针对性优化,而非仅仅是模型本身的提升。

这也是DeepSeek官方自研Harness首次以正式命名出现,此前,梁文锋曾把AGI的实现路径比作爬楼梯:语言模型是第一级,去年解决的是CoT(思维链),今年的台阶是Agent,而Agent之后必须解决的问题,是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。再往后,才是自我迭代的“奇点”与具身智能。“

AI现在不缺品位和直觉,它缺的是持续学习的能力”他说,“投资人看Agent,我们看怎么解决学习。”

持续学习听起来是模型层面的命题,但它的工程落点,恰恰在Harness上。DeepSeek的Agent Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年,今年3月加入DeepSeek,此后其在5月大力招兵买马。

据透露,DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示,“DeepSeek-V4-Pro正式版将会尽快发布。”

生态层面的一次正面交锋

如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent。

Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到Cybergym(网络安全(885459)任务)、SWE-bench(软件工程),一系列Agent基准测试正在重新定义什么是好模型。

从全球范围看,Agent能力的第一梯队目前仍由闭源巨头把持。据benchlm.ai等第三方评测平台数据,GPT-5.6Sol、Claude Opus系列在多数Agent基准测试中位居前列。国产阵营中,GLM、Qwen等也在快速追赶。

DeepSeek此次将Flash的Agent能力大幅拉升,战略意图很清晰:用高性价比的轻量模型,切入Agent应用的庞大市场。

毕竟,Agent场景对推理速度和成本的敏感度,远高于纯对话场景。一个需要反复调用工具、多轮推理的Agent任务,如果用旗舰模型跑,成本可能是Flash的数倍甚至数十倍。如果Flash能在Agent能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。

官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分68.7,DSBench-Hard(内部Coding Agent难题测试集)得分59.6。这从侧面印证了DeepSeek的定位——把Flash打造成开发者和Agent应用的首选底座。

一场生态暗战也在悄然打响,正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex。

Responses API是OpenAI力推的新一代API格式,相比传统的Chat Completions,它更适合Agent场景——支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。

DeepSeek原生支持这一格式,意味着开发者可以更低成本地将基于OpenAI生态开发的Agent应用迁移到DeepSeek上。这将是二者在生态层面的一次正面交锋。

对 Codex的适配,则瞄准了代码生成与软件开发(881272)这一垂直场景。Codex是OpenAI面向代码领域的模型,DeepSeek针对性适配,等于直接在OpenAI的传统优势领域发起挑战。

这些动作放在一起看,DeepSeek的野心不止于做一个“便宜的替代品”,而是要在Agent时代建立自己的生态位。

500亿融资之后:高估值下的时间窗口

此次更新,距离DeepSeek完成首轮外部融资不到两个月。

约一个多月前,DeepSeek完成成立近三年来的首轮外部融资,总额超500亿元人民币,创下中国AI行业单轮融资纪录,投后估值约520亿美元(约合人民币3500亿元)。投资方阵容包括腾讯、宁德时代(HK3750)京东(JD)等产业巨头,以及多家国资产业基金。

7 月中旬,DeepSeek有意推进新一轮私募融资,投前估值约710亿美元(折合人民币约4800亿元),较首轮融资后的520亿美元估值上涨约37%。从520亿到710亿,间隔不足六周。

高估值背后,是市场对DeepSeek技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。

据多家媒体报道,DeepSeek创始人梁文锋本人在首轮融资中出资约200亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从“不融资不上市”转向积极拥抱资本,本身就是一个强烈的信号——DeepSeek正在加速冲向商业化和IPO。

Flash正式版的上线,或许可以看作DeepSeek在资本加持下的一次技术兑现。但真正的考验还在后面:Pro正式版能否如期而至?Agent能力的提升能否转化为实打实的收入?在OpenAI、Anthropic等巨头的夹击下,DeepSeek的高性价比路线将如何发挥优势。

Agent战争的大幕才刚刚拉开。DeepSeek用一个轻量模型的大幅进化,给行业出了一道新题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。

免责声明:风险提示:本文内容仅供参考,不代表同花顺观点。同花顺各类信息服务基于人工智能算法,如有出入请以证监会指定上市公司信息披露平台为准。如有投资者据此操作,风险自担,同花顺对此不承担任何责任。
homeBack返回首页
不良信息举报与个人信息保护咨询专线:10100571违法和不良信息涉企侵权举报涉算法推荐举报专区涉青少年不良信息举报专区

浙江同花顺互联信息技术有限公司版权所有

网站备案号:浙ICP备18032105号
证券投资咨询服务提供:浙江同花顺云软件有限公司 (中国证监会核发证书编号:ZX0050)
AIME