摘要:
性价比之王要打Agent仗了
7 月31日午后,凤凰网科技查询DeepSeek官网发现,DeepSeek-V4-Flash正式版API上线公测。与以往“Pro强、Flash弱”的分层逻辑不同,这次更新释放了一个值得关注的信号——Flash正式版在多项Agent基准测试中的表现,已经逼近甚至超越了三个月前V4-Pro预览版的水平。
官方更新日志显示,V4-Flash正式版在Terminal Bench2.1上拿到82.7分,NL2Repo54.2分,Cybergym76.7分,Toolathlon verified70.3分。而V4-Pro预览版在Terminal Bench2.0上的得分为67.9分。
需要说明的是,Terminal Bench2.0与2.1并非同一版本的测试集,直接对比并不完全公平。但一个激活参数仅130亿的轻量版,在Agent能力上跑出这样的分数,已经在说明后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。
此外,DeepSeek也特别说明目前公测仅限API,App和网页端暂无法体验最新能力。DeepSeek-V4-Pro正式版将尽快发布。
“仅重新进行了后训练”
DeepSeek官方在更新日志中表示,“DeepSeek-V4-Flash-0731的模型结构、尺寸和DeepSeek-V4-Flash-preview保持一致,仅重新进行了后训练。”
根据DeepSeek官方技术报告,V4-Flash总参数2840亿,激活参数130亿;V4-Pro总参数1.6万亿,激活参数490亿。两者在模型规模上相差一个数量级。如果Flash能通过后训练把Agent能力拉到接近Pro的水平,那意味着对于特定任务而言,模型规模并非决定性因素——训练方法和数据质量的权重,正在上升。
官方还特别注明,本次公开基准测试中的Code Agent任务,使用了DeepSeek Harness极简模式作为框架进行测试,max档位,topp=0.95,temperature=1.0。这个细节暗示,DeepSeek可能在Agent框架层面也做了针对性优化,而非仅仅是模型本身的提升。
这也是DeepSeek官方自研Harness首次以正式命名出现,此前,梁文锋曾把AGI的实现路径比作爬楼梯:语言模型是第一级,去年解决的是CoT(思维链),今年的台阶是Agent,而Agent之后必须解决的问题,是持续学习——让模型像人一样长期积累经验,而不是每次都被喂入完整的上下文才能工作。再往后,才是自我迭代的“奇点”与具身智能。“
AI现在不缺品位和直觉,它缺的是持续学习的能力”他说,“投资人看Agent,我们看怎么解决学习。”
持续学习听起来是模型层面的命题,但它的工程落点,恰恰在Harness上。DeepSeek的Agent Harness团队组建于今年3月,挂帅者崔添翼是90后,浙大计算机出身,手握6枚ACM亚洲区域赛金牌,曾在顶级量化机构Jane Street任职九年,今年3月加入DeepSeek,此后其在5月大力招兵买马。
据透露,DeepSeek的Harness规划在V4正式版上线之际同步推出。另据DeepSeek在日志末尾表示,“DeepSeek-V4-Pro正式版将会尽快发布。”
生态层面的一次正面交锋
如果说2023年的大模型竞争是“拼通用能力”,2024年是“拼长上下文”,那么2026年的关键词,毫无疑问是Agent。
Agent能力——即模型自主规划、调用工具、执行复杂任务的能力——正在成为衡量大模型实力的新标尺。从Terminal Bench(终端操作)、NL2Repo(代码仓库生成)到Cybergym(网络安全(885459)任务)、SWE-bench(软件工程),一系列Agent基准测试正在重新定义什么是好模型。
从全球范围看,Agent能力的第一梯队目前仍由闭源巨头把持。据benchlm.ai等第三方评测平台数据,GPT-5.6Sol、Claude Opus系列在多数Agent基准测试中位居前列。国产阵营中,GLM、Qwen等也在快速追赶。
DeepSeek此次将Flash的Agent能力大幅拉升,战略意图很清晰:用高性价比的轻量模型,切入Agent应用的庞大市场。
毕竟,Agent场景对推理速度和成本的敏感度,远高于纯对话场景。一个需要反复调用工具、多轮推理的Agent任务,如果用旗舰模型跑,成本可能是Flash的数倍甚至数十倍。如果Flash能在Agent能力上达到“够用甚至好用”的水平,其性价比优势将极具杀伤力。
官方公布的两个内部测试集也目标明确。DSBench-FullStack(内部全栈开发测试集)得分68.7,DSBench-Hard(内部Coding Agent难题测试集)得分59.6。这从侧面印证了DeepSeek的定位——把Flash打造成开发者和Agent应用的首选底座。
一场生态暗战也在悄然打响,正式版V4-Flash原生支持Responses API格式,并针对性适配了Codex。
Responses API是OpenAI力推的新一代API格式,相比传统的Chat Completions,它更适合Agent场景——支持更灵活的工具调用、更复杂的多轮交互、以及更精细的输出控制。
DeepSeek原生支持这一格式,意味着开发者可以更低成本地将基于OpenAI生态开发的Agent应用迁移到DeepSeek上。这将是二者在生态层面的一次正面交锋。
对 Codex的适配,则瞄准了代码生成与软件开发(881272)这一垂直场景。Codex是OpenAI面向代码领域的模型,DeepSeek针对性适配,等于直接在OpenAI的传统优势领域发起挑战。
这些动作放在一起看,DeepSeek的野心不止于做一个“便宜的替代品”,而是要在Agent时代建立自己的生态位。
500亿融资之后:高估值下的时间窗口
此次更新,距离DeepSeek完成首轮外部融资不到两个月。
约一个多月前,DeepSeek完成成立近三年来的首轮外部融资,总额超500亿元人民币,创下中国AI行业单轮融资纪录,投后估值约520亿美元(约合人民币3500亿元)。投资方阵容包括腾讯、宁德时代(HK3750)、京东(JD)等产业巨头,以及多家国资产业基金。
7 月中旬,DeepSeek有意推进新一轮私募融资,投前估值约710亿美元(折合人民币约4800亿元),较首轮融资后的520亿美元估值上涨约37%。从520亿到710亿,间隔不足六周。
高估值背后,是市场对DeepSeek技术实力的认可,也是对其商业化前景的押注。但高估值同样意味着高预期、高压力。
据多家媒体报道,DeepSeek创始人梁文锋本人在首轮融资中出资约200亿元人民币,通过特殊架构牢牢掌控公司控制权。这位脱胎于幻方量化的创始人,此前近三年一直坚持自有资金投入,如今从“不融资不上市”转向积极拥抱资本,本身就是一个强烈的信号——DeepSeek正在加速冲向商业化和IPO。
Flash正式版的上线,或许可以看作DeepSeek在资本加持下的一次技术兑现。但真正的考验还在后面:Pro正式版能否如期而至?Agent能力的提升能否转化为实打实的收入?在OpenAI、Anthropic等巨头的夹击下,DeepSeek的高性价比路线将如何发挥优势。
Agent战争的大幕才刚刚拉开。DeepSeek用一个轻量模型的大幅进化,给行业出了一道新题——当后训练的红利被充分挖掘,当效率的提升开始抵消参数的差距,大模型的竞争逻辑,可能要被重新书写了。
