发布日期:2026-08-14 21:09点击次数:187
7月到8月,大模型沙场战鼓频催广西橱柜台面胶,而过去的天则堪称“狂星期四”。
8月12日晚间,国内外大模型厂商迎来新模型“三连发”:DeepSeek API文档中出现DeepSeek-V4-Pro-0813,V4-Pro正式版静默上线;Grok 4.6发布,纸面测评得分逼近Fable 5;参数规模达2.4T的Qwen3.8 Max也如期开放权重。另据记者了解,智谱新模型GLM 5.3也已接近发布,DeepSeek-V4-Pro先行步。
不过,V4-Pro正式版的发布在24小时内经历了“波三折”。
模型上线数小时内,社区实测陆续出现异常反馈,本应进行长理的V4-Pro,思考时间经常不足十秒,长流程任务频繁提前收尾,部分场景表现甚至弱于V4-Flash。8月13日凌晨,有开发者用同任务间隔几小时先后测试,结果差异悬殊,怀疑服务端进行过配置调整或版本切换。
8月13日白天,官网页通知与开放平台公告度撤回,API文档页面里的版本名则直显示DeepSeek-V4-Pro-0813。有业内人士注意到,思考强度分档8月11日就已在API文档里列出,13日下午思考模式页有过次修订。
当日晚间,DeepSeek发布文官宣V4-Pro正式版于网页端、App及API全线上线,并同步公布了调价案。官网页通知恢复,官新日志中也次出现了8月13日的相关条目。官并未就上述变动及凌晨时段的服务波动作出说明。
此前虽有过大幅涨价预告,但调价案中的涨幅依然出部分用户的预期。此次调价将于8月17日0时生,调整后将实行分时定价,峰时段输出价格升至27元/百万tokens,为现行价格的4.5倍;缓存未命中价格升至9元/百万tokens,为现行价格的3倍;缓存命中价格则大幅上调至0.30元/百万tokens,为现行价格的12倍。空闲时段价格统为峰时段的半。
此外,在8月13日晚间V4-Pro正式版官宣个多小时后,DeepSeek Harness(DSH)终于单落地。DSH团队的“黑鲸”公众号发布公告,宣布以“开发者预览版(v0.1 版本)”名义,面向全球开发者开放测试,并同步以 MIT 协议开放源代码。
01
发生了什么?
V4-Pro正式版上线后的这连串波折,背后究竟发生了什么,又意味着什么?
社区中对此众说纷纭,有人怀疑官临时发错了模型版本,有人测部署出现了问题,有人猜测V4-Pro的表现未达预期,暂时撤下以待后续满版上线。
有业内人士向记者分析,这系列迹象像是发布环节出现了问题,当晚线上服务状态大概率发生过变动。外部目前法确认此前调用到的是发版本、回退版本还是修复后的版本,在官说明版本状态之前,不同时段的实测结果之间缺乏可比。
在该人士看来,晚间的官宣反过来坐实了白天的撤回,撤的是发布仪式广西橱柜台面胶,调用入口直没动。分档参数早就写在文档页上,前夜的问题是行为没跟着档位走,本该长思考的请求思考不起来。晚间官宣把“灵活的思考强度控制”写成点,对照之下,指向的还是服务端配置。
新加坡限对齐创始人、Codex生态作伙伴宋斐对记者表示,这里叠着三件不样的事:夜切API流量,白天撤页面公告,晚间把官宣、价目和思考开关补进同套话术。流量难退,因为三已经接上;页面和公告则随时能撤能发。API名称从头到尾没有动过,三平台也没有发V4-Pro下线通知,能确认撤掉的,只有官网通知和开放平台公告。
他分析,版本号和官跑分都没变,说明没有换过权重。模型本体若有问题,官不会只撤页面,API也会起下。问题可能在部署配置和配套节奏。他强调,正式版身份的确认和对标Fable 5的能力验证是两件事,前者在13日晚间完成了,后者要等三拿着刚开源的DSH在固定版本上复测之后才有答案。
02
评价褒贬不
此前,7月31日上线的DeepSeek-V4-Flash正式版,因为出人意料的能跃升和致价比而收获如潮好评,其祭出的大模型“斩线”也抬了外界对V4-Pro正式版的期待。
但V4-Pro正式版上线后,市场评价却呈现分化:有用户认为其已达到Fable 5别,也有用户表示失望。
从DeepSeek官公布的评测结果来看,V4-Pro正式版相较此前V4-Pro预览版实现代际提升,并整体优于V4-Flash-0731。
而与前沿模型相较,从官测评结果看,V4-Pro在执行类任务上已追平Anthropic前沿模型,但在基础智能上仍存在定差距。
具体来看,在考察终端操作能力的Terminal Bench 2.1测试中,V4-Pro-0813得分87.9,与Fable 5的88.0仅差0.1分,于Opus 4.8的85.0分;在考察真实世界长周期工程任务能力的DeepSWE测试中,V4-Pro得分62.7,低于Fable 5的70分,但于Opus 4.8的58.0分。
相比之下,在考察基础智能的HLE测试中,V4-Pro-0813得分42.7,低于Fable 5的53.3分和Opus 4.8的49.8分;在考察仓库长程代码生成能力的NL2Repo测试中,得分比Opus 4.8低8.2分。
根据美国研究机构Artificial Analysis新立评测,V4-Pro-0813的智能指数为53分,低于Fable 5的62分、Grok 4.6的61分、Kimi K3的60分和GPT-5.6 Terra的57分;同时,仅比V4-Flash-0731的50分1分,与6月发布的GLM-5.2大致处于同档位。有业内人士以“不及预期”形容其基准测试表现。
目前V4-Pro-0813的官跑分尚未得到三复现。根据社区在8月12日模型上线后的即时反馈,V4-Pro-0813处理复杂任务的完整度有所提升,但与V4-Flash的差距并没有想象中大,甚至在某些编程任务中不如V4-Flash,整体表现没有出预期,且不同时段的表现差异明显。“以Flash数倍的参数做出来的模型不该是这样。”有开发者指出。
与此同时广西橱柜台面胶,社区反馈显示,将DeepSeek-V4-Pro API接入Claude Code后,实际体验不及预期;而接入OpenCode后,表现则明显。
对于上述落差产生的原因,宋斐认为多来自接入协议,而不是模型忽强忽弱。V4-Pro正式版新增支持 Response API 和 Codex 接入,对已经在用Codex的团队,路径比走兼容层短,行为也好控些。同模型换框架,分差往往出在协议:理状态回不回得全、工具预谁说了、并行能不能关,在长任务里这些差异会被放大。
随着8月13日晚间DeepSeek Harness预览版的出,上述模型能力与实际体验之间的落差,有了可以验证的环境。
至于8月12日上线当晚社区反馈的思考时间过短、任务提前收尾现象,宋斐认为,这从工程上看像理服务的配置问题:思考模式有没有真正开、预如何映射到服务端。权重在几小时里反复换的概率低。
宋斐注意到,思考分档8月11日就在文档里,13日下午思考模式页有过次修订,正好卡在凌晨异常之后、晚间官宣之前。这个顺序和前述配置层修复的判断对得上,13日晚间的官宣公告等于把修过的这层收进了正式说明。“测试V4-Pro要显式指定思考档,默认档的结果参考价值有限。在官把版本状态说清楚、外界能对着固定版本复测之前,建议先不要给模型本体下判语。”
03
调价后“斩线”还在吗?
眼下,V4-Pro正式版相比于拼智能上限,硬的仍是价比。
根据8月17日前的现行价,其调用费是V4-Flash的3倍。Artificial Analysis测评显示,V4-Pro每项智能指数任务的加权平均成本为6美分,万能胶厂家是V4-Flash-0731的2倍,不到Fable 5的1/50,约为Kimi K3的十四分之。不过,其成本已于GPT-5.5 Luna的5美分。
调价后,按峰时段计,V4-Pro的缓存未命中输入价格仍约为Kimi K3的45,相较海外旗舰模型依然便宜数倍。
宋斐指出,这轮调价中上调幅度大的是缓存命中价格,从0.025元/百万tokens涨至峰时段的0.30元/百万tokens,涨至原价的12倍。靠命中压成本的长上下文Agent,成本压力将显现。而峰时段输出价格则变为原价的4.5倍,也于市场此前约3倍的预期。要建成本基线或做批量压测的团队,得在8月17日点调价前做完。
在宋斐看来,此次V4-Pro正式版对按任务计费的Agent交付冲击大,而对按智能上限计费的市场而言冲击相对有限。这还只是DeepSeek轮往Agent向训练,后面仍有空间。
“从初步接入和社区反馈看,V4-Pro正式版适应强,稳定差。同道题跑十次,条轨迹很好,下条出低错,平均分没太大意义,多路尝试再加外部筛选,才是用法。现阶段要稳的团队可以继续用V4-Flash正式版;评V4-Pro,放在协议对齐的环境里,等版本状态稳住再下结论。”宋斐表示。
04广西橱柜台面胶
后训练跑通了,但短板也在后训练
V4-Flash和V4-Pro的正式新,都是底座不变,仅通过后训练提升Agent能力。这也让后训练的重要再次成为行业关注的焦点。
4月24日发布的V4系列预览版中,V4-Flash总参数规模为2840亿、激活参数130亿,V4-Pro总参数规模为1.6万亿、激活参数490亿,均采用MoE(混)架构,并支持100万tokens上下文窗口。
7月31日,V4-Flash正式版上线。官表示,在模型架构和参数规模均不变的情况下,仅通过后训练实现Agent能力提升。在DeepSWE测试中,V4-Flash正式版得分从预览版的7.3跃升至54.4。
两周后,V4-Pro正式版上线,同样没有换模型底座,通过后训练将DeepSWE得分从12.8提升至62.7。
“这说明DeepSeek的后训练已经成体系,而且能在不同规模的底座之间复用,前提是两套底座吃的是同套数据。”宋斐表示,“预览版分低,我直不认为是能力不行。能力在权重里,只是还没被训到Agent任务上。后训练做的事,是把执行环境的任务分布写进权重。”
不过,V4-Pro正式版的总参数规模是V4-Flash的5.6倍、激活参数是3.8倍,却没有带来等比例的分数优势,也引发业内关注。在Artificial Analysis的智能指数评分中,V4-Pro-0813也仅比V4-Flash-0731出1分。官测试中,V4-Pro-0813的ALE也只0.5分,Toolathlon3.8分,DeepSWE、DSBench-Hard这类难任务7到8分。
“Pro的价值主要堆在难任务、知识密集诊断和长链条恢复。”宋斐表示,两款模型分工也清楚:Flash铺量,Pro啃难题、接失败,二者并非替代关系。
开发者Jun Song则直言:“模型公司在小模型上表现得异常出,例如Qwen 27B、V4 Flash和GLM-5.2,但到了大的旗舰模型,能力提升往往没有随着参数同步放大。”他认为其原因“也许是训练力不足”。
对DeepSeek而言,后训练作为Agent能力提升路径已经得到验证,但模型能力要继续向上突破,后训练也是其短板,训练素材不足的问题正在凸显。
“三用简框架测出V4-Flash正式版的分数能和官分数平,说明这轮增益已经写进权重,自积累的可验证任务,模型基本学透了。同批任务反复训练,收益会递减,继续提升需要宽的任务来源。这也是他们同步公共Harness的原因。”宋斐指出。
05
Harness单发布,显示分量
海通近期研报指出,模型竞争正从参数规模转向后训练与系统工程。未来模型实际果将越来越取决于“模型+Harness+工具+数据”的整体组,单纯依靠基础模型能力建立壁垒的难度继续上升。
在宋斐看来,DeepSeek Harness不只是开发工具,也是标准接口和数据入口。在条款允许的范围内,开发者跑长程任务留下的轨迹和纠错,可以回流训练。谁占住开发框架,谁就相当于让付费用户帮自己做强化学习里贵的那段。
因此,8月13日DSH预览版的发布及其后续反馈与进展,尤其值得关注。
在发布的公告中,DeepSeek提出了DSH“切皆插件”的设计理念。其采用插件式开放架构构建Agent Harness,模型、工具、技能、会话、沙箱、存储、循环、调度、UI等所有Agent能力均由插件组而成,可自由替换、灵活重组。
同时,DSH提供四种运行模式——标准模式、PTC模式、简模式、创造模式,各模式默认加载不同的插件集。其中“简模式”仅保留个shell工具与个文件编辑工具,官称是用于小环境下的模型基准测试。这意味着,三复现官评测分数的环境条件已经具备了。
此外,模型看到的切,都会写入仅追加(append-only)设计的会话日志,包括系统提示词、思维链、工具调用与结果、子Agent调度,以及每次上下文注入。在 Trajectory 视图中,可以按来源查看这些信息。恢复、分叉、检索与回放也都共享同份事件流。
宋斐认为,DSH预览版的架构,把模型在DSH里做成插件,与工具、沙箱、界面并列,可替换。也就是说运行时是主体,模型是其中个部件,“这个位置由模型厂自己排出来,分量不样”。
进步,他指出,轨迹这层,会话日志记全了模型看到的切,但记录不等于判定,事件流里还看不到步骤的对错标注,预、允许集和停止条件也没有成为产品。对差模型,运行时的价值半在让模型发挥,另半在让它停得下来。v0.1版本把发挥的半搭起来了,停的那半还空着。
DeepSeek Harness终于真的对外开放了,而模型在这之前的24小时里,经历了静默上线、页公告撤回、晚间再官宣的过程。边是波折的模型发布,边是单成篇、开源开放的运行时发布,两场同天上演,轻重自见。V4-Flash与V4-Pro正式版与其说是“价格屠夫”的又次亮剑,不如说是这条线的起点。
点击【阅读原文】投上你宝贵的票!谁是你心中的佳上市公司?
“2026凤凰之星上市公司评选”候选名单已公布,大众投票正式开启。
用户可通过投票,助力优质企业提升影响力。企业报名通道同步开放,组委会将动态新候选名单。终结果于“凤凰湾区财经论坛2026”揭晓。期待您的参与!
]article_adlist--> 海量资讯、解读,尽在财经APP 相关词条:铁皮保温 塑料挤出机 钢绞线 玻璃卷毡厂家 保温护角专用胶
奥力斯 泡沫板橡塑板专用胶报价 联系人:王经理 手机:18232851235(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定广西橱柜台面胶,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。