智快网
快讯 行业 产业 汽车 科技 AI+ 热点

AI大模型竞争白热化:“斩杀线”攀升,性价比成生死关键

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正在上演,行业格局正因“斩杀线”和“毒圈”概念而发生深刻变化。如今,中英文AI圈都用这两个源自电子游戏的词汇,来形容大模型竞争的残酷态势。

2026年7月31日,DeepSeek发布V4 Flash 0731,这一新版模型在Artificial Analysis的Intelligence Index上获得50分,比上一版V4 Flash高出10分。基于Intelligence Index v4.1评测数据绘制的散点图中,纵轴代表Intelligence Index得分,能力越强得分越高;横轴是每任务成本,成本越高越靠右。V4 Flash 0731位于左上角,以其为起点向右下方划出一片区域,该区域内的模型成本更高、能力却更弱,这片区域被中文AI圈称为“斩杀线”,英文则叫Kill Zone(斩杀区)。对于处于斩杀线附近的模型而言,面临的竞争压力如同游戏中不断缩小的“毒圈”,生存空间正被逐步挤压。

Agent的兴起,是大模型行业竞争转向和烈度升级的关键因素。它改变了模型的使用方式,从简单的一次对话转变为完成一项任务。完成任务需要模型连续执行多个步骤、调用外部工具,出错后还要重试,最终交付的是任务结果。这使得单次回答的准确性无法全面反映模型交付任务结果的能力,按token计价的测试也不能准确体现一项任务的支出。例如,2026年5月,美国国家标准与技术研究院下属的CAISI公布DeepSeek V4 Pro评估,将其与GPT - 5.4 mini在7个基准上逐项对比,实际支出从便宜53%到贵41%,同一对模型在不同任务下成本高低甚至会颠倒,可见成本随任务而定,评测口径也聚焦到了“任务”上。

Intelligence Index v4.1的两个坐标轴都以“任务”为评测基准。纵轴的Intelligence Index能力指数,由9个评测加权构成,其中Agents(智能体)占比34%,Coding(编程)占比24%,Scientific Reasoning(科学推理)占比24%,General(通用)占比18%,Artificial Analysis在方法论页面明确表示权重向智能体任务倾斜。横轴的每任务成本,是模型跑完整套Intelligence Index的总成本除以各项评测的任务总数,总成本按input(输入)、cache hit(缓存命中)、cache write(缓存写入)、reasoning(推理)、answer(回答)五类token分别计价,再按各评测在指数中的权重加权。按照这一标准,Claude Opus 4.8 (max)能力得分为56分,每任务成本1.78美元;DeepSeek V4 Pro (max)得44分,每任务成本0.04美元;V4 Flash 0731能力得分为50分,高出DeepSeek V4 Pro (max)六分。能力与V4 Flash 0731最接近的是GPT - 5.6 Luna (max),得分为51分,仅高出一分,且GPT - 5.6 Luna (max)在7月30日下调价格80%后,V4 Flash 0731的每任务成本仍低约60%,凸显了其性价比优势,散点图中左上方也完全空白。

Agent的应用放大了模型之间的成本差距。一次单轮问答消耗数百至数千tokens,而一项Agent任务的tokens消耗量高出数个数量级。模型之间单价差距不变,但最终支出会随消耗量增加而同步扩大。有论文分析八个前沿模型在SWE - bench Verified上的执行轨迹,发现Agent编码任务的tokens消耗为代码问答与代码推理的一千倍。按官方定价,Claude Opus 4.8的输出tokens为每百万25美元,DeepSeek V4 Flash为0.28美元,一次消耗数千tokens的问答,两者支出差额以美分计,但在一项Intelligence Index任务上,每任务成本支出差额接近1.7美元。同时,Agent任务中消耗的tokens还在快速增长,如Artificial Analysis指出Claude Sonnet 5的每任务成本较上一代翻倍,增量全部来自tokens用量增加而非单价上涨,其在Intelligence Index任务上的max档输出tokens较前代高出约40%,在AA - Briefcase和GDPval - AA两项知识工作评测中,智能体轮次约为前代的三倍,消耗量上升使得在模型上的最终支出持续增加。

Agent的应用同样放大了模型之间的能力差距。单轮问答中,能力差异表现为一次回答的准确率差异;而Agent任务由多步骤串联,任一步骤出错整体即告失败,成功率约等于各步成功率的连乘。一次回答准确率为95%与90%相差五个百分点,二十步之后成功率分别为36%与12%,前者接近后者的三倍。Agent常设的重试机制进一步放大了差距,失败发生在长任务中途,重跑需重新支付tokens开销,能力不足将直接转化为额外支出。Agent对模型能力和成本差距的放大效应,直接导致模型分化,性价比落在斩杀线以内的模型,将快速失去市场地位和商业潜力。

Agent还给模型的评测带来了更多变数。7月,Reddit的r/LocalLLaMA上发表的一篇独立评测,测试者将DeepSeek V4 Flash分别接入Pi、OpenCode、Claude Code、Nanocoder四个Agent,执行同一批真实bug修复任务并用同一套评分标准。结果发现四个框架的能力得分落在同一个重叠区间,但消耗的tokens和时间相差四倍。

为了有效对比模型的任务执行能力和成本,Artificial Analysis自建并开源了harness Stirrup,这是一个统一的Agent测试框架,包含E2B沙箱、六个固定工具、250轮上限,所有模型的Intelligence Index跑分都在这个框架里完成。V4 Flash 0731在Terminal - Bench 2.1这项Agent评测上有两个得分,Artificial Analysis使用Stirrup测得79%,DeepSeek在更新日志中公布用自家DeepSeek Harness的极简模式测得82.7%。这表明Agent已成为大模型的主流使用场景,单纯的模型能力分数不能说明全部问题,真正的能力存在于系统层级。

斩杀线意味着一旦模型落入该范围,在市场中往往直接失去竞争力。大模型的切换成本极低,与苹果等拥有网络效应的业务不同,AI大模型的API调用标准化,操作协议开放,开发者可多渠道并行触达用户,用户也不关心底层模型是谁,开发者能快速且低成本自由切换模型。同时,基础模型层进步明显放缓,同质化竞争加剧,同一能力档位的模型之间,只要工程配套完备,切换不会带来交付质量的明显下降。市场份额不随性价比差距线性分配,而是向性价比优者快速聚集,性价比处于劣势的模型将快速失去商业潜力,“斩杀线”之内没有二等奖,所有模型厂商都必须争取第一。

即便模型厂商跟上了竞争节奏,也难以停下。目前,由于模型优化迭代和硬件升级,tokens成本处于快速下降通道,但降下来的成本在激烈的价格竞争中无法转化为利润。2026年7月30日,OpenAI在GPT - 5.6的页面上追加更新,将GPT - 5.6 Luna的价格下调80%,GPT - 5.6 Terra下调20%,次日DeepSeek就发布V4 Flash 0731。只要有一家将降本传导为降价,在“毒圈”不断缩小的威胁下,其余厂商不跟进就得交出市场份额。通过性价比获得的优势可以维持,但难以形成壁垒,大模型厂商进入的不是一座可以筑墙固守的城池,而是一片需要每天争夺的开阔地。

斩杀线还将继续上移,推力来自模型技术进步和基础设施投入。模型仍在不断迭代,V4 Flash 0731的架构与尺寸均未变动,仅重做了后训练,Intelligence Index得分就从40升至50,反超自家V4 Pro (max)的44分。自研芯片、自建算力、应用系统工程化与集成等投入周期长、金额大,具备形成规模壁垒的潜力,一旦转化为模型能力和成本优势,将推动“斩杀线”继续上移。大模型行业的这场竞争,已然进入生死局。

金融智能体招投标新动向:从搭台到解难,大厂与垂直厂商竞逐新赛道
安硕信息拿下富滇银行AI智能尽调报告助手(139.92万元),以及兴业数金公司治理项目,后者也是为了服务银行(巴塞尔协议信息披露系统升级,包括智能体预填流程表单和文档分析功能)。 上半年,浦发银行启动AI红…

2026-08-05

8月5日发布!华为MateBook Fold非凡大师来袭,首搭原生手写笔功能
8月5日,华为新一代鸿蒙折叠屏电脑全新华为MateBook Fold非凡大师将正式发布。此前官方已披露,该机首次支持原生手写笔功能,可实现纯平书写、分屏记录等体验。…

2026-08-05

249元!5000mAh磁吸充电宝加AI彩屏,这差异化创新是惊喜还是鸡肋?
还有一点,不是有 AI 功能吗,也是搭配这个屏幕一起使用的。如果你就喜欢极简、实用,磁吸充电宝和手机贴一起拿手上,已经够厚重了,只想要轻薄、续航这俩核心卖点,那大概率觉得这款有点没必要? 且加墨水屏这操作…

2026-08-05

开源大模型价格战来袭:技术狂飙下,人类社会面临未知链式反应?
而当价格战开打,大厂集团层面面临着难以调和的商业悖论:云计算当然希望DeepSeek、Kimi、智谱们过的越来越好,创业公司用量越大,采购需求就越强;但与此同时,大厂自研模型和模型产品部门,在 C 端和 …

2026-08-05

WoA笔记本外接显卡游戏实测:RTX 4060表现亮眼但仍有优化空间
据悉,博主使用华硕 Zenbook A16 笔记本(IT之家注:骁龙 X2 Elite Extreme 芯片)和 AG03 显卡坞完成测试。博主经过多次测试发现,RTX 4060 显卡目前对 WoA 电脑…

2026-08-05

OPPO A7 Pro Max亮相:10000mAh大电池加持 耐用与性能双在线
作为OPPO旗下首款搭载10000mAh大容量电池的手机,该机不仅续航表现强悍,还拥有七年耐用品质,同时兼具防水、抗摔能力,堪称耐用机型标杆。OPPO还会持续推送系统更新包,保障手机多年使用体验;内置多款 …

2026-08-05

美商海盗船破浪者Clipper Pro mini 60磁轴键盘上架,8K回报率售价799元
快科技8月4日消息,美商海盗船上架一款破浪者Clipper Pro mini 60磁轴游戏键盘,京东平台售价799元。 该键盘采用了目前竞技玩家青睐的60%布局,旨在为鼠标留出更大的活动空间,并搭载了海盗船自…

2026-08-05

2199元起售!OPPO A7 Pro Max携万级长寿电池登场,耐用实用新选择
如果你要的是一台“少充电、扛造、能用很多年、价格别太离谱”的实用型 5G 手机,OPPO A7 Pro Max 在 2000元出头这个区间,确实把差异化打得很清楚;但它不是给手游玩家准备的,第五代骁龙 4…

2026-08-05

2026阔折叠手机怎么选?Galaxy Z Fold8以软件适配重新定义大屏价值
阔折叠的屏幕已经足够大,真正影响使用率的却常常是软件:同一个应用展开后只是被等比例放大,两侧留下空白,图文、视频、评论和功能入口没有重新安排,大屏反而需要更多视线移动。 这四部分彼此相连:外屏与主屏先对应…

2026-08-05

Galaxy Z Fold8:轻巧便携+智能衔接,让折叠屏成日常主力之选
作为三星首款阔折叠手机,Galaxy ZFold8把201克机身、10:16外屏与4:3主屏放在一起,先降低随身负担,再让大屏在任务变复杂时自然接手。Galaxy Z Fold8从201克随身体验开始,用双…

2026-08-05