智快网
快讯 行业 产业 汽车 科技 AI+ 热点

AI大模型“生死局”:性价比“毒圈”紧缩,“斩杀线”持续攀升

2026-08-05来源:快讯编辑:瑞雪

在人工智能大模型领域,一场激烈的竞争正以惊人的速度重塑行业格局。近日,DeepSeek发布的V4 Flash 0731成为焦点,这款新模型在Artificial Analysis的Intelligence Index评测中斩获50分,较上一版本提升10分。基于Intelligence Index v4.1的评测数据,若将各家模型绘制在散点图上,纵轴代表能力得分,横轴为每任务成本,V4 Flash 0731稳居左上角,形成一片“斩杀线”——区域内模型不仅成本更高,能力也明显逊色。

“斩杀线”这一概念源于电子游戏,如今在中英文AI圈广泛流传,成为大模型竞争白热化的标志。其核心逻辑在于:模型能力与成本的差距被智能体(Agent)的应用显著放大,导致市场分化加速。例如,Claude Opus 4.8(max)能力得分为56分,每任务成本1.78美元;而DeepSeek V4 Pro(max)仅得44分,成本却低至0.04美元。V4 Flash 0731以50分超越自家Pro版本,且与能力最接近的对手GPT-5.6 Luna(max)相比,在对方降价80%后,其每任务成本仍低约60%,凸显性价比优势。

智能体的崛起是这场竞争的关键变量。传统模型评测以单次对话或单轮任务为准,而智能体需连续执行多步骤、调用外部工具,并在出错后重试,最终交付完整任务结果。这一转变使得单次回答的准确性无法全面反映模型能力,而按token计价的成本模型也因任务复杂度提升而失效。美国国家标准与技术研究院下属的CAISI在2026年5月的评估中,对比DeepSeek V4 Pro与GPT-5.4 mini在7个基准上的表现,发现同一对模型的成本高低可能因任务不同而完全颠倒,进一步印证了“按任务评测”的必要性。

Intelligence Index v4.1的评测体系正是围绕任务设计:纵轴能力指数由9项评测加权构成,其中智能体任务占比34%,编程与科学推理各占24%,通用任务占18%;横轴每任务成本则综合输入、缓存、推理等五类token的计价,按权重加权得出。这种设计直接反映了智能体对模型能力与成本差距的放大效应。例如,在编码任务中,智能体的token消耗量是代码问答与推理的千倍,模型单价差距虽小,但最终支出可能相差数个数量级。Bai Longju等人在2026年4月的论文中分析,八个前沿模型在SWE-bench Verified上的执行轨迹显示,智能体任务的token消耗随步骤数增加而激增,进一步拉大了模型间的成本差距。

能力差距的放大同样显著。单轮问答中,模型准确率差异可能仅体现在个位数百分点;但在智能体任务中,二十步串联后,95%与90%的准确率对应的成功率分别为36%与12%,差距扩大至三倍。智能体的重试机制进一步加剧了这一效应——能力不足的模型需为失败任务重复支付成本,直接转化为额外支出。这种“双重放大”效应导致性价比落在斩杀线以内的模型迅速失去市场地位。

智能体的普及也引入了更多评测变数。例如,同一模型接入不同Agent框架时,任务执行效率可能差异显著。2026年7月,Reddit上的独立评测显示,DeepSeek V4 Flash在四个Agent框架中执行真实bug修复任务时,消耗的tokens与时间相差四倍。为统一标准,Artificial Analysis开源了测试框架Stirrup,所有模型的Intelligence Index跑分均在此框架内完成,但不同框架的差异仍提示:模型能力需在系统层级验证,单纯分数难以反映真实表现。

市场对性价比的敏感度极高。大模型切换成本低,API调用标准化,开发者可快速切换模型而不影响用户体验。与此同时,基础模型层的进步放缓,同质化竞争加剧,市场份额向性价比最优者集中。例如,2026年7月30日,OpenAI将GPT-5.6 Luna价格下调80%,次日DeepSeek即发布V4 Flash 0731,迫使竞争对手跟进降价。这种“毒圈”效应——即落后者被快速淘汰,幸存者需持续奔跑——使得价格战成为常态。OpenAI的算力投入从0.2吉瓦增至1.9吉瓦,收入增长10倍,但投入与产出几乎线性对应,未形成结构性优势,印证了这场竞赛的残酷性。

成本降低是唯一的喘息机会。2026年5月,DeepSeek将V4 Pro API价格降至原价的四分之一,创全球新低,其技术底气来自混合注意力架构与多token预测技术,使单token推理运算量降至前代的27%。国新证券研报指出,到2030年,大模型推理成本将较2025年降低超90%。路透社同年7月报道,DeepSeek正在研发专用于推理的自有芯片,OpenAI与Anthropic等头部厂商也已公布类似计划,通过技术迭代与硬件优化双管齐下,维持性价比优势。

在这场生死局中,“斩杀线”与“毒圈”的流行恰如其分地描述了行业现状:落后即出局,幸存者需不断突破。模型技术迭代与基础设施投入仍在推动“斩杀线”上移,而成本降低的耐力赛远未结束。大模型竞争已从技术比拼演变为综合实力的较量,唯有在能力、成本与执行效率上全面领先者,方能在这片开阔地上占据一席之地。

三星电子发布CXL 3.2内存模组MD310:256GB容量助力AI与数据分析提速
IT之家 8 月 5 日消息,作为三星电子 FMS 2026 峰会活动的一部分,该企业在官网上公布了其新一代可扩展内存解决方案 CMM-DMD310。 MD310 是一款采用 PCIe 6.0 界面和 CX…

2026-08-05

京东开源JoyAI-Video-Edit模型:实时互动编辑让视频创作“边看边改”成现实
IT之家 8 月 5 日消息,京东今日宣布开源自研的实时流式视频编辑模型 JoyAI-Video-Edit,用户可以一边观看视频,一边修改人物与场景,让视频创作从“先有素材再修改”变为可实时互动编辑。用户不必…

2026-08-05

REDMI K100 Pro系列来袭:M11发光材料加持,画质续航双提升引领新体验
作为本次升级的核心,全新M11发光材料针对屏幕底层发光单元进行深度优化,大幅提升发光效率,搭配全RGB无损像素排列方案,彻底解决传统Pentile排列带来的像素损耗、画面发虚、边缘彩边等问题。K100 Pr…

2026-08-05

三星Galaxy Fit 4手环通过FCC认证,蓝牙升级,健康监测功能再升级
IT之家 8 月 4 日消息,三星 Galaxy Fit 4 现已通过美国 FCC 认证,预计将在近期上市。认证示意图显示,这款手环的背部外观几乎与上代产品 Galaxy Fit 3 完全一致,采用胶囊型 …

2026-08-05

新机密集发布旧机贬值加速,把握回收时机别让手机“睡大觉”
每年下半年都是手机新品集中发布周期,大量旗舰机型轮番登场,很多消费者盯着新机发布会,却忽略手里旧手机正在持续贬值。线上平台最容易踩坑 “虚高估价引流”,寄出手机之后,以细微划痕、电池损耗、屏幕老化大幅砍价,消…

2026-08-05

OPPO新机预售引对比,REDMI Note 17 Pro性价比优势再度凸显
即使有9000mAh电池和1.5K直屏撑场面,我仍觉得它的性能太保守,1599元谈不上多香。只看这些外围体验,OPPO A7 ProMax甚至比不少性能更强的同价位手机考虑得周到。 以前我嫌红米性能不够狠,…

2026-08-05

2026年7月安卓性价比榜揭晓:摩托罗拉千元档大放异彩 包揽前三
榜单第一名是摩托罗拉Moto G100s,8+256GB版本售价仅849元,跑分794839,性价比数值高达936.2,是千元档断层第一。 三款机型统一走“大电池长续航”路线,电池容量最低6720mAh,完…

2026-08-05

AI助力“推翻”考拉兹猜想落空,Lean 4.32.2版本紧急修复内核漏洞
IT之家注:考拉兹猜想(又称奇偶归一猜想 / 3n+1 猜想)由德国数学家洛塔尔 · 考拉兹(Lothar Collatz)于 1937 年提出,是一个表述极其简单但至今未解的数学难题,断言任意正整数在经过…

2026-08-04

华为2026年8月5日发布会来袭 六款全场景智能终端新品蓄势待发
发布会将正式亮相六款新品,涵盖折叠电脑、旗舰平板、轻薄笔记本、中高端智能手机以及两款智能穿戴设备。 其中,MateBook Fold非凡大师折叠电脑采用创新铰链结构与柔性屏幕技术,在保持便携性的同时实现接近…

2026-08-04

冰箱能24小时运转,空调能否长期开?格力朱磊:质量达标也可一直开
IT之家 8 月 4 日消息,话题“为什么冰箱能一直开但空调不能”今日冲上热搜第八。 可能很多朋友都有这个疑问。为什么冰箱可以 24小时不停运转,空调却总被人觉得不能长期开机。 日常家庭里空调很少全天候…

2026-08-04