智快网
快讯 行业 产业 汽车 科技 AI+ 热点

Anthropic 57天密集更新!Opus 5性能比肩Fable 5,价格减半还更高效

2026-07-26来源:快讯编辑:瑞雪

AI模型领域的竞争愈发激烈,Anthropic再次成为焦点。这家公司刚刚推出了新一代模型Opus 5,其性能直逼旗舰产品Fable 5,但价格却大幅降低,引发行业广泛关注。

在短短57天内,Anthropic完成了对Claude主要产品线的全面更新。5月28日,Claude Opus 4.8发布;仅12天后,能力更强的Fable 5和Mythos 5相继登场;6月30日,Sonnet 5上线;7月24日,Opus 5正式发布。这种更新速度在按月迭代的AI行业中也属罕见,尤其是Fable 5和Opus 5之间仅间隔45天,令人意外。

Anthropic的这轮更新与OpenAI的节奏高度契合。7月9日,OpenAI发布GPT-5.6,并在官方评测中将Fable 5列为主要参照模型之一。15天后,Anthropic发布Opus 5,并将GPT-5.6 Sol作为核心对比对象,在陌生问题求解、电脑操作和商业流程等项目中展示自身优势。两家公司在产品发布和宣传上的"对标"意味十分明显。

Opus 5的性能提升显著。Anthropic公布的数据显示,在Frontier-Bench v0.1评测中,Opus 5超越了所有其他模型;与Opus 4.8相比,其任务完成成本更低,成绩却提高了一倍以上。在CursorBench 3.2评测中,最高投入档位下,Opus 5与Fable 5的得分差距不到0.5%,但成本仅为后者的一半。在high、xhigh和max三个投入档位下,按相同成本比较,Opus 5的表现也优于所有其他模型。

在知识工作和问题解决任务中,Opus 5同样表现出色。在ARC-AGI 3这类"陌生题"测试中,Opus 5的得分达到第二名的3倍,显示其在面对未见问题时,通过试错找到解法的能力更强。AutomationBench评测中,Opus 5的任务通过率约为第二名的1.5倍;即使使用最低投入档位,也超过其他模型的最高成绩。这意味着Opus 5无需最高推理成本即可完成更多任务。

在电脑操作测试OSWorld 2.0中,Opus 5在各个成本区间均保持领先。其成本仅为Fable 5的三分之一多一点,成绩却超过了Fable 5的最高水平。这表明Opus 5在打开应用、查找信息、跨软件操作和任务推进方面的效率明显更高。HLE跨学科难题评测中,不调用工具时,Opus 5以56.3%略低于Fable 5的56.5%;允许使用工具后,其得分升至64.7%,反超Fable 5的63.9%,且成本更低。

在模拟真实知识工作的GDPval-AA v2评测中,Opus 5最高得分1861,高于Fable 5的1747和GPT-5.6 Sol的1736。大约花费700美元,即可达到其他模型最高投入档位附近的成绩。DeepSearchQA评测中,Opus 5同样以更低成本取得了略高的通过率。在生命科学领域,Opus 5在所有评测中均超过Opus 4.8,光谱推断分子结构和预测蛋白质变异影响两项任务分别提高10.2和7.7个百分点,显示其在科研环节的潜力。

Anthropic还展示了Opus 5的视觉生成能力。一个可操作的三维风洞演示中,用户可以旋转汽车、调整风速,观察气流变化并查看阻力系数等数据。另一个三维动物细胞模型演示中,用户可以转动、剖开细胞,点击查看各结构说明,页面还会主动指出示意图的简化之处。这两个案例显示,Opus 5已能将代码、三维建模、交互界面和知识讲解整合到同一成品中,可直接搭建接近教学软件或产品原型的演示。

随着模型能力提升,安全与对齐问题成为关注焦点。Anthropic通过多个案例说明Opus 5比此前模型更擅长独立推进任务。例如,在根据机械零件图纸重建FreeCAD三维模型的测试中,Opus 5自行编写计算机视觉程序提取尺寸和几何结构,完成了建模任务,而其他模型连续尝试5次均未成功。在开源软件包管理器任务中,Opus 5不仅查出了程序错误的根本原因,还补上了社区修复方案遗漏的边缘情况。

Anthropic强调,Opus 5是目前对齐表现最好的Claude模型。上线前的自动化审计显示,与Opus 4.8、Sonnet 5和Fable 5相比,Opus 5更能遵守Claude宪法,欺骗行为更少,也更难被诱导执行有害请求。在网络安全领域,Opus 5寻找代码漏洞的水平已接近Mythos 5,但在编写漏洞利用程序和发动实际攻击方面仍明显落后。相比Fable 5,新分类器触发干预的频率预计减少约85%,正常安全研究更少被误伤。

Opus 5延续了Opus 4.8的价格体系,每百万输入Token 5美元、输出Token 25美元。在多项编程和智能体测试中,新模型不仅完成率更高,单位任务成本反而下降。与直接对手OpenAI的GPT-5.6 Sol相比,两者输入价格相同,但Opus 5的输出价格低约17%。处理超长资料时,Opus 5的价格优势更明显。Anthropic对最高100万Token的上下文维持普通单价,而GPT-5.6 Sol的输入超过27.2万Token后,整次请求的输入价格翻倍,输出价格提高50%。对于大型代码库、长篇研究资料和复杂智能体任务,这项差异将直接反映在账单上。

根据Anthropic公布的评测,Opus 5虽然在所有项目中未必都胜过GPT-5.6 Sol,但在电脑操作、商业流程和陌生问题求解等需要模型连续做事的任务上,表现和价格都更具竞争力。目前,Opus 5已成为Claude Max的全新默认型号,也是Claude Pro的最强型号,专为日常使用而设计,效率高于其他型号。

AI需求推动存储变革:企业级SSD价格单季飙升超八成,成AI算力投资新焦点
大容量QLC eSSD合约价同样上涨了80%。AI推理需求正把存储芯片的涨价接力棒从内存交到了闪存手里,AI数据中心对存储的需求也在发生结构性变化。 大容量QLC eSSD的角色转变,源头在于英伟达等AI硬…

2026-07-26

苹果折叠机iPhone Ultra量产遇阻,9月能否与iPhone 18 Pro同步开售存疑
【环球网科技综合报道】7月24日,据《福布斯》报道,距离苹果秋季新品发布会仅剩两月,首款折叠手机iPhoneUltra的上市节奏引发行业热议。 分析人士表示,尽管量产环节仍有挑战,但苹果提前锁定头部代工厂…

2026-07-26

苹果应对内存成本上涨:提议下调iPhone 18 Pro及Max OLED面板采购价
月 25 日消息,韩媒 The Elec 昨日(7 月 24 日)发布博文,报道称苹果公司为更好消化内存等存储元件供应短缺导致的成本涨价,在iPhone 18 Pro 和 iPhone 18 Pro Max…

2026-07-26

联发科天玑9600 Pro 9月登场 性能升级 成本上涨或推高旗舰手机价格
在规格方面,天玑9600 Pro搭载了2颗ARM C2-Ultra超大核,另有3颗C2-Premium大核和3颗C2-Pro中核。值得关注的是,由于台积电2nm工艺成本的大幅上涨,天玑9600 Pro的制…

2026-07-26

豆包手机二代卷土重来,AI手机赛道激战正酣,谁能笑到最后?
一代豆包手机的核心能力基于GUI Agent(图形界面智能体),AI像真人一样读取屏幕、识别按钮、模拟点击操作,在不需要App方配合的情况就可以完成跨应用操作。一代豆包手机3万台售罄、二手价翻倍的意义不在于…

2026-07-25

马斯克:AI或5年内超越人类智慧总和,机器人时代即将开启新篇章
7月24日,马斯克在最新采访中谈到了AI未来发展、人工智能安全以及科技产业变革等话题。他表示,未来5年内,AI的智能水平可能超过全人类智慧的总和,人类社会或将迎来前所未有的技术变革。他表示,如果未来出现远超…

2026-07-25

2025信息化发展成果丰硕:芯片量子科技突破,6G人形机器人进展显著
IT之家 7 月 25 日消息,昨晚,国家互联网信息办公室发布《国家信息化发展报告(2025 年)》,总结 2025 年各地区各有关部门推进信息化发展成效,开展信息化发展水平监测评估。具身智能加快落地应用,2…

2026-07-25

蓝思科技携手英特尔聚焦玻璃通孔先进封装,探索多领域合作潜力共促发展
双方将就玻璃基板穿孔成型、高精度激光加工、金属化通孔沉积及多层互连布线等关键工艺(包括但不限于上述内容)相关的潜在合作进行讨论和评估,英特尔将提供说明性架构信息、可制造性设计(DFM)指南、基准测试方法和验证…

2026-07-25

海韵携手3DMark成新赞助商,全新GPU测试流程将展示其品牌标识
IT之家 7 月 25 日消息,UL Solutions 昨天宣布,电源厂商海韵现已成为 3DMark 基准测试项目赞助商,其 Logo将出现在即将推出的全新 GPU 跑分流程中。 IT之家从官方新闻稿了解…

2026-07-25

三星T7 1TB microSD TF卡:大容量高速度强防护,多场景存储无忧之选
三星T7 microSD TF卡:为影像与游戏而生的1TB可靠之选 当4K视频持续输出、Steam Deck与Switch游戏库不断膨胀、运动相机在极限环境中捕捉瞬间、无人机航拍掠过山海——一张真正扛得住、跑…

2026-07-25