智快网
快讯 行业 产业 汽车 科技 AI+ 热点

千问3.8-Max发布:国产模型激战正酣,阿里如何突围制胜?

2026-08-04来源:天脉网编辑:瑞雪

8月初,阿里正式推出Qwen3.8-Max大模型,参数规模高达2.4万亿,支持最长100万Token上下文,重点提升编程、办公、科研及长周期任务处理能力。官方宣称,该模型不仅能回答问题,还可调用工具、修改代码,并端到端完成复杂任务。开发者可通过千问AI平台获取API服务,每百万Token输入12元、输出36元,价格处于国产头部模型中间水平。阿里计划开源Qwen3.8系列的27B小尺寸模型,为本地部署和低成本应用提供更多选择。

在7月19日预览版上线时,千问团队便宣称该模型以“天”为单位持续进化,对标Anthropic旗舰模型Fable 5,并称其“可能是除Fable 5外最强大的模型”。然而,实际测试显示,Qwen3.8-Max在科研编程、Agent和办公任务中进步显著,部分项目甚至超越海外旗舰模型,但在真实软件工程和复杂环境操作中仍存在差距。例如,在SWE-bench Pro测试中,Qwen3.8-Max得分为67.7分,比Fable 5低12.3分,也略低于Claude Opus 4.8的69.2分。

第三方榜单Arena的成绩也反映了类似情况。Qwen3.8-Max在视觉和文本榜单上分别排名第二和第五,与榜首相差13分;在前端代码榜单中排名第四,比榜首的Opus 5-Max低37分。尽管官方编程基准成绩较好,但Arena榜单更侧重生成结果的视觉效果、交互完成度和用户偏好,因此Qwen3.8-Max未能登顶并不矛盾。长周期任务是Qwen3.8-Max的亮点之一,例如连续运行约16天从零构建开源项目oh-my-cli,但连续运行16天仍不足以证明长周期能力已完全成熟,还需考察其目标一致性、错误发现和恢复能力。

千问系列模型一直成绩亮眼。5月20日发布的Qwen3.7-Max曾在Code Arena排名第四,Text Arena排名第六。然而,实际使用中开发者反馈不一。开发者艾林认为,Qwen3.7-Max对项目理解清晰,但在处理复杂代码时易出现漏洞。新一代Qwen3.8-Max在任务拆解、Agent调用和需求理解上有所提升,但与Fable系列仍有差距。独立开发者李默测试后表示,Qwen3.8-Max已接近第一梯队门槛,但在生成交互网站时存在核心功能未完整实现、HTML标签直接显示等问题,需将要求拆解得非常具体才能执行到位。

与国内近期发布的新模型相比,Qwen3.8-Max在与Kimi K3的对比中,仅在工作流智能体任务上超过对方,其余项目多数落后,尤其在深度软件工程和前沿工程任务中差距较大。与DeepSeek V4 Flash的对比则更多反映定位差异,Qwen3.8-Max在所有可比项目中均占优势,但轻量模型V4 Flash以更低成本取得“够用”成绩,挑战了中间价位旗舰模型的价值。开发者李默认为,Qwen3.8-Max在长上下文和复杂任务上的提升“实打实”,但代码能力仍弱于GLM 5.2和Kimi K3,尚未稳定排进第一梯队前列。

阿里面临的竞争环境愈发复杂。过去,架构创新、更长的上下文或更低的API价格可能成为模型卖点,但如今这些能力正在快速普及,MoE架构、百万Token上下文、智能体编程、多模态和开放权重几乎成为国产头部模型的共同方向。对手动作也越来越快,Kimi K3在复杂软件工程和长周期任务中表现突出,DeepSeek V4以低价和推理效率吸引开发者,GLM 5.2则凭借编程能力获得海外开发者认可。技术路线趋同下,单个模型难以建立长期壁垒,竞争转向谁能持续推出更强模型并降低推理成本。

API定价策略反映了四家的不同思路。Kimi K3走高价旗舰路线,DeepSeek V4-Pro用低价争夺调用量,Qwen3.8-Max与GLM 5.2处于中间档位,但千问输入、输出价格均高于智谱,不占价格优势。对于编程和Agent任务,Token单价只是成本一部分,任务成功率、重试次数和人工接管成本往往更影响总成本。低价模型若频繁理解错需求,节省的调用费用可能被检查和返工成本抵消;高价模型若能一次完成任务,综合成本反而可能更低。因此,Qwen3.8-Max需证明其完成同一项任务时能带来更低综合成本。

阿里的独特优势在于模型之外的完整生态。在模型层面,阿里已覆盖通用语言、编程、数学、视觉、语音、全模态和视频生成,并延伸至世界模型和具身智能,企业可在同一平台组合不同模型。在产品层面,阿里拥有云计算、模型开发平台、钉钉、淘宝及大量企业客户,模型可直接接入办公、电商、客服、营销和软件开发场景。发布当天,阿里旗下企业级Agent产品“千问办公”同步开启公测,模型能力正被直接装进办公场景。阿里披露,Qwen在国内企业级大模型调用市场排名第一,阿里云也位居国内AI云市场第一。然而,生态不能替代模型能力,企业倾向于在同一系统中调用多个模型,哪个效果更好、价格更低就用哪个。若千问长期落后于第一梯队,云和渠道只能延缓用户流失,无法消除能力差距。阿里的竞争力仍存在,但壁垒已非某一款Qwen模型,模型能力决定入场资格,价格决定开发者尝试意愿,云服务和企业生态则决定客户是否长期留下。

安谋科技All in AI战略加速跑:四大产品线迭代,三大业务线成果斐然
我们看到,从边缘、物理到云端,安谋科技持续引入Arm在这三大业务领域的前沿技术,同时深耕本土创新,自研IP与Arm技术创新互补,构筑异构计算平台,给智能体时代AI落地打造坚实的算力基石。 纵观四大产品线、三…

2026-08-04

小米REDMI 17 5G手机渲染图来袭:三色可选 超大电池+高性能芯片引关注
IT之家 8 月 4 日消息,科技媒体 91Mobile 昨日(8 月 3 日)发布博文,分享了一组渲染图,展示了橙色、黑色和蓝色 3种颜色的小米 REDMI 17 5G 手机。尺寸方面,小米 REDMI …

2026-08-04

南天信息携手华为成立联盟 依托技术优势共探产业数智化转型新路径
(来源:云南工投集团) 近日,云南省工投集团所属南天信息作为华为钻石经销商、华为金融融海计划重点合作伙伴,参加华为深圳场景化解决方案发布会,与300多名客户与伙伴代表,以及众多行业领袖与专家学者齐聚一堂,共探…

2026-08-04

OpenAI新模型Astra攻克10道数学难题成本2000美元
OpenAI近日在官方网站发布消息,其新一代人工智能模型系列被命名为“Astra”。该公司透露,其中一款处于内部测试阶段的模型已成功解决或推动了10道长期困扰数学界的难题,完成这些推理任务所需的词元成本约为2000美元。

2026-08-04

索尼音频新品来袭:INZONE H9 II联名套装登场,WH-1000XM6解锁橄榄灰新配色
耳机搭载与WH-1000XM6同款的30mm碳纤维驱动单元,兼顾解析力与动态表现,既能精准捕捉游戏中脚步声、枪声、方位音效等细微声响,带来沉浸式对战体验,也可轻松驾驭日常音乐、影音播放,实现一机多用。同时设备…

2026-08-04

SK海力士携手闪迪:FMS 2026将推HBF标准,加速AI存储生态构建
该规范定义了两种容量配置,分别采用 8 层和 16 层 NAND 芯片堆叠,最高支持 512GB 容量;并按三个等级(Grade1~3)设定带宽标准,数据传输能力覆盖约 0.4TB/s 至 3.0TB/s。…

2026-08-04

苹果加速布局摄像头AirPods领域,两款新品并行开发一款或年内登场
最初有传闻称,这款产品会在今年发布,但随后发布时间被推迟到了明年。 目前还无法确定这两款产品最终会采用怎样的设计,但首款配备摄像头的AirPods 最快有望于今年 9 月正式亮相。 不过,B790 与 B7…

2026-08-04

2026年7月安卓性能榜揭晓:iQOO 15 Ultra领跑,多款机型表现亮眼
从当下的跑分成绩来看,iQOO 15 Ultra不愧于自己性能Ultra的产品定位,也展现了骁龙8 Elite Gen5这枚处理器的潜力。换言之,搭载骁龙8 Elite Gen5领先版的红魔11S Pro…

2026-08-04

2026年7月安卓平板性能TOP10揭晓:vivo Pad6 Pro登顶,调校优势显著
多款搭载骁龙8至尊版Gen5的旗舰平板同台比拼,vivo Pad6 Pro拿下榜单第一名。榜单第八到第十名机型搭载上一代骁龙8至尊版,分数全部落在320万至333万区间,分别是OPPO Pad4 Pro、…

2026-08-04

Jeff Dean最新访谈:基础模型扩张下,小团队如何抓住1%机会与巨头竞争?
这也是他所说的上下文工程:基础模型本身没有发生变化,但当人们把专业经验整理成清晰的步骤、工具和评估标准后,模型在特定任务上的能力会随之提高。JeffDean 所说的“1% 法则”,就是从当前模型几乎无法完成…

2026-08-03