智快网
快讯 行业 产业 汽车 科技 AI+ 热点

百度智能云携手SGLang:聚焦推理基建,助力Agent迈向高效稳定规模化应用

2026-09-23来源:互联网编辑:瑞雪

近日,百度智能云携手SGLang社区共同举办了一场以“Agent时代的推理基础设施:百度百舸 × SGLang生产级实践”为主题的Meetup活动。活动聚焦于多芯适配、上下文缓存优化、显存管理以及推理服务治理等关键议题,深入探讨了如何构建支撑Agent规模化落地的推理基础设施。

随着AI技术的快速发展,Agent已不再局限于单次问答,而是逐步演变为能够理解复杂目标、拆解任务、调用工具,并在多轮交互中持续推进的智能系统。这一转变对推理基础设施提出了更高要求:上下文复用能力、超大模型部署效率以及复杂请求的稳定调度,成为影响Agent任务完成效率和规模化应用成本的关键因素。

在真实场景中,Agent任务往往涉及多轮推理和工具调用,输入上下文随任务推进不断增长,且不同轮次间存在大量重复内容。公开数据显示,在393条Agentic Coding任务轨迹中,输入输出比中位数高达213∶1,极端情况下输入序列长度甚至达到67.5万Token。这一特征对推理基础设施的上下文管理能力提出了严峻挑战。

为应对这一挑战,百度百舸与SGLang社区在多芯适配和上下文缓存优化方面展开深度合作。通过sglang-kunlun插件,SGLang与昆仑芯实现无缝对接,显著降低了模型迁移和适配门槛。同时,百度百舸推动社区建立硬件可插拔插件机制,从芯片算子、任务下发和通信等层面进行全面优化,为多芯环境下的高效推理奠定基础。

在上下文缓存方面,SGLang社区展示了从RadixAttention到Unified Radix Cache的技术演进路径。通过构建统一缓存管理体系,不同类型的KV Cache得以高效复用。实践数据显示,FULL与SWA混合模型在多轮HiCache场景下命中率达到96.8%,平均首字时延仅为1.23秒,有效提升了推理效率。

面对超大模型部署的显存挑战,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩等技术手段,释放了更多显存空间。测试表明,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可提升至原来的2.23倍,为长上下文和高并发任务提供了强有力的资源支撑。

当Agent进入生产环境,服务稳定性成为另一大考验。百度百舸从流量、负载和集群缓存三个层面入手,通过动态调度、变长行为感知分桶和KV Cache无感热迁移等技术,确保请求能够进入最合适的推理实例。同时,构建多级缓存体系并通过全链路命中率漏斗定位缓存损失环节,进一步提升了复杂负载下的服务稳定性。

活动还设置了闪电演讲环节,多位行业专家分享了关于推理服务部署、AI Infra工程自动化以及Agent发展趋势的见解。SGLang核心贡献者张晓雨强调了推理服务部署和工程自动化的重要性;元神智算CEO蓝衣剑客从标准与生态角度探讨了Agent的未来发展方向;万涂幻象社区主理人李祥瑞则聚焦上下文与主体连续性,讨论了Agent如何在真实系统中保持状态、完成交付并应对故障恢复。

这些分享共同揭示了一个趋势:Agent的价值不仅在于“更会回答”,更在于能够在连续上下文中理解任务、调用能力并完成交付。百度智能云表示,将继续与SGLang等技术社区及开发者开展技术共建,助力Agent从单点尝试走向规模化落地,推动AI技术在实际应用中的广泛普及。

阿里云栖大会“剧透”Qwen新进展:多模态升级
在近日举行的云栖大会上,阿里巴巴公布了千问大模型(Qwen LLM)的最新技术突破与应用进展。项目负责人刘大一恒透露,基于递归自我改进(RSI)技术,Qwen3.8-Max已实现全流程自主训练,在无人工干预的33轮迭代中,其性能评分从40提升至45分,跻身全球大模型第一梯队,超越多数国产模型。与此同时,新一代架构的Qwen4已进入训练阶段,未来Qwen4.5、Qwen5版本将扩展至5-10万亿参数规模,持续探索通用人工智能(ASI)的路径。

2026-09-22

比亚迪海外“传声筒”:白浩用亲身经历为中国汽车正名
定居澳大利亚多年的白浩(网名@袋鼠国SAM)从未想过,自己会成为中国汽车品牌走向世界的“代言人”。这位曾对国产车抱有刻板印象的华人,如今站在比亚迪粉丝嘉年华的舞台上,向世界讲述着中国汽车的蜕变故事。从墨尔本街头的一次偶然邂逅,到成为鲨鱼皮卡的忠实用户,再到用亲身经历打破偏见,白浩的转变折射出中国汽车工业在全球市场上的崛起轨迹。

2026-09-21