智快网
快讯 行业 产业 汽车 科技 AI+ 热点

代码大模型考卷升级!字节开源FullStack Bench,首次覆盖全栈编程超11类真实场景

2024-12-05来源:互联网编辑:芳华

代码大模型越来越卷,评估AI编程水平的“考卷”也被迫升级。12月5日,字节豆包大模型团队开源最新代码大模型评估基准FullStack Bench,在业界首次囊括编程全栈技术中超11类真实场景,覆盖16种编程语言,包含3374个问题,相比此前基准,可以更有效地评估大模型在现实世界中的代码开发能力。

代码评估基准是衡量大模型编程能力的标准工具,也是推动模型优化的关键驱动力。不过,当前的代码评估基准覆盖的应用类型和编程语言较为有限,难以反映真实世界中代码开发场景的多样性和复杂性。

比如,主流代码评测集Humaneval和MBPP中近80%数据只聚焦基础编程和高级编程问题;DS-1000中95%数据都集中于数据分析和机器学习任务,且仅对Python语言进行评测;xCodeeval虽覆盖多项任务,但基本局限于高级编程和数学领域。

图表, 条形图

描述已自动生成

FullStack Bench数据覆盖超11种应用领域,远超当前主流代码评估基准

因此,字节豆包大模型团队与M-A-P开源社区联合提出FullStack Bench,一个专注于全栈编程和多语言编程的代码评估数据集。为囊括在真实全栈开发中涉及的各类应用场景,研究团队从全球最大的程序员技术问答社区Stack Overflow中随机抽取了50万个问题进行分析,筛选出占总问题数前88.1%的应用领域,并对其分布做了适当调整来保证每个领域的鲁棒性,最终形成了FullStack Bench关注的超过11种应用场景及分布比例。

FullStack Bench包含3374个问题,每个问题均包括题目描述、参考解决方案及单元测试用例,总计15168个单元测试。为保证评估准确性,问题内容均由相关领域的编程专家设计,并经AI和人工验证进行质量复核。在初始数据集构建后,团队根据主流代码大模型测试结果,按问题难度、模糊性和可解性对数据质量进行了交叉评估和进一步完善。

表格

描述已自动生成

FullStack Bench数据集构成情况

为方便开发者对大模型代码能力进行系统性测试,豆包大模型团队还开源了一款高效的代码沙盒执行工具——SandboxFusion,用于评估来自不同语言的不同编程任务。除了FullStack Bench,SandboxFusion还兼容超过10种广泛使用的代码评估数据集,支持23种编程语言。开发者在单服务器上即可轻松部署SandboxFusion,也可直接在GitHub上进行体验。

图形用户界面

描述已自动生成

发布评测基准及沙盒的同时,字节代码大模型也首次曝光。研究中,豆包大模型团队对全球20余款代码大模型及语言大模型的编程表现进行了评测(详见论文),其中包括未披露过的豆包代码大模型Doubao-Coder。

近半年,字节在代码大模型领域进展迅速,今年6月字节发布了由自研代码基座模型支撑的AI编程助手豆包MarsCode ,目前每月为用户贡献百万量级代码。

论文地址:https://arxiv.org/pdf/2412.00535v2

数据集开源地址:https://huggingface.co/datasets/ByteDance/FullStackBench

沙盒开源地址:https://github.com/bytedance/SandboxFusion

沙盒体验入口:https://bytedance.github.io/SandboxFusion/playground/datasets

华为鸿蒙6系统登场:流畅度大幅提升,跨生态互传成亮点,用户体验全面升级
就在刚刚,华为HarmonyOS 6 正式亮相,这次流畅度直接暴增40%,用余承东的话来说,体验就像换了新手机。接下来就是AI了,作为当下大厂都在卷的能力,这次鸿蒙直接自带 “智能体”。 10 月 22 …

2025-10-23

2025旗舰手机怎么选?荣耀Magic8系列凭全能实力成热门之选
从性能表现到AI体验,再到影像与设计,Magic8系列用实际体验证明了它为何能被列为“最好旗舰”的代表。更重要的是,Magic8在手感上做了细腻优化,机身弧线与掌心贴合,带来更舒适的握持体验。对那些追求稳定性…

2025-10-23

华为鸿蒙6系统新突破:支持与苹果设备“碰一碰”互传文件,个性化功能升级
值得注意的是,鸿蒙操作系统6还可以通过简单的“碰一碰”轻松分享照片、音乐、链接等丰富内容。与大部分国产智能厂商类似,为了增加和苹果生态的协同性,鸿蒙操作系统6可以通过碰一碰和iOS、iPadOS、macOS设…

2025-10-22

鸿蒙操作系统5问世一年终端破2300万,6代系统今日下午将正式登场
2025年10月22日,华为召开鸿蒙操作系统6发布会,发布会一开始,华为常务董事、终端BG董事长余承东对外表示,鸿蒙操作系统5终端数量突破2300万。 据了解,鸿蒙操作系统5是华为于2024年10月22日推出…

2025-10-22

性能旗舰之争:荣耀Magic8凭软硬件协同优势成今年热门之选
荣耀Magic8的影像系统结合AI算力,在长焦、夜景、人像等场景中都有显著提升。 对于正在考虑入手一款顶级旗舰的用户而言,荣耀Magic8无疑是今年最值得关注的答案——在众多高性能机型中,它以稳、快、智的综合…

2025-10-22

售价13000元!三星Galaxy XR头显发布 直面苹果Vision Pro高端之争
【CNMO科技消息】10月21日,三星正式发布了其首款混合现实头戴设备——GalaxyXR,官方售价定为1799.99美元(约合人民币13000元),直接瞄准了苹果Vision Pro的高端市场。借助头显的…

2025-10-22

真我GT8 Pro深度体验:影像创新联动理光GR,性能越级再升级
使用真我GT8 Pro拍摄后就会发现,它可以说是把理光GR的整套理念和色彩科学都塞进了手机里。 长焦还上了2亿像素1/1.56英寸大底潜望,在3倍、6倍和12倍变焦下,画质都有很高可用性,也是长焦街拍的很好补…

2025-10-22

AMD驱动优化显成效!RX 9070与RTX 5070实测对比,性能差距扩大至13%
Hardware Unboxed(HU)的最新测试结果,再次印证了这一说法:Radeon RX9070在最新的驱动和游戏补丁加持下,性能差距与竞争对手RTX 5070明显扩大。 即使加入各自的超分技术,R…

2025-10-22

性能狂飙无上限!一加15携六大行业首创技术震撼登场
行业首发冰河超临界气凝胶,航天级隔热材料,有效隔绝指尖温度; 行业首发冰河VC散热,超薄手撕钢材料,散热速度快两倍; 除此以外,一加15还拥有独家自研冰河芯片空调架构,可降低芯片核心区温度,同时安卓首批全新…

2025-10-22

iQOO 15今晚登场:以跨代理念重塑性能旗舰,带来极致体验盛宴
iQOO 15以“跨代领先”为核心理念,在电竞体验、视觉观感、影像能力和续航表现等方面实现全方位突破,为追求极致的用户带来前所未有的使用体验。从电竞性能到视觉观感,从影像能力到续航表现,iQOO 15以全方…

2025-10-22