在顶尖材料实验室里,研究员面临的困境往往不是缺乏创新灵感,而是AI能在一天内生成数百种新配方,而人工实验验证却需要耗费数年时间。更令人惋惜的是,项目结束后,大量实验数据、经验参数和失败案例未能有效留存,导致后续研究不得不重复试错。这种困境并非个别现象,而是AI for Science(AI4S)领域普遍存在的结构性矛盾。
当前,AI技术迭代速度惊人,模型参数持续扩容,智能体运行能力稳步提升。软件任务交付周期从按月计算缩短至按天甚至按小时计算,行业普遍认为沿着现有技术路径优化,AI的通用能力将保持稳步提升。然而,真实数据却揭示了另一面:过去18个月,AI Coding领域任务成功率从不足5%飙升至88%,代码生成与自测迭代闭环已成熟,赛道增量空间逐渐收窄。相比之下,核心科研领域的技术迭代节奏明显平缓,主流大模型在科研任务中的完成率仅约3%,在NatureBench涵盖的90项顶级科研任务中,最优智能体超越原始论文成果的比例仅为17.8%。
这种冷热不均的现象,暴露了AI的能力边界:大模型擅长处理答案固定、反馈即时的标准化任务,但在无标准答案、问题维度模糊、验证周期漫长的原创科研场景中,适配性显著不足。尽管AI已掌握高效编码和标准化解题能力,但在未知领域的自主探索和原创创新方面仍存在明显短板。上海AI实验室主任、首席科学家周伯文指出,这种差距的核心在于当前大模型普遍缺乏科学元认知能力——它们能生成看似自洽的推演结论,却无法自主提出可证伪的科学假设;能基于文本做概率拟合,却无法在真实世界反馈中修正和重构认知。
科研场景的特殊性进一步放大了这一短板。编程任务具有秒级反馈和即时证伪的特性,任务对错可快速判定;而基础科研试错成本高、验证周期长,失败数据公开度低,有效反馈样本稀缺。模型训练主要依赖公开的成功论文成果,难以学习海量真实试错背后的底层逻辑,导致AI科研陷入"擅长模仿复用、弱于原创突破"的现状。这种现状形成了两大核心瓶颈:一方面,AI生成的海量科研方案因线下实验验证效率低下而堆积;另一方面,科研试错经验和实验数据缺乏系统化留存,导致重复试错和低效迭代。
在WAIC 2026上,上海AI实验室发布的"书生·端砚"科学发现平台,为这一长期存在的矛盾提供了新的解决方案。与多数产品仅通过大模型适配科研场景实现浅层提效不同,"书生·端砚"以干湿实验闭环迭代和科研资产沉淀为核心能力,构建了完整的真实场景反馈链路,推动AI科研从单点效率优化迈向范式升级。该平台通过"读-算-做"一体化闭环,打通了数字推演与实体实验的关键环节:AI自主生成科研假设后,智能体完成多维度仿真筛选,自动化实验设备承接落地测试,实测数据实时回流迭代。全流程无需人工跨平台操作,多智能体协同核验系统可实现自主运转和自动纠错。
在蛋白质工程领域,该平台将传统数天的迭代周期压缩至分钟级,验证通过率提升超3倍;在量子计算领域,依托极速闭环验证能力,创下60毫秒搭建2024原子无缺陷阵列的全球纪录。这些成果验证了闭环系统的价值:它不仅提升了计算效率,更解决了推演产出多、落地验证难、偏差修正慢、成果转化弱等核心痛点,使AI科研能够对接真实世界的迭代逻辑,从标准化工具升级为科研协作载体。
针对科研经验流失问题,"书生·端砚"构建了全流程科研资产结构化沉淀体系。平台将资产沉淀机制深度融入科研链路,所有公式图表、实验参数、运行代码、成败数据和推演日志均按专业标准自动归档、统一留存。特别是行业长期忽视的失败数据和无效试错参数,得以完整保存,补足了AI科研训练中稀缺的负样本数据。这些资产并非静态存档,而是可复用、可迭代的动态资源,支持跨项目、跨团队快速检索复现,同时持续反哺大模型优化,提升科研判断力和推演精准度。
目前,"书生·端砚"已在蛋白质工程、量子计算、脑科学、新材料研发、半导体和地球气象六大前沿领域落地应用。其技术探索表明,AI赋能科研的终极价值不在于替代研究员思考,而在于聚焦前沿创新,推动AI从标准化算力工具进化为可探索未知、可持续迭代的科研伙伴。正如周伯文所言,AI的使命应从"加速科研自动化"转向"以复杂科研任务牵引高阶智能",帮助科学家更快验证判断、更系统沉淀判断,使每次实验反馈都成为新假设的起点。

