今天,人工智能领域欢庆不已。清晨,OpenAI正式推出了其最新旗舰模型GPT-6 Astra,声称其为当前最强大的AI模型。该模型在多个领域,包括计算机使用、网络浏览、软件开发、网络安全和科学研究等,均已打破了当前的性能纪录。OpenAI的副总裁Greg Brockman表示,这标志着“世代转变”,并可能开启AGI(通用人工智能)的新纪元。虽然关于模型的代码和视频生成能力受到广泛关注,但关于其在科学研究中的应用却鲜有深入讨论。如果将目光从AGI的讨论转移,关注GPT-6 Astra的具体性能数据,就会发现它展示了AI4S(人工智能服务于科学)领域的新进展。
AI模型正逐渐迈向新的高度。需要提及的是Terminal-Bench这一评估基准,它已成为衡量AI智能体能力的重要标准,众多前沿实验室均在使用此工具追踪和比较各自模型的表现。Terminal-Bench Science 0.1被称为“科学版Terminal-Bench”,专门评测智能体在科研工作流程中使用代码和终端工具的能力,涵盖了生命科学、物理科学、地球科学、数学科学与工程科学等多领域的70个任务。在这一基准测试中,Astra以64.6%的分数刷新了当前纪录,而其对照模型Claude Fable 5.1得分为52.6%。更值得注意的是,Astra在获得这些成绩时的API成本比对照组低约31%,意味着不仅在能力上领先,更在效率上有所提升。
从AI4S的角度来看,过去的科研流程需要科学家分多轮沟通来完成,如文献调研、提出假设、进行模拟、核对数据及给出建议等,现在这些流程有望由一个智能体独立完成。举例来说,一位科学家使用Astra开发了一个复杂的生物医学应用来分析流式细胞术的数据。流式细胞术是免疫学中的基础技术,允许科学家一次性分析大量单细胞数据。以往该领域常被商业软件垄断,但现今这位科学家表示,他的实验室以往每年支付数千美元的商业软件订阅费用,现在已全部取消,因为他自己利用Astra构建出了一个完整的研究级应用,并强调其用户体验已超出许多商业工具。
此案例表明,AI不仅提升了科学家的工作效率,更使得科学家可通过编写提示直接替代商业软件的功能,这对依靠软件分析费生存的公司来说,或将是一次重大冲击。同时,智能体的成本下降意味着中小型团队现在也有可能使用这类科研能力。
在官方报告中,特别设计了一个章节来评估如何推进科学发现。GPT-6 Astra在对比测试中取得了一系列最佳表现,其中GPQA Diamond项目用于测试研究生在生物学、化学和物理学方面的科学推理能力,Astra的新高分为96.0%。在真实临床工作中的表现基准HealthBench Professional,Astra的得分为63.4%,也较上一代产品有所提升。此外,Astra在一些较为罕见、难度极高的基准测试中表现略有提高,分别在生命科学、计算生物学与药物化学领域获得了60.3%、37.8%和49.3%的得分,而相关的成本也大幅度下降。
需要指出的是,OpenAI在脚注中表示,Claude Fable系列未被纳入这些高难度基准的对比,因为它们在相关问题上多选择拒绝答复,这反映了两个模型在安全性策略上的不同。此现象对科学家选择AI模型将产生实际影响。
最后,还存在一组可能被忽视的数据,这些数据对AI4S行业的未来发展可能带来深远的影响。
发表评论