跳到主内容
@wquguru
精选70深潮 TechFlow(RSS)研究与分析

OpenAI 发布 LifeSciBench,评估 AI 科研能力

OpenAI 发布 LifeSciBench:衡量 AI 系统在真实科研场景中的能力

原文
发到 X

深潮 TechFlow 消息,6 月 18 日,OpenAI 发布全新评测基准 LifeSciBench,旨在衡量 AI 系统在真实科研场景中的能力。据悉,LifeSciBench 基于 750 道专家编写任务,覆盖 7 类科研工作流与 7 个生物学领域,任务来源于 173 名具有博士背景并具备生物科技或制药行业经验的科研人员,该基准强调复杂科研能力评估,包括证据整合、实验设计、数据分析、科学推理与科研沟通等能力,而非单一事实性问题。超过 79%的任务包含多步骤推理,平均每道题需约 4 个推理步骤,并包含 1,062 个真实科研相关数据附件(如论文、图表、序列数据及结构文件等)。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

关联讨论

同一事件的更多信源

相似阅读

另一事件,读法相近