跳到主内容
@wquguru
精选82AYiAI 产品与模型

Anthropic开源30+生物模型,PhAILabs发布ScienceIDE

Anthropic 创始人 Dario Amodei今天凌晨那篇 ART 长文,一个早上就刷到了 300 多万浏览,

原文
发到 X
推荐理由

作者没有停留在功能罗列,而是深入分析了科学代码与普通业务代码在调试逻辑上的本质差异,用具体案例解释了为什么需要专门的评测考场,这种从底层逻辑切入的写法很有参考价值。

Anthropic 创始人 Dario Amodei今天凌晨那篇 ART 长文,一个早上就刷到了 300 多万浏览,

里面有一句我反复看了好几遍,数学可以纯靠推理,生物必须做实验,

但很少有人注意到,昨晚刚发了免费科研工作台 ScienceBuddy 的 @PhAILabs,上周四还开源了一个项目 ScienceIDE,把验证这一关,直接做成了 AI 的对账考场,

上周四,9 月 17 号,其实有两件重磅的事同时落地,

→一边是 Anthropic 公布,Claude 用不到四周,优化了 AlphaFold3、Boltz-2 在内的 30 多个生物学 AI 模型,代码全部开源,

→另一边是 ScienceIDE,把天体物理的 Athena++、海洋气候的 MITgcm、等离子体的 Gkeyll、暗物质探测的 NEST、量子纠错的 Stim 等 7 个学科的真实科研代码,封装成了 15 套 AI 能动手训练的环境,

判分只认一条铁律, 改完的代码算出来的科学结果,必须和基准参考结果逐点吻合, 跑通不算,对了才算,

就拿 MITgcm 来说,海洋和大气之间氟利昂交换的模块里,埋了一个 bug, AI 要自己找到,自己修好, 合不合格,不看代码写得漂不漂亮,只看最终输出能不能一个点一个点对上,

一开始我也觉得,不就是修个 bug 吗, 后来才反应过来,写业务代码,写错了有编译器和单测当场拦住你, 科学代码里最吓人的 bug,偏偏不报错, 程序照样跑完,曲线照样好看,只是海洋吸收的氟利昂悄悄偏了一点,后面整条气候推论,就跟着一起偏, 拿写业务代码的标尺去量科研 AI,量出来的多半是假及格,

难度也摆在明面上, 最难的 85 道题,8 家厂商的 15 个模型,表现最好的首次尝试正确率是 67.1%, 差不多每三道,还有一道拿不下,

另外说句实在的,现在绝大多数任务是代码修复和重构,加速类任务还在早期, 我反而觉得挺好,考场没被刷穿,才有练的价值,

两件事放在一起,味道就出来了, Anthropic 证明了 AI 有能力改进真实的科学软件,ScienceIDE 想给 AI 一个跨学科练这类活的地方, 团队还说,准备把 Anthropic 开源的优化方案也封装成训练环境,把前沿的做法,变成大家都能拿来练的标准题,

做过科研的人都懂,调代码、排 bug、适配工具、核对结果,能耗掉一个博士生大半的时间, 以前聊 AI 做科研,聊的多半是读文献、写综述、出思路, 现在它开始下到各学科的代码库里,干这些最磨人的活,还要对着基准结果一个点一个点交账,

ScienceBuddy现在免费开放,思路是让科研智能体在和研究者的长期协作里,一轮一轮变强, 同一个团队,一边做给 AI 练兵的考场,一边做给科研人当副驾的工作台,

生物学靠湿实验室验证,计算科学靠和基准结果逐点对账, 论文读得再多,综述写得再漂亮,到了几万行的模拟代码面前,还是得把每一个数都对上。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

关联信息,但可能不是同一事件