跳到主内容
@wquguru
精选82Hugging Face 每日论文(json_list)论文研究

Apodex Discovery:发现型AI评测框架与基准环境

Apodex Discovery: Reality Benchmarks and Environments for Evaluating and Building Discoverative Artificial Intelligence

原文
发到 X

阿波罗登月并非仅仅因为其工程师能解出复杂的方程。它之所以成功,是因为将遥远的雄心转化为包含明确目标、模拟、验证和反复修正的任务架构。人工智能如今面临类似的转型:前沿模型在问题、工具和成功标准被明确指定后,能够解决困难任务,然而具有重大现实意义的挑战很少以可执行或可验证的形式出现。 我们推出Apodex Discovery,这是一个通过重型求解器构建和评估探索性AI的框架,该系统由基础模型、工具链、工具和控制策略组成,旨在进行扩展的、有状态的、可验证的调查。它包含三个核心组件。首先,一个问题侦察过程调查了16个行业的561个产业,汇集了423个高价值现实问题,并选出20个用于初始发布。其次,一个通用的环境-任务-情节抽象提供数据、工具、约束、反馈、轨迹记录,以及对中间产物和最终提交的验证。第三,HDS6独立于最终任务成功,评估工具、修复、替代方案、连贯性、证据和范围。 在AAV衣壳设计中,Apodex在可行性、趋向性、结构预测和生成设计方面超越了已发表的最先进水平7%。在药物再利用和重新配方中,一个特定任务的生物医学环境将GPT-5.5和GPT-5.6-sol的平均归一化预测分数分别提高了2.5和7.6分,相较于同一闭卷骨干模型。受控消融实验表明,固定的TRACES情节接口能够将性能差异归因于特定的求解器组件。Apodex Discovery将AI评估从预定义基准推向旨在真正发现的可验证调查。

更进一步:量化金融体系

看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力

进入量化体系 →

相似阅读

另一事件,读法相近