精选75Hugging Face 每日论文(json_list)论文研究
解码级禁忌词:LLM 鲁棒性诊断压力测试
Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
大型语言模型的评估通常侧重于名义条件下的性能,造成了一种能力错觉,即模型能够轻松行走在一条狭窄且高度优化的生成走廊上。然而,在实际部署中,复杂的系统提示、安全护栏和结构约束不断迫使模型偏离这条名义路径,导致基准分数与部署性能之间出现分歧。为了解决这个问题,我们引入了解码级禁忌(Decoding-Level Taboo),这是一种零提示的诊断性压力测试,它在运行时直接干预logit空间,迫使模型偏离其名义路径。通过在词边界动态屏蔽主要候选词,禁忌迫使机器进行迂回表达。 在多个开放权重模型家族上评估禁忌,揭示了偏离路径的鲁棒性受参数规模和训练后指令对齐的强烈影响,鲁棒性通常随模型大小和对齐程度的提高而增强。除了本文呈现的结果外,禁忌还提供了一种新颖的原始方法,用于生成多样化的合成数据集、压力测试运行时安全护栏,以及在实际部署前审计模型的可靠性。
更进一步:量化金融体系
看懂新闻只是起点——沿量化金融路径,把它变成能交付的工程能力