
文章主要内容和创新点主要内容本文针对大型语言模型(LLMs)在多选题任务中因选项位置或标签偏差导致分数虚高的问题,提出了一种名为SCOPE的评估框架。该框架通过两个核心模块减少选择偏差,实现对模型真实理解能力的公平评估:Inverse-Positioning(IP)模块:通过大量无语义的“空提示”(null prompts)估计模型的固有位置偏差分布,再基于该分布的逆分布重新分配正确答案的位置,平衡“幸运率”(因位置偏好偶然选对的概率),理论上确保幸运率不超过随机猜测水平(1/n)。Semantic-Spread(SS)模块:识别与正确答案语义最相似的干扰项(SSD),通过距离加权概率将其放置在远离正确答案的位置,减少模型因语义 proximity 进行“近误猜测”的可能性。实验表明,SCOPE在MMLU和CSQA等基准测试中,相比现有去偏方法(如CalibraEval、Majority Voting等),能更稳定地提升模型评估性能,且正确选项的置信分布更清晰,为LLM评估的公平性和可靠性提供了新标准。创新点数据集无关的位置偏差估计:通过空提示独立量化模型的内在位置偏差,不依赖特定数据集。基于逆偏差分布的答案位置采样:抑制因位置偏好导致的“幸运命中”,为幸运率设定理论上限(1/n)。语义相似干扰项的距离加权