FramingQA: Does the Question Shape the Answer? Measuring the Compositional Framing Effect
研究通过FramingQA基准测试,评估大型语言模型对问题表述的敏感度及其在不同领域内提供一致答案的能力。
0 citationsRead paper
研究通过FramingQA基准测试,评估大型语言模型对问题表述的敏感度及其在不同领域内提供一致答案的能力。
论文解决了LLM评分器因顺序依赖导致决策不一致的问题,提出通过OC-SFT方法训练模型减少顺序影响,提高决策稳定性。
本文提出SenseShift框架,通过编码器和迭代掩码填充方法解决长文本中句子级情感控制问题,实现细粒度情感控制的同时保持文本质量。
本文通过树结构WY变换和单次三角求解方法,解决了Gated DeltaNet混合模型在推测解码时内存效率低的问题。
为解决法律合同最终审查自动化问题,提出ContractScrub基准,评估大语言模型在检测错误和不一致方面的表现。
研究通过FramingQA基准测试,评估大型语言模型对问题表述的敏感度及其在不同领域内提供一致答案的能力。
论文解决了LLM评分器因顺序依赖导致决策不一致的问题,提出通过OC-SFT方法训练模型减少顺序影响,提高决策稳定性。
本文提出SenseShift框架,通过编码器和迭代掩码填充方法解决长文本中句子级情感控制问题,实现细粒度情感控制的同时保持文本质量。
本文通过树结构WY变换和单次三角求解方法,解决了Gated DeltaNet混合模型在推测解码时内存效率低的问题。
为解决法律合同最终审查自动化问题,提出ContractScrub基准,评估大语言模型在检测错误和不一致方面的表现。