文章主要内容和创新点
主要内容
本文针对大型语言模型(LLMs)在隐喻理解任务中的能力进行了全面评估。研究通过多个公开数据集(涵盖自然生成和词汇替换构建的数据),在自然语言推理(NLI)和问答(QA)任务中,结合零样本、少样本及思维链(CoT)等多种提示配置,分析LLMs对隐喻语言的理解能力。结果表明:LLMs的表现更多受词汇重叠、句子长度等表面特征影响,而非对隐喻内容的深层理解;所谓的“隐喻理解能力”实际是表面特征、上下文学习和语言知识共同作用的结果;少样本和CoT提示设置的表现优于微调编码器,可减少对大量人工标注数据的依赖。
创新点
- 多维度评估框架:首次在多数据集、多任务(NLI和QA)、多提示配置下评估LLMs的隐喻理解能力,突破了以往单一数据集或任务的局限。
- 表面特征影响分析:通过定量和定性分析,明确LLMs的表现更依赖词汇重叠、句子长度等表面特征,而非对隐喻的真正理解,揭示了其“隐喻理解能力”的本质。
- 提示策略优势:验证了少样本和CoT提示设置优于微调编码器,降低了对特定任务标注数据的需求,为隐喻理解任务提供了更高效的评估和应用思路。
翻译部分
摘要
本文全面评估了大型语言模型(LLMs)在多个数据集、任务和提示配置下的隐喻理解能力。尽管隐喻处理在自然语言处理(NLP)领域已受到广泛关注,但以往研究局限于单一数