Beyond Single Models: Enhancing LLM Detection of Ambiguity in Requests through Debate
2026/9/15 11:10:06 网站建设 项目流程

文章主要内容总结

本文聚焦于大型语言模型(LLMs)在处理用户请求时面临的歧义检测挑战,提出并评估了一种多智能体辩论框架,以提升歧义检测与 resolution 能力。

  • 研究背景:单LLM在处理用户请求中的歧义(如数值、属性、空间描述模糊)时表现有限,可能导致错误响应,尤其在人机协作等需精准执行的场景中问题突出。
  • 方法设计
    • 构建了包含数值歧义(如“几个” vs 具体数量)、属性歧义(如“物品” vs 具体“方块”)、空间歧义(如“附近” vs 具体方位)的程序化数据集;
    • 选取Llama3-8B、Gemma2-9B、Mistral-7B三种LLM作为智能体,对比单智能体基线与多智能体辩论模式(领导者-追随者协议)的性能。
  • 核心发现
    • 辩论框架显著提升了Llama3-8B和Mistral-7B的性能,其中Mistral-7B作为领导者时成功率达76.7%,尤其擅长处理复杂歧义且共识效率高;
    • 性能存在模型依赖性:Gemma2-9B单模型表现最优(80.0%成功率),但辩论模式反而使其性能下降(48.3%);
    • 辩论模式在空间歧义检测中提升最显著(如Mistral-7B从10%提升至75%),且Mistral-7B领导的辩论共识率高达98.3%,平均仅需1.5轮。
  • 结论:多智能体辩论框架

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询