Understanding Counting Mechanisms in Large Language and Vision-Language Models
2026/9/8 13:12:38 网站建设 项目流程

文章总结与翻译

一、主要内容

该研究聚焦大型语言模型(LLMs)和大型视觉-语言模型(LVLMs)在计数任务中的内部机制,通过受控实验、因果中介分析、激活修补等方法,结合专门设计的工具CountScope,系统探究了模型对数值信息的表示、计算和传递过程。

核心发现包括:

  1. 分层数值表征:数值信息随模型层深逐步涌现,低层编码小计数,深层编码大计数,且数值表征具有线性可加性。
  2. 内部计数器机制:模型存在潜在计数器,以马尔可夫式更新(依赖最新潜在计数而非全部历史信息),在多类型项目场景中会维护类型专属计数器,且重置行为与项目间隔相关。
  3. 计数信息存储位置:文本输入中,计数信息主要存储在上下文(尤其最后一个token);视觉输入中,背景区域和前景区域均携带计数信号,且受图像布局、分辨率影响。
  4. 结构捷径依赖:模型严重依赖分隔符(如逗号)作为计数捷径,分隔符携带的位置信息对计数准确性的影响甚至超过项目本身。
  5. 跨模态一致性:LLMs和LVLMs的计数机制遵循相似模式,均受编码器特性影响,LVLMs的视觉嵌入中同样存在数值信息,但噪声更高。

二、创新点

  1. 工具创新:设计专门用于数值机制可解释性的工具CountScope,解决了现有工具(如Logit Lens、Tuned Le

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询