Evaluating Multimodal Large Language Models on Vertically Written Japanese Text
2026/9/9 0:23:34 网站建设 项目流程

文章主要内容与创新点总结

一、主要内容

  1. 研究背景:多模态大语言模型(MLLMs)在视觉文档理解任务中应用广泛,但针对日语竖排文本的处理能力研究较为匮乏。日语文档常包含竖排形式,其阅读顺序(自上而下、从右至左)与横排文本(自左至右、自上而下)存在显著差异,现有OCR基准测试多侧重横排文本,忽视了竖排文本的评估需求。
  2. 数据集构建
    • 合成数据集JSSODa:通过LLM生成日语文本,渲染为包含1-4列布局的横排/竖排图像,共22,493张,按8:1:1划分为训练集、验证集和测试集,用于模型微调与评估。
    • 真实场景数据集VJRODa:从日本真实PDF文档中提取含竖排文本的页面,经筛选、转录和人工校正得到100张图像,用于模拟真实场景下的模型评估。
  3. 实验设计:选取Qwen2.5-VL、InternVL3、Gemma 3等开源模型及GPT-4.1、GPT-5等闭源模型,通过字符错误率(CER)和BLEU值评估其横排/竖排日语文本识别能力,并验证JSSODa数据集的微调效果。
  4. 核心发现
    • 现有MLLMs处理竖排日语文本的准确率显著低于横排文本,部分模型存在阅读顺序混淆问题。
    • 基于JSSODa的微调能大幅提升原本不擅长竖排文本处理的模型性能(如Qwen2.5-VL-7B),但对已初步掌握竖排阅读规则的模型提升有限。
    • 真实场景数

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询