该文章提出了材料科学领域首个全面的大学水平LLM推理能力基准测试集MatSciBench,通过多维度评估揭示了当前LLM在材料科学推理中的表现与不足,为该领域模型优化提供了关键参考。
一、文章主要内容总结
背景与问题
- 现有LLM在数学和通用科学推理中表现突出,但在材料科学这一物理、化学与工程交叉领域的推理能力尚未被充分探索。
- 现有材料科学基准存在缺陷:评估不全面、缺乏正确答案、依赖LLM生成的含噪声数据,且未充分测试多模态推理能力。
MatSciBench基准设计
- 数据规模与来源:包含1340道来自10本大学教材的题目,覆盖材料科学核心子领域,所有题目为开放式题型以避免模型猜测。
- 分类体系:分为6个主领域(材料、性能、结构、基础机制、工艺、失效机制)及31个子领域,可精准评估模型在特定领域的表现。
- 难度分级:按推理长度分为简单(50.7%)、中等(29.1%)、困难(20.1%)三级,其中270道难题专门测试复杂推理能力。
- 辅助资源:提供944道题的详细解析以支持错误分析,包含315道含视觉场景的题目以测试多模态推理。
实验与结果