50+推理基准数据集速查清单:Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌
2026/8/24 17:32:29 网站建设 项目流程

50+推理基准数据集速查清单:Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌

【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models

面对琳琅满目的推理基准数据集,不知道做LLM评测该选哪一套?Awesome-Reasoning-Foundation-Models是一个开源的推理基准与LLM评测资源库,一站式整理100+ 推理基准数据集与 300+ 前沿论文,覆盖常识、数学、逻辑、因果、视觉等 8 大推理任务,帮你 10 分钟看懂大模型推理能力评测的全貌。

为什么 LLM 评测需要一份"推理基准数据集"速查清单?

如果你正在挑选大模型、或者想评估 GPT、Llama、Qwen 这类模型的推理能力,大概率遇到过这些困扰:

  • 😵 基准太多记不住:GSM8K、HellaSwag、BIG-bench、CLEVR……名字看过去一脸懵
  • 🧩 任务划分不清晰:常识推理和数学推理到底有什么区别?该测哪几个?
  • 📅 信息更新快:每月都有新基准发布,手动整理要花好几天

这份开源仓库就是为解决这些问题而生的。它基于 ACM 综述论文A Survey of Reasoning with Foundation Models整理,把"推理是什么、测什么、怎么测、怎么提升"一次性讲清楚,堪称一份免费的 LLM 评测全貌地图

项目速览:Awesome-Reasoning-Foundation-Models 包含什么?

整个仓库结构非常轻量,核心内容集中在 README.md 一份文档中(建议配合本地文件README.md阅读),共 4 大章节:

章节内容文件位置
0 Survey综述论文出处与引用信息README.md第 0 节
1 Relevant Surveys10+ 相关推理方向综述与链接README.md第 1 节
2 Foundation Models语言/视觉/多模态三类基础模型(GPT-4、Llama 2、Qwen、SAM、CLIP、LLaVA、Gemini 等)README.md第 2 节
3 Reasoning Tasks⭐ 核心:8 大推理任务 + 100+ 基准数据集README.md第 3 节
4 Reasoning Techniques6 大推理技术(预训练、微调、对齐、MoE、ICL、自主智能体)README.md第 4 节

如上图所示,推理任务(中心圆盘)被划分为常识、数学、逻辑、因果、视觉、多模态、具身智能和其他 8 大扇区,右侧的推理技术(预训练、微调、MoE、对齐训练、上下文学习、自主智能体)则构成能力支撑——这正是你挑选基准数据集时的"坐标系"。

快速上手:3 步获取完整推理基准清单

第 1 步:克隆仓库

git clone https://link.gitcode.com/i/7b953eafe50c119c64cb0810a0ea9dea.git

第 2 步:打开README.md,顶部有完整目录(Table of Contents),按任务类别折叠展示,点击即可跳转。

第 3 步:按需定位。每个基准条目都标注了年份 | 名称 | 论文标题 | 论文/代码/项目链接,格式统一,扫一眼就能判断是否适合自己。

📌 提示:仓库每月 1 号自动更新论文(见CONTRIBUTING.md),建议收藏后定期回看。

50+ 推理基准数据集速查清单(核心内容)

下面按 9 大任务类别整理代表性基准。加粗的是评测 LLM 时最常被引用的"必测项",完整列表见README.md对应小节。

① 常识推理基准:模型懂不懂"世界运作方式"?

基准数据集首发一句话定位
HellaSwag2019完成句子的日常物理常识推理
WinoGrande2019大规模对抗式 Winograd 语言指代推理
SocialIQA2019社交场景中的常识行为推理
PIQA2019自然语言物理常识问答
CQA2018CommonsenseQA 知识问答挑战
GQA2019真实场景视觉组合式问答
PROST2021物体时空物理推理
PHYRE2019物理规则推理新基准
RAINBOW2021多任务常识推理统一基准
SWAG2018大规模对抗式常识推理解释

② 数学推理基准:从小学应用题到定理证明

基准数据集首发一句话定位
GSM8K2021小学数学应用题,LLM 数学能力"标尺"
MATH2021竞赛级数学题 + 完整解题步骤
MGSM2022多语言版 GSM8K,测跨语言推理
DROP2019段落离散推理阅读理解
SQuAD2016经典阅读理解问答基准
MAWPS2016小学数学题仓库
FinQA2021金融数据数值推理
TheoremQA2023定理驱动的数学问答
MathBench2024多层次难度数学评测数据集
SciBench2023大学水平科学问题求解
MathVista2023视觉情境下的数学推理(多模态)

③ 逻辑推理基准:能否一步步演绎推理?

基准数据集首发一句话定位
LogiGLUE2023语言模型逻辑推理能力统一基准
BIG-bench2022谷歌"超越模仿游戏"综合能力基准(含逻辑子任务)
FOLIO2022一阶逻辑自然语言推理
AR-LSAT2021分析推理(LSAT 风格)文本推理
ProofWriter2020自然语言蕴含、证明与溯因

④ 因果推理基准:分得清"相关"与"因果"吗?

基准数据集首发一句话定位
CRASS2021反事实推理 LLM 新基准
CauseEffectPairs2014因果 vs 效应方向判别基准
Corr2Cause2023从相关性推断因果能力测试

⑤ 视觉推理基准:2D 图像与 3D 场景理解

基准数据集首发一句话定位
CLEVR2016组合式语言+基础视觉推理诊断集
OK-VQA2019需要外部知识的视觉问答
VisuLogic2025多模态大模型视觉推理新基准
SQA3D20223D 场景情境问答
G-VUE2022感知-定位-推理-行动通用视觉基准

⑥ 音频推理基准:听懂语音与声音事件

基准数据集首发一句话定位
SUPERB2021语音处理通用性能基准
SUPERB-SG2022增强语义+生成能力版语音基准
MLS2020大规模多语言语音数据集
Common Voice2019众包多语言语音语料
Libri-Light2019低监督 ASR 评测基准

⑦ 多模态推理基准:视觉 + 文本的联合能力

基准数据集首发一句话定位
POPE2023大视觉语言模型物体幻觉评测
LVLM-eHub2023大视觉语言模型综合评测基准
LAMM2023语言辅助多模态指令微调基准
ARC / RAVEN2022概念抽象理解评测
MatCha2022图表"去渲染"数学推理预训练
Q-Bench2023低层视觉(画质感知)通用基准
MultimodalOCR2023多模态模型 OCR 隐藏缺陷探测

⑧ 智能体推理基准:能否在真实环境中规划与行动?

基准数据集首发一句话定位
Habitat / Habitat 2.02019/2021具身智能研究平台
iGibson2021家庭日常任务机器人学习仿真
BEHAVIOR-1K20221000 项日常活动的具身 AI 基准
RoboTHOR2020仿真到真实的具身 AI 平台
NuScenes-QA2023自动驾驶多模态视觉问答
DriveLM2023图式视觉问答驱动的驾驶推理

⑨ 其他垂直推理场景:医疗、天气、长链推理

基准数据集首发一句话定位
MultiMedQA2022覆盖 28 个医学问答数据集的汇总(Med-PaLM 系列)
CheXbench2024胸片解读智能体基准
Pangu-Weather20233D 神经网络中期天气预报
KACC2020知识抽象-具体化-补全多任务基准
δ-NLI2020可废止( defeasible)自然语言推理
BoardgameQA2023矛盾信息下的自然语言推理

💡使用建议:新手评测 LLM 数学能力,从GSM8K + MATH起步;测通用智能选BIG-bench / LogiGLUE;做多模态模型选POPE + LVLM-eHub;做 Agent 选Habitat 系列。每个基准在README.md中都附了论文与代码直达链接,点进去就能上手。

三类基础模型:你评测的"选手"是谁?

基准测的是"考试",模型才是"考生"。仓库第 2 章将基础模型分为三类,选型时可以先对号入座:

  • 语言基础模型(LFM):GPT-3 / GPT-4、ChatGPT、Llama 2、LLaMA、PaLM、Bard、Qwen、Mistral 等——LLM 评测的主力
  • 视觉基础模型(VFM):ViT、SAM、Video-MAE V2、Stable Diffusion 等——支撑视觉推理类基准
  • 多模态基础模型(MFM):GPT-4V、Gemini、LLaVA、BLIP-2、InternVL、Qwen-VL 等——多模态推理评测对象

每类模型条目均按发布日期 | 模型名 | 论文/代码/博客统一排版,方便横向对比。

6 大推理技术:评测分低了怎么提升?

仓库第 4 章汇总了 6 类提升模型推理能力的主流技术路线,评测前了解它们,能帮你看懂模型报告中的"提分手段":

技术路线代表方法适合场景
预训练 Pre-TrainingTransformer、GPT 系列、CLIP 变体从零构建推理底座
微调 Fine-TuningLoRA、QLoRA、MetaMath、WizardMath低成本适配推理任务
对齐训练 AlignmentRLHF、DPO、InstructGPT让推理输出更符合人类偏好
专家混合 MoEGLaM、Switch Transformers、MoE-LLaVA大参数规模高效推理
上下文学习 ICLChain-of-Thought、Zero-shot-CoT、ToT(思维树)、Self-Consistency免训练,最易上手的"提分器"
自主智能体 AgentReAct、Reflexion、Voyager、HuggingGPT工具调用+环境交互推理

🎯新手最快上手路径:先用 Zero-shot-CoT(提示词加一句"Let's think step by step")在 GSM8K 上试跑,再对比启用 Self-Consistency 后的分数变化——这是理解"推理技术如何影响基准分数"的最短路径。

清单如何保持更新?如何参与贡献?

  • 📆更新节奏:每月 1 号例行更新论文与基准(详见CONTRIBUTING.md
  • 📝贡献方式:发现遗漏的基准/论文,按CONTRIBUTING.md的格式提交 PR 或 Issue 即可
  • 📄授权许可:项目附带LICENSE文件,开源协议使用
  • 🖼️配套图示assets/目录下提供上述 3 张全景图(0_reasoning.jpg1_overview.jpg22_foundation_models.jpg),可直接用于你的评测报告 PPT

常见问题 FAQ

Q1:我是纯文科背景 / 非开发者,能用吗?可以。整份清单是纯 Markdown 文档,不需要写代码。把它当作"LLM 能力考试大纲"来读,了解各基准在测什么即可。

Q2:清单里的基准数据是最新的吗?仓库每月 1 号更新,2024–2025 年的新基准(如 MathBench、VisuLogic、PhyX)均已收录,是少数持续维护的推理基准清单。

Q3:和直接搜 arXiv 论文相比,这份清单的优势是什么?按"任务类别 × 年份"双重组织,每条附论文/代码/项目三类链接,且配套综述论文的方法论框架,省去你在 300+ 论文中大海捞针的时间。

写在最后

一份好的推理基准数据集速查清单,价值不在于罗列,而在于"对路"。Awesome-Reasoning-Foundation-Models 用 8 大任务 + 6 大技术的框架,把 LLM 评测这件事从"信息焦虑"变成了"按图索骥"——下次有人问"你评测过哪些基准",你大可以笑着甩出这份 100+ 清单。⭐ 觉得有用的话,记得给仓库点个 Star,让这份地图被更多人看到!

【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询