50+推理基准数据集速查清单:Awesome-Reasoning-Foundation-Models让你快速掌握LLM评测全貌
【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models
面对琳琅满目的推理基准数据集,不知道做LLM评测该选哪一套?Awesome-Reasoning-Foundation-Models是一个开源的推理基准与LLM评测资源库,一站式整理100+ 推理基准数据集与 300+ 前沿论文,覆盖常识、数学、逻辑、因果、视觉等 8 大推理任务,帮你 10 分钟看懂大模型推理能力评测的全貌。
为什么 LLM 评测需要一份"推理基准数据集"速查清单?
如果你正在挑选大模型、或者想评估 GPT、Llama、Qwen 这类模型的推理能力,大概率遇到过这些困扰:
- 😵 基准太多记不住:GSM8K、HellaSwag、BIG-bench、CLEVR……名字看过去一脸懵
- 🧩 任务划分不清晰:常识推理和数学推理到底有什么区别?该测哪几个?
- 📅 信息更新快:每月都有新基准发布,手动整理要花好几天
这份开源仓库就是为解决这些问题而生的。它基于 ACM 综述论文A Survey of Reasoning with Foundation Models整理,把"推理是什么、测什么、怎么测、怎么提升"一次性讲清楚,堪称一份免费的 LLM 评测全貌地图。
项目速览:Awesome-Reasoning-Foundation-Models 包含什么?
整个仓库结构非常轻量,核心内容集中在 README.md 一份文档中(建议配合本地文件README.md阅读),共 4 大章节:
| 章节 | 内容 | 文件位置 |
|---|---|---|
| 0 Survey | 综述论文出处与引用信息 | README.md第 0 节 |
| 1 Relevant Surveys | 10+ 相关推理方向综述与链接 | README.md第 1 节 |
| 2 Foundation Models | 语言/视觉/多模态三类基础模型(GPT-4、Llama 2、Qwen、SAM、CLIP、LLaVA、Gemini 等) | README.md第 2 节 |
| 3 Reasoning Tasks | ⭐ 核心:8 大推理任务 + 100+ 基准数据集 | README.md第 3 节 |
| 4 Reasoning Techniques | 6 大推理技术(预训练、微调、对齐、MoE、ICL、自主智能体) | README.md第 4 节 |
如上图所示,推理任务(中心圆盘)被划分为常识、数学、逻辑、因果、视觉、多模态、具身智能和其他 8 大扇区,右侧的推理技术(预训练、微调、MoE、对齐训练、上下文学习、自主智能体)则构成能力支撑——这正是你挑选基准数据集时的"坐标系"。
快速上手:3 步获取完整推理基准清单
第 1 步:克隆仓库
git clone https://link.gitcode.com/i/7b953eafe50c119c64cb0810a0ea9dea.git第 2 步:打开README.md,顶部有完整目录(Table of Contents),按任务类别折叠展示,点击即可跳转。
第 3 步:按需定位。每个基准条目都标注了年份 | 名称 | 论文标题 | 论文/代码/项目链接,格式统一,扫一眼就能判断是否适合自己。
📌 提示:仓库每月 1 号自动更新论文(见CONTRIBUTING.md),建议收藏后定期回看。
50+ 推理基准数据集速查清单(核心内容)
下面按 9 大任务类别整理代表性基准。加粗的是评测 LLM 时最常被引用的"必测项",完整列表见README.md对应小节。
① 常识推理基准:模型懂不懂"世界运作方式"?
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| HellaSwag | 2019 | 完成句子的日常物理常识推理 |
| WinoGrande | 2019 | 大规模对抗式 Winograd 语言指代推理 |
| SocialIQA | 2019 | 社交场景中的常识行为推理 |
| PIQA | 2019 | 自然语言物理常识问答 |
| CQA | 2018 | CommonsenseQA 知识问答挑战 |
| GQA | 2019 | 真实场景视觉组合式问答 |
| PROST | 2021 | 物体时空物理推理 |
| PHYRE | 2019 | 物理规则推理新基准 |
| RAINBOW | 2021 | 多任务常识推理统一基准 |
| SWAG | 2018 | 大规模对抗式常识推理解释 |
② 数学推理基准:从小学应用题到定理证明
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| GSM8K | 2021 | 小学数学应用题,LLM 数学能力"标尺" |
| MATH | 2021 | 竞赛级数学题 + 完整解题步骤 |
| MGSM | 2022 | 多语言版 GSM8K,测跨语言推理 |
| DROP | 2019 | 段落离散推理阅读理解 |
| SQuAD | 2016 | 经典阅读理解问答基准 |
| MAWPS | 2016 | 小学数学题仓库 |
| FinQA | 2021 | 金融数据数值推理 |
| TheoremQA | 2023 | 定理驱动的数学问答 |
| MathBench | 2024 | 多层次难度数学评测数据集 |
| SciBench | 2023 | 大学水平科学问题求解 |
| MathVista | 2023 | 视觉情境下的数学推理(多模态) |
③ 逻辑推理基准:能否一步步演绎推理?
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| LogiGLUE | 2023 | 语言模型逻辑推理能力统一基准 |
| BIG-bench | 2022 | 谷歌"超越模仿游戏"综合能力基准(含逻辑子任务) |
| FOLIO | 2022 | 一阶逻辑自然语言推理 |
| AR-LSAT | 2021 | 分析推理(LSAT 风格)文本推理 |
| ProofWriter | 2020 | 自然语言蕴含、证明与溯因 |
④ 因果推理基准:分得清"相关"与"因果"吗?
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| CRASS | 2021 | 反事实推理 LLM 新基准 |
| CauseEffectPairs | 2014 | 因果 vs 效应方向判别基准 |
| Corr2Cause | 2023 | 从相关性推断因果能力测试 |
⑤ 视觉推理基准:2D 图像与 3D 场景理解
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| CLEVR | 2016 | 组合式语言+基础视觉推理诊断集 |
| OK-VQA | 2019 | 需要外部知识的视觉问答 |
| VisuLogic | 2025 | 多模态大模型视觉推理新基准 |
| SQA3D | 2022 | 3D 场景情境问答 |
| G-VUE | 2022 | 感知-定位-推理-行动通用视觉基准 |
⑥ 音频推理基准:听懂语音与声音事件
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| SUPERB | 2021 | 语音处理通用性能基准 |
| SUPERB-SG | 2022 | 增强语义+生成能力版语音基准 |
| MLS | 2020 | 大规模多语言语音数据集 |
| Common Voice | 2019 | 众包多语言语音语料 |
| Libri-Light | 2019 | 低监督 ASR 评测基准 |
⑦ 多模态推理基准:视觉 + 文本的联合能力
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| POPE | 2023 | 大视觉语言模型物体幻觉评测 |
| LVLM-eHub | 2023 | 大视觉语言模型综合评测基准 |
| LAMM | 2023 | 语言辅助多模态指令微调基准 |
| ARC / RAVEN | 2022 | 概念抽象理解评测 |
| MatCha | 2022 | 图表"去渲染"数学推理预训练 |
| Q-Bench | 2023 | 低层视觉(画质感知)通用基准 |
| MultimodalOCR | 2023 | 多模态模型 OCR 隐藏缺陷探测 |
⑧ 智能体推理基准:能否在真实环境中规划与行动?
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| Habitat / Habitat 2.0 | 2019/2021 | 具身智能研究平台 |
| iGibson | 2021 | 家庭日常任务机器人学习仿真 |
| BEHAVIOR-1K | 2022 | 1000 项日常活动的具身 AI 基准 |
| RoboTHOR | 2020 | 仿真到真实的具身 AI 平台 |
| NuScenes-QA | 2023 | 自动驾驶多模态视觉问答 |
| DriveLM | 2023 | 图式视觉问答驱动的驾驶推理 |
⑨ 其他垂直推理场景:医疗、天气、长链推理
| 基准数据集 | 首发 | 一句话定位 |
|---|---|---|
| MultiMedQA | 2022 | 覆盖 28 个医学问答数据集的汇总(Med-PaLM 系列) |
| CheXbench | 2024 | 胸片解读智能体基准 |
| Pangu-Weather | 2023 | 3D 神经网络中期天气预报 |
| KACC | 2020 | 知识抽象-具体化-补全多任务基准 |
| δ-NLI | 2020 | 可废止( defeasible)自然语言推理 |
| BoardgameQA | 2023 | 矛盾信息下的自然语言推理 |
💡使用建议:新手评测 LLM 数学能力,从GSM8K + MATH起步;测通用智能选BIG-bench / LogiGLUE;做多模态模型选POPE + LVLM-eHub;做 Agent 选Habitat 系列。每个基准在README.md中都附了论文与代码直达链接,点进去就能上手。
三类基础模型:你评测的"选手"是谁?
基准测的是"考试",模型才是"考生"。仓库第 2 章将基础模型分为三类,选型时可以先对号入座:
- 语言基础模型(LFM):GPT-3 / GPT-4、ChatGPT、Llama 2、LLaMA、PaLM、Bard、Qwen、Mistral 等——LLM 评测的主力
- 视觉基础模型(VFM):ViT、SAM、Video-MAE V2、Stable Diffusion 等——支撑视觉推理类基准
- 多模态基础模型(MFM):GPT-4V、Gemini、LLaVA、BLIP-2、InternVL、Qwen-VL 等——多模态推理评测对象
每类模型条目均按发布日期 | 模型名 | 论文/代码/博客统一排版,方便横向对比。
6 大推理技术:评测分低了怎么提升?
仓库第 4 章汇总了 6 类提升模型推理能力的主流技术路线,评测前了解它们,能帮你看懂模型报告中的"提分手段":
| 技术路线 | 代表方法 | 适合场景 |
|---|---|---|
| 预训练 Pre-Training | Transformer、GPT 系列、CLIP 变体 | 从零构建推理底座 |
| 微调 Fine-Tuning | LoRA、QLoRA、MetaMath、WizardMath | 低成本适配推理任务 |
| 对齐训练 Alignment | RLHF、DPO、InstructGPT | 让推理输出更符合人类偏好 |
| 专家混合 MoE | GLaM、Switch Transformers、MoE-LLaVA | 大参数规模高效推理 |
| 上下文学习 ICL | Chain-of-Thought、Zero-shot-CoT、ToT(思维树)、Self-Consistency | 免训练,最易上手的"提分器" |
| 自主智能体 Agent | ReAct、Reflexion、Voyager、HuggingGPT | 工具调用+环境交互推理 |
🎯新手最快上手路径:先用 Zero-shot-CoT(提示词加一句"Let's think step by step")在 GSM8K 上试跑,再对比启用 Self-Consistency 后的分数变化——这是理解"推理技术如何影响基准分数"的最短路径。
清单如何保持更新?如何参与贡献?
- 📆更新节奏:每月 1 号例行更新论文与基准(详见
CONTRIBUTING.md) - 📝贡献方式:发现遗漏的基准/论文,按
CONTRIBUTING.md的格式提交 PR 或 Issue 即可 - 📄授权许可:项目附带
LICENSE文件,开源协议使用 - 🖼️配套图示:
assets/目录下提供上述 3 张全景图(0_reasoning.jpg、1_overview.jpg、22_foundation_models.jpg),可直接用于你的评测报告 PPT
常见问题 FAQ
Q1:我是纯文科背景 / 非开发者,能用吗?可以。整份清单是纯 Markdown 文档,不需要写代码。把它当作"LLM 能力考试大纲"来读,了解各基准在测什么即可。
Q2:清单里的基准数据是最新的吗?仓库每月 1 号更新,2024–2025 年的新基准(如 MathBench、VisuLogic、PhyX)均已收录,是少数持续维护的推理基准清单。
Q3:和直接搜 arXiv 论文相比,这份清单的优势是什么?按"任务类别 × 年份"双重组织,每条附论文/代码/项目三类链接,且配套综述论文的方法论框架,省去你在 300+ 论文中大海捞针的时间。
写在最后
一份好的推理基准数据集速查清单,价值不在于罗列,而在于"对路"。Awesome-Reasoning-Foundation-Models 用 8 大任务 + 6 大技术的框架,把 LLM 评测这件事从"信息焦虑"变成了"按图索骥"——下次有人问"你评测过哪些基准",你大可以笑着甩出这份 100+ 清单。⭐ 觉得有用的话,记得给仓库点个 Star,让这份地图被更多人看到!
【免费下载链接】Awesome-Reasoning-Foundation-Models✨✨Latest Papers and Benchmarks in Reasoning with Foundation Models项目地址: https://gitcode.com/gh_mirrors/aw/Awesome-Reasoning-Foundation-Models
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考