- 文档
- 教程
- 人工智能
- 大模型
【免费下载链接】awesome-generative-ai-guide
A one stop repository for generative AI research updates, interview resources, notebooks and much more!
本文是 awesome-generative-ai-guide 仓库「Understand AI」旅程「301 前沿 feed」的一部分,为你系统梳理2025 年 10 月的 30 篇最具代表性的生成式 AI 研究论文。本清单覆盖混合线性注意力架构、推理强化学习、原生多模态世界模型、智能体深度研究、长上下文与记忆系统等多个前沿方向。读完本文,你将掌握 10 月论文的整体格局,理解每篇论文解决的核心问题、关键方法与报告结论,并能借助本仓库的月度论文 feed 与主题研究表持续跟进这一快速演进的领域。
月度论文清单在仓库中的定位
本清单属于仓库 Understand 301:前沿 feed 的组成部分。该旅程将研究跟进分为三个层次:101 阶段的 Transformer 基础与论文阅读方法、201 阶段的活跃研究方向(对应 RAG 研究表、AI 评测研究表、智能体搜索与检索研究表 等常青研究表),以及 301 阶段的「月度最佳论文」feed——按月份滚动更新当月最值得关注的应用型 AI 论文,2025 全年清单见 research_updates/2025_papers,2024 年清单作为存档保留在 research_updates/2024_papers。
对于刚入门的研究读者,仓库还提供了 最佳综述论文清单,覆盖基础模型、提示工程、RAG、幻觉、参数高效微调、LLM 智能体、多模态、评测与对抗攻击等主题,可作为阅读月度论文前的背景补充。
2025 年 10 月论文全景
本月 30 篇论文在时间上覆盖 10 月 1 日至 10 月 30 日,密度相当高。从主题分布看,可以归纳为五条主线:
- 架构效率与长上下文:混合注意力架构(Kimi Linear、Ring-linear 系列)、核心注意力分离(CAD/DistCA)、光学上下文压缩(DeepSeek-OCR)、KV Cache 语义通信(Cache-to-Cache);
- 推理与强化学习:循环潜在推理(Ouro)、极小网络递归推理(TRM)、面向智能体的熵平衡策略优化(AEPO)、量化增强 RL(QeRL)、智能体训练环境(GEM);
- 多模态与世界模型:原生多模态世界模型(Emu3.5)、全模态理解(OmniVinci)、文档解析 VLM(PaddleOCR-VL)、VLA 空间对齐(Spatial Forcing);
- 智能体与深度研究:端到端深度研究智能体(Tongyi DeepResearch)、搜索智能体评测(InteractComp)、规划与行动统一(ReCode)、自主数据科学(DeepAnalyze)、在流智能体系统优化(AgentFlow);
- 记忆、上下文与幻觉检测:轻量记忆增强生成(LightMem)、智能体上下文工程(ACE)、多语言片段级幻觉检测(PsiloQA)。
下面按主题逐篇解读,每篇保留论文日期、标题、arXiv 编号与核心内容。
主题一:架构效率与长上下文
Kimi Linear:首个在公平比较下超越全注意力的混合线性注意力架构
2025-10-30 · arXiv:2510.26692
Kimi Linear 提出了一种混合线性注意力架构,宣称在短上下文、长上下文以及强化学习(RL)扩展等场景的公平对比下,首次超越全注意力方案。其核心是Kimi Delta Attention(KDA)——一个表达能力更强的线性注意力模块,在 Gated DeltaNet 基础上引入更细粒度的门控机制,从而更有效地利用有限的有限状态 RNN 记忆。作者设计了一种定制的分块(chunkwise)算法,基于Diagonal-Plus-Low-Rank(DPLR)转移矩阵的特化变体实现高硬件效率,相比通用 DPLR 大幅降低计算量,同时与经典 delta rule 保持一致性。
该模型以 3B 激活参数 / 48B 总参数进行预训练,采用 KDA 与Multi-Head Latent Attention(MLA)的逐层混合。论文报告:在相同训练配方下,Kimi Linear 在所有评测任务上明显超越纯 MLA 模型,同时将 KV Cache 用量减少最高 75%,并在 1M 上下文下实现最高 6 倍的解码吞吐。作者开源了 KDA 内核与 vLLM 实现,并发布了预训练与指令微调权重。
Ring-linear 系列:长上下文推理的混合注意力效率路线
2025-10-22 · arXiv:2510.19338
该技术报告介绍了 Ring-linear 模型系列,包含 Ring-mini-linear-2.0(16B 参数、957M 激活)与 Ring-flash-linear-2.0(104B 参数、6.1B 激活)。两个模型均采用混合架构,将线性注意力与 softmax 注意力有效结合,显著降低长上下文推理场景中的 I/O 与计算开销。论文报告:相比 32B 参数的稠密模型,该系列的推理成本降至 1/10;相比原 Ring 系列成本再降 50% 以上。通过系统探索混合架构中不同注意力机制的比例,作者确定了当前最优的模型结构;并借助自研高性能 FP8 算子库linghe将整体训练效率提升 50%。由于训练与推理引擎算子高度对齐,模型在强化学习阶段可以长期、稳定、高效优化,在多个复杂推理基准上保持 SOTA。
核心注意力分离(CAD):长上下文训练的系统级解法
2025-10-20 · arXiv:2510.18121
论文提出core attention disaggregation(CAD)技术:把核心注意力计算 softmax(QKᵀ)V 从模型其余部分解耦,放到独立设备池上执行。之所以可行,基于两个观察:(1) 核心注意力是无状态的——没有可训练参数、只有极少的临时数据,负载均衡退化为纯计算型任务调度;(2) 它是可组合的——现代注意力内核在处理任意长度的 token 级分片融合批次时仍能保持高效率。CAD 将核心注意力切分为 token 级任务并分发到专用注意力服务器,动态重新分批以均衡计算量。系统实现名为DistCA,采用 ping-pong 执行方案完全重叠通信与计算,并在注意力服务器上原地执行以降低内存。论文报告:在 512 张 H200 GPU、上下文最长 512k token 的条件下,端到端训练吞吐最高提升 1.35 倍,消除了数据与流水线并行的掉队者(stragglers),并实现接近完美的计算与内存均衡。
DeepSeek-OCR:用光学 2D 映射压缩长上下文
2025-10-21 · arXiv:2510.18234
DeepSeek-OCR 是对「通过光学 2D 映射压缩长上下文」这一思路的初步探索。它由 DeepEncoder 与 DeepSeek3B-MoE-A570M 解码器两部分组成:DeepEncoder 作为核心引擎,在高分辨率输入下保持低激活数,同时实现高压缩比以获得可控数量的视觉 token。论文报告:当文本 token 数不超过视觉 token 数的 10 倍(即压缩比 <10x)时,解码(OCR)精度可达 97%;即便在 20x 压缩比下,OCR 精度仍维持在约 60%。在 OmniDocBench 上,DeepSeek-OCR 仅用 100 个视觉 token 就超越 GOT-OCR2.0(每页 256 token),并以少于 800 个视觉 token 超越 MinerU2.0(每页平均 6000+ token)。在工程层面,单张 A100-40G 每天可产出 20 万页以上的训练数据。该工作对历史长上下文压缩、LLM 记忆遗忘机制等研究方向具有参考价值。
QeRL:量化增强的 LLM 强化学习
2025-10-13 · arXiv:2510.11696
QeRL 面向 RL 训练资源密集的问题(高 GPU 内存、长 rollout 时长),将NVFP4 量化与LoRA结合,加速 rollout 阶段并降低内存开销。论文发现量化噪声会提高策略熵、增强探索,有助于 RL 中发现更优策略;为此引入Adaptive Quantization Noise(AQN)机制在训练中动态调节噪声。论文报告:rollout 阶段提速超过 1.5 倍,首次实现在单张 H100 80GB 上训练 32B LLM 的 RL;在 7B 规模下,数学基准 GSM8K(90.8%)与 MATH 500(77.4%)上匹配全参数微调效果,且奖励增长更快、最终精度高于 16-bit LoRA 与 QLoRA。
Cache-to-Cache:超越文本的 LLM 间语义通信
2025-10-03 · arXiv:2510.03215
多 LLM 系统通常通过文本通信,这既丢失丰富语义信息,又产生逐 token 生成延迟。Cache-to-Cache(C2C)提出让 LLM 之间直接以KV Cache 为介质通信:用神经网络将源模型的 KV Cache 投影并融合进目标模型的 KV Cache,实现语义直传;可学习的门控机制选择受益于缓存通信的目标层。论文报告:相比单个模型平均准确率提升 8.5%–10.5%,相比文本通信范式提升约 3.0%–5.0%,同时平均延迟加速 2.0 倍。
主题二:推理与强化学习
Ouro:把推理构建进预训练阶段的循环语言模型
2025-10-29 · arXiv:2510.25741
现代 LLM 主要通过显式文本生成(如 chain-of-thought)来「思考」,把推理留到后训练阶段。Ouro(Ouroboros)是开源的Looped Language Models(LoopLM)家族,通过 (i) 潜在空间的迭代计算、(ii) 熵正则化的学习深度分配目标、(iii) 扩展到 7.7T token,把推理内建到预训练阶段。论文报告:Ouro 1.4B 与 2.6B 在多个基准上匹配高达 12B 的 SOTA LLM;受控实验表明优势来自更强的知识操控能力而非更大的知识容量;LoopLM 产出的推理痕迹与最终输出的一致性优于显式 CoT。
Tiny Recursive Model:7M 参数递归推理挑战大模型
2025-10-06 · arXiv:2510.04871
在 Hierarchical Reasoning Model(HRM)启发下,Tiny Recursive Model(TRM)用单一 2 层小网络做递归推理,仅 7M 参数就在 ARC-AGI-1 上取得 45%、ARC-AGI-2 上取得 8% 的测试准确率,论文称高于多数 LLM(如 DeepSeek R1、o3-mini、Gemini 2.5 Pro),而参数量不足其 0.01%。该工作探讨「小网络 + 递归计算」求解难题的潜力。
AEPO:智能体熵平衡策略优化
2025-10-16 · arXiv:2510.14545
主流智能体 RL 算法在熵信号引导下自主探索高不确定性工具调用步骤,但过度依赖熵信号会带来额外约束,导致训练崩溃。Agentic Entropy-Balanced Policy Optimization(AEPO)在 rollout 与策略更新两个阶段平衡熵:动态熵平衡 rollout 机制通过熵预监控自适应分配全局与分支采样预算,并对连续高熵工具调用步骤施加分支惩罚;熵平衡策略优化在高熵裁剪项中插入 stop-gradient 以保留并正确缩放高熵 token 的梯度,并结合熵感知的优势估计。论文报告:在 14 个挑战性数据集上持续优于 7 种主流 RL 算法;仅用 1K RL 样本,Qwen3-14B 即达到 GAIA 47.6%(Pass@1)、Humanity's Last Exam 11.2%、WebWalker 43.0%(Pass@1)。
MM-HELIX 与 AHPO:多模态长链反思推理
2025-10-09 · arXiv:2510.08540
现有 MLLM 在数学、逻辑推理上表现不错,但长链反思推理(迭代思考与回溯)能力不足。作者构建MM-HELIX基准(1,260 个样本、42 个挑战性合成任务),并生成 100k 反思推理轨迹的MM-HELIX-100K数据集用于指令微调。针对标准 RL 在稀疏奖励下失败、SFT 后灾难性遗忘的问题,提出Adaptive Hybrid Policy Optimization(AHPO)——在单一阶段动态统一离线监督与在线优化:奖励稀疏时从专家数据学习,熟练后独立探索。论文报告:在 Qwen2.5-VL-7B 上 MM-HELIX 准确率提升 +18.6%,在通用数学与逻辑任务上平均提升 +5.7%。
AgentFlow:在流智能体系统优化
2025-10-07 · arXiv:2510.05592
主流工具增强方法把「思考 + 工具调用」训练成单一整体策略,长视界、多工具场景下扩展性差。AgentFlow是可训练的「在流(in-the-flow)」智能体框架,协调 planner、executor、verifier、generator 四个模块,通过演化的记忆协调,并在多轮循环内直接优化 planner。训练上提出Flow-GRPO(Flow-based Group Refined Policy Optimization),把多轮优化转换为一系列单轮策略更新:将单一可验证的轨迹级结果广播到每一轮,对齐局部规划决策与全局成功,并用组归一化优势稳定学习。论文报告:7B 规模骨干在搜索、智能体、数学、科学任务上平均准确率分别提升 14.9%、14.0%、14.5%、4.1%,甚至超越 GPT-4o 等更大规模的闭源模型。
GEM:面向智能体 LLM 的环境模拟器
2025-10-01 · arXiv:2510.01051
LLM 训练范式正从静态数据集转向基于经验的学习。GEM(General Experience Maker)是开源环境模拟器,类比传统 RL 的 OpenAI Gym,提供标准化的环境-智能体接口、异步向量化执行(高吞吐)与可扩展的 wrapper。GEM 附带多样环境套件、集成工具,以及用五个流行 RL 训练框架运行 GEM 的示例脚本;还提供 24 个环境上使用 REINFORCE + Return Batch Normalization(ReBN)的基线——论文指出 ReBN 与 GRPO 不同,兼容每轮稠密奖励的完整 RL 设定,credit assignment 更好,并对 PPO、GRPO、REINFORCE 在单轮与多轮设定下做了公平基准对比。
主题三:多模态与世界模型
Emu3.5:原生多模态世界模型
2025-10-30 · arXiv:2510.26583
Emu3.5 是一个大规模多模态世界模型,在视觉与语言上原生预测下一状态。它以统一的 next-token 预测目标,在超过 10 万亿 token 的视觉-语言交错语料(主要来自网络视频的连续帧与转录)上端到端预训练,天然接受交错输入并生成交错输出;后训练阶段使用大规模 RL 增强多模态推理与生成。推理效率方面,Discrete Diffusion Adaptation(DiDA)把逐 token 解码转换为双向并行预测,单图推理加速约 20 倍且不损失性能。论文报告其具备长视界视觉-语言生成、任意图到图(X2I)生成、复杂富文本图像生成等能力,以及可泛化的世界建模能力(时空一致的世界探索与开放世界具身操控)。论文称其在图像生成与编辑任务上与 Gemini 2.5 Flash Image 性能相当,并在交错生成任务上表现更优。
OmniVinci:全模态理解 LLM 的架构与数据设计
2025-10-17 · arXiv:2510.15870
OmniVinci 致力于构建开源全模态 LLM,从架构与数据两个维度展开研究。架构上提出三项创新:(i)OmniAlignNet——在共享的全模态潜在空间中加强视觉与音频嵌入的对齐;(ii)Temporal Embedding Grouping——捕捉视觉与音频信号的相对时间对齐;(iii)Constrained Rotary Time Embedding——在全模态嵌入中编码绝对时间信息。数据方面构建了 24M 单模态与全模态对话的策展与合成流水线,发现模态在感知与推理上相互增强。论文报告:仅用 0.2T 训练 token(Qwen2.5-Omni 的 1/6),在 DailyOmni 上 +19.05、MMAR 上 +1.7、Video-MME 上 +3.9。
PaddleOCR-VL:0.9B 超紧凑多语言文档解析 VLM
2025-10-16 · arXiv:2510.14528
PaddleOCR-VL 面向文档解析,核心组件 PaddleOCR-VL-0.9B 将 NaViT 式动态分辨率视觉编码器与 ERNIE-4.5-0.3B 语言模型结合,支持 109 种语言,擅长识别文本、表格、公式、图表等复杂元素,资源消耗极低。论文报告其在页面级文档解析与元素级识别上达到 SOTA,具备与顶级 VLM 竞争的实力与快速推理速度,适合实际部署。
Spatial Forcing:VLA 模型的隐式空间表示对齐
2025-10-14 · arXiv:2510.12276
视觉-语言-动作(VLA)模型大多基于仅在 2D 数据上预训练的 VLM,缺乏准确的 3D 空间感知。现有方案或引入深度图/点云等显式 3D 输入(受传感器噪声、硬件异构、深度覆盖不全困扰),或依赖深度估计器(性能受限)。Spatial Forcing(SF)是一种简单有效的对齐策略:把 VLA 的中间视觉嵌入与预训练 3D 基础模型产生的几何表示对齐,在中间层隐式强制 VLA 发展空间理解能力,无需显式 3D 输入或深度估计器。论文报告在仿真与真实环境中超越基于 2D 与 3D 的 VLA,训练加速最高 3.8 倍,并提升数据效率。
LCO-Emb:以语言为中心的全模态表示学习
2025-10-13 · arXiv:2510.11693
多模态嵌入研究常用 MLLM 加对比学习(CL)微调,但优势来源未充分解释。该工作论证关键在于生成式预训练中隐式产生的跨模态对齐——语言解码器在共享表示空间中利用多模态信号生成单模态输出。通过各向异性与核相似性结构分析,论文确认 MLLM 表示中涌现潜在对齐,使 CL 成为轻量精炼阶段。据此提出Language-Centric Omnimodal Embedding(LCO-Emb)框架,并识别出Generation-Representation Scaling Law(GRSL):对比精炼获得的表示能力随 MLLM 生成能力正向扩展,并从理论上把 MLLM 生成质量与表示性能上限建立联系。
JanusCoder:代码智能的视觉-程序接口
2025-10-27 · arXiv:2510.23538
神经代码智能正从纯文本源码扩展到程序产生的视觉输出。该工作从数据与建模两端推进:先引入完整合成工具包,利用数据模态间的互惠协同高效产出大规模高质量语料(从标准图表到复杂交互式 Web UI 与代码驱动动画),据此构建JanusCode-800K(迄今最大多模态代码语料),训练出JanusCoder 与 JanusCoderV,建立从文本指令、视觉输入或两者组合生成代码的视觉-程序接口。论文报告 7B–14B 规模模型在文本与视觉代码任务上接近甚至超过商业模型。
主题四:智能体与深度研究
Tongyi DeepResearch:端到端深度研究智能体
2025-10-28 · arXiv:2510.24701
Tongyi DeepResearch 是为长视界、深度信息搜寻研究任务设计的智能体 LLM,采用端到端训练框架:agentic mid-training + agentic post-training,激励自主深度研究能力。论文强调其高度可扩展的全自动数据合成流水线(无需昂贵人工标注),并为每个阶段构建定制环境以保证稳定一致的交互。模型总参数量 30.5B、每 token 仅激活 3.3B,论文报告在 Humanity's Last Exam、BrowseComp、BrowseComp-ZH、WebWalkerQA、xbench-DeepSearch、FRAMES 等智能体深度研究基准上达到 SOTA,并开源模型、框架与完整方案。
InteractComp:用模糊查询评测搜索智能体
2025-10-28 · arXiv:2510.24668
现实用户通常以不完整、模糊的查询开始搜索,但多数搜索智能体假设查询完整明确,且现有基准无法评估交互澄清能力。InteractComp遵循「易于验证、交互消歧」原则,通过目标-干扰物(target-distractor)方法构造 210 个专家策展问题(覆盖 9 个领域),制造只有通过交互才能消解的真实歧义。评测 17 个模型的结果揭示显著失败:最佳模型在完整上下文下准确率 71.50%,模糊查询下仅 13.73%,暴露的是系统性过度自信而非推理缺陷;强制交互则带来巨大提升。纵向分析显示,15 个月内交互能力停滞,而搜索性能提升 7 倍,形成关键盲区。该基准同时适合训练与评测搜索智能体的交互能力。
ReCode:用递归代码生成统一规划与行动
2025-10-27 · arXiv:2510.23564
现实任务需要在不同决策粒度上运作,而当前 LLM 智能体在高层规划与低层行动之间有刚性分离。ReCode(Recursive Code Generation)提出在单一代码表示中统一规划与行动:把高层计划表示为抽象占位函数,由智能体递归分解为更细粒度的子函数,直至原始动作。递归结构天然生成多粒度训练数据,使模型学习层级决策过程。论文报告 ReCode 在推理性能上显著超越先进基线,训练数据效率优异。
DeepAgent:带可扩展工具集的通用推理智能体
2025-10-24 · arXiv:2510.21618
真实任务常需外部工具与长视界交互,而现有框架遵循预定义工作流,限制自主性与全局任务完成。DeepAgent是端到端深度推理智能体,在单一连贯推理过程中自主思考、发现工具并执行动作。针对多轮工具调用导致的上下文爆炸,提出自主记忆折叠机制,把过去交互压缩为结构化的情节记忆、工作记忆与工具记忆。训练上提出ToolPO端到端 RL 策略:利用 LLM 模拟 API,通过工具调用优势归因把细粒度信用分配给工具调用 token。论文报告在 ToolBench、API-Bank、ALFWorld、WebShop、GAIA 等八个基准上,在标记工具与开放集工具检索场景均持续优于基线。
DeepAnalyze:自主数据科学智能体
2025-10-19 · arXiv:2510.16872
DeepAnalyze-8B 是首个面向自主数据科学的智能体 LLM,可自动完成从数据源到分析师级深度研究报告的端到端流水线。训练采用课程式智能体训练范式(模仿人类数据科学家学习轨迹)与数据支撑的轨迹合成框架。论文报告其仅 8B 参数即超越基于最先进闭源 LLM 的既有工作流式智能体,并开源模型、代码与训练数据。
Agent Learning via Early Experience:中间范式
2025-10-09 · arXiv:2510.08558
专家示范数据只覆盖狭窄场景、泛化差,而 RL 在缺少可验证奖励(如网站)或长视界 rollout 低效(如多轮工具使用)的环境中难以训练。该工作提出中间范式early experience:使用智能体自身动作产生的交互数据,以「未来状态」作为无奖励信号的监督。研究了两种使用策略:隐式世界建模(用收集的状态把策略锚定在环境动态上)与自我反思(从次优动作中学习改进推理与决策)。论文报告在八个环境、多个模型家族上一致提升效果与域外泛化,并指出在有可验证奖励的环境中,early experience 为后续 RL 提供坚实基础。
主题五:记忆、上下文与幻觉检测
LightMem:轻量高效记忆增强生成
2025-10-21 · arXiv:2510.18866
记忆系统让 LLM 摆脱无状态交互,但现有系统引入大量时间与计算开销。受Atkinson-Shiffrin 人类记忆模型启发,LightMem 把记忆组织为三阶段:认知启发的感觉记忆通过轻量压缩快速过滤无关信息并按主题分组;主题感知的短期记忆整合这些分组、组织并总结内容以提供结构化访问;带睡眠式更新的长期记忆采用离线过程,把整合与在线推理解耦。论文报告在 LongMemEval 上(GPT 与 Qwen 骨干),LightMem 准确率最高提升 10.9%,同时 token 用量最高减少 117 倍、API 调用最高减少 159 倍、运行时间降低 12 倍以上。
ACE:把上下文当作演化的剧本
2025-10-06 · arXiv:2510.04618
LLM 应用(智能体、领域推理)越来越依赖上下文适配(修改输入而非更新权重),但现有方法存在简洁偏差(为简洁摘要丢失领域洞察)与上下文坍缩(迭代重写侵蚀细节)。ACE(Agentic Context Engineering)基于 Dynamic Cheatsheet 的自适应记忆,把上下文视为演化的剧本,通过生成、反思、策展的模块化流程积累、精炼、组织策略,用结构化增量更新防止坍缩。论文报告在智能体与领域基准上,ACE 在离线(系统提示)与在线(智能体记忆)场景均持续优于强基线:智能体 +10.6%、金融 +8.6%,显著降低适配延迟与 rollout 成本;在 AppWorld 排行榜上匹配排名第一的生产级智能体的平均分,并在更难的 test-challenge 划分上超越。
PsiloQA:多语言片段级幻觉检测
2025-10-06 · arXiv:2510.04849
现有幻觉基准多为序列级且局限于英语。PsiloQA提供覆盖 14 种语言、带片段级幻觉标注的大规模多语言数据集,通过三阶段自动流水线构建:用 GPT-4o 从 Wikipedia 生成问答对、在无上下文设定下让不同 LLM 生成可能幻觉的回答、由 GPT-4o 对照金标准答案与检索上下文自动标注幻觉片段。论文评测了不确定性量化、LLM 标注、微调编码器等多种检测方法,显示编码器模型跨语言表现最强;PsiloQA 还展示了有效的跨语言泛化与向其他基准的知识迁移,且比人工标注数据集成本更低。
如何在仓库中继续跟进本月研究
本清单是 understand.md 中「Understand 301:前沿 feed」的一部分,你可以按以下方式深化研究:
- 阅读完整年度清单:2025 年其他月份的论文见 research_updates/2025_papers(如 9 月清单),2026 年新 feed 见 research_updates/2026_papers;
- 对照常青研究表:本月的智能体搜索与深度研究论文(Tongyi DeepResearch、InteractComp 等)可对照 智能体搜索与检索研究表 中的横向归类阅读;
- 按主题深入:仓库按主题组织了课程与资源入口,例如 AI Agents、Evaluation and Observability、Multimodal、LLM Foundations,可把本月论文挂靠到对应主题继续学习;
- 先读综述再读论文:对不熟悉的方向,先看 最佳综述论文清单 建立地图,再回到月度清单精读原始论文,效率更高。
小结
2025 年 10 月的论文集中体现了生成式 AI 研究的几个明确趋势:效率优先(线性/混合注意力、量化、上下文压缩、KV Cache 通信正在把长上下文与训练成本推向实用化)、RL 成为主训练范式(从 AEPO、Flow-GRPO 到 QeRL、GEM,算法与基础设施同步成熟)、智能体从框架走向端到端训练(深度研究智能体、自主数据科学、规划-行动统一),以及多模态原生模型与世界模型加速涌现(Emu3.5、OmniVinci)。这些方向与仓库中 State of AI 2025 报告 揭示的整体格局相互印证。建议读者结合本文的论文清单与仓库的研究表、综述与课程资源,按兴趣挑选 2~3 条主线深入精读原始论文。
- 文档
- 教程
- 人工智能
- 大模型
【免费下载链接】awesome-generative-ai-guide
A one stop repository for generative AI research updates, interview resources, notebooks and much more!
相关推荐
NemoClaw 贡献工作流指南:根因兄弟路径检查与敏感工作流状态矩阵
NemoClaw 贡献工作流指南:根因兄弟路径检查与敏感工作流状态矩阵 本篇指南系统讲解 NemoClaw 仓库 Agent 技能体系中的共享方法论文档 .ag
文档教程人工智能大模型Argilla 向量(`rg.Vector`)完全指南:为记录添加向量、实现相似性检索
Argilla 向量( rg.Vector )完全指南:为记录添加向量、实现相似性检索 导读 :本文围绕 Argilla Python SDK 中 rg.Vec
文档教程人工智能大模型2025年10月必藏!GitHub黑科技与摸鱼神器月度精选
2025年10月必藏!GitHub黑科技与摸鱼神器月度精选 作为全球最大的开源社区,GitHub 汇聚了无数创新项目,从 AI 黑科技到趣味摸鱼神器应有尽有。本
文档
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考