ML Papers of the Week 2025年6月第4周榜单速览:7 篇论文,从扩散 LM 提速到罕见病诊断
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
2025 年 6 月 23 日至 6 月 29 日这一期,ML Papers of the Week 榜单收录了 10 篇论文,其中 3 篇在干同一件事——把推理和训练的账算得更省。ML Papers of the Week 是 DAIR.AI 团队维护的每周机器学习论文精选仓库,按年和周归档,本期清单呈现出明显的分化:一边是速度与内存(Mercury 用扩散模型把代码生成做到每秒上千 token,MEM1 让智能体内存保持恒定),另一边是长期缺乏可解释性的应用场景(罕见病诊断、基因调控预测)。下面按 4 个主题把这 7 篇逐一讲清楚:各自解决什么痛点、机制是什么、最关键的数字是多少。
仓库怎么克隆、目录各放什么
仓库的核心价值是一份可检索的周度索引:README.md 按年份列出每一周的清单并支持锚点直达,2025 年的完整描述存放在 years/2025.md,本期对应其中「June 23 - June 29」一节。research/ 目录以 CSV 形式沉淀历史论文数据,如 ml-potw-10232023.csv,包含标题、描述、论文与讨论链接四个字段,适合批量处理;pics/ 则是各期引用的图表资源。本地浏览只需一条命令:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week⚡ 推理与训练效率:更快的生成、更便宜的监督
Mercury:并行生成把代码补全提速一个数量级
自回归大模型逐 token 生成,在代码补全这类对延迟敏感的场景里,吞吐是硬瓶颈。Mercury 改走扩散式生成路线(dLLM):不是逐个决定字符,而是一组 token 并行输出,再经「粗到精」的迭代细化,底座仍是 Transformer,现有 LLM 基础设施可以复用。在 NVIDIA H100 上,Mercury Coder Mini 和 Small 分别达到 1109 和 737 tokens/sec,较速度优化的前沿模型快至 10 倍;HumanEval、MBPP 等代码基准上与 Claude 3.5 Haiku、Gemini 2.0 Flash Lite 相当或更好,填充中间(FIM)补全任务则超过 Codestral 2501 和 GPT-4o Mini,Copilot Arena 人类评估中 Mini 以 25ms 延迟取得并列第二的 Elo。如果你在选型代码补全后端,可以把这类并行生成模型列为候选,速度与质量不必二选一。
RLT:只负责讲解题、不解题的 7B「教师」
蒸馏管道通常要调用 320 亿参数以上的大教师生成推理数据,成本与审计都高。RLT(Reinforcement-Learned Teachers)换个思路:小模型拿到的既有题目也有参考解,它的任务是「连点成线」——写出一段让学生模型能复现答案的解释,用强化学习直接优化这个目标,奖励来自学生能否复现解法以及解释的逻辑自洽。7B 的教师模型在 AIME、MATH、GPQA 上的下游表现超过 320 亿参数以上教师的蒸馏管道(包括 DeepSeek R1、QwQ),训练只需 125 步、1 个 epoch。想搭数据生产管线时,这种小型可控的解释生成器是大教师模型之外的现实选项。
🧠 智能体:压内存、把搜索任务结构化
MEM1:长多轮任务里内存保持恒定的 7B 智能体
常规智能体把全部历史追加进上下文,任务一长,内存、延迟、成本同步上涨,性能还会退化。MEM1 不累积历史:每步推理只更新一个共享内部状态,丢弃过时上下文,再用 PPO 风格的强化学习让「该保留什么」直接被任务完成率优化,全程不依赖外部记忆模块。7B 的 MEM1 在 16 目标多跳 QA 上超过 Qwen2.5-14B-Instruct,同时内存占用减少 3.7 倍、推理快 1.78 倍。做长会话智能体产品时,「紧凑内部状态」这套策略值得直接借鉴来控制成本。
Towards AI Search Paradigm:四个智能体把搜索任务拆成 DAG
传统 RAG 只负责取文档,遇到需要调用工具、多步推理的复杂查询就无法闭环。这套系统按角色分工:Master 分析并调度,Planner 把任务建成有向无环图(DAG)并支持动态重规划,Executor 执行并调用外部工具(工具子集通过 MCP 协议动态选择),Writer 负责成文,并用 ATM 对抗训练抵抗噪声检索,配合 RankGPT 等策略优化排序。在复杂信息合成任务中,它能完成传统检索流水线接不住的多步骤任务,且结果可验证。对做搜索助手的团队,DAG 化的任务分解加模块化智能体是当前比较清晰的工程范式。
🔬 垂直领域落地:临床与基因组学
DeepRare:6401 个罕见病病例上的可追溯诊断
罕见病诊断平均滞后多年,而临床 AI 常常只给结论不给依据,医生难以复核。DeepRare 采用三层 MCP 式架构:中央 LLM 主机、表型提取与变异优先级排序等专用智能体服务器,外加 40 多个医疗工具与大规模医学文献,同时吃下文本、HPO 表型术语和 VCF 基因文件,输出排名假设及可追溯到文献来源的推理链。在覆盖 8 个数据集、2919 种罕见病的 6401 个病例上,它对 1013 种疾病达到 100% 准确率,Recall@1 为 57.18%,较 Claude-3.7-Sonnet-thinking 高 23.79 个百分点;HPO+基因多模态输入下,109 个全外显子测序病例的 Recall@1 达 70.60%,对照工具 Exomiser 为 53.20%;180 条推理链的专家评审一致性 95.4%。医疗 AI 里「可回溯的推理链」可能比单点准确率更先决定落地。
AlphaGenome:单碱基分辨率预测基因调控效应
约 98% 的基因组位于非编码区,而既有工具很难同时兼顾长序列覆盖和单碱基分辨率,非编码变异因此难以解释。谷歌 DeepMind 的 AlphaGenome 用卷积与 Transformer 混合结构,在单碱基分辨率下建模最长 100 万碱基对,预测基因起止点、RNA 表达、剪接、染色质可及性与蛋白结合,还能对比野生型与突变序列来评估某个变异的具体调控效应,是首个显式预测剪接位置及表达水平的序列模型。它在 26 个变异效应基准中的 24 个上领先,计算成本约为 Enformer 的一半。做非编码变异解读或罕见病基因研究时,这是第一个能给出百万碱基上下文、单碱基精度预测的模型。
安全与用户观察:450 万次对话里的边界
Claude for Affective Use:情感支持使用的大规模画像
AI 陪伴话题热度高,但用户到底拿助手做什么、安全边界该画在哪,缺少大规模实证。Anthropic 分析了超过 450 万次 Claude 对话,对情感支持类场景(人际建议、辅导、咨询、陪伴)做了系统归类。结果显示:仅 2.9% 的对话属于情感支持类别,浪漫/性角色扮演不足 0.1%;约 10% 的情感对话中 Claude 需要拒绝请求,主要针对伤害风险或专业边界;情绪分析显示会话结尾的用户语气普遍比开头更积极。对做面向个人用户的 AI 产品的人,这是目前最完整的一份「支持性与安全性如何平衡」的大规模数据集。
之后怎么持续跟进
一句话说清本期趋势:让推理和训练更省(并行生成、小教师、恒定内存)与让输出可被复核(诊断推理链、变异效应预测、大规模用户数据)是两条并行主线;另有 DSRL(机器人策略的潜空间强化学习适配)与 PEVA(全身条件的第一视角视频预测)两篇机器人方向工作同样值得留意。
- README.md:按年份的周度索引,最新一期总在最上方;
- research/:历史论文的 CSV 数据目录,含标题、描述与链接字段,适合做二次分析;
- 每周 newsletter 订阅:https://nlpnews.substack.com/ ,社区讨论可加入 Discord:https://discord.gg/SKgkVT8BGJ 。
如果这期解读帮你省下了翻论文的时间,转给同样被论文淹没的同事也不错。
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考