7篇关键论文读懂AI论文周精选:2025年6月ML Papers of the Week完整解读
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
写代码等模型吐出下一行,等得越久越知道推理速度和内存开销有多烧钱;想让模型多干点活,又多怕它把工具和记忆管得一塌糊涂。DAIR.AI 维护的 ML Papers of the Week(AI论文周精选)把每周值得读的论文筛成一份短清单,你只管看结论和数字。本文挑 2025 年 6 月 23—29 日这一周收录的 10 篇论文,按四个方向带你过一遍。
一、ML Papers of the Week是什么,一条命令快速上手
这是 DAIR.AI 团队运营的每周 ML 论文精选清单,按"年份→周"两级归档,每篇附两三句中文可查的英文摘要,适合不想刷 arXiv 首页的人。上手只需一条命令:
git clone https://gitcode.com/GitHub_Trending/ml/ML-Papers-of-the-Week
二、推理加速与效率:把大模型跑得快、跑得省
这一方向的共性很直白:不堆参数,改生成方式和管理方式。
Ultra-Fast Diffusion-based Language Models(Mercury 系列):走的是扩散语言模型(dLLM)路线——不像自回归模型一个字一个字往外蹦,而是并行生成多个 token,再用"粗到精"的迭代把整句修好。在 H100 上,Mercury Coder Mini 跑到 1109 tokens/sec、Small 版 737 tokens/sec,比同质量档位的速度优化模型最高快 10 倍;FIM 补全——在函数中间挖空、让模型把缺口填上——这项任务上它超过了 Codestral 2501 和 GPT-4o Mini;Copilot Arena 真人盲评中,Mini 版只花 25ms 延迟就拿到第二高的 Elo 分。
MEM1把"记什么"当成可训练的技能:每个推理步只保留一个内部状态 ,把新观察和旧记忆一起压进去、丢掉过时上下文,内存占用恒定。7B 的 MEM1 在 16 目标多跳问答上压过 14B 的 Qwen2.5-14B-Instruct,内存省 3.7 倍、推理快 1.78 倍。
三、智能体系统:分工、协议与"会教书"的模型
多智能体系统这一周集体把"用工具、管任务、控行为"从提示词里搬出来,变成可训练、可审计的系统。
Towards AI Search Paradigm用 Master、Planner、Executor、Writer 四个角色分工:任务先拆成有向无环图(DAG,一种"谁先谁后"的流程图),执行失败时局部重规划;工具走 MCP(Model-Context Protocol,可理解为给大模型接外部工具的标准插座)协议动态挑选,排序环节用 RankGPT 和 TourRank 让结果贴合大模型偏好,Writer 再用对抗调优抵抗噪声检索,避免"检索到垃圾就编答案"。
Diffusion Steering via RL(DSRL)换了一条轻得多的路:不动模型权重,只在预训练扩散机器人策略的潜在噪声空间里学一层"方向盘",机器人策略适配的样本效率提升 5~10 倍。
Reinforcement-Learned Teachers(RLT)让模型当"老师"而不是"做题家":题目和标准答案都摆给它,只让它学写讲解,奖励来自学生模型能否照着讲解复现答案。7B 的 RLT 生成的解释,在 AIME、MATH、GPQA 上比 32B+ 模型(DeepSeek R1、QwQ)蒸馏出来的管线还好用,训练只要 125 步、1 个 epoch,不需要验证器后处理。MEM1 教模型"怎么记",RLT 教模型"怎么讲"——两者都在用强化学习把认知能力装进小模型。
AI Agent Communication Protocols则是一篇"安全底账":首次系统梳理智能体通信的威胁面,分成用户-智能体、智能体-智能体、智能体-环境三层,把提示注入、智能体冒充、记忆投毒各归其位,并逐层给出防御建议。
四、垂直领域应用:医疗与基因组的 AI 落地
AlphaGenome(谷歌 DeepMind)把基因调控预测推到 100 万个碱基对的尺度,且保持单碱基分辨率——卷积层加 Transformer 的组合,让"看多远"和"看多细"不再二选一。对比野生型和突变序列就能给单个突变的调控效应打分,它还是第一个显式预测 RNA 剪接位点及其表达量的序列模型;24 项变异效应基准里领先 24 项,算力只需 Enformer 的一半。
DeepRare面向罕见病诊断,三层架构:中央 LLM 主机 + 专职智能体服务器(表型提取、变异优先级排序)+ 40 多个工具和网页级医学源。在 8 个数据集、2919 种罕见病、6401 个病例上,1013 种疾病做到 100% 准确率,整体 Recall@1 为 57.18%,比 Claude-3.7-Sonnet-thinking 高 23.79 个百分点;加上基因数据的多模态设置里 Recall@1 到 70.60%,超过专用工具 Exomiser 的 53.20%。180 条诊断推理链经专家评审,95.4% 与专家意见一致——医疗场景里"可追溯"比"更聪明"更值钱。
五、应用研究:450万次对话里的情感支持使用
Claude for Affective Use(Anthropic)分析了 450 万次对话,最后筛出 13.1 万条做深读:只有 2.9% 的对话在寻求情感支持(人际建议、辅导、咨询或陪伴),浪漫/性向角色扮演不足 0.1%。情感类对话中 Claude 的拒绝率不到 10%,多为劝阻自伤、极端节食或说明专业边界;情绪分析显示用户聊完比聊前情绪更积极。这是目前最大规模的"AI 陪伴"实证样本,对设计有边界的 AI 情感产品参考价值不低。
六、怎么持续跟踪:论文数据在哪看
- 主目录 README.md 按年分节、每周一行,锚点直达当年当周,2025 年 6 月的 AI 论文就藏在 years/2025.md 的 "June 23 - June 29" 一节里。
- 想要结构化数据而不是 Markdown 表格:research/ml-potw-10232023.csv 存着历史论文的标题、简介与链接,可直接进表格软件或跑自己的统计。
- research/README.md 里还附了两套 Colab notebook,演示从论文清单到建数据集、训练模型的完整流程。
- 每周配图归档在 pics/,SUMMARY.md 可一眼看全仓库结构;不想手动刷仓库的话,DAIR.AI 的 newsletter 会每周把清单推到你邮箱。
七、收尾
从 2025 年 6 月这一周能读出两条线:一条是"快和省",扩散生成、恒定内存、潜在空间微调都在压推理成本;另一条是"智能体系统化",分工、协议和安全从论文配角变成正文。建议把 years/2025.md 里最近四个星期的清单先过一遍,再挑一两个与自己相关的方向深读——这是保持对 AI 论文前沿感知的最低成本方式。
【免费下载链接】AI-Papers-of-the-Week🔥Highlighting the top ML papers every week.项目地址: https://gitcode.com/GitHub_Trending/ml/AI-Papers-of-the-Week
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考