文章目录
- 1. 第一阶段:从语言模型到 GPT(2018-2020)
- 关键词:**规模化(Scaling)**
- 2. 第二阶段:ChatGPT 让 LLM 从实验室走向大众(2022-2023)
- (1)指令微调(Instruction Tuning)
- (2)人类反馈强化学习(RLHF)
- 3. 第三阶段:从文字模型到多模态模型(2023-2025)
- Text → Multimodal
- 4. 第四阶段:从“生成”到“推理”(2024以后)
- Reasoning Models(推理模型)
- 5. 第五阶段:Agent(智能体)时代(2025以后)
- 6. 第六阶段:小模型和专用模型崛起
- 巨型模型
- 小型模型
- 7. 第七阶段:个人化 AI
- 8. 最终方向:AGI(通用人工智能)?
- 总结:LLM 的路线图
- 1. Scaling Laws 与基础模型(Foundation Models)
- (1)模型规模规律(Scaling Laws)
- 2. 预训练技术(Pre-training)
- (1)数据工程(Data Engineering)
- (2)新的模型架构
- 长上下文模型
- Transformer 替代架构
- 3. 后训练(Post-training)
- (1)Instruction Tuning
- (2)RLHF / RLAIF
- (3)Preference Optimization
- 4. 推理能力(Reasoning)
- (1)Chain-of-Thought(思维链)
- (2)Test-Time Compute
- (3)Reasoning Model
- 5. Agent 与自主系统(AI Agents)
- (1)Planning(规划)
- (2)Tool Use(工具调用)
- (3)Memory(长期记忆)
- 6. 多模态大模型(Multimodal LLM)
- Vision-Language Model(VLM)
- Video Understanding
- Embodied AI(具身智能)
- 7. RAG(Retrieval-Augmented Generation)
- 8. LLM 安全与可靠性(Safety & Alignment)
- (1)Hallucination(幻觉)
- (2)Alignment(对齐)
- (3)Interpretability(可解释性)
- 9. 高效训练与部署(Efficiency)
- 模型压缩
- 低成本推理
- 10. AI for Science(科学智能)
- 目前研究热度大致排序(2025前后)
- 如果从“未来 5 年最可能突破”的角度看
- 1. 为什么需要 LoRA?
- Full Fine-tuning(全参数微调)
- 2. LoRA 的核心思想
- 3. 为什么叫 Low-Rank?
- 4. LoRA 在 LLM 发展路线中的位置
- 5. LoRA 和 RAG 的区别
- LoRA:
- RAG:
- 6. LoRA 为什么在近几年非常重要?
- 7. LoRA 的进一步发展
- QLoRA
- AdaLoRA
- DoRA
- 总结一句话:
- 1. QLoRA:LoRA + 量化(目前最成熟的改进)
- 2. DoRA:改进 LoRA 的表达能力
- 3. AdaLoRA:动态分配参数
- 4. LoHa / LoKr:更强的低秩表达
- 5. VeRA:极端参数压缩方向
- 6. Prompt Tuning / Prefix Tuning
- 7. Adapter Tuning
- 8. ReFT:不改参数,改“神经表示”
- 9. Mixture-of-Adapters(多个 LoRA 组合)
- 10. 最新趋势:从“微调参数”到“学习能力模块”
- Skill Adapter
- Agent Adapter
- Continual Learning Adapter
- 总体技术路线图
- 如果从研究价值排序(2025左右)
从 GPT(Generative Pre-trained Transformer)开始,LLM(Large Language Model,大语言模型)的发展大致经历了“规模化 → 对齐 → 多模态 → 推理 → 智能体 → 个性化/行业化”这几个阶段。核心趋势不是简单地“模型越来越大”,而是从“会聊天”走向“能理解、能推理、能行动”。Transformer 架构在 2017 年提出后成为现代 LLM 的基础,随后 GPT 系列通过扩大数据、参数和计算资源推动能力跃迁。(维基百科)
1. 第一阶段:从语言模型到 GPT(2018-2020)
关键词:规模化(Scaling)
代表:
- GPT-1(2018)
- GPT-2(2019)
- GPT-3(2020)
变化:
以前的 NLP:
一个模型解决一个任务(翻译、分类、问答)
GPT 思路:
先训练一个通用语言模型,再通过提示(prompt)完成各种任务。
核心突破:
- 大规模预训练
- Transformer 架构
- 海量互联网文本
- 参数规模扩大
GPT-3 证明了一件重要事情:
当模型足够大时,会出现“涌现能力”(emergent abilities),例如简单推理、代码生成、文本总结。(arXiv)
这个阶段的哲学:
更多参数 + 更多数据 + 更多算力 = 更强能力
2. 第二阶段:ChatGPT 让 LLM 从实验室走向大众(2022-2023)
代表:
- ChatGPT(GPT-3.5)
- GPT-4
核心变化:
LLM 不再只是“预测下一个词”,而是变成:
人类可以自然交流的助手。
关键技术:
(1)指令微调(Instruction Tuning)
让模型学会:
- 按要求回答
- 遵循格式
- 扮演角色
(2)人类反馈强化学习(RLHF)
让模型更符合人类偏好:
例如:
普通 GPT:
生成答案
ChatGPT:
生成更有帮助、更安全、更符合交流习惯的答案
这些技术成为 GPT 类系统快速普及的重要原因。(arXiv)
3. 第三阶段:从文字模型到多模态模型(2023-2025)
趋势:
Text → Multimodal
未来模型不只是读文字:
还能理解:
- 图片
- 声音
- 视频
- 代码
- 传感器数据
例如:
以前:
用户:
描述这张图片
模型:
只能分析文字
未来:
用户:
看我的工厂视频,告诉我设备哪里异常
模型:
分析视觉 + 时间变化 + 工业知识
代表方向:
- GPT-4 系列多模态能力
- Gemini
- Claude 多模态模型
多模态被认为是走向更通用智能的重要方向。(维基百科)
4. 第四阶段:从“生成”到“推理”(2024以后)
过去:
LLM 更像:
一个知识丰富的聊天机器人
问题:
- 容易幻觉
- 数学推理弱
- 长任务容易失败
新的方向:
Reasoning Models(推理模型)
特点:
模型会:
- 分析问题
- 分解步骤
- 检查答案
- 再输出结果
类似:
普通模型:
问题 → 答案推理模型:
问题 ↓ 分析 ↓ 规划 ↓ 验证 ↓ 答案未来竞争重点可能从:
谁参数最大
转向:
谁推理效率最高
5. 第五阶段:Agent(智能体)时代(2025以后)
这是目前最重要趋势之一。
LLM 从:
“回答问题”
变成:
“完成任务”。
例如:
以前:
用户:
帮我做市场分析
AI:
给你一份文字报告
未来 Agent:
- 搜索资料
- 阅读文件
- 分析数据
- 写报告
- 做 PPT
- 发邮件
- 跟踪结果
结构:
LLM 大脑 | | 工具调用 | ---------------- 搜索 数据库 代码执行 浏览器 企业系统LLM 会成为各种软件的智能控制层。
6. 第六阶段:小模型和专用模型崛起
过去:
趋势:
越大越好
现在:
出现两个方向:
巨型模型
用于:
- 通用智能
- 科研
- 复杂推理
例如 GPT、Gemini、Claude 等。
小型模型
用于:
- 手机
- 汽车
- 企业内部
- 边缘设备
优势:
- 成本低
- 私密性强
- 延迟低
例如:
一个医院可能不用调用云端大模型,而是在内部部署医疗模型。
未来可能是:
超级大模型 + 行业模型 + 个人模型7. 第七阶段:个人化 AI
未来每个人可能拥有:
自己的 AI 助手。
它了解:
- 你的工作方式
- 写作风格
- 学习习惯
- 项目背景
- 长期目标
例如:
你的 AI:
“根据你过去三年的投资研究习惯,我整理了这份分析。”
这会推动 LLM 从:
公共工具
变成:
个人认知外脑。
8. 最终方向:AGI(通用人工智能)?
很多研究者认为 LLM 是通往 AGI 的重要路径,但目前是否已经达到 AGI 仍存在广泛讨论。
未来可能需要解决:
| 问题 | 当前状态 |
|---|---|
| 语言理解 | 非常强 |
| 知识记忆 | 强,但会错 |
| 逻辑推理 | 快速提升 |
| 长期规划 | 仍有限 |
| 现实世界交互 | 不足 |
| 自主学习 | 早期阶段 |
总结:LLM 的路线图
可以浓缩成:
2018 GPT-1 ↓ 更大模型 2020 GPT-3 ↓ 规模化智能 2022 ChatGPT ↓ 人机交互革命 2023 GPT-4 ↓ 多模态 2024-2025 推理模型 ↓ 更强思考能力 2025+ AI Agent ↓ 执行任务 未来 个人AI + 行业AI + 世界模型 ↓ 通用智能一句话总结:
LLM 的发展方向正在从“预测文字的机器”变成“理解世界、进行推理、调用工具并替人完成复杂工作的智能系统”。
未来 5-10 年,最大的变化可能不是“AI 会不会聊天”,而是大量知识工作会从人操作软件,变成人管理 AI Agent 完成工作。
从研究领域看,近几年 LLM 的研究方向已经从早期的“把模型做大”逐渐转向“让模型更可靠、更智能、更高效、更接近通用智能”。如果按照学术界和工业界的研究热点划分,大致可以分为以下方向:
1. Scaling Laws 与基础模型(Foundation Models)
核心问题:模型规模如何影响智能?
这是 GPT-3 时代开启的研究方向。
研究内容:
(1)模型规模规律(Scaling Laws)
研究:
- 参数量
- 数据量
- 计算量
- 性能提升之间的关系
典型问题:
1000 亿参数模型是否一定比 100 亿参数模型好?
研究发现:
不是简单增加参数,而是需要:
- 合理的数据规模
- 更高质量数据
- 更优训练策略
近年来出现:
- Chinchilla scaling law
- Compute-optimal training
即:
与其盲目扩大模型,不如让模型、数据和计算达到最佳比例。
2. 预训练技术(Pre-training)
这是 LLM 的基础研究。
研究方向:
(1)数据工程(Data Engineering)
越来越重要。
包括:
- 数据过滤
- 去重
- 数据质量评估
- 合成数据生成
过去:
有多少网页,就训练多少
现在:
数据质量决定模型上限
研究问题:
- 什么样的数据产生推理能力?
- 如何自动构造高价值训练集?
(2)新的模型架构
Transformer 仍然主流,但研究者在探索:
长上下文模型
目标:
从:
几十页文本
到:
百万 token。
研究:
- Long Context Transformer
- Attention 优化
- Memory机制
Transformer 替代架构
例如:
- Mamba(State Space Model)
- RWKV
- Hyena
目标:
降低 Transformer 的计算复杂度。
3. 后训练(Post-training)
这是近几年最热门方向之一。
因为研究发现:
基础模型能力 ≠ 用户可用能力
需要进一步训练。
主要包括:
(1)Instruction Tuning
让模型学会:
- 遵循指令
- 输出格式
- 完成任务
研究问题:
如何自动生成高质量指令数据?
(2)RLHF / RLAIF
让模型符合人类偏好。
研究:
- 人类反馈强化学习
- AI 反馈强化学习
核心问题:
如何定义:
“好的回答?”
(3)Preference Optimization
近年来非常热门。
例如:
- DPO(Direct Preference Optimization)
- IPO
- KTO
目标:
不用复杂 RL,也能优化模型行为。
4. 推理能力(Reasoning)
这是 2024 年以后最核心方向之一。
研究问题:
为什么 LLM 会语言,却不会稳定推理?
方向:
(1)Chain-of-Thought(思维链)
让模型:
一步一步解决问题。
例如:
数学题:
问题 ↓ 步骤1 ↓ 步骤2 ↓ 答案(2)Test-Time Compute
一个重要趋势:
过去:
训练时增加计算。
现在:
推理时增加计算。
例如:
模型回答前:
- 多次尝试
- 自我检查
- 搜索路径
类似:
“考试时多花时间思考”。
(3)Reasoning Model
研究:
- 如何训练模型进行深度推理
- 如何评价推理能力
- 如何避免伪推理
涉及:
- 数学
- 编程
- 科学推理
- 复杂规划
5. Agent 与自主系统(AI Agents)
目前非常活跃。
核心问题:
如何让 LLM 从回答者变成执行者?
研究方向:
(1)Planning(规划)
例如:
目标:
“帮我安排一次商务旅行”
模型需要:
理解目标 ↓ 拆任务 ↓ 选择工具 ↓ 执行 ↓ 检查结果研究:
- Task decomposition
- Hierarchical planning
(2)Tool Use(工具调用)
让模型调用:
- 搜索
- 数据库
- Python
- API
- 企业软件
研究:
- Tool learning
- Function calling
(3)Memory(长期记忆)
当前 LLM:
短期记忆强
长期记忆弱。
研究:
- 外部记忆数据库
- 用户建模
- Episodic memory
目标:
打造:
“认识你的 AI”。
6. 多模态大模型(Multimodal LLM)
从文本走向:
Text ↓ Image ↓ Audio ↓ Video ↓ Robot perception研究方向:
Vision-Language Model(VLM)
研究:
如何让模型理解:
- 图片
- 视频
- 空间关系
问题:
为什么模型看到了,但理解不了?
Video Understanding
热门方向:
- 视频事件理解
- 长视频记忆
- 视频推理
例如:
“看一个小时会议录像,总结决策过程。”
Embodied AI(具身智能)
结合:
LLM + Robot
研究:
- 机器人语言控制
- 世界模型
- 现实环境学习
7. RAG(Retrieval-Augmented Generation)
这是工业界非常重要的方向。
核心:
让模型连接外部知识。
结构:
用户问题 ↓ 检索数据库 ↓ 相关资料 ↓ LLM生成答案研究问题:
- 如何检索最相关信息?
- 如何避免错误引用?
- 如何处理动态知识?
应用:
- 企业知识库
- 医疗
- 法律
- 金融
8. LLM 安全与可靠性(Safety & Alignment)
非常大的研究领域。
包括:
(1)Hallucination(幻觉)
问题:
模型会生成不存在的信息。
研究:
- 事实验证
- 引用机制
- 自检能力
(2)Alignment(对齐)
研究:
如何让模型:
- 遵守人类意图
- 避免危险行为
- 理解价值约束
(3)Interpretability(可解释性)
核心问题:
我们知道模型输出什么,但不知道为什么。
研究:
- Mechanistic Interpretability
- Neural Circuit Analysis
目标:
理解 Transformer 内部机制。
9. 高效训练与部署(Efficiency)
工业界非常关注。
研究:
模型压缩
包括:
- Quantization(量化)
- Pruning(剪枝)
- Distillation(蒸馏)
目标:
1000亿参数模型:
→ 手机可运行。
低成本推理
研究:
- KV Cache优化
- Flash Attention
- Speculative Decoding
10. AI for Science(科学智能)
近几年快速增长。
方向:
LLM 辅助:
- 生物
- 化学
- 材料
- 数学
- 物理
例如:
- 自动阅读论文
- 生成实验方案
- 辅助证明数学定理
目前研究热度大致排序(2025前后)
如果看论文数量和工业投入:
| 方向 | 热度 |
|---|---|
| Reasoning / 推理模型 | ★★★★★ |
| AI Agent | ★★★★★ |
| Multimodal LLM | ★★★★★ |
| Post-training | ★★★★★ |
| RAG | ★★★★ |
| Efficient LLM | ★★★★ |
| Interpretability | ★★★★ |
| Robotics / Embodied AI | ★★★★ |
| 新架构(Transformer替代) | ★★★ |
| Scaling Laws | ★★★ |
如果从“未来 5 年最可能突破”的角度看
学术界目前最关注的几个问题:
- LLM 如何获得可靠推理能力?
- 如何让 AI Agent 长时间自主完成复杂任务?
- 如何让模型理解真实世界(多模态 + 世界模型)?
- 如何降低训练和运行成本?
- 如何理解和控制大模型内部机制?
一句话概括:
LLM 研究正在从“训练一个更大的语言模型”转向“构建一个能够感知世界、持续学习、推理规划并执行任务的智能系统”。
如果从计算机科学研究路线来看,未来最核心的交叉领域会集中在机器学习 + 认知科学 + 强化学习 + NLP + 机器人 + 系统工程的交汇处。
LoRA(Low-Rank Adaptation,低秩适配)属于上面提到的“模型后训练(Post-training)/ 参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)”这一类技术。
它解决的问题是:
如何让一个已经训练好的大语言模型适应新的任务,而不用重新训练整个模型。
1. 为什么需要 LoRA?
以 GPT 类模型为例:
一个大模型可能有:
- 70 亿参数(7B)
- 700 亿参数(70B)
- 甚至更多
如果想让它学习一个新领域:
例如:
- 医疗问答
- 法律文本
- 企业内部知识
- 特定写作风格
传统方法:
Full Fine-tuning(全参数微调)
把所有参数重新训练:
原模型: W(1000亿参数) ↓ 训练 新模型: W'(1000亿参数)问题:
- GPU需求巨大
- 成本高
- 容易破坏原模型能力(灾难性遗忘)
- 每个任务保存一个完整模型
例如:
公司有:
- 医疗助手
- 财务助手
- 客服助手
传统方式:
需要保存:
GPT-70B 医疗版 700亿参数 GPT-70B 财务版 700亿参数 GPT-70B 客服版 700亿参数成本非常高。
2. LoRA 的核心思想
LoRA 的想法:
不改变原来的大模型,只增加一个很小的“插件”。
假设原模型某个神经网络层:
[
y = Wx
]
其中:
- W 是模型参数矩阵
- x 是输入
Full fine-tuning:
直接修改 W:
[
W \rightarrow W’
]
LoRA:
保持 W 不变:
[
W
]
增加一个小变化:
[
W’ = W + \Delta W
]
其中:
[
\Delta W = BA
]
也就是:
两个低维矩阵:
原权重 W | | 输入 x ----+ | ↓ 输出 y LoRA: x | ↓ A矩阵 | B矩阵 | ↓ 小的调整 ΔW训练时:
只训练:
A 和 B
而不是 W。
3. 为什么叫 Low-Rank?
因为:
大型模型里的权重矩阵通常很大。
例如:
W: 10000 × 10000 参数量: 100,000,000如果直接训练:
1亿参数。
LoRA 假设:
真正需要改变的信息其实很少。
所以:
不用训练:
10000 × 10000而训练:
10000 × r + r × 10000其中:
r 很小,例如:
- 4
- 8
- 16
- 64
如果 r=8:
参数:
10000×8 + 8×10000 =160,000从:
1亿
减少到:
16万。
4. LoRA 在 LLM 发展路线中的位置
对应之前的路线:
基础模型训练 | | ↓ Pre-training (GPT训练) | | ↓ Post-training | +---------------- | ↓ Instruction tuning | ↓ Preference optimization | ↓ PEFT | +--- LoRA | +--- Adapter | +--- Prefix tuning所以:
LoRA 是让大模型适配新任务的一种后训练技术。
5. LoRA 和 RAG 的区别
很多人容易混淆。
LoRA:
改变模型。
例如:
让模型学会:
医疗专家说话方式
训练:
模型参数 ↓ 改变 ↓ 医疗模型适合:
- 风格改变
- 专业能力增强
- 特定任务
RAG:
不改变模型。
只是提供资料:
用户问题 ↓ 搜索数据库 ↓ 找到资料 ↓ 给LLM回答适合:
- 最新知识
- 企业文档
- 内部资料
简单比较:
| LoRA | RAG | |
|---|---|---|
| 是否训练模型 | 是 | 否 |
| 改变参数 | 少量 | 不改变 |
| 成本 | 中等 | 低 |
| 知识更新 | 慢 | 快 |
| 适合领域化 | 强 | 强 |
| 适合实时信息 | 弱 | 强 |
实际系统经常:
LoRA + RAG 一起用。
例如:
一个法律 AI:
LoRA:
- 学法律语言风格
- 学法律推理模式
RAG:
- 查询最新法规
- 查询案例库
6. LoRA 为什么在近几年非常重要?
因为它改变了大模型应用模式。
以前:
只有大公司能训练模型。
现在:
个人或小团队可以:
拿一个开源模型:
例如:
- Llama
- Mistral
- Qwen
然后:
用少量 GPU:
训练一个:
- 金融助手
- 编程助手
- 企业客服模型
7. LoRA 的进一步发展
LoRA 之后出现很多改进:
QLoRA
LoRA + Quantization(量化)
特点:
让 65B 级模型也能在有限 GPU 上微调。
AdaLoRA
动态调整:
哪些参数需要更多训练。
DoRA
改进 LoRA 的权重更新方式。
总结一句话:
LoRA 是一种“轻量级改造大模型”的方法:冻结原来的 GPT 类模型,只训练少量低秩参数,让模型快速适应新的领域或任务。
在 LLM 技术路线中,它属于:
Post-training → Parameter Efficient Fine-Tuning(PEFT)
是过去几年推动开源大模型生态快速发展的关键技术之一。
这是一个很好的问题。LoRA 属于Parameter-Efficient Fine-Tuning(PEFT,参数高效微调)方向。近几年这个方向非常活跃,因为大家发现:
未来不会给每个任务重新训练一个千亿参数模型,而是希望用很小的代价“改造”一个基础模型。
LoRA 之后的研究大致沿着几个方向发展:更高性能、更低成本、更灵活的适配方式。下面按照研究趋势介绍。
1. QLoRA:LoRA + 量化(目前最成熟的改进)
论文:
QLoRA: Efficient Finetuning of Quantized LLMs (2023)
核心思想:
LoRA 解决:
少训练参数
QLoRA 进一步解决:
连基础模型存储都太贵
传统 LoRA:
冻结:
70B模型权重训练:
LoRA adapter但是:
70B 模型本身仍然需要 GPU 显存。
QLoRA:
先把基础模型压缩:
FP16模型 ↓ 4-bit量化模型然后:
在量化模型上训练 LoRA。
结构:
4-bit LLM | | 输入 ------ Transformer | | LoRA Adapter | ↓ 输出效果:
一个大型模型可以在更少 GPU 上微调。
所以现在很多开源模型微调流程:
Llama / Qwen / Mistral ↓ 4-bit量化 ↓ QLoRA训练已经成为工业标准之一。(arXiv)
2. DoRA:改进 LoRA 的表达能力
论文:
DoRA: Weight-Decomposed Low-Rank Adaptation (2024)
LoRA 的问题:
它假设:
权重变化主要存在于低秩空间。
但是:
一个权重矩阵变化实际上包含两个因素:
- 方向(direction)
- 大小(magnitude)
LoRA:
直接学习:
[
W+\Delta W
]
DoRA:
拆开:
权重 = 方向(direction) × 大小(magnitude)类似:
人的学习:
不是重新学习全部知识,而是:
- 调整思维方向
- 调整强调程度
优势:
在一些任务上接近 Full Fine-tuning 性能。
3. AdaLoRA:动态分配参数
普通 LoRA:
所有层使用相同 rank。
例如:
Layer 1 rank=8 Layer 2 rank=8 Layer 3 rank=8 ...问题:
不同层重要性不同。
AdaLoRA:
自动决定:
哪里需要更多参数。
例如:
Attention层 rank=32 FFN层 rank=4类似:
把预算花在最重要的位置。
研究方向:
自动寻找模型中最值得修改的位置。
4. LoHa / LoKr:更强的低秩表达
LoRA:
矩阵:
[
\Delta W=BA
]
LoHa:
使用:
Hadamard product(元素乘)
增加表达能力。
LoKr:
使用:
Kronecker product(克罗内克积)
目标:
用更少参数表示更复杂变化。
简单理解:
LoRA:
小积木LoHa / LoKr:
更复杂的小积木组合主要用于:
- Stable Diffusion
- 大模型适配
5. VeRA:极端参数压缩方向
VeRA (Vector-based Random Matrix Adaptation)
思想:
LoRA:
每个任务保存:
两个矩阵:
A BVeRA:
使用:
共享随机矩阵 + 少量向量。
结构:
LoRA:
Task A: A矩阵 B矩阵 Task B: A矩阵 B矩阵VeRA:
共享随机矩阵 + 任务向量优势:
adapter 可以非常小。
适合:
大量任务、多租户系统。
6. Prompt Tuning / Prefix Tuning
这是一条不同路线。
LoRA:
修改:
模型参数。
Prompt tuning:
不改模型。
而是在输入前增加:
“虚拟 token”。
例如:
原输入:
总结下面文章: xxxx变成:
[虚拟token1] [虚拟token2] [虚拟token3] 总结下面文章: xxxx模型参数完全冻结。
优点:
非常省。
缺点:
能力通常弱于 LoRA。
7. Adapter Tuning
比 LoRA 更早。
思想:
在 Transformer 中插入小模块:
Transformer Layer Attention ↓ Adapter ↓ FFN训练:
Adapter。
冻结:
原模型。
LoRA 可以看作:
一种更数学化、更轻量的 Adapter。
8. ReFT:不改参数,改“神经表示”
这是一个比较新的研究方向。
论文:
Representation Finetuning (ReFT, 2024)
LoRA:
修改:
权重。
ReFT:
修改:
隐藏状态(representation)。
简单说:
LLM内部:
输入 ↓ 隐藏表示 ↓ 输出ReFT:
直接干预:
隐藏表示空间类似:
不改变大脑结构,
而改变思维状态。
研究者认为:
有时候改变 representation 比改变 weight 更有效。(维基百科)
9. Mixture-of-Adapters(多个 LoRA 组合)
未来企业场景很重要。
例如:
一个基础模型:
Qwen-72B多个 LoRA:
医疗LoRA 金融LoRA 法律LoRA 客服LoRA运行时:
动态组合:
用户问题 ↓ 选择adapter ↓ 回答类似:
给一个通用大脑加载不同技能包。
10. 最新趋势:从“微调参数”到“学习能力模块”
目前研究方向正在变化:
以前:
怎样更少参数地改变模型?现在:
怎样让模型获得新能力?所以出现:
Skill Adapter
学习:
- 编程能力
- 推理能力
- 工具使用能力
Agent Adapter
让模型学:
- 规划
- 调用工具
- 长任务执行
Continual Learning Adapter
让模型:
持续学习新知识。
总体技术路线图
可以这样看:
Full Fine-tuning | ↓ Parameter Efficient Fine Tuning | | ----------------------- | | | LoRA Adapter Prompt | | --------------------------- | | | | QLoRA DoRA AdaLoRA LoHa | | 低成本大模型定制 未来: Representation Tuning + Agent Adapter + Continual Learning如果从研究价值排序(2025左右)
| 方向 | 研究热度 | 原因 |
|---|---|---|
| QLoRA | ★★★★★ | 已经成为开源微调主流 |
| DoRA | ★★★★ | 提升LoRA性能 |
| Adaptive LoRA | ★★★★ | 自动优化参数 |
| Representation Fine-tuning (ReFT) | ★★★★ | 探索新范式 |
| Agent Adapter | ★★★★★ | 面向未来AI Agent |
| Continual Learning | ★★★★★ | 解决长期学习 |
| Prompt/Prefix tuning | ★★★ | 成熟但性能有限 |
一句话总结:
LoRA之后的研究核心不是简单“减少训练参数”,而是探索如何用最小的改变,让一个基础模型获得新的能力。未来方向会从“参数微调(weight tuning)”逐渐走向“能力模块化(skill adaptation)和持续学习(continual adaptation)”。
如果从博士研究方向角度看,目前最值得关注的是Agent + PEFT、Reasoning能力注入、Continual Learning、Representation Fine-tuning这几个交叉方向。