news 2026/9/24 21:49:10

LLM的发展趋势

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
LLM的发展趋势

文章目录

    • 1. 第一阶段:从语言模型到 GPT(2018-2020)
      • 关键词:**规模化(Scaling)**
  • 2. 第二阶段:ChatGPT 让 LLM 从实验室走向大众(2022-2023)
      • (1)指令微调(Instruction Tuning)
      • (2)人类反馈强化学习(RLHF)
  • 3. 第三阶段:从文字模型到多模态模型(2023-2025)
    • Text → Multimodal
  • 4. 第四阶段:从“生成”到“推理”(2024以后)
    • Reasoning Models(推理模型)
  • 5. 第五阶段:Agent(智能体)时代(2025以后)
  • 6. 第六阶段:小模型和专用模型崛起
    • 巨型模型
    • 小型模型
  • 7. 第七阶段:个人化 AI
  • 8. 最终方向:AGI(通用人工智能)?
  • 总结:LLM 的路线图
  • 1. Scaling Laws 与基础模型(Foundation Models)
      • (1)模型规模规律(Scaling Laws)
  • 2. 预训练技术(Pre-training)
    • (1)数据工程(Data Engineering)
    • (2)新的模型架构
      • 长上下文模型
      • Transformer 替代架构
  • 3. 后训练(Post-training)
    • (1)Instruction Tuning
    • (2)RLHF / RLAIF
    • (3)Preference Optimization
  • 4. 推理能力(Reasoning)
    • (1)Chain-of-Thought(思维链)
    • (2)Test-Time Compute
    • (3)Reasoning Model
  • 5. Agent 与自主系统(AI Agents)
    • (1)Planning(规划)
    • (2)Tool Use(工具调用)
    • (3)Memory(长期记忆)
  • 6. 多模态大模型(Multimodal LLM)
    • Vision-Language Model(VLM)
    • Video Understanding
    • Embodied AI(具身智能)
  • 7. RAG(Retrieval-Augmented Generation)
  • 8. LLM 安全与可靠性(Safety & Alignment)
    • (1)Hallucination(幻觉)
    • (2)Alignment(对齐)
    • (3)Interpretability(可解释性)
  • 9. 高效训练与部署(Efficiency)
    • 模型压缩
    • 低成本推理
  • 10. AI for Science(科学智能)
  • 目前研究热度大致排序(2025前后)
  • 如果从“未来 5 年最可能突破”的角度看
    • 1. 为什么需要 LoRA?
      • Full Fine-tuning(全参数微调)
  • 2. LoRA 的核心思想
  • 3. 为什么叫 Low-Rank?
  • 4. LoRA 在 LLM 发展路线中的位置
  • 5. LoRA 和 RAG 的区别
    • LoRA:
    • RAG:
  • 6. LoRA 为什么在近几年非常重要?
  • 7. LoRA 的进一步发展
      • QLoRA
      • AdaLoRA
      • DoRA
  • 总结一句话:
  • 1. QLoRA:LoRA + 量化(目前最成熟的改进)
  • 2. DoRA:改进 LoRA 的表达能力
  • 3. AdaLoRA:动态分配参数
  • 4. LoHa / LoKr:更强的低秩表达
  • 5. VeRA:极端参数压缩方向
  • 6. Prompt Tuning / Prefix Tuning
  • 7. Adapter Tuning
  • 8. ReFT:不改参数,改“神经表示”
  • 9. Mixture-of-Adapters(多个 LoRA 组合)
  • 10. 最新趋势:从“微调参数”到“学习能力模块”
    • Skill Adapter
    • Agent Adapter
    • Continual Learning Adapter
  • 总体技术路线图
  • 如果从研究价值排序(2025左右)

从 GPT(Generative Pre-trained Transformer)开始,LLM(Large Language Model,大语言模型)的发展大致经历了“规模化 → 对齐 → 多模态 → 推理 → 智能体 → 个性化/行业化”这几个阶段。核心趋势不是简单地“模型越来越大”,而是从“会聊天”走向“能理解、能推理、能行动”。Transformer 架构在 2017 年提出后成为现代 LLM 的基础,随后 GPT 系列通过扩大数据、参数和计算资源推动能力跃迁。(维基百科)


1. 第一阶段:从语言模型到 GPT(2018-2020)

关键词:规模化(Scaling)

代表:

  • GPT-1(2018)
  • GPT-2(2019)
  • GPT-3(2020)

变化:

以前的 NLP:

一个模型解决一个任务(翻译、分类、问答)

GPT 思路:

先训练一个通用语言模型,再通过提示(prompt)完成各种任务。

核心突破:

  • 大规模预训练
  • Transformer 架构
  • 海量互联网文本
  • 参数规模扩大

GPT-3 证明了一件重要事情:

当模型足够大时,会出现“涌现能力”(emergent abilities),例如简单推理、代码生成、文本总结。(arXiv)

这个阶段的哲学:

更多参数 + 更多数据 + 更多算力 = 更强能力


2. 第二阶段:ChatGPT 让 LLM 从实验室走向大众(2022-2023)

代表:

  • ChatGPT(GPT-3.5)
  • GPT-4

核心变化:

LLM 不再只是“预测下一个词”,而是变成:

人类可以自然交流的助手。

关键技术:

(1)指令微调(Instruction Tuning)

让模型学会:

  • 按要求回答
  • 遵循格式
  • 扮演角色

(2)人类反馈强化学习(RLHF)

让模型更符合人类偏好:

例如:

普通 GPT:

生成答案

ChatGPT:

生成更有帮助、更安全、更符合交流习惯的答案

这些技术成为 GPT 类系统快速普及的重要原因。(arXiv)


3. 第三阶段:从文字模型到多模态模型(2023-2025)

趋势:

Text → Multimodal

未来模型不只是读文字:

还能理解:

  • 图片
  • 声音
  • 视频
  • 代码
  • 传感器数据

例如:

以前:

用户:

描述这张图片

模型:

只能分析文字

未来:

用户:

看我的工厂视频,告诉我设备哪里异常

模型:

分析视觉 + 时间变化 + 工业知识

代表方向:

  • GPT-4 系列多模态能力
  • Gemini
  • Claude 多模态模型

多模态被认为是走向更通用智能的重要方向。(维基百科)


4. 第四阶段:从“生成”到“推理”(2024以后)

过去:

LLM 更像:

一个知识丰富的聊天机器人

问题:

  • 容易幻觉
  • 数学推理弱
  • 长任务容易失败

新的方向:

Reasoning Models(推理模型)

特点:

模型会:

  1. 分析问题
  2. 分解步骤
  3. 检查答案
  4. 再输出结果

类似:

普通模型:

问题 → 答案

推理模型:

问题 ↓ 分析 ↓ 规划 ↓ 验证 ↓ 答案

未来竞争重点可能从:

谁参数最大

转向:

谁推理效率最高


5. 第五阶段:Agent(智能体)时代(2025以后)

这是目前最重要趋势之一。

LLM 从:

“回答问题”

变成:

“完成任务”。

例如:

以前:

用户:

帮我做市场分析

AI:

给你一份文字报告

未来 Agent:

  1. 搜索资料
  2. 阅读文件
  3. 分析数据
  4. 写报告
  5. 做 PPT
  6. 发邮件
  7. 跟踪结果

结构:

LLM 大脑 | | 工具调用 | ---------------- 搜索 数据库 代码执行 浏览器 企业系统

LLM 会成为各种软件的智能控制层。


6. 第六阶段:小模型和专用模型崛起

过去:

趋势:

越大越好

现在:

出现两个方向:

巨型模型

用于:

  • 通用智能
  • 科研
  • 复杂推理

例如 GPT、Gemini、Claude 等。


小型模型

用于:

  • 手机
  • 汽车
  • 企业内部
  • 边缘设备

优势:

  • 成本低
  • 私密性强
  • 延迟低

例如:

一个医院可能不用调用云端大模型,而是在内部部署医疗模型。

未来可能是:

超级大模型 + 行业模型 + 个人模型

7. 第七阶段:个人化 AI

未来每个人可能拥有:

自己的 AI 助手。

它了解:

  • 你的工作方式
  • 写作风格
  • 学习习惯
  • 项目背景
  • 长期目标

例如:

你的 AI:

“根据你过去三年的投资研究习惯,我整理了这份分析。”

这会推动 LLM 从:

公共工具

变成:

个人认知外脑。


8. 最终方向:AGI(通用人工智能)?

很多研究者认为 LLM 是通往 AGI 的重要路径,但目前是否已经达到 AGI 仍存在广泛讨论。

未来可能需要解决:

问题当前状态
语言理解非常强
知识记忆强,但会错
逻辑推理快速提升
长期规划仍有限
现实世界交互不足
自主学习早期阶段

总结:LLM 的路线图

可以浓缩成:

2018 GPT-1 ↓ 更大模型 2020 GPT-3 ↓ 规模化智能 2022 ChatGPT ↓ 人机交互革命 2023 GPT-4 ↓ 多模态 2024-2025 推理模型 ↓ 更强思考能力 2025+ AI Agent ↓ 执行任务 未来 个人AI + 行业AI + 世界模型 ↓ 通用智能

一句话总结:

LLM 的发展方向正在从“预测文字的机器”变成“理解世界、进行推理、调用工具并替人完成复杂工作的智能系统”。

未来 5-10 年,最大的变化可能不是“AI 会不会聊天”,而是大量知识工作会从人操作软件,变成人管理 AI Agent 完成工作。

从研究领域看,近几年 LLM 的研究方向已经从早期的“把模型做大”逐渐转向“让模型更可靠、更智能、更高效、更接近通用智能”。如果按照学术界和工业界的研究热点划分,大致可以分为以下方向:


1. Scaling Laws 与基础模型(Foundation Models)

核心问题:模型规模如何影响智能?

这是 GPT-3 时代开启的研究方向。

研究内容:

(1)模型规模规律(Scaling Laws)

研究:

  • 参数量
  • 数据量
  • 计算量
  • 性能提升之间的关系

典型问题:

1000 亿参数模型是否一定比 100 亿参数模型好?

研究发现:

不是简单增加参数,而是需要:

  • 合理的数据规模
  • 更高质量数据
  • 更优训练策略

近年来出现:

  • Chinchilla scaling law
  • Compute-optimal training

即:

与其盲目扩大模型,不如让模型、数据和计算达到最佳比例。


2. 预训练技术(Pre-training)

这是 LLM 的基础研究。

研究方向:

(1)数据工程(Data Engineering)

越来越重要。

包括:

  • 数据过滤
  • 去重
  • 数据质量评估
  • 合成数据生成

过去:

有多少网页,就训练多少

现在:

数据质量决定模型上限

研究问题:

  • 什么样的数据产生推理能力?
  • 如何自动构造高价值训练集?

(2)新的模型架构

Transformer 仍然主流,但研究者在探索:

长上下文模型

目标:

从:

几十页文本

到:

百万 token。

研究:

  • Long Context Transformer
  • Attention 优化
  • Memory机制

Transformer 替代架构

例如:

  • Mamba(State Space Model)
  • RWKV
  • Hyena

目标:

降低 Transformer 的计算复杂度。


3. 后训练(Post-training)

这是近几年最热门方向之一。

因为研究发现:

基础模型能力 ≠ 用户可用能力

需要进一步训练。

主要包括:


(1)Instruction Tuning

让模型学会:

  • 遵循指令
  • 输出格式
  • 完成任务

研究问题:

如何自动生成高质量指令数据?


(2)RLHF / RLAIF

让模型符合人类偏好。

研究:

  • 人类反馈强化学习
  • AI 反馈强化学习

核心问题:

如何定义:

“好的回答?”


(3)Preference Optimization

近年来非常热门。

例如:

  • DPO(Direct Preference Optimization)
  • IPO
  • KTO

目标:

不用复杂 RL,也能优化模型行为。


4. 推理能力(Reasoning)

这是 2024 年以后最核心方向之一。

研究问题:

为什么 LLM 会语言,却不会稳定推理?

方向:


(1)Chain-of-Thought(思维链)

让模型:

一步一步解决问题。

例如:

数学题:

问题 ↓ 步骤1 ↓ 步骤2 ↓ 答案

(2)Test-Time Compute

一个重要趋势:

过去:

训练时增加计算。

现在:

推理时增加计算。

例如:

模型回答前:

  • 多次尝试
  • 自我检查
  • 搜索路径

类似:

“考试时多花时间思考”。


(3)Reasoning Model

研究:

  • 如何训练模型进行深度推理
  • 如何评价推理能力
  • 如何避免伪推理

涉及:

  • 数学
  • 编程
  • 科学推理
  • 复杂规划

5. Agent 与自主系统(AI Agents)

目前非常活跃。

核心问题:

如何让 LLM 从回答者变成执行者?

研究方向:


(1)Planning(规划)

例如:

目标:

“帮我安排一次商务旅行”

模型需要:

理解目标 ↓ 拆任务 ↓ 选择工具 ↓ 执行 ↓ 检查结果

研究:

  • Task decomposition
  • Hierarchical planning

(2)Tool Use(工具调用)

让模型调用:

  • 搜索
  • 数据库
  • Python
  • API
  • 企业软件

研究:

  • Tool learning
  • Function calling

(3)Memory(长期记忆)

当前 LLM:

短期记忆强

长期记忆弱。

研究:

  • 外部记忆数据库
  • 用户建模
  • Episodic memory

目标:

打造:

“认识你的 AI”。


6. 多模态大模型(Multimodal LLM)

从文本走向:

Text ↓ Image ↓ Audio ↓ Video ↓ Robot perception

研究方向:


Vision-Language Model(VLM)

研究:

如何让模型理解:

  • 图片
  • 视频
  • 空间关系

问题:

为什么模型看到了,但理解不了?


Video Understanding

热门方向:

  • 视频事件理解
  • 长视频记忆
  • 视频推理

例如:

“看一个小时会议录像,总结决策过程。”


Embodied AI(具身智能)

结合:

LLM + Robot

研究:

  • 机器人语言控制
  • 世界模型
  • 现实环境学习

7. RAG(Retrieval-Augmented Generation)

这是工业界非常重要的方向。

核心:

让模型连接外部知识。

结构:

用户问题 ↓ 检索数据库 ↓ 相关资料 ↓ LLM生成答案

研究问题:

  • 如何检索最相关信息?
  • 如何避免错误引用?
  • 如何处理动态知识?

应用:

  • 企业知识库
  • 医疗
  • 法律
  • 金融

8. LLM 安全与可靠性(Safety & Alignment)

非常大的研究领域。

包括:


(1)Hallucination(幻觉)

问题:

模型会生成不存在的信息。

研究:

  • 事实验证
  • 引用机制
  • 自检能力

(2)Alignment(对齐)

研究:

如何让模型:

  • 遵守人类意图
  • 避免危险行为
  • 理解价值约束

(3)Interpretability(可解释性)

核心问题:

我们知道模型输出什么,但不知道为什么。

研究:

  • Mechanistic Interpretability
  • Neural Circuit Analysis

目标:

理解 Transformer 内部机制。


9. 高效训练与部署(Efficiency)

工业界非常关注。

研究:


模型压缩

包括:

  • Quantization(量化)
  • Pruning(剪枝)
  • Distillation(蒸馏)

目标:

1000亿参数模型:

→ 手机可运行。


低成本推理

研究:

  • KV Cache优化
  • Flash Attention
  • Speculative Decoding

10. AI for Science(科学智能)

近几年快速增长。

方向:

LLM 辅助:

  • 生物
  • 化学
  • 材料
  • 数学
  • 物理

例如:

  • 自动阅读论文
  • 生成实验方案
  • 辅助证明数学定理

目前研究热度大致排序(2025前后)

如果看论文数量和工业投入:

方向热度
Reasoning / 推理模型★★★★★
AI Agent★★★★★
Multimodal LLM★★★★★
Post-training★★★★★
RAG★★★★
Efficient LLM★★★★
Interpretability★★★★
Robotics / Embodied AI★★★★
新架构(Transformer替代)★★★
Scaling Laws★★★

如果从“未来 5 年最可能突破”的角度看

学术界目前最关注的几个问题:

  1. LLM 如何获得可靠推理能力?
  2. 如何让 AI Agent 长时间自主完成复杂任务?
  3. 如何让模型理解真实世界(多模态 + 世界模型)?
  4. 如何降低训练和运行成本?
  5. 如何理解和控制大模型内部机制?

一句话概括:

LLM 研究正在从“训练一个更大的语言模型”转向“构建一个能够感知世界、持续学习、推理规划并执行任务的智能系统”。

如果从计算机科学研究路线来看,未来最核心的交叉领域会集中在机器学习 + 认知科学 + 强化学习 + NLP + 机器人 + 系统工程的交汇处。

LoRA(Low-Rank Adaptation,低秩适配)属于上面提到的“模型后训练(Post-training)/ 参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)”这一类技术。

它解决的问题是:

如何让一个已经训练好的大语言模型适应新的任务,而不用重新训练整个模型。


1. 为什么需要 LoRA?

以 GPT 类模型为例:

一个大模型可能有:

  • 70 亿参数(7B)
  • 700 亿参数(70B)
  • 甚至更多

如果想让它学习一个新领域:

例如:

  • 医疗问答
  • 法律文本
  • 企业内部知识
  • 特定写作风格

传统方法:

Full Fine-tuning(全参数微调)

把所有参数重新训练:

原模型: W(1000亿参数) ↓ 训练 新模型: W'(1000亿参数)

问题:

  • GPU需求巨大
  • 成本高
  • 容易破坏原模型能力(灾难性遗忘)
  • 每个任务保存一个完整模型

例如:

公司有:

  • 医疗助手
  • 财务助手
  • 客服助手

传统方式:

需要保存:

GPT-70B 医疗版 700亿参数 GPT-70B 财务版 700亿参数 GPT-70B 客服版 700亿参数

成本非常高。


2. LoRA 的核心思想

LoRA 的想法:

不改变原来的大模型,只增加一个很小的“插件”。

假设原模型某个神经网络层:

[
y = Wx
]

其中:

  • W 是模型参数矩阵
  • x 是输入

Full fine-tuning:

直接修改 W:

[
W \rightarrow W’
]


LoRA:

保持 W 不变:

[
W
]

增加一个小变化:

[
W’ = W + \Delta W
]

其中:

[
\Delta W = BA
]

也就是:

两个低维矩阵:

原权重 W | | 输入 x ----+ | ↓ 输出 y LoRA: x | ↓ A矩阵 | B矩阵 | ↓ 小的调整 ΔW

训练时:

只训练:

A 和 B

而不是 W。


3. 为什么叫 Low-Rank?

因为:

大型模型里的权重矩阵通常很大。

例如:

W: 10000 × 10000 参数量: 100,000,000

如果直接训练:

1亿参数。


LoRA 假设:

真正需要改变的信息其实很少。

所以:

不用训练:

10000 × 10000

而训练:

10000 × r + r × 10000

其中:

r 很小,例如:

  • 4
  • 8
  • 16
  • 64

如果 r=8:

参数:

10000×8 + 8×10000 =160,000

从:

1亿

减少到:

16万。


4. LoRA 在 LLM 发展路线中的位置

对应之前的路线:

基础模型训练 | | ↓ Pre-training (GPT训练) | | ↓ Post-training | +---------------- | ↓ Instruction tuning | ↓ Preference optimization | ↓ PEFT | +--- LoRA | +--- Adapter | +--- Prefix tuning

所以:

LoRA 是让大模型适配新任务的一种后训练技术。


5. LoRA 和 RAG 的区别

很多人容易混淆。

LoRA:

改变模型。

例如:

让模型学会:

医疗专家说话方式

训练:

模型参数 ↓ 改变 ↓ 医疗模型

适合:

  • 风格改变
  • 专业能力增强
  • 特定任务

RAG:

不改变模型。

只是提供资料:

用户问题 ↓ 搜索数据库 ↓ 找到资料 ↓ 给LLM回答

适合:

  • 最新知识
  • 企业文档
  • 内部资料

简单比较:

LoRARAG
是否训练模型
改变参数少量不改变
成本中等
知识更新
适合领域化
适合实时信息

实际系统经常:

LoRA + RAG 一起用。

例如:

一个法律 AI:

  • LoRA:

    • 学法律语言风格
    • 学法律推理模式
  • RAG:

    • 查询最新法规
    • 查询案例库

6. LoRA 为什么在近几年非常重要?

因为它改变了大模型应用模式。

以前:

只有大公司能训练模型。

现在:

个人或小团队可以:

拿一个开源模型:

例如:

  • Llama
  • Mistral
  • Qwen

然后:

用少量 GPU:

训练一个:

  • 金融助手
  • 编程助手
  • 企业客服模型

7. LoRA 的进一步发展

LoRA 之后出现很多改进:

QLoRA

LoRA + Quantization(量化)

特点:

让 65B 级模型也能在有限 GPU 上微调。


AdaLoRA

动态调整:

哪些参数需要更多训练。


DoRA

改进 LoRA 的权重更新方式。


总结一句话:

LoRA 是一种“轻量级改造大模型”的方法:冻结原来的 GPT 类模型,只训练少量低秩参数,让模型快速适应新的领域或任务。

在 LLM 技术路线中,它属于:

Post-training → Parameter Efficient Fine-Tuning(PEFT)

是过去几年推动开源大模型生态快速发展的关键技术之一。

这是一个很好的问题。LoRA 属于Parameter-Efficient Fine-Tuning(PEFT,参数高效微调)方向。近几年这个方向非常活跃,因为大家发现:

未来不会给每个任务重新训练一个千亿参数模型,而是希望用很小的代价“改造”一个基础模型。

LoRA 之后的研究大致沿着几个方向发展:更高性能、更低成本、更灵活的适配方式。下面按照研究趋势介绍。


1. QLoRA:LoRA + 量化(目前最成熟的改进)

论文:
QLoRA: Efficient Finetuning of Quantized LLMs (2023)

核心思想:

LoRA 解决:

少训练参数

QLoRA 进一步解决:

连基础模型存储都太贵


传统 LoRA:

冻结:

70B模型权重

训练:

LoRA adapter

但是:

70B 模型本身仍然需要 GPU 显存。

QLoRA:

先把基础模型压缩:

FP16模型 ↓ 4-bit量化模型

然后:

在量化模型上训练 LoRA。

结构:

4-bit LLM | | 输入 ------ Transformer | | LoRA Adapter | ↓ 输出

效果:

一个大型模型可以在更少 GPU 上微调。

所以现在很多开源模型微调流程:

Llama / Qwen / Mistral ↓ 4-bit量化 ↓ QLoRA训练

已经成为工业标准之一。(arXiv)


2. DoRA:改进 LoRA 的表达能力

论文:
DoRA: Weight-Decomposed Low-Rank Adaptation (2024)

LoRA 的问题:

它假设:

权重变化主要存在于低秩空间。

但是:

一个权重矩阵变化实际上包含两个因素:

  1. 方向(direction)
  2. 大小(magnitude)

LoRA:

直接学习:

[
W+\Delta W
]

DoRA:

拆开:

权重 = 方向(direction) × 大小(magnitude)

类似:

人的学习:

不是重新学习全部知识,而是:

  • 调整思维方向
  • 调整强调程度

优势:

在一些任务上接近 Full Fine-tuning 性能。


3. AdaLoRA:动态分配参数

普通 LoRA:

所有层使用相同 rank。

例如:

Layer 1 rank=8 Layer 2 rank=8 Layer 3 rank=8 ...

问题:

不同层重要性不同。

AdaLoRA:

自动决定:

哪里需要更多参数。

例如:

Attention层 rank=32 FFN层 rank=4

类似:

把预算花在最重要的位置。

研究方向:

自动寻找模型中最值得修改的位置。


4. LoHa / LoKr:更强的低秩表达

LoRA:

矩阵:

[
\Delta W=BA
]

LoHa:

使用:

Hadamard product(元素乘)

增加表达能力。

LoKr:

使用:

Kronecker product(克罗内克积)

目标:

用更少参数表示更复杂变化。

简单理解:

LoRA:

小积木

LoHa / LoKr:

更复杂的小积木组合

主要用于:

  • Stable Diffusion
  • 大模型适配

5. VeRA:极端参数压缩方向

VeRA (Vector-based Random Matrix Adaptation)

思想:

LoRA:

每个任务保存:

两个矩阵:

A B

VeRA:

使用:

共享随机矩阵 + 少量向量。

结构:

LoRA:

Task A: A矩阵 B矩阵 Task B: A矩阵 B矩阵

VeRA:

共享随机矩阵 + 任务向量

优势:

adapter 可以非常小。

适合:

大量任务、多租户系统。


6. Prompt Tuning / Prefix Tuning

这是一条不同路线。

LoRA:

修改:

模型参数。

Prompt tuning:

不改模型。

而是在输入前增加:

“虚拟 token”。

例如:

原输入:

总结下面文章: xxxx

变成:

[虚拟token1] [虚拟token2] [虚拟token3] 总结下面文章: xxxx

模型参数完全冻结。

优点:

非常省。

缺点:

能力通常弱于 LoRA。


7. Adapter Tuning

比 LoRA 更早。

思想:

在 Transformer 中插入小模块:

Transformer Layer Attention ↓ Adapter ↓ FFN

训练:

Adapter。

冻结:

原模型。

LoRA 可以看作:

一种更数学化、更轻量的 Adapter。


8. ReFT:不改参数,改“神经表示”

这是一个比较新的研究方向。

论文:

Representation Finetuning (ReFT, 2024)

LoRA:

修改:

权重。

ReFT:

修改:

隐藏状态(representation)。

简单说:

LLM内部:

输入 ↓ 隐藏表示 ↓ 输出

ReFT:

直接干预:

隐藏表示空间

类似:

不改变大脑结构,

而改变思维状态。

研究者认为:

有时候改变 representation 比改变 weight 更有效。(维基百科)


9. Mixture-of-Adapters(多个 LoRA 组合)

未来企业场景很重要。

例如:

一个基础模型:

Qwen-72B

多个 LoRA:

医疗LoRA 金融LoRA 法律LoRA 客服LoRA

运行时:

动态组合:

用户问题 ↓ 选择adapter ↓ 回答

类似:

给一个通用大脑加载不同技能包。


10. 最新趋势:从“微调参数”到“学习能力模块”

目前研究方向正在变化:

以前:

怎样更少参数地改变模型?

现在:

怎样让模型获得新能力?

所以出现:

Skill Adapter

学习:

  • 编程能力
  • 推理能力
  • 工具使用能力

Agent Adapter

让模型学:

  • 规划
  • 调用工具
  • 长任务执行

Continual Learning Adapter

让模型:

持续学习新知识。


总体技术路线图

可以这样看:

Full Fine-tuning | ↓ Parameter Efficient Fine Tuning | | ----------------------- | | | LoRA Adapter Prompt | | --------------------------- | | | | QLoRA DoRA AdaLoRA LoHa | | 低成本大模型定制 未来: Representation Tuning + Agent Adapter + Continual Learning

如果从研究价值排序(2025左右)

方向研究热度原因
QLoRA★★★★★已经成为开源微调主流
DoRA★★★★提升LoRA性能
Adaptive LoRA★★★★自动优化参数
Representation Fine-tuning (ReFT)★★★★探索新范式
Agent Adapter★★★★★面向未来AI Agent
Continual Learning★★★★★解决长期学习
Prompt/Prefix tuning★★★成熟但性能有限

一句话总结:

LoRA之后的研究核心不是简单“减少训练参数”,而是探索如何用最小的改变,让一个基础模型获得新的能力。未来方向会从“参数微调(weight tuning)”逐渐走向“能力模块化(skill adaptation)和持续学习(continual adaptation)”。

如果从博士研究方向角度看,目前最值得关注的是Agent + PEFT、Reasoning能力注入、Continual Learning、Representation Fine-tuning这几个交叉方向。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/24 21:46:59

2400套8N8工作流模板合集:一键导入、场景拆解与实战避坑指南

做自动化这几年,我最大的感受是:大部分时间不是花在“跑流程”上,而是花在“搭流程”上。所以当我第一次整理完这2400套8N8工作流模板时,第一反应不是“好多模板”,而是“终于不用从零写节点了”。这份合集覆盖了AI、自…

作者头像 李华
网站建设 2026/9/24 21:46:56

110MB/s下载速度如何实现?从千兆宽带到多线程加速全解析

先说说这个标题本身。下载速度110MB/s,这个数一出来其实就把大部分家用宽带的底牌给露了——你家里如果是百兆宽带,理论极限也就12MB/s左右,能跑到110MB/s,说明你背后至少是一条千兆级的接入线路,而且还得是下载源本身…

作者头像 李华
网站建设 2026/9/24 21:46:30

HTTP 403错误深度解析:从权限本质到四层排查实战

1. 这不是“服务器拒绝你”,而是它在说“我认不出你是谁”——403错误的本质还原HTTP 403 Forbidden,这个状态码在开发者日常里出现频率高得让人麻木:curl命令返回一片红字、前端控制台刷出“failed to load resource”,CI/CD流水…

作者头像 李华
网站建设 2026/9/24 21:46:18

LensGPT大模型实战:从自然语言到光学初始结构设计

光学设计终于开始被AI接手了:LensGPT大模型发布!(附链接与实操教程)光学设计这个圈子,过去几年听过太多"AI要颠覆传统光学"的论调,但绝大多数停留在概念验证或论文里,真正能上手生成一套像样初始…

作者头像 李华
网站建设 2026/9/24 21:46:13

reposync+httpd搭建Rocky 9局域网Yum源及自动化更新指南

简介:在内网环境中,服务器无法访问互联网时,如何高效安装和更新软件是一大难题。这份基于Rocky Linux 9.2的实战文档,专门面向Linux运维工程师及内网服务器管理人员,演示了通过HTTP服务构建局域网YUM源的完整流程。资源…

作者头像 李华
网站建设 2026/9/24 21:46:06

C语言查找算法对比:顺序、二分、哈希与二叉搜索树选型指南

顺序查找、二分查找、哈希查找,这几个词在C语言学习里出现的频率,差不多和printf("hello world")一样高。但说句实话,很多人学完这些算法,能在考试里算出时间复杂度,却在真正写代码时不知道该用哪个。更常见…

作者头像 李华