news 2026/9/10 19:24:16

【收藏必备】从零开始学大模型:LLM核心概念与实现详解

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
【收藏必备】从零开始学大模型:LLM核心概念与实现详解

基础概念/名词

LLM是啥

他是一种基于大规模参数和大规模语料训练得到的语言建模系统,它通过对 token 序列进行条件概率建模,来理解、续写或生成文本 , 通常采用Transformer架构

LLM训练全景图

预训练阶段是 LLM 训练的第一阶段,目标是让模型学习语言的基本规律和世界知识。这个阶段使用海量的文本数据(通常是数 TB 级别),通过自监督学习的方式训练模型。最常见的预训练任务是因果语言建模(Causal Language Modeling),也称为下一个词预测(Next Token Prediction), 预训练阶段的特点是数据量巨大、计算成本高、学到的是通用的语言理解和生成能力、采用无监督学习

后训练阶段则是要解决预训练模型的不足。预训练后的模型虽然具备了强大的语言能力,但它只是一个"预测下一个词"的模型,并不知道如何遵循人类的指令、生成有帮助无害诚实的回答、拒绝不当的请求,以及以对话的方式与人交互。后训练阶段就是要解决这些问题,让模型对齐人类的偏好和价值观

大概的生成流程

用户输入构成 prompt,并与历史对话共同形成 context。文本经过 tokenization 转为 token 序列,再通过 embedding 与位置信息编码成向量表示,送入多层 Transformer。模型通过 masked self-attention、MLP、残差连接和层归一化逐层计算 hidden states,最终输出词表上的 logits,经 softmax 得到下一 token 的概率分布,再通过 decoding 策略选出实际 token。该 token 被追加回上下文,模型以自回归方式重复这一过程,直到输出 EOS 或达到长度限制

Prompt:送给模型的输入文本 Contex:当前可参考的全部前文 Tokenization:把文本切成 token Token:模型处理的最小离散文本单位 Vocabulary:所有可识别 token 的集合(每个token对应哪个ID) Embedding:把 token 变成向量 Positional Encoding:告诉模型顺序(位置信息) Transformer:核心计算架构 Self-Attention:决定该关注上下文哪里 Logits:对下一个 token 的原始打分 Softmax:把打分变成概率 Decoding:从概率里选出实际输出

文本生成

从前面的学习,我们可以知道

现代大语言模型的基础是 2017 年由 Google 提出的 Transformer 架构。这一架构从根本上改变了自然语言处理的方式,使得模型能够高效地处理长序列文本。

Transformer 的核心创新是自注意力机制(Self-Attention),它允许模型在处理每个词元时,同时“关注”序列中的所有其他词元,从而捕捉长距离的语义依赖关系

(有些地方我认为不是很恰当,比如说"加&规范化"我觉得翻译成"残差+归一化"好一点)

现在的大语言模型大多采用自回归(Autoregressive)方式生成文本,即 逐个预测下一个 Token,每次预测都基于之前所有的 Token , 简言之,模型将生成整个序列的概率分解为:每个 Token 出现的概率,条件是之前所有 Token 都已知。

这意味着:

模型需要“记住”之前的所有内容才能正确预测下一个 Token

序列越长,需要维护的“记忆”就越多

这种记忆就体现在上下文窗口中

transformer

首先就是 inputs

这里的输入信息是通过Vocabulary把token转成ID,然后通过 Input Embedding 模块把他映射成一个高维向量,然后加上 Positional Encoding 给他位置编码的信息,然后传入多头注意力层进行处理,对结果 残差+归一化,然后 前馈网络 ,再次 残差+归一化

位子编码+嵌入层

词向量就是把一个单词映射成很多个维度,这些维度就是这个单词在计算机中的“词义”,位置编码就是这个单词在这个句子中的位置,然后位置编码把位置信息也映射为向量,这两个相加的结果就包含了两个信息:一个就是多维度的“词义”,另外一个就是这个单词在这个句子中的位置

多头注意力每个词的最终向量(词义+位置)被同时送到“多头注意力”模块在内部,每个词会生成三个向量:

Query(查询):我想找什么? Key(键):我代表什么?别人会不会找我? Value(值):如果别人找到我,我能提供什么信息?

这三个向量都是从原始输入向量通过线性变换得来的(简单说就是乘个矩阵)

计算注意力分数:

每个词的 Query 会跟所有词的 Key 做点积(类似“匹配度”)

得到一个分数矩阵,比如“我”对“喜欢”的关注度是 0.8,“我”对“猫”的关注度是 0.3,然后用 softmax 归一化,变成概率分布

加权求和 Value:

根据上面的分数,对所有词的 Value 做加权平均

比如“我”这个词,最终输出 = 0.8 × “喜欢”的Value + 0.3 × “猫”的Value + 0.1 × “我”的Value…

多头并行:

上面的过程不是只做一次,而是并行做8次、12次甚至更多次(这就是“多头”)

每个头可能关注不同的关系

最后把所有头的结果拼起来或加权平均,得到最终输出

当然,这里“乘个矩阵” 中这个矩阵可以算是随机的(当然他肯定有一系列算法让这个“随机”高质量)然后就还是那一套,正反传递,残差,梯度回归让这个矩阵变成我们需要的样子

前馈网络

所以逐位前馈可以理解为对单个单词进行放缩,就是对单个次的词向量升维,用更多的激活函数,非线性变换让他的特征提取,增强,然后再全连接回到初始维度,可以理解为是一个对于单词特征的“数据增强”

然后就是output的部分

他这里是用了一个掩蔽多头注意力(Masked Multi-Head Attention),他有一个"掩码矩阵"(causal mask),它的作用只有一个:让当前位置只能看自己和前面的 token,不能看后面的 token

标准 attention 先算这个分数矩阵:

Q 是 query K 是 key S 是每个位置对其他位置的原始注意力打分

然后会把 mask 加进去:

这里的 Mask 往往不是上面那个 矩阵直接用,而是:

可见位置加 0

不可见位置加 −∞ 或非常大的负数

比如长度 4 时,可以写成:

这样做softmax的时候他的权重就成0了

这里, Q 来自 decoder 当前隐藏状态,而 K、V 来自 encoder 输出

attention 的逻辑是:

Q 表示当前查询需求

K 表示被查询对象的索引标签

V 表示被查询对象携带的内容

也就是说, decoder 问问题,encoder 提供答案线索

Linear——全连接层:把“语义表示空间”映射到“词表候选空间” ,然后再一个softmax搞成概率分布

Prompt是什么

在真实系统里,模型看到的往往不止用户那一条输入,而是类似这样一整段东西:

系统规则 历史对话 你当前这一句 可能还有工具返回结果 输出格式要求

这些拼在一起,才是模型真正接收到的完整 prompt。

也就是说:

Prompt = 当前生成时送进模型的完整上下文表达

Contest是什么

模型当前生成时可见、可用的上下文信息 , 很多时候,prompt 会成为 context 的一部分

他更相当于是模型的当前信息环境

token是什么

Token是大语言模型处理文本的基本单位。模型不直接处理字符或单词,而是将文本先转换为 Token 序列,再进行处理

┌────────────────────────────────────────────────┐ │ 1. 原始文本 │ "Hello, I'm Qwen3.5!" │ ↓ │ 2. 预分词(Pre-tokenization) │ 按规则初步切分:["Hello", ",", "I", "'m", ...] │ ↓ │ 3. 应用分词算法(如 BPE) │ 合并高频片段:"Hello" → [Hello], "I'm" → [I, 'm] │ ↓ │ 4. 查词汇表 → Token IDs │ [15496, 11, 314, 716, 2872, 13, 128002] │ ↓ │ 5. 输入模型(Embedding + Transformer) └────────────────────────────────────────────────┘

预分词就是按照常见规则来分开,应用分词算法就是 统计训练语料中相邻符号对的频率 把最高频的符号对合并成一个新token,加入词表,可以理解为根据统计相关性,找附近词某些词的组合,比如each和other,分词后就把each other作为一个新token加入词表

Embedding 是什么

虽然通过Vocabulary把token转成ID了,但是还是不能直接输入到模型,他会把 每个 token ID 会被映射成一个高维向量,比如几千维的一串浮点数 ,这个才是模型内部可以计算的东西

微调权重是什么

大模型本质上是一个巨大的数学函数,里面有海量参数。这些参数就叫weights(权重)

"微调"就是在一个已经训练好的基础模型上,再拿特定数据继续训练一段,让它更适应某个任务或风格

蒸馏是什么

蒸馏就是:让一个小模型学一个大模型的本事。

更准确一点说,叫知识蒸馏

也就是说是用强模型生成大量高质量回答,再拿这些回答去训练小模型

小模型学会更像强模型那样回答问题

量化是什么

量化就是:把模型里的数字,用更省空间的方式来存和算。

大模型的权重本来通常是高精度数字,比如:

FP32:32 位浮点数 FP16 / BF16:16 位浮点数

而“量化”会把它们改成更低精度的表示,比如:

INT8 INT4

甚至更低

这样做的目的很直接:省显存、省内存、跑得更快、部署更容易

剪枝是什么

把模型里不太重要的部分删掉,比如说是权重剪枝,神经元 / 通道剪枝,注意力头剪枝

RAG是什么

全称是Retrieval-Augmented Generation,中文常叫检索增强生成

拆开看:

Retrieval= 检索

Augmented= 增强

Generation= 生成

意思就是:先从外部资料里找相关内容,再把这些内容喂给大模型,让它基于这些资料生成答案

大体的流程

程主要分为两大核心环节。在数据准备阶段,系统通过数据提取、文本分割和向量化,将外部知识构建成一个可检索的数据库。随后在应用阶段,系统会响应用户的提问,从数据库中检索相关信息,将其注入Prompt,并最终驱动大语言模型生成答案

MCP是什么

众所周知,到了现在的多agent时代,我们的模型需要大量调用各种工具,不而管是数据库、浏览器、Google Drive、Figma,还是API,只要都按 MCP 这套标准暴露出来,agent 就能用比较统一的方式去连、去读、去调用

官方也是这么定义的:MCP 是一个开放协议/开放规范,用来把大模型客户端连接到外部工具和资源 (实际上就是一个接口)

涌现是什么

指的是模型在规模(参数量、训练数据量、计算量)扩大到一定阈值后,突然出现一些在较小模型中几乎不存在或性能接近随机水平的新能力。这些能力无法通过简单线性外推小模型的表现来预测,呈现出“量变引发质变”的特点。

Workflow是什么

workflow即为工作流, 是一种传统的自动化范式,其核心是对一系列任务或步骤进行预先定义的、结构化的编排。它本质上是一个精确的、静态的流程图,规定了在何种条件下、以何种顺序执行哪些操作

agent是什么

基于大型语言模型的智能体是一个具备自主性的、以目标为导向的系统。它不仅仅是执行预设指令,而是能够在一定程度上理解环境、进行推理、制定计划,并动态地采取行动以达成最终目标。LLM 在其中扮演着“大脑”的角色

最后唠两句

为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选

很简单,这些岗位缺人且高薪

智联招聘的最新数据给出了最直观的印证:2025年2月,AI领域求职人数同比增幅突破200% ,远超其他行业平均水平;整个人工智能行业的求职增速达到33.4%,位居各行业榜首,其中人工智能工程师岗位的求职热度更是飙升69.6%。

AI产业的快速扩张,也让人才供需矛盾愈发突出。麦肯锡报告明确预测,到2030年中国AI专业人才需求将达600万人,人才缺口可能高达400万人,这一缺口不仅存在于核心技术领域,更蔓延至产业应用的各个环节。

那0基础普通人如何学习大模型 ?

深耕科技一线十二载,亲历技术浪潮变迁。我见证那些率先拥抱AI的同行,如何建立起效率与薪资的代际优势。如今,我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理,分享于此,为你扫清学习困惑,共赴AI时代新程。

我整理出这套 AI 大模型突围资料包【允许白嫖】:

这份完整版的大模型 AI 学习和面试资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】

①从入门到精通的全套视频教程

包含提示词工程、RAG、Agent等技术点

② AI大模型学习路线图(0基础到项目实战仅需90天)

全过程AI大模型学习路线

③学习电子书籍和技术文档

市面上的大模型书籍确实太多了,这些是我精选出来的

④各大厂大模型面试题目详解

⑤640套AI大模型报告合集

⑥大模型入门实战训练

如果说你是以下人群中的其中一类,都可以来智泊AI学习人工智能,找到高薪工作,一次小小的“投资”换来的是终身受益!

应届毕业生‌:无工作经验但想要系统学习AI大模型技术,期待通过实战项目掌握核心技术。

零基础转型‌:非技术背景但关注AI应用场景,计划通过低代码工具实现“AI+行业”跨界‌。

业务赋能 ‌突破瓶颈:传统开发者(Java/前端等)学习Transformer架构与LangChain框架,向AI全栈工程师转型‌。

👉获取方式:
有需要的小伙伴,可以保存图片到wx扫描二v码免费领取【保证100%免费】🆓

本文转载,如有侵权,请联系删除。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/10 19:20:59

虚拟业务事实网络:指标平台多表关联难题的NoETL解决方案

1. 指标平台选型的核心痛点与挑战在数据驱动的商业环境中,指标平台已成为企业数据架构的核心组件。传统指标平台面临的最大挑战之一,就是处理复杂的数据关联关系。当企业数据规模增长到数百甚至上千张表时,表与表之间的关联关系会呈现指数级增…

作者头像 李华
网站建设 2026/9/10 19:20:13

C++编译链接全解析:从源文件到可执行程序的完整链路

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华