本文作者从实际工作需求出发,介绍了如何通过解决具体问题逐步学习大模型技术。从知识库项目需求出发,逐步深入文本嵌入、向量检索、接口设计等关键技术,并分享了在项目实践中如何根据需求调整技术方案。文章强调,学习大模型不必遵循固定路线图,应从实际需求出发,沿着问题逐步深入,边实践边学习,从而更高效地掌握大模型应用技能。
面对大模型很长的学习清单,先学什么并不容易判断。
我的路径不是从一张完整路线图开始的,而是从一个真实需求开始的。
当时,我主要负责大数据、报表、运维和新技术预研。工作中出现了一个智能客服需求,因为我会 Python,也愿意接触新东西,便开始去了解当时开源不久的 LangChain。
这个需求并不难理解。
有些问题其实很常见,但使用者不知道该去哪里找答案,只能联系对应的人。对方不在,或者正在忙,回复就没那么及时。一些简单的技术问题和新人常问的信息,也会反复占用熟悉情况的同事的时间。
我们想做一个知识库,让这些答案相对固定的问题,可以先通过对话自己查询。
这篇文章不提供一套标准学习路线。我更想写清楚:一个知识库项目怎样不断提出新问题,我又怎样沿着这些问题,补上文本嵌入、向量检索、接口和智能体相关的知识。
这种方式不能代替系统学习,但它能帮助人判断,此刻最需要先学什么。
先跑通,再理解每个环节
那时的 LangChain 组件很多,又支持链式调用。模型、提示词、知识库和不同的处理步骤,可以比较快地串在一起。
对于刚接触大模型应用的人来说,这一点很友好。即使不清楚每个环节内部是怎么实现的,也能先搭出一个可以对话的 Chatbot。
但知识库要真正回答问题,还需要完成一条更具体的链路。
先读取文档,把文本切成合适的片段,再通过文本嵌入模型转换成向量。用户提问时,同样把问题转换成向量,从知识库中找出语义上更接近的内容,最后交给大模型组织答案。
为了把这条链路跑起来,我开始了解文本嵌入、语义相似度和向量检索,也接触了余弦相似度、欧氏距离这些以前很少用到的概念。
最开始,我使用 FAISS 保存向量索引,并把它持久化到本地文件系统。我还自己部署过 Hugging Face 上的中文文本嵌入模型,用真实文档去看检索出来的内容是否符合预期。
文本也不能随便切。
切得太长,可能超过模型能够处理的范围,检索出来的内容也不够聚焦;切得太碎,上下文又容易断开。怎么保留语义完整,怎么让问题更容易找到对应的片段,都是在实际使用中才逐渐遇到的问题。
真正的问题,往往在跑起来以后出现
这个知识库后来上线了,也有真实用户在使用。
一些常见的内部信息和技术问题,可以更快拿到结果。使用者不用每次都去找对应的人,也不用因为对方暂时没空,只能把一个简单的问题先放在那里等。
但系统开始使用以后,我发现最初的向量化方式并不适合持续更新。
一开始,程序会读取所有文件,一次性完成切分、向量化和存储。文件少的时候还没有太大问题。文件逐渐多起来以后,只要其中一个文件追加或修改了内容,重新处理整个知识库就会花费不少时间。
一个文件发生变化,却要把全部文件再向量化一遍,这显然不太合适。
我开始去看 LangChain 组件内部是怎么处理数据的,再根据自己的需求做改造。
后来,我把更新粒度缩小到了单个文件。每一份源文件对应一个本地向量索引。文件追加内容时,只处理新增部分,再和原来的索引合并;文件内容发生更新时,也只重新向量化这一份文件,覆盖它对应的索引,不再重建整个知识库。
同时,我也开始按知识类型整理文件,尽量不让一份文件混进太多不相干的内容。
这套方法不是适合所有场景的标准答案。索引文件变多以后,查询和管理也会有新的成本。但在当时的使用范围里,它解决了文件更新就要全库重建的问题。
这次改造让我第一次意识到,项目跑通只是起点。真正的学习,往往发生在系统开始使用、原来的封装不再适合当前需求之后。
沿着问题,补上真正需要的知识
回头看,我学到的很多东西,都不是按照一张预先设计好的路线图完成的。
因为要做 RAG,我去了解文本嵌入、向量检索和文本切分;因为要把能力提供给其他系统使用,我学习了 FastAPI;因为模型调用的大部分时间是在等待网络返回,我也开始理解异步接口更适合什么场景。
因为还要接入企业聊天工具,我又去了解机器人和定制卡片。
这些知识有的进入了方案设计,有的直接写进了代码。做到哪里,我就补到哪里。
那段时间,我也补了一些模型调用和提示词相关的基础概念,并简单了解过 Fine-tuning。但我没有继续深入,因为我的工作重点一直在应用层,眼前更需要解决的是检索、接口、数据流和系统落地,而不是训练模型。
这种学习方式的好处是,学到的东西很快就有地方使用。它的缺点也很明显:知识容易是零散的。一个概念反复遇到以后,我还是需要回过头补基础,把之前靠项目串起来的知识重新整理一遍。
工具会变,选择顺序不必跟着变
再往后,场景变了,存储和检索方式也跟着变。做大数据分析时,已有系统使用 StarRocks,我便复用它的相似度计算能力。后来做智能体,需要处理长期记忆的向量化检索,我又使用了 PostgreSQL。
它们不是 FAISS 的简单升级版,也不是谁替代了谁。场景、已有系统和需要解决的问题不同,选择自然也会变化。
后来接触的智能体框架和编程工具越来越多,但接触过不等于真正掌握,更不等于都值得马上投入。
真实需求仍然是我判断学习优先级最重要的依据。
最后学会的,不只是某个框架
最早的知识库,核心还是用户提出问题,系统检索资料,再给出回答。
后来做智能体,我开始面对更复杂的事情:一个目标应该拆成哪些步骤,模型什么时候调用什么工具,执行过程中的状态怎么保存,失败以后怎么继续,以及哪些信息值得进入长期记忆。
我希望智能体在持续使用中能保留必要的上下文,慢慢变得更懂使用者。但“越用越懂你”并不意味着记得越多越好。记什么、什么时候取出来、能不能修改和删除,以及如何保护隐私,都是设计记忆时必须一起考虑的问题。
对我来说,真正从大数据开发走到大模型应用开发的标志,不是学完了哪门课程,也不是记住了多少框架名称。
而是我开始能够独立拆解任务、设计工具,并把状态、记忆和执行过程组合成一个可以工作的智能体。
现在回头看,我确实没有系统地学过一遍大模型,再开始做项目。是第一个真实需求先把我带了进去,后面的路,才随着一个个问题慢慢展开。
这不意味着基础不重要,也不意味着所有人都应该靠项目入门。项目真正提供的,是一组足够具体的问题:它会告诉你现在缺什么、应该先补什么,以及哪些内容可以晚一点再学。
这未必适合所有人。但如果一张完整路线图让你迟迟不知道从哪里开始,一个具体问题至少能帮你确定第一步。
最后
如果说程序员已经是高薪职业,那么干AI的程序员,就是高薪中的高薪。
现在的市场,已经用数据给程序员指明了方向:学AI大模型,就是冲刺高薪的最优解!
看着身边越来越多的同行转型大模型、拿到高薪offer,很多人心里都动了心,但真正的难题来了:零基础小白不知道从哪入门?有基础的程序员找不到系统学习路径?实战项目练手无门?面试不知道考什么?
别慌!今天就给大家整理了一份【2026年最新版】AI大模型免费学习资源包,覆盖从入门到实战、从理论到面试、从基础到进阶的全流程,所有资料均已整理归档,无冗余、无套路,免费分享给每一位想抓住AI风口的程序员和小白!
👇👇扫码免费领取全部内容👇👇
1、大模型系统化学习路线
2、大模型学习书籍&文档
3、AI大模型最新行业报告
4、大模型项目实战&配套源码
5、大模型大厂面试真题
四阶段精细化学习规划(附时间节点,可直接照做)
结合上述资源,给大家整理了一份可直接落地的四阶段学习规划,总时长约2个月,小白可循序渐进,程序员可根据自身基础调整节奏,高效掌握大模型核心能力,快速实现从“入门”到“能落地、能面试”的跨越。
第一阶段(10天):初阶应用
该阶段让大家对大模型 AI有一个最前沿的认识,对大模型 AI 的理解超过 95% 的人,可以在相关讨论时发表高级、不跟风、又接地气的见解,别人只会和 AI 聊天,而你能调教 AI,并能用代码将大模型和业务衔接。
- 大模型 AI 能干什么?
- 大模型是怎样获得「智能」的?
- 用好 AI 的核心心法
- 大模型应用业务架构
- 大模型应用技术架构
- 代码示例:向 GPT-3.5 灌入新知识
- 提示工程的意义和核心思想
- Prompt 典型构成
- 指令调优方法论
- 思维链和思维树
- Prompt 攻击和防范
- …
第二阶段(30天):高阶应用
该阶段我们正式进入大模型 AI 进阶实战学习,学会构造私有知识库,扩展 AI 的能力。快速开发一个完整的基于 agent 对话机器人。掌握功能最强的大模型开发框架,抓住最新的技术进展,适合 Python 和 JavaScript 程序员。
- 为什么要做 RAG
- 搭建一个简单的 ChatPDF
- 检索的基础概念
- 什么是向量表示(Embeddings)
- 向量数据库与向量检索
- 基于向量检索的 RAG
- 搭建 RAG 系统的扩展知识
- 混合检索与 RAG-Fusion 简介
- 向量模型本地部署
- …
第三阶段(30天):模型训练
恭喜你,如果学到这里,你基本可以找到一份大模型 AI相关的工作,自己也能训练 GPT 了!通过微调,训练自己的垂直大模型,能独立训练开源多模态大模型,掌握更多技术方案。
到此为止,大概2个月的时间。你已经成为了一名“AI小子”。那么你还想往下探索吗?
- 为什么要做 RAG
- 什么是模型
- 什么是模型训练
- 求解器 & 损失函数简介
- 小实验2:手写一个简单的神经网络并训练它
- 什么是训练/预训练/微调/轻量化微调
- Transformer结构简介
- 轻量化微调
- 实验数据集的构建
- …
第四阶段(20天):商业闭环
对全球大模型从性能、吞吐量、成本等方面有一定的认知,可以在云端和本地等多种环境下部署大模型,找到适合自己的项目/创业方向,做一名被 AI 武装的产品经理。
- 硬件选型
- 带你了解全球大模型
- 使用国产大模型服务
- 搭建 OpenAI 代理
- 热身:基于阿里云 PAI 部署 Stable Diffusion
- 在本地计算机运行大模型
- 大模型的私有化部署
- 基于 vLLM 部署大模型
- 案例:如何优雅地在阿里云私有部署开源大模型
- 部署一套开源 LLM 项目
- 内容安全
- 互联网信息服务算法备案
- …
👇👇扫码免费领取全部内容👇👇
6、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
这份完整版的大模型 AI 学习资料已经上传CSDN,朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】