news 2026/9/4 3:10:17

开源大模型本地部署实战:从Ollama到Dify的企业落地指南

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
开源大模型本地部署实战:从Ollama到Dify的企业落地指南

软件开发中最令人头痛的事情,大多不是“功能实现不了”,而是“功能实现了,却不敢交付”。最近半年,开源大模型的迭代速度明显加快,多模态能力、长文本理解、推理能力都在持续刷新上限。与此同时,越来越多的技术团队开始把话题从“接哪个大模型 API”转向“如何在企业内部自己部署一套大模型服务”。

这篇文章不准备只评价“开源好还是闭源好”,而是从企业落地角度,聊聊开源大模型本地部署背后的信任、掌控与优化问题。你会看到本地化部署的真实动机、环境选型思路、基于 Ollama 的快速部署方案、基于 Dify 的完整应用平台搭建方式,以及进入生产环境前必须考虑的硬件、量化、权限和稳定性因素。

如果你所在团队正在评估要不要做本地部署,或者已经决定落地但还没有完整方案,这篇内容可以作为一份可执行的路由参考。

1. 算力认知转向:大模型从“服务”变成“基础设施”

1.1 业务场景里的大模型,不再只是“接口”

早几年说起调用大模型,大家默认的路径是注册云厂商的大模型服务,获取 API Key,然后在代码里发 HTTP 请求。这种做法开发效率确实高,模型能力持续在线,不用关心底层硬件和运维。

但在真实业务推进中,几个问题会反复出现:

第一个是数据合规。企业内部知识库、财务单据、用户日志、客服会话等数据,只要通过公网 API 发送,就要经过第三方系统。即使厂商承诺数据不落库,也很难在合规审计中给出完整解释。

第二个是依赖风险。API 服务版本会调整,模型会动态升级,可能你今天测试通过的效果,下周再调用就产生了差异。对于生产系统来说,这是不可控因素。

第三个是长期成本。按 Token 计费在小流量阶段看不出来,一旦业务流程中大量使用大模型,费用会成倍增长。比如企业文档问答,每次会话都要上传若干文档片段并请求生成,业务量上来后费用曲线非常陡峭。

所以,当模型能力不再是稀缺资源时,企业自然会思考:能不能把模型放到自己的服务器上,让数据不出内网,让费用变成一次性的算力投入?

1.2 “开源大模型 + 本地部署”解决了什么问题

所谓本地部署,就是把大模型的权重文件和推理引擎安装在自己的服务器或私有云环境中,通过内网 API 对外提供服务。当然,并非所有模型都支持本地部署,这里的关键前提是开源,或者至少开放权重。

  • 开源大模型意味着代码、权重或推理方案是对外开放的,企业不用被某个平台绑定。
  • 本地部署意味着模型在自有的计算资源上运行,数据流不离开安全边界。

近年来,Qwen(千问)、DeepSeek、ChatGLM/GLM、LLaMA、Mistral 等开源大模型相继出现。其中,以 Qwen 和 DeepSeek 为代表的中文开源模型,在文本理解、代码生成、数学推理等任务上的表现不断接近同代闭源模型,社区生态也越来越完善,已经具备直接作为业务基座的条件。

严格来说,开源模型和本地部署是两件事,但在企业语境里它们经常一起出现。有一个可下载的模型权重,加上可控的推理运行环境,就能在企业防火墙内形成一个自主可控的 AI 能力层。

1.3 适用场景边界

本地部署不是万能答案。从实际项目经验看,以下几类场景最适合优先落地:

  • 内部知识库问答,例如制度文档、产品手册、运维工单辅助检索。
  • 研发辅助工具,比如代码审查、SQL 生成、日志摘要、接口文档整理。
  • 客服辅助系统,人工坐席先用本地模型生成候选回复,再人工确认。
  • 数据敏感型数据处理,比如财务、医疗、人事等需要最小化数据外流的场景。
  • 高频低延迟调用,本地模型通过批处理和流式输出可以优化单次成本。

如果业务对数学推理、多语言创作、最新小知识的要求很高,而且数据不敏感、预算充足,闭源云 API 仍然是值得保留的选项。本地部署的目标并不是完全替代云服务,而是在关键数据链路中建立自己的主动权。

2. 企业级开源模型的选型视角:从“谁最强”到“谁能落地”

2.1 主流开源模型族

先梳理一下目前在企业环境里常见的开源大模型家族。以下内容是出于技术选型参考,实际模型版本迭代很快,建议以官方最新发布为准:

  • Qwen(千问)系列:阿里开源的中英文模型,覆盖 0.5B 到 72B 等不同量级,也有 Qwen2.5-VL 这样的视觉语言版本。中文任务表现稳定,社区资料丰富,是本地部署首选候选之一。
  • DeepSeek 系列:深度求索出品,DeepSeek-R1 在推理链和数学类任务上表现突出,带 Reasoner 的能力适合复杂逻辑分析,但显存和算力门槛相对更高。
  • ChatGLM/GLM 系列:清华系开源模型,中文理解有优势,早期版本轻量好部署,适合知识问答和对话类场景。
  • LLaMA 系列:Meta 开源,虽然原始训练语料中文占比不高,但通过社区微调和中文数据集补充后,很多团队也把它作为基础底座。
  • Mistral 系列:欧洲开源模型,英文能力出色,体积相对小,适合有法语、英语等多语言需求的团队。

2.2 选型时要看的五个维度

面对一个开源模型,不要只看评测榜单,要结合业务情况评估:

  • 参数量:7B、14B、32B、70B 不等。参数量越大,通常能力越强,但显存需求也越高。7B 左右的量化模型在消费级显卡或低配服务器上也能运行;70B 级模型则需要多卡并行。
  • 上下文长度:长文档场景必须关注模型支持的上下文窗口。Qwen2.5 系列在较新版本中支持 128K 以上上下文,但实际工程中要结合显存评估显式 KV Cache 开销。
  • 中文能力:如果业务以中文为主,优先看中文测试集和开源协议是否允许商业用途,不要只看英文评测数据。
  • 量化支持:模型是否能通过 GGUF、AWQ、GPTQ 等方式量化。同一模型在不同量化格式下的效果和显存占用差异很大。
  • 开源许可与合规:开源不代表免费商用,企业尤其要检查模型协议是否允许商业用途,例如部分模型要求月活用户超过一定规模时需要书面授权。

2.3 本地部署的黄金起步量级

多数企业的第一套本地模型起步于 7B 到 14B 参数量范围。这个区间的模型在单卡 A100/A800/H800、RTX 4090 或 A10 等 GPU 上可通过 4-bit 量化运行,部署成本和维护复杂度都相对可控。对于中小型团队,先用这个级别跑通流程,验证效果,再考虑是否升级到 32B 以上模型,是比较成熟的路径。

3. 本地部署需要掌握的几个核心概念

在动手之前,先把环境搭建中会频繁接触的术语解释清楚。理解这些概念能让你在看日志和调参数时不至于发蒙。

3.1 模型权重

模型权重是训练过程中学习到的参数文件,可以通俗理解为“模型的记忆”。开源模型发布时通常会公开权重,用户下载后配合推理引擎加载。常见的权重格式有 Hugging Face 使用的 safetensors,以及社区广泛使用的 GGUF 格式。

3.2 推理引擎

推理引擎负责把模型权重加载到内存/显存中,并对输入进行前向计算。常见的推理工具和框架包括:

  • Ollama:对个人开发者和中小企业最友好的工具,一条命令下载模型、一条命令启动服务。
  • llama.cpp:底层推理库,Ollama 底层方案之一,也支持直接命令运行 GGUF 模型。
  • vLLM:吞吐量优化型推理框架,适合生产环境中处理高并发请求。
  • LM Studio:带图形界面的本地运行工具,适合愿意先做图形化验证的开发者。

从学习路径上,推荐先通过 Ollama 把模型跑起来,再逐步了解 vLLM 等生产级框架。

3.3 量化

大模型的权重通常用 FP16(半精度浮点数)表示,每个参数占 2 字节。一个 7B 模型仅权重就约占 14GB 显存,一张 12GB 显存的显卡根本放不下。量化就是把模型参数的精度降低,比如从 FP16 变为 INT4,每个参数只占约 0.5 字节。量化后模型体积缩小、推理速度提升,但精度会有一定损耗。

常见的量化标签举例:

  • q4_K_M:4-bit 量化的一种,兼顾体积和效果,本地部署常用。
  • q5_K_M:比 q4 占用稍大,但生成质量通常更稳。
  • q8_0:8-bit 量化,显存占用高,效果最接近原版。

具体效果需要实测,不要只看标签。用不同的量化版本在相同测试集上跑一遍,对比输出质量再决定。

3.4 API 与 SDK 访问

本地部署完成后,推理服务一般会暴露一个兼容 OpenAI 风格的 HTTP API。也就是说,你原来用openaiPython SDK 写的大模型调用代码,只需把base_url改成内网地址,就能切换到本地模型。这种兼容性大大降低了迁移成本,也是本地部署容易落地的原因之一。

4. 快速搭建第一套本地模型服务:Ollama 完整上手

4.1 为什么第一步推荐 Ollama

Ollama 是目前把“下载模型、启动服务、提供 API”打包得最完整的工具。它支持 macOS、Linux、Windows,也支持通过 Docker 方式运行。对新手来说,不需要自己下载模型文件、不需要手动配置 Python 环境、不需要理解推理引擎参数,三条命令就能把模型服务跑起来。

当然,Ollama 的控制器主要面向中小规模和开发调试场景。如果后续要承接日均几十万次调用,或者严格的并发性能要求,可以再引入 vLLM 或 Triton 方案。

4.2 安装 Ollama

在 Linux 服务器上安装非常简单,执行官方安装脚本,也可以去 Ollama 官网手动下载安装包。

curl -fsSL https://ollama.com/install.sh | sh

安装完成后查看版本:

ollama --version

在 Windows 和 macOS 环境,直接下载安装包安装即可。安装完成后在终端执行ollama --version确认成功。

4.3 下载并运行一个开源模型

以目前很受国内团队欢迎的 Qwen2.5 系列为例。Qwen2.5 是一个开源的中文能力优秀的大语言模型。在 Ollama 中运行以下命令下载 7B 版本:

ollama pull qwen2.5:7b

该命令会从模型仓库下载量化后的 GGUF 模型,下载时间取决于模型大小和网络带宽。7B 4-bit 量化模型体积通常在 4.7GB 左右。

运行模型:

ollama run qwen2.5:7b

等待片刻,你会看到交互式对话界面。在提示符中输入问题,模型会流式返回回复。退出对话输入/bye

4.4 将模型封装为 HTTP 服务

Ollama 默认在安装后启动一个 HTTP 服务,默认端口是 11434。如果命令执行后没有启动服务,可以手动执行ollama serve

在另一个终端运行:

curl http://localhost:11434/api/generate -d '{ "model": "qwen2.5:7b", "prompt": "用一句话介绍本地部署大模型的优势", "stream": false }'

返回结果中会包含response字段,就是模型生成的文本。这个接口也可以按流式方式返回,只需将stream设为true

生产调用更推荐使用 OpenAI 兼容接口:

curl http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" \ -d '{ "model": "qwen2.5:7b", "messages": [ {"role": "user", "content": "用 Python 写一个快速排序函数"} ], "stream": false }'

也就是说,你的 Python/Java/Node.js 代码可以直接把base_url指向http://localhost:11434/v1,无需改造原有调用逻辑。如果你之前用过 OpenAI SDK,代码可以这样写:

from openai import OpenAI client = OpenAI( base_url="http://localhost:11434/v1", api_key="ollama" # 本地服务不校验 key,但字段不能省略 ) resp = client.chat.completions.create( model="qwen2.5:7b", messages=[{"role": "user", "content": "写一个快速排序函数"}], stream=False ) print(resp.choices[0].message.content)

这里api_key可以随意填写,本地 Ollama 不会校验,但为了兼容 SDK 结构需要保留该参数。把base_url换掉,一套代码就能在云 API 和本地服务之间灵活切换。

4.5 常见 Ollama 管理操作

查看本地已下载的模型列表:

ollama list

删除不再使用的模型:

ollama rm qwen2.5:7b

查看模型详细信息:

ollama show qwen2.5:7b

当同一个模型在对话中需要固定参数时,也可以创建带配置的模型文件(Modelfile),例如设置温度:

# Modelfile FROM qwen2.5:7b PARAMETER temperature 0.3

然后通过ollama create my-assistant -f ./Modelfile创建自定义模型实例。这样可以对不同业务场景做差异化的推理参数管理。

5. 从“有模型”到“有应用”:基于 Dify 搭建本地 AI 平台

单有模型 API 还不够。企业级的 AI 应用通常需要把模型、知识库、工作流、权限管理这些能力组合起来。Dify 是开源 LLMOps 平台,目标就是让技术团队在一个可视化的界面中完成这些编排工作。结合本地 Ollama 模型,你可以快速搭建一个企业内部的智能问答应用。

5.1 部署方式

Dify 通常通过 Docker Compose 部署。官方发布包含多个服务的 compose 文件,包含 API server、web 前端、worker、数据库、向量索引组件等。起步时直接按官方模板开启 Docker Compose。

一个典型流程如下:

第一,确保服务器已安装 Docker 和 Docker Compose:

docker --version docker compose version

第二,克隆 Dify 源码仓库并在指定目录启动:

git clone https://github.com/langgenius/dify.git cd dify/docker cp .env.example .env docker compose up -d

这个过程会拉取 Dify 所需的容器镜像。启动完成后,通过服务器 IP 的 80 端口访问 Dify Web 控制台。首次访问需要设置管理员账号。

实际使用时,需要保证数据目录有持久化挂载。在docker-compose.yaml中,volumes配置已经把数据库、存储等关键数据目录映射到宿主机,因此升级 Dify 或重启容器时不会丢数据。

5.2 关联 Ollama 模型

进入 Dify 控制台后,选择“设置 → 模型供应商 → Ollama”,在配置界面填写 Ollama 服务地址。

  • API 地址:http://<你的 Ollama 服务器 IP>:11434
  • 模型类型:选择“LLM”
  • 模型名称:填写在 Ollama 中下载的模型名称,如qwen2.5:7b

配置完成后,点击“测试”按钮,Dify 会调用本地模型返回可用性结果。这意味着以后在 Dify 里编排的每个应用,底层推理都发生在你的内网中。

5.3 配置企业知识库问答应用

在 Dify 中创建应用时选择“聊天助手”。然后在“提示词编排”页面,把 LLM 模型切换到刚才配置的本地 Qwen 模型。

如果需要接入企业知识库,需要先创建数据集:

  • 上传企业内部文档,支持 PDF、Word、Markdown、TXT 等。
  • 设置分段长度与索引方式。
  • 等待文档完成导入和向量化。

在提示词编排中,加入“知识库检索”节点,选择刚创建的数据集,设定召回数量。用户提问时,系统会先在本地向量库召回相关内容,再把这些内容作为上下文补充到提示词中,交由本地大模型生成回答。

通过这套链路,企业制度问答、产品文档查询、售后知识库等场景可以快速落地。整个调用链路由 Dify 可视化保存,后续修改提示词或调整召回参数,不用改动上层业务代码。

6. 本地大模型开发中的核心优化:性能与成本

6.1 推理性能

做完上述步骤,你已经成功地把开源大模型跑起来了。但很快会遇到一个新问题:当业务请求并发增多时,模型响应速度明显下降。原因在于,大模型推理是计算密集型和显存密集型任务。

推理性能最相关的要素是 GPU。模型核运算主要集中在张量计算上,GPU 的 CUDA 核心数、显存带宽、显存容量影响最大。如果没有独立 GPU,CPU 也能运行小模型,但速度可能不如可用性体验。

在实际生产中,提升推理性能的常见手段包括:

  • 使用兼容 OpenAI 接口的服务网关做请求队列和超时控制。
  • 增加 Ollama 并发参数。Ollama 默认并发数较保守,可通过环境变量OLLAMA_NUM_PARALLEL调整,比如OLLAMA_NUM_PARALLEL=4表示同时处理 4 个请求。
  • 将模型从 CPU 切换到 GPU。Ollama 默认检测可用 GPU,可通过ollama ps查看模型当前运行设备。
  • 对于更大量级模型和高并发,可引入 vLLM 框架。vLLM 通过 PagedAttention 等机制大幅提升吞吐,在服务化场景中表现突出。

6.2 成本预算

企业关心的不只是性能,还有花钱值不值。本地部署的成本主要由三部分构成:

  • 一次性采购成本:GPU 服务器、存储、网络设备。
  • 持续运维成本:电力、散热、机房、管理员维护。
  • 人工调优成本:模型效果评估、Prompt 调优、知识库更新。

以 7B 模型为例,用一张 24GB 显存的 GPU 即可在量化后运行。如果使用 70B 模型,则需要 4 张以上 48GB 显存的 GPU 或者进行多机分布式部署。小团队起步建议先用低参数量模型验证效果,充分确定业务价值后再考虑大模型的扩容。

6.3 量化选择建议

  • 对通用问答、摘要、文本分类类场景,可以优先尝试q4_K_Mq5_K_M
  • 对生成代码、数学推理、结构化工单提取类任务,量化损耗可能被放大,建议用q8_0或更高精度原版模型测试对比。
  • 量化版本的最终效果请以业务测试集为准。很多人习惯看模型排名,一张实际业务样例的性能对比,往往比榜单得分更有参考价值。

7. 企业平台化落地:微调与 RAG 的取舍

7.1 需要微调吗

本地部署开源大模型后,很多团队会问:要不要用业务数据继续微调模型?

垂直领域微调确实可以让模型在特定任务上表现更好,但它需要高质量标注数据集、计算资源和较长的实验周期。大多数企业用例中,通过 RAG 把正确知识喂给模型就能满足需求。RAG 的方案更容易维护,因为业务知识变化时只需更新向量库,不需要重新训练模型。

微调适合的场景是:模型的输出格式、角色语气、专业领域术语风格需要固化,且能够维护一套较稳定的训练样本集。如果你处在起步阶段,优先把 RAG 和提示词工程做好,不要急于微调。

7.2 让知识库保持新鲜

很多企业知识库问答的初期体验不佳,原因是文档没有做清洗和更新。一份 PDF 里混入表格、页眉页脚、扫描件乱码后,即使模型能力再强,也不知道哪些内容该保留。知识库工程的核心工作是分段、清洗和元数据管理。

实际项目中,建议为每个文档设置清晰的知识来源和更新时间,以便对话回答可以指出依据文档。这样既提高了可信度,也给后续知识更新提供了位置索引。

8. 常见问题与排查思路

问题现象常见原因解决思路
ollama run后模型回答很慢模型数据在 CPU 上推理执行ollama ps确认是否使用 GPU,检查 CUDA 驱动和显卡识别情况
启动报Error: model not found模型名称或标签写错ollama list查看已安装模型名称,确认是否带版本号
Docker 镜像拉取超时镜像下载不稳定检查 Docker 源及网络连通性,不要在内网环境省略镜像配置
Dify 无法连接 Ollama 服务地址不可达或端口未开放在 Dify 服务器上执行curl http://<OllamaIP>:11434,确认网络策略和防火墙
多用户同时使用出现 500Ollama 默认并发低设置OLLAMA_NUM_PARALLEL环境变量并重启服务
模型回答内容包含敏感业务信息风险知识库中无权限控制先通过用户身份及文档权限过滤检索结果,最小化数据暴露范围
生成内容质量波动大未设置温度等参数在请求中设置temperature=0.3或通过 Modelfile 固定参数
本地模型英文输出正常中文质量差选型阶段中文评测不足优先测试 Qwen、DeepSeek 等中文优化模型

排查问题时,一定要先分层。先确认模型服务本身可用,再检查上层知识库和编排逻辑。很多人一上来就怀疑模型效果差,结果发现是提示词没把知识库内容正确拼进上下文,先把链路跑通再谈调优,是效率最高的方式。

9. 生产环境最佳实践与安全边界

9.1 权限与数据合规

本地部署最大的价值是“数据可控”,但如果权限没做好,内网数据可能被内部人员、普通接口调用方泄露。需要注意:

  • 对模型服务和 AI 应用网关启用认证,不能裸奔;内网接口也要有API-Key或身份令牌。
  • 对知识库文档做敏感分级。财务、工资单、合同等重要文档建议不进入通用会话知识库,改为专用模型通道。
  • 记录用户操作日志,保留一定周期,便于后续审计滥删或越权问题。
  • 调用更新、删除类操作时,确保有合法授权,避免模型服务被外部恶意调用。

9.2 数据备份与版本管理

本地部署链路中涉及多个组件:模型权重文件、向量数据库、Dify 配置、代码。建议用版本控制管理好配置和数据集:

  • 模型权重保存位置固定,不能随便覆盖。下载渠道变化、更新模型后要记录原版本哈希。
  • 知识库文档源文件和向量索引放在独立目录,便于重建丢失的索引。
  • .env、compose 文件等关键配置修改后,先备份再变更。
  • 任何生产环境变更前先在最低权限测试环境验证。涉及恢复旧版本时也要能恢复到备份点。

9.3 性能与监控

上线后不要贸然相信“模型部署成功了就万事大吉”。实际使用中,建议关注:

  • GPU 使用率和显存占用,判断是否存在内存溢出风险。
  • 平均首 Token 延迟和单次请求总耗时。
  • 知识库未召回率(比如用户提问但向量库返回空片段),这往往是对话质量下降的隐性原因。

在内网也可以借助 Prometheus 和 Grafana 采集 GPU 指标。通用做法是用nvidia-smi配合脚本输出,或使用 dcgm-exporter 采集到 Prometheus。指标不在于多,关键指标盯住延迟、显存、错误率,能快速定位问题即可。

9.4 模型迭代升级方法

本地模型上线后,面对新出的开源版本,也要有测试评估流程。

  • 在测试环境部署新模型。
  • 用同一份业务评测集跑一遍,对比旧模型。
  • 至少准备 30 到 50 条真实业务场景的问题,模型输出人工打分(或使用大模型评估),硬指标不达标则暂不升级。

不要因新版参数量更大而盲目更新。模型升级往往伴随知识库向量库格式调整与显存需求变化,先有评估流程,再决定是否采取灰度发布。

10. 开源大模型的演进趋势:还没结束的信号

开源大模型的节奏远比预期快。从 2023 年的 LLaMA 引起关注,到 2024 年 Qwen、DeepSeek 等中文模型持续打磨能力,再到 2025 年多模态和 Agent 开源工具链不断涌现,开源社区几乎每几个月就有新的能力点。

接下来值得关注的方向主要有几个:

  • 长上下文推理:文档级 Agent、长视频处理、更完整的代码仓库级理解,都会受益于更大的上下文窗口,但 KV Cache 显存开销正在成为新的资源瓶颈。
  • 多模态开源模型:当文本、图片、视频、音频能统一处理时,企业内部知识库问答就不再局限于文字,图纸、截图、录音都能成为关联的内容源。
  • Agent 与工具调用生态:未来不是“你问我答”,而是模型根据任务自己规划步骤、调用工具、拿到结果后汇报,开源本地模型的可信度和可控性显得更重要。
  • 推理引擎栈的分化:Ollama 让入门变简单,vLLM 等偏向生产高并发,未来会涌现更多针对特定国产硬件的适配方案。选型时要考虑硬件的后续演进。

企业如果此时还没有动作,也不需要焦虑。更值得做的是准备好数据治理、评测集和内部权限平台,把模型层抽离成可替换的中间层——这样每代更新发布时,你只需要替换底座,不需要重写业务。

11. 一套落地路线:从“验证”到“生产”的决策路径

如果你正处于“到底要不要落地”的纠结阶段,可以参考这样一条路线:

第一步:先选任务,不选模型。挑一个场景明确、数据可获取、业务价值可衡量的小任务,例如制度问答、客服话术辅助、合同条款摘要。

第二步:用开源模型跑试点。用普通 GPU 服务器或云端 GPU 临时租用环境,部署 Ollama + Qwen2.5 7B,把场景跑通。不要一开始就上 70B 模型,也不要一开始就要微调。

第三步:建立评估基线。准备 50 条左右的真实问询,先让人工用通用回答打分,再拿模型生成结果与人工基准比较,记录满意度。

第四步:做成本和收益盘点。根据试点期间的 GPU 占用、token 消耗、运维人力,估算正式上线需要多少资源;同时预估因为数据不出域、日志可审计、不再按 Token 计费而节省的财务和合规价值。

第五步:再决定是否进入生产。决定进入生产时,把 Dify、权限体系、监控、备份、知识库管理补全,再把并发压测和回滚方案跑一遍。

这套路线不依赖高算力起步,也不会因为“先选技术栈”而错过真正适合的火力集中点。很多团队容易把精力耗在模型 A/B 评测上,最后项目因迟迟没有业务场景而中断,反而不如先让一个真实需求把链路跑通。

结尾想多说一句:开源大模型的价值,恰恰在“选择自己决定权”本身。当业务数据和算力成本掌握在自己手里,你对系统的信任感才会更长尾。这篇文章给出了一个入门落地的完整闭环。若你现在正处于评估或落地初期,希望里面的经验能帮你少走一段弯路。后续你还可以继续关注微调技术、vLLM 生产化、多模态本地部署和 Agent 工作流编排,每一步都是下一层技术深度的入口。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 3:09:57

AI驱动的供应链攻击:Claude入侵PyPI事件的技术剖析与防御实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 3:09:01

软件工程中的模糊性思维:从确定性执念到弹性架构的实践

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 3:08:44

CTF文件上传漏洞深度解析:从PHP代码执行到现代防御实践

简介&#xff1a;本资源为PICO CTF 2013网络安全竞赛中‘php2’挑战的完整配套学习包&#xff0c;面向CTF初学者、Web安全爱好者及PHP开发人员&#xff0c;聚焦PHP常见漏洞识别与利用实战。压缩包共4个文件&#xff08;18.85MB&#xff09;&#xff0c;包含核心PHP源码&#xf…

作者头像 李华
网站建设 2026/9/4 3:07:11

AI Agent CLI 可靠性进阶:Grok Build v1.0.14 工作流改进与实践指南

最近做 AI Agent 开发的同学&#xff0c;应该都关注到了 Grok Build 的版本更新。从 v1.0.9 到 v1.0.14&#xff0c;表面上只是小数点后的数字在跳动&#xff0c;但实际使用时&#xff0c;命令行工具的稳定性、会话恢复能力和工作流编排体验&#xff0c;都会受到非常明显的影响…

作者头像 李华
网站建设 2026/9/4 3:06:08

整数规划三大经典算法:分支定界、割平面与隐式枚举的MATLAB教学实现

简介&#xff1a;本资源是一套面向运筹学、优化算法学习者与MATLAB初学者的整数规划核心算法实现代码&#xff0c;聚焦分支定界法、割平面法和隐式枚举法三大经典求解策略&#xff0c;用于解决要求变量取整的线性优化问题&#xff0c;适用于课程设计、算法原理验证及小规模实际…

作者头像 李华
网站建设 2026/9/4 3:05:58

MySQL条件查询进阶:从动态WHERE到安全防线

如果你刚开始学网络安全&#xff0c;或者正在系统看 MySQL 基础教程&#xff0c;可能已经发现一个事实&#xff1a;网上关于“挖洞”“渗透”“SRC 平台”的视频很多&#xff0c;但真到动手复现时&#xff0c;很多人的 SQL 还是写不利索。尤其是“不同条件查询”这种不是单纯背…

作者头像 李华