简介:面向初次接触DeepSeek但不知如何安装上手的用户,这份PDF文档系统梳理了DeepSeek的模型选型与三种使用路径。内容先对比DeepSeek V3与R1各自适用场景:V3功能全面均衡,R1在逻辑推理、代码编写、数学题求解等任务上更胜一筹,但调用成本更高,让用户能根据任务复杂度与实际预算快速判断该选哪一款模型;随后依次展开官方网页版/手机App注册使用、基于Ollama平台的本地部署、以及API+客户端(如ChatBox)接入三种方式,每种方式均标注了适用人群与注意事项,并给出了R1本地部署的模型规格、安装命令与API密钥配置步骤等关键细节。资源为单个PDF文档,压缩包约311KB,体积精简,适合存入手机或电脑随时查阅。目前已有365人学习,适合想零基础入门、注重数据隐私或具备一定技术背景的用户按需选择。
1. 先别急着折腾本地部署:DeepSeek 的满血版只在官方手里
很多人一搜 DeepSeek 就想往本地搬,觉得「自己部署 = 完整版」,这是最容易踩的第一个坑。DeepSeek 开放的两款模型里,V3 负责绝大多数日常任务,R1 专攻逻辑推理、写代码和数学题;你本地能跑起来的 1.5B、14B、32B 全是蒸馏版,真正的 671B 满血版只在官方网页、官方 App 和付费 API 里。对绝大多数人来说,第一步应该是直接用官方免费版,把「会不会用」先解决掉,再考虑「要不要自己部署」。这篇笔记按官方、本地、API 三条路线拆完,再补几个我实际用下来最容易翻车的点。
2. 官方使用方式:免费满血版,先分清 V3 和 R1 再动手
2.1 V3 和 R1 差在哪:不是哪个更强,是哪个更贵
DeepSeek 官方同时开放了 V3 和 R1 两个模型,很多人进去之后不知道该点哪个。我给你的判断口径很简单:日常对话、写文案、整理资料、翻译,用 V3,它覆盖面广、响应快;逻辑推理、代码调试、数学题、复杂分析,切到 R1,它的思考链路更长,正确率明显更高,但单价也更贵。
R1 的「贵」体现在两个地方:一是如果你走 API,R1 的 token 单价远高于 V3,同样是几千字的回答,费用能差出好几倍;二是官方免费网页版虽然没有直接收费,但 R1 生成答案时思考过程长,等待时间明显更久。如果你只是问「今天天气怎么样」这类问题却挂在 R1 上,属于杀鸡用牛刀,还白白占用上下文长度。
这个选择一定要养成习惯:进对话前先看一眼当前模型是 V3 还是 R1,而不是等回答出来了才发现用错了。我见过太多人抱怨「DeepSeek 变笨了」,点开一看,模型一直停在 R1 上处理普通问题,又慢又占用资源。
2.2 注册与多终端登录:手机号、微信、邮箱三选一
官方入口只需要记住一个网址:https://chat.deepseek.com/。首次登录时用 +86 手机号、微信或邮箱注册都可以,注册完直接进对话界面,不需要额外下载任何东西。网页版在电脑上使用体验最好,适合办公场景;手机上没有电脑时,直接在应用商店搜「DeepSeek」就能装官方 App。
这里有个容易被忽略的细节:官方网页上有个「获取手机 APP」的入口,鼠标移过去会弹出二维码,扫码也能下载。但多数人直接用应用商店搜索更快,两者装的是同一个 App,功能没有区别。手机版和网页版的登录态是互通的,唯一要注意的是:手机和电脑之间切换时,对话记录同步有一定的延迟,如果你正在电脑上写一半然后急着出门,手机上可能看不到最后几条消息。我一般会在出门前把关键内容复制一遍,省得到时候找不到。
2.3 对话上限之后怎么接续:复制上下文比开新对话可靠
官方免费版有对话长度上限,这是搜索里被问得最多的一个问题:「到达对话上限之后,怎么让新对话承接上一个对话?」
首先要搞清楚为什么会有这个上限。DeepSeek 的上下文窗口是有限的,对话越长,占用的 token 越多。当一段对话超过窗口长度后,最老的几条消息会被挤掉,这时你问「继续」它可能根本不知道你在说什么。以下是三种处理方式,按可靠程度排序:
- 最可靠:把上一轮回答里最关键的部分复制到新对话,再补一句「基于以上内容,继续分析……」;
- 次可靠:新开对话后手动点击会话列表里的历史记录,找到最后一条,复制其中的结论作为新对话的开头;
- 不可靠:同一个对话里反复发「继续」,这会经常得到答非所问的结果,因为最前面的上下文已经被截断了。
这个技巧放在任何长对话里都实用,如果你想让 DeepSeek 帮你写一篇长文或整理大量资料,建议每推进一段就手动把「当前结论」沉淀到新对话里,把之前的上下文作为背景粘贴进去,这样既绕开上限,又能保证一致性。
另外,官方网页版和 App 里都能做模型切换。页面上的模型选择器非常明显,V3 和 R1 之间切换是实时的,不需要退出重进。你只需要记住:切入 R1 之前想清楚是不是真需要深度推理,别让 R1 处理它不擅长的日常琐事。
3. 本地部署 DeepSeek:Ollama 选型、命令与内存测算
3.1 为什么本地只能跑蒸馏版:671B 不是个人电脑能扛的
如果你对数据隐私有顾虑,或者希望完全离线使用,本地部署确实是唯一选择。但必须先说清楚一个事实:DeepSeek R1 原版是 671B 参数的巨型模型,光权重文件就几百 GB,推理时显存需求是 TB 级别,这不是个人电脑能跑的。所以本地部署实际上跑的是「蒸馏版」——用 R1 的输出去训练出来的小模型,规模从 1.5B 到 70B 不等。
蒸馏版和原版的关系,可以理解成「压缩过的知识」。它保留了 DeepSeek R1 的一部分推理能力,但无论是代码质量、数学能力还是逻辑严密性,都会随参数规模缩水而下降。1.5B 版本能让你体验到 DeepSeek 的交互方式和基础能力,但如果你指望它写出高质量的生产级代码,那是不现实的。
这个前提不搞清楚,很容易出现「装完 1.5B 觉得 DeepSeek 不过如此」的误判。你的本地模型表现不好,不代表 DeepSeek 不好,只代表你跑的版本太小。
3.2 Ollama 安装与模型拉取:从下载到对话的完整命令
本地部署最省事的路径是 Ollama。它是一个集成了主流开源 AI 大模型的平台,免费、跨平台,Windows 和 macOS 都有安装包。到 Ollama 官网点 Download 下载安装后,在命令行里执行拉取命令即可。以下是完整流程:
# 1. 确认 Ollama 安装成功 ollama --version # 2. 拉取 DeepSeek R1 1.5B 蒸馏版(下载体积约 1.1GB) ollama pull deepseek-r1:1.5b # 3. 运行模型,进入交互式对话 ollama run deepseek-r1:1.5b # 4. 直接以编程方式调用(后面会讲到) curl http://localhost:11434/api/generate -d '{"model": "deepseek-r1:1.5b", "prompt": "用 Python 写一个快速排序"}'第一条命令的作用是确认 Ollama 是否装好,如果提示找不到命令,你需要把 Ollama 的安装目录加进系统 PATH,或者重开一个终端窗口。第二条命令会从 Ollama 的模型仓库拉取 DeepSeek R1 1.5B 版本,下载速度取决于你的网络,一般几分钟能完成。第三条命令进入交互式对话模式,直接在终端里和模型聊天,适合体验。第四条命令是走 HTTP 接口,这个我们后面详细讲。
参数说明:deepseek-r1:1.5b里的 1.5b 是模型参数量,b 代表 billion(十亿)。Ollama 同时提供 1.5B、7B、8B、14B、32B、70B 等多个尺寸的 DeepSeek R1 蒸馏版,越大的版本推理能力越强,但对内存和 CPU/GPU 的要求也越高。初次体验优先选 1.5B,几乎任何电脑都能跑。
安装完成后你会看到提示符,这时候就可以直接对话了。我建议你用一个需要多步推理的数学题来测试它,观察它的「思维链」输出,这是 R1 区别于其他小模型的显著特征。
3.3 从 1.5B 升级到 14B / 32B:按内存容量选,按需升级
1.5B 版本只能让你「跑通」,离「好用」有距离。等确认环境没问题后,可以根据机器内存和显卡去升级。以下是判断标准:
| 模型规格 | 下载体积量级 | 运行所需内存 | 适合设备 |
|---|---|---|---|
| deepseek-r1:1.5b | 约 1.1GB | 至少 4GB | 任何主流电脑 |
| deepseek-r1:7b / 8b | 约 4.7GB | 8GB 以上 | 近五年主流笔记本 |
| deepseek-r1:14b | 约 9GB | 16GB 以上 | 带独显的工作站 / 游戏本 |
| deepseek-r1:32b | 约 20GB | 32GB 以上 | 高性能台式机 |
| deepseek-r1:70b | 约 43GB | 64GB 以上 | 多卡服务器(优选) |
我一般会这样建议:如果你的电脑有 NVIDIA 显卡且显存在 6GB 以上,优先试 7B 或 14B;如果只有 CPU 没有独显,停留在 1.5B 或 7B 就好,再大的版本推理速度会慢到影响体验。升级的命令和安装一样,还是ollama pull,只是把模型名换掉:
# 升级到 14B 版本(下载体积约 9GB,需要预留两倍磁盘空间) ollama pull deepseek-r1:14b # 查看本地已下载的所有模型 ollama list要注意:ollama list这个命令很有用,它能告诉你当前机器上有哪些模型、占了多少存储空间。如果你装了一堆版本发现磁盘不够,用ollama rm deepseek-r1:7b可以删掉旧版,这点和 Docker 的镜像管理逻辑很像。
3.4 把本地模型接入自己的程序:Ollama 的 HTTP 接口怎么调
本地部署的真正价值在于可编程。Ollama 装好后会自动在本机开放11434端口,你的 Python 程序可以直接请求它。下载一个模型到本地后,以下这段代码就能完成一次完整调用:
import requests import json # 请求 Ollama 的 generate 接口,模型名必须与 ollama list 输出一致 resp = requests.post( "http://localhost:11434/api/generate", json={ "model": "deepseek-r1:7b", # 换成你本地的模型标签 "prompt": "用 Python 写一个二分查找,要求有边界检查", "stream": False, # 关闭流式输出,一次拿完整结果 "options": { "temperature": 0.6 # 推理任务建议调低,减少随机性 } } ) # 接口返回的是 JSON,直接解析 text 字段 result = resp.json() print(result["response"])逻辑说明:这段代码做了一件事——向本地 Ollama 服务发送一个生成请求,model字段必须和ollama list里显示的标签完全一致,否则会报错。stream: False表示关闭流式输出,适合脚本场景;如果你做聊天应用,设成True可以像 ChatGPT 一样一个字一个字往外蹦。
参数说明:temperature是采样温度,取值一般是 0 到 1。写代码、数学题这类需要确定性的任务,建议设在 0.5~0.7;做文案、头脑风暴可以适当调到 0.9 以上,让输出更有发散性。如果你不设置,Ollama 会用默认值,但默认值偏随机,跑推理任务容易答非所问。
这套接口的价值在于:你可以把本地 DeepSeek 嵌进自己的自动化脚本、聊天机器人或内部工具,不必走公网。对于企业内网部署,社区里也常见用 vLLM 这类推理框架来跑更大规模的 DeepSeek 服务,原理类似,性能和并发能力更强,但配置复杂度高不少,新手先用 Ollama 起步就够了。
4. API 与客户端接入:把 DeepSeek 接到你的真实工作流
4.1 为什么走 API:不只是为了极客
官方网页版适合人机对话,本地部署适合离线隐私场景,但如果你想把 DeepSeek 接进自己的工具链——比如企业微信机器人、VS Code 插件、自动化报告生成器,或者你希望多个终端共用一套模型服务——那就要走 API + 客户端方案。这条路线兼顾了模型能力和部署灵活性:模型跑在服务商那边,你的电脑只需要一个客户端负责收发请求。
搜索里出现的「Claude Code 接入 DeepSeek」「Codex 接入 DeepSeek」「VS Code 接入 DeepSeek」这些场景,本质上全部是 API 方案。你需要做的只有三件事:搞到一个 API 密钥、配置基地址和模型名、在客户端里测试连通。
4.2 获取 API 密钥:以硅基流动为例
国内可选的 API 服务商比较多,我以硅基流动为例走一遍流程,因为它注册简单、有免费额度,适合先跑通再付费:
- 访问硅基流动官网,用手机号注册并登录;
- 进入「API 密钥」页面,点创建新密钥;
- 给密钥随便取个名字,创建后复制保存,页面刷新后就不再显示完整密钥,丢了只能重新创建。
密钥的格式通常是一串长短不一的字符串,它代表你的调用身份。所有请求都会按这个密钥计算费用,所以它相当于钱,必须保管好。我见过有人把密钥直接写进代码仓库然后推到 GitHub 上,结果半夜收到扣费账单。密钥不要出现在前端代码里,也不要出现在任何公开仓库里,正确的做法是放到环境变量中:
# Windows PowerShell $env:DEEPSEEK_API_KEY="你的密钥" # macOS / Linux export DEEPSEEK_API_KEY="你的密钥"这里的DEEPSEEK_API_KEY是自定义的环境变量名,客户端会去读这个值。等号后面对应的脚本就是你的密钥。配置好之后,客户端不需要直接接触密钥明文,减少泄露风险。
4.3 ChatBox 配置:服务商、密钥、模型名三步走
客户端的选择很多,ChatBox、Cherry Studio、LobeChat、NextChat 都是常见选项。我以 ChatBox 为例,因为它手机端和电脑端都有,界面直观,对新手友好。下载安装后进入设置,找一个名为「模型服务商」或「AI 服务商」的区域,按以下流程配置:
- 服务商选「硅基流动」(SiliconFlow),如果列表里没有,就选手动配置,填服务商提供的 API Base URL;
- 粘贴刚才复制好的 API 密钥;
- 模型名称填写
deepseek-ai/DeepSeek-R1或 V3 对应的模型 ID,具体以服务商页面展示的模型 ID 为准。
配置完成后立刻发一条测试消息。我建议第一条消息发一个需要多步推理的问题,比如「一个房间里有 3 盏灯和 3 个开关,只能进屋一次,如何确定每个开关对应的灯」,R1 对它处理得特别好,能快速验证模型链路是否通畅。
ChatBox 这类客户端的优势是你可以同时配多家服务商的密钥,界面里手动切换模型。我经常把 V3 和 R1 都配好,日常对话用 V3,遇到复杂问题切 R1,相当于把官方网页版的切换逻辑搬到了自己的客户端里。另外,ChatBox 支持把对话上下文导出为 Markdown 或 PDF,这对需要沉淀工作结果的人来说非常实用,你可以直接把一轮调试过程导出成文档,附在代码评审或技术报告后面。
4.4 用 Python 直接调 API:请求格式、费用控制与上下文管理
理解 API 调的请求格式很重要,因为所有客户端底层都是这样发请求的。下面是一个标准调用代码,使用 OpenAI 兼容格式:
import requests API_URL = "https://api.siliconflow.cn/v1/chat/completions" API_KEY = "你的密钥" # 生产环境必须从环境变量读取,不要硬编码 payload = { "model": "deepseek-ai/DeepSeek-R1", "messages": [ {"role": "system", "content": "你是严谨的编程助理,回答问题前先给出思路。"}, {"role": "user", "content": "用 Python 写一个带超时处理的 HTTP 请求函数。"} ], "temperature": 0.3, # 低温度适合代码任务 "max_tokens": 2048, # 限制单次生成长度,避免费用失控 "stream": False } resp = requests.post(API_URL, json=payload, headers={ "Authorization": f"Bearer {API_KEY}" }) data = resp.json() print(data["choices"][0]["message"]["content"])逻辑说明:这个请求和 ChatGPT 的 API 格式几乎一样。messages列表里system消息用来设定模型角色,user消息是你的输入。返回结果嵌套在choices[0].message.content里,解析路径固定,记牢这一层就够了。
参数说明:max_tokens是单次生成的最大 token 数,它同时是费用上限。R1 这类推理模型会先生成一段很长的「思考过程」,这些思考 token 也要算钱,所以max_tokens设太小会导致回答被截断,设太大又费钱。我的习惯是先设 2048 试跑,如果发现回答总是在结尾处断裂,再往上调。你想查看实际消耗,直接从 API 的返回响应里取usage字段,里面有 prompt_tokens、completion_tokens 和 total_tokens 三项,分别对应输入消耗、输出消耗和总消耗。
费用这块是 API 方案最需要留意的。服务商一般会提供余量查询页面,你应该养成每次用完瞄一眼的习惯。如果你在企业微信这类场景里接入了 DeepSeek,一定要在代码里增加用量记录,否则月底账单会给你一个惊喜。
5. 避坑清单:四个最容易翻车的地方
5.1 模型选错:R1 挂在日常对话上,又慢又贵
现象:官方网页版或客户端里,所有问题都用 R1 回答,响应明显变慢,API 模式下费用飞快上涨。 原因:R1 是推理增强模型,无论问题难易都会先生成一段思考链条;走 API 时这些思考 token 全部计费。 解决:普通对话固定在 V3,只有逻辑推理、代码调试、数学题才切 R1。如果你用的是 ChatBox 这类客户端,可以同时配两个模型,按任务手动切换,效果等同于官方网页版的模型选择器,但可控性更高。
5.2 API 密钥泄露:一个 GitHub 推送就能扣光余额
现象:密钥被写在代码里,代码推送到 GitHub 后,几个小时后账户出现大量异常调用。 原因:公网爬虫会实时扫描 GitHub 代码仓库中的 API 密钥,命中后直接盗用。 解决:密钥一律放环境变量或者本地配置文件里,并且加进.gitignore。如果怀疑泄露,立刻到服务商平台删除旧密钥、换新密钥。从那以后我每次提交代码前都会强制搜一遍仓库里有没有api_key字样,成本几乎为零,收益是避免一笔莫名其妙的高额账单。
5.3 蒸馏版当成满血版:说「DeepSeek 不行」之前,先看模型名
现象:本地部署 1.5B 后对结果不满意,得出「DeepSeek 不过如此」的结论。 原因:1.5B 蒸馏版和官方 671B 满血版的能力差距非常大,小模型在复杂推理上经常答非所问。 解决:先确认自己在用什么模型。本地跑 1.5B 只能验证流程,别拿它做重要工作;要体验真实能力,直接用官方免费版。想升级本地体验,按机器内存逐步升级到 14B 或 32B,但依然追不上满血版,这是物理限制,不是配置问题。
5.4 上下文被截断:长对话突然失忆
现象:一段对话聊了很久,模型开始答非所问,或者完全忘记最早的信息。 原因:对话内容超过上下文窗口,最老的消息被丢弃。 解决:新开对话时手动粘贴上一轮的关键结论,把上下文显式带过去。这个技巧不管是官方网页版、本地部署还是 API 模式都适用。API 模式下更主动的做法是定期压缩历史消息——把旧的对话内容交给模型做一次摘要,再用摘要替换原始消息,这是所有长对话应用的通用优化手段。
5.5 磁盘空间不足:Ollama 装了好几个版本,盘满了
现象:ollama pull下载到一半报错,提示磁盘空间不足;或者系统变卡。 原因:每个模型版本都是独立的几 GB 到几十 GB 文件,全下载下来占用惊人。 解决:用ollama list查看已装模型,用ollama rm删除不再需要的版本。内存不足是另一个引擎:如果运行大模型时系统卡死,或者 Ollama 进程被系统杀掉,这说明物理内存不够。退回小一档的模型,或者启用 Ollama 的量化版本,这是本地方案最常见的取舍手段。
6. 三套方案的选型边界与最小验证法
方案不是越高级越好,而是越匹配越好。我给你一个可以拿来就用的判断口径:
| 你的需求 | 推荐方案 | 理由 |
|---|---|---|
| 偶尔问答、写文案、看效果 | 官方网页版 / App | 零成本,满血性能,免费 |
| 代码、数学、多步推理 | 官方网页版切 R1 | R1 全能力在线 |
| 数据不出内网、完全离线 | Ollama 本地部署 | 隐私可控,选型受限 |
| 接企业微信、VS Code、自建服务 | API + 客户端 | 接口标准化、可编程 |
| 低成本体验 API,先跑通流程 | API + 硅基流动 | 有免费额度,适合验证 |
选定方案后,我建议用同一个测试题去验证所有链路,这是最快发现问题的办法。我常用的验证题是:「一口井深 10 米,一只蜗牛白天爬 3 米,晚上滑下 2 米,几天能爬出去?」这题既能考逻辑(答案是 8 天,不是 10 天),又能观察模型的思考过程。官方版、本地版、API 版分别跑一遍,你会立刻感受到蒸馏版和满血版之间的差距有多大,也能确认客户端的配置是否正确。
还有一个验证技巧值得养成习惯:把「思考过程」打开。DeepSeek R1 系列的最大特点就是会把推理步骤输出出来,你可以看到它怎么一步步得出结论。官方网页版和 ChatBox 里通常都有查看思考链的入口,本地 Ollama 模式会直接在回复里输出。如果你看到的回答只有结论没有推理过程,那说明模型不是 R1,或者你的客户端没有正确切换到 R1。
最后说一句费用习惯:无论是在服务商后台还是usage响应里,调用一次 API 就应该看一眼消耗。这个习惯帮我提前发现了密钥被盗刷的问题,也帮很多朋友控制住了每月预算。我的习惯流程是:新配置一个客户端,先强制跑一遍上面那道井题,确认模型对;再问一个开放性问题,确认生成正常;最后查一次用量页面,确认计费正常。三件事加起来不超过五分钟,能过滤掉九成配置错误。希望帮到你。
本文还有配套的精品资源,点击获取