Eigent 本地模型部署教程:如何把 vLLM、Ollama、LM Studio 接入 Eigent
【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent
公司内部的合同、代码库或客户资料,直接贴给云端大模型 API 往往有合规顾虑,按 token 计费的成本也控制不住。Eigent 是一个开源的多智能体协作桌面端(本地版 Claude Cowork / Codex 替代方案),它的设置页内置了本地模型通道,推理全部跑在你自己的机器上。这篇文章以 Eigent 本地模型部署为主线,带你把 vLLM、Ollama、LM Studio 三条常见路线跑通,搭建一套完全私有化的离线大模型工作环境。
本地模型平台选型:vLLM / Ollama / LM Studio 怎么选
三家工具都提供 OpenAI 兼容接口,Eigent 侧的配置方式完全一致,差别主要在硬件利用率和上手门槛。先按自己的机器对号入座:
| 维度 | Ollama | vLLM | LM Studio |
|---|---|---|---|
| 上手难度 | 低,装完即可拉模型 | 中,需装 Python 环境和 CUDA | 最低,图形界面点选 |
| 性能表现 | 良好,单卡足够 | 三者中最强,吞吐高 | 一般,吃本地量化模型 |
| 图形界面 | 无(可选 Web 端) | 无 | 有,模型下载/加载全可视化 |
| 适合硬件 | 8GB 显存起步 | 单卡 16GB 及以上、多卡 | 4GB 显存、轻薄本、纯 CPU |
| Eigent 默认端点 | http://localhost:11434/v1 | http://localhost:8000/v1 | http://localhost:1234/v1 |
Eigent 在LOCAL_MODEL_OPTIONS中还预置了 SGLang(http://localhost:30000/v1)和 LLaMA.cpp(http://localhost:8080/v1),逻辑与上文一致。源码见 src/pages/Agents/localModels.ts。
统一落地流程:准备模型 → 启动服务 → 填端点 → 验证
四步走,每个工具只换第一步的命令。
第一步:准备模型
- Ollama:
ollama pull qwen2.5:7b - vLLM:无需预下载,首启自动从 Hugging Face 拉取;也可提前
huggingface-cli download Qwen/Qwen2.5-1.5B-Instruct - LM Studio:在应用内搜索模型名,点下载即可
第二步:启动本地推理服务
- vLLM:
vllm serve Qwen/Qwen2.5-1.5B-Instruct,默认监听 8000 端口 - Ollama:装完自带守护进程,
ollama pull后无需额外操作 - LM Studio:打开左侧 Developer → Local Server,点 Start Server,默认 1234 端口
第三步:在 Eigent 中填写端点与模型名
进入设置 → 模型 → 本地模型,选择对应平台,填入两个字段:
- 端点 URL:
http://localhost:11434/v1(Ollama)、http://localhost:8000/v1(vLLM)、http://localhost:1234/v1(LM Studio)。Ollama 少写/v1时 Eigent 会自动补全并提示 - 模型名:与服务里加载的一致,如
qwen2.5:7b、Qwen/Qwen2.5-1.5B-Instruct。Ollama 会自动列出本机已拉取的模型供下拉选择
第四步:验证连通
点击验证按钮。Eigent 会真实发起一次带函数调用的请求,只有确认模型支持 function calling 才算通过——这是多智能体框架的硬性要求。验证通过后模型即被保存,可切为默认工作模型,相关实现在 src/pages/Agents/Models.tsx 与 backend/app/controller/model_controller.py。
按硬件给建议
| 硬件配置 | 推荐工具 | 模型规格建议 |
|---|---|---|
| 消费级显卡(16GB+ 显存) | vLLM | Qwen2.5-7B/14B 原始精度,长上下文任务优势明显 |
| 轻薄本 / 8GB 显存 | Ollama | 4B~7B 的 Q4 量化版,如qwen2.5:7b |
| 纯 CPU / 4GB 显存 | LM Studio | 1.5B~3B 量化模型,只适合轻任务 |
踩坑速查:本地模型部署常见问题
- 现象:连接超时。原因:服务没起来或端口被占。解法:先确认
curl http://localhost:8000/v1/models有返回;端口冲突时 vLLM 加--port 8001再同步改端点。 - 现象:验证报 404。原因:端点格式不对,OpenAI 兼容接口必须以
/v1结尾。解法:检查 URL 末尾,Ollama 记得带http://localhost:11434/v1而非裸地址。 - 现象:验证提示不支持 function calling。原因:模型太小或为 base 模型。解法:换 Instruct/Chat 后缀的模型,纯离线场景下 7B 级是较稳的下限。
- 现象:模型名报 404 但端点能通。原因:模型名与服务里实际加载的不一致(如少了
:7b标签或组织前缀)。解法:以GET /v1/models返回的 id 为准填写。 - 现象:多开服务互相干扰。原因:8000/11434/1234 等默认端口被别的实例占用。解法:改启动端口,Eigent 端点跟着改即可。
跑通之后,提示词、工具调用和文件内容全程只经过你本机的推理服务,不产生任何外部流量,也省下了按量计费的部分。把常用的一两个模型验证好、设为默认,日常多智能体工作流就可以放心切到本地跑了。
【免费下载链接】eigentEigent: The Open Source Cowork Desktop - Local and Free Alternative to Claude Cowork and Codex项目地址: https://gitcode.com/GitHub_Trending/ei/eigent
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考