LocalAI 本地 AI 部署实战:一条 Docker 命令跑通 LLM 与本地多模态
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
LocalAI 是本地 AI 部署引擎:LLM、语音合成、图像生成全部跑在你的硬件上,对外暴露 OpenAI 规范的本地接口。数据要留在内网、现有 OpenAI 调用想切本地、没 GPU 想先验证的,往下看。
本地跑 LLM,你的起点在哪
10 秒对号入座,看你落在哪一行:
| 你的起点 | 硬件条件 | 目标 |
|---|---|---|
| 纯 CPU 验证 | 不需要 GPU | 跑通功能即可 |
| GPU 提速度 | CUDA、ROCm 等 | 提升推理吞吐 |
| 存量 OpenAI 调用切本地 | 均可 | 改动最小 |
三行落点不改变安装流程,只改变镜像 tag 的选型:有没有 GPU、现有调用是否走 OpenAI 规范,就这两个变量。
90 秒装好 LocalAI
前置条件只有一个:装好 Docker。一条命令,核心服务起在 8080 端口:
docker run -ti --name local-ai -p 8080:8080 localai/localai:latest浏览器打开http://localhost:8080,WebUI 几秒内加载完成,从画廊搜索框装一个模型就能直接聊天。(NVIDIA 用户加--gpus all,换 CUDA 镜像。)容器生命周期细节见 Docker 安装文档。
把 OpenAI 的调用切到 LocalAI
请求体不用动,只改两处:
client = OpenAI(base_url="http://localhost:8080/v1") r = client.chat.completions.create(model="llama-3.2-1b-instruct", messages=msgs)base_url 指回本地,model 填你装好的名字。/v1/chat/completions、/v1/models、/v1/embeddings端点都遵循 OpenAI 规范,Anthropic Messages 也能接。
多模态能力一张表看全
| 能力 | 后端引擎 | 文档入口 |
|---|---|---|
| 文本生成 | llama.cpp | 文本生成 |
| 语音合成 TTS | kokoro | TTS |
| 语音转文字 STT | whisper.cpp | STT |
| 图像生成 | stable-diffusion-ggml | 图像生成 |
| 嵌入向量 | sentence-transformers | 嵌入 |
| 重排序 | reranker | 重排序 |
CPU 还是 GPU:硬件选型速查
无 GPU 跑 LLM 的上限在模型量级,不在算力本身:1B 到 4B 的量化区间(压缩到能塞进内存的版本)普通硬件就能用,再往上要认真评估显存或者走分布式。GPU 镜像分 CUDA(NVIDIA)、ROCm(AMD)、Metal(Apple Silicon)、Vulkan 四个分支,按你的卡选 tag。注意模型和后端并非全量兼容,选型前对照 模型安装文档 核对。
为什么不是一个大镜像
核心极薄,只装四样东西:统一的 OpenAI 规范 REST API、模型画廊、请求路由、WebUI。llama.cpp、vLLM、whisper.cpp、stable-diffusion 这些推理引擎各自是独立镜像。
装模型时对应后端自动拉取,本地大模型部署轻就轻在这:磁盘和内存只为真实用到的功能付费。全部引擎源码按语言(cpp、go、python、rust)分子目录放在 backend 目录,想深挖按图索骥。
从聊天到智能体
WebUI 的 Agents 页就能建智能体:系统提示词、工具、MCP 工具调用、RAG 式检索、代码执行全在同一处配置,本地模型由此接进内部流程,而不只是陪你聊天。TTS、语音转录、图像生成在 WebUI 里各有独立页面,贴文本、放音频,不需要另写前端。
多人用:认证与配额
单人或小团队,LOCALAI_API_KEY=your-key挡在最前面足够(该密钥带全部管理权限);要角色区分、OIDC 登录或按用户配额时,用LOCALAI_AUTH=true启动。细节见 认证与授权文档。
单机扛不住了怎么办
分布式模式用 PostgreSQL + NATS 做共享状态层,请求按显存情况做感知路由。P2P 模式让多台机器互借闲置算力。有训练数据时,微调在管理页里做,产物直接导出 GGUF。步骤参考 分布式模式文档。
排障三板斧
curl http://localhost:8080/readyz确认进程活着;/v1/models核对请求里的模型名对不对得上(404 多为拼错或安装没跑完);docker logs local-ai看后端加载时的报错。要更多上下文,用DEBUG=true启动。按类别整理的诊断命令在 排障文档。
你的下一步
路径很明确:CPU 镜像加一个 1B 到 4B 的小模型,走通"装模型 → WebUI 里聊天 → curl 验证接口",再决定上 GPU 镜像还是换更大模型。目的不是装得多,是确认硬件和内存的余量。🚀
【免费下载链接】LocalAILocalAI is the open-source AI engine. Run any model - LLMs, vision, voice, image, video - on any hardware. No GPU required.项目地址: https://gitcode.com/GitHub_Trending/lo/LocalAI
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考