让 AI 助理管理本地大模型:LLM Checker 内置 MCP 服务器接入指南
【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker
LLM Checker是一款开源的硬件扫描工具:它能分析你的 CPU、GPU、内存,告诉你本机到底能跑哪些本地大模型(LLM/sLLM),并深度集成 Ollama。更实用的是,它内置了一个 MCP(Model Context Protocol)服务器——只需一条命令,就能让 Claude Code、Codex、Cursor、Windsurf 等 AI 助理直接"接手"你电脑上的 Ollama 模型:检测硬件、下载/删除模型、跑基准测试、清理磁盘,全程自然语言指挥。
🤔 为什么需要 MCP 服务器?
如果你用 Ollama 跑过本地模型,大概率遇到过这些场景:
- 下了一堆模型,不知道哪些能流畅运行、哪些该删掉
- 想测模型速度(tokens/s),得手动敲一堆命令
- 想知道某个项目该配哪个模型,只能凭感觉
- AI 助理很聪明,但它"看不见"你的硬件,也管不了你的 Ollama
MCP 就是 AI 助理的"工具总线":LLM Checker 把自己的硬件检测、模型推荐、Ollama 管理能力打包成一组标准工具,任何支持 MCP 的 AI 客户端连上之后,就能直接调用。源码位于 bin/mcp-server.mjs,基于官方@modelcontextprotocol/sdk实现。
支持哪些客户端?
内置mcp-setup命令一条搞定,支持:
| 客户端 | 写入位置 |
|---|---|
| Claude Code | claude mcp add(默认) |
| OpenAI Codex | ~/.codex/config.toml |
| Grok | ~/.grok/config.toml |
| Kimi | ~/.kimi/mcp.json |
| Cursor | ~/.cursor/mcp.json |
| Windsurf | ~/.codeium/windsurf/mcp_config.json |
| Gemini CLI | ~/.gemini/settings.json |
| 其他任意客户端 | --client generic输出标准mcpServersJSON |
🚀 3 步完成接入
第 1 步:安装
npm install -g llm-checker第 2 步:一条命令生成配置
llm-checker mcp-setup --client claude- 加上
--apply会自动把配置合并进客户端配置文件(不会覆盖已有内容) - 加上
--json输出结构化片段,方便脚本化 - 不想全局安装?用
--npx生成npx --yes --package llm-checker llm-checker-mcp命令,按需启动
第 3 步:重启客户端
完事了。AI 助理现在能看到一组以llm-checker命名的工具。
🛠️ 接入后你能用哪些工具?
连上之后,AI 助理获得三大类能力:
① 核心分析(硬件 + 模型选型)
| 工具 | 作用 |
|---|---|
hw_detect | 检测 CPU/GPU/内存/加速后端 |
check | 全量兼容性分析,所有模型按评分排序 |
recommend | 按用途推荐(coding、reasoning、multimodal…) |
installed | 给已下载的 Ollama 模型打兼容分 |
search | 关键词搜索模型目录,支持用途/大小过滤 |
smart_recommend | 调用完整评分引擎的智能推荐 |
gpu_plan | 多 GPU 模型摆放与运行参数规划 |
verify_context | 校验本地模型的实际上下文窗口上限 |
ollama_plan/ollama_plan_env | 生成容量规划与可直接粘贴的环境变量 |
toolcheck | 测试本地模型的工具调用兼容性 |
② Ollama 模型管理
| 工具 | 作用 |
|---|---|
ollama_list | 列出已下载模型(参数量/量化/家族/体积) |
ollama_pull | 从仓库下载模型 |
ollama_run | 跑提示词,附带 tok/s 等性能指标 |
ollama_remove | 删除模型腾磁盘 |
③ 高级独家工具(仅 MCP 提供)
| 工具 | 作用 |
|---|---|
ollama_optimize | 按硬件生成最优 Ollama 环境变量 |
benchmark | 标准提示词跑 3 轮基准测试,测出 tok/s、加载耗时 |
compare_models | 两个模型同题对决,速度+回答并排展示 |
cleanup_models | 分析冗余模型、超大模型,给出清理建议 |
project_recommend | 扫描你的项目目录(语言/框架/规模),推荐最配的模型 |
ollama_monitor | 实时查看内存占用与已加载模型 |
verify_model | 加载前对 GGUF/safetensors 文件做结构安全校验 |
cli_help/cli_exec | 列出/执行白名单内的任意 CLI 命令 |
安全方面也不用担心:cli_exec只允许执行白名单内的命令,工具入参都带类型校验,详见 tests/mcp-multiclient.test.mjs。
💬 连上之后,直接"说人话"
配置完成后,你可以像聊天一样指挥 AI 助理(它会自己挑对的工具):
- "我的硬件最适合跑哪个编程模型?"
- "给 qwen2.5-coder 跑个基准测试,看看 tok/s"
- "对比一下 llama3.2 和 codellama 的编码表现"
- "清理一下我的 Ollama,哪些模型该删?"
- "我这个 Rust 项目该用哪个模型?"
- "帮我优化 Ollama 配置到最佳性能"
- "现在 Ollama 占了多少内存?"
比如最后一句,AI 会调用ollama_monitor返回内存占用、已加载模型、可用余量,并直接告诉你"现在能跑多大的模型"。
❓ 常见问题
Q:必须全局安装吗?不必。mcp-setup --npx会生成npx方式启动命令,客户端首次调用时自动拉取。
Q:没装 Ollama 能用吗?可以用hw_detect、check、recommend等纯分析工具;Ollama 管理类工具需要本机有 Ollama(默认连接http://localhost:11434,可用环境变量OLLAMA_HOST指向其他地址)。
Q:怎么验证接入成功?重启客户端后问它一句"列出我的 Ollama 模型",如果返回了ollama_list的结果,就说明 MCP 通道已通。
📚 延伸阅读
- 官方使用说明:docs/guides/usage-guide.md
- 高级玩法:docs/guides/advanced-usage.md
- 技术文档:docs/reference/technical-docs.md
- MCP 服务器源码:bin/mcp-server.mjs
- 多客户端配置与
verify_model工具测试:tests/mcp-server.test.mjs
一条mcp-setup,把硬件检测、模型选型、Ollama 管理全部交给你的 AI 助理——本地大模型的"运维岗",从今天起由它来当班。
【免费下载链接】llm-checkerAdvanced CLI tool that scans your hardware and tells you exactly which LLM or sLLM models you can run locally, with full Ollama integration.项目地址: https://gitcode.com/gh_mirrors/ll/llm-checker
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考