【免费下载链接】Atomic-Chat
Local AI app and inference engine for agents. Run open-weight LLMs locally — private, 100% offline on your computer. Join our Discord: https://discord.com/invite/8wGSsvmg4V
Atomic Chat是一款可以在本地 100% 离线运行开源大模型的 AI 应用与推理引擎,数据不出你的电脑。选对本地大模型的关键不是"越大越好",而是让模型尺寸与你的**内存(RAM/显存)**匹配——这篇文章按 8GB、16GB、24GB、32GB 四档给出完整硬件配置清单和推荐模型,帮你快速选到"第一句话最快、体验最顺"的那一个。
核心结论:一张硬件配置清单表
Atomic Chat 内置了"硬件分级推荐"机制(web-app/src/constants/models.ts),会根据你的机器自动匹配档位。下面是官方推荐梯队的完整对照:
| 你的硬件 | 官方推荐模型 | 下载大小 | 适合场景 |
|---|---|---|---|
| 显存 < 2.5GB(核显/老显卡) | LFM2.5 1.2B | 0.68 GB | 轻量问答 |
| 显存 2.5–5GB | LFM2.5 2.6B | 1.56 GB | 日常对话 |
| 显存 5–9GB(8GB 档) | Qwen3.5 4B(Q4_K_M) | 2.52 GB | 日常对话 |
| 显存 9–13GB | Gemma 4 E4B(视觉) | 5.89 GB | 看图+问答 |
| 16GB(显存 13–17GB / 统一内存 16GB) | Gemma 4 12B(QAT) | 6.42 GB | 视觉知识问答 |
| 24GB(显存 17–25GB / 统一内存 24GB) | Qwen3.6 27B(Q4_K_M) | 15.41 GB | 编程 |
| 32GB 及以上 | Qwen3.6 35B A3B(Q4_K_M) | 19.71 GB | 数学推理 |
几个要点先说清:
- 🎯8GB 内存/显存:认准Qwen3.5 4B(约 2.5GB 文件)。它是用户量最大的档位,加载快、响应快。
- 💾16GB:选Gemma 4 12B 的 QAT 量化版(6.42GB)——量化感知训练让 4-bit 质量接近原版,实测约 37.8 tok/s。
- 🧮32GB 及以上:Qwen3.6 35B A3B是"稀疏"结构,每 token 只激活约 3B 参数,下载大但推理速度接近小模型,性价比极高。
三条选内存的"预算法则"
官方代码(web-app/src/lib/hardware-tier.ts)里有两条被真实数据验证过的规则,直接抄作业即可:
- 舒适线 = 50%:模型文件大小 ≤ 内存的一半时,KV 缓存和工作缓冲区才从容,上下文长度不受挤压。
- 上限线 = 85%(Mac 是硬门槛):在 macOS 上,模型超过统一内存的 85% 时 Metal 会直接拒绝加载(实测成功率从 85% 掉到 16%);而在 Windows/Linux 上超了只是变慢,llama.cpp 会把溢出部分挪进系统内存。
- 8GB 的机器:8 × 50% ≈ 4GB 预算,正好对应 2.5GB 左右的 4B 级模型——这就是 8GB 选 4B 模型的原因。
Mac 和 PC 同样内存,选法不一样
同样是 16GB,Mac 和 PC 的推荐不在同一档,原因有二:
- Mac 的内存是共享的:统一内存要同时给系统、浏览器和 GPU 用,而显卡的显存是模型的"专属空间",所以 16GB Mac 实际对标的是 PC 的 12–16GB 档;
- Mac 上限更硬:超过 85% 直接加载失败,官方代码会在超限时自动降一档推荐(web-app/src/lib/hardware-tier.ts)。
📌 经验法则:Mac 用户按"内存 ÷ 1.2"来对照上表,例如 18GB Mac 按 16GB 档(Gemma 4 12B)选最稳。
没有独立显卡怎么办?
这是最常见的疑问,官方数据给出了明确答案:
- ❌CPU 再快、内存再大也没用——纯 CPU 推理的瓶颈是 token 吞吐速度(实测约 11.5 tok/s),加内存不会提升它。所以无加速器的 x86 机器一律推荐最轻量的 1.2B 模型;
- ✅优先用核显/独显:哪怕只有 4–5GB 显存,速度也能比纯 CPU 快数倍到十倍以上;
- ✅Mac 天然是"统一内存"架构,8GB 起步就能跑,是低配硬件跑本地大模型的最优解。
上手 4 步:从开机到聊天
- 安装启动Atomic Chat,首次启动会自动检测你的内存/显存并分级(检测不到硬件时按 8GB 档保守推荐);
- 跟着推荐卡片一键下载:每个档位固定推荐 Q4_K_M 量化,该档位文件小且速度损失小(i 系列量化虽然再小 0.5GB,但在 CPU 和部分 Vulkan 后端上反而明显更慢);
- 在 Hub 里自己挑模型时,下载面板会按你的内存预算自动预选"装得下"的量化版本(web-app/src/lib/model-card.ts),预选项装不下就自动降档;
- 看"适配"标识:每个模型卡片都有绿色(舒适)/黄色(紧张)/红色(装不下)的内存适配提示,黄色意味着"能跑,但用上下文长度换的"。
最后检查清单 ✅
- 8GB → Qwen3.5 4B;16GB → Gemma 4 12B;24GB → Qwen3.6 27B;32GB+ → Qwen3.6 35B A3B
- Mac 用户按"内存 ÷ 1.2"对照档位,别直接按数字买模型
- 追求质量选 Q4_K_M,别贪 IQ 系列的"更小"
- 纯 CPU 机器把预期放低:能跑 ≠ 快,建议升级核显独显或 Mac
- 下载前留意磁盘空间:19.7GB 的 35B 模型请预留 25GB 以上
📖 延伸阅读:硬件分级完整逻辑见 web-app/src/lib/hardware-tier.ts,推荐清单与量化选型依据见 web-app/src/constants/models.ts,开发者指南见 README.md。
【免费下载链接】Atomic-Chat
Local AI app and inference engine for agents. Run open-weight LLMs locally — private, 100% offline on your computer. Join our Discord: https://discord.com/invite/8wGSsvmg4V
相关推荐
Buck2内存优化:32GB环境下构建超大型项目的配置
Buck2内存优化:32GB环境下构建超大型项目的配置 内存瓶颈分析 Buck2作为新一代构建系统,在32GB内存环境下处理超大型项目时,常面临两类内存挑战:S
构建工具开发工具终极Brontes安装指南:从2TB SSD到32GB内存的区块链分析引擎环境搭建全攻略
终极Brontes安装指南:从2TB SSD到32GB内存的区块链分析引擎环境搭建全攻略 Brontes是一款闪电般快速的通用区块链分析引擎,专门用于系统性ME
先算显存再下模型:R1 本地部署的硬件账本与量化清单
先算显存再下模型:R1 本地部署的硬件账本与量化清单 从 1.5B 到 671B,DeepSeek R1 系列一口气开源了 8 个推理模型。这个"全家桶"的跨度
基础模型大模型人工智能DeepSeek
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考