一、先给结论:能,纯 CPU / 核显也能本地跑大模型
很多人问「没有显卡能跑大模型吗」,答案很直接:能跑。现在主流的本地大模型工具(Ollama、LM Studio 等)在没有独立显卡的情况下会自动用 CPU 推理,这是官方支持的标准模式,不需要任何破解或特殊设置 [1]。
但「能跑」不等于「跑得爽」。核显本、轻薄本、老台式机本地跑大模型,需要先摆正三个预期:
| 认知 | 说明 |
|---|---|
| 模型要选小的 | 1.5B~7B 参数的小模型才现实,70B 这类大模型在 CPU 上只有每秒 1~3 个 token,基本不可用 [2] |
| 一定要用量化版 | Q4(4-bit)量化把模型体积压缩到原来的约 1/4,7B 模型从 14GB 降到 4.7GB 左右,是低配机的标配 [2][8] |
| 速度要接受 | 现代 CPU 跑 3B 模型大约每秒 10~20 个 token,跑 7B 约 5~12 个 token,相当于「看着字一个个打出来」[2] |
换句话说,无显卡本地 AI 适合的是:日常问答、写作润色、翻译摘要、简单编程辅助、离线隐私场景;不适合的是:超长文档秒回、复杂多步推理、多开并发、追求云端大模型那种即时响应。
这篇教程会讲清硬件门槛、手把手带你用 Ollama 纯 CPU 跑起来、给出 2026 年仍好用的小模型清单,以及跑不动时的替代路线。
二、先看硬件:没有独显,什么才是瓶颈?
核显跑大模型、CPU 跑大模型时,模型全部加载在系统内存(RAM)里,由 CPU 计算。所以瓶颈不是显卡,而是内存。
1. 内存(RAM)是首要硬门槛
一个经验公式:Q4 量化下,大约每 10 亿参数占用 0.6GB 左右内存 [2]。
| 模型参数 | Q4 模型文件大小 | 建议可用内存 | CPU 速度量级(现代多核 CPU) | 体验 |
|---|---|---|---|---|
| 0.5B~1.5B | 0.4~1.1GB | 4~8GB | 20~40 token/秒 | 很快,适合超轻任务 |
| 3B~4B | 1.9~2.5GB | 8GB 起步 | 10~20 token/秒 | 日常聊天的甜点区间 [2] |
| 7B~8B | 4.7~5.2GB | 16GB 起步 | 5~12 token/秒 | 质量好,长回复要等 [2] |
| 13B~14B | 8~9GB | 16~24GB | 3~6 token/秒 | 明显偏慢 [3] |
| 32B 以上 | 19GB+ | 32GB+ | 1~3 token/秒 | 不建议纯 CPU [3] |
实用建议:
- 8GB 内存:只建议跑 1.5B~3B 模型,跑 7B 会大量占用内存、容易卡顿或把系统挤爆;
- 16GB 内存:跑 7B Q4 比较舒服(模型 4.7GB 左右,加上系统和上下文,占用约 6~8GB),这是低配电脑本地部署 AI 的推荐起步配置;
- 注意内存要给系统留余量。Windows / macOS 本身要占 3~5GB,所以「模型大小 + 5GB」才是你实际需要的内存。
顺便解释一个高频问题:为什么没有显卡也能跑? 早期大模型推理基本依赖 NVIDIA 的 CUDA 生态,而开源项目 llama.cpp 用 C/C++ 重写了推理过程,针对 CPU 做了大量优化(支持 AVX2、ARM NEON 等指令集),并推广了 GGUF 这种专门适配 CPU 的模型文件格式——Ollama、LM Studio 底层用的都是它。配合「量化」技术(把模型权重从 16 位浮点压缩成 4 位整数,体积约为原来的四分之一,精度损失很小),小模型才能在普通电脑的内存里跑起来。
关于量化等级,常见有 Q4_K_M、Q5_K_M、Q8 等:数字越小越省内存、速度越快,数字越大质量越好。低配机直接用 Ollama 默认的 Q4_K_M 即可,它是体积、速度、质量的平衡点;内存充裕、想追求一点质量再考虑 Q5。
2. 硬盘空间
7B Q4 模型约 4.7GB,13B 约 9GB,32B 约 20GB [3][8]。建议:
- 模型放在 SSD 固态硬盘上,机械硬盘加载模型会慢很多;
- C 盘空间紧张的话,Windows 下可以设置环境变量
OLLAMA_MODELS,把模型目录改到其他盘,改完重启电脑生效 [9]。
3. CPU 核数与指令集
- 核数越多越快,4 核起步、8 核体验明显更好;
- 特别老的 CPU 要注意:LM Studio 在 Windows 上要求 CPU 支持 AVX2 指令集(2013 年后的主流处理器基本都支持)[4];Ollama 对老 CPU 兼容性更好。
4. Mac 用户单独说明
苹果 M1/M2/M3/M4 系列 Mac 虽然也是「核显」,但它用的是统一内存(Unified Memory):CPU、GPU 共用同一块高速内存,并通过 Metal 框架做硬件加速 [1][2]。因此同样无独显,Mac 的表现远超普通 Windows 核显本:
- M2 / M3 跑 7B~8B 模型可以达到每秒 30~45 个 token,相当于中端独立显卡的水平 [2];
- 8GB 统一内存的 MacBook 能跑 3B 左右,16GB 可以流畅跑 7B~8B [2]。
所以 Mac 用户可以直接把自己当「有加速」对待,下面的 CPU 教程同样适用,速度参考上浮即可。
三、方案一:Ollama 纯 CPU 安装与跑模型(推荐新手)
Ollama 是目前最流行的本地大模型运行框架,GitHub 星数早已超过 10 万,一行命令就能下载、运行模型,Windows / macOS / Linux 都支持,没有独显时自动用 CPU 推理 [1][3]。
1. 安装
Windows(Win10/11):
- 访问官网下载页
https://ollama.com/download,下载OllamaSetup.exe; - 双击安装,一路点「Install / 安装」,装完右下角任务栏会出现羊驼图标,说明服务已在后台运行 [9];
- 按
Win + R输入cmd打开命令提示符,输入下面的命令验证:
ollama --version显示版本号即安装成功。
macOS:
- 在
https://ollama.com/download下载 macOS 版,拖进「应用程序」即可; - 或用命令行安装(Linux 通用):
curl -fsSL https://ollama.com/install.sh | sh安装后在「终端 / Terminal」输入 ollama --version 验证。
2. 下载并运行第一个模型
以轻量、中文能力强的 qwen2.5:1.5b 为例,在命令行输入:
ollama run qwen2.5:1.5b首次运行会自动下载模型(约 986MB),下载完成后出现 >>> 提示符,就可以直接打字对话了。输入 /bye 退出,模型闲置一段时间后会自动释放内存 [9]。
常用命令一览:
| 命令 | 作用 |
|---|---|
ollama run 模型名 | 下载(若没有)并启动模型进入对话 |
ollama pull 模型名 | 只下载不运行 |
ollama list | 查看已下载的模型 |
ollama ps | 查看当前正在运行的模型及所在设备 |
ollama stop 模型名 | 停止模型、释放内存 |
3. 确认自己是不是在纯 CPU 跑
运行模型后,在另一个命令行窗口输入:
ollama ps输出里的 PROCESSOR 列会显示运行位置 [1]:
100% CPU:全部在系统内存 / CPU 上跑(无显卡本就是这个状态);100% GPU:全部在显卡上;xx%/xx% CPU/GPU:部分卸载到显卡(核显部分加速时会出现)。
如果想强制只用 CPU(比如核显卸载反而报错时),NVIDIA 机型可以通过把 CUDA_VISIBLE_DEVICES 设为无效值实现,AMD 机型对应设置 ROCR_VISIBLE_DEVICES,具体见官方 GPU 文档 [6]。
4. 几个实用设置
- 改上下文长度:Ollama 默认上下文是 4096 token。纯 CPU 不建议开太大,长上下文会明显增加内存占用和等待时间。可在对话中用
/set parameter num_ctx 4096调整,或设置环境变量OLLAMA_CONTEXT_LENGTH[1]。 - 改模型存储位置:Windows 设置系统环境变量
OLLAMA_MODELS=D:\ollama\models(改成你空间大的盘),重启电脑生效 [9]。 - 断网可用:模型下载完成后,运行完全离线,不联网也能用,隐私数据不出本机 [3]。
四、低配电脑模型清单(2026 年仍好用,附内存与用途)
下面都是官方开源权重、可在 Ollama 一键拉取的小模型。表格中的大小为 Ollama 官方库的 Q4 默认量化文件大小,内存占用按「模型 + 系统 + 上下文」估算 [7][8][10][11][12]。
| 模型(拉取命令) | 参数 | 文件大小 | 建议内存 | 适合用途 |
|---|---|---|---|---|
qwen2.5:0.5b | 0.5B | 398MB | 4GB | 超轻任务、分类、关键词提取、老机器试水 [7] |
qwen3:0.6b | 0.6B | 523MB | 4GB | 新一代超小模型,带思考模式开关,简单问答 [10] |
llama3.2:1b | 1B | 1.3GB | 4~6GB | 英文轻任务、改写、检索,2GB 内存极限可用 [12] |
qwen2.5:1.5b | 1.5B | 986MB | 6GB | 中文日常对话、摘要、翻译,低配首选 [7] |
deepseek-r1:1.5b | 1.5B | 1.1GB | 6GB | 会「输出思考过程」的小推理模型,数学/逻辑入门 [8] |
qwen3:1.7b | 1.7B | 1.4GB | 6~8GB | 中文、轻推理,小模型里速度/质量平衡好 [10] |
qwen2.5:3b | 1.9GB | 1.9GB | 8GB | 中文+编程小能手,支持 JSON/函数调用 [7] |
llama3.2:3b | 3B | 2.0GB | 8GB | 指令遵循好、128K 长上下文,通用稳妥选择 [12] |
phi4-mini | 3.8B | 2.5GB | 8~10GB | 微软小钢炮,数学、逻辑、代码推理强 [11] |
qwen3:4b | 4B | 2.5GB | 8~10GB | 新一代通用模型,256K 上下文,日常聊天推荐 [10] |
qwen2.5:7b | 7B | 4.7GB | 16GB | 中文综合能力强、长文本,16GB 内存主力 [7] |
deepseek-r1:7b | 7B | 4.7GB | 16GB | 分步推理、解题、分析,回答会先给思考链 [8] |
deepseek-r1:8b(默认) | 8B | 5.2GB | 16GB | R1 蒸馏增强版,推理质量更好一点,稍慢 [8] |
选型建议(对号入座):
- 8GB 内存 / 老笔记本:从
qwen2.5:1.5b、qwen3:1.7b起步,想质量高一点试qwen2.5:3b; - 16GB 内存 / 核显本:直接上
qwen2.5:7b或qwen3:4b,要推理选deepseek-r1:7b; - 主要用中文:优先 Qwen(通义千问)系列,中文语料和表达更自然;
- 要数学/代码/逻辑:选
phi4-mini(3.8B)或deepseek-r1蒸馏版 [8][11]; - 这些模型权重均为官方开源(Qwen 多为 Apache 2.0,DeepSeek-R1 蒸馏版为 MIT,Llama 3.2 为 Llama 许可),个人使用没有版权问题 [7][8][12]。
提示:Ollama 模型库更新很快,拉取前可以到
https://ollama.com/search搜索模型名,查看最新标签和大小。
小模型怎么问才好用?
小模型能力有限,提问方式对效果影响很大,记住四个技巧:
- 指令写具体:把「帮我写个东西」改成「用中文写一段 200 字的产品介绍,语气亲切,面向大学生用户」,小模型更不容易跑偏;
- 一次只让它做一件事:别在一个问题里又要总结又要翻译又要列提纲,拆成多轮对话质量更高;
- 给它角色和例子:开头加「你是一名专业文案」或直接给一个输出示例,小模型照葫芦画瓢的效果明显更好;
- 开长上下文要克制:虽然很多模型标称 128K 上下文,但纯 CPU 下上下文越长越慢、越占内存,日常对话保持 4K~8K 足够,真要读长文档再临时调大 [1][10]。
另外,deepseek-r1 这类「思考模型」回答时会先输出一段推理过程,答案更严谨,但也会更慢、更费 token。低配机日常聊天可以用普通对话模型(qwen2.5 / qwen3),遇到数学、逻辑题再切 r1 系列。
五、不喜欢命令行?纯 CPU 可用的图形界面工具
如果你觉得黑窗口不友好,下面这些图形界面工具都能在无独显环境使用:
| 工具 | 特点 | 纯 CPU / 核显支持 |
|---|---|---|
| LM Studio | 界面美观,内置模型搜索下载,一键加载 GGUF 模型,带本地服务器(OpenAI 兼容接口) | 无独显自动用 CPU;Windows 需 CPU 支持 AVX2,建议 16GB 内存;注意不支持 Intel 芯片的老款 Mac [4] |
| AnythingLLM | 主打「本地知识库 / RAG」,可把 PDF、Word 拖进去让模型基于文档回答;桌面版可选 Ollama 作后端 | 无显卡可用 CPU;2026 年新版还内置微软 Foundry Local,能自动调用 CPU/GPU/NPU(需 Win11 24H2+)[5] |
| GPT4All | 安装简单,自带多款 CPU 优化模型,适合纯入门体验 | 原生为 CPU 设计,对老机器友好 [13] |
| Chatbox / Open WebUI | 聊天界面类,配合已装好的 Ollama 使用,体验接近 ChatGPT | 本身不跑模型,调用 Ollama,CPU/GPU 取决于 Ollama |
新手推荐组合:Ollama(后台跑模型)+ Chatbox 或 LM Studio(前台聊天),既不用记命令,又能稳定跑小模型。想做「本地文档问答」再上 AnythingLLM。
补充一个低配机做知识库的小经验:AnythingLLM 做文档问答时,除了对话模型还会用到一个「向量嵌入模型」,别让它默认下载大模型,选 Ollama 官方的 nomic-embed-text 即可,文件只有约 274MB、占用内存很小,专门负责把文档转成向量,再搭配一个 3B 左右的对话模型,8~16GB 内存也能跑起本地 RAG 知识库。
六、核显加速到底有没有用?(Intel / AMD 现状)
很多人期待核显能帮上忙,这里说结论,不夸大:
| 核显类型 | 加速现状 | 建议 |
|---|---|---|
| Intel UHD / 老款核显(8~10 代) | 算力弱。实测在这类核显上用 Vulkan 卸载,速度甚至不如纯 CPU,还可能出现显存不足、加载报错 [14] | 别折腾,直接纯 CPU |
| Intel Iris Xe(11 代起)/ Arc 核显 | 理论支持 Vulkan、OpenVINO 加速,但社区实测对 4~8B 模型,CPU 与核显速度基本持平,核显加载更慢 [14] | 提升有限,纯 CPU 即可;想折腾可用 IPEX-LLM / OpenVINO |
| AMD Radeon 780M / 890M 等(锐龙 7000/8000/AI 系列) | RDNA3 核显 + 高频内存有一定算力。实测配合 LM Studio 部分卸载,跑 20B 模型也能到约 9 token/秒 [15] | 可以在 LM Studio 里试着把 GPU Offload 开一部分,跑分看有没有变快 |
| NPU(酷睿 Ultra / 锐龙 AI 的 AI PC) | 专用 AI 引擎,但 Ollama 默认不调用;需 Foundry Local、AMD Lemonade、IPEX-LLM 等框架 [5][13] | 新手可先不管,用 AnythingLLM 新版自动调度 [5] |
一句话:普通 Intel 核显别指望加速,老老实实用 CPU 反而更稳;较新的 AMD 强力核显可以试试部分卸载,内存大小依然是天花板。 核显和 CPU 共用内存,所以无论怎么卸载,内存不够照样跑不动。
七、小模型不够用?本地 + 云端混合方案
低配机跑 7B 已经是体验上限,遇到复杂推理、长文档、写大型代码时,小模型会「力不从心」。这时候没必要硬扛,本地小模型 + 云端 API 混合用是最划算的路线:隐私、日常问答走本地;重活交给便宜的云端大模型。
主流低成本云端选择(2026 年价格,以官方页为准):
- DeepSeek API(deepseek-flash):官方定价,输入(缓存未命中)空闲时段约 1 元 / 百万 token、高峰约 2 元;输出空闲约 4 元、高峰约 8 元 / 百万 token,新用户还有体验额度 [16]。日常轻度使用,几块钱能用很久。
- 国内其他平台:阿里云百炼、腾讯云、智谱、硅基流动等都有开源小模型的免费额度或极低价 API,很多 Qwen 系列小模型接口可免费调用,适合入门试水。
混合用法建议:
| 场景 | 走哪里 |
|---|---|
| 敏感资料、个人隐私、离线环境 | 本地 Ollama 小模型 |
| 日常问答、翻译、摘要、改写 | 本地(免费、无限次) |
| 复杂推理、长文分析、正式文案 | 云端 DeepSeek 等 API(便宜、质量高) |
Chatbox、AnythingLLM、Open WebUI 这类工具都能同时配置「本地 Ollama」和「云端 API」两个来源,随用随切。
八、手机能不能本地跑大模型?
能,但体验有限,简要说明:
- 手机端没有官方的 Ollama / LM Studio,要用专门的 App,比如 PocketPal AI(iOS / 安卓,图形界面,内置 llama.cpp,可离线跑 GGUF 小模型)、MLC Chat / MLC LLM(调用手机 GPU),或安卓上用 Termux + llama.cpp [13][17];
- 实际表现:2021 年后、6GB 内存以上的手机跑 1B~3B 量化模型,大约每秒 3~6 个 token;新款旗舰(骁龙 8 Gen3、A17 Pro 级别)跑 1B 模型可达每秒 15~30 个 token [17];
- 适合:离线翻译、随手问答、尝鲜;不适合替代日常 AI 工作流,发热和耗电也明显。
对多数人,手机上更省心的选择是直接用各家的云端 AI App(联网使用,效果好、不折腾),本地跑留给「离线 + 隐私 + 好奇尝鲜」。
九、常见卡顿与报错排查
| 现象 | 可能原因 | 解决办法 |
|---|---|---|
| 模型加载失败 / 闪退 / 卡住 | 内存不足 | 换更小模型(7B→3B→1.5B);关掉浏览器等占内存程序;加虚拟内存 [2] |
| 输出特别慢(< 3 token/秒) | 在跑大模型或核显抢占 | 降到 3B 以下;笔记本插电源、开高性能模式;确认 ollama ps 没误卸载到核显 [1] |
| 核显上报 out of memory / Vulkan 错误 | 核显共享内存、驱动问题 | 强制纯 CPU 运行;更新或回退显卡驱动;别开 GPU 卸载 [14] |
| 模型下载慢 / 中断 | 网络问题 | 重试 ollama pull 支持断点续传;换网络环境;模型体积大请耐心 |
| 提示 'ollama' 不是内部命令 | 安装未生效 / 未重启 | 重新打开命令行窗口;确认安装成功;重启电脑 [9] |
| 回复答非所问、胡说 | 模型太小或上下文超限 | 换 7B 级模型;缩短输入;把上下文 num_ctx 设回 4096 左右 [1] |
| 硬盘被占满 | 模型默认存 C 盘 | 设置 OLLAMA_MODELS 改到其他盘 [9] |
十、常见问题 FAQ
1. 没有独立显卡,纯靠 CPU 真能流畅用吗?
能「用」,但「流畅」取决于模型大小。3B 以内在现代多核 CPU 上每秒 10~20 个 token,日常聊天可以接受;7B 约每秒 5~12 个 token,长回复要等;13B 以上就偏慢了 [2]。
2. 核显本和真·无显卡(如服务器 CPU)有区别吗?
普通 Intel 核显对推理帮助很小,基本等同于纯 CPU;苹果 M 系列和新款 AMD 强核显例外,前者靠统一内存 + Metal 加速明显,后者可部分卸载 [2][14][15]。
3. 8GB 内存的笔记本能跑多大模型?
建议 1.5B~3B(文件约 1~2GB)。7B 模型文件 4.7GB,加系统容易吃满内存导致卡顿,16GB 内存跑 7B 才比较从容 [2][7]。
4. 量化会不会让模型变笨?
Q4 量化会损失极少量精度,但对日常对话、写作、翻译几乎感知不到,却能把体积压到约 1/4,是低配机的标准做法;追求质量再考虑 Q5、Q8 [2]。
5. 本地跑的模型和 ChatGPT、DeepSeek 网页版比差多少?
1.5B~7B 小模型在通用问答上够用,但复杂推理、专业知识、长文能力明显弱于云端旗舰大模型。建议本地处理日常和隐私,重活用云端 API [16]。
6. 本地跑大模型要钱吗?模型在哪下安全?
Ollama、LM Studio 等工具都免费开源,模型用官方开源权重、从 Ollama 官方库或 Hugging Face 官方仓库下载即可,不收费、可商用(按各模型许可),也不用任何特殊网络工具 [3][7][8]。
参考资料
- Ollama 官方 FAQ(ollama ps 查看 CPU/GPU、上下文设置等)
- CPU-Only LLMs — Run AI Without a GPU(内存/速度量级整理)
- Ollama Setup Guide: Run AI Models Locally on Your Hardware
- LM Studio 官方系统要求文档
- AnythingLLM 内置 Microsoft Foundry Local 官方公告
- Ollama 官方 GPU 支持文档(NVIDIA/AMD/Metal)
- Ollama 模型库:qwen2.5
- Ollama 模型库:deepseek-r1
- Ollama 官方下载页(Windows/macOS/Linux 安装)
- Ollama 模型库:qwen3
- Ollama 模型库:phi4-mini
- Ollama 模型库:llama3.2
- Awesome AI Projects for CPU(CPU 可跑的开源 AI 项目汇总)
- Intel GPU LLM Inference Toolkit(Intel 核显 CPU/GPU 实测对比)
- 核显笔记本(Radeon 780M)本地跑 20B 模型实测(Habr)
- DeepSeek API 官方定价页
- Run LLMs on Old Phones: Mobile AI Inference 实测指南
📦 省心资料包 + 一对一服务
- 《本地部署AI完全指南》(19.9元):从硬件判断、显卡内存对照,到 Ollama / Open WebUI / 知识库 / 外网访问,手把手图文保姆级教程,照着做不踩坑。→ https://pay.66buff.com/buy/2
- 《AI提效指令库:540个高频提示词模板(2026升级版)》(19.9元):本地模型也能套用的高频提示词,办公、写作、编程直接复制用。→ https://pay.66buff.com/buy/3
不想自己折腾环境,或有 建站 / 小程序 / 支付对接 / 企业私有 AI / RAG 知识库 / 远程代部署 等定制需求,加客服微信「大山资源」一对一咨询(技术工程师本人接单):
