返回教程列表
本地部署Ollama低配电脑CPU跑大模型

没有显卡能跑大模型吗?核显/CPU本地部署AI完整教程(2026)

发布于 2026-09-11阅读约 16 分钟

一、先给结论:能,纯 CPU / 核显也能本地跑大模型

很多人问「没有显卡能跑大模型吗」,答案很直接:能跑。现在主流的本地大模型工具(Ollama、LM Studio 等)在没有独立显卡的情况下会自动用 CPU 推理,这是官方支持的标准模式,不需要任何破解或特殊设置 [1]。

但「能跑」不等于「跑得爽」。核显本、轻薄本、老台式机本地跑大模型,需要先摆正三个预期:

认知说明
模型要选小的1.5B~7B 参数的小模型才现实,70B 这类大模型在 CPU 上只有每秒 1~3 个 token,基本不可用 [2]
一定要用量化版Q4(4-bit)量化把模型体积压缩到原来的约 1/4,7B 模型从 14GB 降到 4.7GB 左右,是低配机的标配 [2][8]
速度要接受现代 CPU 跑 3B 模型大约每秒 10~20 个 token,跑 7B 约 5~12 个 token,相当于「看着字一个个打出来」[2]

换句话说,无显卡本地 AI 适合的是:日常问答、写作润色、翻译摘要、简单编程辅助、离线隐私场景;不适合的是:超长文档秒回、复杂多步推理、多开并发、追求云端大模型那种即时响应。

这篇教程会讲清硬件门槛、手把手带你用 Ollama 纯 CPU 跑起来、给出 2026 年仍好用的小模型清单,以及跑不动时的替代路线。

二、先看硬件:没有独显,什么才是瓶颈?

核显跑大模型、CPU 跑大模型时,模型全部加载在系统内存(RAM)里,由 CPU 计算。所以瓶颈不是显卡,而是内存。

1. 内存(RAM)是首要硬门槛

一个经验公式:Q4 量化下,大约每 10 亿参数占用 0.6GB 左右内存 [2]。

模型参数Q4 模型文件大小建议可用内存CPU 速度量级(现代多核 CPU)体验
0.5B~1.5B0.4~1.1GB4~8GB20~40 token/秒很快,适合超轻任务
3B~4B1.9~2.5GB8GB 起步10~20 token/秒日常聊天的甜点区间 [2]
7B~8B4.7~5.2GB16GB 起步5~12 token/秒质量好,长回复要等 [2]
13B~14B8~9GB16~24GB3~6 token/秒明显偏慢 [3]
32B 以上19GB+32GB+1~3 token/秒不建议纯 CPU [3]

实用建议:

  • 8GB 内存:只建议跑 1.5B~3B 模型,跑 7B 会大量占用内存、容易卡顿或把系统挤爆;
  • 16GB 内存:跑 7B Q4 比较舒服(模型 4.7GB 左右,加上系统和上下文,占用约 6~8GB),这是低配电脑本地部署 AI 的推荐起步配置;
  • 注意内存要给系统留余量。Windows / macOS 本身要占 3~5GB,所以「模型大小 + 5GB」才是你实际需要的内存。

顺便解释一个高频问题:为什么没有显卡也能跑? 早期大模型推理基本依赖 NVIDIA 的 CUDA 生态,而开源项目 llama.cpp 用 C/C++ 重写了推理过程,针对 CPU 做了大量优化(支持 AVX2、ARM NEON 等指令集),并推广了 GGUF 这种专门适配 CPU 的模型文件格式——Ollama、LM Studio 底层用的都是它。配合「量化」技术(把模型权重从 16 位浮点压缩成 4 位整数,体积约为原来的四分之一,精度损失很小),小模型才能在普通电脑的内存里跑起来。

关于量化等级,常见有 Q4_K_M、Q5_K_M、Q8 等:数字越小越省内存、速度越快,数字越大质量越好。低配机直接用 Ollama 默认的 Q4_K_M 即可,它是体积、速度、质量的平衡点;内存充裕、想追求一点质量再考虑 Q5。

2. 硬盘空间

7B Q4 模型约 4.7GB,13B 约 9GB,32B 约 20GB [3][8]。建议:

  • 模型放在 SSD 固态硬盘上,机械硬盘加载模型会慢很多;
  • C 盘空间紧张的话,Windows 下可以设置环境变量 OLLAMA_MODELS,把模型目录改到其他盘,改完重启电脑生效 [9]。

3. CPU 核数与指令集

  • 核数越多越快,4 核起步、8 核体验明显更好;
  • 特别老的 CPU 要注意:LM Studio 在 Windows 上要求 CPU 支持 AVX2 指令集(2013 年后的主流处理器基本都支持)[4];Ollama 对老 CPU 兼容性更好。

4. Mac 用户单独说明

苹果 M1/M2/M3/M4 系列 Mac 虽然也是「核显」,但它用的是统一内存(Unified Memory):CPU、GPU 共用同一块高速内存,并通过 Metal 框架做硬件加速 [1][2]。因此同样无独显,Mac 的表现远超普通 Windows 核显本:

  • M2 / M3 跑 7B~8B 模型可以达到每秒 30~45 个 token,相当于中端独立显卡的水平 [2];
  • 8GB 统一内存的 MacBook 能跑 3B 左右,16GB 可以流畅跑 7B~8B [2]。

所以 Mac 用户可以直接把自己当「有加速」对待,下面的 CPU 教程同样适用,速度参考上浮即可。

三、方案一:Ollama 纯 CPU 安装与跑模型(推荐新手)

Ollama 是目前最流行的本地大模型运行框架,GitHub 星数早已超过 10 万,一行命令就能下载、运行模型,Windows / macOS / Linux 都支持,没有独显时自动用 CPU 推理 [1][3]。

1. 安装

Windows(Win10/11)

  1. 访问官网下载页 https://ollama.com/download,下载 OllamaSetup.exe
  2. 双击安装,一路点「Install / 安装」,装完右下角任务栏会出现羊驼图标,说明服务已在后台运行 [9];
  3. Win + R 输入 cmd 打开命令提示符,输入下面的命令验证:
ollama --version

显示版本号即安装成功。

macOS

  1. https://ollama.com/download 下载 macOS 版,拖进「应用程序」即可;
  2. 或用命令行安装(Linux 通用):
curl -fsSL https://ollama.com/install.sh | sh

安装后在「终端 / Terminal」输入 ollama --version 验证。

2. 下载并运行第一个模型

以轻量、中文能力强的 qwen2.5:1.5b 为例,在命令行输入:

ollama run qwen2.5:1.5b

首次运行会自动下载模型(约 986MB),下载完成后出现 >>> 提示符,就可以直接打字对话了。输入 /bye 退出,模型闲置一段时间后会自动释放内存 [9]。

常用命令一览:

命令作用
ollama run 模型名下载(若没有)并启动模型进入对话
ollama pull 模型名只下载不运行
ollama list查看已下载的模型
ollama ps查看当前正在运行的模型及所在设备
ollama stop 模型名停止模型、释放内存

3. 确认自己是不是在纯 CPU 跑

运行模型后,在另一个命令行窗口输入:

ollama ps

输出里的 PROCESSOR 列会显示运行位置 [1]:

  • 100% CPU:全部在系统内存 / CPU 上跑(无显卡本就是这个状态);
  • 100% GPU:全部在显卡上;
  • xx%/xx% CPU/GPU:部分卸载到显卡(核显部分加速时会出现)。

如果想强制只用 CPU(比如核显卸载反而报错时),NVIDIA 机型可以通过把 CUDA_VISIBLE_DEVICES 设为无效值实现,AMD 机型对应设置 ROCR_VISIBLE_DEVICES,具体见官方 GPU 文档 [6]。

4. 几个实用设置

  • 改上下文长度:Ollama 默认上下文是 4096 token。纯 CPU 不建议开太大,长上下文会明显增加内存占用和等待时间。可在对话中用 /set parameter num_ctx 4096 调整,或设置环境变量 OLLAMA_CONTEXT_LENGTH [1]。
  • 改模型存储位置:Windows 设置系统环境变量 OLLAMA_MODELS=D:\ollama\models(改成你空间大的盘),重启电脑生效 [9]。
  • 断网可用:模型下载完成后,运行完全离线,不联网也能用,隐私数据不出本机 [3]。

四、低配电脑模型清单(2026 年仍好用,附内存与用途)

下面都是官方开源权重、可在 Ollama 一键拉取的小模型。表格中的大小为 Ollama 官方库的 Q4 默认量化文件大小,内存占用按「模型 + 系统 + 上下文」估算 [7][8][10][11][12]。

模型(拉取命令)参数文件大小建议内存适合用途
qwen2.5:0.5b0.5B398MB4GB超轻任务、分类、关键词提取、老机器试水 [7]
qwen3:0.6b0.6B523MB4GB新一代超小模型,带思考模式开关,简单问答 [10]
llama3.2:1b1B1.3GB4~6GB英文轻任务、改写、检索,2GB 内存极限可用 [12]
qwen2.5:1.5b1.5B986MB6GB中文日常对话、摘要、翻译,低配首选 [7]
deepseek-r1:1.5b1.5B1.1GB6GB会「输出思考过程」的小推理模型,数学/逻辑入门 [8]
qwen3:1.7b1.7B1.4GB6~8GB中文、轻推理,小模型里速度/质量平衡好 [10]
qwen2.5:3b1.9GB1.9GB8GB中文+编程小能手,支持 JSON/函数调用 [7]
llama3.2:3b3B2.0GB8GB指令遵循好、128K 长上下文,通用稳妥选择 [12]
phi4-mini3.8B2.5GB8~10GB微软小钢炮,数学、逻辑、代码推理强 [11]
qwen3:4b4B2.5GB8~10GB新一代通用模型,256K 上下文,日常聊天推荐 [10]
qwen2.5:7b7B4.7GB16GB中文综合能力强、长文本,16GB 内存主力 [7]
deepseek-r1:7b7B4.7GB16GB分步推理、解题、分析,回答会先给思考链 [8]
deepseek-r1:8b(默认)8B5.2GB16GBR1 蒸馏增强版,推理质量更好一点,稍慢 [8]

选型建议(对号入座):

  • 8GB 内存 / 老笔记本:从 qwen2.5:1.5bqwen3:1.7b 起步,想质量高一点试 qwen2.5:3b
  • 16GB 内存 / 核显本:直接上 qwen2.5:7bqwen3:4b,要推理选 deepseek-r1:7b
  • 主要用中文:优先 Qwen(通义千问)系列,中文语料和表达更自然;
  • 要数学/代码/逻辑:选 phi4-mini(3.8B)或 deepseek-r1 蒸馏版 [8][11];
  • 这些模型权重均为官方开源(Qwen 多为 Apache 2.0,DeepSeek-R1 蒸馏版为 MIT,Llama 3.2 为 Llama 许可),个人使用没有版权问题 [7][8][12]。

提示:Ollama 模型库更新很快,拉取前可以到 https://ollama.com/search 搜索模型名,查看最新标签和大小。

小模型怎么问才好用?

小模型能力有限,提问方式对效果影响很大,记住四个技巧:

  1. 指令写具体:把「帮我写个东西」改成「用中文写一段 200 字的产品介绍,语气亲切,面向大学生用户」,小模型更不容易跑偏;
  2. 一次只让它做一件事:别在一个问题里又要总结又要翻译又要列提纲,拆成多轮对话质量更高;
  3. 给它角色和例子:开头加「你是一名专业文案」或直接给一个输出示例,小模型照葫芦画瓢的效果明显更好;
  4. 开长上下文要克制:虽然很多模型标称 128K 上下文,但纯 CPU 下上下文越长越慢、越占内存,日常对话保持 4K~8K 足够,真要读长文档再临时调大 [1][10]。

另外,deepseek-r1 这类「思考模型」回答时会先输出一段推理过程,答案更严谨,但也会更慢、更费 token。低配机日常聊天可以用普通对话模型(qwen2.5 / qwen3),遇到数学、逻辑题再切 r1 系列。

五、不喜欢命令行?纯 CPU 可用的图形界面工具

如果你觉得黑窗口不友好,下面这些图形界面工具都能在无独显环境使用:

工具特点纯 CPU / 核显支持
LM Studio界面美观,内置模型搜索下载,一键加载 GGUF 模型,带本地服务器(OpenAI 兼容接口)无独显自动用 CPU;Windows 需 CPU 支持 AVX2,建议 16GB 内存;注意不支持 Intel 芯片的老款 Mac [4]
AnythingLLM主打「本地知识库 / RAG」,可把 PDF、Word 拖进去让模型基于文档回答;桌面版可选 Ollama 作后端无显卡可用 CPU;2026 年新版还内置微软 Foundry Local,能自动调用 CPU/GPU/NPU(需 Win11 24H2+)[5]
GPT4All安装简单,自带多款 CPU 优化模型,适合纯入门体验原生为 CPU 设计,对老机器友好 [13]
Chatbox / Open WebUI聊天界面类,配合已装好的 Ollama 使用,体验接近 ChatGPT本身不跑模型,调用 Ollama,CPU/GPU 取决于 Ollama

新手推荐组合:Ollama(后台跑模型)+ Chatbox 或 LM Studio(前台聊天),既不用记命令,又能稳定跑小模型。想做「本地文档问答」再上 AnythingLLM。

补充一个低配机做知识库的小经验:AnythingLLM 做文档问答时,除了对话模型还会用到一个「向量嵌入模型」,别让它默认下载大模型,选 Ollama 官方的 nomic-embed-text 即可,文件只有约 274MB、占用内存很小,专门负责把文档转成向量,再搭配一个 3B 左右的对话模型,8~16GB 内存也能跑起本地 RAG 知识库。

六、核显加速到底有没有用?(Intel / AMD 现状)

很多人期待核显能帮上忙,这里说结论,不夸大:

核显类型加速现状建议
Intel UHD / 老款核显(8~10 代)算力弱。实测在这类核显上用 Vulkan 卸载,速度甚至不如纯 CPU,还可能出现显存不足、加载报错 [14]别折腾,直接纯 CPU
Intel Iris Xe(11 代起)/ Arc 核显理论支持 Vulkan、OpenVINO 加速,但社区实测对 4~8B 模型,CPU 与核显速度基本持平,核显加载更慢 [14]提升有限,纯 CPU 即可;想折腾可用 IPEX-LLM / OpenVINO
AMD Radeon 780M / 890M 等(锐龙 7000/8000/AI 系列)RDNA3 核显 + 高频内存有一定算力。实测配合 LM Studio 部分卸载,跑 20B 模型也能到约 9 token/秒 [15]可以在 LM Studio 里试着把 GPU Offload 开一部分,跑分看有没有变快
NPU(酷睿 Ultra / 锐龙 AI 的 AI PC)专用 AI 引擎,但 Ollama 默认不调用;需 Foundry Local、AMD Lemonade、IPEX-LLM 等框架 [5][13]新手可先不管,用 AnythingLLM 新版自动调度 [5]

一句话:普通 Intel 核显别指望加速,老老实实用 CPU 反而更稳;较新的 AMD 强力核显可以试试部分卸载,内存大小依然是天花板。 核显和 CPU 共用内存,所以无论怎么卸载,内存不够照样跑不动。

七、小模型不够用?本地 + 云端混合方案

低配机跑 7B 已经是体验上限,遇到复杂推理、长文档、写大型代码时,小模型会「力不从心」。这时候没必要硬扛,本地小模型 + 云端 API 混合用是最划算的路线:隐私、日常问答走本地;重活交给便宜的云端大模型。

主流低成本云端选择(2026 年价格,以官方页为准):

  • DeepSeek API(deepseek-flash):官方定价,输入(缓存未命中)空闲时段约 1 元 / 百万 token、高峰约 2 元;输出空闲约 4 元、高峰约 8 元 / 百万 token,新用户还有体验额度 [16]。日常轻度使用,几块钱能用很久。
  • 国内其他平台:阿里云百炼、腾讯云、智谱、硅基流动等都有开源小模型的免费额度或极低价 API,很多 Qwen 系列小模型接口可免费调用,适合入门试水。

混合用法建议:

场景走哪里
敏感资料、个人隐私、离线环境本地 Ollama 小模型
日常问答、翻译、摘要、改写本地(免费、无限次)
复杂推理、长文分析、正式文案云端 DeepSeek 等 API(便宜、质量高)

Chatbox、AnythingLLM、Open WebUI 这类工具都能同时配置「本地 Ollama」和「云端 API」两个来源,随用随切。

八、手机能不能本地跑大模型?

能,但体验有限,简要说明:

  • 手机端没有官方的 Ollama / LM Studio,要用专门的 App,比如 PocketPal AI(iOS / 安卓,图形界面,内置 llama.cpp,可离线跑 GGUF 小模型)、MLC Chat / MLC LLM(调用手机 GPU),或安卓上用 Termux + llama.cpp [13][17];
  • 实际表现:2021 年后、6GB 内存以上的手机跑 1B~3B 量化模型,大约每秒 3~6 个 token;新款旗舰(骁龙 8 Gen3、A17 Pro 级别)跑 1B 模型可达每秒 15~30 个 token [17];
  • 适合:离线翻译、随手问答、尝鲜;不适合替代日常 AI 工作流,发热和耗电也明显。

对多数人,手机上更省心的选择是直接用各家的云端 AI App(联网使用,效果好、不折腾),本地跑留给「离线 + 隐私 + 好奇尝鲜」。

九、常见卡顿与报错排查

现象可能原因解决办法
模型加载失败 / 闪退 / 卡住内存不足换更小模型(7B→3B→1.5B);关掉浏览器等占内存程序;加虚拟内存 [2]
输出特别慢(< 3 token/秒)在跑大模型或核显抢占降到 3B 以下;笔记本插电源、开高性能模式;确认 ollama ps 没误卸载到核显 [1]
核显上报 out of memory / Vulkan 错误核显共享内存、驱动问题强制纯 CPU 运行;更新或回退显卡驱动;别开 GPU 卸载 [14]
模型下载慢 / 中断网络问题重试 ollama pull 支持断点续传;换网络环境;模型体积大请耐心
提示 'ollama' 不是内部命令安装未生效 / 未重启重新打开命令行窗口;确认安装成功;重启电脑 [9]
回复答非所问、胡说模型太小或上下文超限换 7B 级模型;缩短输入;把上下文 num_ctx 设回 4096 左右 [1]
硬盘被占满模型默认存 C 盘设置 OLLAMA_MODELS 改到其他盘 [9]

十、常见问题 FAQ

1. 没有独立显卡,纯靠 CPU 真能流畅用吗?

能「用」,但「流畅」取决于模型大小。3B 以内在现代多核 CPU 上每秒 10~20 个 token,日常聊天可以接受;7B 约每秒 5~12 个 token,长回复要等;13B 以上就偏慢了 [2]。

2. 核显本和真·无显卡(如服务器 CPU)有区别吗?

普通 Intel 核显对推理帮助很小,基本等同于纯 CPU;苹果 M 系列和新款 AMD 强核显例外,前者靠统一内存 + Metal 加速明显,后者可部分卸载 [2][14][15]。

3. 8GB 内存的笔记本能跑多大模型?

建议 1.5B~3B(文件约 1~2GB)。7B 模型文件 4.7GB,加系统容易吃满内存导致卡顿,16GB 内存跑 7B 才比较从容 [2][7]。

4. 量化会不会让模型变笨?

Q4 量化会损失极少量精度,但对日常对话、写作、翻译几乎感知不到,却能把体积压到约 1/4,是低配机的标准做法;追求质量再考虑 Q5、Q8 [2]。

5. 本地跑的模型和 ChatGPT、DeepSeek 网页版比差多少?

1.5B~7B 小模型在通用问答上够用,但复杂推理、专业知识、长文能力明显弱于云端旗舰大模型。建议本地处理日常和隐私,重活用云端 API [16]。

6. 本地跑大模型要钱吗?模型在哪下安全?

Ollama、LM Studio 等工具都免费开源,模型用官方开源权重、从 Ollama 官方库或 Hugging Face 官方仓库下载即可,不收费、可商用(按各模型许可),也不用任何特殊网络工具 [3][7][8]。


参考资料

  1. Ollama 官方 FAQ(ollama ps 查看 CPU/GPU、上下文设置等)
  2. CPU-Only LLMs — Run AI Without a GPU(内存/速度量级整理)
  3. Ollama Setup Guide: Run AI Models Locally on Your Hardware
  4. LM Studio 官方系统要求文档
  5. AnythingLLM 内置 Microsoft Foundry Local 官方公告
  6. Ollama 官方 GPU 支持文档(NVIDIA/AMD/Metal)
  7. Ollama 模型库:qwen2.5
  8. Ollama 模型库:deepseek-r1
  9. Ollama 官方下载页(Windows/macOS/Linux 安装)
  10. Ollama 模型库:qwen3
  11. Ollama 模型库:phi4-mini
  12. Ollama 模型库:llama3.2
  13. Awesome AI Projects for CPU(CPU 可跑的开源 AI 项目汇总)
  14. Intel GPU LLM Inference Toolkit(Intel 核显 CPU/GPU 实测对比)
  15. 核显笔记本(Radeon 780M)本地跑 20B 模型实测(Habr)
  16. DeepSeek API 官方定价页
  17. Run LLMs on Old Phones: Mobile AI Inference 实测指南

📦 省心资料包 + 一对一服务

  • 《本地部署AI完全指南》(19.9元):从硬件判断、显卡内存对照,到 Ollama / Open WebUI / 知识库 / 外网访问,手把手图文保姆级教程,照着做不踩坑。→ https://pay.66buff.com/buy/2
  • 《AI提效指令库:540个高频提示词模板(2026升级版)》(19.9元):本地模型也能套用的高频提示词,办公、写作、编程直接复制用。→ https://pay.66buff.com/buy/3

不想自己折腾环境,或有 建站 / 小程序 / 支付对接 / 企业私有 AI / RAG 知识库 / 远程代部署 等定制需求,加客服微信「大山资源」一对一咨询(技术工程师本人接单):

👉 https://u.wechat.com/MGQJue4lhHah8QzEJfkEwwE?s=2

客服二维码:https://pay.66buff.com/kefu.jpg

想要更系统、更全的整理?

配套付费资料,把本页讲不透的细节一次补全

微信客服二维码 - 大山资源

购买或使用有疑问?需要远程代部署、建站、支付对接、企业私有 AI/RAG 定制?加工程师微信,本人接单

微信:大山资源点击添加工程师微信