把AI装进你的电脑 · 数据不出本机 · 完全掌控
数据不离开你的电脑,敏感代码、商业文档、个人信息完全私密
开源模型+本地运行,无订阅费、无API费、无使用限制
不依赖网络,飞机上、山区、保密环境都能用
无网络传输延迟,本地GPU推理速度极快,隐私对话秒回
| 配置等级 | GPU | 内存 | 可运行模型 | 体验 | 预算参考 |
|---|---|---|---|---|---|
| 🟢 入门级 | 无GPU / 核显 | 8GB | Qwen2.5-1.5B、Phi-3-mini | 可用,速度较慢 | 现有电脑即可 |
| 🟢 基础级 | GTX 1660 6GB | 16GB | Qwen2.5-7B、Llama3-8B | 流畅,日常够用 | ~¥3000 |
| 🟡 进阶级 | RTX 3060 12GB | 32GB | Qwen2.5-14B、DeepSeek-7B | 很流畅 | ~¥5000 |
| 🟡 主力级 | RTX 4070 Ti 12GB | 32GB | Qwen2.5-32B (Q4量化) | 优秀 | ~¥8000 |
| 🟠 高级 | RTX 4080 16GB | 64GB | Llama3-70B (Q4量化) | 非常好 | ~¥12000 |
| 🔴 旗舰级 | RTX 4090 24GB | 64GB | DeepSeek-33B、Qwen-72B (Q4) | 极佳 | ~¥20000 |
| 🔴 发烧级 | 双RTX 4090 48GB | 128GB | Llama3-70B (FP16)、DeepSeek-67B | 顶级 | ~¥40000 |
| ⚫ 专业级 | A100 80GB / H100 | 256GB+ | 任意开源模型满血运行 | 满血 | ¥10万+ |
Ollama 是目前最简单的本地AI部署工具,三步搞定。
macOS / Linux:
curl -fsSL https://ollama.com/install.sh | sh
Windows:前往 ollama.com 下载安装包,双击安装即可。
验证安装:
ollama --version
一条命令下载并运行模型(首次会自动下载):
# 推荐新手:Qwen2.5 7B(中文优秀,4.4GB)
ollama run qwen2.5:7b
# 或者 Llama3.1 8B(英文强,4.7GB)
ollama run llama3.1:8b
# 或者 DeepSeek 7B(推理强,4.0GB)
ollama run deepseek-r1:7b
下载完成后会自动进入对话模式,直接打字聊天即可!
# 查看已下载的模型
ollama list
# 运行指定模型
ollama run qwen2.5:7b
# 删除模型
ollama rm llama3.1:8b
# 查看模型信息
ollama show qwen2.5:7b
# 启动 API 服务(给其他工具调用)
ollama serve
适合:高级用户、极致性能优化
特点:C++实现,支持CPU推理,GGUF量化格式,内存占用最低
# 克隆并编译
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && make
# 运行模型
./llama-cli -m models/qwen2.5-7b-q4_k_m.gguf -p "你好" -n 256
优势:纯CPU也能跑,树莓派等低配设备可用
适合:需要API服务、多人使用
特点:高性能推理引擎,支持PagedAttention,吞吐量极高
# 安装
pip install vllm
# 启动API服务(兼容OpenAI格式)
python -m vllm.entrypoints.openai.api_server \
--model Qwen/Qwen2.5-7B-Instruct \
--port 8000
优势:多人并发访问,适合团队部署
适合:Apple Silicon Mac用户
特点:Apple官方优化,充分利用M系列芯片的统一内存
# 安装
pip install mlx mlx-lm
# 运行模型
python -m mlx_lm.generate \
--model mlx-community/Qwen2.5-7B-Instruct-4bit \
--prompt "你好,请介绍一下自己"
优势:MacBook M1/M2/M3 跑7B模型非常流畅,32GB内存可跑14B
| 模型 | 参数量 | 大小(Q4) | 擅长 | 推荐场景 |
|---|---|---|---|---|
| Qwen2.5-7B | 7B | 4.4GB | 中文理解、通用对话 | 日常中文问答首选 |
| DeepSeek-R1-7B | 7B | 4.0GB | 推理、数学、逻辑 | 推理任务、学习辅助 |
| Llama3.1-8B | 8B | 4.7GB | 英文、代码、通用 | 英文场景、编程 |
| Qwen2.5-14B | 14B | 8.9GB | 综合能力强 | 12GB+显存推荐 |
| Qwen2.5-Coder-7B | 7B | 4.4GB | 代码生成、理解 | 编程专用 |
| Yi-1.5-9B | 9B | 5.5GB | 中文、长文本 | 中文长文处理 |
| Llama3.1-70B | 70B | 40GB | 全面强大 | 高端用户、24GB+显存 |
export OLLAMA_HOST=https://ollama.com 或使用代理ollama run qwen2.5:7b-q4_K_MOLLAMA_NUM_GPU_LAYERS=20 ollama run qwen2.5:7b推荐 Open WebUI(最流行的开源方案):
# Docker一键安装
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
然后访问 http://localhost:3000 即可。支持多模型切换、对话历史、文件上传等。
| 维度 | 本地部署 | 云端API |
|---|---|---|
| 隐私 | ⭐⭐⭐⭐⭐ 数据不出本机 | ⭐⭐⭐ 数据经过第三方 |
| 成本 | ⭐⭐⭐⭐⭐ 一次性硬件投入 | ⭐⭐⭐ 持续订阅/API费用 |
| 模型能力 | ⭐⭐⭐ 受限于硬件 | ⭐⭐⭐⭐⭐ 可用最强模型 |
| 速度 | ⭐⭐⭐⭐ 取决于GPU | ⭐⭐⭐⭐ 取决于网络 |
| 便利性 | ⭐⭐⭐ 需要配置 | ⭐⭐⭐⭐⭐ 开箱即用 |
| 离线使用 | ⭐⭐⭐⭐⭐ 完全支持 | ❌ 不支持 |
最推荐的本地方案,提供类似ChatGPT的网页界面:
# 1. 确保Ollama已运行
ollama serve
# 2. 启动Open WebUI
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
# 3. 访问 http://localhost:3000
功能:多模型切换、对话历史、文件上传、RAG知识库、多用户
在VS Code中使用本地AI编程助手:
优势:免费版Cursor替代品,代码不出本机
让AI基于你的私有文档回答问题:
# 方案一:Open WebUI自带RAG功能
# 上传PDF/TXT/MD文件即可
# 方案二:AnythingLLM(专业RAG工具)
docker pull mintplexlabs/anythingllm
docker run -d -p 3001:3001 \
--cap-add SYS_ADMIN \
-v anythingllm:/app/server/storage \
mintplexlabs/anythingllm
用途:企业知识库、个人笔记检索、法律/医疗文档问答
OLLAMA_NUM_GPU_LAYERS=999 让所有层都在GPU上运行,速度最快。如果显存不够,逐步减少这个数字。OLLAMA_NUM_PARALLEL=4 设置并行数。OLLAMA_KEEP_ALIVE=24h 让模型常驻内存,避免每次对话都要重新加载。将合同、财务报表等敏感文件通过本地RAG系统进行分析和问答,数据完全不出本机。特别适合律师、财务、医疗等对数据隐私要求极高的行业。
配合VS Code + Continue插件,获得免费的Copilot替代方案。代码永远留在本地,适合处理公司核心代码、个人项目和安全敏感的代码库。
用本地模型进行初稿生成、灵感碰撞。隐私日记、个人博客草稿、未发表的小说等不想上传到云端的内容,都可以安全地在本地处理。
断网环境下(如飞机上、图书馆、偏远地区)依然可以使用AI辅助学习、解释概念、练习对话。学生党零成本获得AI助手。
安全研究人员可以用本地模型进行红队测试、漏洞分析、恶意代码检测等敏感操作,避免在云端留下痕迹。
医疗病历分析、法律文书审查等涉及高度敏感数据的场景,本地部署是唯一合规的选择。患者数据和客户信息绝不能泄露。
本地部署虽好,但也有明显的局限性,需要了解:
结论:本地部署适合特定场景(隐私敏感、离线需求),但不建议作为唯一的AI使用方式。最佳策略是云端+本地互补。
| 术语 | 含义 |
|---|---|
| 量化 (Quantization) | 将模型参数从高精度(FP16/BF16)压缩为低精度(INT8/INT4),减小模型体积和显存占用,轻微损失质量 |
| GGUF | llama.cpp使用的模型格式,支持CPU和GPU混合推理,本地部署最流行的格式 |
| Q4_K_M | 一种4-bit量化方案,K表示使用K-Quant方法,M表示中等大小。质量/体积比最优 |
| 上下文长度 (Context Length) | 模型一次能处理的最大token数,越长能理解越多内容,但占用更多显存 |
| 推理 (Inference) | 模型根据输入生成输出的过程,本地部署主要优化的就是推理速度 |
| LoRA | 低秩适配,一种微调技术,可以在基础模型上添加特定能力而不需要全量训练 |
| GGML | GGUF的前身格式,已逐渐被GGUF取代 |
| vLLM | 高性能推理引擎,使用PagedAttention技术提升吞吐量,适合API服务场景 |
| MLX | Apple开发的机器学习框架,专门针对Apple Silicon优化 |
| Token | 模型处理文本的最小单位,中文1字约2-3 token,英文1词约1-2 token |
| 阶段 | 目标 | 预计时间 | 关键动作 |
|---|---|---|---|
| 🟢 入门 | 跑通第一个本地模型 | 1小时 | 安装Ollama,运行Qwen2.5-7B |
| 🟡 基础 | 配置Web界面和常用模型 | 半天 | 部署Open WebUI,下载3-5个模型 |
| 🟠 进阶 | 搭建本地知识库 | 1-2天 | 配置RAG,上传私有文档 |
| 🔴 高级 | 集成到开发工作流 | 3-5天 | 配置VS Code插件、API调用 |
| ⚫ 专家 | 自定义模型微调 | 1-2周 | 学习LoRA微调,训练专属模型 |